全部动态
OpenAI新出的网络安全大模型GPT-5.5-Cyber挺猛,CyberGym跑分超了Claude Mythos 5,安全团队可以关注一下。
Qwen2.5-0.5B调优后,在关系抽取任务上干掉了GPT-5.4和Claude Sonnet,而且模型很小,单卡就能跑,适合隐私敏感场景。
字节新出的豆包Seed 2.1 Pro和Turbo,专门优化编程、智能体和多模态任务,Pro适合高难度场景,Turbo便宜且效率高,很适合接项目用。
OpenAI 的 Daybreak 现在不仅能找漏洞,还能自动打补丁了,连 Linux 内核和 FreeBSD 都支持,安全团队可以试试 GPT-5.5-Cyber。
OpenAI 搞了个 Daybreak 扩展,直接在 Codex 里修漏洞,还有专门的安全模型 GPT-5.5-Cyber,想帮安全团队快速打补丁。
OpenAI出了Daybreak工具,用Codex Security自动找漏洞,GPT-5.5-Cyber帮你验证修复,搞安全的可以看看。
百川发了医疗增强大模型 M4,在 HealthBench 碾压 GPT-5.5,幻觉率仅 3.3%,看病问诊更靠谱。
Cloudflare 这招挺实用:免注册部署 Workers,60 分钟内自动回收,很适合临时测试或 AI agent 调工具。
OpenAI 要发 GPT-5.6 了,上下文拉到 150 万 tokens,编码能力还干翻了 Anthropic 的 Mythos,价格还更便宜,开发者可以关注一下。
马斯克说国产大模型要等到2027年才能追上Anthropic的Fable,但智谱的唐杰直接回怼用不了那么久。GLM-5.2刚在编程测试上赢了GPT-5.5,差距正在缩小。
Claude Fable 5 在 ECI 上拿 161 分,超 GPT-5.5 Pro 一分,Anthropic 终于又领先了。
OpenAI 把 GPT-5.5 Instant 的医疗问答能力做到了和自家顶级推理模型一样好,而且免费用户都能用,生病问AI更放心了。
想少想多做?K2.7 Code 编码专用,推理开销比 K2.6 低三成,还能对标 GPT-5.5,适合写代码时不用纠结。
Apodex能派150个Agent跑15000步帮你深挖问题,自主校验结果,在Benchmark上超了GPT-5.5和Claude-Opus。
想知道怎么用Kimi K2.7 Code花不到5分钱做出媲美Claude Fable 5的落地页?实验数据全给你算清楚了,迭代省大钱。
想看看AI在药物发现中到底行不行?这个基准测试用4800条轨迹告诉你,Claude Opus 4.8和GPT-5.5都还差得远,最高才59.3%的通过率。
OpenAI搞了个新基准LifeSciBench,专门测生物科学推理,GPT-Rosalind比GPT-5.5还强,值得看看。