OpenAI 用 GPT-Live 把语音交互做到实时全双工,还能让 GPT-5.5 处理复杂推理,听说是你聊天的好帮手。
全部动态
腾讯Hy3开源模型295B参数,比GLM-5.2小一半却和GPT-5.5打平,还超过DeepSeek V4 Pro,免费API两周,智能体应用很香。
GPT-5.6 来了,参数 2-4T,带 Ultracode 推理层级,还有 Cerebras 版速度飙到 750 tokens/s。想试试新模型的可以关注了。
马斯克的SpaceXAI联手Cursor搞了个新模型,据说能跟GPT-5.5和Claude Opus 4.8掰手腕,可以看看。
Claude Fable 5 能把蜘蛛侠荡网变成可玩的 Godot 游戏,而且比 GPT-5.5 少出不少错,做游戏可以试试它。
Anthropic的Sonnet 5来了,Agent能力接近最贵的Opus,价格才40%。以前会卡住的复杂任务现在能跑完,还自己检查输出。默认模型升级值得一试。
普林斯顿搞了个AI当老板的模拟考试,Claude Fable 5赚了4700万,其他大多破产,这测试挺能看出谁更适合做长期决策。
美团搞了个纯国产卡训练的1.6T MoE模型,激活参数48B,1M上下文,编程和Agent场景表现强,在SWE-bench Pro上还超过了GPT-5.5,值得编程开发者试试。
GPT-5.5-Cyber 在安全基准 CyberGym 上直接碾压了 Mythos 5,想搞红队或漏洞分析的话可以申请权限试试。
OpenAI 出了三个新模型 Sol、Terra、Luna,Terra 和 GPT-5.5 差不多但便宜一半,Luna 超低价。还改了缓存计费规则,省钱又灵活。
Sam Altman发了Sol和Terra,一个和GPT-5.5同价,一个半价性能差不多,但被美国政府卡住只能预览,挺有意思的。
OpenAI 发布了 GPT-5.6 三兄弟,Sol 旗舰带 Ultra 模式,能协调多个 subagent 干活,在命令行任务上直接 91.9%。日常用 Terra 性能持平 5.5 但价格砍半,适合干活党。
Fireworks和Faros拿真实工程任务实测GLM-5.2,结果比Opus 4.8和GPT-5.5都更便宜更快,得分还高。想为代码任务选模型可以看看这个。
Google 把屏幕操控塞进了 Gemini 3.5 Flash,OSWorld 得分和 GPT-5.5 差不多。开发者直接用 API 就能做自动化,很实在。
Unsloth把GLM-5.2压到1-bit,Mac Studio上跑21 tok/s,创意性居然不输Claude Opus,本地部署党有福了。
Mistral OCR 在 ParseBench 上打败了 GPT-5.5,离 Gemini 3.1 Pro 也不远,价格还便宜,做文档解析很值。
OpenAI 发了新的 GPT-5.5 Instant,对话更聪明更自然,Pro 和 Plus 用户现在就能用,免费用户明天也能体验到。
GLM-5.2 在前端任务上干掉了 Claude Opus 系列,对 Kimi 和 Sonnet 胜率超 60%,开源模型里相当能打。
OpenAI 新出的 GPT-5.5-Cyber 专攻网络安全,能自动修补漏洞,基准测试里已经跑赢了 Anthropic 的 Mythos。
OpenAI新出的网络安全大模型GPT-5.5-Cyber挺猛,CyberGym跑分超了Claude Mythos 5,安全团队可以关注一下。
字节新出的豆包Seed 2.1 Pro和Turbo,专门优化编程、智能体和多模态任务,Pro适合高难度场景,Turbo便宜且效率高,很适合接项目用。
百川发了医疗增强大模型 M4,在 HealthBench 碾压 GPT-5.5,幻觉率仅 3.3%,看病问诊更靠谱。