全部动态
Grok 4.5 在代码智能体任务上得分和 GPT-5.5 一样高,但 token 消耗只有三分之一,价格还更便宜,做 agent 开发选它很划算。
OpenAI 出了 GPT-Live,能全双工对话还自动叫 GPT-5.5 帮忙算难题,但用户说聊着聊着被挂电话,距离完美还有段路。
OpenAI 这次把语音交互做得更自然了,GPT-Live 系列能边听边说,还能打断和调用工具,比以前的 Advanced Voice Mode 流畅很多。
OpenAI 让 ChatGPT 能同时听和说了,复杂问题自动转给 GPT-5.5 处理,对话更自然。付费用户现在就能体验。
OpenAI 用 GPT-Live 把语音交互做到实时全双工,还能让 GPT-5.5 处理复杂推理,听说是你聊天的好帮手。
腾讯Hy3开源模型295B参数,比GLM-5.2小一半却和GPT-5.5打平,还超过DeepSeek V4 Pro,免费API两周,智能体应用很香。
GPT-5.6 来了,参数 2-4T,带 Ultracode 推理层级,还有 Cerebras 版速度飙到 750 tokens/s。想试试新模型的可以关注了。
马斯克的SpaceXAI联手Cursor搞了个新模型,据说能跟GPT-5.5和Claude Opus 4.8掰手腕,可以看看。
Simon Willison 用 GPT-5.5 写了这个 Web 组件,能自动从 GitHub 链接抓取指定行的代码显示在网页上,带行号,做文档或博客嵌入代码很方便。
Simon 发布了 sqlite-utils 4.0rc3,主要加了复合外键支持,还修了一堆 issue。用上 Claude 和 GPT 帮忙,少踩不少坑。
Claude Fable 5 能把蜘蛛侠荡网变成可玩的 Godot 游戏,而且比 GPT-5.5 少出不少错,做游戏可以试试它。
企业AI费用爆涨(月花1500万美元)开始限制高级模型,花旗、Adobe、Atlassian都有动作。想知道怎么控制AI成本?看看这些公司的做法。
想搞形式化验证代码生成?这篇论文的 AxDafny 用验证器做迭代修复,把 Dafny 编程题的验证成功拉到 92.7%,比之前的最好方法还高 6.5 个百分点。
Anthropic的Sonnet 5来了,Agent能力接近最贵的Opus,价格才40%。以前会卡住的复杂任务现在能跑完,还自己检查输出。默认模型升级值得一试。
普林斯顿搞了个AI当老板的模拟考试,Claude Fable 5赚了4700万,其他大多破产,这测试挺能看出谁更适合做长期决策。
美团搞了个纯国产卡训练的1.6T MoE模型,激活参数48B,1M上下文,编程和Agent场景表现强,在SWE-bench Pro上还超过了GPT-5.5,值得编程开发者试试。
如果你对多语言OCR或印地语文本识别感兴趣,这篇论文揭示了主流模型在天城体上的真实差距,尤其是GPT-5.5表现不如开源Qwen3-VL-8B。
NVIDIA 开源了这个工具,让 AI 代理能直接调用分子模型做药物发现。用上它任务完成率翻倍还省 Token,做生物计算的同学可以试试。