Mira Murati团队和桥水基金一起搞了个AI筛选新闻的实验,先用GPT、Claude只有50%准确率,专家写提示词到75%还是不够,最后微调模型干到了84.7%,成本还低了13倍多。
发新论文了,斯坦福团队搞的QuasiMoTTo,不用独立采样浪费算力,相关采样省25-47%样本,训练步骤也砍半。做推理扩展的可以看看。
斯坦福发了个AutoMem,给智能体装上可训练的记忆模块,让32B模型打平Claude Opus 4.5。省去调任务动作,光改记忆就提升2-4倍,搞长程任务的别错过。
Poe 刚上了两个新模型:Claude Fable 5 回归,Gemini Omni Flash 能对话式编辑视频,很值得试试。
GLM-5.2在SiliconFlow上用OpenCode跑,效果媲美Opus但便宜很多,开发者实测能处理数据表格直接出报告,还能参加排行榜拿奖励。
美团新模型LongCat-2.0真能打,1M上下文还懂agentic coding,SWE-bench 59.5,价格也不贵。
月之暗面把Kimi K2.7开放权重模型塞进GitHub Copilot了,性能不输前沿模型还更便宜,写代码可以试试这个新选项。
想对比 Claude Sonnet 5 和 4.6 的文本能力?这份分析告诉你它在专家级提示上更强,但其他类别反而差了。
Anthropic 的 Claude Sonnet 5 写前端代码得分比上代高 29,还超过 Opus 4.6。搞前端的可以试试它的自主编程能力。
poolside新出的Laguna XS 2.1,33B MoE专为编程智能体设计,SWE-bench 70.9%还支持Mac本地跑,值得编程党试试
NVIDIA新出的Qwen3.6-27B模型,4位量化体积小很多但精度没怎么降,SGLang直接就能用,可以去试试。
GenRecon用手机拍几张照片就能生成高精度3D模型,细节比传统方法多16%,还能直接编辑。
DeepSeek 把 DSpark 开源自带进 vLLM,跑 DeepSeek-V4 实测单卡 250 token/s,比 MTP 快 12-42%,想搞投机解码的可以试试。
Qwen3.6-27B-NVFP4来了!在Blackwell上内存减半,MMLU Pro 86.3分,用vLLM就能跑,开源模型本地AI更省显存。
Genspark 把 Claude Fable 5 请回来了,编程、研究、视觉都好使,任务越难越强,快去试试。
Anthropic用户吐槽新模型链路性能狂降,从全能变废物,还烧额度,老用户都在骂。
有用户发现Fable 5回归后,同样任务被拆给Opus 4.8和Sonnet 5,消耗大量限额但效果反而不如以前,体验缩水了。
这个项目把RL训练的活物做得超逼真,毛发和声音都来自神经网络激活值,技术堆叠很酷,值得看一眼。
Fable 5 和 GPT 5.5 在物理模拟上差距明显,但价格差近三倍,看你在意效果还是成本。
Fable 5写物理动画确实牛,但钱包要厚;GLM 5.2便宜到离谱,预算有限就选它。
如果你厌倦了 XGBoost 调参,TabFM 不用训练直接预测,省时省力,适合表格数据任务。
专门为表格数据设计的架构,用交替行列注意力处理无序,还压缩行向量做上下文学习,比硬套LLM聪明多了。
这个做法用合成数据解决工业场景真实数据稀缺的问题,数亿级数据集全靠模型生成,思路挺新颖。
Anthropic 给 Fable 5 加了更严的安全过滤,编程时容易被误拦,拦了就自动切到 Opus 4.8,用之前得想好怎么绕过。
博主 omarsar0 用同一个 prompt 对比了 GLM-5.2、Fugu Ultra、Fable 5,他最喜欢 Fable 5 的生成结果,你可以看看三个模型的差异。
Notion 把 Claude Fable 5 放进来了,专治复杂多步骤任务,比之前更强的推理和智能体能力。
Cursor 里又能用 Claude Fable 5 了,它在 CursorBench 上排第一,就是有点贵,适合追求极致效果的场景。
GLM 5.2 编码和智能体表现接近闭源,用 Fireworks 跑划算,适合不想花大钱又要高水平的开发者。
Fable 5 的 Agent Mode 刚上线,看看它能不能在智能体任务上继续领先
Anthropic的Fable 5又回Agent Arena了,上次拿过第一,这次看看它还能不能霸榜。还有新模型上了多个测试战场,快去试试。
Fireworks AI 在微软 Foundry 上推出了 GLM 5.2,还支持用 FireConnect 路由到 Codex、OpenCode,搞工作流开发能快不少,试试呗。
Anthropic 在 GitHub Copilot 里放了个能自主写代码的 Claude Fable 5,适合处理长期复杂任务,试试看。
Anthropic把Claude Fable 5加了安全护栏重新上线,但代价是部分功能降级到Opus 4.8。想了解新模型具体被削了哪些能力、行业如何反应,可以看这篇。
想用 Claude 但担心安全?Anthropic 这次加了新防护,编程请求可能暂时降级到 Opus 4.8,你可以在 OpenRouter 上体验。
GitHub 和 Anthropic 让 Claude Fable 5 回归 Copilot,专攻长周期自主编码,写复杂任务更顺手。
NVIDIA把30B模型劈成两半,并行写token,速度翻倍还保质量,不是新训模型是复用预训练,挺聪明的做法。
GLM 搭配 8090 的 Software Factory 在代码迁移任务中成本砍到 1/16,虽然慢了点,但省钱效果很直观。
Devin团队放出了Agentic MapReduce的完整技术文档和评估,想了解智能体如何结构化处理任务可以看看。
Recraft AI 今天直接发布了两款新模型,不用排队就能在 Recraft Studio 里用,快去试试。
Claude Fable 5 的新版本在评测榜上闪了一下就没了,可能是马上要发布了,值得蹲一下。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。