全部动态
NVIDIA 开源了 NOOA 智能体框架,在软件工程和网络安全基准上做到了最先进水平,还带数据和模型,搞安全智能体的可以看看。
语音界大动作:ElevenLabs 要在班加罗尔开峰会,10 月 6 日首秀新模型,还有现场 Demo,搞语音和 Agent 的别错过。
Lightelligence 把光计算从论文带到了真实门禁系统里,PACE 3 芯片的 256x256 矩阵能跑低延迟推理,是商用落地的首个案例,值得关注。
这个框架能自动设计量子化学电路,比传统ADAPT-VQE快10倍,还在真实量子计算机上跑了实验。搞量子计算化学的可以看看。
Cohere一口气开源三个模型,Transcribe、Command A+和North Mini Code都基于Apache 2.0,想自己部署AI的赶紧试试。
NVIDIA找到AdamW的短板了,批量干到1亿tokens它就崩,但SOAP和Muon依然稳,还解决了训练崩溃的毛病,训大模型可以看看这个。
这条推文直指 Opus 5 和 Fable 5 的基准与体验反差,还爆出 Anthropic 新的蒸馏训练路径,以及 RLHF 被弱化导致的体验变化,值得看看。
NVIDIA测了Nemotron 3 Ultra在芯片设计RTL编码上的表现,九类任务平均通过率97.1%,开源模型里最强,值得关注。
这篇论文给出了一个很实用的思路:用任务级反馈来动态路由LLM,不用每次调用都做独立决策。在多个基准上同时提升了准确率和速度。
LunarFM把三个月球任务的六种仪器数据整合成一个模型,能直接做资源识别和地质分类,开源数据集和代码。
如果觉得 LoRA 微调大模型太费钱,κ-LoRA 只挑条件数大的矩阵来更新,参数量砍半,速度提升 16%,精度不降,值得试试。
Kimi K3 把 NVIDIA 的 Nemotron 3 Ultra 打趴了,开源模型竞争真猛,看中国实验室怎么追上来的。
SemiAnalysis证明Kimi K3比NVIDIA的Nemotron 3 Ultra强很多,开源AI竞争格局正在变化,看看谁在领跑。
快手开源了KAT-Coder-V2.5,用10万个可验证环境训练代码智能体。AutoBuilder把环境搭建成功率从16%拉到57%,沙盒审计又让反馈错误降到2%以下。做编程智能体训练的值得一看。
Induction Labs 搞了个新套路:不用动作标签,只看视频就能学会模拟桌面、跳棋和台球物理。106B 参数的 MoE 模型,一次预训练就够了。
腾讯开源了三个具身模型,像搭积木一样分层解决机器人从看懂到动起来的难题,VLA 能做到毫秒级反应,做机器人开发的一定要看看。
Opus 5 的提示词被完整扒出来了,3.4 万 token 全是规矩,连记忆怎么记、什么能记不能记都写死了,看完你就知道 Anthropic 有多谨慎。
Sakana AI 新出的网络安全模型 Fugu-Cyber 在 CyberGym 上拿了 86.9%,比 GPT-5.5-Cyber 还高,做安全测试的可以关注。
Reactor 团队把 Dreamer 4 的完整训练配方和代码都开源了,JAX/Flax 实现,想复现世界模型做视频预测的赶紧看。
LLaDA2.2-flash在智能体基准上把Ling-2.6-flash甩开一截,快速模式甚至冲到705分,做Agent研究的可以看看。
OpenRouter 上 Token 用量前十中八个是中国模型,开源模型真的猛,快看看是哪些占了上风。
Anthropic的Opus 5在Auto Mode下把浏览器智能体的提示注入防御做到了100%,129个测试全过,这可能彻底解决智能体安全难题。
微软新出的 MAI 模型,在 Excel 上比肩 GPT-5.6,而且跑在旧款显卡上就能用,成本低不少。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档