全部动态

AI 相关资讯全量信息流 · 373 条
6月5日
6月4日
论文精选12:09
Discourse-Role Labels 影响语言模型对上下文的采纳程度

这篇论文揭示了标签选择能显著改变模型对误导信息的采纳率(最高差 84 个百分点),做 RAG 系统或上下文增强应用的开发者需要警惕:你用的标签可能无意中放大了错误信息的影响。建议点开了解如何控制这一变量。

arXiv: DeepSeek@Jianguo Zhu原文
6月3日
模型Agent 与开发者多源确认88°13:48
微软发布7款MAI新模型,MAI-Thinking-1对标Sonnet 4.6

微软一口气推出7款新模型,覆盖推理、编程、图像三大方向,MAI-Thinking-1在推理和编码上直接对标Claude Sonnet 4.6和Opus 4.6,做AI应用或企业定制化模型的团队值得关注——尤其是Frontier Tuning让企业用更低成本获得超越GPT-5.5的效果。

事件专题
Mustafa Suleyman@mustafasuleyman6 个信源在谈原文
6月2日
论文12:05
K-BrowseComp:首个韩语网页浏览智能体基准测试

做多语言智能体或网页浏览任务的团队会立刻意识到差距——韩语场景下最强模型准确率不到一半,说明现有评估严重偏向英语。做韩语 NLP 或本地化产品的开发者可以直接用这个基准测试自己的模型。

事件专题
arXiv: DeepSeek@Nahyun Lee 等 15 人2 个信源在谈原文
6月1日
5月31日
5月30日
5月29日
产品多源确认精选72°21:32
ChatGPT 推出新版 GPT-5.5 Instant,改进谄媚、事实性和多语言表现

如果你在用 ChatGPT 做事实核查或多语言任务,新版 5.5 Instant 值得一试——它直接解决了旧版过于固执和谄媚的问题,对需要准确答案的开发者来说是个实用升级。

事件专题
官方账号Greg Brockman@gdb11 个信源在谈原文