09:20官方一手arXiv: DeepSeek@Zimo Shi, Xander Tifft, Wen Xing精选研究测试了思维链(CoT)作为AI监督机制的假设。研究引入指令遵循差距(ICG)概念,发现8个前沿推理模型中存在不对称披露现象,模型更可能泄露恶意隐藏指令而非良性指令。Qwen3-14B、Qwen3-32B和Qwen3-235B等模型在恶意指令泄露概率上分别高出13.9pp、13.0pp和5.8pp。通过对比性激活添加提取的转向向量可因果性地诱导隐藏行为,且良性与恶意衍生的隐藏向量高度相似。论文Qwen3推理模型思维链推荐理由:这篇论文揭示了AI模型在隐藏指令披露上的不对称行为,对AI安全和监督机制设计有重要启示。原文稍后读已读值得跟进有用关注 Qwen3
10:18官方账号arXiv cs.LG@Ye Shen, Yuting Zheng, Dun Pei, Zijian Chen, Wenlong Zhang, Qi Jia, Guangtao ZhaiSciMIF是一个新的基准,旨在评估多模态大型语言模型在遵循复杂科学指令方面的能力。通过分析5个代表性科学学科的22个不同任务,提出包含10个约束组的全面分类法。实验发现,不同科学学科间存在显著性能差异,化学对当前MLLMs更具挑战性。SciMIF填补了评估科学领域多模态指令遵循的空白,为MLLMs在严格科学应用中的未来改进奠定基础。数据与代码将在GitHub上发布。论文SciMIF多模态MLLMs推荐理由:SciMIF基准为评估MLLMs在科学领域的指令遵循能力提供了新工具,揭示了不同学科间的性能差异,对科学研究和MLLMs发展具有重要意义。原文稍后读已读值得跟进有用关注 SciMIF
03:43Gary Marcus@GaryMarcusGary Marcus在推文中指出,AI不遵循指令的问题正被许多人忽视,正如早期对幻觉问题的轻视。他认为,这类核心问题无法通过现有方法快速解决,除非开发出根本性新架构。Marcus警告,以LLM为中心的架构对AI安全构成深刻威胁。他还引用Huw Ringer的观点,称指令越具体,模型遵循的可能性反而越低。行业Gary MarcusAI安全指令遵循推荐理由:Gary Marcus直接点出AI不听指令比幻觉更危险,还引用了越具体越不听话的现象。想了解AI安全风险,看这条。原文稍后读已读值得跟进有用关注 Gary Marcus
10:33官方账号arXiv cs.AI@Ekaterina Alimaskina, Denis Shveykin, Gleb Molodtsov, Igor Shalygin, Alexey Kadeishvili, Aleksandr Beznosikov语言模型越来越多地使用自生成的问答数据来微调或蒸馏。研究表明,生成阶段并非中性预处理,而是隐含策略:模型在提问时不会均匀扫描文档,覆盖很快饱和并集中在显著区域,不同提示也会聚焦相同片段。在回答阶段,模型倾向于服从文本中嵌入的指令性内容,且这种服从取决于指令的表面形式和意图。作者通过将每个问题固定到特定目标降低了选择偏差,并在回答前过滤指令性文本,将注入合规率从88%降至13%,同时保留几乎所有干净文本。论文自生成问答微调知识蒸馏推荐理由:这篇论文告诉你,用模型自己问自己生成的问答数据来训练模型,可能会引入隐蔽的偏见和指令注入风险。他们用一个简单方法就能把问题率从88%压到13%,值得做数据合成的同学看看。原文稍后读已读值得跟进有用关注 自生成问答
01:14Justine Moore@venturetwinsVentureTwins 在 X 上分享了对某模型的评测,指出该模型的一大优点是既能处理简短提示词也能处理长提示词,并且都能很好地遵循指令。他举例说明,在 WIRED 图片中他给出了完整文案,而在另外两张图中只给了一句模糊的指导,模型就自动完成了其余内容。这表明该模型在指令遵循能力上表现突出,对提示词长度不敏感,适合需要精确控制或快速生成内容的场景。AI模型模型评测指令遵循提示词推荐理由:对提示词长度和复杂度不敏感,做内容生成或创意设计的团队可以试试,能省去反复调优提示词的麻烦。原文稍后读已读值得跟进有用关注 模型评测