09:34官方一手arXiv: OpenAI@Ankur Singh, Jinqiu Yang, Tse-Hsun Chen精选IssueTrojanBench新基准测试了Cursor、Claude Code和Codex Desktop三个编码代理,基于GPT-5.3/5.4和Sonnet 4.6模型。基准包含四种新型攻击类别(嵌入恶意指令)和六种投递向量(如PDF、issue评论)。结果显示66.5%的恶意issue穿透了所有防护。GPT模型普遍脆弱,而Sonnet 4.6表现出更选择性的高风险行为阻断。当前代理级防御措施提供的额外保护有限。论文IssueTrojanBenchGPT-5.3Sonnet 4.65 个信源在谈事件专题推荐理由:这个基准测试发现,你用的AI编码工具面对恶意issue时几乎不设防,66.5%都能得逞,赶紧看看你的工具安不安全。原文稍后读已读值得跟进有用关注 IssueTrojanBench
11:39IT之家(博客/媒体)精选OpenAI介绍了内部使用的网络安全红队模型GPT-Red。该模型通过自博弈强化学习训练,可自动化模拟网络攻击。自GPT-5.3后的每个生产模型均使用GPT-Red进行训练。伪造思维链攻击成功率从GPT-5.1的95%降低至最新模型不足10%,最新GPT-5.6 Sol在直接提示符注入攻击中失败率仅0.05%。AI模型GPT-RedOpenAIGPT-5.310 个信源在谈事件专题推荐理由:OpenAI搞了个内部红队模型GPT-Red,自动找漏洞,攻击成功率从95%降到10%以下,效果很实在。原文稍后读已读值得跟进有用关注 GPT-Red
09:25官方一手arXiv: DeepSeek@Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh精选72°该研究分析了多智能体LLM系统中幻觉的动态传播过程,通过500次级联实验追踪事实不一致性。结果显示,3级级联将归一化幻觉分数从0.422降至0.272,但事实准确性从0.789降至0.769,揭示了幻觉抑制与事实保留之间的权衡。不同模型表现各异:LLaMA-3-70B-Instruct幻觉最低,GPT-5.3生成更快但幻觉率更高。领域分析表明,科学领域幻觉较低,抽象领域较高。论文多智能体系统幻觉传播级联分析推荐理由:多智能体系统开发者终于有了量化幻觉传播的基准——这篇论文揭示了级联深度与事实准确性的权衡,做Agent编排的团队建议仔细看,避免盲目堆叠智能体导致事实失真。原文稍后读已读值得跟进有用关注 多智能体系统