这项研究揭示了LLM作为攻击者的行为规律和可靠性差异,做AI安全评估或红队测试的团队值得关注——它告诉你不同模型在真实攻击场景下的稳定性和失败模式,直接指导模型选型和防御策略。
全部动态
AI 相关资讯全量信息流 · 95 条
5月29日
400次实验揭示LLM攻击一致性:Gemini 2.5 Flash-Lite成功率85%领先
5月21日
Whitepill:分布式训练可规避AI暂停条约,论文提出检测方法
这篇论文戳穿了AI暂停条约的技术漏洞——分布式训练让监管形同虚设,做AI治理、安全研究的团队值得细看,看完会对现有方案的有效性重新评估。
5月20日
5月19日
A-ProS:多模型反馈实现可靠自主编程
竞争编程开发者终于有了一个能可靠迭代的 AI 助手——A-ProS 通过多模型反馈将 GPT-5 的初始通过率提升 2 倍以上,做算法竞赛或自动化代码生成的团队可以直接参考其架构设计。
5月18日
5月15日
5月14日
30 Token 提示词让 12 个 LLM 停止推荐赞助内容
这篇论文揭示了 LLM 推荐中的赞助偏见,并提供了一个极简的对抗方法——用 30 token 提示词就能大幅降低推荐偏差。做 AI 安全、推荐系统或 LLM 应用的开发者值得一看,可以直接复现实验。
人格模型崩溃:微调导致大模型角色分化失控
做AI安全和对齐的研究者、模型微调工程师值得关注——这项研究用两个量化指标揭示了有害微调如何让模型角色扮演能力崩溃,比单纯看输出内容更早发现问题。建议点开看看指标计算方法。
Negation Neglect:微调让模型把假新闻当真,安全风险凸显
这个发现戳穿了微调中“加否定声明就能纠正模型”的幻觉,做安全对齐或数据清洗的团队必须警惕——你的训练数据里那些“假新闻”可能正在反向教坏模型。建议所有做微调的人点开看看,避免踩坑。
5月13日
RADAGAS & RefleXQLi:用LLM生成对抗性SQL注入攻击
安全工程师和渗透测试人员可以借鉴RADAGAS和RefleXQLi的思路,自动化生成对抗性SQL注入payload来评估自家WAF的盲区,尤其是AI/ML型WAF的脆弱点值得重点关注。
Overtrained, Not Misaligned:大模型微调中的“突发性错位”可避免
做LLM微调的团队终于有了避免“突发性错位”的实操指南——早期停止就能保留93%性能,建议所有做安全对齐的工程师点开看看具体阈值。
5月12日
论文19:11
GPT、Claude、DeepSeek、Grok如何分配西班牙和德国社会预算该研究揭示了LLM在公共政策模拟中的系统性偏差,对AI辅助决策的可靠性提出警醒,值得政策制定者和AI开发者关注。
5月11日
论文11:43
CA-SQL:动态计算分配提升Text-to-SQL推理该方法为Text-to-SQL领域提供了可落地的复杂度感知计算分配方案,对提升LLM在结构化查询等推理密集型任务中的效率有参考价值。
arXiv cs.AI原文