全部动态
AI 相关资讯全量信息流 · 90 条
5月15日
5月14日
30 Token 提示词让 12 个 LLM 停止推荐赞助内容
这篇论文揭示了 LLM 推荐中的赞助偏见,并提供了一个极简的对抗方法——用 30 token 提示词就能大幅降低推荐偏差。做 AI 安全、推荐系统或 LLM 应用的开发者值得一看,可以直接复现实验。
人格模型崩溃:微调导致大模型角色分化失控
做AI安全和对齐的研究者、模型微调工程师值得关注——这项研究用两个量化指标揭示了有害微调如何让模型角色扮演能力崩溃,比单纯看输出内容更早发现问题。建议点开看看指标计算方法。
Negation Neglect:微调让模型把假新闻当真,安全风险凸显
这个发现戳穿了微调中“加否定声明就能纠正模型”的幻觉,做安全对齐或数据清洗的团队必须警惕——你的训练数据里那些“假新闻”可能正在反向教坏模型。建议所有做微调的人点开看看,避免踩坑。
5月13日
RADAGAS & RefleXQLi:用LLM生成对抗性SQL注入攻击
安全工程师和渗透测试人员可以借鉴RADAGAS和RefleXQLi的思路,自动化生成对抗性SQL注入payload来评估自家WAF的盲区,尤其是AI/ML型WAF的脆弱点值得重点关注。
Overtrained, Not Misaligned:大模型微调中的“突发性错位”可避免
做LLM微调的团队终于有了避免“突发性错位”的实操指南——早期停止就能保留93%性能,建议所有做安全对齐的工程师点开看看具体阈值。
5月12日
论文19:11
GPT、Claude、DeepSeek、Grok如何分配西班牙和德国社会预算该研究揭示了LLM在公共政策模拟中的系统性偏差,对AI辅助决策的可靠性提出警醒,值得政策制定者和AI开发者关注。
5月11日
论文11:43
CA-SQL:动态计算分配提升Text-to-SQL推理该方法为Text-to-SQL领域提供了可落地的复杂度感知计算分配方案,对提升LLM在结构化查询等推理密集型任务中的效率有参考价值。
arXiv cs.AI原文