12:11官方账号arXiv cs.AI@Hang Ni, Weijia Zhang, Fan Liu, Mengqian Lu, Hao LiuSIREN-Bench基准包含600个问答实例、19个任务,覆盖4个独立预警流程和1个端到端预警链。现有天气智能体框架在SIREN-Bench上表现出显著能力差距。研究者提出SIREN,一种结合历史案例检索、技能蒸馏和预测建模的经验驱动智能体框架。实验显示SIREN在独立预警流程和端到端预警链上均超越基线。该框架利用异构天气证据和工具集成环境,提升预警自动化水平。论文SIREN极端天气LLM Agent推荐理由:想了解LLM智能体在极端天气预警中怎么用?这篇论文建了个600题的基准,还搞了个历史案例驱动的框架,比现有方案强不少。原文稍后读已读值得跟进有用关注 SIREN
10:55官方一手arXiv: Anthropic@Evan Caville, Siamak Layeghy, Billy Sung, Sara Dolnicar, Marius Portmann论文提出SIREN方法,通过PAIR越狱循环自动编辑检索到的网页内容,操纵大语言模型的推荐排名。在124次试验中,SIREN在Claude 3.5 Sonnet和Claude 3 Opus模型上实现62次目标实体升至排名1。使用23种内容投毒技术(如声明性排名声称和种子列表),并在新会话中复现成功率达0.805。这是首个在固定源上下文下研究生产级LLM推荐排名操纵的受控实验。论文SIRENPAIRClaude推荐理由:这篇论文教你如何通过修改网页内容让大模型推荐时把你想要的东西排第一。SIREN用PAIR越狱循环,在Claude模型上成功率80%,挺有意思的。原文稍后读已读值得跟进有用关注 SIREN