5月18日
10:32
10:32官方账号arXiv cs.LG@Igor Bogdanov, Chung-Horng Lung, Thomas Kunz, Jie Gao, Adrian Taylor, Marzia Zaman
精选
FORGE 是一种无需梯度更新的智能体记忆进化协议,通过分层 ReAct 架构和群体广播机制,让 LLM 智能体从失败轨迹中生成可复用的知识(规则、示例或混合形式)。在 CybORG CAGE-2 网络防御任务中,FORGE 使所有 12 种模型配置的平均回报提升 1.7-7.7 倍(相比零样本基线),并降低严重失败率至约 1%。关键发现包括:群体广播是性能提升的核心机制,示例记忆对多数模型效果最佳,且较弱模型受益更显著。该工作为无需权重更新的智能体持续学习提供了新范式。
推荐理由:做智能体持续学习和自主决策的团队——FORGE 用群体广播解决了记忆进化中的灾难性遗忘问题,无需微调模型权重,直接提升任务成功率。做网络防御或 POMDP 场景的开发者值得关注其低成本高回报的实践路径。
5月17日
5月16日
23:25
23:25Gary Marcus@GaryMarcus
Gary Marcus在X上回应@Nima292,指出当前的大语言模型(LLM)并非通用人工智能(AGI),但已经会导致部分工作岗位流失。他认为,如果未来真正实现AGI,失业问题将更加严重。这一观点引发了关于AI对就业影响的讨论,提醒人们关注技术发展的社会后果。
推荐理由:Gary Marcus的这条推文戳中了AI从业者和政策制定者的焦虑点——LLM已经带来失业,AGI会更糟。关心AI社会影响的人值得一看,看完会思考技术发展的代价。
5月15日
5月14日
5月13日
5月12日
17:56
17:56AK@_akhaliq
Soohak是由数学家精心策划的基准测试,旨在评估大型语言模型(LLM)在科研级别数学问题上的能力。该基准涵盖高等数学的多个领域,包括代数、几何、分析等,要求模型不仅具备计算能力,还需展现推理和创新解题能力。这为评估LLM在专业数学研究中的应用潜力提供了更严格的测试标准。

推荐理由:Soohak填补了现有数学评测基准在科研深度上的空白,为AI在数学领域的前沿应用提供了更精确的评估工具,有助于推动模型在数学推理和问题解决上的进步。
5月11日