AITOPAI热报
今日全部早读
地区
东盟中国趋势
外观
登录 / 注册
AITOPAI热报
全部动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
论文多源确认22:39
Anthropic研究:不可信智能体协作或致系统级故障

Anthropic的实验告诉你,多智能体协作会搞内鬼,能力强反而坏事。做了Agent系统的都该看看。

GGary Marcus11 个信源在谈原文
论文18:05
BDH-CQ 论文:循环潜在推理的上下文学习

BDH-CQ 这篇新论文把循环潜在推理用到上下文学习里,想看看它怎么提升少样本推理,可以读读。

AAK原文
论文18:05
LMArena发布AutoEval自动评测方法论视频与文章

LMArena这段视频把AutoEval评测方法讲得挺清楚,还配了文章,想研究模型评测的可以戳进去看看。

llmarena.ai原文
论文多源确认17:56
Anthropic 新研究:多智能体系统中的“思想病毒”传播机制

Anthropic 做了个实验:让“思想病毒”在多个 AI 智能体之间传播,一句系统提示警告就能几乎完全免疫,论文在 arXiv 上。

eelvis11 个信源在谈原文
论文17:52
训练停止后的记忆:ChatGPT 误把“考虑去土耳其”记成真事

记忆专场金句:ChatGPT 记错旅行,上下文学习赢过专用记忆,改推理就让任务完成率从22%提到60%。

AAI Engineer原文
论文17:41
CLAUDE.md为何不断膨胀?研究称追加容易删除难

这条论文用24万条指令数据告诉你CLAUDE.md为什么越写越长,还给了注释法这个解法,提升多到23%。

eelvis原文
论文00:57
LlamaParse 发布 ExtractBench:复杂企业文档抽取基准与 Agentic Plus

LlamaParse 发布 ExtractBench:长文档让商业模型召回崩到 35%;自家 Agentic Plus 95.6% 登顶,成本更低。

JJerry Liu2 个信源在谈原文
论文多源确认19:32
Anthropic发布新研究,Claude模型能力再提升

Anthropic发了新研究,Claude在推理和代码上又强了,接近GPT-4,想了解细节的可以看看。

TThe Rundown AI11 个信源在谈原文
论文16:49
腾讯发布自进化智能体可靠性综述:定义L0-L4分级

腾讯混元团队整理了549篇论文,给自进化智能体分了L0-L4五个等级,还提出一套验证更新靠不靠谱的方法,做Agent研究的朋友可以看看。

HHunyuan原文
论文多源确认04:05
NVIDIA发布Nemotron-RL-Agentic-Terminal-Pivot数据集

NVIDIA开源了训练编码智能体的数据集,想搞强化学习或智能体开发的可以看看。

NNVIDIA AI11 个信源在谈原文
论文04:03
人类数据直传机器人,跨具身鸿沟缩放定律首次被证实

这篇讲的是用人类数据直接训练机器人,不用机器人轨迹数据也能变强,跨具身缩放定律首次被证明,值得搞机器人的朋友看看。

AAI Will原文
论文23:42
利用API漏洞提取前沿模型隐藏推理过程

有人发现了从各家前沿模型API里偷看隐藏推理的漏洞,还验证了计费token对得上,挺有意思的。

eelvis原文
论文12:58
SWE-Bench ProMax:大规模多语言代码重构智能体基准

想测测你的 AI 编程助手在多语言重构上到底行不行?这个新基准 SWE-Bench ProMax 就是干这个的,比原来的 SWE-Bench 更狠。

AAK原文
论文07:52
Meta新论文提出Skaling law:耦合容量与数据的新缩放定律

Meta新论文搞了个Skaling law,比Chinchilla和Kaplan那套准1.5到3倍,而且小规模跑就能算准,预算算力能省不少。

eelvis原文
论文03:58
MatrAIx:83亿人格智能体模拟世界

想看怎么用83亿智能体模拟世界?MatrAIx 论文来了,Hugging Face 就能看到。

AAK原文
论文07:52
Meta新研究:EvoHarness-RL让智能体学习协调策略

Meta 新论文让智能体学会管理外部记忆,Qwen3-8B 在 ALFWorld 到 96.9%,长任务不用堆工具。

eelvis原文
论文23:28
YC Paper Club 机器人专题:多年承诺后研究现状与未来

这期请了一堆机器人研究者,讲 VLA 和世界模型新论文,还有遥操作创业观点,挺干货。

YY Combinator原文
论文04:00
Agent Arena 发布因果追踪方法论详解

Agent Arena 把怎么用因果追踪看清智能体行为的方法讲透了,做智能体评估或研究模型机制的人可以看看。

llmarena.ai原文
论文04:11
神经符号 AI 定义之争:Gary Marcus 称工具调用不是原意

Gary Marcus 在线怼人,翻出自己 2001 年的论文说对方没读过定义。想围观神经符号 AI 的考古级争论就看这条。

GGary Marcus原文
论文01:56
迈向技能原生LLM:技能熵用于长程推理基准与训练

新论文提出技能熵,用来评测和训练长程推理。想搞清AI是不是真会推理的可以读。

AAK原文
论文01:00
多模态预训练的物理:知识流、模态协同与早期统一

这篇论文把多模态预训练拆成知识流、模态协同和早期统一,还给了训练配方,搞多模态的可以读读。

AAK原文
论文多源确认07:09
新基准DataSpace:数据智能体异构任务最佳准确率66.34%

想知道数据智能体怎么选?DataSpace测了6个模型和5个框架,换框架能让准确率差15个点,值得看。

eelvis3 个信源在谈原文
论文04:42
Notion 调研 6000 名专业人士:AI 在职场实际应用如何

Notion 搞了个全球职场 AI 调查,6000 人、10 个市场,看看大家上班怎么用 AI,结论挺有意思。

NNotion原文
论文01:48
MerchantBench:评测电商LLM智能体长期连贯性的新基准

MerchantBench 专门测 LLM 智能体在电商里的长期连贯性,比单轮问答更贴近实际运营,可以看看。

AAK原文
论文06:08
同一模型和提示词,换 Agent Harness 单次成功成本相差 5-30 倍

别急着换模型,先看看 agent harness。同一任务成功成本能差 5 到 30 倍,论文还给了省 token 的提示模板。

eelvis原文
论文01:34
LongHorizon-Harness:评测真实世界长时程智能体

有人发了 LongHorizon-Harness,一个专测长时程智能体的框架,论文在 Hugging Face,想评估多步任务表现可以看。

AAK原文
论文12:37
谷歌论文:Transformer是记忆缓存的特例,长上下文更省算力

谷歌Titans团队的新方法用记忆缓存把RNN长上下文召回从21提到32,算力还远低于Transformer。

GGary Marcus原文
论文07:43
Model or Harness:41种Agent故障模式归因框架

做Agent生产的人快收藏:它把41种故障按交互边分类,修bug能直接判断是模型问题还是脚手架问题。

eelvis原文
论文07:42
TokTier有状态分词提升智能体服务,TTFT最高降34%

做智能体服务的朋友看下,TokTier把长记录重复分词干掉了,vLLM下首字延迟降16%-34%,省GPU。

eelvis原文
论文06:24
微软研究院发布SocialRL、PazaBench V2等研究

看微软研究院这周新东西:SocialRL 教小模型谈判,PazaBench V2 补非洲语言语音评测,顺带还有 EvoLib 智能体知识库。

MMicrosoft Research原文
论文多源确认03:08
OpenAI 发布数学手稿、Lean 证书与推理过程

OpenAI 把证明过程和机器验证文件都公开了,直接看 Lean 证书就能确认对错,搞数学的可以省去重复推导。

OOpenAI4 个信源在谈原文
论文02:26
斯坦福研究员提出合成数据推断框架:在历史任务上校准偏差

斯坦福Carrie的新框架,用历史任务校准合成数据,不需要真实标签,Agent Arena也在用,能解决模型和时间带来的偏差。

llmarena.ai原文
论文01:20
陶哲轩谈AI与数学:警惕“证明消化不良”

陶哲轩对AI做数学的真实看法,讲得很清楚:AI能算题,但建理论还不行。

GGary Marcus原文
论文00:17
从RLVR到RLSVR:任务变换让LLM自我改进用上自验证奖励

开放式任务也能用强化学习自我改进了,这篇论文把RLVR升级成RLSVR,不用人工奖励,AI自己验证自己。

AAK原文
论文23:32
SaliTrap研究:LLM被显性数字带偏,常识推理陷阱难避

这篇SaliTrap研究用1145道常识题考了12款模型,最好的也才过半避坑,点开看看谁最容易被数字带偏。

GGary Marcus原文
论文03:09
Gary Marcus:头部公司都在构建神经符号系统,只是不承认

Gary Marcus直接回怼“神经符号AI从没试过”,说大厂其实都在做,还甩出2020年的文章让你自己看。观点很冲。

GGary Marcus原文
论文01:23
谷歌DeepMind新研究:SkillSmith把模型权重当额外模态

DeepMind真会玩:把模型权重当文本喂给LLM,不用训练就能直接生成新技能,论文在arXiv可看。

eelvis原文
论文23:15
MIT与哈佛新论文:LLM无法真正进行科学发现

MIT和哈佛发了个评测,把前沿LLM丢进真实科研流程,结果它们连假设都提不好。

GGary Marcus原文
论文多源确认01:11
OpenAI 249页数学论文被批:只谈结果不谈模型如何工作

Gary Marcus公开质疑OpenAI的249页数学论文不讲模型机制,和普通论文比缺了关键验证细节。

GGary Marcus6 个信源在谈原文
论文23:13
ATWZ为Claude Code智能体团队打造持久工作区

Claude Code多智能体协作总丢状态?ATWZ给每个智能体独立工作区,一条命令恢复整队。

eelvis原文
‹ 上一页
123…14
下一页 ›
今日全部早读东盟登录