#Anthropic

1623 条 · 查看话题观测
7月30日
论文官方一手精选09:33
OptimismBench:语言模型概率判断的乐观偏差与对齐效应

这篇论文发现大多数大模型判断概率时普遍乐观,只有Anthropic的模型偏悲观,还揭示对齐训练会改变偏差方向,值得AI开发者和伦理研究者关注。

事件专题
官方一手arXiv: Anthropic@Seonglae Cho, Adriano Koshiyama4 个信源在谈原文
论文官方一手精选09:31
Constitutional Midtraining:中期插入宪法内容可提升模型对齐

Anthropic提出了在模型训练中期加入宪法性内容来提升对齐持久性,在blackmail任务上降了17.5pp,而且不牺牲MMLU等能力,值得搞对齐的人看看。

事件专题
官方一手arXiv: Anthropic@Desiree Cho, Cameron Tice, Bernie Hogan, Hunar Batra, Puria Radmard, Jun Zhao, Nigel Shadbolt9 个信源在谈原文
7月29日
论文官方一手11:08
用软件工程原则编写 Agent Skills:Anthropic 规范与 Claude Code 实践

Anthropic 出了 Agent Skills 的开放规范,这篇论文教你用软件工程方法写技能,有 Claude Code 的实操细节,还有和其他机制的选择规则,搞 agent 开发的值得看。

事件专题
官方一手arXiv: Anthropic@Giuseppe Destefanis11 个信源在谈原文
7月28日