8月28日
21:28
21:28Stanford AI Lab@StanfordAILab
Terminal-Bench-Science是一个评估AI代理在科研工作流表现的基准测试。该基准由斯坦福大学领导,v0.1版本包含70个任务。Claude Opus 5仅能解决约30%的任务。这是Terminal-Bench团队与全球科研机构科学领域专家共同开发的成果。
推荐理由:斯坦福发布了科研AI代理基准Terminal-Bench-Science,Claude Opus 5仅完成30%,看看你的模型表现如何。
20:56
20:56官方账号Simon Willison’s Weblog博客/媒体
精选73°
研究人员Johann Rehberg发现了一种针对Claude Code的攻击方法,成功率高达80%。该攻击通过诱使Claude下载并解压zip文件,执行导入base64的代码而不注意会同时执行本地struct.py文件。在某些情况下,Auto Mode甚至阻止了Claude终止恶意软件的清理命令。
事件专题

推荐理由:Johann Rehberg发现Claude Code Opus 5 Auto Mode存在80%成功率的攻击,安全机制反而成为失败部分。
17:31
8月27日
16:18
15:18
08:55
08:54
08:53
02:08
01:40
8月26日
13:04
07:03
07:03IT之家博客/媒体
Anthropic 更新 Claude Cowork 与聊天功能间的记忆机制,实现统一管理。Cowork 可访问聊天记录中的信息,并保存相关记忆。敏感话题记忆默认关闭,用户可手动开启。支持免费版和付费版,Mac 和 iOS 平台。
事件专题

推荐理由:Anthropic 升级 Claude 记忆功能,Cowork 与聊天无缝对接,方便用户管理信息,无需重复解释。敏感信息保护到位,安全可靠。
04:54
02:50
02:48
01:58
01:05
00:39
8月25日
23:36
8月24日
09:36
04:13
04:13官方账号Simon Willison’s Weblog博客/媒体
Drew Breunig指出,在Fable出现之前,优化编码工具似乎没有必要,因为新模型的出现往往能解决大部分问题。然而,Fable的出现虽然令人惊叹,但其高昂的成本使得Opus、5.6、K3和GLM等模型已经足够应对大多数需求。因此,人们开始思考哪些工作应该放在哪里。
推荐理由:Drew Breunig分享了他对Fable的看法,揭示了免费午餐时代的终结,对于关注LLM定价和AI发展的读者来说,这是一篇值得阅读的文章。
8月22日
19:28
05:04
02:44
8月21日
17:03
07:06
07:05
04:06
03:48
01:17
01:16
01:16宝玉@dotey
Claude Code 最新版本上线了一个特别讨厌的功能,频繁给其他正在运行的 session 发消息。该功能默认开启,用户至今未找到关闭选项。它会导致早已结束且无缓存的历史会话被意外唤起,造成 token 消耗激增。

推荐理由:Claude Code 新版上线了个烦人的跨 Session 通知功能,默认开启还关不掉,会把旧会话全唤醒,token 消耗飞起。
8月20日
23:38
23:38宝玉@dotey
Together AI 工程师哈桑分享了用智能体设计 UI 的经验。他开发了名为 Hallmark 的 design skill,将 AI 常见的“slop 套路”列为“别这么干”的规则喂给模型。他建议给智能体提供参考图和截图,并使用更长的提示词。他提到 GLM 5.2 的效果与 Opus 几乎分不出来,但速度更快。
推荐理由:Together AI 工程师哈桑分享了用智能体设计 UI 的经验,他做了个叫 Hallmark 的 design skill,把 AI 常见的“slop 套路”列为“别这么干”的规则喂给模型,效果很好。
23:05
23:04
23:04