9月2日
12:58
12:58官方一手歸藏(guizang.ai)@op7418
73°
Claude发布了Fable 5.1和Mythos 5.1模型,两者权重相同。输入输出价格与Fable 5保持一致,缓存价格降低75%。官方表示典型负载成本降低约25%,重度Agent负载降低约45%。但用户报告称Fable 5.1订阅额度消耗极快,20-30分钟内可能用完。
事件专题

推荐理由:Claude新模型Fable 5.1和Mythos 5.1发布,缓存降价75%,但实际成本可能更高,还有额度消耗快和功能限制问题。
9月1日
21:45
21:45Richard Socher@RichardSocher
73°
Braintrust研究评估了1,329个时事问题,对比4个模型在14种条件下的表现。搜索功能将模型间差距从47.9分缩小至5.6分。检索增益随事件时间衰减,近期事件约45分,最旧事件约24分。5次以上搜索的得分反而下降19-49%。
推荐理由:Braintrust研究显示,搜索功能能让不同模型表现趋同,但搜索次数过多反而会降低准确率。
8月27日
00:53
8月26日
14:58
8月24日
18:53
18:53AI Will@FinanceYF5
78°
Anthropic最强模型Fable 5仅占客户购买Token的6%,价格是Opus 5的两倍,但性能仅落后0.5%,单任务成本减半。企业主要在高难度任务上使用Fable 5,成本更低可能带来更高毛利。
事件专题

推荐理由:Anthropic的Fable 5虽然价格高,但性能仅略逊于Opus 5,成本却低一半,适合高难度任务,值得关注。
8月21日
18:03
18:03官方账号深度求索 DeepSeek@deepseek_ai
78°
DeepSeek-V4-Flash-Vision-Exp模型在DeepSeek API平台上线,文本能力与DeepSeek-V4-Flash相当,多模态性能提升显著,接近Opus-4.8。DeepSeek Harness 0.1.1版本支持新模型。
事件专题

推荐理由:DeepSeek新模型上线,文本和推理能力提升,多模态性能接近Opus-4.8,值得一试!
8月14日
02:57
02:57官方账号Perplexity@perplexity_ai
Grok 4.6 已在 Perplexity 和 Perplexity Computer 上线。该模型在 WANDR 基准上位于性能和效率的帕累托前沿。相比 Fable 5,Grok 4.6 在结果持平的情况下成本降低超过 60%。用户现在即可在 Perplexity 生态中直接使用 Grok 4.6。
事件专题

推荐理由:Grok 4.6 上线 Perplexity 了,在 WANDR 上跟 Fable 5 结果持平,成本还低 60% 以上。
6月8日
6月6日
07:44
6月5日
08:25
08:25cat@_catwu
Anthropic 正在招聘一位专注于模型性能的产品经理,负责 Claude Code 产品线。该职位要求候选人具备编写智能体评估(agentic evals)的经验,并能将研究想法整合到核心产品中。这表明 Anthropic 正加速将前沿研究转化为实际产品,尤其关注智能体(Agent)场景下的模型表现。对于关注 AI 产品化和智能体落地的从业者,这是一个值得关注的信号。
事件专题

推荐理由:Anthropic 首次公开为 Claude Code 招聘模型性能方向的 PM,说明智能体评估正从研究走向产品化。做 AI 产品经理或智能体开发的团队,可以从中看到行业对 agentic evals 的重视程度,值得关注。