8月28日
18:45
18:45官方一手arXiv: DeepSeek@Gokulakannan Sakthivel, Jerry Wu, Amogh Rajendra, Giriprasad Radhakrishnan
精选73°
研究测量了OLMoE-1B-7B、DeepSeek-V2-Lite和Qwen3-30B-A3B三种MoE模型上的三种推理优化效果。Fused Triton内核在隔离测试中达到5.6x至9.0x加速,但端到端实际效果仅为0.999x,远低于1.07x的理论上限。INT4量化平均每位置仅改变8个专家中的0.53个,且通过全精度权重重放这些改变路线仅造成2.7%的质量损失。
推荐理由:论文揭示了MoE模型中三种推理优化为何实际效果不佳,对模型部署有重要参考价值。
7月25日
01:57
01:57Alex Albert@alexalbert__
78°
Anthropic 发布 Opus 5 模型,在多个领域提升 token 效率的同时,进一步拉高了智能水平。团队投入大量工作优化该模型,使其在编码任务上表现优于 Fable 5。用户反馈使用体验流畅。
事件专题

推荐理由:Anthropic 新模型 Opus 5,token 更省、智商更高,写代码比 Fable 5 顺手,值得试试。
5月21日
22:19
22:19官方账号Logan Kilpatrick@OfficialLoganK
76°
Gemini 3.5 Flash 在 APEX-Agents-AA 基准测试中排名第一,超越了参数规模更大的模型。该基准专注于智能体能力评估,Gemini 3.5 Flash 以较小模型实现了领先性能,展示了高效架构的优势。这一结果对智能体开发领域具有重要意义,表明模型效率与性能可以兼得。

推荐理由:智能体开发者可以关注:Gemini 3.5 Flash 用更小参数实现了更强性能,意味着更低成本和更快响应,值得在项目中尝试。