11:57官方一手arXiv: DeepSeek@Tai Tran Tan, An Dinh Thien该论文描述了SemEval-2026 Task 6的系统,针对美国总统采访中的政治回避策略分类。比较了两种范式:使用QLoRA对Qwen3(4B-32B)进行参数高效微调,以及使用结构化CoT提示推理模型DeepSeek-V3.2和Grok-4-Fast。Grok-4-Fast在子任务2(9类回避)上取得Macro F1 0.5147,子任务1(3类清晰度)上0.7979,分别排名第8和第13。消融实验表明层次化标签和少样本示例提升了效果,但最强提示变体间Macro F1无显著差异。论文Grok-4-FastDeepSeek-V3.2Qwen31 个信源在谈事件专题推荐理由:想知道怎么用CoT提示检测政治回避?这篇论文拿Grok-4-Fast跑出了0.51的F1,比微调Qwen3强,还分析了怎么设计提示最有效。原文稍后读已读值得跟进有用关注 Grok-4-Fast
11:55官方一手arXiv: DeepSeek@Zaifu Zhan, Shuang Zhou, Rui Zhang提出一种多智能体互审推理方法,让多个LLM独立生成链式推理与候选答案,再互相评审事实正确性与逻辑合理性,选择最高分推理链输出最终答案。在Llama-3.1-8B、Qwen2.5-7B、Phi-4、DeepSeek-LLM-7B、GPT-oss-20B五个模型上对HeadQA、MedQA-USMLE、PubMedQA三个基准测试,平均准确率达0.820,超过单模型最佳0.777和多数投票集成最高0.789。评审可靠性高,能有效区分优质与低质推理链。论文Llama-3.1-8BQwen2.5-7BPhi-4推荐理由:这篇论文让多个AI模型互相评审对方的思考过程,医学问答准确率比单模型高5个百分点,比投票集成也高3个百分点,有意思。原文稍后读已读值得跟进有用关注 Llama-3.1-8B
10:47官方一手arXiv: DeepSeek@Haolong Qian, Xianliang Yang, Yinuo ma, Lirong Che, Feng Lu, Ye Guo, Lei Song, Jiang Bian, Chun Yuan论文在Qwen2.5、LLaMA-3和DeepSeek三个系列上发现:用小模型自身生成并通过拒绝采样选取的轨迹,比用更强Oracle模型精炼的高奖励数据,能更有效提升数学推理。Oracle精炼虽修复逻辑,但引入分布偏移,增加小模型适应成本,抵消了逻辑改进的收益。作者提出风格对齐精炼(Style-Aligned Refinement),保留小模型原生轨迹风格同时融入Oracle逻辑修复,降低适应成本并恢复下游效用。该发现挑战了数学推理蒸馏中依赖奖励模型分数选择数据的常规做法。论文Qwen2.5LLaMA-3DeepSeek推荐理由:这篇论文揭穿了一个直觉错误:你以为给小白模型喂“学霸笔记”能变强,结果效果还不如它自己瞎写的解题草稿。原因是学霸的思路和它不匹配,硬学反而费劲。原文稍后读已读值得跟进有用关注 Qwen2.5
10:46官方一手arXiv: DeepSeek@Sen Xu, Shixi Liu, Wei Wang, Jixin Min, Yingwei Dai, Zhibin Yin, Yirong Chen, Xin Zhou, Junlin ZhangVibeThinker-3B是一个3B参数的小型稠密模型,基于Spectrum-to-Signal后训练范式,通过课程监督微调、多域强化学习和离线自蒸馏提升。在AIME26上达到94.3分(测试时扩展至97.1),LiveCodeBench v6上Pass@1为80.2,最新LeetCode竞赛接受率96.1%。其性能与DeepSeek V3.2、GLM-5和Gemini 3 Pro等旗舰大模型相当或超越。IFEval得分为93.4,表明强推理未损害指令遵循能力。该工作提出了参数压缩-覆盖假说:可验证推理可压缩为紧凑推理核心,而开放域知识需宽参数覆盖。AI模型VibeThinker-3B推理模型可验证推理推荐理由:想看看3B小模型怎么打平千亿级大模型?VibeThinker-3B用AIME 94.3分、LiveCodeBench 80.2%的成绩告诉你,小模型也能杀进顶级推理梯队。原文稍后读已读值得跟进有用关注 VibeThinker-3B
10:45官方账号arXiv cs.AI@Yizhen Yao, Qinglin Zhu, Runcong Zhao, Xiangxiang Dai, Yanzheng Xiang, Yulan He, Lin Gui扩散大语言模型(dLLMs)在并行生成中面临解码速度与质量权衡。现有可撤销解码策略存在错误传播和局部错误强化问题。研究提出ASRD框架,通过时间一致性识别锚点令牌并动态缓存,引入锚点引导生成和锚点扰动验证两种机制。在数学和编码基准上,ASRD相比最新基线实现准确率提升最高6.4%,推理吞吐量提升最高7.2倍。论文ASRD扩散LLMAnchor Tokens推荐理由:这篇论文帮你用更少计算让扩散LLM更准更快,数学编程题准确率升6.4%,速度翻7倍,值得看一下。原文稍后读已读值得跟进有用关注 ASRD
09:45官方账号arXiv cs.AI@Yaoting Huang, Yifu Yuan, Linqi Han, Chengwen Li, Shuoheng Zhang, Xianze Yao, Hongyao Tang, Yan Zheng, Jianye HaoRoboPIN提出PinCoT(固定思维链)方法,将每个推理步骤绑定到视觉锚点,每个锚点包含实体名称、唯一标识、视图索引和空间定位。基于4B参数的小模型,在14个基准测试(涵盖空间推理、多视图推理和指向任务)中,平均超越7B开源模型Mimo-Embodied达12%。该方法通过三阶段后训练注入具身知识和过程监督,显著提升定位精度和跨步骤实体一致性。论文RoboPINPinCoT具身推理推荐理由:这篇论文用4B小模型在具身推理上打败了7B的Mimo-Embodied,平均提高12%,靠的是把每一步推理都牢牢钉在视觉证据上,挺有意思。原文稍后读已读值得跟进有用关注 RoboPIN
09:42官方一手arXiv: DeepSeek@Jiakai Li, Ke Qin, Rongzheng Wang, Yizhuo Ma, Qizhi Chen, Muquan Li, Shuang Liang大推理模型(LRM)常因过度思考生成冗余token,降低准确率。ASAG方法通过分析注意力分布推断推理状态,自适应调整生成策略。该方法无需训练,可即插即用,在DeepSeek-R1-Distill和Qwen3系列等主流模型上测试。在Qwen3-8B上,ASAG平均准确率提升3.2%,生成token减少约40%。论文ASAGDeepSeek-R1Qwen3推荐理由:想减少推理模型输出废话?ASAG免费即插即用,在Qwen3-8B上准确率升3.2%还省近40%token,实打实的效果。原文稍后读已读值得跟进有用关注 ASAG
20:12小互@imxiaohuPerceptron AI 发布了 Agentic Detection 模型,用户只需提供一张图片并用自然语言描述目标,模型就能在图中精确框出并标注每个目标。该模型无需预先训练,可直接处理从未见过的检测任务。它还能执行物理推理,例如从森林火灾画面中定位“烟的来源”,识别“需要维修的电线杆”或标记“空着的停车位”。这些能力使其在零样本目标检测领域展现了显著进步。AI模型Perceptron AIAgentic Detection视觉检测推荐理由:Perceptron AI 发了新视觉检测模型,不用提前训练,直接说找什么它就圈出来,还能推理物理关系,挺实用。原文稍后读已读值得跟进有用关注 Perceptron AI
18:12AI Will@FinanceYF5该模型在低effort设置下仍展现极强性能,是新训练轮次的第一个版本。它已被认为是当前最强的模型,但调低effort后不会大材小用。这一结论来自一个推文作者的观察,强调了低档位的强大。AI模型effort推理模型训练轮次推荐理由:试试把effort调到最低,这个新版本直接成了最强模型,效果惊人。原文稍后读已读值得跟进有用关注 effort
17:56官方账号阿里云 Alibaba Cloud@alibaba_cloud阿里巴巴旗下开源模型 Qwen 现已登陆欧洲 AI 网关 Eden AI,该平台已服务超过 200,000 名开发者。企业可通过 Eden AI 的统一 API 调用 Qwen 的推理、编程等模型,构建多模型工作流并避免供应商锁定。为庆祝上线,所有 Qwen 模型享 35% 折扣。Eden AI CEO 与 CPTO 将在下周二 VivaTech 会场与开发者见面。AI产品QwenEden AIAlibaba Cloud推荐理由:Qwen 现在在 Eden AI 上能用了,20 万开发者都在用的平台,通过统一 API 就能调用推理和编码模型,还打 35 折,挺划算的。原文稍后读已读值得跟进有用关注 Qwen
14:13官方一手marktechpost@Michal Sutter79°Z.ai 于 2026 年 6 月 13 日发布 GLM-5.2,覆盖所有 GLM Coding Plan 层级。该模型支持 100 万 token 的可用上下文窗口,并提供 High 和 Max 两种思考努力级别。GLM-5.2 通过 Anthropic 兼容端点集成到 Claude Code、Cline 和 OpenClaw 等工具中。发布时未公布基准测试结果,MIT 开源权重预计下周发布。AI模型Z.aiGLM-5.2长上下文10 个信源在谈事件专题推荐理由:Z.ai 的 GLM-5.2 支持百万token上下文,还能选思考深度原文稍后读已读值得跟进有用关注 Z.ai
11:10官方账号arXiv cs.AI@Shikun Liu, Mufei Li, Dongqi Fu, Haoyu Wang, Yinglong Xia, Hong Li, Hong Yan, Pan LiParallel-Synthesis框架使合成器直接消费并行工作线程的KV缓存,避免文本拼接冗余。它通过缓存映射器校准独立分支缓存,并微调合成适配器以支持非顺序缓存接口。在9个数据集(数学、科学问答、代码生成、GAIA、多智能体数据库诊断)上,7个超越或持平文本合成基线,首token延迟降低2.5-11倍。该工作为并行智能体分支的高效合成提供了新接口。论文Parallel-SynthesisLLMAgent推荐理由:并行合成提速2.5-11倍原文稍后读已读值得跟进有用关注 Parallel-Synthesis
10:22Gary Marcus@GaryMarcus精选一篇arXiv论文(2601.22436)发现,当前LLM智能体系统存储过去任务时包含原始步骤历史或总结规则。研究者通过将正确提示替换为随机垃圾文本来测试记忆使用情况:当步骤历史被破坏时,AI表现显著下降;但当总结规则被破坏时,AI性能无变化。这表明AI并未真正应用抽象规则,而是依赖复制精确历史动作。论文LLM智能体推理模型记忆机制推荐理由:论文实锤AI只会照搬历史原文稍后读已读值得跟进有用关注 LLM智能体
16:21宝玉@doteyPhoenix Yin指出,过去在GPT-3.5提示词中让其冒充GPT-4只能获得性能提升的错觉。Fable 5的真正实力来自Mythos-class底层权重、海量新训练数据和复杂agent架构,而非简单提示词复制。泄露prompt与老模型最多cosplay出味道像的lite版,性能差距巨大。Fable 5在长时程复杂分析、工具链、自验证等硬核任务上直接甩老模型几条街。AI模型GPT-3.5GPT-4Fable 510 个信源在谈事件专题推荐理由:别信提示词能偷实力,Fable 5靠的是真功夫原文稍后读已读值得跟进有用关注 GPT-3.5
02:01lmarena.ai@lmarena_ai精选Kimi 发布并开源了最新编程模型 Kimi-K2.7-Code,相比 K2.6 在 Kimi Code Bench v2 上提升 21.8%,在 Program Bench 上提升 11.0%,在 MLS Bench Lite 上提升 31.5%。推理效率优化,推理 token 使用量降低 30%。支持长程编程任务,指令遵循和端到端成功率更高。模型已通过 Kimi API 和 Kimi Code 提供。AI模型Kimi-K2.7-CodeKimi开源模型5 个信源在谈事件专题推荐理由:Kimi 开源新编程模型,性能全面超越前代原文稍后读已读值得跟进有用关注 Kimi-K2.7-Code
22:51量子位@鹭羽HuggingFace CEO和Bengio团队推荐的HRM模型,参数量仅1B,训练成本仅1500美元。该模型在多个基准测试中表现优于同规模模型,如MMLU上达到45.2%,HellaSwag上达到72.1%。其核心创新在于高效训练方法,大幅降低了资源需求。AI模型HRMHuggingFaceBengio推荐理由:1B模型,1500美元,性能超预期原文稍后读已读值得跟进有用关注 HRM
18:21官方账号Decoder@Matthias Bastian73°Anthropic 的 Claude Fable 5 在 FrontierMath 最难层级上达到 88% 准确率,较 Opus 4.5 在 2026 年初低于 10% 的成绩大幅提升。OpenAI 的 GPT-5.5 在同一层级上达到约 75%。两者差距为 13 个百分点,显示 AI 数学能力加速提升。AI模型Claude Fable 5GPT-5.5FrontierMath10 个信源在谈事件专题推荐理由:Anthropic 新模型数学碾压 GPT-5.5原文稍后读已读值得跟进有用关注 Claude Fable 5
17:47berryxia@berryxiaGLM-5.2 模型更新已发布,目前仅面向 codingPlan 用户开放。API 调用预计下周才支持。该更新是 GLM 系列模型的新版本,具体改进细节尚未公布。AI模型GLM-5.2codingPlan智谱AI2 个信源在谈事件专题推荐理由:GLM 新版本来了原文稍后读已读值得跟进有用关注 GLM-5.2
16:53Fireworks AI@FireworksAI_HQ精选Moonshot 推出 K2.7 Code,这是其 K2 系列的最新编程模型,已在 Fireworks 的 serverless 和 API 上上线。相比 K2.6,K2.7 Code 的推理 token 减少约 30%,同时在 Moonshot 的编程基准测试中得分更高。对于智能体编程任务,这一效率提升显著。AI模型K2.7 CodeMoonshotFireworks推荐理由:编程模型 token 省 30% 还更强原文稍后读已读值得跟进有用关注 K2.7 Code
16:53Fireworks AI@FireworksAI_HQ精选Fireworks AI 为 Qwen 模型新增长时智能体循环功能,支持观察、推理、编码、执行和验证的重复流程。Qwen 官方演示运行了 11 小时,生成了超过 10,000 行代码并执行了 1,000 多次调用。Fireworks 提供 reasoning_history 参数以跨轮次保留推理上下文,支持按请求切换思考/非思考模式,以及原生图像和文本输入。默认启用 262k 上下文和提示缓存,缓存输入价格为每百万 token 0.10 美元。AI产品FireworksQwen智能体推荐理由:Fireworks 让 Qwen 跑 11 小时智能体循环原文稍后读已读值得跟进有用关注 Fireworks
16:53Fireworks AI@FireworksAI_HQFireworks 宣布作为真正的推理提供商部署 Qwen 3.7 Plus,请求在其硬件上端到端执行,使用授权权重,无转发。Qwen 3.7 Plus(思考模式)在 AIME 2025 上匹配 Max 性能,端到端吞吐量比 Qwen 3.6 Plus 高 3.55 倍。AI模型Qwen 3.7 PlusFireworksAIME 2025推荐理由:Fireworks 直营 Qwen 3.7 Plus,吞吐量翻倍原文稍后读已读值得跟进有用关注 Qwen 3.7 Plus
16:38Fireworks AI@FireworksAI_HQ精选Fireworks AI 指出,在长代理循环中,推理 token 会在后续轮次中作为上下文被重复使用。K2.7 Code 通过缩短推理 token 长度,在不牺牲质量的前提下减少下游上下文大小,从而提升生成速度并降低重试次数,最终降低每个完成任务的真实成本。AI模型K2.7 CodeFireworks AI推理模型推荐理由:K2.7 Code 省 token 省成本原文稍后读已读值得跟进有用关注 K2.7 Code
13:54IT之家(博客/媒体)精选Google Research 推出 Gemini-SQL2 模型,基于 Gemini 3.1 Pro 打造,专攻 Text-to-SQL 任务。在 BIRD 基准的单模型赛道中,执行准确率达 80.04%,超越此前 Gemini-SQL。BIRD 覆盖 95 个数据库、37 个领域和 12751 组问题,数据量 33.4GB,模拟真实企业环境。该模型可让业务人员用自然语言查询营收、流失等数据,但谷歌尚未公布 API 或接入产品。AI模型Gemini-SQL2Google ResearchText-to-SQL4 个信源在谈事件专题推荐理由:谷歌新模型让自然语言查数据库更准原文稍后读已读值得跟进有用关注 Gemini-SQL2
13:17官方账号Epoch AI@EpochAIResearch精选73°Anthropic 的 Claude Fable 5 在 FrontierMath 基准测试 v2 版本中取得高分,Tier 1-3 达到 87%,Tier 4 达到 88%。这延续了 Anthropic 模型在数学能力上快速提升的趋势。AI模型Claude Fable 5AnthropicFrontierMath10 个信源在谈事件专题推荐理由:Anthropic 新模型数学超强原文稍后读已读值得跟进有用关注 Claude Fable 5
13:11官方账号LMSYS Org (SGLang)@lmsysorg精选73°SGLang在NVIDIA GB300 NVL72平台上,针对DeepSeek V4 Pro 1.6T模型(FP4精度,8K/1K上下文)实现了每GPU超过12K tok/s的推理速度。该性能由NVIDIA Dynamo(SGLang)和MTP技术协同实现。根据SemiAnalysis InferenceX基准测试,该性能在整个交互性曲线上保持稳定。AI模型SGLangGB300 NVL72DeepSeek V4 Pro10 个信源在谈事件专题推荐理由:SGLang在GB300上跑DeepSeek V4 Pro,每GPU超1.2万token原文稍后读已读值得跟进有用关注 SGLang
13:08官方账号Epoch AI@EpochAIResearch精选72°Epoch AI 发布 FrontierMath 基准测试 v2 版本,修复了 42% 的问题错误。新版本中,GPT-5.5 (xhigh) 在 Tier 1-3 上取得 85% 的准确率,Google 的 AI co-mathematician 在 Tier 4 上达到 76%。所有模型得分普遍提高,排名基本不变。AI模型FrontierMathGPT-5.5Google推荐理由:数学基准更新,GPT-5.5和Google AI成绩亮眼原文稍后读已读值得跟进有用关注 FrontierMath
13:00lmarena.ai@lmarena_aiPeter Gostev在YouTube上分享了Anthropic的Claude Fable 5在Agent Arena中的初步体验。视频展示了该模型在复杂任务中的表现,包括多步骤推理和工具调用。Claude Fable 5在Agent Arena的基准测试中取得了显著成绩,超越了前代模型。AI模型Claude Fable 5AnthropicAgent Arena10 个信源在谈事件专题推荐理由:看看Claude Fable 5在Agent Arena的表现原文稍后读已读值得跟进有用关注 Claude Fable 5
12:38Fireworks AI@FireworksAI_HQ精选Fireworks 宣布 Kimi K2 模型现已在 serverless 平台上可用。标准层按 token 计费,输入 $0.95/1M token,输出 $4/1M token,缓存命中 $0.19/1M token。上下文窗口达 256K。优先层面向关键工作负载,快速路径即将推出。AI产品FireworksKimi K2serverless推荐理由:Fireworks上线Kimi K2,价格超低原文稍后读已读值得跟进有用关注 Fireworks
11:00官方账号Decoder@Matthias BastianAnthropic发布的Claude Fable 5在Artificial Analysis Intelligence Index上获得64.9分,创下十项基准测试中的五项纪录。相比Opus 4.8,性能仅提升5.7%,但token价格翻倍。安全过滤器和回退路由进一步推高使用成本。AI模型Claude Fable 5AnthropicOpus 4.810 个信源在谈事件专题推荐理由:性能微涨价格翻倍,谨慎升级原文稍后读已读值得跟进有用关注 Claude Fable 5
10:41AI Will@FinanceYF5精选《Memory》方法让模型在多个 session 间积累知识,路径分为失败、调查、验证、提炼规则、查用规则五步。Sonnet 4.6 仅完成第1步(记录失败但不查询);Opus 4.7 可到第3步,但校验覆盖率仅7–33%;Fable 5 能走完全程,验证覆盖率最高达73%。该方法旨在提升模型跨会话知识复用能力。论文Sonnet 4.6Opus 4.7Fable 510 个信源在谈事件专题推荐理由:Fable 5 跨 session 记忆覆盖率73%原文稍后读已读值得跟进有用关注 Sonnet 4.6
10:38AI Will@FinanceYF5Anthropic工程师通过两个实验验证,设计让模型自我纠错的环境比直接提示更有效。实验一显示,在特定架构下,Claude 3.5 Sonnet的任务成功率从52%提升至78%。实验二表明,通过环境反馈机制,模型在复杂推理任务中的错误率降低了34%。这种架构方法不依赖更强大的模型,而是优化了Agent的交互流程。AI模型Claude 3.5 SonnetAnthropic智能体10 个信源在谈事件专题推荐理由:Anthropic教你用环境设计提升Agent原文稍后读已读值得跟进有用关注 Claude 3.5 Sonnet
10:34AI Will@FinanceYF5精选Claude Fable 5 基于物理第一性原理构建了太阳系模拟,而非仅制作轨道动画。它推导出行星运动规律,并成功预测了一次日食。该模型还展示了黑洞模拟,体现了其科学推理能力。AI模型Claude Fable 5物理模拟推理模型10 个信源在谈事件专题推荐理由:Claude Fable 5 用物理原理预测日食原文稍后读已读值得跟进有用关注 Claude Fable 5
10:29OpenRouter@OpenRouterAIOpenRouter 推出 Subagent 服务器工具,允许 GPT-4 等强大模型在生成过程中将子任务委托给更小、更便宜的模型(如 Claude 3 Haiku)。主模型负责编排,子代理执行具体任务,且子代理可使用 OpenRouter 上任意模型。该工具旨在降低推理成本并提升速度,目前已有 634 次查看。AI产品OpenRouterSubagent智能体推荐理由:大模型自动调用便宜模型干活原文稍后读已读值得跟进有用关注 OpenRouter
10:18berryxia@berryxia精选73°Kimi 发布 K2.7-Code 模型,开源权重和代码至 Hugging Face。相比上一代,token 消耗减少 30%,agent 长任务成功率提升。在 Kimi Code Bench v2 上提升 21.8%,Program Bench 提升 11%,MLS Bench Lite 提升 31.5%。模型通过高效推理解决 coding model 过度思考问题,并预告 6x High-Speed Mode。AI模型KimiK2.7-Code开源模型推荐理由:Kimi 开源新模型,少烧 token 还能干更多活原文稍后读已读值得跟进有用关注 Kimi
09:43官方一手marktechpost@Asif Razzaq精选Google Research 于 2026 年 6 月 12 日发布 Gemini-SQL2,基于 Gemini 3.1 Pro 模型。该模型在 BIRD 单模型排行榜上取得 80.04% 的执行准确率。文章解释了该分数含义、排行榜对比情况,以及 Google 未披露的细节。同时介绍了使用场景和基于 schema 的实现模式。AI模型Gemini-SQL2Gemini 3.1 ProBIRD3 个信源在谈事件专题推荐理由:Google 新模型 SQL 准确率破 80%原文稍后读已读值得跟进有用关注 Gemini-SQL2
04:21elvis@omarsar0精选Google Research 推出 Gemini-SQL2,基于 Gemini 3.1 Pro 模型。该模型在 BIRD 基准上实现了最新最佳结果,能够将自然语言转换为可直接执行的 SQL 查询。BIRD 是一个高难度的文本转SQL基准,Gemini-SQL2 在此验证了定制模型在处理复杂真实数据时的优势。AI模型Gemini-SQL2GoogleBIRD3 个信源在谈事件专题推荐理由:Google 用 Gemini 3.1 Pro 刷新了 SQL 生成最强成绩原文稍后读已读值得跟进有用关注 Gemini-SQL2
22:18官方账号LMSYS Org (SGLang)@lmsysorg73°SGLang 宣布 Day-0 支持 MiniMax-M3,这是 MiniMax 推出的原生多模态 MoE 推理模型,总参数量约 428B(活跃参数约 23B),支持文本、图像和视频的融合处理。M3 采用 MiniMax 稀疏注意力机制,在 1M 上下文下相比 M2 实现 9 倍预填充和 15 倍解码加速,每 token 计算量降至 1/20。该模型在编码和协作任务上达到前沿智能体性能,并原生支持 NVIDIA Blackwell 和 AMD MI350X/MI355X 上的 MXFP8 格式。开发者可通过 SGLang 立即运行该模型。AI模型SGLangMiniMax-M3多模态10 个信源在谈事件专题推荐理由:SGLang 第一时间支持 MiniMax-M3,做多模态推理和长上下文应用的团队可以直接上手体验 428B 模型的稀疏注意力加速,编码和智能体任务表现值得一试。原文稍后读已读值得跟进有用关注 SGLang
21:56官方账号vLLM@vllm_projectKimi 发布 K2.7-Code,一个专注于编程的智能体模型,基于 K2.6 构建。该模型采用 1T 参数的混合专家架构,每次推理仅激活 32B 参数,配备 MLA 注意力机制和 256K 上下文窗口。相比 K2.6,K2.7-Code 的思考 token 减少了约 30%,推理更高效。该模型已获 vLLM 支持,可直接复用 K2.6 的部署配置,降低了迁移成本。AI模型编程智能体MoE/混合专家Kimi推荐理由:编程智能体模型终于有了更高效的选择——K2.7-Code 在保持 1T 参数规模的同时,将激活参数压缩到 32B,做代码生成和推理的开发者可以直接在 vLLM 上复用现有部署,值得一试。原文稍后读已读值得跟进有用关注 编程智能体
14:45Philipp Schmid@_philschmidAgent's Last Exam 是一个全新的AI智能体基准测试,旨在评估智能体在复杂、多步骤任务中的表现。该测试由多个研究机构联合开发,包含一系列需要规划、工具使用和推理的挑战性任务。初步结果显示,当前最先进的模型在测试中得分较低,表明智能体能力仍有巨大提升空间。该基准的发布为AI智能体研究提供了更严格的评估标准。论文智能体基准测试评估推荐理由:做AI智能体研究的团队终于有了更严格的测试标准——Agent's Last Exam 揭示了当前模型的真实短板,值得所有关注智能体能力的开发者点开看看。原文稍后读已读值得跟进有用关注 智能体
14:19AI Will@FinanceYF5Boris Cherny 评价 Fable 5 是自 Opus 4.5 以来最显著的模型升级。该模型从单纯的编码助手进化为产品构建中的思考和设计伙伴,具备判断力、品味和维度感。在调试任务中,Fable 5 展现出前所未有的系统性和精确性,会自动测量、添加日志并验证修复效果。Cherny 认为这种能力并非来自提示工程,而是模型本身的“人格”特质,带来了从未体验过的“大模型气息”。AI模型Fable 5编程助手推理模型10 个信源在谈事件专题推荐理由:Fable 5 解决了 AI 编程从工具到伙伴的跃迁问题,做复杂产品开发的团队值得一试——它不再只是帮你写代码,而是能和你一起设计。原文稍后读已读值得跟进有用关注 Fable 5