AITOPAI热报
今日全部早读
地区
东盟中国趋势
外观
登录 / 注册
AITOPAI热报

Qwen3.5-35B

共 2 条相关 AI 资讯
7月23日
22:38
22:38官方账号LMSYS Org (SGLang)@lmsysorg
精选
Miles 框架新增 On-Policy Distillation(OPD)作为一等训练原语。在 Qwen3.5-35B-A3B 上,纯 OPD 使推理 token 数从 18.6k 降至 5.5k–6.7k,缩短约 3 倍,同时 held-out DAPO 准确率从 0.8457 升至 0.8945。反向 KL 散度从 0.045 降至 0.010,学生模型收敛至教师。采用稀疏逐位置评分代替密集 O(R²K) 评分,提升效率。支持纯蒸馏或与 GRPO/PPO 奖励结合,计划扩展多教师和 RL 场景。
AI模型MilesOPDQwen3.5-35B
事件专题

推荐理由:Miles 发布了 OPD 方法,让 Qwen3.5 模型推理更快更准,无需任务奖励,比传统蒸馏更高效,适合模型压缩场景。
原文
6月19日
09:33
09:33官方一手arXiv: DeepSeek@Gregory Matsnev
该论文提出一种基于提示的不确定性分解方法,将动作置信度与请求不确定性分离,使智能体在任务规格模糊时主动请求澄清。作者引入WebShop-Clarification和ALFWorld-Clarification两个基准,其中50%任务故意模糊。在GPT-5.1、DeepSeek-v3.2-exp、GLM-4.7、Qwen3.5-35B、GPT-OSS-120B五个大模型上测试,该方法在ALFWorld-Clarification上的澄清F1比ReAct+UE提升73%,比UAM提升36%。
论文GPT-5.1DeepSeek-v3.2-expGLM-4.7

推荐理由:这篇论文给出了一个简单实用的方法,让智能体在任务模糊时主动提问,而非盲目执行。五个大模型上都有提升,值得做Agent的同学看看。
原文
今日全部早读东盟登录