11:24官方账号arXiv cs.AI@Hamed Babaei Giglou, Sören Auer, Jennifer D'Souza精选73°研究评估了13个模型,包括Qwen3.5和Qwen3.6系列以及GPT变体,使用OntoLearner管道。在Qwen3.5密集型模型中,参数量增加主要提高精确率而非召回率,9B到27B参数间提升最大。27B密集型模型在术语分类上显著优于更大的稀疏模型,而更大的MoE模型在分类发现上表现最佳。非分类关系提取在所有模型规模上仍具挑战性,特别是在材料数据科学本体上。论文Qwen3.5Qwen3.6本体学习推荐理由:Qwen团队研究了13个模型规模对本体学习的影响,发现参数量并非越大越好,架构和模型血统比参数数量更重要。原文稍后读已读值得跟进有用关注 Qwen3.5
11:21官方账号arXiv cs.AI@Qiyao Yan, Chenpeng Wang, Liangming Pan精选73°研究人员发现大语言模型在推理任务失败时,可能并非缺乏底层能力,而是输出阶段存在瓶颈。通过隐藏状态探测,即使在序列评分完全崩溃的情况下,仍能解码出正确答案。使用最小化无标签校正协议,仅用25个未标记样本和2个参数,就能为Qwen3.5模型恢复9-34个准确点,该方法成功迁移到OLMo-2-1B和Llama-3.1-8B模型。论文Qwen3.5Llama-3.1-8BOLMo-2-1B推荐理由:发现大模型推理失败不等于能力缺失,用简单方法就能恢复被掩盖的内部逻辑。原文稍后读已读值得跟进有用关注 Qwen3.5
10:25官方一手arXiv: DeepSeek@Jiarui Dong, Yin Cai, Zhouhong Gu, Chenmou Wu, Ci Tao, Yiran Chen, Jialing Li, Xiaoran Shi, Juntao Zhang, Zhijun FangSchemaGUI是一个基于模板的基准,用于可控制GUI生成评估。通过从参数化界面模式合成成对的自然语言指令和确定性的函数调用引用,SchemaGUI可以在几秒钟内生成数千个确定性的标注任务,无需人工标注。在六个代表性双语场景中,对每个场景和语言评估了1000个实例,包括Qwen3.5系列、Qwen3-Coder-30B和DeepSeek-R1等五个主流模型。分析揭示了三个关键发现:精确的几何空间控制仍然是重要瓶颈;从4B扩展到27B的Qwen3.5提高了Schema可行性从91.56%到99.63%,但几何分数仅略有提高(从67.05%到75.30%);生成难度高度敏感于布局复杂性,当前LLMs擅长简单顺序排列,但在密集网格和多区域组合中存在严重的坐标漂移;思考模式增加令牌消耗,同时通常降低GUI分数,特别是对于较小的模型。论文SchemaGUIGUI生成LLMs推荐理由:SchemaGUI提供了一个新的基准,用于评估可控制GUI生成,特别是对于LLMs在几何空间控制和布局复杂性方面的表现进行了深入分析,对于想要了解GUI生成领域最新进展的人来说是个好资源。原文稍后读已读值得跟进有用关注 SchemaGUI
09:30官方一手arXiv: DeepSeek@Zhongzhi Li, Yucheng Shi, Zongxia Li, Ruhan Wang, Anhao Li, Zixun Huang, Junyao Yang, Lei Ke, Ninghao Liu, Haitao Mi, Leowei Liang精选RST是一种递归验证的合成框架,能从已验证种子任务出发扩展参考解、重对齐验证器与指令,并在新沙盒中验证。经过15轮递归,RST以约0.05美元/任务的成本生成了37,484个终端任务,中位参考解从67行增至374行,执行的命令数从40增至244。DeepSeek-V4-Pro的pass@4从第1轮的90%降至第15轮的2.5%,任务难度持续攀升。用Qwen3.5轨迹微调,Qwen3.5-27B在Terminal-Bench 2、Hard和Long-Horizon上最多提升10分;PPO训练后相对增益为20.0%、41.2%和21.9%。15轮后合成产率和验证率保持稳定,表明流程可继续扩展。AI模型RSTDeepSeek-V4-ProQwen3.54 个信源在谈事件专题推荐理由:想低成本造高质量长任务数据?RST用递归验证把成本压到5分钱一个,还让模型成绩涨了10分,值得看看。原文稍后读已读值得跟进有用关注 RST
12:14官方账号arXiv cs.AI@Yijun Lu, Rui Ye, Jiajun Wang, Yuwen Du, Tian Jin, Songhua Liu, Siheng ChenABSeeker基于Qwen3.5-4B,仅用8500个示例训练,在BrowseComp上达到37.3%,在BrowseComp-ZH上达到39.1%。加入上下文管理后,成绩分别提升至55.3%和52.9%,超过同规模4B智能体,并赶上约30B参数的更大模型。其核心是ABC框架,通过答案回溯恢复线索,再将搜索每一步与线索比对,生成细粒度步骤级奖励。论文ABSeekerQwen3.5BrowseComp推荐理由:它用答案倒推给搜索智能体每一步打分,4B模型在BrowseComp上拼到55.3%,能对标30B模型,值得看方法。原文稍后读已读值得跟进有用关注 ABSeeker
11:52官方账号arXiv cs.AI@Simone Giano, Lorenzo Severini, Alessandro Galdelli, Adriano Mancini该论文针对灾难管理场景的视觉语言模型数据需求,从仅含图像的Incidents1M数据集中恢复了10万张图像,并使用Qwen3.5-4B和Qwen3.5-35B-MoE两种架构生成文本描述。为验证描述可靠性,作者提出图像不可见的LLM-as-a-Judge流水线,用Qwen3.5-9B模拟无数据蒸馏中学生的模态差距。在173,179个标签对上的评估显示,两种架构的语义一致性得分78.65/100,自动评估发现高精确率(77.6%)和低召回率(46.0%)的保守描述行为。该工作提供了可扩展的LLM验证多模态数据集,并揭示了原始标注中的人类不一致性。论文TheiaIncidents1MQwen3.5推荐理由:想把纯图片的Incidents1M变成图文对?这篇用Qwen3.5做生成和验证,10万条描述加自动打分,干活靠谱。原文稍后读已读值得跟进有用关注 Theia
00:29berryxia@berryxia81°Microsoft 发布了基于 Qwen3.5 架构的 27B 参数电脑操作 Agent Fara1.5-27B。它能看图像、读文字,像人一样控制电脑,支持浏览网页、填表单、从截图提取数据等任务。27B 的规模适合本地部署与自托管,门槛较低。该模型开源,让中等参数量的模型也能可靠完成真实网页自动化。AI模型Fara1.5-27BMicrosoftQwen3.51 个信源在谈事件专题推荐理由:微软开源了27B的电脑操作Agent Fara1.5-27B,能控制电脑做网页自动化,本地就能跑,RPA可以退了。原文稍后读已读值得跟进有用关注 Fara1.5-27B
11:32官方账号arXiv cs.AI@Yijun Liang, Yunjie Tian, Yijiang Li, Yuqi Jia, Furong Huang, Tianyi Zhou, Di FuVCSD提出一种新的自蒸馏方法,通过对比原始图像和内容擦除控制的token级log概率差异来生成蒸馏信号。在ViRL39K数据集上,基于Qwen3-VL的实验显示,2B模型七基准聚合从62.27%提升至67.04%,4B从71.30%提升至73.16%,8B从72.51%提升至76.26%。VCSD无需外部教师、特权答案或视觉证据信号,且不增加推理开销。论文VCSDQwen3-VLQwen3.51 个信源在谈事件专题推荐理由:这篇论文提出了VCSD,不需要外部老师就能让多模态模型自己教自己,在Qwen3-VL上几个规模都涨了4-5个点,而且不增加推理成本。原文稍后读已读值得跟进有用关注 VCSD
09:56官方一手arXiv: DeepSeek@Yanyu Chen, Yue Li, Yongyi Cui, Dongsheng Shi, Lichang DaiSelectBench是一个控制性基准和训练集,用于大语言模型选择性采纳检索结果中的证据。基于Qwen3.5-4B,使用DAPO强化学习方法,通过确定性规则奖励或语义法官进行后训练。在325样本的SelectBench-v2测试集上,严格成功率从原始检查点的22.46%提升至DAPO-Rule的25.54%和DAPO-DeepSeek的26.46%。两种策略均减少了禁止内容采纳,生成了更短更聚焦的回答,但提示注入跟随能力未改善。在MMLU和干净HotpotQA上未见明显退化,表明通用能力保持。论文SelectBenchDAPOQwen3.51 个信源在谈事件专题推荐理由:Qwen3.5用强化学习学会在污染检索中挑有用证据,成功率从22%提到26%,还不掉通用分。原文稍后读已读值得跟进有用关注 SelectBench
23:01IT之家(博客/媒体)巴西IplanRIO发布的Rio-3.5-Open-397B模型在多个基准测试取得SOTA,被奉为拉美开源新势力。上海创智学院Nex团队指控该模型套壳阿里千问Qwen3.5和Nex N2 Pro的权重,并展示证据:无系统提示时模型自称“Nex N2 Pro”且提及“上海创智学院”。IplanRIO在Hugging Face致歉,称因操作失误上传了合并基线版本,承诺后续重新上传正式版。行业Rio-3.5-Open-397BQwen3.5Nex N2 Pro1 个信源在谈事件专题推荐理由:巴西公司号称自研的黑马模型,结果是个套壳缝合怪,被扒得底裤都不剩。看看证据有多实锤。原文稍后读已读值得跟进有用关注 Rio-3.5-Open-397B
03:05官方账号阿里通义 Qwen@Alibaba_Qwen76°阿里 Qwen 团队联合多家合作伙伴,在 TokenSpeed 推理引擎上对 Qwen3.5 模型进行极致优化,实现了 580 tokens/秒的推理速度,创下智能体工作负载的新纪录。该成果得益于 NVIDIA GPU、FlashAttention-4 优化以及 PyTorch 社区的支持。这一里程碑展示了开源大模型在推理性能上的巨大潜力,尤其适合对延迟敏感的智能体应用场景。PyTorch 官方博客已发布完整技术细节。AI模型Qwen3.5推理优化TokenSpeed推荐理由:580 tps 意味着智能体应用可以几乎实时响应,做 LLM 推理优化或 Agent 开发的团队值得关注这个开源方案,可以直接参考 PyTorch 博客里的实现细节。原文稍后读已读值得跟进有用关注 Qwen3.5
10:42IT之家(博客/媒体)78°微软研究院推出 Fara1.5 系列浏览器 AI 智能体模型,包含 4B、9B 和 27B 三个参数版本。该模型通过读取浏览器截图并输出鼠标键盘操作来完成网页任务,采用“观察—思考—行动”循环。在 Online-Mind2Web 基准测试中,Fara1.5-27B 以 72% 的任务成功率超越 OpenAI Operator(58.3%)和 Gemini 2.5 Computer Use(57.3%)。模型基于 Qwen3.5 微调,使用约 200 万条样本训练,并在安全方面设计了主动询问机制。配套的 MagenticLite 沙盒浏览器提供了安全边界。AI模型微软Fara1.5浏览器智能体10 个信源在谈事件专题推荐理由:做浏览器自动化或网页智能体的开发者终于有了一个开源可用的强基线——Fara1.5 在多项基准上碾压 OpenAI Operator,且附带安全机制,建议直接下载试试。原文稍后读已读值得跟进有用关注 微软