09:25官方账号arXiv cs.AI@Weiming Li, Helen Paik, Yulei Sui现代GUI代理框架使用前沿API模型实现强大的桌面任务性能,但持续的控制系统信息通常隐含在增长的交互轨迹中。使用Qwen3.5-9B替换GPT-5将OSWorld SR-100的平均值从60.9%降低到37.7%。LocalLSTC通过时间范围组织控制,维护跨步骤的持续状态来指导短期执行承诺。使用Qwen3.6-27B,LocalLSTC在OSWorld上达到64.7%的SR-100,在WindowsAgentArena上达到65.3%,优于两个基准测试上的先前本地结果。论文LocalLSTC长期短期控制GUI代理推荐理由:LocalLSTC通过时间组织控制信息,显著提升了本地GUI代理的性能,值得研究。原文稍后读已读值得跟进有用关注 LocalLSTC
20:25官方账号阿里通义 Qwen@Alibaba_Qwen精选阿里Qwen团队在X平台回应称,Qwen3.6-27B在智能体编码任务中表现强劲。团队确认下一代Qwen3.8-27B将带来更好性能,但未透露具体发布时间。该消息引发社区关注,原推文获得579次点赞和3.2万次浏览。AI模型Qwen3.6-27BQwen3.8-27BAlibaba推荐理由:阿里官方确认Qwen3.8-27B要来了,说会比3.6更强,做智能体编码的可以蹲一波。原文稍后读已读值得跟进有用关注 Qwen3.6-27B
11:25官方一手arXiv: DeepSeek@Devin Pereira, Willem Zuidema精选论文研究Transformer在河内塔规划任务中的表现,发现小型自训练模型能涌现出线性可解码的几何世界模型(谢尔宾斯基三角),该模型与解题存在因果关联。对Qwen3.6-27B和DeepSeek-R1-Distill-Qwen-32B两个前沿推理模型的分析显示,它们能在提示末尾近乎完美地编码该世界模型,但圆环数超过3个时仍会在多数任务上失败。探针实验表明失败源于规划过程中世界模型表征的衰减,而非缺失。在推理时注入提示阶段的表征可部分恢复性能。论文Qwen3.6-27BDeepSeek-R1-Distill-Qwen-32B世界模型推荐理由:这篇论文说推理模型其实能建出世界模型,但解题中途就弄丢了。它用小模型和可解释性方法把问题定位得很清楚,还给出了补救办法。原文稍后读已读值得跟进有用关注 Qwen3.6-27B
09:54官方一手pandaily@contact@pandaily.com (Pandaily)清华团队开源VeriLoop Coder-E1,基于Qwen3.6-27B模型。模型在SWE-bench Verified获得85.20分,SWE-bench Pro为62.38分,Terminal-Bench 2.0达76.40分,DeepSWE为33.63分。该模型采用窄领域PEFT和Self-Harness技术,实现仓库级代码修复的可验证递归自改进。AI模型VeriLoop Coder-E1Qwen3.6-27B开源模型推荐理由:清华开源了个能自己改代码的模型VeriLoop Coder-E1,SWE-bench拿85.2分,比很多大模型都强,想搞代码修复的可以试试。原文稍后读已读值得跟进有用关注 VeriLoop Coder-E1
11:29官方账号arXiv cs.LG@Yihao Chen, Shi Chang, Khaled Chawa, Feng Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan论文提出 MindForge 自动流程,将开源命令行程序转为仅暴露编译后可执行文件和文档的源码无关环境。用 GLM-5.2 作为教师智能体生成高质量程序合成轨迹,微调 Qwen3.6-27B。微调后模型在 ProgramBench 上平均测试通过率从 37.98% 提升至 49.51%,并在 7 个未见基准上均获提升,如在 RepoZero-C2Rust 上绝对增益 31.00 分、SWE-bench Verified 上 5.04 分。论文MindForgeProgramBenchGLM-5.2推荐理由:MindForge 教小模型从零写完整软件,不用源码只用可执行文件和文档就把 Qwen3.6-27B 在 ProgramBench 上提升了 11.53%,跟大模型差不多。原文稍后读已读值得跟进有用关注 MindForge
11:48小互@imxiaohuPrismML 基于 Qwen3.6-27B 模型,将原本 54GB 的 27B 参数模型压缩至 3.9–5.9GB,使其能在 iPhone 上运行。在 15 项测试中,5.9GB 的 Ternary 版本保留原版 95% 性能,3.9GB 的 1-bit 版本保留 90% 性能。在 RTX 5090 上推理速度达 163 token/s,在苹果 M5 Max 上达 87 token/s。AI模型Qwen3.6-27BPrismMLiPhone推荐理由:PrismML 把 27B 大模型压到几 GB 还能在手机上跑,性能几乎没缩水,iPhone 用户也能本地跑大模型了。原文稍后读已读值得跟进有用关注 Qwen3.6-27B
07:00官方一手marktechpost@Asif RazzaqPrismML 推出了 Bonsai 27B,这是对 Qwen3.6-27B 进行低比特量化得到的模型,不修改原架构。三元版本使用 {−1, 0, +1} 权重,每个参数仅 1.71 bits,理想大小 5.9GB。1-bit 版本采用二进制 {−1, +1} 权重。两个版本均以 Apache 2.0 许可开源,可在笔记本和手机上本地运行。AI模型PrismMLBonsai 27BQwen3.6-27B推荐理由:PrismML 把 Qwen3.6-27B 压到 5.9GB,手机都能本地跑,还全开源,适合离线使用。原文稍后读已读值得跟进有用关注 PrismML
17:09Stanford AI Lab@StanfordAILab71°斯坦福AI实验室提出TRACE自我改进方法,智能体通过识别自身失败背后的缺失能力并进行针对性训练来提升。TRACE训练的Qwen3.6-27B在SWE-bench Verified上达到73.2%,超过Codex 5.2和GLM 5等更大模型,同时以少于1/4的训练rollout击败GRPO和GEPA。该工作已在ICML AIWILD获得Spotlight论文。AI模型TRACEQwen3.6-27BSWE-bench Verified推荐理由:斯坦福AI Lab搞了个新方法TRACE,让AI自己找短板补课。只用四分之一训练量就超过了GRPO和GEPA,还赢了大模型Codex 5.2和GLM 5。原文稍后读已读值得跟进有用关注 TRACE
03:01AK@_akhaliq精选bottlecapai 基于 Qwen3.6-27B 微调推出 ThinkingCap-Qwen3.6-27B 模型,平均推理 token 减少 50%,最佳案例减少 90% 以上。该模型通过先进微调算法在多个领域和难度的问题集上训练。AI模型ThinkingCap-Qwen3.6-27BQwen3.6-27Bbottlecapai推荐理由:bottlecapai 用 Qwen3.6-27B 微调的新模型能省一半推理 token,最快省九成,适合低成本推理场景。原文稍后读已读值得跟进有用关注 ThinkingCap-Qwen3.6-27B
14:52Paul Couvert@itsPaulAi精选Paul推荐了5款可在笔记本上运行的本地模型,无需$10k Mac Studio。Qwen3.6-27B被认为是最佳编程智能体模型,Qwen3.6-35B-A3B是更快选项。Gemma 4 12B适合日常问答,Parakeet 0.6B v3是语音转文本最佳模型。Gemma 4 E4B可离线在手机运行,Gemma 4 26B diffusion在本地模型中Token/秒最高。建议使用Unsloth量化版搭配LM Studio或llama.cpp运行。技巧Qwen3.6-27BGemma 4Parakeet1 个信源在谈事件专题推荐理由:Paul整理了5款能塞进笔记本的本地模型,从编程到语音全覆盖,帮你省掉高价工作站的钱。原文稍后读已读值得跟进有用关注 Qwen3.6-27B
00:25官方账号Simon Willison’s Weblog(博客/媒体)Georgi Gerganov 在 Hacker News 评论中分享,过去一个半月他几乎每天都用 Qwen3.6-27B 模型处理编码任务,运行在 M2 Ultra 或 RTX 5090 上。他使用轻量级 pi agent(pi -nc --offline)搭配简短系统提示来适配个人编程风格。虽然主要用于 ggml-org 的琐碎维护任务,但认为该模型是高效的辅助工具。技巧Qwen3.6-27BGeorgi Gerganovpi推荐理由:Georgi Gerganov 亲测 Qwen3.6-27B 配合 pi agent,日常编程完全够用,本地运行无压力。原文稍后读已读值得跟进有用关注 Qwen3.6-27B
06:49官方账号Clement Delangue@ClementDelangue精选llama.cpp 新增 MTP(Multi-Token Prediction)支持,使本地模型推理速度大幅提升。在 A10G 上测试 Qwen3.6-27B 模型,生成速度从 25 tok/s 提升至 45 tok/s,增幅达 78%。这一优化让本地模型具备了作为日常驱动力的实用性,对本地部署和隐私敏感场景意义重大。开发者可直接在 llama.cpp 中启用 MTP 功能,体验更流畅的本地推理。AI模型llama.cppMTP/多令牌预测本地推理推荐理由:本地模型速度翻倍,做本地部署的开发者终于可以告别卡顿,建议直接试试 MTP 支持。原文稍后读已读值得跟进有用关注 llama.cpp