03:22Philipp Schmid@_philschmidGemini 3.8 Flash在@cursor_ai基准测试中取得了69.9%的成绩,每任务成本为2.38美元。该模型在性能与成本之间实现了平衡。测试结果显示其具有竞争力。AI模型GeminiCursor基准测试1 个信源在谈事件专题推荐理由:谷歌Gemini 3.8 Flash在Cursor测试中得分69.9%,每任务仅2.38美元,性价比突出。原文稍后读已读值得跟进有用关注 Gemini
01:42Firecrawl@firecrawl_devFireCrawl 公司开源了 DevDex 基准测试,用于评估搜索工具帮助编程代理找到正确源代码的可靠性。该基准测试专门针对编程代理的搜索需求设计。DevDex 基准测试已在 firecrawl.dev/benchmarks/dev 页面发布。AI模型DevDexFireCrawl编程代理推荐理由:FireCrawl 推出 DevDex 基准,帮你选对编程代理的搜索工具原文稍后读已读值得跟进有用关注 DevDex
12:46量子位@梦晨Claude最强Fable 5.1版本正式发布,在8项基准测试中取得领先成绩。该版本引入反蒸馏机制,最高降价达45%。新版本能够处理更复杂的任务,尤其在困难任务完成度上有显著提升。AI模型ClaudeFable反蒸馏推荐理由:Claude发布了Fable 5.1,8项基准测试领先,降价45%,还加入了反蒸馏机制。原文稍后读已读值得跟进有用关注 Claude
10:40官方账号arXiv cs.AI@Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu, Jiahao Meng, Han Chen, Ziyu Wang, Hongyang Du研究团队推出TempCloze基准测试,包含1521个视频片段,评估Video-LLMs的时间推理能力。测试要求模型从四个选项中识别出视频中间缺失的部分。研究发现Alignment维度是主要瓶颈,模型能识别语义内容和事件进展,但难以把握时间对齐。研究团队对10个专有和21个开源Video-LLMs进行了评估。论文Video-LLMsTempCloze时间推理推荐理由:新基准测试揭示视频大模型在时间对齐上的短板,比语义理解更弱。原文稍后读已读值得跟进有用关注 Video-LLMs
10:11官方账号arXiv cs.LG@Yiming Huang, Ziche Liu, Zhuohang Wu, Yiqian Wang, Junxia Cui, Xinkai Zou, Linjun Mao, Nan Huang, Naicheng Yu, Kaijie Zhu, Yue Ma, Kun Zhou, Letian Peng, Jingbo Shang精选73°研究团队推出SCILAWS-BENCH基准,包含118个问题,源自381篇科学论文,覆盖291个候选定律和约800万真实数据点。该基准包含SCILAWS-REAL和SCILAWS-PARALLEL两种设置,分别评估模型从固定观测中提出定律和主动查询世界以恢复隐藏定律的能力。研究发现预测拟合度可能与科学有效性存在差异,模型记忆能力影响其能否再现或超越已发表公式。论文SCILAWS-BENCHLLMs科学发现推荐理由:研究人员发布科学定律发现基准SCILAWS-BENCH,包含真实数据和合成世界两种测试场景,评估LLM科学发现能力。原文稍后读已读值得跟进有用关注 SCILAWS-BENCH
09:39官方账号arXiv cs.AI@Noor Abo Mokh, Kirill Chirkunov, Teresa Lynn, Nizar Habash, Reham Marzouk, Malik H. Altakrori, Younes Samih, Muhammed Abu Odeh, Nour Rabih, Rahaf Alshahrani, Hamad Alshehhi, Hamdan Al-Ali, Muhra Almahri, Besher Hassan, Mohamed Anwar, Abed Alhakim Freihat, Preslav Nakov, Alham Fikri AjiEDRAC是首个大规模阿拉伯方言机器阅读理解和生成式问答基准,涵盖埃及、摩洛哥、阿联酋、叙利亚和沙特五种主要方言。该基准包含499段自然对话语料和4977个问答对,采用人机协作流程生成。研究显示,现有模型在语义答案质量和方言保真度间存在显著差距。论文EDRAC阿拉伯方言阅读理解推荐理由:阿拉伯方言NLP研究者必看,首个覆盖五大方言的阅读理解基准,揭示现有模型局限。原文稍后读已读值得跟进有用关注 EDRAC
09:37官方账号arXiv cs.AI@Leonardo Ranaldi, Sherrie Shen, Jushi Kai, Alexandra BirchWorldBench是一个包含1600个任务的多语言基准测试,覆盖7种语言和8种文化。该基准测试通过结构化动作让智能体在沙盒环境中执行日常任务。研究显示前沿模型仅达到49.2%的约束任务成功率(CTS),所有模型在正确性和环境保持方面存在显著差距。论文WorldBench多语言智能体基准测试推荐理由:研究人员发布WorldBench基准,测试多语言智能体在真实场景中的表现,发现当前模型在长周期任务中表现脆弱。原文稍后读已读值得跟进有用关注 WorldBench
06:29官方一手Hugging Face: Blog(博客/媒体)BenchMIRT研究揭示了当前LLM基准测试的局限性。该研究分析了多个基准测试,包括MMLU、HellaSwag和TruthfulQA。研究发现这些基准可能无法全面评估模型的真实能力。研究团队提出了改进基准测试的建议。论文BenchMIRTLLM基准测试1 个信源在谈事件专题推荐理由:BenchMIRT研究告诉你,现在流行的LLM基准测试到底在测什么,有什么局限性。原文稍后读已读值得跟进有用关注 BenchMIRT
02:46mem0@mem0ai当前模型竞赛差距极小,1%的性能差异难以决定胜负。在实际应用中,能够持续工作的智能体比基准测试中高出2%但会遗忘会话内容的智能体表现更好。持久性智能体能够记住上下文,避免重复提问,提升用户体验。AI模型智能体模型竞赛持久性推荐理由:模型性能差距微小,持久性智能体比短期表现更优,实际应用中更实用。原文稍后读已读值得跟进有用关注 智能体
12:12官方账号arXiv cs.LG@Ahmed El Kady, Aravind Narayanan, Rehana Noorani, Yani Ioannou, Shaina Raza研究团队对三种密集型和混合专家模型在BBQ和BBQ-V基准上进行了七种条件测试。INT4量化导致较大变化,而INT8基本保持质量但能耗增加1.79-4.26倍。减少基准测试提供最一致的节省,但极小子集对保留项目更敏感。论文BBQBBQ-VAI评估推荐理由:Vector Institute研究团队发现高效AI评估可能改变基准结论,不同优化方式对结果影响各异。原文稍后读已读值得跟进有用关注 BBQ
11:19官方账号arXiv cs.AI@Siqi Zeng, Andre N. Assis, Rowan Wang精选73°研究团队评估了LLM回答自身行为问题的能力,引入了可验证行为问题的基准测试。当前模型展现出非平凡但有限的自我建模技能,在关于自身行为的简单反事实问题上存在系统性错误。研究团队开发了可扩展的合成数据管道生成自我建模训练数据,并通过强化学习提升了三个开源模型家族的总体自我建模技能,部分技能可迁移到保留任务上。论文LLMself-modeling强化学习推荐理由:研究者提出LLM自我建模评估基准,用合成数据提升模型自我认知能力,但不构成真正的内省。原文稍后读已读值得跟进有用关注 LLM
08:15lmarena.ai@lmarena_aiAgent Arena 排行榜现已上线,提供各类 AI 智能体的性能对比。排行榜包含多个基准测试指标,帮助用户了解不同智能体的表现差异。目前已有 928 人查看了该排行榜。AI产品Agent Arena智能体排行榜推荐理由:Agent Arena 发布了智能体排行榜,能直观对比各 AI 智能体性能,比传统评测更直观。原文稍后读已读值得跟进有用关注 Agent Arena
09:35官方账号arXiv cs.AI@Qing Ye, Meng-Hsuan Lin研究人员在评估25个手工精选主张的代理基准测试中发现,一个模型通过保真度检查却从未打开数据表。该模型在结构化输出约束下禁用了工具使用,但仍编造源文本回答。研究团队记录了37个主张的所有工具调用,构建了基于规则的故障归因分类器和静默故障检测器。检测器在207个干净提取中无误报,成功恢复50个植入故障。物理测量验证仅能验证37个主张中的2个。论文Agentic数据表提取保真度推荐理由:OpenAI团队发现保真度检查有漏洞,新工具检测能揪出编造答案的模型,比传统方法更可靠。原文稍后读已读值得跟进有用关注 Agentic
09:34官方账号arXiv cs.AI@Yupei Liu, Yuqi Jia, Neil Zhenqiang Gong, Jinyuan Jia精选73°LongPIBench是首个针对长上下文的提示注入攻击基准,涵盖论文评审、简历筛选、代码审查和邮件摘要4个场景。该基准包含合成数据集和真实数据集,上下文长度从数千到数万token不等。评估结果显示,即使在长上下文场景下,简单的启发式提示注入攻击仍能取得高成功率,并经常绕过最先进的防御措施。论文LongPIBench提示注入长上下文推荐理由:研究人员发布LongPIBench基准,测试了长上下文场景下的提示注入防御效果,发现现有防御存在显著漏洞。原文稍后读已读值得跟进有用关注 LongPIBench
09:32官方账号arXiv cs.AI@Jason Armitage, Ioannis Tsochantaridis, Linda Mazzone, Chuqiao Yan, Srini Narayanan, Sarah EblingMAP是首个评估多模态AI系统辅助无障碍需求用户规划实地访问的基准。该基准包含两项新颖评估:无障碍规划主张验证,评估系统对场所信息和无障碍功能信息的支持能力;无障碍规划视觉证据检索,检查系统能否为请求的场所和无障碍功能选择视觉证据。MAP采用自动评分和部分人工评分相结合的方法,支持在场所信息和无障碍信息随时间变化的环境下比较AI系统性能。论文MAP多模态无障碍规划推荐理由:MAP基准测试首次评估AI系统如何帮助有无障碍需求的用户规划实地访问,包含主张验证和视觉证据检索两项创新评估。原文稍后读已读值得跟进有用关注 MAP
13:49AI Will@FinanceYF5Qwen3.8-27B 是一个拥有 270 亿参数的开源模型,在笔记本上也能流畅运行。该模型在多个基准测试中表现出色,性能接近更大规模的模型。用户分享了 10 个实际应用案例,展示了其在各种场景下的实用能力。模型的高效表现让用户感到惊讶,重新定义了对小参数模型的期待。AI模型Qwen3.8-27B开源模型参数效率推荐理由:阿里发布的 Qwen3.8-27B 虽参数量不大,但在笔记本就能跑出惊艳效果,10个案例展示实际能力。原文稍后读已读值得跟进有用关注 Qwen3.8-27B
03:37techcrunch@Russell BrandomAnthropic研究员展示了自动系统在10个特定行为基准上的表现。这些系统能够在每个基准上改进性能而不会降低整体性能。研究团队测试了针对不协调行为的特定基准。AI模型Anthropic自我改进AI基准测试4 个信源在谈事件专题推荐理由:Anthropic研究员展示了AI如何自我改进,在10个基准上都提升了表现。原文稍后读已读值得跟进有用关注 Anthropic
22:11lmarena.ai@lmarena_ai精选Agent Arena使用因果追踪技术评估模型在现实世界长期任务上的表现。该基准测试显示模型相对于平均模型的净改进程度。用户可访问arena.ai/leaderboard查看整体排行榜,并按代码、聊天和工作类别进行筛选。AI模型Agent Arena因果追踪基准测试推荐理由:Agent Arena上线新基准,用因果追踪测模型在长期任务中的真实表现,还能按类别筛选对比。原文稍后读已读值得跟进有用关注 Agent Arena
18:07官方账号arXiv cs.AI@Dewu Zheng, Yanlin Wang, Xiwen Wang, Kefeng Duan, Hongyu Zhang, Xilin Liu, Yuchi Ma, Zibin Zheng精选73°MCR-Bench是首个缺陷状态感知的多轮代码审查基准,覆盖5种编程语言,包含2269个真实世界多轮代码审查任务。实验显示主流大模型在缺陷检测和生命周期状态跟踪方面能力有限,随着交互轮次增加性能显著下降。模型在不同缺陷类型和严重程度上表现差异大,语义复杂或低显著性缺陷更易被遗漏。论文MCR-Bench代码审查LLM推荐理由:MCR-Bench揭示了当前LLM在真实代码审查中的不足,特别是跨轮次时间对齐和长程记忆问题。原文稍后读已读值得跟进有用关注 MCR-Bench
17:22官方账号arXiv cs.AI@Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević, Shiyang Li, Yifan Zhou, Bin Fu, Wenlong Zhang, Junjun He, Yu Qiao, Yihao Liu, Jingbo Xing, Xi Chen精选73°PAWBench基准测试评估了11个当前视频生成系统在50个场景下的表现。研究发现,没有模型能够同时匹配参考概率并恢复有效行为范围。该研究引入了概率对齐概念,将世界模型定义为可能行为的分布采样器。PAWEval协议将重复视频展开转换为可能物理行为的经验分布。论文PAWBench视频生成世界模型推荐理由:PAWBench首次系统评估视频生成模型作为世界模型的概率对齐能力,揭示了当前模型与理想状态间的差距。原文稍后读已读值得跟进有用关注 PAWBench
16:18shao__meng@shao__meng72°RSI-Exam量化RSI基准,测试智能体通过自主实验改进方法,覆盖6大领域88项任务,Claude和GPT表现突出,仍有改进空间。AI模型RSI-Exam智能体基准测试推荐理由:RSI-Exam测试了LLM自演化能力,Claude和GPT表现优异,值得一看。原文稍后读已读值得跟进有用关注 RSI-Exam
10:26官方账号arXiv cs.AI@Yutong Chen, Guangfu Guo, Zhichao Xu, Kunpeng LiuDualOPSD是一种不对称交替框架,自适应学生模型和教师模型。在Qwen3-8B上,DualOPSD在AIME 2024、AIME 2025和HMMT 2025上分别比OPSD提升了23.61、13.89和10.00个avg@12点。模型规模越大,准确率提升越明显。所有规模下,DualOPSD都减少了截断,4B规模下的诊断结果还显示教师和学生之间的KL散度更低。论文自蒸馏模型优化性能提升推荐理由:DualOPSD在模型规模和性能上都有显著提升,是自蒸馏领域的一个新突破。与OPSD相比,DualOPSD在多个基准测试中取得了更好的成绩,值得关注。原文稍后读已读值得跟进有用关注 自蒸馏
09:24官方一手arXiv: DeepSeek@Dung Le Quang, Dong Cao Van, Nam Le Hai, Linh Ngo Van, Anh M. T. Bui, Phuong T. NguyenXREPOTEST是一个针对大型语言模型的多语言仓库级单元测试生成基准测试,涵盖Rust、Go、Julia、PHP和Ruby五种语言。它使用容器化执行框架和多种上下文增强策略,包括文件级、基于LSP和基于检索的上下文。实验结果表明,独立测试和仓库级测试之间存在显著差距,并揭示了更丰富的上下文和测试可靠性之间的权衡。论文XREPOTEST单元测试生成大型语言模型推荐理由:XREPOTEST提供了针对大型语言模型单元测试生成的挑战性基准,揭示了不同模型在不同上下文下的表现差异,值得研究。原文稍后读已读值得跟进有用关注 XREPOTEST
04:07elvis@omarsar0精选DAIR.AI提出一种新的递归自我改进方法,通过元操作递归和动态深度搜索,在所有八个基准测试中优于现有自我改进智能体。该方法在ARC-AGI-2基准上表现出色,是唯一得分超过零的方法。论文DAIR.AI递归自我改进基准测试推荐理由:DAIR.AI提出一种新颖的递归自我改进方法,在多个基准测试中表现出色,值得一读。原文稍后读已读值得跟进有用关注 DAIR.AI
00:43Jerry Liu@jerryjliu0精选@perplexity_ai 在Portable Computer版本中正确基准测试文档理解,使用ParseBench子集,涵盖表格、图表、布局、文本内容和格式。Portable Computer是一个本地优先的智能体,用于私有和成本效益的工作,27B模型在真实知识工作上得分82.6%,超过开源的Pi和Hermes。经过微调的PPLX 27B达到85.4%AI模型@perplexity_ai文档理解Portable Computer3 个信源在谈事件专题推荐理由:@perplexity_ai 发布了Portable Computer,这是一个本地优先的智能体,在文档理解方面表现优异,比开源的Pi和Hermes更胜一筹,值得一试。原文稍后读已读值得跟进有用关注 @perplexity_ai
22:30techcrunch@Rebecca BellanZ.ai确认是Ox Alpha模型的背后AI实验室,该模型在基准测试和排行榜上领先,其权重即将发布。AI模型Ox Alpha模型Z.aiAI模型推荐理由:Z.ai揭秘了神秘的Ox Alpha模型,看看它如何领先其他模型!原文稍后读已读值得跟进有用关注 Ox Alpha模型
21:38官方账号阿里通义 Qwen@Alibaba_Qwen精选78°Qwen3.8-Flash-Next-Base参数量仅为6B,在14项基准测试中领先8项,包括MMLU-Pro、SuperGPQA等,与Qwen3.7-Plus-Base在剩余测试中保持竞争力。其51B N-gram嵌入参数使用确定性查找,不增加每词矩阵乘法成本。AI模型Qwen3.8-Flash-Next-Base基准测试参数量推荐理由:阿里巴巴Qwen3.8-Flash-Next-Base模型参数少,性能强,是MMLU-Pro等基准测试的领先者,值得一看。原文稍后读已读值得跟进有用关注 Qwen3.8-Flash-Next-Base
10:35Jerry Liu@jerryjliu0精选LlamaIndex发布文档提取基准测试,评估了多种系统,包括VLMs和LlamaParse,覆盖370个企业文档和67种文档类型。CTO和联合创始人Simon Suo将进行技术讲解,探讨提取难度、现有基准测试的不足以及成本与准确性的权衡。论文LlamaIndex文档提取基准测试推荐理由:LlamaIndex发布文档提取基准测试,全面评估多种系统,了解提取难度和成本与准确性的权衡,不容错过!原文稍后读已读值得跟进有用关注 LlamaIndex
07:53官方一手marktechpost@Asif RazzaqLiquid AI发布开源平台Pipette,用于在边缘设备上基准测试基础模型,与Artificial Analysis合作,独立验证方法。Pipette将设备上的行为作为评估标准,报告在服务器级、全精度条件下的模型卡片质量,这些数字很少能预测模型在手机上的表现。AI模型Liquid AIPipette基准测试推荐理由:Liquid AI发布了Pipette,这是一个开源的基准测试套件,可以综合评估设备模型、量化、运行时和硬件,对于想要了解模型在边缘设备上表现的人来说是个好工具。原文稍后读已读值得跟进有用关注 Liquid AI
03:59官方账号Perplexity@perplexity_ai模型、芯片或设备进步将不断改善本地能力,即将开放基准测试。AI模型Perplexity AI本地能力模型进步推荐理由:Perplexity AI 将开放基准测试,看看本地能力如何提升吧!原文稍后读已读值得跟进有用关注 Perplexity AI
23:18The Rundown AI@therundownai91°OpenAI发布其定制AI芯片Jalapeño的基准测试,性能比Nvidia GB200和GB300系统高1.9倍,响应速度提升3.6倍。芯片设计从开始到制造完成历时九个月,预计年底前在OpenAI数据中心运行。AI模型OpenAIJalapeño芯片AI芯片10 个信源在谈事件专题推荐理由:OpenAI发布Jalapeño芯片,性能大幅提升,值得一看!原文稍后读已读值得跟进有用关注 OpenAI
22:28techcrunch@Russell Brandom78°OpenAI的Jalapeño芯片在Semianalysis的InferenceX基准测试中,每用户处理的token数量和每千瓦时的吞吐量均超过现有最先进技术。AI模型OpenAIJalapeño芯片推理加速10 个信源在谈事件专题推荐理由:想了解OpenAI如何加速推理?Jalapeño芯片的表现值得关注。它比现有技术更快,值得一看。原文稍后读已读值得跟进有用关注 OpenAI
10:46官方账号arXiv cs.AI@Zhiqing Cui, Xinxiang Yin, Yihong Tang, Xinglang Zhang, Yuanzhe Hu, Siru Zhong, Weidong Tang, Yuxuan Liang, Weijia Li, Ming Jin, Shirui Pan, Yuhao Kang, Dingyi Zhuang, Jinhua ZhaoEarthVerse基准测试通过405个可复现任务评估科学智能体,基于199个记录事件和19种灾害类型。评估25个模型和智能体系统,平均答案单元准确率为84.65%,最高Strict@95为34.81%。测试显示当前智能体常在单个步骤完成,但缺乏跨证据、尺度、单元、计算和物理解释的一致性链。EarthVerse为测量动态地球系统中端到端科学可靠性提供可复现基础。论文EarthVerse科学智能体基准测试推荐理由:EarthVerse基准测试为评估科学智能体提供了全面的方法,揭示了当前智能体在跨证据和尺度上的不足,值得专业人士关注。原文稍后读已读值得跟进有用关注 EarthVerse
10:06官方账号arXiv cs.AI@Marek Hradil, Danae Sánchez Villegas视觉语言模型(VLMs)在视频和图像序列基准测试中表现出色,但它们是否捕捉到时间结构尚不清楚。我们提出时间定位作为异常检测问题,并引入TimeCatch,通过交换连续帧和用高斯噪声替换帧来创建时间异常和帧级异常。模型在四个合成和真实世界数据集上进行了异常检测和定位任务的评估,并与人类研究进行了比较。结果表明,VLMs在帧级异常检测中表现良好,但在时间异常检测中表现接近随机,在定位上仅略高于随机。人类在两项任务中都取得了接近天花板的表现。对模型规模、提示策略、序列长度和视觉相似度等方面的进一步分析表明,这些失败不能仅归因于感知或模型容量的限制。这些发现表明,当前的VLMs可以识别单个帧中的异常,但在整合跨帧信息以推理时间一致性方面存在困难。TimeCatch为评估视觉语言模型中的时间定位提供了一个受控的基准。论文视觉语言模型时间一致性异常检测推荐理由:这篇论文提出了TimeCatch,一个用于评估视觉语言模型时间一致性的基准,揭示了当前模型在时间异常检测上的不足,值得一读。原文稍后读已读值得跟进有用关注 视觉语言模型
01:37OpenRouter@OpenRouterAI探讨模型周期变化、基准测试局限性及AI应用潜力未达天花板时的情况。行业模型周期AI应用潜力行业趋势推荐理由:了解模型周期变化和AI应用潜力,洞察行业趋势。原文稍后读已读值得跟进有用关注 模型周期
22:43量子位@思邈中国公司提出AI科研评价新规则,实践数据在两项基准测试中位列第一,全球大厂开始关注。论文AI科研评价规则中国公司基准测试推荐理由:这篇论文提出了新的AI科研评价标准,数据表现优异,值得行业关注。原文稍后读已读值得跟进有用关注 AI科研评价规则
01:18elvis@omarsar0精选本文探讨了AI智能体当前存在的问题,如幻觉、成本效率低下等,提出了解决方案。通过将上下文获取视为主动推理,提出了一种名为“最优提问”的方法,并在25至300个候选者的二进制和多路任务上进行了基准测试。论文AI智能体最优提问上下文获取推荐理由:这篇论文提出了AI智能体上下文获取的新方法,值得一读。它通过最优提问,提高了智能体的性能和效率,与现有方法相比有显著不同。原文稍后读已读值得跟进有用关注 AI智能体
02:33Firecrawl@firecrawl_devFirecrawl基准测试发布,可从GitHub仓库自行运行。包含半数查询,剩余用于测试,防止训练。AI模型Firecrawl基准测试GitHub推荐理由:Firecrawl基准测试开放,自己动手测试一下,看看你的模型表现如何!原文稍后读已读值得跟进有用关注 Firecrawl
21:38官方账号NVIDIA AI@NVIDIAAINVIDIA AVO通用编码智能体在ARC-AGI-3推理基准测试中满分,完成183个级别,无需指令或规则自主决策。AI模型NVIDIAARC-AGI-3智能体3 个信源在谈事件专题推荐理由:NVIDIA的通用编码智能体ARC-AGI-3测试满分,展示了强大的自主推理能力,是AI领域的又一里程碑!原文稍后读已读值得跟进有用关注 NVIDIA
16:07官方一手pandaily@contact@pandaily.com (Pandaily)78°开源开发者新基准Qwen3.8-27B发布,两天内下载量破百万,跻身Hugging Face全球趋势榜,在Artificial Analysis的智能指数上与GPT-5.6 Luna和DeepSeek V4 Flash并列,昵称'本地Opus 4.6',将前沿能力压缩至27亿参数模型,4位量化后适配24GB GPU。新发布模型均以超越Qwen3.8-27B为标准。AI模型Qwen3.8-27B开源模型智能体3 个信源在谈事件专题推荐理由:开源开发者有了新基准,Qwen3.8-27B横扫消费级硬件,比肩GPT-5.6 Luna和DeepSeek V4 Flash,参数量27亿,4位量化后适配24GB GPU,超越它才是新标准!原文稍后读已读值得跟进有用关注 Qwen3.8-27B