模型多源确认精选73°

阿里Qwen3.8-27B模型ARC-AGI评测结果

精选理由

阿里Qwen3.8-27B在ARC-AGI评测中表现亮眼,v1得分87.5%,成本仅0.22美元/任务。

阿里Qwen3.8-27B模型在ARC-AGI v2基准上得分为42.4%,每任务成本0.45美元。在ARC-AGI v1基准上得分为87.5%,每任务成本0.22美元。Qwen的聊天模板为低和高推理级别添加了指导,但未包含中级别指导。

原文 · ARC Prize

Qwen3.8-27B from @Alibaba_Qwen on ARC-AGI (Verified):

- ARC-AGI v2: 42.4%, $0.45/task - ARC-AGI v1: 87.5%, $0.22/task

Qwen's chat template adds guidance for low and xhigh reasoning, but not medium, which may explain why medium used more tokens yet scored below low. https://t.co/fD7Mg0DPWU