GPQA(Generative Pre-trained Question Answering)是一个专注于评估大语言模型在复杂多步推理任务上表现的数据集,尤其侧重于物理、化学、生物等科学领域的深度知识理解与逻辑推理能力,常被用作衡量模型专业领域智能的关键基准。随着大语言模型参数规模与能力的提升,GPQA的测试结果已成为业界评估模型是否具备“专家级”推理能力的重要参考。
№gpqa·product
GPQA
别名
- 首次出现
- 2026-05-22
- 最近出现
- 2026-09-03
- 累计提及
- 36
§ 01综述
§ 02相关报道10 条在档
- 01华为正式开源 openPangu-2.0-Pro:昇腾训练的 505B MoE 模型
- 02Moonshot AI 开源 Kimi-K3 多模态代理模型,2.8T 参数
- 03GRADE:门控路由与自适应深度实现高效多智能体推理
- 04OpenAI发布GPT-Live:全双工语音模型,可调用GPT-5.5实时生成UI
- 05OpenAI 发布 GPT-Live 全双工语音模型,可调用 GPT-5.5 并生成实时 UI
- 06英伟达发布 Audex 统一模型:30B 总参数,避免多模态扩展后文本能力下滑
- 07DemoPSD:分歧调节的策略自蒸馏
- 08Qwen3.6-27B-NVFP4发布,vLLM支持Blackwell GPU推理
- 09Theoria:基于非正式推理状态的改写接受性验证
- 10OpenRouter 持续运行开放权重模型基准测试并公布排名
§ 03邻近话题