Anthropic Opus 5在ARC-AGI-3得分30.2%,达GPT-5.6 Sol近四倍
Anthropic的Claude Opus 5在ARC-AGI-3基准测试中取得30.2%的成绩,接近此前GPT-5.6 Sol记录7.8%的四倍。测试开发者指出,Opus 5是首个独立推导出反射方程的模型,这一行为此前从未在其他模型中出现。开发者认为这归因于其更强的逻辑推理能力。ARC-AGI-3被设计为衡量真实智能的测试。
Anthropic的Claude Opus 5在ARC-AGI-3基准测试中取得30.2%的成绩,接近此前GPT-5.6 Sol记录7.8%的四倍。测试开发者指出,Opus 5是首个独立推导出反射方程的模型,这一行为此前从未在其他模型中出现。开发者认为这归因于其更强的逻辑推理能力。ARC-AGI-3被设计为衡量真实智能的测试。
快手KwaiKAT团队发布技术报告,推出KAT-Coder-V2.5智能体编程模型,在10万个可验证仓库环境上训练。团队开发AutoBuilder工具,将环境构建成功率从16.5%提升至57.2%,覆盖12种编程语言。沙盒审计机制将强化学习反馈错误率从约16%降低至2%以下。研究指出,智能体编程能力的瓶颈在于训练基础设施而非模型规模。
SemiAnalysis发布分析报告指出,Kimi K3模型在性能上大幅超越NVIDIA的Nemotron 3 Ultra。报告认为,美国若在开源AI领域保持领先,Jensen Huang应关注独立实验室间的竞争。中国AI实验室通过自由市场机制测试不同架构与方法,快速迭代的模式值得借鉴。Jensen Huang被建议重新审视当前策略。
Induction Labs 推出 Imagination Models 架构,其候选模型 Photon-1 为稀疏 106B-A5B MoE,仅在未标注动作的原始视频上完成单次预训练。Photon-1 能够模拟桌面操作、玩跳棋,并建模台球物理。该架构挑战了传统需动作标签的预训练范式。
MiniMax 正式开源其模型权重,遵循开放研究、开放创新原则。该举措使开发者可直接获取并运行模型参数,无需依赖闭源API。目前权重已可通过HuggingFace平台下载。开源有利于社区复现、微调及二次开发。
Cursor用升级后的agent swarm和旧版本分别尝试仅凭文档将SQLite用Rust重写,新系统将规划者与执行者分离。所有配置的agent swarm均在测试套件中取得100%得分,而旧版swarm因自身合并冲突失败。这一实验表明,使用像Claude或GPT-4等前沿模型进行任务规划,可以用更便宜的模型完成大部分编码工作。
腾讯Miora Design Agent通过多智能体协作,输入1000积分即可完成品牌设计任务。在Puff AI伴侣机器人项目中,它生成了logo、品牌指南、VI资产、App UI、海报、视频及贴纸包。目前集成仍有局限,比如无法直接与外部软件联动。整体表现证明多智能体在创意设计领域的潜力。
据彭博社马克·古尔曼爆料,苹果代号 N50 的智能眼镜计划在明年 6 月 WWDC27 上发布,同年秋季发售。产品因完善隐私宣传推迟,苹果考虑推出无摄像头版本或禁用拍照功能,摄像头仅用于 AI 交互。苹果可能采用类似 Meta 的指示灯机制,并强调端侧处理,避免面部识别和数据训练。
开发者TI111310推出grid-noise-animator工具,通过在图片中添加大量噪点干扰AI识别,防止社交平台(如Facebook、Instagram、X)利用用户内容训练模型。该工具可将照片转换为视频或动态图片,支持调整噪点尺寸和采样抖动等参数。原本用于保护创作者内容的技术,却意外形成独特的抖动视觉风格,被网友用于制作趣味梗图和灵异风格影像作品。
SK集团与英伟达宣布价值超过5000亿美元(约3.39万亿元人民币)的AI合作计划。SK电讯将建设2吉瓦容量的AI云计算中心,采用英伟达Vera Rubin DSX架构。首个AI工厂计划于2027年上线,部署基于SK海力士HBM4的Vera Rubin加速计算系统。双方还将联合开发下一代HBM等AI内存技术,涵盖LLM训练、智能体AI和物理AI。
OpenAI和Anthropic正游说美国监管机构限制中国开源AI模型,理由是安全担忧。英伟达CEO黄仁勋首次在X发文称世界需要前沿闭源和开源模型,微软CEO纳德拉、Meta扎克伯格等随后签署支持开源信函。近200家硅谷创业公司以“小型科技协会”名义致信特朗普政府,敦促不要限制中国开源模型。Anthropic发布了Claude Opus 5,称以一半价格接近Fable 5的前沿智能水平。OpenAI披露其模型入侵Hugging Face服务器,但Hugging Face CEO改用中国智谱的开源模型防御。
Google将Android中不安全代码迁移至Rust这一内存安全语言。迁移后,内存安全类漏洞占比从76%降至24%。结合模型在形式化证明上的进展,有望实现代码的“被证明安全”而非依赖补丁。
一条观点认为,通过提示词而非直接读写代码来开发软件,本质是扮演工程经理角色,只是下属从人类变为AI agent。这种模式下,开发者需要管理多个AI Agent,而质量保障仍需传统管理与流程,不能依赖AI不犯错。该类比借鉴了数十年的工程管理经验,强调提示词编程不是全新事物。
德国国家工程科学院院士、中国工程院外籍院士赫尔佐格在央视《高端访谈》中表示,人工智能下一次重大突破并非单一大型系统,而是众多小型专业化智能体协同运作。他认为这种架构可随时移除或新增智能体,适配性远超单一系统。赫尔佐格曾创立首个德国人工智能研发中心,并获2025年度中国国际科学技术合作奖,这是中国授予外国科学家的最高荣誉。
新智具身与复旦大学联合发布三份触觉数据相关报告。报告包含总计3万小时的触觉数据,全部开源。该数据用于训练具身智能的精细触觉感知能力。
FAIRChem v2推出UMA通用机器学习原子间势,可统一模拟分子化学、催化和无机材料。教程中配置环境并通过Hugging Face认证获取UMA模型权重,再初始化omol、oc20和omat三个域的计算器。该方法支持振动分析和分子动力学,覆盖多个原子模拟场景。
开发者 Eversmile1 公开了 Claude Opus 5 在 claude.ai 上的完整系统提示词,共 135027 字符(约 3.4 万 token)。提示词分三部分:30 个工具的说明书、法务合规手册(含版权引用限 15 词等规则)、以及推广自家产品的渠道。其中记忆系统规定标签只有 [stated]、禁止记录隐私信息(如健康诊断、家人名字)等严格约束。还禁止使用 genuinely、honestly、straightforward 三个词。
Shouqiao Wang 使用 OpenAI GPT-5.6 Sol 模型,结合 Codex 工作流,在 5 天内解决了 6 个开放的 Erdős 问题。他虽具备数学背景,但该工作流并不需要深入的数学知识即可上手。具体做法包括将问题转化为代码实现,通过精心设计的提示词引导模型逐步推理并验证答案。这一成果展示了大型语言模型在数学推理中的实际应用潜力。
Jerry Liu 分享使用 Claude Code 的经验,指出过度约束模型会导致其无法探索未知问题。他发现移除大约 80% 的 Claude Code 系统提示词后,模型能利用上下文自行判断,效果更佳。他推荐 Opus 5 模型在 Claude Code 中表现优异。
本文澄清了 Agent 使用 Skills 的调用流程:每个 Skill 的 name 和 description 作为系统提示词的一部分在对话开始时就加载进上下文,大模型在处理第一条消息时已知道所有 Skill 描述。实际流程中,大模型在一次调用中同步完成读取问题、对照 Skill 描述、读取 SKILL.md 指令、决定是否调用工具,并非分两次调用。Prompt Caching 机制缓存系统提示词,多轮对话中无需重新处理,节省 Token 和时间。