12:56AK@_akhaliq精选研究人员提出'Code as Worlds'方法,通过智能体发现可执行世界表示用于物理推理。该方法在物理推理基准测试中表现优异,能够模拟复杂物理环境。论文已在Hugging Face平台发布,编号为2608.27。论文Code as Worlds物理推理可执行世界表示推荐理由:新论文提出用代码表示物理世界的方法,让AI能像模拟环境一样进行物理推理。原文稍后读已读值得跟进有用关注 Code as Worlds
09:41官方一手marktechpost@Michal Sutter精选Code-as-World系统能从真实视频中恢复可编辑的MuJoCo场景代码。该系统使用验证后的世界来训练物理推理能力。这种方法将视频内容转化为可执行物理程序,实现了虚拟与现实的结合。研究人员通过这种方法创建了可交互的物理环境。AI模型Code-as-WorldMuJoCo物理推理推荐理由:MIT新系统把视频转成可编辑的物理程序,能训练AI理解真实世界物理规律。原文稍后读已读值得跟进有用关注 Code-as-World
12:18官方账号arXiv cs.AI@Han-Jun Ko, Jr-Jen Chen, Haobo Yuan, Hsin-Ying Lee, Tiancheng Shen, Ming-Hsuan Yang, Yu-Chiang Frank WangVAORA (Visual Action Outcome Reasoning Alignment) 提出两种互补奖励:Visual Alignment Reward 将 VLM 推理锚定到视觉上下文,独立于智能体动作;Visual-Action Alignment Reward 将推理与动作引起的视觉结果对齐。该方法在 PHYRE 和 Virtual Tool 基准上,针对未见任务和未见环境设置提升性能,抑制幻觉链式推理并缩小推理与行为差距。实验表明,VAORA 能诱导基于视觉的、可泛化的物理智能。AI模型VAORA视觉语言模型物理推理推荐理由:VAORA 用一个巧妙的奖励设计,让 VLM 在物理推理中不再瞎想,在 PHYRE 和 Virtual Tool 上泛化能力更好。原文稍后读已读值得跟进有用关注 VAORA
08:00Sundar Pichai@sundarpichai83°Google CEO Sundar Pichai 宣布推出 Gemini Omni,这是一个不仅能生成逼真场景,还能推理下一步该发生什么的视频生成模型。它结合了物理直觉与 Gemini 对历史、科学和文化背景的知识,使生成的视频更具逻辑性和上下文相关性。该功能今日起面向全球 Google AI Plus、Pro 和 Ultra 订阅用户,通过 Gemini 应用、Google Flow 以及 YouTube Shorts 逐步开放。这一进展标志着 AI 视频生成从“看起来真实”向“理解并预测动态”迈出了重要一步。AI产品Gemini Omni视频生成物理推理推荐理由:做视频生成或 AI 内容创作的团队,终于有了一个能理解物理规律和文化背景的模型——生成的视频不再只是视觉逼真,而是逻辑连贯。建议订阅 Google AI 的用户立即体验。原文稍后读已读值得跟进有用关注 Gemini Omni
08:18berryxia@berryxia76°Google 发布 Gemini Omni,一种不仅能生成逼真视频,还能基于物理直觉和知识推理场景后续发展的 AI 模型。它将物理直观与历史、科学、文化背景知识结合,使生成内容更符合现实逻辑。该模型即日起面向全球 Google AI Plus、Pro 和 Ultra 订阅用户推出,首批支持视频输出。这一进展标志着视频生成从单纯视觉真实迈向因果推理的新阶段。AI模型Gemini Omni视频生成物理推理推荐理由:做视频生成或物理模拟的开发者值得关注——Gemini Omni 把常识推理带进视频生成,让 AI 不再只是“画得好”,而是“想得对”。原文稍后读已读值得跟进有用关注 Gemini Omni