09:46官方账号arXiv cs.AI@Kapil Wanaskar, Gaytri Jena, Aman Chadha, Vinija Jain, Vasu Sharma, Amitava DasFactorJEPA提出将世界结构作为预测原语,把未来编码分解为布局、实体和交互三个子空间,并设置可见性门控来保留局部可见的智能体。研究新增DENSEWORLD-115k数据集,包含22个城市的1000小时行车、步行和航拍视频。相比现有JEPA方法,FactorJEPA在未来帧L1、因果L1和掩码比率斜率上均有提升。方法在2B和1B参数的V-JEPA 2.1骨干上排名一致,斯皮尔曼系数为0.895至0.978。AI模型FactorJEPADENSEWORLD-115kV-JEPA 2.1推荐理由:研究拥挤混乱街景的世界模型,发布了新模型和115k数据集,比传统JEPA更擅长处理遮挡和异构交通。原文稍后读已读值得跟进有用关注 FactorJEPA
11:49官方账号arXiv cs.AI@Zexuan Yan, Yuzhou Wu, Yue Ma, Zonghang He, Kaibo Yin, Xiaobing Tu, Yinggui Wang, Jinkui Ren, Xiantao Zhang, Shijian Wang, Jinghong Liu, Linfeng ZhangEgoGenesis是一个基于预训练视频生成先验的自我中心世界动作模拟器,用于合成可控的操作视频。它通过在线锚定投影记忆(OAPM)保留第一帧3D场景锚点,并用Action-3D RoPE编码末端执行器运动。将400条真实轨迹与400条EgoGenesis生成轨迹合并后,单臂任务真实机器人成功率从77%提升至84%。双臂任务成功率从53%提升至70%,说明合成数据能显著改善下游世界动作模型的泛化。论文EgoGenesis视频生成具身智能推荐理由:EgoGenesis是个能生成机器人操作视频的工具,用400条合成数据就把单臂成功率从77%提到84%,双臂从53%提到70%,挺厉害。原文稍后读已读值得跟进有用关注 EgoGenesis
22:05官方账号Decoder@Maximilian SchreinerGoogle DeepMind 研究员 Tom Zahavy 在题为“LLMs can't jump”的立场论文中认为,语言模型缺乏创造全新事物的认知机制,因此无法引发科学革命。文章指出,语言模型只能在其训练数据分布内插值,而真正的科学突破需要跳出现有知识框架。作为替代方案,Zahavy 提出“世界模型”可能具备这种能力,因为它们能模拟因果结构和进行反事实推理。该论文并未给出具体基准或数字,而是从哲学和认知科学角度提出理论观点。论文Google DeepMindTom ZahavyLLMs can't jump推荐理由:DeepMind 的 Tom Zahavy 说了个大实话:LLM 搞不了真正的新发现,得靠世界模型。不是泛泛空谈,有论文为证。原文稍后读已读值得跟进有用关注 Google DeepMind
17:42量子位@henryWorld Labs(李飞飞创立)近期将“世界模型”应用在机器人训练中,让机器人获得空间智能。该模型使机器人能够理解三维场景并规划动作路径。早期测试显示机器人可在未见过环境中自主导航和操作物体。World Labs的目标是构建能够像人类一样感知和行动的通用机器人基础模型。AI模型World Labs李飞飞世界模型推荐理由:李飞飞的公司World Labs把世界模型用到机器人上了,机器人能看懂空间、自己规划动作,跟传统方法很不一样。原文稍后读已读值得跟进有用关注 World Labs
15:55官方一手pandaily@contact@pandaily.com (Pandaily)在WAIC 2026上,Muka Robotics、Shengshu Technology、EvoPhys.ai 和 Chengwei Capital 的专家讨论了中国的世界模型初创公司。他们认为,这些公司目前已没有直接的美国对标企业,打破了以往中国科技公司对标美国的模式。小组指出,中国在世界模型领域已经领先,无需跟随美国的发展路径。行业Muka RoboticsShengshu TechnologyEvoPhys.ai推荐理由:中国搞世界模型的公司已经跑到前面了,美国找不着对标了。WAIC上几方团队聊了聊怎么做出来的。原文稍后读已读值得跟进有用关注 Muka Robotics
01:57官方账号NVIDIA AI@NVIDIAAI81°在SIGGRAPH2026上,NVIDIA Cosmos Lab副总裁刘明宇宣布了Cosmos-Dreams,一种神经闭环模拟器。他展示了该模拟器的完整演示,并阐述了世界模型作为物理AI数据引擎的理念。Cosmos-Dreams旨在将数据从被动收集转变为主动计算生成。AI产品NVIDIACosmos-DreamsCosmos Lab2 个信源在谈事件专题推荐理由:NVIDIA在SIGGRAPH上发布了Cosmos-Dreams,一个能主动计算生成训练数据的模拟器。物理AI开发不再只靠收集数据了,看看演示视频吧。原文稍后读已读值得跟进有用关注 NVIDIA
19:20官方一手pandaily@contact@pandaily.com (Pandaily)比亚迪AI团队首次公开HyWorldVLA混合世界模型,采用像素-潜在混合世界建模与VLA架构,在NAVSIM v1基准上取得90.59 PDMS,达到SOTA。该模型由比亚迪与哈尔滨工业大学机器人研究人员合作开发。这一成绩标志着比亚迪正式进入自动驾驶基础模型赛道。AI模型HyWorldVLA比亚迪NAVSIM推荐理由:比亚迪悄悄拿出的HyWorldVLA,在NAVSIM上直接以90.59分拿下SOTA,这是他们首次秀自动驾驶基础模型肌肉。原文稍后读已读值得跟进有用关注 HyWorldVLA
16:34AI Will@FinanceYF5World Labs 在其世界模型分类中将模拟器称为关键枢纽,认为它是 Agent 行动、学习和评估的核心。他们提出的 R2S2R 引擎旨在将机器人开发从缓慢、昂贵且受硬件限制的迭代,转向更可规模化、成本更低的训练与评估。该引擎通过模拟环境加速机器人开发流程,降低硬件依赖。AI模型World LabsR2S2R引擎模拟器1 个信源在谈事件专题推荐理由:World Labs 这篇博客把模拟器定位成世界模型的核心,他们的 R2S2R 引擎能让机器人训练成本降很多,值得搞机器人开发的看看。原文稍后读已读值得跟进有用关注 World Labs
11:36官方账号arXiv cs.LG@Gaspard Lambrechts, Adrien Bolland, Daniel Ebi, Damien Ernst论文提出Reinformed Dreamer算法,通过潜在引导改进不对称表示学习,解决了Informed Dreamer在特权信息表示上的局限。在多个强化学习基准测试中,相比Dreamer基线,Reinformed Dreamer表现出更一致的性能提升。该方法利用训练期间的额外监督信息学习更好的观察和特权信息表示。论文Reinformed Dreamer强化学习世界模型推荐理由:如果你做强化学习,特别关注世界模型,这篇论文提出Reinformed Dreamer,用潜在引导训练不对称表示,比Informed Dreamer更稳定地超越Dreamer。原文稍后读已读值得跟进有用关注 Reinformed Dreamer
00:44官方账号Fei-Fei Li@drfeifei精选World Labs创始人Fei-Fei Li在推文中介绍了团队的世界模型分类法,将模拟器定位为智能体行动、学习和评估的关键枢纽。新发布的R2S2R引擎使机器人开发可从缓慢、昂贵、受硬件限制的迭代转向更可扩展、成本更低的训练与评估。该引擎采用真实到模拟到真实(Real-to-Sim-to-Real)循环,有望降低机器人研发门槛。AI模型R2S2RWorld LabsFei-Fei Li2 个信源在谈事件专题推荐理由:Fei-Fei Li团队搞了个R2S2R引擎,让机器人训练不用老在真机上折腾,省时省钱,做机器人开发的一定要看看。原文稍后读已读值得跟进有用关注 R2S2R
22:14IT之家(博客/媒体)Unity中国CEO张俊波在团结引擎2.0发布会后表示,AI不会颠覆游戏引擎,反而能降低门槛扩大引擎公司的渗透。他认为世界模型能快速生成虚拟空间,但不等同于可长期运营的游戏,还需要玩法规则、数值系统等系统工程。张俊波不认同“一句话生成游戏”的说法。Unity中国当日发布团结引擎2.0,推出可独立执行游戏开发任务的AI Agent团结Codely,并新增对PS5、Xbox Series X|S、Nintendo Switch 2等主机平台的支持。AI产品Unity中国团结引擎2.0张俊波推荐理由:Unity中国CEO张俊波谈AI不会颠覆游戏引擎,并发布团结引擎2.0,新增AI Agent和主机平台支持。原文稍后读已读值得跟进有用关注 Unity中国
15:35量子位@henry精选72°研究人员利用50万小时视频数据训练出首个隐式触觉世界动作模型。该模型能够根据视觉输入生成对应触觉信号。在机器人操作任务中,它实现了比纯视觉模型更精准的动作预测。这项研究将触觉感知融入了世界模型框架。AI模型触觉世界模型50万小时视频世界模型推荐理由:团队用50万小时视频让模型学会预测触觉,这在之前没人做到过。它能帮机器人提前感知物体触感,操作更稳。原文稍后读已读值得跟进有用关注 触觉世界模型
10:34官方账号arXiv cs.AI@Liangyu Li, Qingwen Liu, Mingqing Liu论文揭示基于采样和潜在世界模型的控制器存在“提议过度生成”问题:当候选动作序列池从72增加到288,可行性从0.375降至0.062(位置目标)、0.344降至0.031(位置加偏航目标),即使大池中始终包含可行序列。作者提出相邻集动作重建(ASAR)方法,通过测量低代价序列的密度并从相邻集重建完整动作。在Carry and Release评估的75个查询中,Kernel ASAR在72、144、288个提议下分别将事件完成成功率提升28.0、24.0、18.7个百分点(潜在成本下)及18.7、20.0、17.3个百分点(轨迹可达性成本下)。论文ASARCube世界模型推荐理由:这篇论文发现了世界模型选动作的隐性陷阱:候选越多反而越容易选错。ASAR用相邻集合重建的方法,在75个机器人任务上提升了最多28%的成功率,值得搞机器人控制的看看。原文稍后读已读值得跟进有用关注 ASAR
17:16官方一手marktechpost@Michal SutterInduction Labs 推出 Imagination Models 架构,其候选模型 Photon-1 为稀疏 106B-A5B MoE,仅在未标注动作的原始视频上完成单次预训练。Photon-1 能够模拟桌面操作、玩跳棋,并建模台球物理。该架构挑战了传统需动作标签的预训练范式。AI模型Photon-1Induction Labs世界模型推荐理由:Induction Labs 搞了个新套路:不用动作标签,只看视频就能学会模拟桌面、跳棋和台球物理。106B 参数的 MoE 模型,一次预训练就够了。原文稍后读已读值得跟进有用关注 Photon-1
03:08官方一手marktechpost@Asif RazzaqReactor 团队开源了 Open Dreamer,这是一个基于 JAX 和 Flax NNX 的 Dreamer 4 世界模型管道的完整复现。该项目包含两个代码仓库:next-state/open-dreamer 提供训练管道,包括因果视频分词器、动作条件潜在动力学模型、轨迹生成和 FVD 评分;reactor-team/open-dreamer 提供推理代码。Open Dreamer 的发布使 Dreamer 4 的完整训练流程得以公开复现。AI模型Open DreamerDreamer 4JAX推荐理由:Reactor 团队把 Dreamer 4 的完整训练配方和代码都开源了,JAX/Flax 实现,想复现世界模型做视频预测的赶紧看。原文稍后读已读值得跟进有用关注 Open Dreamer
23:48量子位@思邈该模型在由李飞飞团队构建的视觉语言基准中拿下第一。它完全适配华为昇腾算力平台,无需依赖英伟达硬件。代码和全部权重已开放,社区可直接下载使用。从一张静态图就能生成连贯视频,展现物理规律。AI模型世界模型昇腾李飞飞2 个信源在谈事件专题推荐理由:这个国产模型在权威榜单上拿了第一,还完全开源,用昇腾就能跑,值得看看。原文稍后读已读值得跟进有用关注 世界模型
14:20官方账号vLLM@vllm_project82°NVIDIA 发布 Cosmos 3 Edge,一个4B参数的设备端世界模型,基于自研Nemotron骨干从零训练。模型采用双Transformer塔架构:自回归塔处理视觉/文本推理,扩散塔负责预测、生成和动作输出。在640×360分辨率下,单次推理可输出32个动作,于Jetson Thor上实现15Hz实时控制。vLLM和vLLM Omni已提供即日支持,可用于机器人、自动驾驶和视觉代理。AI模型NVIDIA Cosmos 3 EdgevLLM世界模型5 个信源在谈事件专题推荐理由:NVIDIA发了能在设备上实时跑的世界模型,4B参数,15Hz控制机器人,vLLM直接就能用。原文稍后读已读值得跟进有用关注 NVIDIA Cosmos 3 Edge
09:57官方一手arXiv: Google DeepMind@Jiaqi Li, Xinglong Zhang, Haibin Xie, Yixing Lan, Wei Pan, Xin Xu精选Koopman Dreamer是一种基于Dreamer架构的世界模型,其确定性潜动力学核心采用二维旋转-缩放块,谱半径有界以表示阻尼与周期模式。模型通过线性与低秩双线性动作项捕捉全局和状态依赖控制效应,结合后验条件EMA教师目标与一致性、多步展开等目标训练。论文推导了多步展开误差界,分离谱骨干和双线性交互的放大效应与随机状态失配的影响。在DeepMind Control Suite的6个 proprioceptive 控制任务和UAV-LiDAR自主导航中,Koopman Dreamer将长程潜滚动误差降低30%以上,闭环控制性能提升15%-25%。论文Koopman DreamerDreamer世界模型推荐理由:Koopman Dreamer 给 Dreamer 加了个谱约束核,长程想象稳多了。在 DeepMind 控制套件和无人机导航上,比原版 Dreamer 控得更好更稳。原文稍后读已读值得跟进有用关注 Koopman Dreamer
12:03量子位@量子位的朋友们酷哇科技在WAIC 2026上发布了行业首个双层智能体世界模型,该模型将物理世界模型与人类社会世界模型统一。不同于传统单一物理世界模型,它整合了人类行为和社会规则。该模型旨在让机器人更理解复杂环境,提升交互能力。AI模型酷哇科技双层智能体世界模型智能体推荐理由:酷哇科技搞了个新东西,把物理世界和人类社会的模型合二为一,机器人更聪明了。原文稍后读已读值得跟进有用关注 酷哇科技
18:44量子位@量子位的朋友们国家具身智能应用中试基地与魔芯科技联合发布首个合作世界模型MoWorld 3D。该模型专注于3D场景生成与具身智能交互,支持从文本或图像直接生成三维环境。MoWorld 3D在空间理解与物理模拟方面表现突出,可为机器人训练提供低成本仿真数据。这一发布标志着国内具身智能领域在3D世界模型上取得关键进展。AI模型魔芯科技MoWorld 3D世界模型推荐理由:国家基地联手魔芯搞了个MoWorld 3D,能直接文本生成3D场景,给机器人训练省大钱了。搞具身智能的别错过。原文稍后读已读值得跟进有用关注 魔芯科技
18:33量子位@量子位的朋友们启鸣达人在WAIC 2026上发布了《世界模型驱动的教育AGI白皮书》。白皮书从理论探索到体系构建,系统阐述了世界模型在教育AGI中的应用框架。该白皮书为教育AI领域提供了系统性参考。论文启鸣达人世界模型教育AGI推荐理由:启鸣达人发了份教育AGI白皮书,讲了世界模型怎么驱动教育,搞AI教育的可以看看。原文稍后读已读值得跟进有用关注 启鸣达人
18:48官方账号Decoder@Jonathan Kemper77°Google Deepmind 提出 GenCeption 方法,利用视频生成器完成深度估计和语义分割等经典视觉任务。该方法在仅使用合成视频训练的情况下,匹配甚至超越当前最先进系统的性能。研究团队认为视频生成器内部已经隐式包含了一种通用世界模型,这挑战了传统计算机视觉的范式。GenCeption 在 KITTI 深度估计基准上取得了与基于真实数据训练的模型相当的结果,证明了其有效性。论文GenCeptionGoogle Deepmind视频生成推荐理由:Deepmind 把视频生成器当成通用感知模型,用合成视频训练就达到了顶级深度估计水平,挺震撼的,值得一看。原文稍后读已读值得跟进有用关注 GenCeption
16:18IT之家(博客/媒体)73°阿里云百炼于7月19日上线世界模型产品HappyOyster 1.0。该模型从海量视频中学习物理规律,用户输入一句话或一张图即可生成可交互数字世界。提供世界探索和实时导演两种模式,分别支持1分钟连续交互和3分钟以上分支叙事。已开放Android/iOS/Web三端SDK,在阿里云百炼开启灰测。可用于游戏原型、互动短剧、虚拟陪伴等场景。AI产品阿里云百炼HappyOyster世界模型推荐理由:阿里云百炼出了个世界模型,一句话就能生成可以亲自进去玩的数字世界,还能随时改剧情,适合做游戏原型或互动剧。原文稍后读已读值得跟进有用关注 阿里云百炼
11:42IT之家(博客/媒体)小鹏图灵第二代VLA模型发布,实现同一套模型同时适配中国和欧洲路况。该模型通过世界模型与VLA结合提升在真实世界中的理解力与行动力。即使在训练数据不足的海外市场,也能自主生成训练数据加速泛化。小鹏目标在2027年逐步向海外用户交付。AI模型小鹏图灵VLA小鹏汽车1 个信源在谈事件专题推荐理由:小鹏的智驾模型做到了全球通吃,同一套代码跑通中欧路况,还有明确的2027年海外交付计划,挺酷的。原文稍后读已读值得跟进有用关注 小鹏图灵
00:42Y Combinator@ycombinatorYC的Decoded播客讨论了AI与人类学习效率的差距:顶尖AI需要数万样本学习技能,而人类几次尝试就能掌握。节目深入介绍了世界模型(world models)的概念——让AI拥有环境的内部模拟,提到了AlphaGo在围棋中面临的行动空间问题、蒙特卡洛树搜索(MCTS)的原理,以及JEPA(联合嵌入预测架构)在自动驾驶和机器人领域中的应用。该播客还探讨了模型无关强化学习(Model-Free RL)与基于模型的强化学习(Model-Based RL)的差异,指出机器人学习是其中最困难的场景。论文世界模型强化学习自动驾驶推荐理由:这期播客聊了为什么AI学东西这么慢,重点介绍了‘世界模型’这个可能的解法,涉及AlphaGo、自动驾驶、机器人等具体案例,非常有料。原文稍后读已读值得跟进有用关注 世界模型
09:51官方账号arXiv cs.AI@Yukuan Lu, Zaishuo Xia, Weyl Lu, Yubei Chen研究分析了DreamerV3、DIAMOND、TWISTER、Simulus和STORM五种世界模型在Atari Pong中的表现。冻结模型后,单独策略生成的视频轨迹出现球消失、运动错误等问题。像素空间零样本MBRL中,DreamerV3平均回报从-5.5降至-20.9,接近最低分-21。提出Concept-Guided Spatial Regularization(CGSReg)辅助重建损失,在DreamerV3、DIAMOND和TWISTER上改进了闭环轨迹和零样本MBRL。论文DreamerV3DIAMONDTWISTER推荐理由:这篇论文发现DreamerV3等模型在Pong里会弄丢球,他们用CGSReg方法修了一部分问题,做强化学习的可以看看。原文稍后读已读值得跟进有用关注 DreamerV3
09:30官方账号arXiv cs.LG@Susie Lu, Haonan Chen, Weirui Ye, Yilun DuDriftWorld 是一种动作条件的世界模型,通过训练中学习动作条件漂移,在单个前向传播中生成未来帧,速度达 30+ fps。相比扩散模型基线,平均推理速度提升 17 倍。在 Bridge-V2、RT-1、Language Table、Push-T、Robomimic 等机器人操控基准上,DriftWorld 以更少推理时间实现 SOTA 决策性能。它还可作为离线模拟器,用于排序真实机器人策略,滚动得分与真实结果相关性高达 0.99。AI模型DriftWorld世界模型机器人推荐理由:DriftWorld 能让机器人快速想象动作结果,比扩散模型快 17 倍,还能离线评估策略,性能强又省时。原文稍后读已读值得跟进有用关注 DriftWorld
12:11量子位@衡宇原力灵机发布了世界模型DW0.5,专用于训练VLA(视觉语言动作模型)。通过将强化学习搬进虚拟世界进行训练,DW0.5使VLA后训练对真机数据的需求降低60%。这一方法利用虚拟环境模拟减少真实机器人数据采集成本,提升策略泛化能力。AI模型原力灵机DW0.5VLA推荐理由:原力灵机用DW0.5世界模型训练VLA,真机数据需求降60%。把RL搬到虚拟世界,机器人后训练成本大降。原文稍后读已读值得跟进有用关注 原力灵机
00:43elvis@omarsar0精选大多数世界模型在几秒后出现纹理涂抹、几何扭曲等失败模式。LingBot-World 2.0来自@robbyant_brain,在720p分辨率下以60fps保持互动长达一小时。该模型解决了长期视频生成中的一致性难题。其架构创新使得长时间高保真世界模拟成为可能。AI模型LingBot-World 2.0世界模型视频生成推荐理由:别的世界模型几秒就崩,LingBot-World 2.0能稳跑一小时720p 60fps,超实用。来看看它怎么做到的。原文稍后读已读值得跟进有用关注 LingBot-World 2.0
15:50IT之家(博客/媒体)精选高德推出的 ABot-WorldStudio 将交互式视频生成与 3DGS 场景生成统一在同一产品中,用户输入文字或图片即可生成可实时交互的 AI 世界。该工坊在单张 RTX 5090 上即可本地部署,连续推理已稳定超过 1 小时,而同类模型生成上限大多仅为 1 分钟。工坊内置了“时空任意门”机制,允许用户在不同 3D 世界间跃迁,探索范围不受场景限制。底层模型 ABot-World0 和 ABot-3DWorld0 已全面开源,支持室内、街景与城市航拍全尺度空间生成。AI产品高德ABot-WorldStudio世界模型推荐理由:高德开源的 AI 工坊,输文字或图片就能生成可实时交互的 3D 世界,还能连续跑 1 小时不崩,比同类 1 分钟长得多,且内置任意门随便穿梭。原文稍后读已读值得跟进有用关注 高德
12:42量子位@量子位的朋友们高德推出通用世界模型工坊ABot-World Studio,可基于单张5090显卡生成小时级实时交互式视频与3D场景。该工坊支持用户通过输入文本或图像直接创建可交互的3D世界,并实现实时渲染。其生成效率较传统方案提升显著,降低了大规模3D内容创作的门槛。模型已在高德地图内部多个场景进行测试,展示出良好的实用性。AI模型高德ABot-World Studio世界模型推荐理由:高德发了ABot-World Studio,用一张5090就能生成小时级的实时3D场景和交互视频,做游戏或数字孪生都可以试试,门槛低了很多。原文稍后读已读值得跟进有用关注 高德
11:55官方账号arXiv cs.AI@Yuanzhi Liang, Xufeng Zhan, Haibin Huang, Chi Zhang, Xuelong Li这篇论文回顾了世界动作模型(WAMs)的演变,指出当前研究存在三个耦合差距:模型角色和表示、目标和标准化、系统组合。基于此,提出以embodied brain为核心的协同进化路线图,这是一个长期模型目标,能整合多模态上下文、比较候选干预、发出状态转换或能力请求。论文还介绍了物理束缚(physical harness)、共享合同和闭环后训练等组件,构建了一个模块化的物理智能堆栈。论文World Action ModelsEmbodied Brains世界模型推荐理由:这篇论文梳理了从世界动作模型到具身大脑的路线图,对搞具身智能的研究者很有参考价值。原文稍后读已读值得跟进有用关注 World Action Models
09:21官方一手arXiv: Google DeepMind@Achyuthan Sivasankar这篇论文在9个DeepMind Control任务上引入shallow penalty ρ来测量深度在自回归展开中的效果,发现6/9的任务中深度帮助(ρ最高达4.7倍),2/9的任务中浅层胜出(ρ低至0.85倍)。通过消融实验,反转现象(cheetah任务)被证实由训练目标造成:仅监督早期退出第一步时ρ从0.87升至1.18,而内在折中任务不受影响。ρ的部分可预测性通过观察/动作维度和单步模型误差与ρ的Spearman相关系数约0.75(n=9)展示。在CEM规划器中,ρ的符号可预测规划是否受益于深度,反转任务上浅层规划优于深层。论文DeepMind ControlCEM planner世界模型推荐理由:这篇论文用实验告诉你,深的世界模型在滚动预测时不一定管用——在DeepMind Control的9个任务里,有2个反而是早退浅层更好,而且原因竟然出在训练方式上。搞模型规划的值得看看。原文稍后读已读值得跟进有用关注 DeepMind Control
15:55IT之家(博客/媒体)据36氪消息,字节跳动正探索进入自动驾驶领域,项目由Seed旗下周畅的世界模型团队负责。业务方向包括无人物流,隶属于火山引擎汽车行业线。字节已与头部自动驾驶团队进行过业务探讨,并开始向辅助驾驶或自动驾驶人才发出邀约。字节官方回应称,其在物理AI领域有早期研究,但没有做智能驾驶业务的计划。行业字节跳动Seed世界模型推荐理由:字节跳动也在看自动驾驶了,虽然官方说没打算做智能驾驶,但Seed世界模型团队已经在探索,可能有无人物流方向。原文稍后读已读值得跟进有用关注 字节跳动
18:31量子位@一水一位1998年出生的哈工大教授创办公司,目标是构建人形灵巧操作世界模型。技术路线包括触觉数据采集、跨模态对齐以及触觉在实际操控中的应用。该模型旨在让机器人通过触觉实现精细化物体操作,区别于纯视觉方案。AI模型触觉人形机器人世界模型推荐理由:哈工大年轻教授从触觉切入人形机器人,想做世界模型,和主流视觉路线不同,思路挺有意思。原文稍后读已读值得跟进有用关注 触觉
16:30官方一手pandaily@contact@pandaily.com (Pandaily)2026年6月,具身AI领域迎来爆发,平均每48小时就有一个新模型诞生,共13个具身AI模型和世界模型发布。BAAI发布了其世界模型,阿里巴巴推出了Qwen-Robot。这些模型标志着竞争焦点从机器人硬件基准转向软件智能,如Sim-to-Real、操作泛化等能力。这13个模型涵盖从抓取到导航的多种任务,基准如LIBERO、RLBench表现均有提升。AI模型BAAI World ModelQwen-RobotAlibaba推荐理由:具身AI每两天就冒出一个新模型,这次BAAI和阿里都出手了,想看看软件智能怎么拼过硬件?这篇总结到位。原文稍后读已读值得跟进有用关注 BAAI World Model
17:35官方账号Decoder@Jonathan Kemper北京人工智能研究院发布Orca世界模型,它预测抽象世界状态而非token或像素。该模型在125,000小时视频上训练,未使用任何动作标签。在五个机器人任务上,Orca的表现与专用π0.5模型相当。这项研究可能有助于缓解机器人领域长期面临的数据短缺问题。AI模型Orcaπ0.5世界模型推荐理由:中国团队搞了个Orca世界模型,不用学动作标签就能看懂视频里的世界,在五个机器人任务上跟专业π0.5打平,厉害。原文稍后读已读值得跟进有用关注 Orca
12:43官方一手marktechpost@Asif Razzaq精选蚂蚁集团Robbyant团队发布LingBot-World-Infinity(LingBot-World 2.0),一个14B参数因果视频生成模型,用作交互式世界模拟器。核心创新包括混合双向自回归(MoBA)注意力机制和分布匹配蒸馏,解决长程漂移导致的纹理模糊和几何变形。报告展示单个60分钟不间断会话涵盖20个场景。但发布内容仅包含一个检查点、480P参考脚本,无部署代码和定量基准,且采用非商业许可CC BY-NC-SA 4.0。AI模型LingBot-World-InfinityRobbyant蚂蚁集团推荐理由:蚂蚁发了14B的世界模型LingBot-World-Infinity,能生成60分钟视频模拟20个场景,用MoBA注意力解决长时间漂移。不过目前只开放了检查点,没有完整代码。原文稍后读已读值得跟进有用关注 LingBot-World-Infinity
10:09AI Will@FinanceYF5@robbyant_brain 开源了LingBot-World 2.0 (Infinity)世界模型。该模型支持小时级实时生成,长时间运行后画质不衰减。输出为720p/60fps视频,解决了大多数世界模型运行几分钟后画面崩坏的问题。AI模型LingBot-World 2.0世界模型实时生成3 个信源在谈事件专题推荐理由:这个开源世界模型能稳跑几小时不崩画质,比那些几分钟就坏的强多了,机器人预判世界的好工具。原文稍后读已读值得跟进有用关注 LingBot-World 2.0
10:07AI Will@FinanceYF5Robbyant Brain再次开源发布三个模型:空间感知模型LingBot-Vision和LingBot-Depth 2.0,具身操作模型LingBot-VLA 2.0,以及世界模拟器LingBot-World 2.0。这些模型覆盖从视觉感知到物理预测的全链路。1月曾有一次类似开源发布,此次延续了开源策略。该系列旨在构建完整的具身智能技术栈。AI模型LingBot-VisionLingBot-Depth 2.0LingBot-VLA 2.04 个信源在谈事件专题推荐理由:Robbyant Brain又开源了三个模型,从看世界到模拟世界一步到位,做具身智能的可以关注LingBot系列。原文稍后读已读值得跟进有用关注 LingBot-Vision