世界模型

加入交流群
扫码加入
获取工程师必备礼包
参与热点资讯讨论

大型世界模型(LWM,Large World Model)

大型世界模型(LWM,Large World Model)收起

查看更多
  • 世界模型102:三条技术路线与大一统趋势的架构解读
    文章介绍了三种不同类型的世界模型:观测级模型、潜在空间模型和3D增强与对象中心模型。每种模型都有其特点和适用场景,但同时也存在一些不足之处。文章指出,未来的世界模型应该是一个生成与理解一体化的模型,能够理解和生成动态世界。此外,世界模型还需要考虑动作和策略的建模,以便更好地理解和控制物理世界。最后,文章强调了全模态整合的重要性,即物理AI需要一个能够理解现状、想象可能的未来并与世界交互的模型,整合多种模态的物理信号。
    234
    07/16 13:35
    世界模型102:三条技术路线与大一统趋势的架构解读
  • 98年哈工大长聘教授创业:触觉驱动的机器人世界模型,能否成为下一个突破口?
    哈尔滨工业大学(深圳)计算机科学与技术学院长聘教授杨朔创立破晓智能(PHANES AI),聚焦人类数据、触觉感知与世界模型研究,目标是让人形机器人完成全身移动灵巧操作。公司已组建数十人团队,覆盖数据、模型、机器人控制与硬件系统。李朔团队围绕触觉数据展开了一系列研究,包括EgoTouch、TouchAnything和TouchWorld,解决了触觉数据采集、规模化和实际应用的问题。此外,破晓智能正搭建面向人类操作的多模态数据采集平台,以降低成本并提高数据质量,助力机器人实现全面的触觉感知和操作能力。
  • 世界模型101:概念、技术争鸣与科学应用
    "世界模型"已经成为人工智能领域最受关注的概念之一。从基于模型的强化学习、视频生成,到具身机器人,再到更宏大的"物理 AI"(Physical AI),各个子领域的研究者都在构建自己称之为"世界模型"的系统。连普通消费者也开始在各种场合听到这个词。
    239
    07/14 11:31
    世界模型101:概念、技术争鸣与科学应用
  • 地平线的HSD V2.0让端到端走到了哪一步?
    2026年自动驾驶端到端已成为主流,地平线发布HSD V2.0,采用一段式端到端全场景辅助驾驶系统,利用世界模型增强主动安全,提升无接管里程和反应速度。行业正从功能落地转向体验优化,强化学习成为共识路线。
    地平线的HSD V2.0让端到端走到了哪一步?
  • 智驾下半场,体系能力才能重写排位?
    蔚来通过提前设计的工程体系,实现了硬件冗余和软件优化,成功推出世界模型版本,覆盖各大平台和车型,提升了用户体验并推动了整个行业的技术进步。
  • 具身智能 | 用世界模型替代师生学习:WMP 是如何让四足机器人「看清地形」
    本文介绍了WMP(World Model Policy)方法,这是一种在视觉腿足机器人领域的新颖技术。WMP的核心思想是绕过传统的scandots表达力局限,通过构建一个统一的世界模型,使政策可以直接在一个预测能力强的隐状态空间中生长。文章详细阐述了WMP的设计思路和技术细节: 1. **输入输出接口**:WMP将腿足控制建模为POMDP,使用深度图作为输入,同时引入特权信息。 2. **关键不对称:世界模型与策略的频率错位**:为了应对仿真与真机延迟问题,WMP采用了每100ms更新一次世界模型的策略。 3. **为什么策略要拿**:解释了为何策略采用确定性部分而非随机部分的原因。 4. **训练时的监督模块**:介绍了一次训练阶段内同时训练世界模型、策略和深度预测器的方法。 5. **推理时的执行模块**:讨论了如何在板载推理环境中进行部署,以及关键超参数设置。 6. **训练目标**:提出了三套损失函数并存的方式,确保世界模型、策略和深度预测器的有效训练。 7. **可选模式**:提供了t-SNE可视化和开环预测的实验结果。 WMP通过将世界模型与策略紧密结合,实现了在复杂地形中的高效导航,展示了其在视觉腿足机器人领域的潜力。
    具身智能 | 用世界模型替代师生学习:WMP 是如何让四足机器人「看清地形」
  • 端到端、世界模型与VLA三者到底是什么关系?
    2026年上半年,自动驾驶行业技术迭代加速,主要聚焦于端到端、VLA和世界模型三大技术路线。端到端简化了传统模块化设计,但缺乏深层理解;VLA通过加入语言模型增强理解能力,但存在推理延迟和模型不适配问题;世界模型则通过模拟物理世界预测未来,提高决策主动性。随着技术融合加深,行业正朝着让AI理解物理世界的趋势发展,预计下半年的竞争将集中在技术融合的深度和速度上。
    端到端、世界模型与VLA三者到底是什么关系?
  • 十分钟读论文 | Nano World Models——搭建一个最小化未来视频预测世界模型
    Nano World Models 提供了一个可复现实验框架,将世界模型的研究拆分为多个可替换的配置轴,包括生成目标、模型规模、动作注入、潜在空间、数据集和采样方式。其核心思想是通过 diffusion forcing 统一未来视频预测,使研究者能够灵活调整和比较不同的设计选择。Nano WM 支持多种动作注入机制,并提供了详细的配置和实验指南,方便研究人员进行深入探索和创新。
    十分钟读论文 | Nano World Models——搭建一个最小化未来视频预测世界模型
  • 从像素到规划:读懂LeWorldModel——一个只用两项损失就能稳定训练的世界模型
    《LeWorldModel》介绍了一种新的世界模型训练方法,能够在单GPU环境下稳定训练带有动作的世界模型。该方法采用了简化版的JEPA架构,并通过SIGReg正则化手段解决了表征坍塌问题。文章详细介绍了模型架构、训练目标、训练流程以及应用场景。
    1632
    07/06 13:44
  • 从像素到空间:智汇云舟3D图形引擎如何重塑世界模型的未来
    世界模型的“像素困境” 想象这样一个场景:你戴上VR头盔,走进一个由AI实时生成的虚拟世界。你向左转,看到桌上有一个杯子;你向右走几步再回头——那个杯子还在桌上,形状、颜色、位置都没有变。这听起来再自然不过,但对今天绝大多数AI“世界模型”来说,这恰恰是最难做到的事情。 世界模型(World Model)是近年来人工智能领域最受瞩目的方向之一。它的目标很直接:让AI能够理解、模拟甚至预测物理世界的
  • 世界模型还是VLA,选错技术路线就会被淘汰吗?
    自动驾驶行业在2026年迎来技术路线的关键抉择,主要围绕VLA(视觉-语言-动作模型)与世界模型展开激烈讨论。VLA强调通过语言模型理解场景并作出决策,而世界模型则侧重于物理世界的预测和推演。尽管目前尚未出现绝对优势路线,多家企业如华为、Waymo、理想、小鹏等都在积极探索融合这两种技术的方法,以适应未来的高阶自动驾驶需求。
    世界模型还是VLA,选错技术路线就会被淘汰吗?
  • 读读代码 | EmbodiChain: 面向具身智能的生成式仿真世界模型深度解析
    本文介绍了跨维智能团队开源的 EmbodiChain 框架,这是一个面向具身智能的端到端 GPU 加速平台,基于 GS-World 理论,提出了一套全新的机器人学习范式。通过高速生成物理精确的仿真数据,突破传统数据采集的效率瓶颈,实现零真实数据条件下的 Sim2Real 迁移。
  • 十分钟读论文 | τ0-WM:让机器人先在脑子里推演,再决定怎么动
    τ0-WM 是一种创新的机器人世界模型,通过整合视频预测、动作生成和动作评估,实现了在复杂任务中的高效决策。该模型利用真实机器人遥操作数据、UMI风格演示数据和第一视角人类视频来构建全面的世界模型。VAM模块负责动作生成和未来预测,ACVS模块评估候选动作的潜在后果,而TTC模块在部署时进行动作选择和修正。τ0-WM的核心理念是将未来预测融入决策过程中,确保机器人能够综合考虑各种因素并做出最佳选择。
  • 城市NOA提出这么久,发展到什么程度了?
    城市NOA技术近年来迅速发展,已成为各大车企竞争焦点。尽管多数车型宣称标配此功能,但其实际成熟度和性能差异仍待考察。随着端到端架构的普及,VLA和世界模型成为新的技术方向,分别强调快速决策和预判能力。安全性也是重点,轻舟智航和理想提出的方案通过安全端到端机制增强安全性。然而,尽管部分高端车型表现出色,但在复杂路况下的表现仍有待提高。总体而言,城市NOA技术虽取得进展,但仍面临诸多挑战,还需进一步完善。
    1034
    06/18 10:58
    城市NOA提出这么久,发展到什么程度了?
  • 智源研究院院长王仲远:具身智能仍需“世界模型”突破,泛化能力是最大挑战
    具身智能硬件取得进展,但泛化能力不足。世界模型被视为突破瓶颈的关键。王仲远提出,具身智能需依赖世界模型实现对物理世界的预测,目前面临因果推理和复杂动态系统的挑战。尽管现有模型已有应用,但未来有望统一融合,推动具身智能发展。
    智源研究院院长王仲远:具身智能仍需“世界模型”突破,泛化能力是最大挑战
  • 200+AI专家集结北京,共议世界模型、智能体、具身智能等话题,这届智源大会释放什么信号?
    2026智源大会在北京中关村举行,汇集了国内外顶尖学者、产业领袖和青年科研人才,共同探讨大模型、AI Agent、世界模型、具身智能、AI4S等前沿议题。大会展示了多个重要研究成果,包括原生多模态大模型、智能体产品和基础软硬件生态的最新进展。中关村持续推动技术创新和人才培养,形成了完整的创新链条,吸引了全球顶尖年轻人才参与。
    1036
    06/15 23:52
  • 哪些车企真的将占用网络装进了量产车?
    占据网络(Occupancy Network)技术近年来在自动驾驶领域备受关注,因为它能够解决传统感知系统难以应对的异形障碍物问题。特斯拉和小鹏汽车分别采用纯视觉路线和多传感器融合策略,利用占用网络从二维图像推断三维空间的占用状态,并引入时间维度进行运动预测。华为和小米则进一步探索超分辨率占用网络,提升空间分辨率。理想汽车和蔚来则将占用网络与世界模型相结合,使其成为端到端自动驾驶系统的核心空间推理单元。展望未来,占用网络正朝着4D化和端到端架构整合的方向发展,其具体应用效果取决于企业在其上的上层架构设计。
    哪些车企真的将占用网络装进了量产车?
  • 从视频生成到世界模型的演进之路:空间智能时代的技术革命
    人工智能正面临从表面模拟到深层理解的转型,视频生成技术的发展为构建世界模型提供了强大工具。世界模型不仅是对物理世界的模拟,还包括隐式世界模型和视频渲染器两大部分。从第一阶段的基础视频生成到第四阶段的随机性和多尺度建模,世界模型逐渐实现了从短期真实性到长期规划性,再到复杂系统预测和随机性感知的跃升。 导航模式是实现交互性的关键,通过动作序列、轨迹、文本指令等多种方式引导模型生成。目前主流的条件注入策略包括ControlNet、多模态Transformer、交叉注意力等,各有利弊。扩散模型因其生成质量和稳定性在视频生成中占主导地位,但也面临生成速度慢的问题。 世界模型已在机器人、自动驾驶、游戏、创意产业等多个领域得到应用,从训练环境到感知增强,从场景生成到安全测试,展现了巨大潜力。李飞飞教授提出的空间智能理念为世界模型的发展奠定了理论基础,并通过Marble等工具推动了技术进步。 展望未来,世界模型将继续朝着更高的真实性和复杂性迈进,尤其是在机器人、科学和教育等领域,有望彻底变革智能交互的方式。
    从视频生成到世界模型的演进之路:空间智能时代的技术革命
  • VLA与世界模型哪个更适合自动驾驶?为什么车企会有不同选择?
    自动驾驶技术中,世界模型与VLA各有侧重:世界模型注重环境逻辑预测,VLA强调决策逻辑推理。两者在实际应用中逐渐融合,共同推动自动驾驶系统的智能化水平。
    VLA与世界模型哪个更适合自动驾驶?为什么车企会有不同选择?
  • 神仙打架之外:环卫车里长出的世界模型什么样
    2026年5月,世界模型赛道上有智元GE 2.0、星动纪元Ctrl-World和北京人形Pelican-Unify等重要事件。酷哇科技发布的CooWAIM 2.0展示了其在实际场景中的高效避障能力,采用DAWN架构实现了高效的交互式物理推演。尽管酷哇科技在技术上有所突破,但仍面临从榜单领先到规模化落地的挑战。

正在努力加载...