物理 AI、具身智能、世界模型有什么区别?
目录
物理 AI(Physical AI)、具身智能(Embodied AI)和世界模型(World Model)分别回答三个问题:完整系统如何在现实世界运行;智能体如何通过身体与环境形成反馈;模型如何表征或预测环境状态。三者会重叠,但在同一系统中承担的范围不同。
本文采用可直接核对产品与投资证据的工作定义:Physical AI是完整工程和部署范围;具身智能是感知—行动—反馈的学习方式;世界模型是环境表征、预测或生成能力。NVIDIA的定义把机器人、自动驾驶、建筑和工厂纳入能感知、推理与行动的物理系统,也说明「身体」不限于人形。[1]
三者有什么区别
| 概念 | 本文采用的工作定义 | 在完整系统中的位置 | 是否必须有实体身体 | 常见误解 |
|---|---|---|---|---|
| Physical AI | 把 AI 部署到现实环境,使系统能够感知、推理并采取物理行动 | 完整工程与应用范围 | 通常需要实体设备或能控制物理过程的系统 | 把它等同于人形机器人 |
| 具身智能 | 智能体依靠具体身体与环境互动,并通过反馈调整行为 | 贯穿感知、决策、执行与反馈的闭环 | 是;「身体」可以是机械臂、汽车、无人机,不只人形 | 认为只有长得像人的机器人才算具身 |
| 世界模型 | 学习环境状态及其变化,用来理解、预测或模拟行动后果 | 模型与认知层 | 否;可以先在纯虚拟环境训练和运行 | 把能生成影片的模型都视为成熟机器人「大脑」 |
| VLA/策略模型 | 把视觉、语言、状态等输入转换成计划或动作 | 决策与控制层 | 本身不是身体,但通常服务于机器人或其他设备 | 认为它和世界模型一定是同一个模型 |
| 机器人/自动驾驶系统 | 承载感应器、计算与执行器的具体产品 | 身体与应用层 | 是 | 认为有自动化程式就等于具身智能 |
这套划分不是要制造新的标准,而是帮助读者回答三个不同问题:
- 系统是否真的能影响物理世界?
- 它是否形成了「感知—行动—反馈」的闭环?
- 世界模型究竟是独立组件、隐含能力,还是只有市场推广名称?
图:世界模型可以参与环境预测,但不是所有具身系统都必须有一个独立、显式命名的 World Model;Physical AI 的部署结果取决于整条闭环。
一套 Physical AI 系统如何运作
完整系统通常不是「一个大模型控制一切」,而是多个模型、感应器、计算平台和控制器共同工作。
1. 环境与感知
摄影机、激光雷达、深度感应器、触觉感应器、麦克风和设备状态首先把现实环境转换成机器可以处理的数据。感知模型需要识别对象、位置、速度、姿态、可通行区域和异常状态。
这一步决定系统「看见了什么」,感知、理解与安全行动是依次推进的三个能力层。感应器遮挡、光线变化、反射、噪声和设备漂移都会把错误带到后面的决策链。
2. 世界模型与记忆
世界模型尝试回答:「当前环境是什么状态,如果执行某个动作,接下来可能发生什么?」它可以学习空间关系、物体持续性、运动变化与部分因果规律,也可以在模拟环境中生成训练场景。
Google DeepMind的Genie以可互动环境模拟作为世界模型路线;Meta的V-JEPA 2则从影片学习物理表征,并测试预测与机器人规划。两者说明世界模型可以生成像素,也可以在抽象表征空间预测,不能只用画面逼真度判断能力。[2][3]
世界模型有时是系统中清楚分开的模型,有时预测能力被包含在更大的视觉语言模型、策略模型或端到端系统中。因此,系统的环境预测能力要从实际架构和测试结果确认;「World Model」名称本身只能提供产品定位。
3. 推理、规划与 VLA
推理层把用户目标和环境状态拆成可执行步骤;策略模型决定下一步动作;VLA(Vision-Language-Action,视觉—语言—动作模型)则尝试把视觉资讯和语言指令直接连接到机器人动作。
Google DeepMind把Gemini Robotics分成具身推理与VLA能力:前者理解环境、规划和调用工具,后者把视觉与指令转换成动作。这个例子说明,具身系统可以由多个专门模型协作。[4]
4. 身体、执行器与边缘计算
机械臂、人形机器人、自动驾驶汽车、无人机和工业设备是不同的 embodiment,也就是智能体作用于世界的具身载体。关节、马达、减速器、夹爪、制动、转向和其他执行器把模型决策变成物理动作;边缘计算平台则要在功耗、散热和即时延迟限制下运行模型。
同一个模型迁移到不同身体时,动作空间、负载、视角、感应器和安全边界都会改变。所谓「跨本体泛化」是重要目标,但不能仅由展示影片推断已经解决。
5. 反馈、评估与安全
动作完成后,系统必须重新感知环境,判断任务是否成功,并在失败或危险出现时停止、改道或交还控制权。这个环节可用来区分普通自动化脚本与较完整的具身智能闭环。
现实部署还需要传统控制、功能安全、权限管理、日志、遥距急停和人工监督。生成式模型能力提高,并不会自动消除机械、电气和运营安全要求。
世界模型、具身智能与人形机器人是什么关系
人形机器人只是具身智能的一种载体,不是 Physical AI 的全部。自动驾驶汽车、仓储机械臂、移动机器人、无人机、手术机器人甚至可自主调整的工业系统,都可能形成感知和行动闭环。
三者可以这样理解:
- 世界模型提供「环境如何变化」的表征或预测能力;
- 策略模型或 VLA 决定「下一步做什么」;
- 具身智能强调「通过这个身体行动,并从结果继续学习」;
- Physical AI 把模型、仿真、算力、感应器、执行器和安全系统整合成可部署的现实应用。
NVIDIA Cosmos提供世界基础模型、数据处理与评估工具;Isaac GR00T参考设计把数据采集、仿真、模型、中间件、机载计算与实体硬件连起来。前者位于模型与开发基础设施,后者覆盖更完整的具身部署链。[5][6]
如果只想查看相关上市公司与业务纯度,可转到物理 AI 概念股与港美股产业链;世界模型玩家与上市敞口则见世界模型概念股。
投资产业链应该如何拆
Physical AI公司的商业模式分布在平台、模型、零件、整机和运营服务。判断投资敞口时,应先确认公司销售哪一层产品、由谁付费、收入已走到哪个阶段。
| 产业层 | 主要产品或能力 | 可核对的商业证据 | 常见判断错误 |
|---|---|---|---|
| 云端算力与开发平台 | 训练芯片、网络、仿真、模型开发工具 | 云端使用量、开发者采用、客户部署、财务分部 | 把全部数据中心收入视为机器人收入 |
| 世界模型与软件 | 模型、API、合成数据、评估与训练平台 | 正式产品、付费 API、授权、客户项目 | 把论文、开源模型或展示等同成熟营收 |
| 感知与边缘计算 | 摄影机、激光雷达、处理器、机器人计算平台 | 出货量、量产车型或机器人客户、产品收入 | 把 ADAS、工业和机器人出货混为一谈 |
| 执行器与零部件 | 马达、关节、减速器、夹爪、驱动与控制器 | 定点、订单、量产、业务收入 | 根据供应链传闻推断客户与份额 |
| 整机与系统整合 | 人形机器人、机械臂、自动驾驶系统、工业方案 | 付费部署、交付数量、利用率、服务收入 | 用试点、合作备忘录或现场展示代替商业化 |
| 运营与应用 | Robotaxi、仓储、制造、医疗和其他服务 | 收费用户、任务量、单位经济、监管许可 | 忽略安全责任、维护成本和地域限制 |
产业链会出现上下游重叠。例如,一家公司可能同时提供芯片、仿真软件和机器人模型;另一家公司则购买这些平台,专注整机或运营。研究时需要分别核对产品关系和财务口径,不能因为它位于「上游」就自动推断利润最终落在这一层。
想进一步查看人形整机,可参考人形机器人概念股;自动驾驶应用见Robotaxi 概念股;基金产品的持仓与费用差异见机器人 ETF 比较。
如何判断公司已走到哪个商业阶段
可以把证据强度分成四级:
- 研究与叙事:管理层提到 Physical AI,发布论文、概念影片或研发计划。
- 可用产品:存在模型、开发套件、硬件、API 或可核对的技术文件。
- 客户与部署:出现具名客户、量产项目、付费试点、出货或真实任务数据。
- 财务可见度:公司披露订单、收入、毛利、资本开支或独立业务指标。
第一级可以证明公司关注这个方向,却不能证明商业价值;第二、三级说明技术正在进入产品,但仍要核对客户是否付费、部署能否扩大;第四级最接近基本面,却也要避免把一个大分部的全部收入归因于 Physical AI。
截至2026年9月,NVIDIA、Google DeepMind和Meta已公开可核对的模型与开发体系;其财务披露仍把相关投入放在更大的平台或研发范围内。这类敞口应按产品采用、客户部署和后续收入口径跟踪。
哪些技术问题仍未解决
模拟到现实的差距
模拟环境无法完整复现材料摩擦、感应器噪声、设备磨损、人员行为和罕见意外。模型在虚拟环境成功,不代表真机可以用相同成功率工作。
长尾场景与安全责任
物理系统的错误会造成设备损坏、人身风险和法律责任。测试覆盖、故障保护、人工接管和监管许可,往往比单次模型展示更决定商业化速度。
数据与评估口径
机器人数据昂贵且任务差异大,不同公司的成功率、任务难度和测试环境通常不可直接比较。没有公开任务定义和失败样本的「成功率」很难用于横向判断。
硬件成本与单位经济
感应器、机载计算、执行器、维护、电力和人工监督都会进入总成本。能完成任务不等于部署后比人工或传统自动化更经济。
收入归属不清
大型科技公司的 Physical AI 能力可能分散在芯片、云、研究、汽车或机器人合作中。投资研究必须回到最新财报和公司文件,不能从技术领先直接推导短期财务贡献。
后续应该观察什么
- 世界模型是否从生成展示进入可重复的预测、规划和评估流程;
- VLA 或策略模型能否跨任务、跨环境和跨不同机器人身体迁移;
- 真实部署是否披露任务量、成功率、人工接管和安全事件口径;
- 感应器、算力与执行器成本是否随量产下降;
- 上市公司是否开始单列客户、订单、收入或资本开支;
- 监管与责任框架是否允许应用从封闭场景进入公共空间。
这些指标比单次发布会、机器人表演或「某公司进入 Physical AI」更能说明产业是否跨过商业化门槛。
常见问题
物理 AI 和具身智能是同一个概念吗? 两者经常被交替使用,但侧重点不同。Physical AI 更常指让 AI 在物理世界运行的完整工程与应用体系;具身智能强调智能体通过具体身体与环境形成感知、行动和反馈闭环。不同机构的用词会重叠,应结合具体系统判断。
世界模型一定是具身智能的一部分吗? 世界预测能力对复杂具身任务很重要,但不一定以独立、明确命名的 World Model 出现。部分系统把预测、记忆或环境表征包含在 VLA、策略模型或端到端架构中,因此不能只看产品名称。
大语言模型是世界模型吗? 大语言模型主要学习语言与其他训练数据中的模式,可以包含大量关于现实世界的知识,但这不等于已经建立可用于物理控制的世界模型。世界模型通常更强调环境状态、空间关系、时间变化和行动后果。
人形机器人是具身智能唯一的落地方式吗? 不是。机械臂、自动驾驶汽车、移动机器人、无人机和其他能感知环境并采取物理行动的设备,都可以成为具身智能载体。人形外观只是一种身体设计。
物理 AI 概念股有哪些? 相关公司分布在算力与平台、世界模型与软件、感知、执行器、整机和运营应用等环节,但业务纯度和收入可见度差异很大。具体港美股名单与证据分级可查看物理 AI 概念股产业链。
下一步阅读
想把概念落到上市公司,可由物理AI概念股与收入证据开始;要研究模型供应商,继续看世界模型概念股和NVIDIA Physical AI产品栈;要研究付费任务,进入人形机器人或Robotaxi产业页。
Klaro Research
资料来源与更新依据
资料截止:2026年9月3日
- [1] NVIDIA What Is Embodied AI?
第一方 · 行业资料 · 查阅:2026年9月3日
- [2] Google DeepMind Genie world models
第一方 · 行业资料 · 查阅:2026年9月3日
- [3] Meta AI V-JEPA 2 world model
第一方 · 行业资料 · 查阅:2026年9月3日
- [4] Google DeepMind Gemini Robotics
第一方 · 行业资料 · 查阅:2026年9月3日
- [5] NVIDIA NVIDIA Cosmos platform
第一方 · 行业资料 · 查阅:2026年9月3日
- [6] NVIDIA Open Humanoid Robot Reference Design
第一方 · 行业资料 · 发布:2026年3月16日 · 查阅:2026年9月3日
研究限制
- Physical AI、具身智能与世界模型没有跨机构强制统一定义;本文使用可核对工程角色的工作定义。
- 模型展示、研究基准和真实机器人部署衡量不同能力,不能由一项结果推断完整系统商业化。
需要重新检查的事件
- NVIDIA、Google DeepMind或Meta更改相关产品定义、模型架构或部署证据时重核概念边界。
- 上市公司开始独立披露世界模型、VLA或具身智能收入时更新产业映射。
本文仅供参考,不构成投资建议。