物理 AI、具身智能、世界模型有什么区别?技术栈与产业链
目录
物理 AI(Physical AI)、具身智能(Embodied AI)和世界模型(World Model)不是严格同义词:本文采用一套便于核对技术与业务的工作定义——Physical AI 是让 AI 在物理世界感知、推理和行动的完整工程系统;具身智能强调智能体透过具体身体与环境持续互动;世界模型则负责表征、预测或模拟环境状态,通常只是完整系统中的一层。
产业界会交叉使用这些术语,并不存在一套获所有公司和研究机构共同采用的边界。例如,NVIDIA 的 Embodied AI 词条把机器人、自动驾驶汽车、建筑和工厂都纳入能感知、推理和行动的物理系统;NVIDIA 同时又用 Physical AI 描述更广的开发与部署体系。因此,与其争论何者的涵盖范围必然较大,更具实际意义的做法是检查一个系统是否具备 环境、感知、模型、决策、身体、动作与反馈 这些环节。
三者有什么区别
| 概念 | 本文采用的工作定义 | 在完整系统中的位置 | 是否必须有实体身体 | 常见误解 |
|---|---|---|---|---|
| Physical AI | 把 AI 部署到现实环境,使系统能够感知、推理并采取物理行动 | 完整工程与应用范围 | 通常需要实体设备或能控制物理过程的系统 | 把它等同于人形机器人 |
| 具身智能 | 智能体依靠具体身体与环境互动,并透过反馈调整行为 | 贯穿感知、决策、执行与反馈的闭环 | 是;「身体」可以是机械臂、汽车、无人机,不只人形 | 认为只有长得像人的机器人才算具身 |
| 世界模型 | 学习环境状态及其变化,用来理解、预测或模拟行动后果 | 模型与认知层 | 否;可以先在纯虚拟环境训练和运行 | 把能生成影片的模型都视为成熟机器人「大脑」 |
| VLA/策略模型 | 把视觉、语言、状态等输入转换成计划或动作 | 决策与控制层 | 本身不是身体,但通常服务于机器人或其他设备 | 认为它和世界模型一定是同一个模型 |
| 机器人/自动驾驶系统 | 承载感应器、计算与执行器的具体产品 | 身体与应用层 | 是 | 认为有自动化程式就等于具身智能 |
这套划分不是要制造新的标准,而是帮助读者回答三个不同问题:
- 系统是否真的能影响物理世界?
- 它是否形成了「感知—行动—反馈」的闭环?
- 世界模型究竟是独立组件、隐含能力,还是只有市场推广名称?




图:世界模型可以参与环境预测,但不是所有具身系统都必须有一个独立、显式命名的 World Model;Physical AI 的部署结果取决于整条闭环。
一套 Physical AI 系统如何运作
完整系统通常不是「一个大模型控制一切」,而是多个模型、感应器、计算平台和控制器共同工作。
1. 环境与感知
摄影机、激光雷达、深度感应器、触觉感应器、麦克风和设备状态首先把现实环境转换成机器可以处理的数据。感知模型需要识别对象、位置、速度、姿态、可通行区域和异常状态。
这一步决定系统「看见了什么」,但看见不等于理解,更不等于可以安全行动。感应器遮挡、光线变化、反射、噪声和设备漂移都会把错误带到后面的决策链。
2. 世界模型与记忆
世界模型尝试回答:「当前环境是什么状态,如果执行某个动作,接下来可能发生什么?」它可以学习空间关系、物体持续性、运动变化与部分因果规律,也可以在模拟环境中生成训练场景。
Google DeepMind 对 Genie 的说明把世界模型描述为能够模拟环境,并表示智能体的行动如何改变世界;Meta 的 V-JEPA 2 官方介绍则展示了从影片学习物理表征、预测与机器人规划的另一条路线。两者说明「世界模型」不是单一固定架构,也不能只用画面是否逼真判断能力。
世界模型有时是系统中清楚分开的模型,有时预测能力被包含在更大的视觉语言模型、策略模型或端到端系统中。因此,没有独立命名的 World Model,不代表系统完全没有环境预测;公司使用了「世界模型」一词,也不代表它已经能可靠控制实体设备。
3. 推理、规划与 VLA
推理层把用户目标和环境状态拆成可执行步骤;策略模型决定下一步动作;VLA(Vision-Language-Action,视觉—语言—动作模型)则尝试把视觉资讯和语言指令直接连接到机器人动作。
Google DeepMind 的 Gemini Robotics 官方页面把系统分成具身推理模型和 VLA 模型:前者负责理解环境、规划和调用工具,后者把视觉与指令转换成动作。这个例子说明,具身智能可以是多个专门模型组合,而不是必须由单一模型完成所有工作。
4. 身体、执行器与边缘计算
机械臂、人形机器人、自动驾驶汽车、无人机和工业设备是不同的 embodiment,也就是智能体作用于世界的具身载体。关节、马达、减速器、夹爪、制动、转向和其他执行器把模型决策变成物理动作;边缘计算平台则要在功耗、散热和即时延迟限制下运行模型。
同一个模型迁移到不同身体时,动作空间、负载、视角、感应器和安全边界都会改变。所谓「跨本体泛化」是重要目标,但不能仅由展示影片推断已经解决。
5. 反馈、评估与安全
动作完成后,系统必须重新感知环境,判断任务是否成功,并在失败或危险出现时停止、改道或交还控制权。这个环节可用来区分普通自动化脚本与较完整的具身智能闭环。
现实部署还需要传统控制、功能安全、权限管理、日志、遥距急停和人工监督。生成式模型能力提高,并不会自动消除机械、电气和营运安全要求。
世界模型、具身智能与人形机器人是什么关系
人形机器人只是具身智能的一种载体,不是 Physical AI 的全部。自动驾驶汽车、仓储机械臂、移动机器人、无人机、手术机器人甚至可自主调整的工业系统,都可能形成感知和行动闭环。
三者可以这样理解:
- 世界模型提供「环境如何变化」的表征或预测能力;
- 策略模型或 VLA 决定「下一步做什么」;
- 具身智能强调「透过这个身体行动,并从结果继续学习」;
- Physical AI 把模型、仿真、算力、感应器、执行器和安全系统整合成可部署的现实应用。
例如,NVIDIA Cosmos提供世界基础模型、数据处理和评估工具,用于机器人、自动驾驶与视觉系统的模拟和训练;NVIDIA Isaac GR00T 参考平台进一步把数据采集、仿真、模型、机器人中间件、机载计算和实体硬件连接起来。前者更接近世界模型与开发基础设施,后者展示的是更完整的具身部署链。
如果只想查看相关上市公司与业务纯度,可转到物理 AI 概念股与港美股产业链;世界模型玩家与上市敞口则见世界模型概念股。
投资产业链应该如何拆
「Physical AI 公司」不是一种相同的商业模式。判断投资敞口时,应先确认公司究竟销售哪一层产品、由谁付费、收入是否已经出现。
| 产业层 | 主要产品或能力 | 可核对的商业证据 | 常见判断错误 |
|---|---|---|---|
| 云端算力与开发平台 | 训练芯片、网络、仿真、模型开发工具 | 云端使用量、开发者采用、客户部署、财务分部 | 把全部数据中心收入视为机器人收入 |
| 世界模型与软件 | 模型、API、合成数据、评估与训练平台 | 正式产品、付费 API、授权、客户项目 | 把论文、开源模型或展示等同成熟营收 |
| 感知与边缘计算 | 摄影机、激光雷达、处理器、机器人计算平台 | 出货量、量产车型或机器人客户、产品收入 | 把 ADAS、工业和机器人出货混为一谈 |
| 执行器与零部件 | 马达、关节、减速器、夹爪、驱动与控制器 | 定点、订单、量产、业务收入 | 根据供应链传闻推断客户与份额 |
| 整机与系统整合 | 人形机器人、机械臂、自动驾驶系统、工业方案 | 付费部署、交付数量、利用率、服务收入 | 用试点、合作备忘录或现场展示代替商业化 |
| 营运与应用 | Robotaxi、仓储、制造、医疗和其他服务 | 收费用户、任务量、单位经济、监管许可 | 忽略安全责任、维护成本和地域限制 |
产业链会出现上下游重叠。例如,一家公司可能同时提供芯片、仿真软件和机器人模型;另一家公司则购买这些平台,专注整机或营运。研究时需要分别核对产品关系和财务口径,不能因为它位于「上游」就自动推断利润最终落在这一层。
想进一步查看人形整机,可参考人形机器人概念股;自动驾驶应用见Robotaxi 概念股;基金产品的持仓与费用差异见机器人 ETF 比较。
如何判断一家公司不是只贴概念标签
可以把证据强度分成四级:
- 研究与叙事:管理层提到 Physical AI,发布论文、概念影片或研发计划。
- 可用产品:存在模型、开发套件、硬件、API 或可核对的技术文件。
- 客户与部署:出现具名客户、量产项目、付费试点、出货或真实任务数据。
- 财务可见度:公司披露订单、收入、毛利、资本开支或独立业务指标。
第一级可以证明公司关注这个方向,却不能证明商业价值;第二、三级说明技术正在进入产品,但仍要核对客户是否付费、部署能否扩大;第四级最接近基本面,却也要避免把一个大分部的全部收入归因于 Physical AI。
截至 2026 年 7 月,NVIDIA、Google DeepMind 和 Meta 已公开可核对的模型与开发体系,但相关公司通常没有单独披露「世界模型收入」或「具身智能收入」。这类业务更适合按产品采用、客户部署和后续财务口径持续跟踪,而不是把公司总 AI 收入直接套进主题。
哪些技术问题仍未解决
模拟到现实的差距
模拟环境无法完整复现材料摩擦、感应器噪声、设备磨损、人员行为和罕见意外。模型在虚拟环境成功,不代表真机可以用相同成功率工作。
长尾场景与安全责任
物理系统的错误会造成设备损坏、人身风险和法律责任。测试覆盖、故障保护、人工接管和监管许可,往往比单次模型展示更决定商业化速度。
数据与评估口径
机器人数据昂贵且任务差异大,不同公司的成功率、任务难度和测试环境通常不可直接比较。没有公开任务定义和失败样本的「成功率」很难用于横向判断。
硬件成本与单位经济
感应器、机载计算、执行器、维护、电力和人工监督都会进入总成本。能完成任务不等于部署后比人工或传统自动化更经济。
收入归属不清
大型科技公司的 Physical AI 能力可能分散在芯片、云、研究、汽车或机器人合作中。投资研究必须回到最新财报和公司文件,不能从技术领先直接推导短期财务贡献。
后续应该观察什么
- 世界模型是否从生成展示进入可重复的预测、规划和评估流程;
- VLA 或策略模型能否跨任务、跨环境和跨不同机器人身体迁移;
- 真实部署是否披露任务量、成功率、人工接管和安全事件口径;
- 感应器、算力与执行器成本是否随量产下降;
- 上市公司是否开始单列客户、订单、收入或资本开支;
- 监管与责任框架是否允许应用从封闭场景进入公共空间。
这些指标比单次发布会、机器人表演或「某公司进入 Physical AI」更能说明产业是否跨过商业化门槛。
常见问题
物理 AI 和具身智能是同一个概念吗? 两者经常被交替使用,但侧重点不同。Physical AI 更常指让 AI 在物理世界运行的完整工程与应用体系;具身智能强调智能体透过具体身体与环境形成感知、行动和反馈闭环。不同机构的用词会重叠,应结合具体系统判断。
世界模型一定是具身智能的一部分吗? 世界预测能力对复杂具身任务很重要,但不一定以独立、明确命名的 World Model 出现。部分系统把预测、记忆或环境表征包含在 VLA、策略模型或端到端架构中,因此不能只看产品名称。
大语言模型是世界模型吗? 大语言模型主要学习语言与其他训练数据中的模式,可以包含大量关于现实世界的知识,但这不等于已经建立可用于物理控制的世界模型。世界模型通常更强调环境状态、空间关系、时间变化和行动后果。
人形机器人是具身智能唯一的落地方式吗? 不是。机械臂、自动驾驶汽车、移动机器人、无人机和其他能感知环境并采取物理行动的设备,都可以成为具身智能载体。人形外观只是一种身体设计。
物理 AI 概念股有哪些? 相关公司分布在算力与平台、世界模型与软件、感知、执行器、整机和营运应用等环节,但业务纯度和收入可见度差异很大。具体港美股名单与证据分级可查看物理 AI 概念股产业链。
官方资料与延伸阅读
本文仅供参考,不构成投资建议。