物理 AI、具身智能、世界模型有什么区别?

作者 Klaro 编辑部 ·发布于 2026年7月27日 ·最后更新2026年9月3日

物理AI、具身智能与世界模型在完整感知和行动闭环中的位置
世界模型负责表征或预测环境,具身智能强调身体与环境的反馈闭环,Physical AI涵盖完整工程与部署。
目录

物理 AI(Physical AI)、具身智能(Embodied AI)和世界模型(World Model)分别回答三个问题:完整系统如何在现实世界运行;智能体如何通过身体与环境形成反馈;模型如何表征或预测环境状态。三者会重叠,但在同一系统中承担的范围不同。

本文采用可直接核对产品与投资证据的工作定义:Physical AI是完整工程和部署范围;具身智能是感知—行动—反馈的学习方式;世界模型是环境表征、预测或生成能力。NVIDIA的定义把机器人、自动驾驶、建筑和工厂纳入能感知、推理与行动的物理系统,也说明「身体」不限于人形。[1]


三者有什么区别

概念 本文采用的工作定义 在完整系统中的位置 是否必须有实体身体 常见误解
Physical AI 把 AI 部署到现实环境,使系统能够感知、推理并采取物理行动 完整工程与应用范围 通常需要实体设备或能控制物理过程的系统 把它等同于人形机器人
具身智能 智能体依靠具体身体与环境互动,并通过反馈调整行为 贯穿感知、决策、执行与反馈的闭环 是;「身体」可以是机械臂、汽车、无人机,不只人形 认为只有长得像人的机器人才算具身
世界模型 学习环境状态及其变化,用来理解、预测或模拟行动后果 模型与认知层 否;可以先在纯虚拟环境训练和运行 把能生成影片的模型都视为成熟机器人「大脑」
VLA/策略模型 把视觉、语言、状态等输入转换成计划或动作 决策与控制层 本身不是身体,但通常服务于机器人或其他设备 认为它和世界模型一定是同一个模型
机器人/自动驾驶系统 承载感应器、计算与执行器的具体产品 身体与应用层 是 认为有自动化程式就等于具身智能

这套划分不是要制造新的标准,而是帮助读者回答三个不同问题:

  1. 系统是否真的能影响物理世界?
  2. 它是否形成了「感知—行动—反馈」的闭环?
  3. 世界模型究竟是独立组件、隐含能力,还是只有市场推广名称?

Physical AI、具身智能与世界模型在完整系统中的位置

Physical AI、具身智能与世界模型在完整系统中的位置

Physical AI概念关系手机版

Physical AI概念关系手机版

图:世界模型可以参与环境预测,但不是所有具身系统都必须有一个独立、显式命名的 World Model;Physical AI 的部署结果取决于整条闭环。

一套 Physical AI 系统如何运作

完整系统通常不是「一个大模型控制一切」,而是多个模型、感应器、计算平台和控制器共同工作。

1. 环境与感知

摄影机、激光雷达、深度感应器、触觉感应器、麦克风和设备状态首先把现实环境转换成机器可以处理的数据。感知模型需要识别对象、位置、速度、姿态、可通行区域和异常状态。

这一步决定系统「看见了什么」,感知、理解与安全行动是依次推进的三个能力层。感应器遮挡、光线变化、反射、噪声和设备漂移都会把错误带到后面的决策链。

2. 世界模型与记忆

世界模型尝试回答:「当前环境是什么状态,如果执行某个动作,接下来可能发生什么?」它可以学习空间关系、物体持续性、运动变化与部分因果规律,也可以在模拟环境中生成训练场景。

Google DeepMind的Genie以可互动环境模拟作为世界模型路线;Meta的V-JEPA 2则从影片学习物理表征,并测试预测与机器人规划。两者说明世界模型可以生成像素,也可以在抽象表征空间预测,不能只用画面逼真度判断能力。[2][3]

世界模型有时是系统中清楚分开的模型,有时预测能力被包含在更大的视觉语言模型、策略模型或端到端系统中。因此,系统的环境预测能力要从实际架构和测试结果确认;「World Model」名称本身只能提供产品定位。

3. 推理、规划与 VLA

推理层把用户目标和环境状态拆成可执行步骤;策略模型决定下一步动作;VLA(Vision-Language-Action,视觉—语言—动作模型)则尝试把视觉资讯和语言指令直接连接到机器人动作。

Google DeepMind把Gemini Robotics分成具身推理与VLA能力:前者理解环境、规划和调用工具,后者把视觉与指令转换成动作。这个例子说明,具身系统可以由多个专门模型协作。[4]

4. 身体、执行器与边缘计算

机械臂、人形机器人、自动驾驶汽车、无人机和工业设备是不同的 embodiment,也就是智能体作用于世界的具身载体。关节、马达、减速器、夹爪、制动、转向和其他执行器把模型决策变成物理动作;边缘计算平台则要在功耗、散热和即时延迟限制下运行模型。

同一个模型迁移到不同身体时,动作空间、负载、视角、感应器和安全边界都会改变。所谓「跨本体泛化」是重要目标,但不能仅由展示影片推断已经解决。

5. 反馈、评估与安全

动作完成后,系统必须重新感知环境,判断任务是否成功,并在失败或危险出现时停止、改道或交还控制权。这个环节可用来区分普通自动化脚本与较完整的具身智能闭环。

现实部署还需要传统控制、功能安全、权限管理、日志、遥距急停和人工监督。生成式模型能力提高,并不会自动消除机械、电气和运营安全要求。

世界模型、具身智能与人形机器人是什么关系

人形机器人只是具身智能的一种载体,不是 Physical AI 的全部。自动驾驶汽车、仓储机械臂、移动机器人、无人机、手术机器人甚至可自主调整的工业系统,都可能形成感知和行动闭环。

三者可以这样理解:

  • 世界模型提供「环境如何变化」的表征或预测能力;
  • 策略模型或 VLA 决定「下一步做什么」;
  • 具身智能强调「通过这个身体行动,并从结果继续学习」;
  • Physical AI 把模型、仿真、算力、感应器、执行器和安全系统整合成可部署的现实应用。

NVIDIA Cosmos提供世界基础模型、数据处理与评估工具;Isaac GR00T参考设计把数据采集、仿真、模型、中间件、机载计算与实体硬件连起来。前者位于模型与开发基础设施,后者覆盖更完整的具身部署链。[5][6]

如果只想查看相关上市公司与业务纯度,可转到物理 AI 概念股与港美股产业链;世界模型玩家与上市敞口则见世界模型概念股。

投资产业链应该如何拆

Physical AI公司的商业模式分布在平台、模型、零件、整机和运营服务。判断投资敞口时,应先确认公司销售哪一层产品、由谁付费、收入已走到哪个阶段。

产业层 主要产品或能力 可核对的商业证据 常见判断错误
云端算力与开发平台 训练芯片、网络、仿真、模型开发工具 云端使用量、开发者采用、客户部署、财务分部 把全部数据中心收入视为机器人收入
世界模型与软件 模型、API、合成数据、评估与训练平台 正式产品、付费 API、授权、客户项目 把论文、开源模型或展示等同成熟营收
感知与边缘计算 摄影机、激光雷达、处理器、机器人计算平台 出货量、量产车型或机器人客户、产品收入 把 ADAS、工业和机器人出货混为一谈
执行器与零部件 马达、关节、减速器、夹爪、驱动与控制器 定点、订单、量产、业务收入 根据供应链传闻推断客户与份额
整机与系统整合 人形机器人、机械臂、自动驾驶系统、工业方案 付费部署、交付数量、利用率、服务收入 用试点、合作备忘录或现场展示代替商业化
运营与应用 Robotaxi、仓储、制造、医疗和其他服务 收费用户、任务量、单位经济、监管许可 忽略安全责任、维护成本和地域限制

产业链会出现上下游重叠。例如,一家公司可能同时提供芯片、仿真软件和机器人模型;另一家公司则购买这些平台,专注整机或运营。研究时需要分别核对产品关系和财务口径,不能因为它位于「上游」就自动推断利润最终落在这一层。

想进一步查看人形整机,可参考人形机器人概念股;自动驾驶应用见Robotaxi 概念股;基金产品的持仓与费用差异见机器人 ETF 比较。

如何判断公司已走到哪个商业阶段

可以把证据强度分成四级:

  1. 研究与叙事:管理层提到 Physical AI,发布论文、概念影片或研发计划。
  2. 可用产品:存在模型、开发套件、硬件、API 或可核对的技术文件。
  3. 客户与部署:出现具名客户、量产项目、付费试点、出货或真实任务数据。
  4. 财务可见度:公司披露订单、收入、毛利、资本开支或独立业务指标。

第一级可以证明公司关注这个方向,却不能证明商业价值;第二、三级说明技术正在进入产品,但仍要核对客户是否付费、部署能否扩大;第四级最接近基本面,却也要避免把一个大分部的全部收入归因于 Physical AI。

截至2026年9月,NVIDIA、Google DeepMind和Meta已公开可核对的模型与开发体系;其财务披露仍把相关投入放在更大的平台或研发范围内。这类敞口应按产品采用、客户部署和后续收入口径跟踪。

哪些技术问题仍未解决

模拟到现实的差距

模拟环境无法完整复现材料摩擦、感应器噪声、设备磨损、人员行为和罕见意外。模型在虚拟环境成功,不代表真机可以用相同成功率工作。

长尾场景与安全责任

物理系统的错误会造成设备损坏、人身风险和法律责任。测试覆盖、故障保护、人工接管和监管许可,往往比单次模型展示更决定商业化速度。

数据与评估口径

机器人数据昂贵且任务差异大,不同公司的成功率、任务难度和测试环境通常不可直接比较。没有公开任务定义和失败样本的「成功率」很难用于横向判断。

硬件成本与单位经济

感应器、机载计算、执行器、维护、电力和人工监督都会进入总成本。能完成任务不等于部署后比人工或传统自动化更经济。

收入归属不清

大型科技公司的 Physical AI 能力可能分散在芯片、云、研究、汽车或机器人合作中。投资研究必须回到最新财报和公司文件,不能从技术领先直接推导短期财务贡献。

后续应该观察什么

  • 世界模型是否从生成展示进入可重复的预测、规划和评估流程;
  • VLA 或策略模型能否跨任务、跨环境和跨不同机器人身体迁移;
  • 真实部署是否披露任务量、成功率、人工接管和安全事件口径;
  • 感应器、算力与执行器成本是否随量产下降;
  • 上市公司是否开始单列客户、订单、收入或资本开支;
  • 监管与责任框架是否允许应用从封闭场景进入公共空间。

这些指标比单次发布会、机器人表演或「某公司进入 Physical AI」更能说明产业是否跨过商业化门槛。

常见问题

物理 AI 和具身智能是同一个概念吗? 两者经常被交替使用,但侧重点不同。Physical AI 更常指让 AI 在物理世界运行的完整工程与应用体系;具身智能强调智能体通过具体身体与环境形成感知、行动和反馈闭环。不同机构的用词会重叠,应结合具体系统判断。

世界模型一定是具身智能的一部分吗? 世界预测能力对复杂具身任务很重要,但不一定以独立、明确命名的 World Model 出现。部分系统把预测、记忆或环境表征包含在 VLA、策略模型或端到端架构中,因此不能只看产品名称。

大语言模型是世界模型吗? 大语言模型主要学习语言与其他训练数据中的模式,可以包含大量关于现实世界的知识,但这不等于已经建立可用于物理控制的世界模型。世界模型通常更强调环境状态、空间关系、时间变化和行动后果。

人形机器人是具身智能唯一的落地方式吗? 不是。机械臂、自动驾驶汽车、移动机器人、无人机和其他能感知环境并采取物理行动的设备,都可以成为具身智能载体。人形外观只是一种身体设计。

物理 AI 概念股有哪些? 相关公司分布在算力与平台、世界模型与软件、感知、执行器、整机和运营应用等环节,但业务纯度和收入可见度差异很大。具体港美股名单与证据分级可查看物理 AI 概念股产业链。

下一步阅读

想把概念落到上市公司,可由物理AI概念股与收入证据开始;要研究模型供应商,继续看世界模型概念股和NVIDIA Physical AI产品栈;要研究付费任务,进入人形机器人或Robotaxi产业页。

Klaro Research

资料来源与更新依据

资料截止:2026年9月3日

  1. [1] NVIDIA What Is Embodied AI?

    第一方 · 行业资料 · 查阅:2026年9月3日

  2. [2] Google DeepMind Genie world models

    第一方 · 行业资料 · 查阅:2026年9月3日

  3. [3] Meta AI V-JEPA 2 world model

    第一方 · 行业资料 · 查阅:2026年9月3日

  4. [4] Google DeepMind Gemini Robotics

    第一方 · 行业资料 · 查阅:2026年9月3日

  5. [5] NVIDIA NVIDIA Cosmos platform

    第一方 · 行业资料 · 查阅:2026年9月3日

  6. [6] NVIDIA Open Humanoid Robot Reference Design

    第一方 · 行业资料 · 发布:2026年3月16日 · 查阅:2026年9月3日

研究限制

  • Physical AI、具身智能与世界模型没有跨机构强制统一定义;本文使用可核对工程角色的工作定义。
  • 模型展示、研究基准和真实机器人部署衡量不同能力,不能由一项结果推断完整系统商业化。

需要重新检查的事件

  • NVIDIA、Google DeepMind或Meta更改相关产品定义、模型架构或部署证据时重核概念边界。
  • 上市公司开始独立披露世界模型、VLA或具身智能收入时更新产业映射。

本文仅供参考,不构成投资建议。