物理 AI、具身智能、世界模型有甚麼區別?
目錄
物理 AI(Physical AI)、具身智能(Embodied AI)和世界模型(World Model)分別回答三個問題:完整系統如何在現實世界運行;智能體如何透過身體與環境形成反饋;模型如何表徵或預測環境狀態。三者會重疊,但在同一系統中承擔的範圍不同。
本文採用可直接核對產品與投資證據的工作定義:Physical AI是完整工程和部署範圍;具身智能是感知—行動—反饋的學習方式;世界模型是環境表徵、預測或生成能力。NVIDIA的定義把機器人、自動駕駛、建築和工廠納入能感知、推理與行動的物理系統,也說明「身體」不限於人形。[1]
三者有甚麼區別
| 概念 | 本文採用的工作定義 | 在完整系統中的位置 | 是否必須有實體身體 | 常見誤解 |
|---|---|---|---|---|
| Physical AI | 把 AI 部署到現實環境,使系統能夠感知、推理並採取物理行動 | 完整工程與應用範圍 | 通常需要實體設備或能控制物理過程的系統 | 把它等同於人形機器人 |
| 具身智能 | 智能體依靠具體身體與環境互動,並透過反饋調整行為 | 貫穿感知、決策、執行與反饋的閉環 | 是;「身體」可以是機械臂、汽車、無人機,不只人形 | 認為只有長得像人的機器人才算具身 |
| 世界模型 | 學習環境狀態及其變化,用來理解、預測或模擬行動後果 | 模型與認知層 | 否;可以先在純虛擬環境訓練和運行 | 把能生成影片的模型都視為成熟機器人「大腦」 |
| VLA/策略模型 | 把視覺、語言、狀態等輸入轉換成計劃或動作 | 決策與控制層 | 本身不是身體,但通常服務於機器人或其他設備 | 認為它和世界模型一定是同一個模型 |
| 機器人/自動駕駛系統 | 承載感應器、計算與執行器的具體產品 | 身體與應用層 | 是 | 認為有自動化程式就等於具身智能 |
這套劃分不是要製造新的標準,而是幫助讀者回答三個不同問題:
- 系統是否真的能影響物理世界?
- 它是否形成了「感知—行動—反饋」的閉環?
- 世界模型究竟是獨立組件、隱含能力,還是只有市場推廣名稱?
圖:世界模型可以參與環境預測,但不是所有具身系統都必須有一個獨立、顯式命名的 World Model;Physical AI 的部署結果取決於整條閉環。
一套 Physical AI 系統如何運作
完整系統通常不是「一個大模型控制一切」,而是多個模型、感應器、計算平台和控制器共同工作。
1. 環境與感知
攝影機、激光雷達、深度感應器、觸覺感應器、麥克風和設備狀態首先把現實環境轉換成機器可以處理的數據。感知模型需要識別對象、位置、速度、姿態、可通行區域和異常狀態。
這一步決定系統「看見了甚麼」,感知、理解與安全行動是依次推進的三個能力層。感應器遮擋、光線變化、反射、噪聲和設備漂移都會把錯誤帶到後面的決策鏈。
2. 世界模型與記憶
世界模型嘗試回答:「當前環境是甚麼狀態,如果執行某個動作,接下來可能發生甚麼?」它可以學習空間關係、物體持續性、運動變化與部分因果規律,也可以在模擬環境中生成訓練場景。
Google DeepMind的Genie以可互動環境模擬作為世界模型路線;Meta的V-JEPA 2則從影片學習物理表徵,並測試預測與機器人規劃。兩者說明世界模型可以生成像素,也可以在抽象表徵空間預測,不能只用畫面逼真度判斷能力。[2][3]
世界模型有時是系統中清楚分開的模型,有時預測能力被包含在更大的視覺語言模型、策略模型或端到端系統中。因此,系統的環境預測能力要從實際架構和測試結果確認;「World Model」名稱本身只能提供產品定位。
3. 推理、規劃與 VLA
推理層把用戶目標和環境狀態拆成可執行步驟;策略模型決定下一步動作;VLA(Vision-Language-Action,視覺—語言—動作模型)則嘗試把視覺資訊和語言指令直接連接到機器人動作。
Google DeepMind把Gemini Robotics分成具身推理與VLA能力:前者理解環境、規劃和調用工具,後者把視覺與指令轉換成動作。這個例子說明,具身系統可以由多個專門模型協作。[4]
4. 身體、執行器與邊緣計算
機械臂、人形機器人、自動駕駛汽車、無人機和工業設備是不同的 embodiment,也就是智能體作用於世界的具身載體。關節、馬達、減速器、夾爪、制動、轉向和其他執行器把模型決策變成物理動作;邊緣計算平台則要在功耗、散熱和即時延遲限制下運行模型。
同一個模型遷移到不同身體時,動作空間、負載、視角、感應器和安全邊界都會改變。所謂「跨本體泛化」是重要目標,但不能僅由展示影片推斷已經解決。
5. 反饋、評估與安全
動作完成後,系統必須重新感知環境,判斷任務是否成功,並在失敗或危險出現時停止、改道或交還控制權。這個環節可用來區分普通自動化腳本與較完整的具身智能閉環。
現實部署還需要傳統控制、功能安全、權限管理、日誌、遙距急停和人工監督。生成式模型能力提高,並不會自動消除機械、電氣和營運安全要求。
世界模型、具身智能與人形機器人是甚麼關係
人形機器人只是具身智能的一種載體,不是 Physical AI 的全部。自動駕駛汽車、倉儲機械臂、移動機器人、無人機、手術機器人甚至可自主調整的工業系統,都可能形成感知和行動閉環。
三者可以這樣理解:
- 世界模型提供「環境如何變化」的表徵或預測能力;
- 策略模型或 VLA 決定「下一步做甚麼」;
- 具身智能強調「透過這個身體行動,並從結果繼續學習」;
- Physical AI 把模型、仿真、算力、感應器、執行器和安全系統整合成可部署的現實應用。
NVIDIA Cosmos提供世界基礎模型、數據處理與評估工具;Isaac GR00T參考設計把數據採集、仿真、模型、中間件、機載計算與實體硬件連起來。前者位於模型與開發基礎設施,後者覆蓋更完整的具身部署鏈。[5][6]
如果只想查看相關上市公司與業務純度,可轉到物理 AI 概念股與港美股產業鏈;世界模型玩家與上市敞口則見世界模型概念股。
投資產業鏈應該如何拆
Physical AI公司的商業模式分布在平台、模型、零件、整機和營運服務。判斷投資敞口時,應先確認公司銷售哪一層產品、由誰付費、收入已走到哪個階段。
| 產業層 | 主要產品或能力 | 可核對的商業證據 | 常見判斷錯誤 |
|---|---|---|---|
| 雲端算力與開發平台 | 訓練芯片、網絡、仿真、模型開發工具 | 雲端使用量、開發者採用、客戶部署、財務分部 | 把全部數據中心收入視為機器人收入 |
| 世界模型與軟件 | 模型、API、合成數據、評估與訓練平台 | 正式產品、付費 API、授權、客戶項目 | 把論文、開源模型或展示等同成熟營收 |
| 感知與邊緣計算 | 攝影機、激光雷達、處理器、機器人計算平台 | 出貨量、量產車型或機器人客戶、產品收入 | 把 ADAS、工業和機器人出貨混為一談 |
| 執行器與零部件 | 馬達、關節、減速器、夾爪、驅動與控制器 | 定點、訂單、量產、業務收入 | 根據供應鏈傳聞推斷客戶與份額 |
| 整機與系統整合 | 人形機器人、機械臂、自動駕駛系統、工業方案 | 付費部署、交付數量、利用率、服務收入 | 用試點、合作備忘錄或現場展示代替商業化 |
| 營運與應用 | Robotaxi、倉儲、製造、醫療和其他服務 | 收費用戶、任務量、單位經濟、監管許可 | 忽略安全責任、維護成本和地域限制 |
產業鏈會出現上下游重疊。例如,一家公司可能同時提供芯片、仿真軟件和機器人模型;另一家公司則購買這些平台,專注整機或營運。研究時需要分別核對產品關係和財務口徑,不能因為它位於「上游」就自動推斷利潤最終落在這一層。
想進一步查看人形整機,可參考人形機器人概念股;自動駕駛應用見Robotaxi 概念股;基金產品的持倉與費用差異見機器人 ETF 比較。
如何判斷公司已走到哪個商業階段
可以把證據強度分成四級:
- 研究與敘事:管理層提到 Physical AI,發佈論文、概念影片或研發計劃。
- 可用產品:存在模型、開發套件、硬件、API 或可核對的技術文件。
- 客戶與部署:出現具名客戶、量產項目、付費試點、出貨或真實任務數據。
- 財務可見度:公司披露訂單、收入、毛利、資本開支或獨立業務指標。
第一級可以證明公司關注這個方向,卻不能證明商業價值;第二、三級說明技術正在進入產品,但仍要核對客戶是否付費、部署能否擴大;第四級最接近基本面,卻也要避免把一個大分部的全部收入歸因於 Physical AI。
截至2026年9月,NVIDIA、Google DeepMind和Meta已公開可核對的模型與開發體系;其財務披露仍把相關投入放在更大的平台或研發範圍內。這類敞口應按產品採用、客戶部署和後續收入口徑跟蹤。
哪些技術問題仍未解決
模擬到現實的差距
模擬環境無法完整復現材料摩擦、感應器噪聲、設備磨損、人員行為和罕見意外。模型在虛擬環境成功,不代表真機可以用相同成功率工作。
長尾場景與安全責任
物理系統的錯誤會造成設備損壞、人身風險和法律責任。測試覆蓋、故障保護、人工接管和監管許可,往往比單次模型展示更決定商業化速度。
數據與評估口徑
機器人數據昂貴且任務差異大,不同公司的成功率、任務難度和測試環境通常不可直接比較。沒有公開任務定義和失敗樣本的「成功率」很難用於橫向判斷。
硬件成本與單位經濟
感應器、機載計算、執行器、維護、電力和人工監督都會進入總成本。能完成任務不等於部署後比人工或傳統自動化更經濟。
收入歸屬不清
大型科技公司的 Physical AI 能力可能分散在芯片、雲、研究、汽車或機器人合作中。投資研究必須回到最新財報和公司文件,不能從技術領先直接推導短期財務貢獻。
後續應該觀察甚麼
- 世界模型是否從生成展示進入可重複的預測、規劃和評估流程;
- VLA 或策略模型能否跨任務、跨環境和跨不同機器人身體遷移;
- 真實部署是否披露任務量、成功率、人工接管和安全事件口徑;
- 感應器、算力與執行器成本是否隨量產下降;
- 上市公司是否開始單列客戶、訂單、收入或資本開支;
- 監管與責任框架是否允許應用從封閉場景進入公共空間。
這些指標比單次發佈會、機器人表演或「某公司進入 Physical AI」更能說明產業是否跨過商業化門檻。
常見問題
物理 AI 和具身智能是同一個概念嗎? 兩者經常被交替使用,但側重點不同。Physical AI 更常指讓 AI 在物理世界運行的完整工程與應用體系;具身智能強調智能體透過具體身體與環境形成感知、行動和反饋閉環。不同機構的用詞會重疊,應結合具體系統判斷。
世界模型一定是具身智能的一部分嗎? 世界預測能力對複雜具身任務很重要,但不一定以獨立、明確命名的 World Model 出現。部分系統把預測、記憶或環境表徵包含在 VLA、策略模型或端到端架構中,因此不能只看產品名稱。
大語言模型是世界模型嗎? 大語言模型主要學習語言與其他訓練數據中的模式,可以包含大量關於現實世界的知識,但這不等於已經建立可用於物理控制的世界模型。世界模型通常更強調環境狀態、空間關係、時間變化和行動後果。
人形機器人是具身智能唯一的落地方式嗎? 不是。機械臂、自動駕駛汽車、移動機器人、無人機和其他能感知環境並採取物理行動的設備,都可以成為具身智能載體。人形外觀只是一種身體設計。
物理 AI 概念股有哪些? 相關公司分佈在算力與平台、世界模型與軟件、感知、執行器、整機和營運應用等環節,但業務純度和收入可見度差異很大。具體港美股名單與證據分級可查看物理 AI 概念股產業鏈。
下一步閱讀
想把概念落到上市公司,可由物理AI概念股與收入證據開始;要研究模型供應商,繼續看世界模型概念股和NVIDIA Physical AI產品棧;要研究付費任務,進入人形機器人或Robotaxi產業頁。
Klaro Research
資料來源與更新依據
資料截止:2026年9月3日
- [1] NVIDIA What Is Embodied AI?
第一方 · 行業資料 · 查閲:2026年9月3日
- [2] Google DeepMind Genie world models
第一方 · 行業資料 · 查閲:2026年9月3日
- [3] Meta AI V-JEPA 2 world model
第一方 · 行業資料 · 查閲:2026年9月3日
- [4] Google DeepMind Gemini Robotics
第一方 · 行業資料 · 查閲:2026年9月3日
- [5] NVIDIA NVIDIA Cosmos platform
第一方 · 行業資料 · 查閲:2026年9月3日
- [6] NVIDIA Open Humanoid Robot Reference Design
第一方 · 行業資料 · 發佈:2026年3月16日 · 查閲:2026年9月3日
研究限制
- Physical AI、具身智能與世界模型沒有跨機構強制統一定義;本文使用可核對工程角色的工作定義。
- 模型展示、研究基準和真實機器人部署衡量不同能力,不能由一項結果推斷完整系統商業化。
需要重新檢查的事件
- NVIDIA、Google DeepMind或Meta更改相關產品定義、模型架構或部署證據時重核概念邊界。
- 上市公司開始獨立披露世界模型、VLA或具身智能收入時更新產業映射。
本文僅供參考,不構成投資建議。