物理 AI、具身智能、世界模型有甚麼區別?

作者 Klaro 編輯部 ·發佈於 2026年7月27日 ·最後更新2026年9月3日

物理AI、具身智能與世界模型在完整感知和行動閉環中的位置
世界模型負責表徵或預測環境,具身智能強調身體與環境的反饋閉環,Physical AI涵蓋完整工程與部署。
目錄

物理 AI(Physical AI)、具身智能(Embodied AI)和世界模型(World Model)分別回答三個問題:完整系統如何在現實世界運行;智能體如何透過身體與環境形成反饋;模型如何表徵或預測環境狀態。三者會重疊,但在同一系統中承擔的範圍不同。

本文採用可直接核對產品與投資證據的工作定義:Physical AI是完整工程和部署範圍;具身智能是感知—行動—反饋的學習方式;世界模型是環境表徵、預測或生成能力。NVIDIA的定義把機器人、自動駕駛、建築和工廠納入能感知、推理與行動的物理系統,也說明「身體」不限於人形。[1]


三者有甚麼區別

概念 本文採用的工作定義 在完整系統中的位置 是否必須有實體身體 常見誤解
Physical AI 把 AI 部署到現實環境,使系統能夠感知、推理並採取物理行動 完整工程與應用範圍 通常需要實體設備或能控制物理過程的系統 把它等同於人形機器人
具身智能 智能體依靠具體身體與環境互動,並透過反饋調整行為 貫穿感知、決策、執行與反饋的閉環 是;「身體」可以是機械臂、汽車、無人機,不只人形 認為只有長得像人的機器人才算具身
世界模型 學習環境狀態及其變化,用來理解、預測或模擬行動後果 模型與認知層 否;可以先在純虛擬環境訓練和運行 把能生成影片的模型都視為成熟機器人「大腦」
VLA/策略模型 把視覺、語言、狀態等輸入轉換成計劃或動作 決策與控制層 本身不是身體,但通常服務於機器人或其他設備 認為它和世界模型一定是同一個模型
機器人/自動駕駛系統 承載感應器、計算與執行器的具體產品 身體與應用層 是 認為有自動化程式就等於具身智能

這套劃分不是要製造新的標準,而是幫助讀者回答三個不同問題:

  1. 系統是否真的能影響物理世界?
  2. 它是否形成了「感知—行動—反饋」的閉環?
  3. 世界模型究竟是獨立組件、隱含能力,還是只有市場推廣名稱?

Physical AI、具身智能與世界模型在完整系統中的位置

Physical AI、具身智能与世界模型在完整系统中的位置

Physical AI概念關係手機版

Physical AI概念关系手机版

圖:世界模型可以參與環境預測,但不是所有具身系統都必須有一個獨立、顯式命名的 World Model;Physical AI 的部署結果取決於整條閉環。

一套 Physical AI 系統如何運作

完整系統通常不是「一個大模型控制一切」,而是多個模型、感應器、計算平台和控制器共同工作。

1. 環境與感知

攝影機、激光雷達、深度感應器、觸覺感應器、麥克風和設備狀態首先把現實環境轉換成機器可以處理的數據。感知模型需要識別對象、位置、速度、姿態、可通行區域和異常狀態。

這一步決定系統「看見了甚麼」,感知、理解與安全行動是依次推進的三個能力層。感應器遮擋、光線變化、反射、噪聲和設備漂移都會把錯誤帶到後面的決策鏈。

2. 世界模型與記憶

世界模型嘗試回答:「當前環境是甚麼狀態,如果執行某個動作,接下來可能發生甚麼?」它可以學習空間關係、物體持續性、運動變化與部分因果規律,也可以在模擬環境中生成訓練場景。

Google DeepMind的Genie以可互動環境模擬作為世界模型路線;Meta的V-JEPA 2則從影片學習物理表徵,並測試預測與機器人規劃。兩者說明世界模型可以生成像素,也可以在抽象表徵空間預測,不能只用畫面逼真度判斷能力。[2][3]

世界模型有時是系統中清楚分開的模型,有時預測能力被包含在更大的視覺語言模型、策略模型或端到端系統中。因此,系統的環境預測能力要從實際架構和測試結果確認;「World Model」名稱本身只能提供產品定位。

3. 推理、規劃與 VLA

推理層把用戶目標和環境狀態拆成可執行步驟;策略模型決定下一步動作;VLA(Vision-Language-Action,視覺—語言—動作模型)則嘗試把視覺資訊和語言指令直接連接到機器人動作。

Google DeepMind把Gemini Robotics分成具身推理與VLA能力:前者理解環境、規劃和調用工具,後者把視覺與指令轉換成動作。這個例子說明,具身系統可以由多個專門模型協作。[4]

4. 身體、執行器與邊緣計算

機械臂、人形機器人、自動駕駛汽車、無人機和工業設備是不同的 embodiment,也就是智能體作用於世界的具身載體。關節、馬達、減速器、夾爪、制動、轉向和其他執行器把模型決策變成物理動作;邊緣計算平台則要在功耗、散熱和即時延遲限制下運行模型。

同一個模型遷移到不同身體時,動作空間、負載、視角、感應器和安全邊界都會改變。所謂「跨本體泛化」是重要目標,但不能僅由展示影片推斷已經解決。

5. 反饋、評估與安全

動作完成後,系統必須重新感知環境,判斷任務是否成功,並在失敗或危險出現時停止、改道或交還控制權。這個環節可用來區分普通自動化腳本與較完整的具身智能閉環。

現實部署還需要傳統控制、功能安全、權限管理、日誌、遙距急停和人工監督。生成式模型能力提高,並不會自動消除機械、電氣和營運安全要求。

世界模型、具身智能與人形機器人是甚麼關係

人形機器人只是具身智能的一種載體,不是 Physical AI 的全部。自動駕駛汽車、倉儲機械臂、移動機器人、無人機、手術機器人甚至可自主調整的工業系統,都可能形成感知和行動閉環。

三者可以這樣理解:

  • 世界模型提供「環境如何變化」的表徵或預測能力;
  • 策略模型或 VLA 決定「下一步做甚麼」;
  • 具身智能強調「透過這個身體行動,並從結果繼續學習」;
  • Physical AI 把模型、仿真、算力、感應器、執行器和安全系統整合成可部署的現實應用。

NVIDIA Cosmos提供世界基礎模型、數據處理與評估工具;Isaac GR00T參考設計把數據採集、仿真、模型、中間件、機載計算與實體硬件連起來。前者位於模型與開發基礎設施,後者覆蓋更完整的具身部署鏈。[5][6]

如果只想查看相關上市公司與業務純度,可轉到物理 AI 概念股與港美股產業鏈;世界模型玩家與上市敞口則見世界模型概念股。

投資產業鏈應該如何拆

Physical AI公司的商業模式分布在平台、模型、零件、整機和營運服務。判斷投資敞口時,應先確認公司銷售哪一層產品、由誰付費、收入已走到哪個階段。

產業層 主要產品或能力 可核對的商業證據 常見判斷錯誤
雲端算力與開發平台 訓練芯片、網絡、仿真、模型開發工具 雲端使用量、開發者採用、客戶部署、財務分部 把全部數據中心收入視為機器人收入
世界模型與軟件 模型、API、合成數據、評估與訓練平台 正式產品、付費 API、授權、客戶項目 把論文、開源模型或展示等同成熟營收
感知與邊緣計算 攝影機、激光雷達、處理器、機器人計算平台 出貨量、量產車型或機器人客戶、產品收入 把 ADAS、工業和機器人出貨混為一談
執行器與零部件 馬達、關節、減速器、夾爪、驅動與控制器 定點、訂單、量產、業務收入 根據供應鏈傳聞推斷客戶與份額
整機與系統整合 人形機器人、機械臂、自動駕駛系統、工業方案 付費部署、交付數量、利用率、服務收入 用試點、合作備忘錄或現場展示代替商業化
營運與應用 Robotaxi、倉儲、製造、醫療和其他服務 收費用戶、任務量、單位經濟、監管許可 忽略安全責任、維護成本和地域限制

產業鏈會出現上下游重疊。例如,一家公司可能同時提供芯片、仿真軟件和機器人模型;另一家公司則購買這些平台,專注整機或營運。研究時需要分別核對產品關係和財務口徑,不能因為它位於「上游」就自動推斷利潤最終落在這一層。

想進一步查看人形整機,可參考人形機器人概念股;自動駕駛應用見Robotaxi 概念股;基金產品的持倉與費用差異見機器人 ETF 比較。

如何判斷公司已走到哪個商業階段

可以把證據強度分成四級:

  1. 研究與敘事:管理層提到 Physical AI,發佈論文、概念影片或研發計劃。
  2. 可用產品:存在模型、開發套件、硬件、API 或可核對的技術文件。
  3. 客戶與部署:出現具名客戶、量產項目、付費試點、出貨或真實任務數據。
  4. 財務可見度:公司披露訂單、收入、毛利、資本開支或獨立業務指標。

第一級可以證明公司關注這個方向,卻不能證明商業價值;第二、三級說明技術正在進入產品,但仍要核對客戶是否付費、部署能否擴大;第四級最接近基本面,卻也要避免把一個大分部的全部收入歸因於 Physical AI。

截至2026年9月,NVIDIA、Google DeepMind和Meta已公開可核對的模型與開發體系;其財務披露仍把相關投入放在更大的平台或研發範圍內。這類敞口應按產品採用、客戶部署和後續收入口徑跟蹤。

哪些技術問題仍未解決

模擬到現實的差距

模擬環境無法完整復現材料摩擦、感應器噪聲、設備磨損、人員行為和罕見意外。模型在虛擬環境成功,不代表真機可以用相同成功率工作。

長尾場景與安全責任

物理系統的錯誤會造成設備損壞、人身風險和法律責任。測試覆蓋、故障保護、人工接管和監管許可,往往比單次模型展示更決定商業化速度。

數據與評估口徑

機器人數據昂貴且任務差異大,不同公司的成功率、任務難度和測試環境通常不可直接比較。沒有公開任務定義和失敗樣本的「成功率」很難用於橫向判斷。

硬件成本與單位經濟

感應器、機載計算、執行器、維護、電力和人工監督都會進入總成本。能完成任務不等於部署後比人工或傳統自動化更經濟。

收入歸屬不清

大型科技公司的 Physical AI 能力可能分散在芯片、雲、研究、汽車或機器人合作中。投資研究必須回到最新財報和公司文件,不能從技術領先直接推導短期財務貢獻。

後續應該觀察甚麼

  • 世界模型是否從生成展示進入可重複的預測、規劃和評估流程;
  • VLA 或策略模型能否跨任務、跨環境和跨不同機器人身體遷移;
  • 真實部署是否披露任務量、成功率、人工接管和安全事件口徑;
  • 感應器、算力與執行器成本是否隨量產下降;
  • 上市公司是否開始單列客戶、訂單、收入或資本開支;
  • 監管與責任框架是否允許應用從封閉場景進入公共空間。

這些指標比單次發佈會、機器人表演或「某公司進入 Physical AI」更能說明產業是否跨過商業化門檻。

常見問題

物理 AI 和具身智能是同一個概念嗎? 兩者經常被交替使用,但側重點不同。Physical AI 更常指讓 AI 在物理世界運行的完整工程與應用體系;具身智能強調智能體透過具體身體與環境形成感知、行動和反饋閉環。不同機構的用詞會重疊,應結合具體系統判斷。

世界模型一定是具身智能的一部分嗎? 世界預測能力對複雜具身任務很重要,但不一定以獨立、明確命名的 World Model 出現。部分系統把預測、記憶或環境表徵包含在 VLA、策略模型或端到端架構中,因此不能只看產品名稱。

大語言模型是世界模型嗎? 大語言模型主要學習語言與其他訓練數據中的模式,可以包含大量關於現實世界的知識,但這不等於已經建立可用於物理控制的世界模型。世界模型通常更強調環境狀態、空間關係、時間變化和行動後果。

人形機器人是具身智能唯一的落地方式嗎? 不是。機械臂、自動駕駛汽車、移動機器人、無人機和其他能感知環境並採取物理行動的設備,都可以成為具身智能載體。人形外觀只是一種身體設計。

物理 AI 概念股有哪些? 相關公司分佈在算力與平台、世界模型與軟件、感知、執行器、整機和營運應用等環節,但業務純度和收入可見度差異很大。具體港美股名單與證據分級可查看物理 AI 概念股產業鏈。

下一步閱讀

想把概念落到上市公司,可由物理AI概念股與收入證據開始;要研究模型供應商,繼續看世界模型概念股和NVIDIA Physical AI產品棧;要研究付費任務,進入人形機器人或Robotaxi產業頁。

Klaro Research

資料來源與更新依據

資料截止:2026年9月3日

  1. [1] NVIDIA What Is Embodied AI?

    第一方 · 行業資料 · 查閲:2026年9月3日

  2. [2] Google DeepMind Genie world models

    第一方 · 行業資料 · 查閲:2026年9月3日

  3. [3] Meta AI V-JEPA 2 world model

    第一方 · 行業資料 · 查閲:2026年9月3日

  4. [4] Google DeepMind Gemini Robotics

    第一方 · 行業資料 · 查閲:2026年9月3日

  5. [5] NVIDIA NVIDIA Cosmos platform

    第一方 · 行業資料 · 查閲:2026年9月3日

  6. [6] NVIDIA Open Humanoid Robot Reference Design

    第一方 · 行業資料 · 發佈:2026年3月16日 · 查閲:2026年9月3日

研究限制

  • Physical AI、具身智能與世界模型沒有跨機構強制統一定義;本文使用可核對工程角色的工作定義。
  • 模型展示、研究基準和真實機器人部署衡量不同能力,不能由一項結果推斷完整系統商業化。

需要重新檢查的事件

  • NVIDIA、Google DeepMind或Meta更改相關產品定義、模型架構或部署證據時重核概念邊界。
  • 上市公司開始獨立披露世界模型、VLA或具身智能收入時更新產業映射。

本文僅供參考,不構成投資建議。