物理 AI、具身智能、世界模型有甚麼區別?技術棧與產業鏈

作者 Klaro 編輯部 ·發佈於 2026年7月27日

機器人在倉庫中感知物體,左側虛擬環境呈現世界模型模擬的多種未來動作
世界模型負責表徵或預測環境,具身智能強調身體與環境的反饋閉環,Physical AI 則把模型、算力、感應器和執行系統部署到現實任務中。
目錄

物理 AI(Physical AI)、具身智能(Embodied AI)和世界模型(World Model)不是嚴格同義詞:本文採用一套便於核對技術與業務的工作定義——Physical AI 是讓 AI 在物理世界感知、推理和行動的完整工程系統;具身智能強調智能體透過具體身體與環境持續互動;世界模型則負責表徵、預測或模擬環境狀態,通常只是完整系統中的一層。

產業界會交叉使用這些術語,並不存在一套獲所有公司和研究機構共同採用的邊界。例如,NVIDIA 的 Embodied AI 詞條把機器人、自動駕駛汽車、建築和工廠都納入能感知、推理和行動的物理系統;NVIDIA 同時又用 Physical AI 描述更廣的開發與部署體系。因此,與其爭論何者的涵蓋範圍必然較大,更具實際意義的做法是檢查一個系統是否具備 環境、感知、模型、決策、身體、動作與反饋 這些環節。


三者有甚麼區別

概念 本文採用的工作定義 在完整系統中的位置 是否必須有實體身體 常見誤解
Physical AI 把 AI 部署到現實環境,使系統能夠感知、推理並採取物理行動 完整工程與應用範圍 通常需要實體設備或能控制物理過程的系統 把它等同於人形機器人
具身智能 智能體依靠具體身體與環境互動,並透過反饋調整行為 貫穿感知、決策、執行與反饋的閉環 是;「身體」可以是機械臂、汽車、無人機,不只人形 認為只有長得像人的機器人才算具身
世界模型 學習環境狀態及其變化,用來理解、預測或模擬行動後果 模型與認知層 否;可以先在純虛擬環境訓練和運行 把能生成影片的模型都視為成熟機器人「大腦」
VLA/策略模型 把視覺、語言、狀態等輸入轉換成計劃或動作 決策與控制層 本身不是身體,但通常服務於機器人或其他設備 認為它和世界模型一定是同一個模型
機器人/自動駕駛系統 承載感應器、計算與執行器的具體產品 身體與應用層 認為有自動化程式就等於具身智能

這套劃分不是要製造新的標準,而是幫助讀者回答三個不同問題:

  1. 系統是否真的能影響物理世界?
  2. 它是否形成了「感知—行動—反饋」的閉環?
  3. 世界模型究竟是獨立組件、隱含能力,還是只有市場推廣名稱?

Physical AI 系統從環境感知、世界模型到具身執行的繁體中文閉環關係圖

Physical AI 系統從環境感知、世界模型到具身執行的簡體中文閉環關係圖

Physical AI 系統從感知、世界模型、VLA 到身體執行的繁體中文手機直版閉環關係圖

Physical AI 系統從感知、世界模型、VLA 到身體執行的簡體中文手機直版閉環關係圖

圖:世界模型可以參與環境預測,但不是所有具身系統都必須有一個獨立、顯式命名的 World Model;Physical AI 的部署結果取決於整條閉環。

一套 Physical AI 系統如何運作

完整系統通常不是「一個大模型控制一切」,而是多個模型、感應器、計算平台和控制器共同工作。

1. 環境與感知

攝影機、激光雷達、深度感應器、觸覺感應器、麥克風和設備狀態首先把現實環境轉換成機器可以處理的數據。感知模型需要識別對象、位置、速度、姿態、可通行區域和異常狀態。

這一步決定系統「看見了甚麼」,但看見不等於理解,更不等於可以安全行動。感應器遮擋、光線變化、反射、噪聲和設備漂移都會把錯誤帶到後面的決策鏈。

2. 世界模型與記憶

世界模型嘗試回答:「當前環境是甚麼狀態,如果執行某個動作,接下來可能發生甚麼?」它可以學習空間關係、物體持續性、運動變化與部分因果規律,也可以在模擬環境中生成訓練場景。

Google DeepMind 對 Genie 的說明把世界模型描述為能夠模擬環境,並表示智能體的行動如何改變世界;Meta 的 V-JEPA 2 官方介紹則展示了從影片學習物理表徵、預測與機器人規劃的另一條路線。兩者說明「世界模型」不是單一固定架構,也不能只用畫面是否逼真判斷能力。

世界模型有時是系統中清楚分開的模型,有時預測能力被包含在更大的視覺語言模型、策略模型或端到端系統中。因此,沒有獨立命名的 World Model,不代表系統完全沒有環境預測;公司使用了「世界模型」一詞,也不代表它已經能可靠控制實體設備。

3. 推理、規劃與 VLA

推理層把用戶目標和環境狀態拆成可執行步驟;策略模型決定下一步動作;VLA(Vision-Language-Action,視覺—語言—動作模型)則嘗試把視覺資訊和語言指令直接連接到機器人動作。

Google DeepMind 的 Gemini Robotics 官方頁面把系統分成具身推理模型和 VLA 模型:前者負責理解環境、規劃和調用工具,後者把視覺與指令轉換成動作。這個例子說明,具身智能可以是多個專門模型組合,而不是必須由單一模型完成所有工作。

4. 身體、執行器與邊緣計算

機械臂、人形機器人、自動駕駛汽車、無人機和工業設備是不同的 embodiment,也就是智能體作用於世界的具身載體。關節、馬達、減速器、夾爪、制動、轉向和其他執行器把模型決策變成物理動作;邊緣計算平台則要在功耗、散熱和即時延遲限制下運行模型。

同一個模型遷移到不同身體時,動作空間、負載、視角、感應器和安全邊界都會改變。所謂「跨本體泛化」是重要目標,但不能僅由展示影片推斷已經解決。

5. 反饋、評估與安全

動作完成後,系統必須重新感知環境,判斷任務是否成功,並在失敗或危險出現時停止、改道或交還控制權。這個環節可用來區分普通自動化腳本與較完整的具身智能閉環。

現實部署還需要傳統控制、功能安全、權限管理、日誌、遙距急停和人工監督。生成式模型能力提高,並不會自動消除機械、電氣和營運安全要求。

世界模型、具身智能與人形機器人是甚麼關係

人形機器人只是具身智能的一種載體,不是 Physical AI 的全部。自動駕駛汽車、倉儲機械臂、移動機器人、無人機、手術機器人甚至可自主調整的工業系統,都可能形成感知和行動閉環。

三者可以這樣理解:

  • 世界模型提供「環境如何變化」的表徵或預測能力;
  • 策略模型或 VLA 決定「下一步做甚麼」;
  • 具身智能強調「透過這個身體行動,並從結果繼續學習」;
  • Physical AI 把模型、仿真、算力、感應器、執行器和安全系統整合成可部署的現實應用。

例如,NVIDIA Cosmos提供世界基礎模型、數據處理和評估工具,用於機器人、自動駕駛與視覺系統的模擬和訓練;NVIDIA Isaac GR00T 參考平台進一步把數據採集、仿真、模型、機器人中間件、機載計算和實體硬件連接起來。前者更接近世界模型與開發基礎設施,後者展示的是更完整的具身部署鏈。

如果只想查看相關上市公司與業務純度,可轉到物理 AI 概念股與港美股產業鏈;世界模型玩家與上市敞口則見世界模型概念股

投資產業鏈應該如何拆

「Physical AI 公司」不是一種相同的商業模式。判斷投資敞口時,應先確認公司究竟銷售哪一層產品、由誰付費、收入是否已經出現。

產業層 主要產品或能力 可核對的商業證據 常見判斷錯誤
雲端算力與開發平台 訓練芯片、網絡、仿真、模型開發工具 雲端使用量、開發者採用、客戶部署、財務分部 把全部數據中心收入視為機器人收入
世界模型與軟件 模型、API、合成數據、評估與訓練平台 正式產品、付費 API、授權、客戶項目 把論文、開源模型或展示等同成熟營收
感知與邊緣計算 攝影機、激光雷達、處理器、機器人計算平台 出貨量、量產車型或機器人客戶、產品收入 把 ADAS、工業和機器人出貨混為一談
執行器與零部件 馬達、關節、減速器、夾爪、驅動與控制器 定點、訂單、量產、業務收入 根據供應鏈傳聞推斷客戶與份額
整機與系統整合 人形機器人、機械臂、自動駕駛系統、工業方案 付費部署、交付數量、利用率、服務收入 用試點、合作備忘錄或現場展示代替商業化
營運與應用 Robotaxi、倉儲、製造、醫療和其他服務 收費用戶、任務量、單位經濟、監管許可 忽略安全責任、維護成本和地域限制

產業鏈會出現上下游重疊。例如,一家公司可能同時提供芯片、仿真軟件和機器人模型;另一家公司則購買這些平台,專注整機或營運。研究時需要分別核對產品關係和財務口徑,不能因為它位於「上游」就自動推斷利潤最終落在這一層。

想進一步查看人形整機,可參考人形機器人概念股;自動駕駛應用見Robotaxi 概念股;基金產品的持倉與費用差異見機器人 ETF 比較

如何判斷一家公司不是只貼概念標籤

可以把證據強度分成四級:

  1. 研究與敘事:管理層提到 Physical AI,發佈論文、概念影片或研發計劃。
  2. 可用產品:存在模型、開發套件、硬件、API 或可核對的技術文件。
  3. 客戶與部署:出現具名客戶、量產項目、付費試點、出貨或真實任務數據。
  4. 財務可見度:公司披露訂單、收入、毛利、資本開支或獨立業務指標。

第一級可以證明公司關注這個方向,卻不能證明商業價值;第二、三級說明技術正在進入產品,但仍要核對客戶是否付費、部署能否擴大;第四級最接近基本面,卻也要避免把一個大分部的全部收入歸因於 Physical AI。

截至 2026 年 7 月,NVIDIA、Google DeepMind 和 Meta 已公開可核對的模型與開發體系,但相關公司通常沒有單獨披露「世界模型收入」或「具身智能收入」。這類業務更適合按產品採用、客戶部署和後續財務口徑持續跟蹤,而不是把公司總 AI 收入直接套進主題。

哪些技術問題仍未解決

模擬到現實的差距

模擬環境無法完整復現材料摩擦、感應器噪聲、設備磨損、人員行為和罕見意外。模型在虛擬環境成功,不代表真機可以用相同成功率工作。

長尾場景與安全責任

物理系統的錯誤會造成設備損壞、人身風險和法律責任。測試覆蓋、故障保護、人工接管和監管許可,往往比單次模型展示更決定商業化速度。

數據與評估口徑

機器人數據昂貴且任務差異大,不同公司的成功率、任務難度和測試環境通常不可直接比較。沒有公開任務定義和失敗樣本的「成功率」很難用於橫向判斷。

硬件成本與單位經濟

感應器、機載計算、執行器、維護、電力和人工監督都會進入總成本。能完成任務不等於部署後比人工或傳統自動化更經濟。

收入歸屬不清

大型科技公司的 Physical AI 能力可能分散在芯片、雲、研究、汽車或機器人合作中。投資研究必須回到最新財報和公司文件,不能從技術領先直接推導短期財務貢獻。

後續應該觀察甚麼

  • 世界模型是否從生成展示進入可重複的預測、規劃和評估流程;
  • VLA 或策略模型能否跨任務、跨環境和跨不同機器人身體遷移;
  • 真實部署是否披露任務量、成功率、人工接管和安全事件口徑;
  • 感應器、算力與執行器成本是否隨量產下降;
  • 上市公司是否開始單列客戶、訂單、收入或資本開支;
  • 監管與責任框架是否允許應用從封閉場景進入公共空間。

這些指標比單次發佈會、機器人表演或「某公司進入 Physical AI」更能說明產業是否跨過商業化門檻。

常見問題

物理 AI 和具身智能是同一個概念嗎? 兩者經常被交替使用,但側重點不同。Physical AI 更常指讓 AI 在物理世界運行的完整工程與應用體系;具身智能強調智能體透過具體身體與環境形成感知、行動和反饋閉環。不同機構的用詞會重疊,應結合具體系統判斷。

世界模型一定是具身智能的一部分嗎? 世界預測能力對複雜具身任務很重要,但不一定以獨立、明確命名的 World Model 出現。部分系統把預測、記憶或環境表徵包含在 VLA、策略模型或端到端架構中,因此不能只看產品名稱。

大語言模型是世界模型嗎? 大語言模型主要學習語言與其他訓練數據中的模式,可以包含大量關於現實世界的知識,但這不等於已經建立可用於物理控制的世界模型。世界模型通常更強調環境狀態、空間關係、時間變化和行動後果。

人形機器人是具身智能唯一的落地方式嗎? 不是。機械臂、自動駕駛汽車、移動機器人、無人機和其他能感知環境並採取物理行動的設備,都可以成為具身智能載體。人形外觀只是一種身體設計。

物理 AI 概念股有哪些? 相關公司分佈在算力與平台、世界模型與軟件、感知、執行器、整機和營運應用等環節,但業務純度和收入可見度差異很大。具體港美股名單與證據分級可查看物理 AI 概念股產業鏈

官方資料與延伸閱讀

本文僅供參考,不構成投資建議。