晶片巨頭AMD最近半年動作多,美股股價已漲209%,比起同期漲37.56%的輝達(NVDA)亮眼。本週一蘇姿丰更宣布以82億美元全股票併購人工智慧先驅李飛飛創辦的World Labs。NVIDIA先前力推Cosmos 3,Google DeepMind發表Genie 3,科技巨頭同樣關注世界模型(World Model)的發展。世界模型到底是什麼?它跟過去只會聊天的ChatGPT、或是生成影片的Seedance、Sora有何本質差別?AI的下一波概念股題材就看這裡?
【目錄】
• 什麼是世界模型?
• 世界模型跟大型語言模型、Sora影片生成有何不同?
• 為什麼AMD、NVIDIA、Google科技巨頭都要研發世界模型?
• 世界模型有哪些應用?
2026年9月28日,半導體大廠AMD正式宣布已達成協議,將以約82億美元全股票交易收購AI新創公司World Labs,這家公司由知名電腦視覺學者、史丹佛大學教授李飛飛與團隊於2024年共同創立。當日,AMD收盤跌3.61%,報 607.87 美元;但盤後收購消息公布後,股價小幅上漲約0.4%。
延伸閱讀: 蘇姿丰來台指AI Agent與CPU正崛起!AMD下階段晶片突破在這
根據World Labs公告,收購完成後,李飛飛將正式加入AMD擔任執行副總裁兼首席科學家,直接向董事長暨執行長蘇姿丰匯報。
不過,當前全球AI熱潮多半圍繞在大型語言模型與AI Agent的應用,為何一家全球晶片大廠,願意砸下天價買下一家主打「空間智慧」與「世界模型」的年輕新創?
正如李飛飛在宣布World Labs與AMD達成收購協議的公開專文中所言,「真實世界不是由文字組成的,而是由實體事物構成。語言本身並不足以支撐未來的模型發展。」

她強調,從科學探索、數位娛樂到機器人,許多AI難題都要求模型理解物理世界的結構與行為。
倘若AI要走出螢幕、進入工廠、道路與家庭,只掌握文字與語言並不足夠。從NVIDIA Cosmos 3、Google DeepMind Genie 3與Gemini Robotics,到AMD重金收購World Labs,世界模型正成為科技巨頭布局的下一塊戰場。
究竟什麼是世界模型?它為什麼重要?
什麼是世界模型?
要理解世界模型,可以先想像人類如何在行動前預判後果。
伸出手拿東西時,我們會自然判斷周遭物體的位置,避免碰撞或打翻。這種「預測環境如何隨行動改變」的能力,就是世界模型試圖掌握的方向。
Google DeepMind研究副總裁紀懷新(Ed Chi)過去接受《遠見》專訪時,曾以生動的日常例子點出若要完成上述動作,所需要的能力究竟為何。
「我把水放在這,它有可能會倒下去嗎?這種預測問題也是對物理世界的了解,」他解釋,當人們討論機器人時,機器人必須先理解,手臂出多少力才能夾起水瓶而不致捏破,還得知道需要用什麼角度,才能拿起水瓶。
「如果是人類撞倒水瓶,根本不用思考就知道倒了,但是機器人要怎麼捕捉到這件事情?這都是要克服的挑戰。」
具體來說,「世界模型」目前並沒有一致的定義。

資策會資深產業分析師楊淳安解釋,可以從三種能力理解世界模型:首先是「渲染」,描繪環境樣貌;其次是「模擬」,建立幾何與物理狀態,推演環境如何變化;最後是「規劃」,根據環境與目標決定下一步行動。
World Labs也採取類似分類,將世界模型分為渲染器(Renderers)、模擬器(Simulators)與規劃器(Planners),並指出三者界線正在逐漸融合。
簡單來說,世界模型是一系列讓AI建立「世界如何運作」內部表徵的技術,其中一個重要方向,就是回答:「如果我採取某個行動,接下來世界可能發生什麼變化?」
世界模型跟大型語言模型、Sora影片生成有何不同?
有人可能會問,過去三年下來,我們已經看過ChatGPT寫文章、寫程式,也看過Seedance生成以假亂真的影片,也看過機械手臂點揀貨物、機器人在晚會上大秀舞藝。
如此說來,世界模型跟它們到底有何不同?
以ChatGPT背後的GPT模型為代表的大型語言模型(LLM)來說,Meta首席AI科學家楊立昆(Yann LeCun)長年對其提出質疑。
他主張,LLM主要透過預測下一個符元(token)學習文字統計結構,欠缺像人類與動物一樣從感知建立理解世界運作方式的能力,因此,僅靠大型語言模型不足以建立對實體世界的完整理解,
對照之下,世界模型更重視從視覺、空間與互動經驗中,學習物體與環境如何變化。
其次,則是既有影像生成模型仍有局限。

2024年初,OpenAI發表Sora時,以「Video generation models as world simulators」為技術報告標題,主張影片生成可能成為通往世界模擬器的一條路。
不過,許多影片生成模型的目標,是生成視覺上合理、前後連貫的時空序列,即使畫面逼真,仍可能出現物理錯誤、物件變形或憑空出現等現象,讓觀者發現破綻。
此外,傳統影片生成大多是在給定條件後產生一段既定序列,並不要求模型在使用者或AI Agent持續採取行動時,即時重新推演接下來的世界狀態。
對照之下,互動式世界模型更強調根據外部動作持續更新環境,讓使用者或AI Agent的每一步行動,都能影響模型接下來生成的世界。
最後則是近來也頗受討論的VLM、VLA,廣泛運用在實體AI與機器人領域中。這兩類模型與世界模型強調的能力不同,但彼此正逐漸走向融合。
「視覺語言模型(VLM)」主要負責「看懂」世界。例如看到桌上的水杯,能辨識物體、理解場景,並回答「這是一只裝滿水的玻璃杯」,不過,它本身通常不直接輸出機器人的控制動作。
「視覺-語言-動作模型(VLA)」則進一步把感知與語言指令轉化為動作,例如收到「抓取水杯」的指令後,模型可以根據相機畫面,直接輸出機械手臂的移動與抓取指令。
不過,直接從觀察映射到動作,和「理解這個動作接下來會如何改變世界」仍是兩種不同能力。

早期VLA模型在陌生物件、環境變化與長時間任務上,往往容易受到訓練資料分布限制;近年的模型則正快速補強泛化、規劃與自我修正能力。
圖策機器人處長陳哲堅舉例,如果訓練一隻機器手臂拿滑鼠,即使模型看過大量相似資料,當滑鼠翻面、位置改變或環境出現新的干擾時,仍可能因為缺乏足夠的泛化能力而失敗。
因此,VLA與世界模型並非互相取代。前者將感知與指令轉化為行動,後者則可協助預測行動後果、規劃與修正;前沿模型正逐漸把這些能力整合在同一套系統中。
為什麼NVIDIA、Google科技巨頭都要研發世界模型?
世界模型受到重視的一大原因,在於真實世界的情境與變化難以靠人工逐一建構。楊淳安便直言,具身智慧當前最核心的痛點已經不是技術路線之爭,而是實體AI訓練資料極度匱乏。
以訓練機器人來說,動作收集緩慢、人力昂貴,且機器人在真實環境中反覆摸索碰撞,動輒損壞造價昂貴的手臂與感測器,訓練機器人代價極高。
過去產業界的折衷辦法,是將機器人丟進類似電玩遊戲的3D物理模擬器中練習,但仰賴既有物理引擎、人工建立的3D資產與大量參數調校。
只是,現實環境複雜,被壓扁的寶特瓶、油膩的抹布或者反光的地磚,有著太多細節,難以將真實世界的所有細節全錄入電腦當中。因此,才會有機器人在模擬器裡很聰明,一到真實世界就頻頻出錯的情況發生。
陳哲堅指出,若直接在真機上反覆試錯,發生嚴重錯誤時,可能造成昂貴硬體損壞;世界模型則讓部分訓練與驗證能先移往模擬環境,大幅降低試錯成本。
以World Labs最新的Atlas模型為例,它能從少量真實影像或影片重建具空間一致性的3D環境,並進一步用於Real-to-Sim機器人模擬。開發者可以在模擬環境中改變物件、位置、機器人動作、光線與背景等條件,產生更多訓練與測試情境。
這正是科技大廠積極布局世界模型的原因之一。
對晶片商來說,下一波AI負載不再只有LLM運算,隨著AI走向3D生成、機器人、模擬與Physical AI,運算需求也將變得更加多元。

蘇姿丰因此指出,「打造下一代AI運算平台,需要對模型如何演進有深刻理解。」
在敲定收購協議前,雙方也已合作在AMD Instinct GPU上最佳化相關工作負載。把模型研究團隊納入旗下,讓AMD能更直接掌握下一代AI需要什麼樣的軟硬體。
AMD競爭對手NVIDIA更早就開始布局。黃仁勳近年持續將Physical AI定位為下一波重要運算浪潮,並以Cosmos世界模型搭配Omniverse、Isaac與Jetson平台,從模擬、機器人開發一路延伸至邊緣運算,形成完整的Physical AI技術堆疊。
延伸閱讀: 輝達黃仁勳宣布推Cosmos世界模型「機器人的ChatGPT時刻即將到來」
Google DeepMind主席哈薩比斯(Demis Hassabis)另外表示,具備互動能力的通用世界模型,是AI在物理世界學習與探索的重要一步。他們以Genie 3打造可即時探索的互動世界,同時透過Gemini Robotics推進機器人的空間推理、規劃與控制。
世界模型有哪些應用?
世界模型的商業價值並不需要等到通用人形機器人成熟才出現。目前相關技術已開始切入數位內容生成,也逐步被用來強化既有的模擬與訓練流程;長期則可能進一步成為通用實體機器人理解與預測環境的重要基礎。
楊淳安觀察,相較於長遠的機器人目標,短期之內遊戲設計與數位內容產製,可能是世界模型最有可能率先規模化商業落地的舞台。
過去打造3D遊戲或虛擬場景,需要美術與開發團隊逐步建立幾何模型、貼圖材質與互動邏輯。如今,世界模型開始提供另一條路徑:直接生成可探索、甚至可即時互動的虛擬環境。
新創公司Decart 推出的 Oasis 世界模型曾展示由神經網路即時生成、可透過鍵盤操作的類《Minecraft》互動世界。Google DeepMind的Genie 3亦能從文字描述生成可即時探索的互動環境,並根據使用者的操作持續生成後續世界狀態。

中期應用則可望進入自駕等高風險系統的安全驗證,因為許多罕見、危險情境難以直接在真實道路中反覆測試。
英國自駕獨角獸Wayve 推出的 GAIA-4 世界模型,與需要事先建立3D場景與模擬規則的傳統方法不同,GAIA-4直接從真實道路紀錄學習,並根據AI Driver的轉向、加減速等駕駛決策,持續生成下一步的感測器輸入,讓模型的每一次行動都會改變接下來看到的世界,形成「閉環模擬(Closed-loop Simulation)」,讓AI司機能在大量虛擬與反事實情境中接受安全評估。
長期的終極願景,則是走入人類社會的通用實體機器人。
例如,挪威人形機器人新創1X便成立World Model Lab,將世界模型直接納入機器人預訓練,希望讓人形機器人擺脫只能處理固定環境、狹窄任務的限制,進一步提升泛化、適應與自主學習能力。
過去三年,生成式AI證明了機器掌握人類語言的潛力;下一步,則是讓AI理解空間、物理與行動後果。
從遊戲、自駕模擬到機器人,世界模型正在把AI從螢幕裡的「回答者」,推向能在虛擬與真實世界中預測、規劃與行動的系統。AMD、NVIDIA與Google此刻提前卡位,爭的正是下一代AI與實體世界接軌的入口。不少投資專家看好,這趨勢也將捧出又一波新秀,概念股即將成軍。