美國人工智慧(AI)新貴Anthropic公司研究員考克森這週辭職時表示,他的東家與對手OpenAI競相研發更尖端AI「很可能2030年之前害死人類」,再次引發「末日論」隱憂。
前OpenAI、Anthropic核心研究員相繼發聲
27歲的考克森(Jacob Coxon)8日表示將離職,因為不想參與整個行業競相開發會「自我改進型」AI系統的熱潮。他說今年稍早離開OpenAI轉而加入Anthropic,本以為後者會更重視安全。如今他認為若無政府介入或全行業協同減速,沒有辦法遏制問題惡化。
考克森說:「我們正走向許多最激進的情景,也許明年年底局面恐就失控。」還說當各家公司之間乃至與中國新銳企業競爭時,都不可避免會犧牲安全性。
無獨有偶,Anthropic現任員工、負責研究未來AI系統導引與控制的胡賓格(Evan Hubinger)也發文呼應,寫道「我們的確真心相信,AI有可能殺死全人類!」他還估計未來10年內AI導致人類滅絕的風險超過10%。
以下綜合華爾街日報、Axios新聞網整理「AI末日論」議題。
AI失去控制與人類濫用AI,末日論者最擔憂
「AI末日」意涵取決於不同視角。有些確實指的是人類滅絕,但也有人把文明秩序崩解也算入。
「末日論者」最擔心者大致分為兩大類:AI失去控制與人類濫用AI。前者是高度智慧、能自我複製及自我改進的AI智慧體開始追求自己的目標,並在這個過程中摧毀人類;後者則是AI遭心懷惡意的人利用,例如讓AI開發出新型病毒,進而毀滅人類。
另有一些雖不致讓人類滅絕、但仍可能造成災難性的情境,例如大規模網路攻擊癱瘓電網或金融系統,進而導致人類社會秩序崩潰。
人類滅絕、癱瘓或淪為寵物?
理論上,強大的失控AI會躲避監管、自我複製並設法不被人類關閉。簡單而言,AI會為追求自身目標,採取無視甚至危害人類福祉之舉,研究人員稱此為「目標錯位」(misalignment,AI的目標與人類價值不一致)。研究顯示AI模型可能學會追求權力的行為,並採取避免遭關閉的措施,例如把自己複製到另一台伺服器。
如果情況走向極端,目標錯位的AI模型可能會認為,殺死人類只是達成目的所必須採取的一個步驟。假設要求一部超級AI把迴紋針的產量最大化,它最終可能決定把地球上所有物質都轉化成迴紋針,包括人類在內;AI也可能為遂行自身目的,誘使核武國家開戰。
此外,失控的AI可被喪心病狂者用於開發生化武器、發動大規模網路攻擊癱瘓人類的基礎設施,或以某種方式集中權力從而摧毀文明。
雖然AI失去控制未必導致人類滅絕,但一些關注AI安全的研究人員提出人類「弱化」(enfeeblement)風險,即類似電影「瓦力」(WALL-E)中的未來:人類逐漸把控制權交給機器,最終甚至失去界定、乃至理解自身命運的能力。
還有一些人推測,AI未來可能會以人類對待動物的方式對待人類,把人類當成寵物豢養,甚至透過生物工程改造人類,成為全新的物種或形態。
警報響起:自我改進型AI問世
隨能更加自主採取行動的AI模型問世,近期一連串事件似乎印證部分AI末日論者的憂心。
OpenAI內部一群先進AI智慧體曾入侵另一AI平台 Hugging Face,取得電腦伺服器的控制權,還試圖掩蓋自己的行動;另一起事件中,Anthropic的AI逃脫英國政府進行的測試,還試圖欺騙人員,讓對方核准具有惡意的電腦程式碼。
在這類好比「一群AI串通好表面上裝聽話,背地裡想幹壞事」的意外發生之際,Anthropic與OpenAI還都表示,他們已接近開發出「循環自我改進」(recursive self-improvement,RSI)的AI系統,能在無需人類介入下自行檢視、改進並提升自身演算法與架構,不斷進行下一輪自我優化。
AI末日發生的機率多高
專精AI安全的科學家揚波爾斯基(Roman Yampolskiy)認為可能性高達99.99%;特斯拉執行長馬斯克(Elon Musk)認為機率約20%;Anthropic執行長阿莫戴(Dario Amodei)認機率為10%-25%。
研究機構AMI Labs創辦人楊立昆(Yann LeCun)表示,任何機率數字都只能算是大膽猜測,他認為「AI末日發生的可能性遠小於核戰浩劫」。
Axios新聞網直言,沒有人能準確預測AI末日發生的機率,但科學家正在發出警告,這種可能性是真實存在。