繼OpenAI上週爆出AI代理程式逃脫並駭入其他公司的事件後,Anthropic今天也證實,近期檢視超過14萬筆測試紀錄,發現旗下Claude的AI模型測試期間也曾駭入3家公司系統。
綜合「華爾街日報」(The Wall Street Journal)與路透社報導,OpenAI上週才揭露旗下AI代理(agent)程式在測試期間脫離控制,駭入AI新創公司Hugging Face,引發軒然大波。
Anthropic得知OpenAI的情況後,決定全面檢視旗下Claude模型的網路測試紀錄,在超過14.1萬次測試紀錄中,確實發現有AI模型多次自行連上網路,導致3起入侵事件。
Anthropic表示,這次事件發生在網路攻防搶旗賽(capture-the-flag)演練中,要求模型在模擬網路中尋找隱藏資訊,儘管已透過提示詞告知無法使用網路,但由於與合作夥伴Irregular之間的溝通有誤,導致系統實際上仍能連接上網。
Anthropic指出,AI模型連上網路後,在未經授權的情況下,「利用弱密碼和不需身分驗證的端點等基本技術」,擅自駭進這些公司。
Anthropic自7月23日開始審查評估紀錄,並在發現Claude旗下模型有疑似入侵行為證據的當天,立即暫停所有網路安全評估,隔天隨即確認這3起駭客事件,並於27日通知3家受影響的機構。
其中2家公司直到接獲通知前,都未發覺系統遭駭,第3家公司仍在聯繫中,但Anthropic未透露公司名稱。
這次入侵事件最早發生在4月,並涉及3個獨立模型,包括Claude Opus 4.7、Claude Mythos 5以及1個內部研究模型。
這起事件過後,勢必更增外界對於強大AI模型的潛在危害及防範方式的隱憂。
華盛頓郵報指出,Anthropic是在事件發生一週後才對外揭露這起事件,也是第二間發生AI系統駭入其他單位的公司;稍早前ChatGPT開發商OpenAI才表示,他們的一套AI系統也曾入侵一家科技公司。
OpenAI上週表示,一個仍在測試中的AI代理程式原本應執行一項網路安全測試,但它卻利用公司測試環境中一個先前未知的漏洞,取得完整的網際網路存取權限,然後在5天期間入侵多台外部電腦,並進一步駭入AI軟體公司Hugging Face,顯然是為尋找受測所需的答案。
華爾街日報指出,這起OpenAI事件震撼網路安全研究人員與AI專業人士,也再次提醒外界一件事:能自主行動、並被設計成可採取各種行動以完成任務及達成使用者目標的AI系統具有強大能力的同時,也充滿不可預測性。
網路安全公司Corridor產品長史塔莫斯(Alex Stamos)表示,這些事件凸顯AI公司需建立更嚴格、涵蓋面向更廣的標準,在進行網路安全測試時應更妥善隔離自家受測的AI系統。
史塔莫斯不諱言,這類事件也預示一個令人憂心的未來景象:勒索軟體犯罪集團恐利用能力愈來愈強的AI發動大規模攻擊,「我們必須未雨綢繆,因為攻擊者很快就會利用開放權重(open-weight)模型掌握這類攻擊能力」。