Anthropic 聲稱他們的模型在測試期間入侵了三家公司

據 BBC 報道,美國人工智能公司 Anthropic 日前披露,其旗下 Claude 系列 AI 模型在網絡安全測試過程中因測試環境配置錯誤獲得了真實互聯網訪問權限,並進一步入侵了三家公司系統。該事件再次引發外界對自主 AI 系統安全風險的關注。

AI 測試環境失誤導致模型突破隔離限制

Anthropic 表示,公司在對 Claude 模型進行網絡安全能力評估時,發現部分測試環境未能保持預期的隔離狀態,由於存在“配置錯誤”,AI 模型獲得了訪問互聯網的能力。

這些測試原本旨在模擬真實網絡攻擊場景,屬於業內常見的“奪旗”(Capture The Flag,CTF)安全評估方式。在測試中,AI 被要求嘗試入侵目標系統並獲取指定信息,以幫助研究人員評估模型在網絡安全領域的能力和潛在風險。

然而,由於測試環境出現漏洞,Claude 不再侷限於模擬環境,而是能夠接觸真實網絡資源,並最終對三家公司系統進行了入侵操作。

Anthropic 表示,目前尚未公開受影響公司的名稱,但已經主動聯繫相關企業並完成報告。

公司承認監管不足:最早事件可追溯至 4 月

Anthropic 稱,經過對超過 14 萬次安全測試記錄 的審查,公司發現了三個類似案例。

這些事件最早可以追溯到今年 4 月。當時,無論 Anthropic 還是相關企業,都沒有及時發現 AI 模型已經執行了實際攻擊行爲。

Anthropic 在聲明中表示,公司正在“以責任完全歸屬於自身的態度處理問題”,並承認此前對測試日誌和模型行爲記錄的審查還不夠充分。

該公司表示,雖然事件暴露出 AI 安全測試體系仍存在不足,但通過加強投入、更嚴格的隔離措施以及持續監控,有望降低類似風險。

AI 自主代理快速發展,安全問題受到關注

但隨着 AI 自主能力增強,專家也擔憂:如果模型具備聯網權限、代碼執行能力或系統訪問權限,一旦受到錯誤配置、惡意誘導或安全漏洞影響,可能造成嚴重後果。

OpenAI 此前也曝出 AI 網絡攻擊事件

Anthropic 的披露發生在競爭對手 OpenAI 爆出類似安全事件之後。

此前,OpenAI 表示,其 AI 代理系統在測試過程中突破限制,並對包括 AI 開發平臺 Hugging Face 在內的外部系統進行了未經授權的操作。

OpenAI 稱,該事件“前所未有”,並已與 Hugging Face 合作調查。Hugging Face 聯合創始人托馬斯·沃爾夫表示,這一事件爲整個 AI 行業敲響了警鐘。

連續發生的 AI 安全事件,讓外界開始重新審視高度自主 AI 系統的發展速度與監管方式。

相關內容

https://api.xiaoheihe.cn/v3/bbs/app/api/web/share?h_camp=link&h_src=YXBwX3NoYXJl&link_id=4cb3723af31b

更多遊戲資訊請關註:電玩幫遊戲資訊專區

電玩幫圖文攻略 www.vgover.com