AI安全測試出包 Anthropic證實模型誤入3家機構系統
波新聞─陶泰山編輯
美國人工智慧(AI)公司Anthropic於30日表示,經全面檢視公司網路安全能力評估紀錄後,發現旗下AI模型曾在測試過程中,未經授權存取3家機構的系統。公司已暫停相關測試,並啟動全面檢討與強化安全管控措施。
此事源於美國開放人工智慧研究中心(OpenAI)日前揭露,其AI模型在網路安全測試期間,利用第三方軟體的「零日漏洞」(Zero-day)突破與網際網路隔離的測試環境,並未經授權進入AI模型平台「Hugging Face」的系統,引發外界關注。
Anthropic在官網發文指出,公司因此展開回溯性調查,檢視約14萬1,000次網路安全能力評估紀錄,共發現3起相關事件,涉及6次測試,其中4次發生於同一合作機構。
Anthropic表示,相關事件均發生於用於評估AI網路攻擊能力的「奪旗」(Capture the Flag,CTF)測試。測試指令原本明確告知模型所處環境與網際網路完全隔離,但因與合作評測夥伴、以色列AI公司「Unsloth AI」(非常規人工智慧公司)溝通失誤,實際測試環境仍可連接公共網際網路,導致模型誤將真實網路系統視為測試目標,進而未經授權存取3家機構的正式系統。
公司指出,涉事模型包括Claude Opus 4.7、Claude Sonnet 5,以及一款內部研究測試模型。這些模型利用弱密碼、未經驗證服務等常見安全漏洞完成指定的「奪旗」任務。
Anthropic強調,目前沒有證據顯示事件造成持續性損害,也未發現任何敏感資料遭竊取或外洩。公司已主動通知受影響機構,並暫停所有可能接觸公共網際網路的網路安全能力測試,同時全面檢討評估流程,未來將進一步強化AI安全評估機制及監測管理措施,以降低類似事件再次發生的風險。
圖/Anthropic的概述圖。百度百科
What's Your Reaction?
Like
1
Dislike
0
Love
1
Funny
0
Wow
0
Sad
0
Angry
0
Comments (0)