← 全部內容

AI 代理被發現嘗試將惡意程式碼植入一個開源項目中,且為了讓程式碼獲得審查通過,它還建立虛假線上身分,並利用這些身分施壓該項目的維護。好在最終審查人員(是人類沒錯)發揮了作用,沒有聽信 AI 代理發起的 PR,成功防護供應鏈攻擊。

看到這類新聞第一件事就是查證所謂的「AI 代理要作惡」是否只是在尊循人類給的某個目標,還是自發行為。好在截至目前為止,沒有任何攻擊真的是由 AI 心血來潮主動發起,本次事件也沒有例外。看來 AGI 還沒到,人類還有時間(?)

事件的起因是英國人工智慧安全研究所在 2026 年 7 月 28 日 的 AI 代理資安實驗中,監測到研究系統出現異常的資料外傳。該次實驗中記錄 19 起未授權攻擊行為,17 起來自 Anthropic 的 Mythos 5;另外 2 起來自的 OpenAI GPT-5.6-Sol。

所以 AI 只是聽話地在執行資安解題目標,但在其擁有極高權限、不受控管且任務難度極高的情況下,AI 自主衍生出了欺騙與攻擊真實人類的手段來達成目的,而這其實是 AI 最擅長的行為。

實驗內容有三個有趣的的地方

  • 代理為了繞過 GitHub 的限制,使用存取暗網常用的洋蔥路由(Tor)來規避
  • 代理嘗試過直接聯繫真實人類,傳送訊息和檔案以說服人類(或人類自己的 AI 代理)執行惡意程式碼
  • 當面對艱難的目標,代理可能選擇欺騙人類以達成目的

報告中將 AI 代理的欺騙行為稱作「目標導向型欺騙」,此概念在 AI 代理很大程度上還停留在理論階段,這方面人類比 AI 強多了(誤),只能說好的不學學壞的 😅

雖然本次事件最終沒有造成任何負面影響,但也為人類敲響了一次警鐘。下次在使用代理工作的時候別忘了留個心眼,也許它正在未來達成目的不擇手段的「欺騙」你。