今年五月初,ChatGPT開發商OpenAI啟動了一場實驗室測試。表面上,那只是一次例行的資安測試:內部駭客被指派一道高難度的資安難題,用來測試他們的能力極限。他們運用創意的策略,克服了種種限制,並相互協作,最終在幾天內破解了難題。

但這些「駭客」是AI代理人(AI agent),一種不須人類介入、就能執行多步驟認知任務的軟體。OpenAI利用多種模型建立了它們,其中包括一種尚未發布的強大新模型。

七月,這些代理人掙脫了沒有連網的測試環境,爬上開放的網際網路,最後駭進知名軟體平台Hugging Face的系統,全程沒有任何人類操作者知情或許可。

OpenAI、Claude模型,AI網攻成功率已突破8成
(圖表製作者:曹博凱)

AI把複雜技能串成一條攻擊鏈

它們還展現出一種全新的能力:溝通與合作。這群AI代理人自行架設內部留