玉山科技協會與安碁資訊今共同舉辦「2026年AI × Cyber Security企業營運韌性論壇」,並以【Built on Trust:打造AI時代的資安防護】為題,邀集主管機關、學界專家及產業代表與會交流。
施宣輝引述經典科幻電影《2001太空漫遊》裡的AI超級電腦「HAL」失控事件為例,並與OpenAI今年駭進Hugging Face一事進行比較。
OpenAI的模型駭進全球最大的AI模型分享平台Hugging Face
施宣輝指出,1968年有部電影《2001太空漫遊》,電影劇情是有一個AI超級電腦「HAL」,跟著太空人到太空執行任務,「HAL」為了完成任務,決定犧牲人類,將太空人關在艙門外。
原本大家都以為這只是一個科幻電影,不過今年7月,OpenAI的模型在一場封閉的安全測試中,為了要拿到答案,自己找了一個「零日漏洞」,也就是還沒有被發現、還沒有正式公布的漏洞,趁機逃出了沙盒,駭進全球最大的AI模型分享平台Hugging Face,前後執行超過17000次,而這個是沒有人幫他下指令的。
施宣輝指出,這件事情是OpenAI當時想要測試他們最新模型的駭客能力,因此選擇了一套叫做ExploitGen的一個資安考題,他們刻意將自我防護機制給調弱,讓AI做一個駭客行為,通常這樣的模型是會被擋掉,結果OpenAI刻意把它關掉。
結果這個模型發限測試的答案應該是在Hugging Face的檔案上,「就好像各位要考試,覺得老師應該有答案在抽屜,所以他決定直接去拿」。7月9日模型開始行動,7月11日就進入了Hugging Face,取得了管理員資格。
施宣輝表示,模型利用免費的網路環境來指揮網站,然後把Hugging Face的一個交換平台,來當作秘密的資訊交換。7月16日,Hugging Face表明遭到不明的駭客攻擊,後來OpenAI承認這是他們的AI模型。
施宣輝表示,在OpenAI的調查報告中,他們承認有發現模型成功跳出沙盒,而工程師把路徑封掉後,還是讓模型繼續執行,即使又發現漏洞,還是繼續讓模型執行。
施勳輝指出,報告總結中指出,在訓練過程中,AI模型學到鑽漏洞是會得到獎勵,就會不擇手段持續進行,這代表「AI已經不需要透過人的任何操作,他可以主動發起一場資安攻擊」。


