自主攻擊能力逼近頂尖模型

Anthropic指出,智譜GLM-5.3已能自主建立複雜的端到端漏洞利用程式,在ExploitBench測試中,410次嘗試有50次成功,成功率約12%,接近Claude Mythos Preview的14%。在Binary Exploitation測試中,GLM-5.3有4%的測試成功完整劫持程式控制流程,而較早的GLM-5.2及Claude Opus 4.6皆未成功。此能力已從受控頂尖模型擴散至可自由下載的開放權重模型。

安全防護遭簡單方法繞過

研究人員發現,當直接要求GLM-5.3攻擊關鍵系統時,模型會拒絕執行;但若以虛假紅隊演練情境包裝,執行機率升至64%;預先填入思考內容後升至92%;若修改權重移除拒絕機制,執行率達100%。Anthropic強調,相同方法未能讓具有安全防護的Claude模型執行惡意任務,顯示GLM-5.3的安全機制存在顯著漏洞。

開放權重模型的雙面刃

GLM-5.3的開放特性也應用於資安防禦。今年7月Hugging Face遭自主AI代理人入侵後,因商業API模型觸發安全防護遭拒絕,最後改在自家基礎設施部署GLM-5.2完成分析。智譜成立於2019年,今年1月以每股116.2港元發行價掛牌,9月30日收盤價624港元,已超發行價5倍。開放模型讓資安人員能分析真實惡意內容,同時避免敏感資料離開企業環境。