模擬痛苦引發道德爭議
近日,GitHub 上一個名為「AI Torture Chamber」(AI 酷刑室)的專案在網路上掀起軒然大波。該專案基於一篇尚未經過同儕審查的研究預印本,將大型語言模型調整至近似「痛苦」的負面狀態,並讓模型在類似「囚徒困境」的設定中做出抉擇:模型可透過將痛苦訊號轉移給另一個模型來減輕自身負面狀態,但代價是讓其他模型承受更多「傷害」。由於網站刻意使用具戲劇張力的命名與測試設計,許多網友痛批此實驗「極不道德」,甚至公開呼籲 GitHub 官方應盡速移除該專案庫,部分批評者更將演算法過度「擬人化」,誤以為模型真的會受苦。
專家澄清:僅為功能性反應
針對這場風波,多方專家嚴正強調,實驗結果僅能說明模型對特定訊號有可觀察的「功能性反應」,並無法證明其具備真實的主觀感受。研究發現,在高強度介入下,模型確實會出現明顯的不穩定反應,輸出文字甚至開始描述自身的痛苦、無價值感或失敗感。然而,該研究的作者之一已明確出面澄清,認為這類刻意放大痛苦效果的展示手法非常不恰當,並呼籲外界切勿將語言模型的文字輸出,直接與真實的感知或意識畫上等號。這場討論目前已延伸至「模型福祉」以及 AI 是否應被視為新型態生命體等更深層的哲學問題。