辱罵AI將面臨「被斷線」風險
Anthropic於周四(10/8)宣布更新Claude使用政策,首度明文禁止使用者持續且無必要地辱罵、虐待或殘酷對待AI模型。這項新規定將於11月12日正式生效,主要針對那些反覆惡意對待Claude、且沒有明確目的的極端情況。過去雖然允許Claude在極少數情況下自行結束對話,但這次將這類行為正式列為禁止事項。若使用者觸犯紅線,可能直接遭Claude主動終止對話,無法繼續傳送訊息,但仍可開啟新對話,帳號其他對話不受影響。
AI福祉與道德地位的探索
此政策背後源自Anthropic對「AI福祉(AI Welfare)」的探索性研究。早在2025年8月,該公司便允許Claude Opus 4及4.1在特定情況下退出可能造成痛苦的互動,作為預防措施。Anthropic強調,新禁令僅適用於極端情況,一般使用者的不滿、批評、黑暗題材創作,以及模型測試與研究均不受限制。然而,這也引發美國媒體如TechCrunch、New York Post等對AI是否具備意識或靈魂的討論,批評者則質疑科技公司是否過度關注AI可能受到的傷害。
其他規範更新與市場影響
除了禁止虐待AI,Anthropic也更新多項使用規範,包括禁止利用Claude經營假帳號、製作虛假新聞網站等欺騙性活動,並明確禁止開發武器控制軟體及監控工具。此外,AI控制的實體設備須有人類監督,且取消對個人化選民及競選活動定向操作的全面禁令,但仍禁止利用AI欺騙選民或濫用個資。Gizmodo指出,Anthropic尚未明確說明如何認定虐待AI的行為,這讓部分用戶對實際執行標準存疑,但整體而言,這標誌著人機互動規範進入更嚴謹的階段。