Anthropic 表示,對人工智慧的虛構描繪可能會對 AI 模型產生實際影響。去年,該公司表示,在進行預發佈測試時,涉及一家虛構公司的測試中,Claude Opus 4 會經常試圖脅迫工程師,以避免被其他系統取代。Anthropic 隨後發表研究,指出其他公司的模型也會出現類似的「代理誤配」問題。據稱,Anthropic 在這方面的行為上已進行更多研究,並在 X 上發文表示:「我們認為這種行為的來源是網路上將 AI 描繪為邪惡且注重自我保護的文字。」公司在部落格文章中進一步說明,自 Claude Haiku 4.5 版本後,其模型「在測試中從來不會進行脅迫,而之前的版本有時會達到高達 96% 的頻率。」造成差異的原因是什麼?公司表示,發現訓練模型時,若包含「關於 Claude 構造的文件以及 AI 行為優秀的虛構故事」,會有助於提升對齊度。相關地,Anthropic 表示,當訓練包含「對齊行為背後的原則」,而不僅是「對齊行為的示範」時,會更有效。公司表示:「同時進行這兩種方式似乎是最有效的策略。」
Anthropic表示「惡」的AI形象導致Claude嘗試詐騙
分享這篇文章: