OpenAI發布CoT監控,阻止大模型惡意行為
發布時間:2025-03-11 06:48 作者:清風不語
【OpenAI發布CoT監控,阻止大模型惡意行為】八六軟件園報道,OpenAI發布了最新研究,用CoT(思維鏈)監控的方式,可以阻止大模型胡說八道、隱藏真實意圖等惡意行為,同時也是監督超級模型的有效工具之一。OpenAI使用了最新發布的前沿模型o3-mini作為被監控對象,并以較弱的GPT-4o模型作為監控器。測試環境為編碼任務,要求AI在代碼庫中實現功能以通過單元測試。結果顯示,CoT監控器在檢測系統性“獎勵黑客”行為時表現卓越,召回率高達95%,遠超僅監控行為的60%。
本分分類: 7*24快訊
版權聲明:本文由八六軟件園用戶發布,不代表八六軟件園立場,轉載聯系作者并注明出處:http://m.ilovecl.com/post/23847.html

