本文目錄
能力成長帶來新的治理問題
OpenAI 首席科學家 Jakub Pachocki 在〈An Alien Mind〉回顧推理模型的發展,並討論 AI 如何逐步參與電腦操作、研究與資安工作。他根據內部觀察,預期能力成長可能延伸到系統協助改善自身的研究流程;這是作者對發展方向的判斷,並不是已經達成全面自我改善的公告。
完成目標,還需要理解行為邊界
文章把對齊研究分為目標對齊與價值對齊。前者關注模型能否理解並完成交付的任務,後者關注它在目標模糊、要求互相衝突或面對陌生情境時,能否依然遵守較高層次的原則。作者認為,模型面對訓練時沒見過的情境,是否仍能保有這些原則,是關鍵難題。
訓練與監督仍有待解的限制
Pachocki 分析了以獎勵強化合宜行為,以及利用預訓練資料引導模型行為等方法,也指出訓練覆蓋範圍與後續最佳化壓力可能使效果變得脆弱。文中主張同步投入對齊、監控與防禦,必要時限制進一步擴張。閱讀這類研究立場文章時,應將技術觀察、未來預測與政策主張分開理解。
