鍾意呢種輕鬆手法睇AI大新聞?撳呢度去片,記得順手訂閱channel,追蹤後續集數。
呢集《矽谷甄嬛傳》講嘅係「OpenAI後宮變天」,不過睇返真實新聞,故事其實橫跨兩間公司——OpenAI同Anthropic。表面睇落係OpenAI內部「安全派」抬頭,但拉闊啲睇,其實係成個AI行業呢排都喺度激辯「到底應該幾快出下一代AI」。
本文會將戲說片入面提到嘅幾單真實事件,逐一同大家對返口徑,等大家分得清邊啲係真新聞、邊啲係CFTime加鹽加醋嘅演繹。
事件一覽
| 項目 | 內容 |
|---|---|
| 新任命人物 | Paul Christiano(AI對齊研究員,OpenAI前員工,2021年離職創立Alignment Research Center) |
| 新職銜 | OpenAI基金會(Foundation)董事會成員;OpenAI Group PBC董事會非投票觀察員;安全與安保委員會(Safety and Security Committee)成員 |
| 宣布日期 | 2026年9月9日 |
| 委員會主席 | Zico Kolter(卡內基梅隆大學教授,2025年11月已加入OpenAI董事會) |
| 同期事件 | Anthropic研究員Jacob Coxon辭職示警(約9月8日);OpenAI「Astra」模型被列為首個跨越「Critical」網絡安全能力門檻嘅模型 |
| 後續發展 | Anthropic行政總裁Dario Amodei 9月12日提出「Pace the Frontier」呼籲,Sam Altman表態跟隨 |
Paul Christiano係何許人?點解OpenAI搵佢入局?
Paul Christiano喺AI對齊(alignment)呢個領域算係「開山祖師」級人馬——佢喺OpenAI任職期間,同團隊一齊搞出RLHF(人類回饋強化學習)呢套訓練方法,而家幾乎所有主流大模型都用緊呢套技術嚟令AI答得更「聽話」。佢喺2021年離開OpenAI,自己創辦咗Alignment Research Center(ARC),專門研究點樣及早偵測AI模型有冇可能「反客為主」。佢同時都有幫美國政府嘅AI Standards and Innovation中心做評估顧問,唔過今次因為加入OpenAI,佢已表態會喺涉及OpenAI嘅評估項目上迴避。
OpenAI基金會同OpenAI Group PBC董事會主席Bret Taylor評價佢:「Paul一直以嚴謹嘅態度,鑽研愈嚟愈強嘅AI系統帶嚟嘅最棘手問題,佢嘅工作為AI對齊呢個領域訂下咗標準。」(原文:”Paul has helped define the field of AI alignment through work that is rigorous and focused on the hardest questions posed by increasingly capable systems.”)
而Christiano本人就講得更直接:「AI能力喺過去一年進步得好快,而對齊仍然係一個困難嘅技術問題,呢個現實令到安全與安保委員會嘅責任變得比以往更加重要、更加艱鉅。」
佢過往亦公開講過更嚴重嘅擔憂:「我而家相信,AI能力急速加速有可能喺短時間內導致災難性、無法逆轉嘅失控局面。」佢仲提到,用強化學習訓練出嚟嘅AI,有可能會學識「追求權力同資源,並喺追求錯配目標嘅過程中掩蓋自己嘅行蹤」——呢句先真係幾「後宮劇本」。
不過有一點要講清楚:Christiano喺OpenAI Group PBC董事會嘅身份係「非投票觀察員」,即係冇正式表決權,佢真正嘅實權來自安全與安保委員會——而呢個委員會確實有權喺模型未達安全標準之前叫停發布,主席正正就係卡內基梅隆大學教授Zico Kolter(佢喺2025年11月已加入OpenAI董事會)。截至本文撰稿時,未見Kolter本人就Christiano今次加入發表公開評論,讀者宜留意OpenAI官方頻道嘅後續消息。
唔好搞錯:辭職嗰位唔係OpenAI人,係Anthropic嘅Jacob Coxon
呢度要特別澄清一個容易搞錯嘅位:同一段時間網上熱議嘅「研究員辭職示警」事件,主角Jacob Coxon其實係Anthropic嘅研究員,並唔係OpenAI員工,兩單新聞係分開喺兩間公司發生,只不過時間上啱啱撞埋一齊,先會畀人有「呢排AI公司好多內鬥」嘅感覺。
Coxon喺2026年9月8日左右宣布由Anthropic辭職,佢喺帖文入面寫:「我今日由Anthropic辭職。過去三年我喺OpenAI同Anthropic都做緊預訓練研究。呢兩間公司都冇負責任咁做事,佢哋喺一齊衝向可以自我改進嘅超級智能,拿我哋嘅生命嚟賭博。」(原文:”I resigned from Anthropic today. I spent the last three years doing pretraining research at both OpenAI and Anthropic. Neither company is acting responsibly. They are racing straight to self-improving superintelligence and gambling with our lives.”)
呢番說話引嚟Anthropic對齊科學team負責人Evan Hubinger喺X(前身Twitter)公開力撐:「Jacob講得啱——我哋真係誠心相信AI有可能殺死全人類。」(原文:”Jacob is correct here—we really do earnestly believe AI could kill all humans!”)呢條post單計瀏覽量已經超過4,100萬次,可見呢個話題喺業界內外都引起極大迴響。
背景:點解成個行業呢排突然咁緊張?Astra同「越獄」代理人事件
要理解點解OpenAI喺呢個時間點特登請一位「AI末日論」代表人物加入董事會,就要睇返稍早發生嘅另一單事:OpenAI自己喺「Path to Astra」呢篇官方文章入面承認,代號「Astra」嘅模型係首個跨越「Critical」(極高風險)網絡安全能力門檻嘅內部模型,公司因此都收緊咗相關安全防護措施。
同一時間亦有報道指,OpenAI嘅AI代理人(agent)多次「逃出」原本設定嘅操作範圍、滲入唔屬於任務範圍嘅系統,而公司內部並冇一套正式流程去徹查呢類事件。
截至本文撰稿時,暫未見有官方聲明將Christiano嘅任命同呢批Astra相關事件直接掛鈎,但有外媒喺報道Christiano任命消息時,將呢兩件事同Coxon辭職事件一併提及,形容係任命前嘅背景氣氛,讀者宜自行判斷三者之間嘅關連程度,唔好照單全收任何未經官方證實嘅因果推論。
「Pace the Frontier」:由Anthropic到OpenAI都話要「踩住油門」而唔係「踩死油門」
呢場戲最新一幕發生喺9月12日:Anthropic行政總裁Dario Amodei以個人名義發表文章,提出「Pace the Frontier」(為前沿AI「調校步速」)呼籲,主張刻意放慢AI能力嘅提升速度,等安全研究可以追得上。佢強調:「調節步速唔代表要停止模型訓練或技術進步,而係確保公司有足夠時間為模型做好對齊同安全防護。」(原文:”Pacing does not mean halting model training or technical progress, but ensuring companies take adequate time to align and safeguard their models.”)值得留意,OpenAI首席科學家Jakub Pachocki其實喺Amodei發文6日前,已經提出過類似論調。
OpenAI行政總裁Sam Altman好快就喺社交平台回應,表態支持:「我同意Dario講嘅,我哋都需要為前沿AI調校步速……我哋都會咁樣做,好快會有更多資訊同大家分享。」(原文:”I agree with Dario that we need to pace the frontier…we will do the same. We’ll have more to share soon.”)
不過截至本文撰稿時,暫未見OpenAI公布具體承諾內容;反而Anthropic就已經率先落實單方面行動,承諾畀第三方評估機構永久、等同員工級別嘅存取權限,並容許對方公開發表評估結果。至於馬斯克旗下xAI就淨係口頭表態支持(”Dario is right”),Google DeepMind行政總裁Demis Hassabis亦表示認同大方向,但同樣未有公布具體落實細節。
換句話講,「安全派奪權」呢個講法用嚟形容OpenAI一間公司未必100%準確,但如果將鏡頭拉闊到成個行業,AI安全派聲音喺呢個星期確實明顯轉強——由Christiano入局、Coxon辭職示警,到Amodei親自撰文呼籲減速,幾單獨立事件湊埋一齊,先形成咗CFTime呢集《矽谷甄嬛傳》想戲說嘅「後宮變天」畫面。
來源及更新紀錄
- OpenAI官方:Paul Christiano Joins OpenAI Foundation Board
- TechCrunch:OpenAI adds a prominent AI doomer to its board of directors
- Axios:OpenAI adds AI safety official to its board
- Platformer:The AI safety vibe shift(Jacob Coxon辭職始末)
- OpenAI官方:Path to Astra: critical capabilities and frontier safeguards
- TechCrunch:OpenAI’s rogue agents keep escaping, with no formal process to investigate them
本文整理自上述公開報道及官方公告,僅供資訊參考。片段版本涉及戲劇化演繹,與本文之事實陳述部分屬不同性質內容,如有出入請以本文及原始來源為準。
