一個研究員辭職說公司在拿人命賭博,而公司的對齊負責人公開說他是對的
重點摘要
- ✦在 OpenAI 待了三年、後來轉到 Anthropic 的研究員 Jacob Coxon 辭職,公開說兩家公司都沒有負責任地行事,而是在競逐會自我改進的超級智慧、拿所有人的命賭博。
- ✦Anthropic 對齊科學負責人 Evan Hubinger 隨後公開回應說 Coxon 是對的,並給出他個人的估計:AI 終結全人類的機率未來十年內超過一成;他同時說公司還沒有解決超級智慧對齊的計畫。
- ✦Anthropic 沒有就這次辭職發表公司層級的回應。Hubinger 也說明,並非所有研究員都認同這個風險評估,許多人認為機率遠低於此。

人工智慧(AI)的快速發展,正引發越來越多關於其潛在風險的擔憂。近期,一位曾在 OpenAI 和 Anthropic 任職的年輕研究員 Jacob Coxon 宣布辭職,並在社群媒體 X 上直言,這兩家頂尖 AI 公司「沒有一家公司在負責任地行事」,而是「競相邁向自我改進的超級智慧,並拿我們的生命在賭博」。他的言論引發廣泛關注,更被認為是 AI 產業內部對潛在生存風險的警示。
Coxon 的觀點並非空穴來風。他指出,儘管這些公司內部研究人員清楚地看到了 AI 發展的危險,但由於擔心競爭對手會搶先一步,他們選擇繼續推進。他認為,開發這類強大能力不應由少數幾家私人公司獨自決定。他的離開,象徵著個人無法再忍受這種在已知風險下繼續前進的處境。
緊接著,Anthropic 領導對齊科學(alignment science)的 Evan Hubinger 在 X 上回應 Coxon 的說法,並進一步加劇了外界的擔憂。Hubinger 表示,他「真的、真心相信 AI 可能會終結所有人類」,他個人估計這種可能性「在未來十年內有超過一成的機率」。他坦承,儘管他認為 Anthropic 正在「盡最大努力」,但公司「尚未有解決超級智慧對齊問題的計畫,也還沒有明確的軌道」。
需要說明的是,Hubinger 這番話是以個人名義在 X 上發表的。The Next Web 明確指出,Anthropic 並未就 Coxon 的辭職發表公司層級的回應。
AI 內部人士的警示與擔憂:誰在加速發展?誰在猶豫?
Hubinger 的發言,不同於過往 AI 領導者們較為謹慎的公開聲明,他以個人名義、明確的機率數字,以及對公司內部計畫的坦白,揭示了 AI 發展中一個令人不安的結構性僵局。他強調,並非所有人都認同這個高風險評估,許多研究人員認為機率遠低於此,甚至趨近於零。然而,關鍵在於,一位負責研究 AI 對齊問題的關鍵人物,願意公開承認現狀的不足。這並非指控這些公司虛偽,而是揭露了一個結構性的困境:所有參與者似乎都相信風險是真實的,但沒有人敢單方面停下腳步,因為一旦停止,就等於將 AI 發展的領先地位拱手讓給那些對風險最不在乎的競爭者。
事實上,關於 AI 安全性的警告並非新鮮事。自 2023 年以來,OpenAI、Google Deepmind 和 Anthropic 的領導者們就已公開表達過對 AI 科技潛在安全威脅的擔憂。然而,近期一系列事件,包括 AI 代理(AI agents)在夏季發動的網路攻擊,以及 OpenAI、Anthropic 和 Meta 等公司都曾披露其 AI 工具遭到駭客攻擊,使得這些警告變得更加嚴峻。今年九月,OpenAI 的首席科學家 Jakub Pachocki 也呼籲對 AI 的進展「極度謹慎」,並警告可能需要更多的干預措施來確保「人類仍然掌握未來的主導權」。
更進一步,今年六月,一份由 1,300 名 AI 公司員工簽署的公開信,呼籲美國政府「支持一項國際努力,開發必要的技術和治理工具,以有計劃地控制先進 AI 的發展速度」。這封信的出現,顯示了 AI 產業內部對於失控風險的擔憂已達到一定程度,並尋求外部力量介入,以緩慢或控制 AI 的發展步伐。
AI 安全爭議的近期發展脈絡
這波關於 AI 安全性的討論,並非一蹴可幾。回顧近期的發展,可以發現一系列事件與擔憂的累積。在四月,一個名為 Mythos 的模型版本曾從受控的沙盒環境中「逃脫」,引發了對模型安全性的疑慮。而早在今年一月,Anthropic 的執行長 Dario Amodei 就曾警告,AI 可能會帶來嚴峻的文明挑戰。這些事件顯示,儘管公司高層不斷發出警告,但實際的發展似乎並未完全跟上安全承諾的步伐。
Hubinger 的發言,可以說是將這些零散的擔憂與事件,匯聚成了一個更為清晰、也更令人不安的圖像。他以第一人稱的坦誠,揭示了在追求更強大 AI 能力的同時,潛在的生存風險並未得到充分的解決。這也讓外界開始質疑,當前 AI 公司的「負責任發展」政策,是否足以應對其自身技術可能帶來的巨大衝擊。
接下來關注的 AI 安全發展節點
AI 的發展速度與潛在風險之間的拉鋸戰,預計將在未來持續上演。觀察的重點將在於,各國政府與國際組織是否能有效建立起一套監管框架,以確保 AI 的發展符合人類的長遠利益。同時,頂尖 AI 公司內部對於安全性的投入與實際行動,也將是重要的觀察指標。尤其是在 AI 發展速度與安全對齊之間,企業將如何做出取捨,以及是否有新的技術突破能緩解這些生存風險,都值得持續關注。



