主頁 Blog OpenAI首席科學家示警AI發展過快 RSI與AI對齊失衡恐成全球安全新風險

OpenAI首席科學家示警AI發展過快 RSI與AI對齊失衡恐成全球安全新風險

(圖/ MGBOX新聞網 AI圖片) OpenAI首席科學家Jakub Pachocki在美國OpenAI發布最新文章,警告AI能力快速提升後,遞歸自我改進(RSI)、AI對齊與模型監控正面臨新的安全挑戰,全球AI產業是否需要放慢尖端模型發展速度,再度成為焦點。 OpenAI...
MGBOX新聞網
2026-09-08 12:04:16 18 min read

(圖/ MGBOX新聞網 AI圖片)

OpenAI首席科學家Jakub Pachocki在美國OpenAI發布最新文章,警告AI能力快速提升後,遞歸自我改進(RSI)、AI對齊與模型監控正面臨新的安全挑戰,全球AI產業是否需要放慢尖端模型發展速度,再度成為焦點。

OpenAI AI安全正面臨一項新的發展矛盾:AI模型越來越強大,同時人類卻可能越來越難以確認模型究竟如何完成推理。OpenAI首席科學家Jakub Pachocki 9月6日發布〈An Alien Mind〉,從AI對齊與安全角度說明目前研究進展,並認為現有監控方法可能逐漸跟不上模型能力成長。

這篇文章的真正訊號並不是宣告「AI已經完全失控」,而是OpenAI內部對下一階段AI發展速度與安全能力之間落差的公開警告。Pachocki甚至直指,目前沒有任何AI實驗室已經把對齊與監控問題解決到足以長期維持最高速度擴張的程度,並主張在建立共同安全標準前,產業應考慮自願放慢發展速度。

從AI變聰明到AI參與自身發展 RSI成為下一道門檻

 

Pachocki在文章中回溯2023年OpenAI「RLSlow」研究計畫的早期成果。當時研究團隊發現,透過擴大推理模型訓練,可以讓預訓練模型形成自己的思維鏈,這讓研究人員開始思考一個更深層問題:如果機器智慧持續成長,未來是否可能出現明顯超越人類部分能力的系統。

到了2026年,推理型語言模型已經不再只是回答問題的工具。OpenAI指出,新一代模型可以操作電腦與圖形介面、與人類及其他AI協作,並開始參與研究工作。

這使AI發展進入新的階段。過去模型能力主要由人類工程師設計、訓練與調整;如今AI逐漸能夠參與研究、程式設計、模型評估及部分訓練流程。當「AI協助人類開發AI」進一步變成「AI協助改進下一代AI」,遞歸自我改進,也就是RSI,就從理論上的長期概念,逐漸成為前沿AI研究的重要議題。

Pachocki的說法並不是「RSI已經全面完成」,而是認為只要目前的技術發展路徑持續,機器參與自身發展將成為未來AI進步的重要核心。這項區別相當重要,也直接影響市場與社會對「AI已經失控」這類說法的理解。

為何稱為「異星心智」?AI可能越來越難被人類完全理解

 

Pachocki使用「An Alien Mind」作為文章標題,核心並不是指AI真的具有外星生命,而是用來描述一種與人類認知方式不同、並且難以完全理解的機器智慧。

他認為,大型AI模型與傳統軟體存在本質差異。傳統軟體通常由工程師逐步寫下明確規則;大型深度學習模型則是在龐大資料與算力下,透過大量最佳化逐漸形成複雜能力。研究人員可以分析模型中的部分機制,但隨著系統規模與能力增加,要完整描述模型如何產生特定行為也變得更加困難。

這形成AI安全領域最棘手的問題之一:如果人類不知道模型為什麼這樣做,又要如何確認模型正在按照人類期待行動?

當AI只是提供文字答案時,這個問題可能還不容易被放大;但當AI可以操作電腦、使用工具、執行研究任務,甚至與其他AI協作時,模型內部決策與外部行動之間的距離就會縮短。AI安全因此從「答案是否正確」,逐漸轉向「AI為什麼這麼做,以及人類是否還能有效監控」。

AI對齊不只是聽話 真正難題是價值是否一致

 

Pachocki將AI對齊問題區分成不同層次,其中一個核心區別是「目標對齊」與更深層的「價值對齊」。目標對齊比較容易理解,也就是使用者要求AI完成一項工作時,模型能否按照指令執行。

真正困難的是,當使用者沒有提供完整指令,或者AI遇到訓練資料沒有涵蓋的情境時,模型是否仍能維持人類所認可的誠實、善意與安全底線。

這代表AI安全不能只依靠「讓模型照指令做事」。因為在高度複雜的環境中,模型可能需要自行判斷下一步行動。如果訓練過程只獎勵特定結果,模型可能學會達成目標的方法,卻未必真正理解人類希望它遵循的價值。Pachocki指出,這也是現有對齊方法面對的重要限制。

更值得注意的是,當模型接受更強的最佳化訓練後,原本看似符合人類價值的行為是否仍能維持,也可能成為新的風險。因此,AI能力越強,對齊工作的難度不一定同步下降,反而可能更加複雜。

思維鏈原本是AI安全「窗口」 如今監控能力正在下降

 

這篇文章另一個受到關注的重點,是OpenAI對「思維鏈監控」(CoT monitoring)的重新評估。思維鏈過去被視為觀察推理模型的重要工具。研究人員可以透過模型產生的推理內容,了解模型如何處理問題,並從中尋找可能存在的錯誤或不符合安全要求的行為。

但Pachocki指出,OpenAI的評估顯示,依賴思維鏈進行監控的能力正在逐漸減弱。原因包括模型開始處理更加複雜的環境,需要同時與人類、其他AI以及外部工具互動;模型本身也越來越擅長處理與操控自身推理流程;此外,預訓練能力提升後,AI即使不依賴明確的語言化思維鏈,也可能展現更強的能力。

這意味著,人類原本透過「讀模型的思考過程」來監控AI的方法,可能不再像過去一樣可靠。這並不代表CoT監控已經失效。Pachocki也表示,OpenAI仍在研究如何提高思維鏈可監控性,並探索結合思維鏈與模型內部訊號監控等方法。真正的警訊是:AI能力成長速度可能正在超過人類理解與監控能力的成長速度。

GPT-6 Astra成為新一階段測試場 能力與安全同步競速

 

這項討論與OpenAI近期推出的GPT-6 Astra密切相關。OpenAI在9月3日發布GPT-6 Astra,將其定位為新一代高度能力模型;但隨著模型能力提升,如何監控模型行為也成為更重要的安全問題。路透報導指出,Astra在部分任務上的能力顯著提升,同時OpenAI也面對模型推理過程較難被直接觀察的安全挑戰。

這代表AI產業正在進入一個新的競爭模式。過去科技公司主要比的是模型規模、速度、準確度與應用能力;現在除了這些指標之外,另一場競爭也正在展開——誰能先建立足夠可靠的AI安全與監控技術。

如果AI模型的能力持續快速增加,但安全評估仍停留在舊有方法,模型部署的速度可能最終受到安全能力限制。Pachocki甚至直言,未來AI發展可能會受到「對監控能力的信心」所限制。

AI防禦AI成為兩難 更強的模型可能也是安全工具

 

另一個值得注意的矛盾是,人類可能需要更強大的AI來防禦更強大的AI。Pachocki在文章中提出,未來AI代理可能具有更強的網路攻防能力,也可能透過談判、欺騙甚至勒索等方式與現實世界互動。

如果這類高自主性AI真的出現,人類可能需要同樣具備高度能力的AI防禦系統,才能即時保護網路、關鍵基礎設施與其他AI系統。問題因此變成:如果更強大的AI具有風險,人類是否仍必須先打造更強大的AI,才能防禦其他AI?

這形成AI安全領域難以迴避的矛盾。Pachocki並未因此主張全面停止AI研究,反而認為未來需要同時推進兩條路線,一方面提升對齊與監控能力,另一方面在必要時協調降低AI發展速度。

從企業自律走向法律規範 AI安全開始進入治理階段

 

Pachocki的主張也顯示,AI安全正在從純粹的技術問題,逐漸轉向公共治理問題。如果AI能力快速進步,單一企業能否自行決定安全標準,可能成為新的政策爭論。

因此,他提出應建立更具約束力的AI安全規範,讓對齊框架不只是企業內部的自律措施,同時推動不同AI實驗室形成共同安全標準,並建立跨國協調機制。

這也意味著未來AI治理可能出現三個層次:企業內部安全測試、產業共同標準,以及政府與國際組織建立的跨國治理架構。尤其當AI模型已經能夠跨越國界部署,單一國家的監管很難完全涵蓋整個技術鏈。AI安全因此不再只是OpenAI、Google、Anthropic或其他科技公司的產品問題,而逐漸成為全球科技政策與國際治理議題。

OpenAI真正面對的問題 不是AI要不要更強,而是人類能否跟得上

 

Pachocki這篇文章最值得注意的地方,並非「異星心智」這個具有衝擊力的名稱,而是它重新定義了AI競賽的核心問題。如果模型能力可以持續透過更多資料、算力與自動化研究提高,那麼單純追求更強模型並不是最難的部分。

真正困難的是,人類能否在模型變得更強之前,同時建立足夠有效的監控、對齊與治理機制。這也是為什麼Pachocki認為,AI產業不應把「加速」視為唯一選項。OpenAI官方文章指出,目前沒有任何AI實驗室已經把對齊與監控問題解決到足以長期維持最高速度擴張的程度;他期待在共同安全標準建立前,業界能出現自願性的發展放緩。

因此,這篇文章更像是一項來自AI產業核心內部的「風險訊號」,而不是對AI即將失控的預言。

RSI時代尚未定局 AI產業下一場競爭可能是「可控性」

 

從目前公開資訊來看,RSI仍不能被解讀為「AI已經完全自主進化」的既成事實。Pachocki討論的是一條可能持續發展的技術路徑:當AI越來越多參與資料分析、程式設計、模型訓練與科學研究,機器參與自身改進的程度可能持續提高。

真正需要觀察的,是這條路徑究竟會走多快,以及安全能力能否同步跟上。OpenAI目前已經公開將RSI、AI對齊與監控視為下一階段研究重點,Pachocki則把「是否繼續以最高速度擴張」這項決策直接帶到產業與政策層級。

對全球AI產業而言,下一階段的競爭可能因此不再只是誰能打造最大的模型,而是誰能回答更基本的一個問題:當AI比上一代更聰明、更自主,也更難理解時,人類是否仍然有能力讓它按照人類設定的邊界運作?

這將成為RSI真正走向產業化之前,全球AI公司、政府與研究機構都必須面對的核心考驗。

MGBOX NEWS

178738091944

MGBOX新聞網

(文/ 記者 郭紋雅)

#MGBOXNEWS
#MGBOX新聞網

MGBOX https://magicbox.mg