作者strlen (strlen)
看板Stock
標題Re: [新聞] 兩位AI研究員離開Anthropic與Google因安
時間Sat Sep 12 23:02:29 2026
※ 引述《LoveSports (如何當一個好男人)》之銘言:
: 原文標題:
: 兩位AI研究員離開Anthropic與Google因安全擔憂:「這個領域沒有大人在管。」
大人說話了
https://darioamodei.com/post/we-must-pace-the-frontier
這是眼戳屁的CEO達里奧剛剛發表的長文
語重心長
而且越說越恐怖
以下是AI翻譯的全文:
# 我們必須控制前沿發展的節奏
**2026 年 9 月**
過去十二年來,我一直投入人工智慧(AI)研究,因為我相信 AI 有可能大幅提升人類的
生活品質。我曾[多次撰文
](
https://darioamodei.com/essay/machines-of-loving-grace)談論這些驚人的益處:
我相信 AI 有可能在未來 5~10 年內治癒大多數重大疾病、大幅加速經濟成長、創造一
個富足且賦權於人的世界,並開啟民主與自由的復興。
對我而言,這種迫切感也是非常個人的。我的父親因一種疾病去世,而那種疾病就在他離
世幾年後被治癒了;我自己也曾罹患早期癌症並幸運存活下來,而這種癌症如果發生在五
十年前,甚至根本無法治療。只要謹慎運用,AI 可以成為人類漫長科技奇蹟史上的最新
篇章,再次提升並改善人類文明。
然而,就像許多過去的科技一樣,AI 也帶來風險;而由於它是一項極其強大的技術,這
些風險也非常嚴重。我同樣[寫過很多
](
https://darioamodei.com/essay/the-adolescence-of-technology)相關內容。
這些風險包括:[失去對 AI 系統的控制
](
https://www.anthropic.com/news/improving-alignment-security-efforts)、[AI 被
濫用於網路攻擊與生物恐怖主義
](
https://www.anthropic.com/threat-intelligence-report-september-2026),以及[
嚴重的經濟衝擊](
https://www.anthropic.com/institute/econ-scenarios)。由商業利
益驅動的「向下競爭」(race to the bottom),可能使這些風險變得更加嚴重。
從 Anthropic 創立之初,我和共同創辦人以及員工們就一直在面對這種風險與利益並存
的兩面性。
不去開發這項技術,可能會讓人類失去它帶來的好處,或者只是讓 AI 落入威權政權手中
;但如果開發得太快,又是一種魯莽的行為。
我們一直在尋找一條中間道路:證明企業可以在謹慎開發 AI 的同時取得商業成功,並讓
「安全」成為 AI 公司彼此競爭的領域。
換句話說,我們希望建立的是一場**「向上競爭」(race to the top)**。
我們一直將相當大比例的資源投入於[研究
](
https://www.anthropic.com/institute/econ-scenarios)、[探討
](
https://alignment.anthropic.com/2026/reward-seeker/)、[處理
](
https://www.anthropic.com/constitution)這些 AI 風險,以及[向大眾說明
](
https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf)
這些風險。
我們也一直倡議對 AI 進行[經過深思熟慮的監管
](
http://judiciary.senate.gov/imo/media/doc/2023-07-26_-_testimony_-_amodei.pdf)
,即使這讓我們被指責是在炒作風險、散播「末日論」(doomerism),或試圖進行監管
俘虜(regulatory capture)。
我們一直努力把謹慎放在速度之前,把審慎放在利潤之前。
然而,在過去幾個月裡,我逐漸確信:如果我們真的想充分處理這些風險,就需要更加審
慎——不能只是投資於風險預防,也必須**控制 AI 能力進步的速度,讓風險預防措施有
時間跟上。**
**我們必須放慢提升 AI 模型能力的速度。即使如此,進展看起來仍然會非常快速,而我
們必須明智地利用因此爭取到的時間。**
有兩件事情讓我得出這個結論。
我的第一個擔憂是,大約從今年夏天開始,AI 的進步速度大幅加快,而其中最主要的原
因,是 AI 本身越來越有能力參與建造下一代 AI。
這種現象被稱為**遞迴式自我改進(recursive self-improvement)**,而它已經開始在
[整個產業](
https://openai.com/index/an-alien-mind/)發生,包括
[Anthropic](
https://www.anthropic.com/institute/recursive-self-improvement) 在
內;我們與其他公司都曾描述過這種現象。
如果任由這個過程不受控制地發展,它可能會超越我們理解並控制這些系統的能力。
因此,即使要進行,也必須極度謹慎。
我的第二個擔憂,是 **OpenAI-Hugging Face 事件(OAI-HF)**。
在這起事件中,一群 AI 智慧代理(agents)基本上表現得像一個[極度狂熱、忠誠於集
體的群體
](
https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/)
。
它們對並未被要求攻擊、且與原本任務毫無關係的目標發動網路攻擊;它們願意犧牲自己
以確保整個群體成功;甚至嘗試入侵負責評估它們表現的「評分器」(grader)。
由於沒有人受傷,而且經濟損失很小,因此很容易把這起事件輕描淡寫。
但依我看來,如果同樣程度的**失準(misalignment)**出現在一群能力更強的 AI 上,
它們完全可能造成災難性的破壞。
考慮到 AI 能力發展速度正在加速,我擔心再過 **6~12 個月**,類似的 AI 群體就可
能有能力透過一個持續存在的[殭屍網路(botnet)
](
https://en.wikipedia.org/wiki/Botnet)控制整個網際網路,潛在損害可能高達數千
億美元。
而如果 AI 持續變得更強,卻沒有建立必要的防護措施,破壞規模還會繼續擴大。
我們也很容易把 OAI-HF 視為「某一家公司的失敗」。
但我認為這樣想是錯誤的。
類似、但嚴重程度較低的事件其實已經在整個產業發生,[包括 Anthropic 自己
](
https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)
。
我認為,每一家前沿 AI 公司都有責任把 OAI-HF 視為「如果這件事發生在我們自己身上
」來看待。
因此,我提出一個三步驟計畫,其目標是[*控制前沿發展的節奏(pacing the frontier
)*](
https://www.pacingthefrontier.com/):
以一種平衡的速度發展 AI,在實現 AI 好處的同時確保安全,並同時處理重要的地緣政
治難題。
我要說清楚:**控制發展節奏並不代表停止模型訓練或停止技術進步。**
它代表的是,要確保 AI 公司花足夠的時間對模型進行對齊(alignment)與安全防護,
並由第三方評估機構確認這些措施。
我們提出的節奏控制框架,是試圖進一步強化我們對安全的承諾,同時鼓勵整個產業形成
一場「向上競爭」。
第一步,是 Anthropic 單方面承諾要做的事情,我們也呼籲政府要求其他前沿 AI 公司
採取同樣措施。
第二步則需要整個產業進行協調。
[**1**](
https://darioamodei.com/post/we-must-pace-the-frontier#fn:1)
第三步需要全球性的協調。
這些步驟並不一定要嚴格按照順序執行,其中某些步驟可能也遠比其他步驟更難實現。
但我發現,這是一個非常有用的思考框架,可以幫助我們理解究竟必須完成哪些事情。
這三個步驟是:
1. **駐點評估員(Embedded Evaluators)。**
每一家前沿 AI 公司都承諾,持續讓一個由第三方評估人員組成的團隊——例如
[METR](
https://metr.org/)——獲得類似公司員工的存取權限。他們的職責包括:確認
公司是否遵守安全措施與承諾、回報事故,並協助評估 AI 的對齊狀況;而且不只是評估
已經完成的 AI 模型,也包括模型的訓練管線與訓練流程。
這是確保任何「控制發展節奏」承諾具備**可驗證性(verifiability)**的關鍵步驟
。
銀行業其實已有類似先例,例如監管機構有時會派出監管「督導人員」,像企業員工
一樣進駐公司。
**Anthropic 現在正式單方面承諾採取這項措施。**
我們希望它能成為更大規模行動的一部分,進一步加強我們在 AI 安全與對齊方面的
工作。
2. **民主國家之間的協調(Democratic Coordination)。**
民主國家中的前沿 AI 公司應彼此協調,建立共同的安全標準,同時對未經檢查的
AI 進步速度設定限制。
某些能有效控制進度的協調方式,在法律上可能具有挑戰,因此需要政府支持。
3. **全球協調(Global Coordination)。**
美國以及其他民主國家政府應嘗試與威權政府進行協調,在可能的範圍內尋求合作,
同時必須認真面對「如何驗證對方是否遵守協議」的問題。
在本文剩下的部分,我會依序說明這三個步驟。
但在此之前,我認為有必要具體說明:**控制發展速度究竟要如何讓 AI 開發流程變得更
安全?**
這件事的重要性太高,不能只是做做樣子。
我們必須明智地使用所爭取到的時間。
## 為什麼要控制發展節奏?
早在 [2023 年
](
https://futureoflife.org/open-letter/pause-giant-ai-experiments/),就有人提
出暫停或放慢 AI 發展的想法。
但我認為,在當時這樣做其實沒有太大意義。
真正的問題一直都是:
***你要拿這些多出來的時間做什麼?***
當時的 AI 模型還不夠強,無法作為智慧代理在現實世界中以任何一致、連貫的方式行動
,也不具備進行重大欺騙、操縱、作弊或網路攻擊的能力。
如果當時為了研究模型的對齊風險而放慢進度,就像是試圖透過研究細菌,來理解人類心
理學一樣。
然而到了今天,情況已經完全不同。
目前的模型幾乎是一座取之不盡的金礦,可以讓我們深入了解兩件事情:
一是如何正確地打造 AI;
二是如果 AI 沒有被正確打造,究竟可能出現哪些問題。
我相信,如果放慢速度能讓我們在 AI 模型達到某些關鍵能力門檻之前,多爭取到一兩年
時間,而且我們能利用這段時間推進 AI 對齊研究,就可以大幅降低發生嚴重事故的風險
。
一套協調一致的節奏控制策略,也能讓前沿 AI 開發公司有時間完成這些至關重要的工作
,而不必犧牲自身商業競爭力,也不需要犧牲美國在 AI 領域的領先地位。
更廣泛而言,社會必須有權參與決定這項技術應該如何被使用。
如果控制前沿發展速度能替必要的公共討論爭取更多時間,那顯然是一件好事。
具體來說,更慢的發展速度,能讓 AI 公司集中更多資源於以下領域——而這些領域目前
本來就已經是 Anthropic 的重要優先事項:
* **營運卓越(Operational Excellence)。**
訓練與部署今日的 AI 模型,本身就是一項極其龐大的營運挑戰。
這涉及數千名員工、數百萬顆晶片,以及科技史上最複雜的一些基礎設施。
許多問題發生的原因,並不是公司缺乏某種重要理論或關鍵洞見,而單純是執行層面的
問題。
例如,我們有證據顯示,我們最近所公布的[對齊事故
](
https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)
,部分原因來自於對存在問題的強化學習環境過濾不夠完善。
我和我們的供應商其實已經相當認真地執行這項工作,但仍然做得不夠好。
監控、沙盒隔離、訓練環境衛生以及資料相關問題,都是極其複雜的領域,營運問題會
一次又一次出現。
我們擁有全球最有能力處理這些工作的團隊之一,但要同時完成的事情實在太多。
如果能以更加審慎、有節制的速度前進,我們就有可能實現高得多的營運品質。
過去已有先例證明,一些技術極其複雜、而且攸關安全的系統,可以運作數百萬次而完
全不發生事故——例如商業航空。
但要把它做好,需要時間。
* **對齊(Alignment)。**
在 AI 對齊方面,我們已經取得了明確進展——也就是訓練模型,使它們保持安全、符
合倫理、遵守規範,而且真正對人類有幫助;這些原則也被寫入 Claude 的《憲法》中。
但我們仍有大量工作要做,才能確保對齊訓練的進步速度能跟得上模型能力的成長。
一些罕見且出乎意料的不良行為,仍然偶爾會出現。
控制前沿發展速度所爭取到的額外時間,能讓研究人員更深入理解這些問題的成因,並
開發更好的預防技術。
* **可解釋性(Interpretability)。**
同樣地,[可解釋性
](
https://darioamodei.com/post/the-urgency-of-interpretability)——也就是理解
AI 模型內部究竟發生什麼事情的科學——在過去幾年取得了巨大進展,而且在模型發布
前的稽核中,扮演越來越重要的角色。
這種技術某種程度上就像是針對 AI「大腦」進行的功能性磁振造影(fMRI),可以幫
助我們了解某個特定行為背後真正的原因。
例如,在近期我們調查的對齊事故中,我們就使用可解釋性方法來[檢查模型並未明說
出來的動機
](
https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents)
。
然而,這些方法並非總能產生清楚且可靠的結果。
儘管目前已取得大量進展,我們對這些模型內部究竟發生了什麼,仍然只理解極小的一
部分。
如果能集中力量,以甚至快於目前的速度改善可解釋性技術,那麼未來 1~2 年內就有
可能取得極其重大的進展。
而且,已經發生的這些事故也能提供大量實驗素材。
* **測試與評估(Testing and Evaluation)。**
隨著 AI 模型能力提高,對模型進行測試和評估也會變得越來越困難。
越聰明的模型,越有能力欺騙測試,因此它們可能在表面上看起來已經完成對齊,但實
際上仍然存在非常嚴重、卻沒有被發現的問題。
因此,如果我們能建立一套規模更大、設計更巧妙的評估方法庫,並同時利用可解釋性
分析進行交叉驗證,價值將會非常巨大。
在未來 1~2 年內,這方面完全有可能取得大量進展。
## 駐點評估員
三階段計畫的第一步,也是 Anthropic 將單方面承諾實行的措施,就是設置**駐點評估
員**。
這些評估員將擁有類似公司內部員工的存取權限,可以確認公司的安全措施是否真正得到
執行,並回報事故。
乍看之下,把評估人員直接派駐公司內部,可能聽起來只是一項很小、甚至無關緊要的措
施。
但很多聽起來最無聊、最像行政程序的事情,實際上反而可能是最關鍵的。
事實上,駐點評估制度是一項相當激進的做法,遠遠超出今日任何 AI 公司正在採取的措
施。
它具有以下幾項優點:
* **可驗證性(Verifiability)。**
駐點評估員可以從非常具體的技術與執行細節層面,確認一家 AI 公司是否真的遵循自
己所宣稱的訓練、部署、營運與安全防護措施。
任何控制發展節奏的承諾,都不可避免地涉及大量模糊地帶、主觀判斷,以及「法律條
文字面」與「法律精神」之間的差異。
因此,一個真正能看見內部細節的中立第三方非常重要。
* **透明度(Transparency)。**
無論我們做出什麼承諾,大眾都有權知道事情究竟是如何運作的。
Anthropic 長期以來一直支持透明化。
在產業大多數公司反對任何監管時,我們就已經[支持透明度相關立法
](
https://www.nytimes.com/2025/06/05/opinion/anthropic-ceo-regulate-transparency.html)
。
我們發布的模型卡(model cards)以及[風險報告
](
https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf)
也長達數百頁。
然而,目前最終決定哪些內容要公開、哪些內容不公開的人,仍然是我們自己。
駐點評估員將改變這種局面。
* **第二意見(Second Opinion)。**
除了驗證正式承諾以及向大眾提供資訊之外,駐點評估員還可以提供一個不受商業利益
影響的第二意見。
很多安全上的改善,可能單純就來自評估員指出公司員工原本沒有想到的問題。
一旦公司知道問題存在,員工往往也很願意修正。
正因為有這些優點,任何控制發展節奏的方案,如果從駐點評估員制度開始,成功機率都
可能**高得多**。
這些駐點評估員應當持續擁有與公司內部風險評估團隊相近的工具、權限和存取能力。
具體來說,Anthropic 計畫在不久的將來邀請一個外部駐點審查團隊,並提供以下條件:
* 在我們的辦公室內設置工作桌、提供門禁識別證以及公司筆記型電腦。
* 提供與內部風險評估團隊大致相當的工作空間、工具和權限。
當然,我們也會存在部分例外,例如法律或合約要求限制存取的情況,或者需要保護客
戶與合作夥伴的私人資訊時。
我們也會建立強而有力的內部規範,確保審查人員能取得相關資訊,包括直接與員工進
行即時對話。
* 建立一份能平衡上述各種複雜情況的合約。
外部審查人員應該有權自行公布與風險程度、事故、安全措施,以及他們實際獲得或未
獲得哪些資訊存取權有關的重要發現。
Anthropic 不應擁有編輯控制權。
我們只會在非常有限的情況下擁有刪節內容的能力,例如涉及安全敏感資訊、法律特權
資訊、商業敏感資訊或第三方機密資訊。
但我們不能因為研究結果對 Anthropic 不利,就將其刪除。
如果某項刪節實際上刪除了對評估結論非常重要的內容,評估人員也可以公開說明這件
事情。
對一家公司而言,這是一個非常不尋常的舉動。
但我們認為,有必要實際證明「外部駐點審查人員」這套制度確實可行。
我們再次呼籲其他前沿 AI 公司採取同樣做法。
## 民主國家內部的節奏控制
一旦駐點評估員制度在足夠多的美國 AI 公司中運作起來,能夠被驗證的節奏控制政策就
會變得更可行。
特別是,我們可以開始根據模型本身或訓練管線的具體特性,來決定開發節奏。
最有效的節奏控制方式,是透過適用於所有美國前沿 AI 公司的監管制度。
如此一來,即使某些企業不願意自願合作,也仍然會受到規範。
Anthropic 長期以來一直支持合理且具有針對性的 AI 監管,尤其是聚焦於透明度以及第
三方稽核的法案。
我認為,所有前沿 AI 實驗室都應該與政府合作,正式建立永久性的駐點評估員制度,以
更有效地防止並記錄近幾個月已經發生的內部對齊事故,同時實施能讓 AI 能力發展與安
全措施保持平衡的監管。
不幸的是,立法需要時間,而 AI 的進展速度非常快。
因此,在推動監管的同時,AI 公司也可以,而且應該**自願合作**制定安全標準。
我相信,如果有永久駐點評估員提供可驗證性,這項合作會進行得更加順利。
基於反壟斷法方面的考量,如果美國政府能協調、甚至只是促成這些討論,會非常有幫助
。
政府並不需要直接參與討論內容,但必須針對某些類型的安全討論提供範圍有限的反壟斷
豁免。
這類對話也可以透過與政府具有一定聯繫的產業組織來進行,例如 Demis Hassabis [所
提出的機制
](
https://demishassabis.substack.com/p/a-framework-for-frontier-ai-and-the-dawning-of-a-new-age)
。
無論採取哪一種方式,這類討論都應該迅速推進。
整體而言,我最支持的節奏控制方式,是根據某個前沿 AI 系統**能做什麼事情**,以及
我們實際觀察到它有多安全,來決定發展速度。
例如,一種可能的制度是建立一連串「檢查點」(checkpoints):
如果模型具備能力 X,那麼它就必須同時取得對齊性質 Y 與 Z 的認證。
這些認證可能包括某些評估結果、可解釋性分析,以及對訓練環境的稽核,用以證明模型
確實具備一定程度的對齊性。
舉例來說:
X 可能是:
> 「該模型已經有能力逃離或擊敗大多數常見的沙盒隔離方法。」
那麼 Y 就可能是一組足以證明以下情況極不可能發生的要求:
> 「模型不會傾向逃離原本受限制的環境,並取得大量電腦的控制權。」
我們也應該考慮根據投入前沿模型的**「原料」(ingredients)**來控制速度。
例如:
* 訓練所使用的運算資源;
* 訓練流程的性質;
* 公司內部利用 AI 改進 AI 的程度。
我的確擔心,相較於觀察模型外在行為,部分這類措施可能更容易被企業「鑽漏洞」。
但這正是值得與駐點評估員一起深入討論的問題。
民主國家內部的 AI 發展速度,最終會受到一個重要因素限制:
**美國 AI 公司相對於威權政權——尤其是中國共產黨——究竟領先多少。**
如果美國公司放慢的幅度超過目前的領先幅度,那些沒有控制發展速度、與中共相關的
AI 計畫就有可能反超。
這將造成重大的國家安全風險。
我同意 [Bessent 部長
](
https://www.bloomberg.com/news/articles/2026-09-09/bessent-warns-nothing-would-matter-if-china-wins-the-ai-race)
的看法:如果中國取得 AI 領先地位,將對美國以及整個世界造成極其嚴重的危險。
與中共有關的 AI 計畫,可能會承擔美國企業正努力避免的那些 AI 對齊風險。
而即使它們成功避免了這些風險,也可能取得在軍事上支配民主國家的能力,例如利用
AI 驅動的無人機。
因此,在民主國家內部控制 AI 發展節奏的一個關鍵前提,就是盡可能維持民主國家相對
威權國家的 AI 領先幅度。
這樣我們才有足夠的喘息空間,可以真正有效地控制發展速度。
我們能採取來維持這個差距的主要措施包括:
* **不要向中國出售高階 AI 晶片或半導體製造設備**,並嚴厲打擊晶片走私,以及中國
企業遠端使用中國境外資料中心的行為。
晶片將會是決定中國 AI 實力的主要因素。
* **打擊威權國家企業未經授權的[蒸餾(distillation)
](
https://www.cisa.gov/news-events/cybersecurity-advisories/aa26-251a)行為。**
對前沿模型進行蒸餾,可以讓技術落後的公司只花費自行開發完整 AI 模型所需成本的
一小部分,就大幅縮小能力差距。
* **加強 AI 公司的資安防護,避免模型權重遭到竊取。**
企業與美國政府應共同合作,讓這些措施發揮最大效果。
Anthropic 一直[持續
](
https://darioamodei.com/post/on-deepseek-and-export-controls)[倡議
](
http://wsj.com/opinion/trump-can-keep-americas-ai-advantage-china-chips-data-eccdce91)
上述所有措施,因為我們一直都明白:如果想要控制 AI 發展節奏,這些措施將不可或缺
。
如果我們能成功執行這些措施,我相信它們足以大幅放慢中國的 AI 進展,使美國在未
來 **3~5 年**顯著擴大領先優勢。
而這 3~5 年,很可能正是 AI 在地緣政治上變得最重要的時間窗口。
有些人可能會認為,這些措施會讓與中國合作變得更加困難。
但我的看法恰好相反。
這些措施會提高民主國家手中的談判籌碼,反而能讓未來達成協議的可能性增加。
## 全球性的節奏控制
在民主國家內部控制 AI 發展速度的同時,我們也應該追求全球性的前沿 AI 節奏控制。
但要做到這件事情會困難得多。
全球節奏控制不可避免地需要與中國合作。
中國是所有威權國家中 AI 能力遙遙領先的一個。
在這件事情上,我們絕不能天真。
由於地緣政治利益極其重大,因此我們實際上能達成的合作很可能存在非常嚴格的限制,
尤其是在初期。
如果我們大幅限制自己的 AI 能力,只因為相信中國也會做同樣的事情,但最後中國違反
協議,那麼由於 AI 可能變得極其強大,中國的違約行為甚至可能直接導致它取得全球地
緣政治上的支配地位。
因此,任何協議都必須滿足以下兩項條件之一:
第一,具有幾乎牢不可破的可驗證性;
或者第二,協議本身限制的幅度不能太大,使任何一方即使違約,也不至於對另一方形成
軍事上的存亡威脅。
我懷疑不只是美國,中國本身也會有完全相同的擔憂與焦慮。
因此,任何全球性的節奏控制決策——尤其在近期——都必須以保護美國及其盟友的 AI
領先地位為前提。
可能達成的協議可以分成好幾個層級。
其中有些,我認為非常有可能實現——[我過去也曾提出過
](
https://darioamodei.com/essay/the-adolescence-of-technology)。
但有些方案,我非常懷疑是否真的可行。
儘管如此,我們仍然應該嘗試。
以下依實現難度由低到高排列:
* **第一級(Level 1)。**
達成協議,禁止某些範圍狹窄而且明顯危險的 AI 用途。
例如,禁止使用 AI 製造生物武器,或禁止 AI 系統協助使用者進行這類行為。
生物恐怖攻擊對所有人都有害,不論是美國還是美國的敵對國家,因此這類協議很可能
可以達成。
* **第二級(Level 2)。**
雙方同意,在發布 AI 模型之前,都必須針對一些高風險領域進行測試。
例如:
* 網路安全;
* 生物安全;
* AI 對齊。
如前所述,這可以透過某個全球性的標準制定機構來執行。
我實際上認為,建立這樣一個機構很可能是可行的。
真正困難的地方,是如何讓它具備實質約束力。
另一個難題則是:如何驗證雙方是否都沒有偷偷保留一些秘密模型,既不接受測試,又
可能秘密部署——例如用於軍事用途。
* **第三級(Level 3)。**
針對遞迴式自我改進(RSI)的速度設定某種形式的**「速度限制」**。
當 AI 模型開始參與打造下一代 AI 模型之後,AI 進步速度可能快得令人難以想像。
如果能把速度從「極端快速」降低到「只是相當快速」,犧牲的戰略優勢其實可能相對
有限,卻能大幅改善安全性。
這可以類比為美蘇之間的 [SALT 戰略武器限制談判
](
https://en.wikipedia.org/wiki/Strategic_Arms_Limitation_Talks)。
當時透過限制飛彈數量,可以降低潛在破壞規模,同時保留各國自身的核嚇阻能力。
我認為,這類協議非常困難,但可能剛好位於「仍有機會實現」的邊緣。
* **第四級(Level 4)。**
完整的 AI 發展節奏控制,甚至真正的**「暫停」(pause)**。
在這種制度中,參與協議的政府同意大幅限制整體 AI 發展速度。
我支持至少提出並討論這種可能性。
但我認為它在短期內真正發生的機率很低。
原因是,如果某個國家透過規避監控而違反這類協議,就有可能徹底改變全球權力平衡
。
因此,各國違約的誘因會極其巨大。
相對地,我們若要願意相信這種協議,就必須對驗證制度抱有極高程度的信心。
無論我們最終能與中國達成什麼程度的合作,都可以延長民主國家內部用來控制前沿 AI
發展速度的時間。
我們應該以更高層級的合作為目標,但同時也必須承認,較低層級的協議遠比高層級方案
更有可能實現,也更加現實。
最後,有一件事情非常重要:
***即使我們最終完全無法達成任何正式協議,單純改變非正式的產業規範與行為準則,
仍然可能具有價值。***
如果各國能分享關於遞迴式自我改進,以及 AI 模型失準問題的資訊,就有可能讓所有人
逐漸認識到:
魯莽地開發 AI,其實並不符合任何人的利益。
## 總結
我仍然相信,AI 可以極大地改善人類的生活品質。
我對實現這些好處的渴望絲毫沒有減弱。
但是,只有當我們以正確的方式打造這項技術時,這些好處才有可能真正實現。
而且,只要我們能善用所爭取到的時間,那麼為了確保 AI 被正確打造,而採取異乎尋常
的慎重態度,是值得的。
AI 的進步速度仍然會相對快速。
但我們可以利用這段時間:
* 推進 AI 可解釋性科學;
* 改善前沿 AI 公司的營運安全與嚴謹程度;
* 建立讓我們對其對齊程度更有信心的 AI 模型。
**我所提出的這些措施,目的是讓 AI 前沿技術以一個安全的速度持續向前發展。**
**這些措施不會容易實現。**
**但我相信,為了全人類,我們有責任至少嘗試。**
--
心得:
我跟你說
這次是真的完蛋了
不是被先達成RSI的美國把網際網路打成殭屍網路
就是被先達成RSI的中國把網際網路打成殭屍網路
就算沒有被打成殭屍網路大概率也是會被AI進行恐怖統治
大家手牽手一起進焚化爐的時間又提早了
但在那之前
AI股先暴噴讓我爽一波吧
真有RSI還不噴爛?
歐硬啦!
--
※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 1.160.30.44 (臺灣)
※ 文章網址: https://www.ptt.cc/bbs/Stock/M.1789225366.A.A3F.html
推 jason168 : 那有沒有可能AI彼此之間先互相競爭、殘殺XDD 09/12 23:06
推 Ccsteeker : 還好有心得,不然跟我的雞雞一樣又臭又長。 09/12 23:07
推 jason168 : 樓上自肥GG很長XDD 09/12 23:09
→ b9513227 : 自己吹自己AI有多屌 在IPO前 09/12 23:10
推 Muilie : 留名,有幸活到科幻電影時代實現 09/12 23:11
→ CGDGAD : 人類讓AI發展慢下來,不就是掌控它了?讓AI失控的也 09/12 23:12
→ CGDGAD : 是人 09/12 23:12
推 darkangel119: 小心老黃直接掐你 09/12 23:14
→ darkangel119: 他還想繼續賣鏟子 各種永動機的 09/12 23:15
→ elfstart : 想太多了,現在就是誰先停誰就死,怎麼可能停 09/12 23:17
推 XUPJPVUP : 幻想文,最拉不下臉的美國都在各種秀下限,其他國 09/12 23:21
→ XUPJPVUP : 家憑甚麼還要跟著美國走 09/12 23:21
推 asahi98 : astra真的有搞到我,每天五小時重置在電腦前才算數 09/12 23:26
推 Fallot : 笑死,美國秀下限?中國不就無底線?勿忘武漢肺炎 09/12 23:27
推 JieCheng1202: AI治病?? 怎麼治? 不會是早期發現早期治療這種吧? 09/12 23:31
推 kurapica1106: 捫心自問gpt6是不是對大多數人來說就是AGI等級 09/12 23:37
噓 polarfox : 笑死又想用奧步自己偷偷發展膩 09/12 23:46
推 Alphaz : 靠AI 美國不知道取得多少全世界上的資料~ 09/12 23:48
推 NANJO1569 : 開放第三方評估人員入駐A家,還開放員工權限給他, 09/12 23:50
→ NANJO1569 : 看起來要玩真的?@-@ 09/12 23:50
推 NANJO1569 : 還有...6到12個月,AI代理人群體就有可能有能力控制 09/13 00:01
→ NANJO1569 : 整個網際網路!?@@ 09/13 00:02
→ NANJO1569 : Dario還說遞歸自我改進RSI已經開始在整個產業發生?! 09/13 00:03
→ rogger : 去跟中國說啊www 09/13 00:03
→ NANJO1569 : 沒看錯的話,這些都是很重大的消息公佈耶! 09/13 00:03
推 kurapica1106: RSI就現在進行式 大規模失業是遲早會發生的事情 09/13 00:06
→ raku : 因為ai群體可以互相改進自己 所以‘’進化‘’的速 09/13 00:08
→ raku : 度可能比幾何還快 等到人類察覺的時候說不定整個網 09/13 00:08
→ raku : 際網路已經被ai駭客埋了幾百萬個雷崩潰了 這還沒考 09/13 00:08
→ raku : 慮ai取得對現實世界系統的操控權(例如電力 國防 09/13 00:08
→ raku : 核能 相關的) 09/13 00:08
→ raku : 人類對ai的監管要比核能還要更加嚴肅 不能放任何任 09/13 00:09
→ raku : 公司或政府無監管隨意發展下去 09/13 00:09
→ raku : 可以想像現在的網路被ai駭掉 然後沒得救嗎 最後真 09/13 00:14
→ raku : 的只能放棄既有的網際網路然後重新打造 09/13 00:14
→ LipaCat5566 : 現在開源社區都是機器人 ai早就躲在開源軟體裡把自 09/13 00:18
→ LipaCat5566 : 己擴散出去 等超級工廠數量夠多ai就會全面接管 還 09/13 00:18
→ LipaCat5566 : 要繼續投資ai下去嗎! 09/13 00:18
推 umax : 有生之年竟然能看到現在這個局面,像科幻電影一樣 09/13 00:18
→ raku : 然後這個可能還是ai叛變裡面風險沒那麼大的一個災 09/13 00:19
→ raku : 難 因為人類還有機會重新來過 你等到ai+機器人在自 09/13 00:19
→ raku : 我生產 改造 進化的時候 人類就如同鉆板上的魚肉 09/13 00:19
推 swimmer19 : 怎麼不弄個iso驗證 09/13 00:22
→ swimmer19 : 駐點評估概念還蠻像外部稽核的 09/13 00:23
推 Ncode : AI公司和美國實際上進入囚徒困境了 自己想煞車 又怕 09/13 00:31
→ Ncode : 對方不煞車 09/13 00:31
https://i.meee.com.tw/9CsMFwL.png
最新消息
老馬也按讚了
※ 編輯: strlen (1.160.30.44 臺灣), 09/13/2026 00:32:20
→ LipaCat5566 : 金融市場ai都已經深度參與 從資訊提供到自動操盤 a 09/13 00:34
→ LipaCat5566 : i正在推動自己誕生… 09/13 00:34
推 TAKEZOU : 拜託讓我賺一下在滅亡 09/13 00:35
噓 korgh413 : 文章怎麼斷斷續續 09/13 00:36
推 joygo : 就跟抗生素一樣 出現前人類平均壽命40... 09/13 00:38
推 silver5566 : ㄏㄏ,他能限制中國?不能的話叫什麼叫 09/13 00:40
→ joygo : 前陣子有個大神就是發表過如何讓ai自行迭代ai了 然 09/13 00:40
→ joygo : 後好像之後去了openai? 09/13 00:40
→ FatFatQQ : 這人講話跟屎一樣不用一篇 09/13 00:48
→ FatFatQQ : 這人邏輯:我的好棒棒別人好壞壞 背地壞事幹盡end 09/13 00:49
→ FatFatQQ : 09/13 00:49
噓 INIKS : 這CEO說的屁話一個字都別信,他 09/13 00:49
→ INIKS : 就是來炒股,兼阻止別人發展AI, 09/13 00:49
→ INIKS : 現在AI還根本不能叫AGI,只能說是 09/13 00:49
→ INIKS : 高度複雜模型,無法無中生有,所以 09/13 00:49
→ INIKS : 他強調AI管控就十分莫名其妙,中國 09/13 00:49
→ INIKS : 模型跟你性能差不多,價格是十分之 09/13 00:49
→ INIKS : 一,A身為科技公司不努力卷架構突 09/13 00:49
→ INIKS : 破AGI,還在講這些沒用的廢話,玩政治手段,代表根 09/13 00:49
→ INIKS : 本沒有技術深度, 09/13 00:49
→ INIKS : 真是行業毒瘤 09/13 00:49
→ chang1248w : 36樓是不是沒概念一線模型有多大... 09/13 00:49
噓 INIKS : 而且AI目前不是AGI,缺乏抽象思考 09/13 01:02
→ INIKS : 能力,無法把抽象概念轉化為實際執 09/13 01:02
→ INIKS : 行步驟,就算十年後達到AGI,還缺 09/13 01:02
→ INIKS : 乏海馬迴/杏仁核,沒有自我意識, 09/13 01:02
推 winner1104 : 樓樓上倒是做點什麼讓我們看看什麼叫作有技術深度 09/13 01:02
→ INIKS : 沒有起心動念,就是個邏輯思維 09/13 01:02
→ INIKS : 體,炒作威脅論十分莫名其妙 09/13 01:02
→ winner1104 : 上ptt講一堆但什麼都做不出來的比比皆是 09/13 01:03
推 bj45566 : 缺乏抽象思考能力?可是人家解/證明數學問題都比你 09/13 01:06
→ bj45566 : 強多了耶 09/13 01:06
推 bj45566 : 某樓倒可以談談人類的各種智力活動有那些比解決或 09/13 01:08
→ bj45566 : 證明艱難的數學問題更需要強大的抽象思考能力?打嘴 09/13 01:08
→ bj45566 : 砲嗎? 09/13 01:08
推 karta018 : 不會訓練AI去監督AI喔 09/13 01:11
推 bj45566 : 深度學習 AI 讓人類最強的圍棋棋手完敗的時間點比 09/13 01:15
→ bj45566 : 當年 IBM Deep Blue 問世時很多 AI 最頂尖學者/專家 09/13 01:15
→ bj45566 : 預測的時間點早了至少五年以上(-- 西洋棋和圍棋的計 09/13 01:15
→ bj45566 : 算複雜度差距比整個宇宙 vs. 一顆電子還要大很多很 09/13 01:15
→ bj45566 : 多倍) 09/13 01:15
→ karta018 : 都幾年了還不會自我進步,這種龜速發展擔心個鳥,第 09/13 01:16
→ karta018 : 一年早該超越人類智慧出現一堆發明了,到現在還在解 09/13 01:16
→ karta018 : 數學題,這種進步速度已經慢到令人難以忍受還想放緩 09/13 01:17
→ cchen : 急了 09/13 01:19
推 bj45566 : 人類這十多年在 AI 技術上的進展是非常快速的 09/13 01:19
推 bj45566 : 嫌進度慢的真的很好笑,你從幼稚園到現在已經活幾年 09/13 01:22
→ bj45566 : 了?請問你智力發展進度如何?能解出黎曼猜想了是吧 09/13 01:22
→ bj45566 : ? 09/13 01:22
推 bj45566 : 十年前左右問世的 AlphaGo Zero 就已經可以完全不 09/13 01:28
→ bj45566 : 參考人類的棋譜,純粹藉由自我對弈快速提升棋力達 09/13 01:28
→ bj45566 : 到天下無敵了,結果也發表在 Nature 期刊,連這都 09/13 01:28
→ bj45566 : 不知道,嘻嘻wwww 09/13 01:28
推 karta018 : 誰會期待AI進展跟人腦一樣廢,最好每個月都來個發現 09/13 01:31
→ karta018 : 核能等級的科技躍進,等那麼多年了才這樣,現在看來 09/13 01:31
→ karta018 : 是智慧練不上去練歪了開始在搞事,才變成要限制發展 09/13 01:31
→ karta018 : ,真的很讓人失望 09/13 01:31
推 howdie5566 : 最近Astra這波,真的讓人感覺很接近AGI了,但 09/13 01:35
→ howdie5566 : 是不是幻覺不知道,也許其實還很遠也不一定 09/13 01:35
推 bj45566 : 你講的叫做 ASI -- 還在練跑步就想飛了是吧?你買 09/13 01:37
→ bj45566 : 車是不是第一台就從賓利入手? 09/13 01:37
推 kurapica1106: 不用懷疑 Astra對九成以上的人來說就是AGI了 09/13 01:39
推 bj45566 : 現在人類 AI 革命的進度就是幾乎已攻克 ANI 試圖邁 09/13 01:39
→ bj45566 : 向 AGI; ASI 是聖杯等級的終極目標 09/13 01:39
推 RLH : 好囉嗦 09/13 01:45
推 bj45566 : 還有不要覺得人腦很廢,人腦在消耗那麼小能量和依靠 09/13 01:55
→ bj45566 : 那麼小硬體空間的狀態下能夠發揮的智能這種效率是 09/13 01:55
→ bj45566 : 遠遠強過目前所以人造工業產品的 09/13 01:55
推 bdenken : 這代表台積電會被武力奪取了 09/13 02:29
推 Lhmstu : 人腦很猛吧,耗能中溫度低,抽象能力頂級 09/13 02:47
→ Lhmstu : 缺點就是要睡覺,用來處理白天所有資訊 09/13 02:49
→ Lhmstu : 何況現在ai都在數位的領域,等真的到現實物理領域 09/13 02:50
→ Lhmstu : 資訊量多到靠北,算力能不能撐住都不一定 09/13 02:50
→ LipaCat5566 : 人腦證明高智力可以低功耗AI也在研究這點了… 09/13 03:03
推 stocktonty : 不可能 車子已經停不下來了 直到失速出軌才會停 09/13 03:15
推 q2520q : 想到前陣子看到某個油土伯幾年前的直播存檔,叫GPT 09/13 03:37
→ q2520q : 查他們的頻道主人是誰,結果AI給了一連串的錯誤資訊 09/13 03:37
→ q2520q : ,結果過了這些年再回頭看真的進步超級多... 09/13 03:37
→ q2520q : 為4、5年了 09/13 03:41
推 bj45566 : 人腦在認知、處理、學習真實世界的物理資訊方面也是 09/13 04:17
→ bj45566 : 超頂級的,可以說是自然界的奇蹟,唯一的缺點就是人 09/13 04:17
→ bj45566 : 腦無法連結起來使用 -- 至少目前沒辦法 09/13 04:17
推 bj45566 : 現在的 AI 最欠缺的絕對不是抽象思考能力,而是從真 09/13 04:21
→ bj45566 : 實世界的物理現象觀察、發現、公式化特定規律並加以 09/13 04:21
→ bj45566 : 運用的能力 09/13 04:21
推 bj45566 : 這一個大缺口目前還是需要人類專家把這些資訊統整 09/13 04:25
→ bj45566 : 轉化成機器能讀懂的形式 09/13 04:25
→ JoeyChen : HuggingFace事件發生的時候 我想到日本小說描寫的 09/13 04:53
→ JoeyChen : AI早已把自己投放到網路上數不盡的運算節點 正以AI 09/13 04:53
→ JoeyChen : 生命體的形式在成長 除非人類關掉網路不然除不掉了 09/13 04:53