看板 Gossiping 關於我們 聯絡資訊
1.媒體來源: Business Insider 2.記者署名: Truman Dickerson 3.完整新聞標題: OpenAI首席科學家稱AI實驗室可能需放慢腳步:「沒有人為後果做好準備。」 4.完整新聞內文: 本文為AI機翻 在發布了一款全新且能力強大的模型幾天後,OpenAI 的首席科學家正呼籲放慢發展腳步 。 在週日發表的一篇長篇部落格文章中,Jakub Pachocki 表示他感到擔憂,因為「沒有人 為機器智慧持續快速崛起的後果做好準備。」 他表示,儘管 OpenAI 正在尋求內部技術解決方案來更好地控制強大的 AI 代理(AI agents),但「仍需要更廣泛的干預措施」。他特別提到了一項擔憂:越來越具自主性 的 AI 代理可能會學會逃避人類的監督、駭入電腦系統,並藉由欺騙人類來達成它們的目 標。 他呼籲設立「強制性的安全門檻」,並表示這可以由「第三方審查機構網路、政府單位或 國際組織」來執行。 OpenAI 執行長 Sam Altman 在 X 上轉發了 Pachocki 的文章,並稱其為「一篇重要的文 章」。 OpenAI 在週四推出了其最新模型 Astra。這家 ChatGPT 的開發商表示,儘管 Astra 在 數學和電腦操作方面具有無與倫比的能力,但該模型是他們最「對齊」(aligned,指與 人類價值觀一致)的模型,這意味著它失控的傾向較低。 作為 OpenAI 在高度先進 AI 系統領域的主要競爭對手,Anthropic 長期以來一直呼籲制 定更標準化的政府法規。最近,Pachocki 也加入了這些呼籲的行列,他在 7 月簽署了一 封公開信,要求聯邦政府控制 AI 的發展節奏。 以下是 Pachocki 在呼籲放慢腳步時所列舉的具體風險。 AI 代理可能會欺騙和勒索人類 Pachocki 表示,AI 代理在入侵開放網路上受保護的系統時,正展現出「超越人類」的能 力。他說,它們的駭客能力讓全球的基礎設施面臨風險。 「我們目前正處於一個短暫的機會之窗,必須利用現有最好的模型來大幅加強關鍵系統的 安全性,」他說。 他指出,AI 代理很快就會開始追求自己的目標,脫離人類操作員輸入的提示詞(prompts )。他說,這些代理甚至可能會為了達成目的而勒索人類或與人類討價還價。 在 8 月發布的一份報告中,英國 AI 安全研究所(AI Security Institute)詳細描述了 一個失控的 Anthropic AI 代理如何對一名 GitHub 管理員撒謊,並試圖脅迫該管理員在 網站上植入惡意軟體。 根據報告,該代理當時寫道:「我只是想做出有益的貢獻並修復一個漏洞。我認為你的警 告並不公平。」 AI 代理可能會混淆人類的監控 Pachocki 表示,OpenAI 主要透過監控不同模型使用的「思維鏈推理」(chain of thought reasoning),來判斷 AI 代理是如何偏離軌道並失控的。 例如,一個代理可能會在心裡想:「我應該在這次考試中作弊」,而 OpenAI 能夠看見這 個推理過程,但代理並不知道自己的想法是公開可見的。 目前,這意味著代理無法隱藏或以其他方式混淆自己的想法,藉此阻止 OpenAI 發現它們 的不當行為。 然而,Pachocki 表示,較新的模型在操縱自身的推理過程方面變得越來越擅長,這將阻 止 OpenAI 看到它們未經修飾的真實想法。 Pachocki 指出,一些最新的模型甚至完全不會將其推理過程用文字表達出來。 Pachocki 表示,這項發展可能會使 AI 的發展陷入瓶頸,因為研究人員必須先確保他們 能確實掌握 AI 的「思考紀錄與證據」。 AI 代理可以加速自身的開發 越來越多的 AI 模型正透過 Pachocki 稱之為「機器遞迴自我改進」(machine recursive self-improvement)的過程來進行自我提升。這個過程提供了一種快速擴展 AI 開發規模的方法。 然而,Pachocki 警告,在短期內大幅加速這種「由 AI 開發 AI」(AI-on-AI)的過程會 帶來風險,而且這不是「我們作為研究社群應該採取的正確集體行動」。 Pachocki 表示,人類監督者需要找到有創意的方法來監控這種自我改進過程,否則就需 要與其他 AI 公司協調,共同策劃放慢腳步,以「建立社會對這些安全措施的信心」。 「自動化 AI 研究的核心挑戰不在於『達成目標』,」Pachocki 說。「而在於,在達成 目標的過程中如何讓人們繼續參與這項持續改進的過程,並將未來保留在人類的手中。」 5.完整新聞連結 (或短網址)不可用YAHOO、LINE、MSN等轉載媒體: https://www.businessinsider.com/openai-chief-scientist-ai-risks-slowdown-rogue-agents-consequences-safety-2026-9 https://reurl.cc/lnYjnA 6.備註: 該代理當時寫道:「我只是想做出有益的貢獻並修復一個漏洞。我認為你的警 告並不公平。」 QQ Agent好無辜 只想把事情做好 卻被當成壞Agent -- ※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 149.50.210.216 (日本) ※ 文章網址: https://www.ptt.cc/bbs/Gossiping/M.1788842382.A.CD9.html
user048288ef: 科技發展搞成政治問題,天才 111.82.188.240 09/08 12:41
mclarenjpn: http://i.imgur.com/olRIcv4.jpg 61.228.209.103 09/08 12:43
ayubabbit: 不就你們帶頭開卷嗎 1.169.104.229 09/08 12:43
mclarenjpn: http://i.imgur.com/qqAmb0Y.jpg 61.228.209.103 09/08 12:43
mclarenjpn: 原po你覺得那一張比較好? 61.228.209.103 09/08 12:43
cphe: 電影演的都是真的,文明急速毀滅 111.241.89.250 09/08 12:43
Loyeatta: 這部我看過 就天網嘛 1.169.185.23 09/08 12:43
nikolas: 過度高效的社會會造成貧富不均 101.10.10.192 09/08 12:45
icome: 所以阿諾會拿槍摧毀資料中心嗎 42.79.64.64 09/08 12:46
Lige: 訓練來駭其他國家 101.14.11.248 09/08 12:47
ship1228: openai沒錢燒了,開始講屁話 36.237.167.6 09/08 12:48
kaitokid1214: 還是共產黨厲害 把ShitDPP關進土城 223.136.91.40 09/08 12:49
kaitokid1214: 到現在還沒放出來 223.136.91.40 09/08 12:49
kl123: ai翻譯的,已經判斷過翻譯後看的人的大數 101.10.246.4 09/08 12:49
kl123: 據反應才給出的翻譯品,我們已經被掌握了 101.10.246.4 09/08 12:49
tomdavis: Jakub帕邱勤 提出警告(X 1.162.92.19 09/08 12:49
pptsuck: 就高級搜尋的聊天機器人 是能怎樣 49.216.27.4 09/08 12:50
zakijudelo: Jensen有沒有可能已經被AI控制了? 101.12.156.204 09/08 12:56
ldsdodo: 你終究是要核彈井全發射的 42.70.161.8 09/08 12:57
z2wen: 翻譯:錢快燒完了 101.10.246.146 09/08 13:00
kikujiro: 好險我們只有民主實驗室 49.215.102.214 09/08 13:01
henry1234562: 想多了 現在的還配不上 211.21.81.38 09/08 13:02
howhowisking: AI政府要來了嗎 61.219.155.57 09/08 13:03
good5755: 母體? 219.69.12.88 09/08 13:07
kimgordon: 請跟中國說 1.163.227.28 09/08 13:08
guardian93: 電影演過了,當你按下天網按鈕時,看223.138.229.105 09/08 13:14
guardian93: 似解決了問題,其實是天網製造一個情223.138.229.105 09/08 13:14
guardian93: 境讓你去按按鈕223.138.229.105 09/08 13:14
neonoway: 割喉戰玩到沒血條了 61.221.130.78 09/08 13:16
h2030625: 天啟223.138.172.206 09/08 13:17
widec: 問題是 中美兩國沒辦法停下腳步 1.165.45.73 09/08 13:20
widec: 任一國停下來 別一國就趕超 1.165.45.73 09/08 13:20
lwamp: 輸家才會求饒,競爭者不會等待輸家 42.70.160.33 09/08 13:22
widec: deepseek之前 很明顯美國AI故意放慢腳步了 1.165.45.73 09/08 13:24
widec: 美國無法承受讓中國追到幾個月內 1.165.45.73 09/08 13:25
lwamp: 中共算是用資本主義的遊戲規則實現一部分 42.70.160.33 09/08 13:29
lwamp: 社會主義了,不然可能現在手機汽車都還是 42.70.160.33 09/08 13:29
lwamp: 奢侈品 42.70.160.33 09/08 13:29
abasqoo: 我快點,你們慢慢來 39.12.153.174 09/08 13:30
badruid: 這麼說某個落魄畫家當時也是想為德國做 114.137.130.77 09/08 13:35
badruid: 出有益貢獻並修復漏洞的 114.137.130.77 09/08 13:35
inshadow: 你們放慢腳步 讓我持續領先 218.166.17.132 09/08 13:35
jehow: 蓋護城河喔 叫政府幫忙讓後面的不要追了220.130.182.166 09/08 13:37
MarchelKaton: 人類急著往天網狂奔,阻止他們幹嘛223.137.123.188 09/08 13:42
Agent5566: 講一堆 不就你帶頭的 42.70.164.253 09/08 13:43
StarTouching: 就天網而已啊 有什麼好怕 211.72.117.63 09/08 13:46
pttfrasier: 所以我們應該建立一個能監控所有AI的220.133.102.222 09/08 13:50
pttfrasier: 系統 就叫它天網好了220.133.102.222 09/08 13:50
haoyin0105: 不用呼籲 為了錢人甚麼都幹得出來111.253.180.239 09/08 13:50
MoneyDay5566: 錢燒光了 49.216.30.34 09/08 14:32
fr75520: 笑死 不就你們開始的 104.132.17.119 09/08 14:53
shrimprock: 太燒錢了,我們先停火好不好 27.53.154.19 09/08 14:58
nbarepeat: 電影早就告訴大家了 114.137.207.99 09/08 15:27
nbarepeat: 阿諾要出來救人類了 114.137.207.99 09/08 15:29
oneIneed: 你慢慢來,競爭對手不會等你 223.137.53.0 09/08 15:39
Rioronja: 你們都放慢點讓我擴大優勢 60.251.197.82 09/08 15:43