OpenAI官網不用「AGI」這個詞,證明AGI的98.6%的等級是客戶買不到的配置
雖然OpenAI證實他們進入了AGI程度,但我們現在其實還碰不到。
OpenAI 總裁 Greg Brockman 前幾天發表 GPT-6 Astra 的時候,講了一句很重的話:「歡迎來到 AGI 時代。」他說自己個人相信,OpenAI 已經達成通用人工智慧。但同一天,OpenAI 自己的官方發表頁上,完全沒有出現「AGI」這個字——頁面上寫的是「最聰明、最對齊的模型」跟「世界最好的電腦操作模型」。一個人在台上喊出時代的名字,公司自己的官方網站沒寫。
拿去證明AGI的那個分數,藏著一個關鍵細節
Astra 在 ARC-AGI-3 這項測驗拿到 98.6%,是外界拿來論證「AGI要到了」最常引用的一個數字。但 The New Stack 追出一個細節:這個分數,是用 OpenAI 自家一套叫「Provider Adapter」的測試環境跑出來的——這套環境會把模型跨請求的推理狀態保留下來、把長對話壓縮,讓模型可以接續上一輪的思考,不用每次重新從頭推理。換成 ARC Prize 官方的標準測試環境,同一個模型只拿到 62.7%。
關鍵的是:模型本身沒有變,變的是包在外面的那層軟體。而且用那套特製配置跑完整套題目,成本是 17,332 美元;用標準環境跑,反而要花 26,098 美元——分數更低、還更貴。一般客戶透過 ChatGPT 或 API 拿到的,是標準版本,不是那組拿下 98.6% 的特製配置。
AI 懷疑論者怎麼看
知名 AI 懷疑論者 Gary Marcus 的評論很直接:Astra 是「真實的進步」,但他拒絕貼上 AGI 的標籤。他原話是:「在 ARC-AGI 上成功很棒、很讓人印象深刻,但——儘管這個測驗的名字裡有 AGI 兩個字——這不代表通用人工智慧已經被證明存在。」
分析指出Astra 公開評測裡最強的項目,是推理、生成、解題、電腦操作;但真正缺的,是「可靠地自我調整、自我修正、跟人協作」這幾項能力——而這幾項,恰好是要撐起「通用」兩個字最需要的部分。
AGI 的定義OpenAI 自己早就寫好了
OpenAI 自己憲章裡對 AGI 的定義是:「在多數有經濟價值的工作上,表現超越人類的高度自主系統。」用這條自己訂的標準回頭檢視,目前公開的證據,並沒有證明 Astra 在多數有經濟價值的工作上表現超越人類——連 Brockman 自己都只敢說「我覺得可能是這個模型」,不是斬釘截鐵地宣告。
我看這件事可以給大家的分享
把這幾件事排在一起看,會發現一個很清楚的落差:對外行銷用的是「AGI 時代」這種能點燃想像力的詞,證明用的分數,用的卻是客戶實際買不到的特製配置;公司自己的官方文件,反而比行銷發言更誠實、更保守。這不是說 Astra 沒有進步——它確實有,這點連最會唱反調的 Gary Marcus 都承認。問題在於,「進步」跟「達成 AGI」中間,還隔著一段被行銷語言刻意模糊掉的距離。
判斷一家公司AI進展的框架:看它敢不敢把「拿去打分數的那個配置」,跟「你實際花錢買到的那個配置」,用同一套規格公開講清楚。分數用特製環境衝高、產品賣標準版本,這中間的落差有多大,就代表這句宣告裡,行銷成分占了多少。
不過不能改變的是 AGI應該很接近了,你覺得呢?