商業觀點

昨天Fable5.1來,今天CHATGPT 發布 GPT6 Astra。

Max Lu 呂元鐘 ・ 2026-09-04 ・ 原載於 Facebook

誒大家不給休息的耶。 #maxSharing

重點整理一下:

。1,050,000 tokens context window
。單次最高輸出 128K tokens
。reasoning 有 low / medium / high / xhigh / max
。主打 複雜推理、寫程式、Computer Use、研究、文件製作
。API:輸入 US$10 / 百萬 tokens,輸出 US$50 / 百萬 tokens
。官方知識截止日 2026/4/30
。支援 Web Search、File Search、Computer Use、MCP、Code Interpreter 等工具。

OpenAI 昨天發表了 GPT-6,代號 Astra。官方資料看完,:規格幾乎沒變。

上一代 GPT-5.6 Sol 一次能讀 105 萬 token,GPT-6 還是 105 萬;最大輸出一樣是 12.8 萬。這代表 OpenAI 這一代根本沒把力氣花在「一次塞更多資料」上。變的是兩件事:定位,跟價格。

定位改了一個詞,價格漲了 2.5 倍

官方對 5.6 Sol 的描述是「處理複雜專業工作的旗艦」;對 GPT-6 的描述是「為最困難的 end-to-end 工作打造」。差一個詞,意思差很多——前者是把一道難題答得更好,後者是收到目標之後,自己規劃、自己開工具、自己操作電腦、自己檢查,把整件事做完。官方列的五大用途也很直白:複雜推理、寫程式、操作電腦、研究、做文件。

然後是價格,5.6 Sol 每百萬 token 輸入 4 美元、輸出 20 美元;GPT-6 是 10 美元跟 50 美元——剛好都是 2.5 倍。這個定價本身就是一句話:它沒打算取代 5.6 當你的日常主力,它是留給貴的任務用的。

這次升級是頂尖的 40%

真正有意思的,是 OpenAI 自己公布的客戶實測。

法律科技公司 Legora 拿 GPT-6 做財報審查:41 份文件,裡面故意埋了 4 個錯,其中一個是藏在營收附註裡的 50 萬英鎊缺口。GPT-6 四個全抓出來,這條財報核對流程的表現比前一代提升接近 40%。

但同一家公司、同一套測試基準跑完所有任務,平均提升只有 3%。

40 跟 3,這組對照比任何跑分都誠實。它說的是:日常大部分工作,5.6 已經夠強,新模型幫不了你多少;但在某幾條又長、又複雜、錯一步就整件重來的工作鏈上,差距會突然拉開。升級長出來的是幾根尖刺,不是整片往上抬的地板。

另一個案例是遊戲公司 Playco:用 GPT-6 從同一個基底做出三套不同主題的遊戲原型,過程中的人工修正少了 50%。

所以什麼時候值得付 2.5 倍?

把這兩個案例放在一起,帳就好算了。

AI 幫你工作,真正貴的從來不是 token,是回頭再做返工——它做錯、你發現、你改指令、重跑、又錯一個地方、你再收拾。這個循環吃掉的是你的時間。所以 2.5 倍的價格值不值,只有一個判斷方法:如果一件事便宜模型要跑三次加人工檢查,貴的模型一次做完,那貴的反而省錢;如果便宜模型一次就能做對,你付 2.5 倍純粹是在燒帳單。

看到新模型別急著問「它聰明多少」,問「在我哪條工作鏈上,它能把返工砍掉多少」。回頭再做返工成本高過 token 價差的地方,才是它的位子。

OpenAI 這次自己承認,GPT-6 是他們第一個在網路安全能力上達到內部「Critical」門檻的模型——在適當工具跟權限下,它有能力找出未知漏洞、對防禦嚴密的系統發展攻擊手段,所以部署時加了額外的安全措施。這條你可以當成另一個佐證:在「長鏈推理+工具+實際執行」這種任務上,它確實跨過了一個門檻,連 OpenAI 自己都得為此拉警報。

← 看更多 Max Lu 呂元鐘 的文章