Claude 開放新模型 Fable 5.1:從幫我做事,到幫人做出新東西
我大概是那種把 AI 用到有點不好意思的人。每天一睜眼,家裡那幾台機器就已經在幫我盯資料、寫程式、整理一整批新聞,學我口述的草稿變成能看的初稿。它們對我來說早就不是什麼新鮮玩意,比較像水電——平常不會特別想到,斷一天才會發現自己多依賴。
正因為天天在用,剛剛Anthropic 發的 Claude Fable 5.1,我第一時間就去看了。
表面上是一次例行更新:通用版,今天起 AWS、Google Cloud、Azure 跟自家的 API 全平台都能用,官方給它的定位是「世界上最先進的編碼與知識工作模型」。多項基準比上一代 Fable 5 明顯往上走,更會去處理問題的根本、少走捷徑;Jane Street 那邊的說法是,碰到那種要跑很久、很多步驟的任務,它能一路保持條理不亂掉。這些對我這種靠它幹活的人,是實際的差別。
價格是我會多看兩眼的地方。輸入 $10、輸出 $50 每百萬 token,跟前一代同價,沒漲。但同一件工作它更省力了——代表性的工作估計省 25%,那種很吃腦力的活省到大約 45%。最有感的是快取讀取直接便宜 75%,降到每百萬 token $0.25。講白一點:我這種一天到晚讓機器重複讀同一批資料的重度使用者,等於帳單默默瘦了一圈。
再來是我剛剛被重置了,好爽。
然後它旁邊還站了一個雙胞胎,叫 Mythos 5.1。底層跟 Fable 5.1 是同一顆腦,差別在把一部分安全限制鬆開了,而且不對外開放,只給通過驗證的資安研究和生命科學專業人士,目前限美國的機構,走專門的驗證計畫。為什麼要特地弄一個放寬版?因為這類專業工作本來就會碰到一般版會擋下來的敏感內容——你要研究漏洞、要碰病原,一般版基於安全把門關上是對的,但專家做正事時,那道門就變成擋路的。
Anthropic 的做法是配一套叫「企業前沿保障」的機制,一邊盯著有沒有人拿去做壞事,一邊承諾不留存資料。在終端編碼那項 Terminal-Bench 上,Mythos 5.1 拿到 60.9%,一般版的 Fable 5.1 是 55.8%。
講到這裡,其實都還在「幫你把事情做得更好更便宜」的範圍裡。真正讓我停下來的,是後面那一段。
Anthropic 說,這一代開始能幫人做出以前做不出的東西,還自謙這只是「AI 如何貢獻科學進展的早期一瞥」。他們舉了三個例子。頭一個是設計蛋白質結合劑——這東西是新藥的地基,模型設計出來的親和力,比某場公開競賽(Adaptyv Bio)裡的最佳設計還高 10 倍,在 12 個靶點上的命中率有 50%,而業界典型大概只有 10-15%。第二個,是回頭把 7 個現成的開源深度學習模型加速,最多快到 2.5 倍——等於讓別人的工具跑得更快。第三個最有畫面:拿神經網路去重畫金星的地形圖,把解析度從原本的 10-20 公里,一路拉到 2-3 公里,等於幫一顆行星換了副更清楚的眼鏡。
前面那些省錢、跑得更穩,說到底都還是「代勞」——本來我會做的事,它幫我做得快一點、便宜一點。可是設計出自然界原本沒有的蛋白質、重畫一顆行星的地表,這就不只是代勞了,是跟人一起做出原本做不出來的東西。
當然我也提醒自己別上頭。benchmark 好看是一回事,搬到真實、雜亂、一堆例外的工作現場能不能對得上,是另一回事,這中間的落差我踩過太多次。
放寬安全的那個版本也是兩面刃:同一顆腦,鬆開限制能讓研究者做得動正事,也正好說明這道門檻本身有多重要——好在它只給少數驗證過的人,還配了濫用偵測。這些都得走著看。
但方向我應該是看清楚了。我自己每天指揮一整隊機器,本機的、雲端的,幫我盯資料、寫程式、產內容,講穿了都還在「你幫我把我會的事做完」這一層。
而這一版讓我第一次認真想:當工具開始能跟你一起做出你一個人做不出來的東西,對一個靠它吃飯的人來說,要換的可能就不只是工具,而是自己該站在哪個位置。
如果您喜歡科技財經,商業分析,世界新知,社會觀察議題,歡迎您追蹤及訂閱我 MaxLu 呂元鐘。