DeepMind昨天把人類DNA 90億種單點突變全部預先算完,存成一個1PB的免費資料庫
商業觀點

DeepMind昨天把人類DNA 90億種單點突變全部預先算完,存成一個1PB的免費資料庫

Max Lu 呂元鐘 ・ 2026-09-09 ・ 原載於 Facebook

以後是要叫DeepMind爸爸了嗎?我們全被算光了。

Google DeepMind昨天(9月8日)發布了一個叫AlphaGenome Atlas的資料庫,把人類DNA理論上可能發生的90億種「單一字母突變」的影響全部先算好,打包成一個1PB(等於1000TB)大小的資料庫,免費開放給研究用途。聽起來很技術,我知道,但這個打法跟背後的盤算,比表面看到的有意思很多。

—-
▍先搞懂「90億種突變」怎麼算出來的

人類基因組大概有30億個鹼基位點,每個位點理論上都能突變成另外三種鹼基之一,30億乘以3,就是90億種可能的單點突變。過去要知道某個具體突變會不會致病,得一個一個去算、去做實驗驗證,很花時間。DeepMind這次做的事,是用他們去年發布的AlphaGenome模型,把這90億種可能性一次全部算完,存成資料庫,以後誰要查某個突變的影響,不用重新運算,直接查表就好。

—-
▍真正難解的不是基因本身,是基因以外的98%

人類基因組裡真正負責寫出蛋白質的編碼區,只占整個基因組的2%左右,剩下98%是調控區,決定一個基因什麼時候該開、開多大聲量。大多數跟疾病、跟性狀有關的變異,其實就藏在這塊調控區裡,但它一直是最難解讀的一塊,因為裡面絕大多數變化都是無害的隨機雜訊,真正有殺傷力的訊號被淹沒在裡面,很難挑出來。AlphaGenome Atlas鎖定的就是這塊過去長期被晾在一邊的暗區。

DeepMind為了把「這是不是危險突變」講清楚,做了一個叫AVI(AlphaGenome Variant Impact)的統一分數,把AlphaGenome(調控預測模型)跟AlphaMissense(蛋白質致病性預測模型)兩個模型的輸出合併成單一數字,拿去跟真實臨床基因資料庫比對。結果這個分數能可靠分辨出「這是致病突變」還是「這只是正常變化」,在多項變異致病性與罕見病的公開測試指標上都拿到最好的成績。

—-
▍已經真的幫人找到病因

這套東西不是紙上談兵,已經有實際案例。美國布羅德研究所(Broad Institute)的研究人員,用它幫一個罹患罕見癲癇腦病的孩子找到了病因:DNM1這個基因裡的一個變異,做出一個錯誤的剪接位點,讓最後合成的蛋白質不正常地變長,實驗篩選驗證了這個預測是對的。

另一邊,英國埃克塞特大學的研究團隊,用這套系統分析超過5萬4千名英國生物資料庫(UK Biobank)參與者的資料,多找出22%的非編碼區基因關聯,還鎖定了兩個跟蛋白質豐度有關的新基因。

—-
▍這是DeepMind第二次玩同一套打法

DeepMind不是第一次幹這種事:先把整個問題空間一次算完、存成資料庫、免費開放。2022年他們發布AlphaFold Database,把人類已知的蛋白質結構,從當時19萬個經實驗驗證的結構,直接擴充到超過2億個AI預測結構。

這次AlphaGenome Atlas的資料規模,據說是AlphaFold資料庫的30倍以上。這套打法讓Demis Hassabis跟John Jumper拿到2024年諾貝爾化學獎,現在他們把同一套方法搬到基因組上再玩一次。

—-
▍免費開放,但商業使用要另外付費

非商業研究用途完全免費,網站(alphagenome.google/atlas)、API、甚至整合進Google自家的agentic開發平台Google Antigravity都能直接用;商業用途則要透過Google Cloud的Model Garden另外付費授權。

DeepMind也在官方頁面上寫得很清楚:這套系統目前還沒經過臨床驗證,不能取代專業醫療建議。

我自己的分享

看DeepMind這個打法特別有感。他們連著做了兩次同一件事:先花最貴、最難的那次運算成本,把整個問題空間一次性算完,存成一個所有人都能查表用的永久資產,而不是每次有人問就重新算一次。

DeepMind用AlphaFold證明過一次這套打法能拿諾貝爾獎,現在用AlphaGenome Atlas再證明一次這不是偶然。真正的護城河,是願意先把最貴的那一步做完、蓋成資產,之後所有人來查都是免費的複利——同一件事重複做得比別人快,那個不算。

← 看更多 Max Lu 呂元鐘 的文章