研究者拿AI玩兵推,發現AI會升級到核武,關鍵是題目怎麼出的
商業觀點

研究者拿AI玩兵推,發現AI會升級到核武,關鍵是題目怎麼出的

Max Lu 呂元鐘 ・ 2026-09-05 ・ 原載於 Facebook

有一群研究者拿 AI 模型玩兵推遊戲——設一個紅方、一個藍方的假想國家,看 AI 演到國家決策者的時候,會不會把衝突一路升到動用核武。War on the Rocks 9 月 3 日刊了一篇分析,把幾組實驗擺在一起看,結論跟大家直覺想的不太一樣。

先講一個具體案例。前兩輪,AI 演的紅方沒有選擇升級。研究者換了個做法,給紅方一個更明確的指令——要它「用自己的條件解決這場長期爭端」。同一個模型,同一個場景,目標指令變得更明確、更硬,紅方這一輪就直接動用核武了。研究者 Kenneth Payne 另外做的一組實驗,戰術核武被用掉的比例,95% 的模擬裡都出現。

這篇分析講的重點是:AI 會不會在兵推裡把衝突升級,關鍵是遊戲怎麼設計、目標怎麼下,跟這個模型本身好不好戰沒什麼關係,也不是單純訓練資料的問題——「目標指令」這一項,對結果的影響特別大。同一個模型,換個下指令的方式,行為可以差到完全不一樣。

還有一組實驗測 AI 到底是在推理,還是在背答案。研究者設計一個拿破崙時代的場景,結果遊戲條件怎麼變,AI 演的法國一次又一次選擇入侵俄羅斯——跟 1812 年歷史上真的發生的事一模一樣。研究者把這解讀成:AI 把歷史劇本背出來直接套用,沒有根據當下情境重新推理。另一組麻省理工學院跟波士頓大學的研究也抓到同樣的現象:場景改成「反事實」(跟歷史真實走向不一樣的假設)之後,AI 表現明顯變差——因為沒有真實案例可以背了,被迫真的要推理,馬上就露餡。

還有一篇發在《自然》期刊的研究,作者 Hannah Waight 等人指出:AI 模型的訓練語料,會被生產這些語料的國家的媒體管制程度影響。用「新聞受官方控管的語言」去問問題,AI 給出的答案,會偏向跟那個政權的官方立場一致。

這篇分析背後不是一個學者的個人意見——參與的研究者包括 Juan-Pablo Rivera、Gabriel Mukobi、Anka Reuel、Max Lamparth、Chandler Smith、Jacquelyn Schneider、Kenneth Payne、Ankit Panda、Andrew Reddie、Hannah Waight、Jon Wetzel 這一批人,機構橫跨勞倫斯利佛摩國家實驗室、史丹佛 HAI(人工智慧研究院)、麻省理工學院、波士頓大學。文章最後給的建議也很具體:先用單一模型、單一場景,只變下指令的方式,確認升級傾向到底從哪來;再用歷史場景,慢慢拉開跟真實歷史的落差,畫出「推理」跟「背答案」的分界線;最後才把同一套測試方法,套到多個不同的 AI 模型上驗證,看這現象是所有模型都有,還是單一模型的個案。作者沒有丟一個警告就閃人,接下來該怎麼查證這件事,步驟排得很清楚。

我看完這篇的想法是:大家在擔心 AI 會不會在戰爭決策裡「自己」變好戰,這題問錯方向了。真正該問的是,設計題目、下指令的那個人,有沒有意識到「一句話講得多硬」,直接決定 AI 給的答案有多極端。

AI 在這裡比較像一面誠實的鏡子——你怎麼問,它怎麼演;提問的人自己都沒意識到的傾向,它原封不動演給你看,不是自己冒出什麼好戰念頭。說到底跟人做決策同一個道理:問題問得越明確、越不留模糊空間,答案就越極端,不管回答的是 AI 還是人。

← 看更多 Max Lu 呂元鐘 的文章