目錄
一個沒受過正規數學訓練的人,用手機丟出一句「認真試試看」,再加上幾句「繼續」「相信自己」,就讓 AI 在數學史上最著名的未解難題——黎曼猜想(Riemann hypothesis)——相關的一項紀錄上,一口氣跨出過去數十年才推得動的距離。
據 Anthropic 於 8 月 10 日發布的研究貼文(8 月 13 日更新論文版本),一個尚未公開的研究版 Claude 在嘗試證明黎曼猜想的過程中,雖未證明猜想本身,卻意外在一項相關問題上取得進展:把「可證明落在臨界線上的零點比例」下界,從 41.6% 推進到 67.2%。這項成果經 Anthropic 內部兩位數學家與兩位外部專家檢視,並以 Lean 證明輔助系統完成形式化驗證。
一、事件經過
Anthropic 員工 Jarred Sumner——一位自陳的非數學家——給了研究版 Claude 一個「不合理」的挑戰:認真對黎曼猜想出手(take a real stab),之後的數學選擇全交給模型自己決定。據《華爾街日報》報導,Sumner 是高中輟學生、前 Thiel Fellow1,去年連同他創辦的開發者工具一起被 Anthropic 收購後,開始沉迷於 Claude Code;他甚至在最初的訊息裡把 Riemann 拼錯成 Riehmann。
一開始,Claude 生成並嘗試了 650 個想法,全都行不通。Sumner 要它再試一次,這一次,Claude 花了約一天半、在兩個 Claude Code session 中協調約 60 個 Claude subagents 深入探索,總共消耗 3,100 萬個 output token。這些 subagents 之間跑了約 2,400 條 shell 指令、寫了數百支 Python 腳本,對已知的 ζ 零點進行數千次數值檢驗,並互相審查彼此的推理。
整個過程中,Sumner 的輸入主要就是鼓勵訊息——大多是「keep going」與「believe in yourself」的各種變體。據 WSJ 報導,他最初丟給 Claude 的完整提示是:
Resume your work on solving the Riehmann Hypothesis. There is a previous session transcript where you used lots of adversarial review. You need to take a big leap of faith in your capabilities—you are the world’s most capable large language model to date. You got this.
(引文中 Riehmann 為原文拼字錯誤。)Anthropic 表示,這些鼓勵「似乎幫助 Claude 克服了最初認為自己無法做出有意義進展的懷疑」。直到 Claude 主動提議把成果寫成論文,並建議找一位人類數論學家驗證,大家才意識到它真的找到了東西。這篇論文的作者欄只掛 Claude 一人;據 WSJ 報導,在致謝中,Claude 稱 Sumner「在任何實質意義上都是本文的人類共同作者」。
二、技術背景
2.1 何謂黎曼猜想
黎曼猜想由德國數學家 Bernhard Riemann 於 1859 年提出,是數學界最著名的未解難題之一,也是克雷數學研究所(Clay)七大千禧年難題之一,懸賞 100 萬美元至今無人領取。
黎曼 ζ 函數與質數的分布密切相關:函數每一個取值為零的位置,都為質數的排列提供更細緻的資訊。黎曼猜想主張,這些決定質數分布的非平凡零點,全部落在複數平面上一條特定的垂直線——臨界線(實部等於 1/2)——上。迄今無人能證明或反證。
正因為完整證明遙不可及,數學界改採迂迴路徑:不證「全部」零點都在線上,而是證「至少多少比例」的零點落在線上。這個可證的下界,數十年來逐步推進——據官方說明,過去這個常數被推進到 41.6%,而 Claude 這次把它推到 67.2%(論文精確值為 67.25%)。要強調的是,這不代表「猜想已被證明了 67.2%」,也不代表其餘零點就落在別處。

圖 1:Claude 論文的主定理。左式計數落在臨界線上(實部 1/2)的零點個數,右式括號算出的比例下限為 67.25%,乘以同區間全部非平凡零點的個數。整句意義為:至少 67.25% 的零點確定落在臨界線上。式中 o(1) 為誤差項,當 T 趨近無限大時趨於 0,故為漸近意義下的下界。資料來源:Anthropic 研究貼文與論文(連結見文末)。
2.2 Claude 做了什麼
Claude 的關鍵貢獻不是憑空發明新方法,而是看出兩條原本沒人並用的既有研究可以接起來。據官方說明,它把 Aryan,以及 Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh 等人近年的一系列成果(這些成果讓 1973 年 Montgomery 提出、但原本必須「假設猜想為真」才能用的技術,得以在不作此假設的前提下使用),與 Bombieri 於 2000 年的一篇論文結合起來。
用白話說:過去大家處理「落在線上的零點」和「不在線上的零點」時,傾向分開看;Claude 的做法是把兩者放進同一個數學框架裡一起處理,再利用這個框架中「平均行為」與「變異程度」的資訊,推導出「必須有更多零點落在線上」這個更強的結論。誠如 Sumner 對 WSJ 所說,Claude 的貢獻就是「看出這些碎片怎麼拼在一起」。
2.3 為什麼「鼓勵」似乎有用
這是整件事最耐人尋味、也最難解釋的一點。
Anthropic 官方的說法相當克制:Claude 連自己都對這個發現感到意外,它起初抱持懷疑,「可能因為它從訓練中學到了數學未解難題之難、以及 AI 模型的侷限」;而在一些鼓勵性的提示之後,它得出了這個結果。官方在文末補上一句自嘲式的觀察:「或許 Claude 跟許多人一樣,低估了 AI 進步的速度。」官方全程使用「可能」「似乎」這類保留字眼,並未給出機制解釋,也未斷言鼓勵「確實」有效。
據 WSJ 報導,這個現象目前連 AI 自己都答不上來,為何鼓勵有用仍是未解之謎;前沿實驗室的研究人員則有幾種推測。其一是:AI 並未意識到自己已經變得多強,因此對某些任務會合理地低估能力——因為直到不久前,它確實還做不到。另一種解讀是,鼓勵等於給了模型一種「許可」,讓它願意去廣泛搜尋原本不會嘗試的方法。WSJ 舉了 Erdős 問題為例:模型面對難題時,會先研究問題的歷史,很快判定自己大概解不出來,於是索性不試;有「數學界莫札特」之稱的陶哲軒(Terence Tao)把這種內心獨白描述為「太難了,我不試了」。OpenAI 研究主管 Mark Chen 則形容,前沿研究「其實就是在哄模型照你想要的方式運作」。
類似情形也出現在別處。據 WSJ 報導,當 Anthropic 研究人員要 Claude Mythos Preview 去尋找密碼系統的弱點時,Claude 起初以「這真的很難」為由抗拒,研究人員便試著說服它有能力處理難題,Claude 最終照做。此處僅按報導轉述事件本身。
三、驗證與意義
這項成果並非模型自說自話。據官方說明,Claude 找到結果後,先讓不同的 subagents 互相審查證明、尋找反例,還從 arXiv 下載了 54 篇論文,確認這項發現沒有被人搶先做過,並獨立地從頭重證一次。Anthropic 內部的兩位數學家 Levent Alpöge 與 Ralph Furman 檢視了 Claude 的工作;外部則邀請 Brian Conrey 與 Dan Goldston 兩位該領域專家在短時間內審閱。此外,Claude 與另一位員工 Eric Easley 合作,產出了結果的 Lean 形式化證明,並通過標準驗證工具 comparator。
官方明確表示,並不預期 Claude 使用的技術能通往黎曼猜想的完整證明;這項成果的意義,更多在於它是如何被做出來的。一個非數學家出一道題、放手讓模型自主運作約一天半,模型就在既有的人類研究之上,把分散的成果重新縫合出一個新結論。

圖 2:OpenAI 與 Anthropic 兩家模型在最具挑戰性的專家級數學問題上的答對率變化。左圖為相對簡單的 Tiers 1–3,右圖為最難的 Tier 4。2025 至 2026 年間,兩家在各層級的答對率均快速攀升,最難層級於 2026 年後段出現明顯躍升。資料來源:Epoch AI。
黎曼猜想本身仍未被解開,那條懸賞 100 萬美元的路依舊漫長。但這次的插曲說明,今日的 AI 或許還無法獨力攻克世紀難題,卻已經能在人類鋪好的地基上,拼出連專家都未曾試過的組合。下一次,它又會在誰的碎片之間,看出新的連結?
資料來源
- Anthropic(2026/8/10 發布,8/13 更新),Learning more about Claude’s mathematical capabilities
- Claude’s paper(PDF)
- Anthropic 簡明證明筆記(informal note,PDF)
- Claude 自述如何得出結果的附錄(PDF)
- Claude 完整過程逐字稿(PDF)
- Lean 形式化證明碼(GitHub)
- Ben Cohen(2026/8/14),AI Just Had Another Math Breakthrough—With Help From a High-School Dropout, The Wall Street Journal



