四大會計師事務所生成式人工智慧(GenAI)運用翻車事件簿

四大會計師事務所生成式人工智慧(GenAI)運用翻車事件簿

一、教人用 AI 的機構,自己先翻車了

過去兩年,企業導入生成式 AI 的第一通電話,多半打給四大會計師事務所。KPMG 出版客戶體驗與 agentic AI 的年度研究,PwC 中東向波灣國家的企業主管推銷 agentic AI 的應用前景,EY 與 Deloitte 則承接政府與企業的數位轉型專案。這些機構同時扮演兩個角色:AI 應用的倡議者,以及專業判斷的把關者。

2025 年 10 月到 2026 年 7 月之間,這四家機構的公開報告陸續被查出捏造引註與不實主張。Deloitte 澳洲退還了政府委外費用的一部分;EY 加拿大的報告把一個不存在的 McKinsey 研究寫進參考表;KPMG 的 45 條引註中只有 5 條準確;PwC 中東的四份報告,全數查出問題。

更值得注意的是其中兩案的主題。KPMG 那份報告談的正是 agentic AI 如何提升客戶體驗,PwC 那份標題就叫《Agentic AI – The New Frontier in GenAI》。一份關於 AI 的報告,敗在 AI 的濫用。

筆者觀點

這不是「四大也會犯錯」的泛泛之談。這四家機構每天在告訴客戶如何導入 AI、如何管控 AI 風險,而它們自己的公開產出沒有設任何查核關卡。如果連它們都這樣,其他機構憑什麼假設自己不會。

本文的材料全部來自 GPTZero 發布的四篇調查。在進入案例之前,必須先交代這個來源本身的性質——因為它同時是調查的發布者,以及調查所用工具的供應商。

二、糾錯者是誰

2.1 兩把尺

GPTZero 是一家 AI 內容偵測公司,目前有兩條對外產品線。

AI Detector 判斷一段文字由 AI 生成的機率,可分段標示。Hallucination Check(Citation Check) 則逐條查核引註是否存在、被引主張是否真的被來源支持,並可找出未附引註的重要主張。後者已被 IJCAI、ICLR、ICSE 等學術會議用於篩查投稿。

四篇調查的標的來源不完全相同。EY、KPMG、PwC 三案來自 GPTZero 自建的自動化搜尋管線,該管線定期掃描主要顧問公司的公開報告,主動尋找虛構引註;Deloitte 案則是爭議爆發之後的事後查核。

2.2 一組不對稱的數字

GPTZero 在多篇調查中揭露同一組數據:偽陰性率低於 1%,也就是每 100 條有瑕疵的引註至少能抓出 99 條。偽陽性率則只有定性描述——「較高」,原因是任何無法在線上驗證的引註都會被標記,網址失效、付費牆後、紙本文獻、非公開報告都會落入此類。

這個不對稱是刻意的設計。漏抓一條假引註,它就會進入正式報告並向外擴散;誤標一條真引註,覆核者花幾分鐘就能排除。工具因此寧可寬鬆標記,把成本推給人。

筆者觀點

只公布對自己有利那一側的錯誤率,是值得注意的揭露方式。偽陰性率低是產品賣點,偽陽性率高是導入成本,後者不揭露,採購方就無從估算要投入多少人力做覆核。調查引註可驗證性的一方,自身的誤標率同樣缺乏第三方驗證。

也因此,四案調查都在工具之外配置人工專家覆核。Deloitte 案的判定清單由GPTZero團隊內一位歷史學博士驗證,其中一條邊界案例,團隊討論了將近一小時。這個做法本身就說明了工具的定位:適合初篩,不適合終判。

三、四案實錄

3.1 Deloitte 澳洲:唯一有價格標籤的一案

2025 年 7 月 4 日,Deloitte 澳洲交付《Targeted Compliance Framework: Independent Review Final Report》,全長 234 頁,委託方為澳洲就業與職場關係部(DEWR),契約金額 440,000 澳元。檢視的對象,是該部會對社會福利給付對象施加自動化裁罰的系統。

爭議的起點不是工具,是一位讀者。雪梨大學學者 Christopher Rudge 在閱讀報告時,看到同校法學教授 Lisa Burton Crawford 名下一本他確知不存在的著作。他找上《Australian Financial Review》,記者查證後確認捏造的來源不只一筆。DEWR 內部檢視接著指出逾 50 條可疑引註。GPTZero 事後以 Citation Check 掃描全文,在 141 條引註中指出逾 30 條有問題,其中約 20 條判定為可能的幻覺。

Deloitte 最終更新報告、替換問題引註、向委託機關致歉,並退還 98,000 澳元。該公司承認報告製作過程使用 AI 協助,但始終未承認相關引註為生成式 AI 的產物。

值得單獨拆解的是這些假引註的形態。它們不是憑空捏造,而是真實元素的變形與嫁接:真實的學者被冠上不存在的著作;真實的 Melissa Perry 法官與真實的學者 Natalie Cujes,被合成為並不存在的「Justice Natalie Cujes Perry」。

筆者觀點

兩件事值得注意。其一,這種變形嫁接式的幻覺,正好是抽樣稽核最難抓到的一類——抽到的那一條看起來完全正常,作者是真的、機構是真的、主題也對得上。傳統的隨機抽查方法,對它的偵測力相當有限。

其二,這份報告的檢視對象是政府的自動化決策系統。委託方想知道的正是「這套自動裁罰能不能信」,而承接方交出的答案裡有二十來條虛構引註。查核者本身不受查核,整條信任鏈就斷了。

3.2 EY 加拿大:假引註如何洗進四大品牌

2025 年下半年,EY 加拿大發布 44 頁的忠誠度計畫資安報告《Points of Attack: Uncovering Cyber Threats and Fraud in Loyalty Systems》,掛名作者為兩位合夥人與一位資深經理。

這份報告不使用註腳,改用第 41 至 43 頁的資源表列出標題、說明與網址。GPTZero 的查核結果是:幾乎所有網址失效或虛構,逾半數標題無對應的真實來源。

三個發現值得逐一看。

(1) 內部矛盾。執行摘要稱全球忠誠點數市場總值 2,000 億美元,其中 30 至 50% 未被兌換。到了第 10 頁,同一個 2,000 億卻變成未兌換點數的總值。依報告自己的前提推算,全球市場規模至少要達到 4,000 億才能自洽。

(2) 來源洗白。支撐後一種說法的,是一份 2022 年的 McKinsey 忠誠度經濟報告——該報告並不存在。GPTZero 追出這條引註的來源:六個月前,一篇英國小型 fintech 媒體 Financial IT 的部落格文章,用了幾乎一模一樣的說法,並在來源區列出同一份虛構的 McKinsey 報告。這條假引註原文照抄地出現在 EY 的資源表裡。

(3) 同一統計,兩個出處。報告第 6 頁稱 72% 的忠誠度計畫曾通報遭竊或詐欺,出處標為加拿大支付業者 Paystone;第 11 頁同一個統計,出處變成詐欺防制公司 Forter。兩者都不在參考表內,而真正的源頭是 2017 年的一份 Ipsos 調查。

筆者觀點

第二點的意義超出單一報告的範圍。一份低流量部落格的虛構引註,經由四大品牌轉手之後取得了公信力,而 EY 的報告後來被一篇《Canberra Times》的報導引用,該報導又被轉載至澳洲六十家以上的報紙。

品牌在這裡的作用不是防線,是加速器。讀者對四大會計師事務所出品的內容天然降低戒心,這使得同樣一條假資訊,掛上四大的名字之後傳播得更遠。

3.3 KPMG:引註層與主張層的雙重失效

2025 年 10 月,KPMG 發布客戶體驗與 agentic AI 的年度研究報告《Total Experience》。

引註層的結果是:45 條引註中只有 5 條準確,45 個標題有 40 個是虛構的,28 條屬於真實來源搭配改寫或捏造的成分,另有 12 條資訊過少而無法判定。

但 GPTZero 這次多做了一層。他們不只查引註是否存在,還查被引的主張是否真的被來源支持——結果是約半數主張不成立。兩個例子:報告引用 JR East 2019 年的一則新聞稿,作為該公司運用 AI agent 的證據,而那則新聞稿完全沒有提到 AI;報告稱奧地利能源業者 Verbund 以 AI agent 優化家庭智慧家電與電動車充電,實際的來源是該公司投資一家新創的新聞稿。

GPTZero 對成因的推測是:有人要求 AI 研究工具去找各國 agentic AI 的應用案例,工具過度順從,於是把並非 agentic AI 的東西一律寫成 agentic AI。

還有一個細節,比上述數字更有價值。報告中引註 32 至 40 的格式與其他引註不同——標題加上了引號——而這一區段的引註大多被判定為真。

筆者觀點

這個格式差異,是同一份報告內部存在「經人工覆核」與「未經覆核」兩種區段的證據。

它把問題的性質講清楚了:失效點在流程控制,不在工具能力。同一批人、同一份文件、同一個時程,只要有人真的去核,引註品質就明顯不同。反過來說,缺的不是更好的工具,是有人被指派去做這件事、並且被要求為結果負責。

3.4 PwC 中東:四份報告,四種主題,全數查出問題

GPTZero 對 PwC 的調查涵蓋中東地區的四份報告,主題橫跨政府治理、交通、資安與 AI。四份都查出問題。

《Transforming Governance》 主推一個名為 Citizen Pulse 的框架,卻從未明確定義其內容。GPTZero 的查證結論是:除了這份報告以外,PwC 未在任何公開資料中提及此框架。報告並聲稱丹麥、沙烏地阿拉伯、美國、澳洲四國已採用該框架,四個註腳分別連至各國入口網站與一則企業新聞稿,均未提及此框架。這份報告的 AI 生成機率,全份為 84%,僅計正文、排除參考文獻等附屬內容後為 100%。

《Shaping the GCC Mobility Landscape》 引用世界經濟論壇的沙烏地自駕車研究,而所引的圖表未見於該研究;一張「全球大趨勢」圖表的註腳,指向德國巴士業公會的德文意見書,內容與該圖表無關;報告並將中國電動車累計銷量 1,300 萬輛,誤植為 1,300 萬座公共充電樁——IEA 的資料載明 2024 年為 358 萬座。

《Building a Cyber-Resilient eMobility Ecosystem》 的 AI 資安方案主張,註腳指向 2020 年聯合國車輛資安法規的新聞稿,該文未提及此類方案;電池相關主張的註腳,指向美國生產者延伸責任法案的網頁,該頁討論的是產品包裝而非電池。這份報告引註 4 的網址,帶有 utm_source=chatgpt.com 參數。

《Agentic AI – The New Frontier in GenAI》 中,一項 73% 的數據註腳指向 VentureBeat 的 agentic AI 介紹文,該文未提及 PwC 的 CEO 調查,也沒有這個數據;另一條引註的標題與所連結的文章不符,且兩者都不含所述的內容;報告主張 Mayo Clinic 使用 NVIDIA Clara 平台,所引文章未提及該平台,而這項合作要到報告發布之後才對外宣布。

依 GPTZero 的嚴格定義,四份報告合計只有 4 條符合虛構引註。

筆者觀點

這 4 條很容易被誤讀成「PwC 的問題最輕」。實際上這個數字只說明一件事:GPTZero 的定義收得很緊,它指的是參考文獻本身憑空捏造,而 PwC 的主要失效型態不在這裡——它的註腳大多指向真實存在的頁面,只是那些頁面不支持所寫的內容。

更值得注意的是 Citizen Pulse 這一條,它的性質與其他三份不同。那不是引註錯誤,是機構對外宣稱自己擁有某項產品、以及與四個國家政府的業務往來。就算引註格式完全正確,這些客戶關係仍然不存在。這已經超出研究品質的範疇。

四、翻車的共同機制

四案的細節各異,抽出來的模式卻高度一致。

4.1 失效點是查核關卡的缺席

四家都用了 AI 協助撰寫——Deloitte 是自己承認的,PwC 有工具參數殘留,EY 與 KPMG 則有偵測結果與典型的 LLM 錯誤形態佐證。但使用 AI 本身不是問題所在。

問題在於模型之外沒有任何東西去驗證輸出。模型產出了格式完美、看起來像真的引註,那是它被訓練出來的行為;沒有人、也沒有系統,去確認那些引註打不打得開、那些頁面支不支持所寫的內容。

KPMG 案的引註 32 至 40 是這一點的反面證據:同一份報告裡,有人核過的區段品質明顯較高。

4.2 幻覺多為真實元素的變形

四案中的假引註,幾乎都是真實來源的改寫、真實人名的重組、或多個真實元素的融合,而非憑空捏造。這代表傳統「抽查幾條看看」的稽核方法,偵測力正在下降——抽到的那一條看起來完全正常。

4.3 汙染會複利

EY 案的虛構 McKinsey 報告,從一篇小型部落格洗進四大報告,再經媒體轉載至澳洲六十家以上的報紙。KPMG 案的統計數字被產業媒體、捷克的主要報紙、以及 ChatGPT 與 Gemini 重複引用。

GPTZero 在多篇調查中用了同一個框架:把報告發布到網路上,等於向公共知識池注入資料。當內容為假,它就會誤導後續的研究者。而 AI 深度研究工具因為選源信號與人類不同,對這類汙染更為脆弱——形成「AI 生成假來源 → 由高權重網站託管 → 被 AI 研究工具採信 → 進入下一份報告」的迴路。

4.4 簡化引註格式是結構性共犯

顧問業的引註慣例是只給標題、出版者與年份,不給完整網址與作者。這種格式讓來源比對的成本高到連專業團隊都要投入大量時間,等於天然地降低了被查核的機率。GPTZero 也指出,PwC 中東未統一各刊物的引註體例,甚至在同一份刊物內都未維持格式一致。

五、預防:把查核做進 Harness

四案的結論若停在「要仔細一點」,這篇文章就白寫了。真正該問的是:這些查核由誰執行、在哪個環節攔截、未通過時會發生什麼。

5.1 為什麼查核不能靠提示詞

把「請確認每一條引註都真實存在」寫進提示詞,看起來像做了管制,實際上不是。模型可能照做、可能沒做,而沒做的時候不會留下任何紀錄。事後要舉證「當時有沒有查」,找不到任何依據。

查核必須由模型之外的結構承擔。在 AI 系統工程裡,這一層稱為 harness——脈絡組裝、工具定義、控制流、驗證與重試,模型以外的整體工程結構。四案缺的正是這一層。

那麼要做哪些查核?不必從零設計,GPTZero 已經示範過一整套。

5.2 GPTZero 查 PwC 用了哪六種檢查

從四份 PwC 報告的查核結果反推,可以還原出六種檢查。先看全貌:

檢查查什麼執行者由哪一案顯現
來源存在性網址能否開啟、標題是否對應真實文獻程式腳本四案共通
主張與來源比對該來源是否支持所寫的主張語言模型報告二、三、四
跨網路存在性搜尋該名詞在這份報告以外是否存在搜尋工具報告一
時序比對所述事件是否早於報告發布程式腳本報告四
AI 生成機率偵測文本是否由模型生成偵測模型報告一
產出痕跡檢查網址參數、標題是否取自網頁原始碼程式腳本報告三

六種的門檻差距很大,逐一說明。

來源存在性是最基礎的一層,也是成本最低的一層——一支腳本逐條打開網址即可,連模型都不必用。EY 案「幾乎所有網址失效或虛構」,這一關就會全部亮紅燈。

主張與來源比對是最核心也最耗資源的一層。來源真實存在,問題是它支不支持所寫的內容。PwC 報告三用產品包裝的法規網頁佐證電池主張、報告四用 VentureBeat 的介紹文佐證一項 73% 的數據,都要打開來源、讀完內容才判得出來。

跨網路存在性搜尋不是查某個網址通不通,而是在整個網路上搜尋一個名詞。Citizen Pulse 那一條就是這樣抓出來的——查核對象從「引註」擴大到「報告宣稱擁有的東西」。

時序比對是查出所述事件的實際發生時間,與報告發布時間相比。PwC 報告四宣稱 Mayo Clinic 使用 NVIDIA Clara 平台,而這項合作要到報告發布之後才對外宣布。技術門檻極低,難的是想到要做。

AI 生成機率偵測與引註無關,是獨立的一條軸線。PwC 報告一全份 84%,僅計正文為 100%。

產出痕跡檢查同樣不查內容,查產出方式——PwC 報告三的引註 4,網址帶有 utm_source=chatgpt.com 參數。

筆者觀點

這六種裡,只有前兩種是任何引註查核的標配。後四種是調查者針對這批材料的特性設計出來的——想不到就查不到。這意味著查核清單本身需要定期擴充,不是設一次就完備。EY 案的「同一統計、兩個出處」與「2,000 億美元的兩種定義」也屬於這一類,那是跨頁比對才會浮現的發現。

5.3 六種之中,哪些能當閘門

閘門的定義是「未通過即不得放行」。要當閘門,判定結果必須明確到足以擋下一份文件。六種裡有四種做得到,兩種做不到。

做得到的四種是來源存在性、主張與來源比對、時序比對、產出痕跡檢查。它們的判定條件都是事實比對——網址通不通、來源支不支持、日期孰先孰後、參數有沒有。其中主張比對因為由模型判定,會帶誤標與漏標,需要人裁決被標記的爭議項;其餘三種判定即結論,不必再看第二次。

做不到的兩種是跨網路存在性搜尋與 AI 生成機率偵測,理由各不相同。

跨網路搜尋的問題是「查無資料」無法區分「不存在」與「未公開」。顧問業與客戶的合作大量屬於不公開性質,若把搜尋無結果直接判為不實,會大量誤標真實的客戶關係。

AI 偵測的問題更根本:它是統計推斷,不是事實。它說明文本像模型寫的,不證明任何一條主張為假。而且使用 AI 協助撰寫本身不違規,違規的是未經查核;若把偵測分數當成閘門條件,等於處罰工具使用而非查核缺失,方向就錯了。GPTZero 在四案中也從未用它定罪,始終只當佐證。

這兩種的正確定位是分流訊號——高分段落、查無外部證據的段落,優先進入完整查核。這樣它們的統計性質不會變成判定依據,而是資源配置依據。

5.4 收斂為四道閘門

上述六種是 GPTZero 查 PwC 用的方法。若要把四案的教訓一般化成一套可長期運作的設計,還要補上一項——內部一致性,也就是同一數字在不同章節的定義是否一致、相互推導的數字能否自洽。這一項在 PwC 案沒有出現,卻是 EY 案 2,000 億美元那條矛盾的直接對策。

合併之後,實際要建的閘門是四道:

閘門內容判定者未通過的處置
來源存在性網址、標題、時序、產出痕跡的事實比對程式腳本直接退回
主張支持度來源是否支持所寫的主張語言模型初判標記後交人裁決
內部一致性跨章節的定義與數字自洽程式腳本直接退回
對外宣稱確認本機構的產品、客戶關係是否為真持有事實的一方未確認不得發布

時序比對與產出痕跡檢查併入第一道,因為三者的判定性質相同、執行方式相同,分成三道只是增加流程節點而不增加控制力。

5.5 第四道閘門怎麼設

第四道與前三道不同,值得單獨談。

有一類主張,任何外部工具都到不了——機構宣稱自己擁有某項產品、與某些客戶有業務往來。Citizen Pulse 就是這一類,事實只有 PwC 內部持有。

但這不表示 harness 在這裡失效。harness 不需要判斷真偽,只需要偵測「查無外部證據」這個狀態並據此攔截,把判定交給持有事實的一方。判斷歸人,攔截歸系統,這仍然是 harness 的工作。

真正的難處在觸發率。顧問報告裡查無外部證據的主張非常多,多數是正常的未公開資訊。若照單全攔,覆核者會被淹沒,然後開始習慣性放行——那時閘門形式上存在、實質上失效,正是 KPMG 案「一部分核過、一部分沒核」的那個狀態。

因此這道閘門必須限縮範圍:只攔「宣稱本機構擁有某產品或某客戶關係」這類對外宣稱,其餘查無證據者僅記錄、不攔截。範圍怎麼設,本身就是 harness 的設計工作。

5.6 三個層級不要混用

討論這類設計時,有三個詞經常被混用,區分清楚才知道責任落在哪裡。

Harness 是層——模型之外的整體工程結構,回答「該由誰負責」,而答案不是模型。

Gate 是功能——未通過即不得放行的關卡,回答「什麼條件下才能放行」。一道完整的閘門要包含三件事:放行條件、判定者、未通過時的處置,前一節的表格就是照這個結構寫的。

實作機制是手段——閘門的具體執行方式,回答「由什麼執行」。Anthropic 在 Claude Code 中稱為 hook 的掛載點是其中一種,程式規則、人工覆核流程也都是。

混用的代價很實際。把實作當成層級,治理設計就綁定在特定產品上,更換工具或平台時整套失效;把層級推回模型,驗證就退化為提示詞層次的要求,未執行時無紀錄、無從舉證。

5.7 對台灣金融業的映射

顧問報告與徵信報告、盡職調查報告、產業分析在結構上高度同構:大量外部來源、簡化的引註格式、時間壓力、專業品牌背書。四案顯示的失效型態,在授信報告裡會直接變成信用決策的事實基礎瑕疵。

依前述四道閘門,可以逐項自問:

(1) 外部來源的存在性查核,是否已經是機器可執行的既定程序,而非個人習慣?

(2) 報告中的統計數字,是否要求標註一手出處而非二手轉述?EY 案的 72% 統計,真正源頭是 2017 年的調查,中間隔了兩層轉述。

(3) 同一數字在不同章節的定義是否一致、跨頁比對是否自動執行?EY 案的 2,000 億美元,兩處定義互斥。

(4) 對外宣稱本機構產品或客戶關係的段落,發布前由誰確認?未確認的後果是什麼?

(5) AI 輔助產出的段落,是否留有可追溯的工具使用紀錄,並據此決定哪些段落優先進入完整查核?

(6) 覆核者與覆核範圍是否逐份可追溯?KPMG 案的教訓是,同一份文件內部就可能一半核過、一半沒核。

六、結語

四大會計師事務所每天在教別人如何導入 AI、如何管控 AI 風險。它們的翻車,正好說明問題不在模型能力——這四家用的模型,和它們客戶用的是同一批。

差別在模型之外。四道閘門都可以由 harness 承擔:來源存在性、時序與痕跡檢查判定即結論;主張與來源比對由第二個模型執行、人處理爭議項;查無外部證據的對外宣稱,由系統攔截、交持有事實的一方判定。制度負責的是指定誰在人工節點上判定,以及未判定時的後果。

這件事對台灣金融業有一層額外的意義。在受監理的環境裡,可稽核性本身就是一種效能——一份無法舉證查核過程的報告,即使結論正確,在監理檢查時也站不住。四大付出的代價是退款與商譽;金融機構在各種決策上付出的代價,會記在資產品質上。

下一份被查出問題的報告,會是台灣哪一家機構的?


資料來源:

資料整理截至 2026 年 8 月 11 日。文中觀點僅代表作者個人立場。