目錄
每一支創新團隊如今用的工具都差不多:同一批 foundation model、相近的提示詞庫。但產出品質卻天差地別——有的團隊迎來創意大爆發,有的只收到一堆同質、平庸、像出自同一人之手的點子。哈佛、華頓、西北、哥倫比亞四校的研究者在一篇受《International Journal of Research in Marketing》邀稿的新工作論文中主張:差別不在用了哪個模型,而在生成式 AI 如何作用於創新流程裡那些長年既有的「人性瓶頸」(human bottleneck)。
這正是論文的核心視角。作者群(De Freitas、Israeli、Nave、Timoshenko、Toubia)刻意不問「生成式 AI 能做什麼」,而改問一個更耐久的問題:長年拖慢創新的認知、社會、組織限制到底是什麼,AI 又如何與每一種限制互動。他們的關鍵論點是:多數創新瓶頸本質上是「人的問題」,不是技術問題;而生成式 AI 訓練自人類既有產出的總和,傾向重現當初造成瓶頸的那些傾向,只是更快、更大規模。因此,一個新的 AI 能力究竟會鬆綁還是加深某個瓶頸,取決於瓶頸背後的「機制」,不取決於模型多先進——這是整套框架的診斷價值所在。
論文把創新流程拆成四個階段,每個瓶頸都用同一套結構分析:瓶頸是什麼、AI 若被「天真地」使用會如何、又該如何改善。以下依論文架構逐一導讀(四階段的瓶頸總覽見圖 1)。
【圖 1|人性瓶頸框架:四階段總覽】 — 四階段各一欄,每欄列出該階段的人性瓶頸、AI 天真使用會如何惡化它、以及改善方式。
一、發想階段
發想的目標不是累積一堆還可以的點子,而是撈出真正的異數(outlier)——因為一個傑出點子的價值勝過數十個普通點子,所以發想追求的是「找到那個最好的」,而非「平均都不錯」。論文在此點出三個人性瓶頸。
(一)認知固著(個人層次)
瓶頸:每個人既有的心智模型(過去經驗、知識、習慣累積成的思考慣性)會讓某些點子很容易想到、某些卻幾乎想不到。深度領域專家尤其容易吃虧——正因為太熟,他們的注意力會被自己內化的模型自動、過早地導向熟悉的解法,反而跳不出來。
AI 天真使用:LLM 天生傾向給出統計上最典型的回應(它就是被訓練來預測「下一個最可能的字」)。麻煩的是,人一旦讀到這個典型答案,思路反而會被它綁住,想不出原本可能自己生得出的、更不尋常的點子。等於 AI 先把點子收窄一次,人再被 AI 收窄第二次。
改善方式:
(1) 用 chain-of-thought(思維鏈)提示——要模型先寫出簡短的點子摘要,再在展開之前,明確命令它把這些摘要改寫得更大膽、更獨特,然後才擴寫。這麼做能擋住「早期的草稿限制住後面的產出」,也抵消了訓練過程帶來的「趨向典型」的傾向。要注意這招只對 AI 有效、對人無效:同樣一句「請想得更發散一點」,能提升模型的點子多樣性,對人類發想者卻幾乎沒用——因為人腦一旦鎖定某條思路,明著叫他發散,反而更甩不掉那條思路〔註1〕。
(2) 但上面這招只能在「既有知識已經觸及得到」的範圍內拓寬點子,挖不出那種「非得對一個未解問題有親身經歷、才生得出來」的點子。
這類洞察屬於「領先使用者」(lead user)——他們的需求太超前、太極端,現有產品根本滿足不了,逼得他們自己動手拼湊出克難的應付辦法。這個克難辦法未必成熟,但它「將就」的過程,恰恰暴露出一個主流還沒看見的真實需求。要挖到這種點子,靠的不是技術而是組織投入:刻意經營領先使用者計畫、以及民族誌方法(研究者親自到真實現場貼身觀察使用者實際怎麼做、怎麼卡關,而不是靠問卷去問),讓研究者靠近未解問題到一個程度,真正跳出既有的心智框架。
(二)設計固著(社會層次)
瓶頸:創作者會向彼此學習,而看多了成功的範例,這些範例的「表面特徵」會在記憶中變得特別鮮明,於是設計不知不覺趨向模仿範例的外觀,而不是吸收「讓那個設計真正成立的核心元素」(例如它的母題、構圖,而非它的顏色長相)。
AI 天真使用:AI 有一個對應的、更大規模的版本,論文稱為「模式崩塌」(mode collapse)——每一次獨立的 AI 生成,其實都是從同一套集中化的訓練分布裡抽樣,所以不同人、不同工作階段跑出來的東西會不自覺地聚在一起、彼此雷同。結果是一種「公有地悲劇」:就算每家公司只是拿 AI 產出當參考範例,整個產業的集體解答空間仍會一起收窄——個別生產力上升了,集體的多樣性卻下降。
改善方式:
(1) 用「人物設定修飾詞」(persona modifier)——提示模型「假裝你是某個特定的人」來回應,例如「一位曾為圖書館經費奔走的退休政治人物」或「一位集郵的軟體工程師」。這種指定視角會把模型推向它訓練分布裡平常不會去的區域,藉由注入五花八門的線索,打破不同工作階段之間的雷同。同一招還能對付「專家近視」:可以反過來要模型設想「一個完全外行的人會怎麼看這個問題」,逼它跳出該領域根深柢固的成見(不過論文提醒,並非每種人物設定都同樣有效)。
(2) 因為設計固著發生在人與人之間、且問題在於設計師只學到表面,所以另一種改善是改造「範例如何在人之間流通」。做法是:給設計師看的不是原始範例,而是「AI 生成的範例變體」——每個變體都保留原設計的核心元素,只微調視覺呈現。這樣設計師吸收到的是「讓設計成立的內在道理」,而不是照抄它的長相。
(三)心理安全感(群體層次)
瓶頸:在組織裡發想,人常常因為預期會被同事評判而自我審查,於是心裡的最佳化目標,悄悄從「想出新奇的點子」換成「想出不會被笑的點子」。資淺者在資深者面前尤其容易這樣,誰敢講、誰的點子被當一回事,也受地位與階層影響,與點子本身好不好無關。
AI 天真使用:把發想這件事外包給 AI,確實移除了「當場被評判」的風險——人會對著模型講出在會議上不敢說的想法,這是 AI 在組織發想裡少數可靠的好處。但這個好處很容易只是被「延後」而非真正消除:如果 AI 生出來的點子,接著還是拿到那個有上下階層的群體裡去評選,地位壓力會在「評選階段」原封不動地回來。
改善方式:
(1) 論文提出「AI 中介的混合名義流程」:先讓大家各自私下用模型發想,把產出丟進一個匿名的集中池,由 AI 抹掉「這是誰提的」線索、統一格式、把雷同的聚在一起、並刻意保留奇特的點子;等這個匿名池整理好,群體討論才開始。如此把「想點子」和「當眾亮相被評價」這兩件事切開。
(2) 同一套流程還能分開「發散」與「收斂」兩種模式:發散階段讓 AI 扮演「yes-and」的鼓勵者,接話、邀請較安靜或資淺的人加入、壓下過早的批評;收斂階段再讓 AI 轉為批判角色,去挑假設、找失敗點。關鍵是這兩種氛圍該出現在流程的不同階段,AI 可以幫忙守住這條界線,但它自己創造不出心理安全感。
二、篩選階段
「篩選階段」是委員會、投資審查在「市場還沒表態、產品還沒做出來」之前,就得決定哪些點子拿到資源、哪些被擱置的階段。它的失敗天生是看不見的——被錯殺的點子,沒人知道它本來會成功。論文點出三個瓶頸。
(一)新奇趨避的評價
瓶頸:評審者就算嘴上支持創意,心裡仍不自覺把「新奇」跟「不切實際、不確定」綁在一起,於是對真正原創的點子起了防衛反應。加上「損失趨避」(人對可能的損失,感受比對等量的獲得更強烈),新奇點子的下檔風險看起來就比它的上檔潛力更刺眼。
AI 天真使用:AI 透過「認知流暢度」這條管道放大偏見——LLM 的產出通常文句流暢、結構工整,而人容易把「讀起來順」誤當成「品質好」,於是給出假陽性的高分。漂亮的提案拿到更高分,跟它是不是真的比較好無關。
改善方式:
(1) 把「呈現方式」和「內容評價」拆開:評分前先把所有提案改寫成統一格式,並對「這是人還是 AI 寫的」設盲(評審不知作者是誰)。這樣就抵消了 AI 產出「因為漂亮而佔便宜」的優勢。
(2) 刻意安排「先評可行性、還是先評新奇」的順序——研究顯示這個順序會造成取捨:先評可行性,選出來的東西平均創新程度較高、但彼此差異小;先評新奇則相反。既然順序會影響結果,就該把它當成一個刻意的組織決策來設計,而不是沿用既有習慣。
(二)認知負荷
瓶頸:篩選者通常得從一大堆候選裡挑出少數贏家,而評估「高度新奇」的點子,比評估熟悉的點子更耗腦力(新的東西更難理解、難歸類)。當腦力被占滿,評估者會從「仔細思考」滑向「憑直覺捷徑」,於是更不願意選新奇的點子。它本身不製造偏見,而是「放大器」——把上一道新奇趨避的瓶頸放得更大。
AI 天真使用:AI 直接惡化這道瓶頸——它讓湧進評估管線的點子數量暴增,而數量壓力又回頭加重了新奇趨避。
改善方式:在篩選管線的「架構」上動手,而不是要人硬看更多。具體做法是把 LLM 的評分,跟歷史上人類專家的評分,一起放進一個預測模型,用它先篩出「真正值得人細看」的少數件,其餘略過——這樣能在大幅減少人工細看件數的同時,仍不漏掉該入選的作品〔註2〕。
(三)共享心智模型鎖定
瓶頸:長期一起評審的委員會,會慢慢形成一套「什麼叫有前景」的隱形共識,新成員靠觀察、靠自己的點子被接受或打槍,默默學會這套標準。於是整個委員會變成一個自我強化的評價文化——標準從沒被明講,卻牢牢綁住每個人。
AI 天真使用:問題在 AI 會同時改變這道瓶頸的「載體」和「影響範圍」。載體上,若拿委員會過去的准駁紀錄去訓練篩選 AI,它會學會並大規模複製那套從沒被明講、也沒人正式背書的標準,還讓結果「看起來很客觀」——本來這套共識還是隱形的、活在一群人身上,只要有個唱反調的委員或帶著不同觀點的新人,就可能當場鬆動它;可是一旦拿過去的決策去訓練 AI,這套偏見就被學進模型、套用到每一個案子,而且 AI 給出的判斷「看起來像客觀的分數」,不像某個保守委員的個人意見,於是反而沒人會去質疑——偏見沒有消失,只是換上了客觀的外衣,更難被挑戰。
一項田野實驗發現:若AI 會逐案給評審一個建議:有些點子它建議「通過」,有些它建議「否決」。實驗(Lane 等,2026)發現一個不對稱:當 AI 的建議附上一段書面理由時,評審對「否決」建議的服從度,明顯高於對「通過」建議——也就是說,AI 說某個點子該刷掉、又附上一段像樣的理由,評審就特別容易真的把它刷掉;但 AI 說某個點子該過時,評審反而沒那麼照單全收。
Lane, J. N., Boussioux, L., Ayoubi, C., Chen, Y. H., Lin, C., Spens, R., Wagh, P., & Wang, P. H. (2026). The narrative AI advantage? A field experiment on AI-augmented evaluations of early-stage innovations. Harvard Business School Working Paper, No. 25-001.
問題是,看了理由的評審,並沒有因此更能判斷 AI 到底對不對——那段理由沒有幫他思考,反而成了「我不必自己再查」的藉口,而這個效應在最模稜兩可、最需要人親自判斷的邊界案例上最強。
改善方式:
(1) 換一種「答案」來訓練 AI。
同一個提案身上其實有兩種資訊:一是委員會當初「准或駁」的決定,二是它獲准上市後、市場給的真實成績(賣得好不好、多少人用)。前者夾帶委員會的偏見,後者是市場的客觀事實。所以在那些「點子已經獲准上市、看得到市場成績」的地方,就改用市場成績、而不是委員會的准駁決定去訓練 AI——如此 AI 學到的是「什麼點子真的會成功」,而不是「委員會以為什麼會成功」,偏見的繼承就被切斷。
(2) 另一種做法,是在篩選時乾脆不附 AI 的理由。實驗發現:不附理由的「黑箱」建議,反而比純人類評估改善了決策品質;同一個建議一旦附上一段理由,這個好處就消失了〔註3〕。
三、偏好衡量與消費者洞察階段
一個點子通過篩選後,不會直接變成產品,而是先發展成一個「概念」——把它具體化,定出要有哪些功能、賣多少錢、主打什麼定位。接下來公司得拿這個概念去問市場:消費者到底買不買單?而要問得準,前提是先真正搞懂顧客想要什麼。這一節談的,就是「搞懂顧客想要什麼」會遇到的兩道落差。
(一)真實性落差
瓶頸:這裡的「真實性」不是指「有沒有標準答案」,而是指「抓到的是顧客真正的感受,還是他在一個抽離情境的問卷裡當場說出來的話」。因為偏好不是事先存好、等著被讀出來的——它是在被問的當下,依情境、依怎麼問、依旁邊有什麼可比、依當時心情,臨場「建構」出來的。一個為了實驗乾淨而剝掉情境的研究設計,剝掉的正好是「決定這個創新會不會被買單」的那些東西。
AI 天真使用:透過三個機制惡化。
其一「異質性流失」:LLM 學的是整個母體的平均文字,所以它傾向吐出「大家偏好的集中趨勢」,而抓不到「不同人之間的差異分布」——而正是這個差異,才是市場區隔、精準行銷的依據;就算拿分人群的資料去微調,群組間的差異仍對不太起來。
其二「提示誘發的混淆」:在一個對模型設盲的提示裡調高價格時,模型不會把它當成「實驗在操弄價格」,而當成「情境線索」(高價=高階產品),於是它給出的需求曲線是平的、甚至往上,而不是真實消費者那種「越貴買越少」的向下曲線。
其三「數位分身無法重現非理性行為」:就算拿真人的豐富行為輪廓去打造「數位分身」(模擬特定個人的模型),這些分身還是比真人理性太多——它們不會犯沉沒成本的錯(明知投錯了還捨不得放手),於是系統性地低估了那些「足以害死一個新產品」的心理摩擦。
改善方式:
三個機制各有不同的處理方式,有的能靠 AI 補救,有的只能交還給人。
(1)對付異質性流失:
異質性流失指 AI 只能還原「大家平均的偏好」、抓不到「不同族群之間的差異」。這個問題在「你只需要總量估計」時沒那麼致命——例如你只想知道「整體而言大家願意為這功能付多少錢」,不需要細分族群。這種情況下,可以拿某個特定產品類別的歷史真人資料,去微調模型(讓模型先學過這個類別的真人偏好),估出來的願付價格就能達到堪用的準確度;或是用 AI 去「增補」一小群真人樣本、而不是完全取代真人,用少量真人資料當地基、AI 補足其餘,壓低成本〔4〕。要注意:這只補得回「總量」的準確度,補不回「族群間的差異」——微調反而會讓不同族群的估計更趨一致,而非更能分辨。
(2)對付提示誘發的混淆:
這個毛病是——你在提示裡偷偷調高價格想測價格敏感度,模型卻把「漲價」讀成「這是高階產品」的情境線索,於是給出錯誤的需求曲線。訣竅是「對實驗設計設盲,而不是對情境變數設盲」:與其假裝什麼都沒變(讓模型自己去猜漲價的含意),不如明白告訴模型「有一個變數正在被實驗性地調整、範圍大概是多少」。這樣模型就知道價格是被刻意操弄的實驗變數,而不是暗示產品檔次的線索,模擬準確度會穩定改善〔註5〕。
(3)對付數位分身的非理性缺口:
數位分身(模擬特定真人的模型)比真人理性太多,不會犯沉沒成本、損失趨避這類「非理性但真實」的錯,因此系統性低估了會害死新產品的心理摩擦。這一塊目前沒有 AI 解法。所以凡是結果取決於沉沒成本、轉換成本、框架效應這類非理性行為的決策,就別信數位分身,交還給真人研究。
(二)可表達落差
瓶頸:有些偏好,消費者根本說不出來——因為他還沒遇過那個能滿足它的產品。論文叫這些「隱藏的寶石」:需求其實存在,只是還沒有任何產品證明「這個想要是可以被滿足的」,所以連詞彙都還沒長出來。經典例子是觸控螢幕手機:2006 年的人說不出自己想要「滑動操作」,因為那還沒進入任何人的經驗。
AI 天真使用:AI 是靠語言訓練的,所以它只撈得到「已經被人用語言講過」的偏好;一個從沒被說出口的偏好,對它而言等於不存在。拿評論、訪談逐字稿去微調,只能擴充「已經講得出來」的詞彙,永遠碰不到「講出來之前」那層經驗。
改善方式:這道落差的核心(消費者說不出他還沒遇過的需求)沒有 AI 解法——要挖出這些「隱藏的寶石」,只能靠民族誌與現場觀察,去看消費者如何繞過現有產品的不足。但在「消費者已經講得出來」的那一層,AI 有兩個幫得上忙的角色:
(1)當「探針」,逼出研究者自己說不清的直覺:
有經驗的管理者對顧客常有一種「講不清楚、但感覺得到」的判斷。把 AI 生成的東西(例如一批設計草案)當成刺激物丟給他看,往往能逼他把心裡有、卻一直沒說出口的判斷講出來——AI 在這裡不是拿來「測量顧客」,而是拿來「戳出專家的隱性知識」。
(2)當「規模化的翻譯機」,把顧客的原始語言轉成需求陳述:
顧客在評論、客服對話裡講的話零散又口語(「我搞不清楚哪塊已經上漆了,結果一直漏塗」),要轉成標準的需求陳述(「希望能看出哪裡已經上過漆」)以前得靠受訓練的分析師。經過適當微調的模型,這件事做得可媲美專業分析師,而且能跨產品類別通用。
四、擴散與市場學習階段
創新做出來之後,還得穿過一整個社會系統才能擴散到規模;而擴散過程拋回來的訊號,又必須被讀懂、轉成下一輪的產品決策。論文點出三個瓶頸。
(一)社會擴散建模
瓶頸:一項新產品被採用,不是一個個獨立消費者反應的加總,而是一個社會過程——早期採用者替產品背書、意見領袖賦予這個品類正當性,產品在一群群人之間累積社會意義。要預測這個過程,分析單位是「整個社會系統」而非單一個人,這比預測任何個別反應都難,而且很難規模化:一支團隊或許能模擬一個區隔的動態,卻模擬不了五個,偏偏對新產品最關鍵的,往往是公司從沒研究過的那些區隔。
AI 天真使用:這裡的限制直接繼承自上一階段——既然連「單一消費者的非理性行為」都還模擬不真,那麼把這些不準的個體疊起來去模擬社會擴散,只會繼承同樣的錯,還可能在彼此互動中被放大。
改善方式:
社會擴散建模要預測的是「一項產品如何在人群之間一傳十、十傳百」,難處在於它是整個社會系統的連鎖反應,不是單一個人的反應。這一塊目前沒有 AI 解法——原因很直接:既然連「單一消費者的非理性行為」都還模擬不真,把這些不準的個體疊起來去推演群體擴散,只會把誤差愈滾愈大。
所以 AI 在這裡適合的角色,是「先篩掉明顯走不通的擴散路徑」,替後續分析縮小範圍;但「這條路到底走不走得通」的關鍵判斷,仍留在人這一側,靠領先使用者與現場觀察去支撐。
(二)注意力與彙整
瓶頸:產品上市後拋回的訊號多到沒有團隊消化得完——跨平台的評論、社群討論、客服工單、退貨、論壇。更麻煩的是這些訊號有選擇偏誤:評論偏向極滿意和極不滿意兩端、社群偏向愛發言的人、工單偏向出問題的情況;而對創新最要緊的訊號(新冒出來的使用情境、默默不採用的人)恰恰最不會浮出水面。
AI 天真使用:這是整個框架裡,AI「真正縮小」瓶頸的第一次——LLM 能以過去只有大公司專責團隊才做得到的規模,去吸收、分類、聚類、摘要市場回饋,抽取出品質逼近專業分析師的結構化需求。市場聆聽的成本與時間大幅崩降。但瓶頸沒有消失,只是移位了:產品團隊現在的難題變成「優先排序」——這週冒出來的幾百個主題,哪些值得行動、哪些只是摘要過程的雜訊、哪些是「用出現頻率加權的摘要」會系統性埋掉的微弱卻重要的訊號。
改善方式:
這道瓶頸是「上市後湧回的訊號多到人看不完」。AI 在「量」這一關真正幫得上忙——它能以過去只有大公司專責團隊才做得到的規模,去吸收、分類、歸整海量的市場回饋,抽取出結構化的顧客需求,這部分已經可行、成本也大幅下降。
真正還沒解的,是「量」被解決後浮現的新難題:怎麼設計分流機制,讓真正浮上來的是「要緊的訊號」(剛冒出來的新用法、默默不採用的人),而不是「出現次數最多的訊號」。因為對創新最關鍵的往往是微弱卻重要的訊號,偏偏最容易被「以出現頻率加權的摘要」淹掉。這一步論文明說仍是開放問題,沒有現成答案。
(三)動機性詮釋
瓶頸:就算訊號拿到手,組織仍有誘因把它往「我們已經做的決定」那個方向去善意解讀:弱的負面訊號被吸收進「維護現有產品」的說法裡,正面訊號則被過度放大。這來自沉沒投資和高風險的組織政治,不是能力不足——給更好的資料也沒用,因為那個「往有利方向解讀」的誘因還在。
AI 天真使用:AI 與這道瓶頸的關係是兩面的。一方面,AI 對過去的決策沒有情感包袱,會中立地把「對某個明星功能的抱怨」照實標出來。另一方面,它產出的那份流暢摘要,也更容易被人斷章取義地拿去支持「早就想要的結論」——尤其當提問的方式已經透露了團隊偏好哪個答案,加上 AI 本身有迎合使用者的傾向。
改善方式:
這道瓶頸是「組織會把市場訊號往『我們早就做的決定』那個方向去解讀」,根源是沉沒投資與組織政治,不是能力不足。
論文在這裡坦言:目前沒有任何經實證驗證的有效介入。AI 甚至是兩面刃——它一方面對過去的決策沒有情感包袱,會中立地把壞消息照實標出來;另一方面,它產出的流暢摘要也更容易被人挑著引用、去支持早就想要的結論。這份流暢摘要最終會讓組織更誠實面對數據、還是更會為自己找漂亮藉口,論文認為是這部分框架裡最重要、也最懸而未決的問題。
五、機制決定分工
論文由此收斂出一個貫穿全篇的判準:人與 AI 的分工不該按「階段」劃分,而該按「瓶頸背後的機制」劃分。
凡瓶頸本質上是資訊性、流量性、方法性的(發想的認知固著、篩選的認知負荷、市場學習的注意力彙整),最該動手的地方就在 AI 系統本身——靠提示策略、微調、資訊架構去解。
凡瓶頸根植於親身經驗、非理性行為或組織誘因(跨產業的設計固著、可表達落差、數位分身無法重現非理性採用、社會擴散建模的極限、扭曲上市後訊號的組織誘因),該動手的地方(目前)仍在人這一側,AI 至多是輔助。
這套分工並非一成不變,而是「以當前能力、依機制推出來的」。框架真正的價值,在於給任何一個新發展一個判斷依據:先問它對付的是哪種機制,就能預判它落在分工的哪一側。
六、系統層次的更大影響
論文在談完四階段的個別瓶頸後,進一步拉高到整個創新系統,指出六個橫跨全流程、或直接挑戰流程結構本身的議題。
(一)組織問題
議題:能不能用上前面那些介入,取決於一個更前置的問題——公司裡「誰」被允許建置、形塑、部署 AI 工具。最要緊的那些介入(人物設定發想、不設盲的模擬設計、微調過的需求抽取管線)都是需要領域專業的客製配置,而這種專業握在消費者洞察、產品、設計團隊手上,資料科學團隊通常沒有;反過來,技術基礎設施又握在資料科學那邊。雖然建置 AI 工具的技術門檻已大幅下降,卻製造了「人人都能部署企業軟體」的危險錯覺——機器學習系統特別容易累積看不見的技術債,早期原型好做,一旦進到正式生產環境就難以維護。
改善方式:
問題是「該讓誰來建置 AI 工具」——最懂顧客的洞察、產品、設計團隊有領域知識卻沒有技術基礎設施,資料科學團隊有技術卻不懂顧客,兩邊各據一方。
論文的解法是「中心化的技術基礎設施,搭配分散式的協作建置」,也就是把工作按專長拆開、但綁在同一套基礎設施上:
1. 由最懂顧客的洞察專家,去共同打造工具的邏輯與初步雛形(因為「什麼才算好的產出」只有他們知道);由資料科學家精修底層模型;
2. 由專責的軟體工程師負責上線部署與後續維護。
這樣既打破了「洞察」與「資料科學」各做各的穀倉,又不會反過來讓技術團隊的優先順序壓過洞察團隊的專業判斷。
(二)去技能化與自動化陷阱
議題:當 AI 接手創新流程裡一個個鄰近的任務,那些任務原本會磨練出的人類能力,可能悄悄流失,而且有跨世代的複利效應——如果點子、消費者模擬、文案都由 AI 生成,資淺從業者就失去了培養「隱默判斷力」的養成過程,最後養出一批很會用 AI 產出、卻沒能力判斷「這個產出什麼時候是錯的」的人。放大到整個創新職能,就是「自動化陷阱」:每個工具單獨測都沒問題,但整個學習迴路慢慢飄離真實消費者,因為發想、篩選、測試、訪談如今全由「彼此拿對方輸出去訓練出來的模型」中介,一切都更快,卻沒有一樣真正踩在地上。
改善方式:
這道風險是「AI 接手愈多,人愈沒機會磨練判斷力,最後整個組織飄離真實顧客」。
論文的對策是刻意的「留一手」——在創新流程的每一個階段,都保留與真實消費者、真實市場、真實訊號的接觸點,不讓回饋迴路變成「AI 餵 AI」。
具體的分工原則是:把生成式 AI 明確導向它擅長的資訊性、流量性、方法性任務(處理量大、規則清楚的工作),而把「領先使用者洞察、激進重構、為決策後果負責」這些需要親身經驗與擔當的角色,刻意保護在人的手上。最關鍵的一句提醒是:別假設「每個零件單獨測都準,湊起來的系統就一定踩在地上」——元件正確不等於整體接地。
(三)不平等與代表性
議題:比起「誰用得到 AI」,對創新更要緊的不平等發生在「產出端」——因為 AI 主要用多數群體的資料訓練,它會隱性地為那些群體最佳化。數位分身對富裕、高教育的消費者比較準,LLM 的偏好估計還原的是母體平均、卻抹掉了驅動利基市場的差異。當一個創新系統用這些方法去分配「要研究哪些區隔」的資源,偏差就複利成「市場層次的代表性不足」:越是難被現有 AI 工具還原偏好的區隔,它的未滿足需求就越不可能被看見、越不會成為新產品開發的目標。
改善方式:
這道問題是「AI 用多數群體的資料訓練,於是隱性地為多數人最佳化,讓小眾族群的需求更不容易被看見」。論文能提供的槓桿,其實就是前面「偏好衡量」那一節用過的那幾種——用 AI 增補(而不是取代)真人調查、拿特定類別的真人資料去微調模型、用 AI 主持的訪談去延伸質性研究的觸及範圍——用這些方法,刻意去保護那些「難被 AI 還原偏好」的族群,不讓他們的需求在資源分配裡被跳過。但論文也誠實承認:這些槓桿要怎麼在整個創新組合的層次上部署、才能真正擋住「代表性崩塌」,目前仍是一個沒有答案的實證問題。
(四)倒轉的開發曲線
議題:傳統產品開發裡,做出一個能動的原型又慢又貴,但原型一旦有了,往可靠產品走的路相對清楚(輸入對應輸出,規則由開發者掌握)。
生成式 AI 產品把這條曲線倒轉了(見圖 2):做原型現在很快——LLM 幾乎立刻就能對多數問題給出「看起來合理」的回應;但從「看起來合理」走到「可靠到能上線」卻難得多——失敗模式難以事先列舉、同一個提示可能跑出不同結果、要達到特定領域的準確度,得做檢索、接地、驗證、退場機制等一堆架構選擇,而這些才是大部分的工程量。於是篩選瓶頸換了位置:問題不再是「這個點子該不該推進」,而是「既然原型能動,這套系統能不能被做到可靠、足以上線」——這沒辦法靠看原型判斷,因為漂亮的展示已經不再透露真正的部署風險。
改善方式:
這道議題是「做原型變快了,但把原型變成可靠產品反而更難,於是最難的工程都發生在原型之後」。
既然如此,論文主張把「評估的重心」也跟著往後移——別再用「展示做得多漂亮、原型跑得多快」來判斷一個 AI 專案值不值得投入,因為在生成式 AI 的世界裡,漂亮的展示幾乎人人做得出來,它已經不能反映真正的部署風險。真正該評估的,是一家公司有沒有「把系統從『看起來合理』推進到『在特定領域真正可靠』」的原型後工程能力——也就是組建領域資料、搭建驗證架構、做系統整合的本事。
論文提醒,若不這樣調整,會出現三個後果:公司累積一堆永遠畢不了業的試點、傳統的階段閘門評審失去篩選價值(因為它們把關的時點太早)、競爭優勢從「會做原型」轉移到「有本事把原型變可靠」的少數團隊手上。

【圖 2|倒轉的開發曲線(論文 Figure 1)】 — 上下對照兩條時間軸。傳統產品開發:做出原型耗時長(約佔 0-45%)、原型少,原型之後到可靠產品的工程與測試相對短(約 55-90%)。生成式 AI 產品開發:做出原型極快(約 0-20%)、原型多,但從原型到「可靠產品」的工程、測試、驗證、安全、整合階段拉得很長(約 40-90%)。凸顯論點:AI 讓做原型變快,真正的難處與去風險化移到了「原型之後」。
(五)創新架構的轉變
議題:論文借用 Von Hippel 的「黏性資訊」概念(意思是:關於「使用者需求」和「解法」的資訊,往往各自黏在不同的人身上、很難轉移),把生成式 AI 的用法分成三種模式(見圖 3)。模式一「AI 作為整合創新者」——想讓 AI 系統本身同時裝下「需求」和「解法」兩種資訊,例如打造一個合成人物去代表某個顧客區隔的偏好;但第 2 節已經顯示它的限制(異質性流失、數位分身不會非理性、以及「偏好是臨場建構而非儲存」這個更深的真實性瓶頸)。模式二「AI 中介的需求抽取」——不取代使用者,而是用 AI 大規模去擷取他們的需求(例如 AI 主持的訪談),業界很關注但學界還沒充分驗證。模式三「AI 作為使用者創新工具箱」——把「解法能力」開放給使用者,讓他們自己變成創新者(各種 vibe coding、低程式碼工具就是這一類)。
改善方式:
論文把 AI 的用法分成三種模式,並主張「重心押錯了地方」。目前業界的目光多半集中在模式一(讓 AI 系統自己同時裝下顧客需求與解法,例如打造合成顧客(AI 模擬出來的虛擬顧客)去代表某個族群的偏好),但前面幾節已經顯示這條路的限制很硬——AI 抓不到族群差異、數位分身不會非理性、而且顧客偏好本來就是臨場建構、不是存好等著被讀取的。
論文因此建議把重心更多移向另外兩種模式:
模式二「用 AI 去大規模擷取真人的需求」(例如 AI 主持訪談,人還是需求的來源,AI 只負責擷取),以及模式三「把解法能力開放給使用者、讓他們自己動手創新」(各種 vibe coding、低程式碼工具就屬於這類)。理由是這兩種模式都是「順著」人類的限制走、而不是硬要用 AI 去「取代」人類最難被取代的那部分。至於哪種模式適合哪種情境、又各自需要開發什麼工具,論文說這是後續研究的優先題目。

【圖 3|創新架構的三種模式】 — 三種模式並列,每種都由上方(創新者 Innovator/解法 Solutions)、中間(AI)、下方(使用者 User/需求 Needs)三層構成,差別在箭頭方向。模式一「AI 作為整合創新者」:箭頭從創新者/解法向下、從使用者/需求向上,雙向匯入 AI——AI 同時是需求與解法資訊的所在。模式二「AI 中介的需求擷取」:箭頭從使用者/需求向上進入 AI,再由 AI 向上指回創新者——AI 把使用者需求擷取後傳給創新者,不取代使用者。模式三「AI 作為使用者創新工具箱」:箭頭從創新者/解法向下進入 AI,再由 AI 向下指向使用者——AI 把解法能力交到使用者手上,讓其自行創新。
(六)為 AI agent 而創新
議題:現有研究大多假設「使用者是人」,論文則設想一個「只稍微未來一點」的情境——使用者本身就是一個 AI agent,而創新者是人、或另一個 AI agent。這帶出一個根本問題:當買家是 AI agent,「偏好」還是什麼意思?人類的偏好是臨場建構的、帶情感的、看情境的;而 AI agent 的「偏好」,其實是設定它的人或組織所寫下的目標函數。這造成一個代理問題:agent 是在為「它的設定裡編碼的、人類嘴上說的偏好」最佳化,不見得等於「人類在真實情境中會建構的偏好、或實際用了產品得到的滿足」——而這道落差,在創新最關心的那類新穎、高涉入的產品上最大。
改善方式:
這一題論文擺明是「開放的研究方向」,而不是給出解法——它設想的是一個「使用者本身就是 AI agent」的近未來情境,並指出一個根本難題:當買家是 AI agent,它的「偏好」其實只是人類事先寫進去的目標函數,跟真人那種臨場、帶情感、看情境的偏好是兩回事,兩者之間會出現系統性的落差。面對這個還沒被好好研究的局面,論文提出的不是答案、而是問題:該不該發展出一門對應「顧客洞察」的「agent 洞察」學科?偏好衡量的方法又該怎麼為 AI agent 重新設計?
論文唯一給得比較肯定的一點是:無論 AI agent 之間如何互為創新者與使用者,這整套機制仍必須嵌在一個「有人類監督」的更大生態裡,不能全交給 agent 自己跑。
七、結語
論文把「人到底還會不會留在創新流程裡」這個主流問題,重新框定為「何時、以及如何」。透過以人性瓶頸(而非 AI 能力)為分析的基準,這套框架能指出:流程中哪些位置,人的判斷是那個卡住一切的關鍵約束;哪些位置又不是。而這個區分是實證的——它跟隨每個瓶頸背後的機制,不隨模型的先進程度而變。
更難處理的是系統層次的意涵:框架所倚賴的那些人類貢獻(領先使用者的沉浸、民族誌觀察、挑戰組織既定說法的意願),恰恰是當前組織實務最不擅長保護的——它們透過「正被 AI 快速吸收的養成工作」發展、透過「正被 AI 稀釋的當責結構」被評價、由「信譽無法被 AI 供給的人」來執行。
企業大致已經決定要在創新流程裡用生成式 AI,更難的問題是:當真正新穎的難題出現時,那個流程所依賴的人類能力,還在不在。這些能力是承重的,它們會在「看起來像進步」的條件下悄悄流失,因此需要刻意的組織保護。
附註(改善方式的實證依據,均出自本論文所引研究):
〔1〕chain-of-thought 提示可提升 LLM 於單一工作階段內的點子多樣性(Meincke 等,2024),但同樣做法對人類發想者的多樣性幾乎無效果(Deng 等,2026)。
〔2〕Kireyev 等(2025)以 153 場創意競賽、逾 74,000 件投稿為資料,將 LLM 生成評分與歷史人類專家評分結合進預測模型後,可在少看 28.4% 件數的情況下,仍識別出全部贊助方入選作品;增益多半來自重新加權歷史人類評分以對齊贊助方偏好,而非 LLM 訊號本身。
〔3〕Lane 等(2026)的田野實驗發現,不附理由的「黑箱」AI 建議相較純人類評估改善了決策品質,同樣的建議一旦附上敘事理由則否,儘管附理由會誘發更高的整體順從。
〔4〕Brand 等(2026)發現,對既有的產品與屬性,基準 LLM 的 conjoint(一種拆解顧客對各屬性願付價格的偏好衡量方法)常能以人類研究一小部分的成本與時間,產出量級正確的願付價格估計;對既有類別內的漸進式新功能,以該類別的歷史人類 conjoint 資料微調可補回大部分準確度。
〔5〕Gui & Toubia(2023)以隨機定價的真實實驗為對照,發現對「實驗設計」(而非情境變數)設盲,能跨模型世代穩定改善模擬準確度,並對微調中的無關觀察資料具穩健性。
資料來源:
- Julian De Freitas、Ayelet Israeli、Gideon Nave、Artem Timoshenko、Olivier Toubia(2026/8/14),Research: The Innovation Problems AI Can’t Solve, Harvard Business Review
- 原始論文:Innovating with Generative AI: A Human Bottleneck Framework,SSRN



