AI會讓判斷力變差嗎?MIT四週實驗發現:即時查證更準,獨立辨識卻沒有跟著變強

目錄

每天使用 AI 讀新聞、整理資料或協助查證消息時,很容易看到一個直接的好處:原本需要自己搜尋很多來源的事情,幾分鐘內就能得到整理過的答案。但 MIT Media Lab 一份為期四週的研究提醒,工具把當下表現拉高,不代表同一套判斷能力也會一起留下來。研究裡的參與者在 AI 協助下辨識真假新聞時,準確率平均提高約 21.3 個百分點;到了後續拿掉 AI、要求自行判斷新的新聞素材時,表現卻沒有隨著四週練習變得更好,而且每次使用 AI 後立即進行的獨立測驗,到了第四週比第一週低了 15.3 個百分點。

這個結果很容易被濃縮成「用 AI 一個月,判斷力下降 15%」,但研究其實沒有證明得這麼直接。每個 Session 一開始、還沒使用 AI 前的獨立測驗,到了第四週比 Week 0 低 6.8 個百分點,但差異沒有達到統計顯著;下降最清楚的是先和 AI 對話,再立刻拿掉 AI 判斷新素材的 After AI 階段。研究作者因此認為目前結果同時可能包含依賴、認知卸載或當下的 cognitive fatigue,而不能單憑 15.3 個百分點就認定參與者形成了永久性的能力損失。比較能確定的是,四週反覆和 AI 一起查證新聞,沒有讓獨立辨識能力穩定進步。

這個差別對長期使用 AI 工作的人很重要。AI 摘要、AI 查證、AI 分類與 Agent 自動整理資料確實可以少掉很多重複工作,但如果某些任務本來希望持續保有自己的判斷能力,衡量工作流時就不能只看「有 AI 時做得多快」,還要看「工具暫時拿掉之後,原本會做的事還剩多少」。

MIT的AI依賴研究怎麼做?67人追蹤四週,不只是測一次真假新聞

研究分成Week 0、Week 2與Week 4三個Session

這篇研究名為《Dialogues with AI Reduce Beliefs in Misinformation but Build No Lasting Discernment Skills》,2026 年發表於 CHI Conference on Human Factors in Computing Systems。研究團隊最初透過 Prolific 招募 105 名美國與英國成年人,其中 28 人沒有完成全部三次 Session,另有 10 人因未通過注意力檢查被排除,最後分析樣本為 67 人,平均年齡 40 歲。三次實驗分別在 Week 0、Week 2 與 Week 4 進行,每一輪都先讓參與者自己判斷真假新聞,再和 AI 討論同一批素材,最後拿掉 AI,改判斷之前沒看過的新素材。

新聞不是只有文字標題,而是「Headline+Image」配對,來源是 MiRAGeNews Dataset。研究人員原先隨機挑出 55 則素材,先讓實驗使用的 AI 系統進行測試,其中 6 則被系統判斷錯誤,因此被排除,最後留下 49 則進入正式研究。實驗中的 AI 使用 GPT-4o 產生對話,另外連接 Google Custom Search API 查找即時資料,每一則新聞最多可以來回對話九輪。

這個設計有一個很重要的目的:研究團隊不是只想知道 AI 能不能把當下答案改對,而是刻意把「AI 在場時的表現」和「AI 離開後的獨立能力」拆開。這也是這篇研究比單次比較「有 AI/沒 AI」更值得看的地方。

有AI協助時準確率提高21.3個百分點,這部分確實很明顯

AI很會幫忙把眼前這一題做對

在三個 Session 裡,參與者和 AI 對話之後,判斷同一則新聞的準確率平均比使用 AI 前提高約 21.3 個百分點,其中 Week 0 約增加 22.4 點、Week 2 增加 15.3 點、Week 4 增加 26.1 點,因此就「眼前這則新聞能不能判斷正確」而言,AI 的協助效果相當明顯。

這也是研究一開始真正想區分的兩件事:AI 可以糾正一個錯誤信念,卻不一定會把判斷方法一起教會。參與者如果原本覺得一則假新聞是真的,AI 可以搜尋資料、提供證據,再透過對話把答案拉回正確方向;但如果整個推理過程主要由 AI 完成,下一次碰到另一則從沒看過的新聞時,先前那個正確答案不一定會變成可以自己重複使用的能力。

所以這份研究不是在說「AI 查證沒有價值」,反而證明 AI 在即時判斷上確實很有用。研究真正問的是另一件事:當正確答案一直由外部工具提供,使用者究竟是在學習,還是只是在當下得到比較好的結果?

15.3個百分點到底代表什麼?這是整篇最容易被誤讀的數字

下降最明顯的是「剛用完AI後又立刻自己做」,不是跨週基準能力永久少15.3點

每次 Session 都有兩種「沒有 AI」的測驗。第一種是 Session 一開始的 Before AI,此時參與者尚未和 AI 互動,比較適合觀察前兩週使用 AI 之後有沒有留下持久的學習效果;第二種則是先和 AI 對話,再立即進行 After AI,改用全新的新聞素材自行判斷。

如果看比較接近長期能力的 Before AI,Week 4 比 Week 0 低約 6.8 個百分點,但這個下降沒有達到統計顯著,研究因此沒有看到可靠的持久能力進步,同時也不能據此證明長期能力已經顯著退化。

真正達到顯著下降的是 After AI。參與者剛完成 AI 協助後,再獨立面對新的新聞素材,Week 4 的表現比 Week 0 低 15.3 個百分點,而且下降主要集中在辨認假新聞;對真新聞的辨識則相對穩定。作者進一步指出,這種 After AI 下降比跨 Session 的 baseline 下降陡得多,因此可能至少有一部分來自使用 AI 後立即產生的短期依賴或認知疲勞,下一次 Session 開始時也可以看到部分恢復。

所以比較準確的結論不是「一個月後能力永久倒退 15.3 點」,而是:AI 幫助當下判斷變準,卻沒有建立穩定的獨立辨識能力,而且反覆使用之後,剛離開 AI 時辨認新假新聞的表現反而越來越差。

最需要注意的不是15.3%,而是有人表現下降卻覺得自己進步了

研究看到的是自我評估與實際表現失準,不宜直接叫做Dunning-Kruger effect

研究團隊除了測準確率,也分析參與者四週前後對 AI 的看法與思考方式,最後把 67 人分成五種使用軌跡。其中 18 人、約 27%,被研究者稱為 Progressive Learners,這群人原本對 AI 比較懷疑,到 Week 4 卻越來越相信 AI 有教會自己辨識真假資訊,但客觀測驗中的獨立表現並沒有跟著改善。研究另外找出 14 人、約 21%,歸類為 Dependency Developers,他們的描述逐漸從主動思考轉成依賴 AI 完成查證。

其中一名參與者後來提到,AI 的確一直提醒要跨來源確認新聞,但真正進行查證的工作主要還是 AI 完成,自己沒有因此學會怎麼進一步檢查圖片脈絡。這種差距比「答錯幾題」更值得留意,因為工具長期提供正確結論之後,很容易把「共同完成任務時的成功率」和「自己的能力」混在一起。

MIT News 在報導這一段時用了「Dunning-Kruger creeps in」作為小標,不過研究本身沒有正式設計 Dunning-Kruger Effect 的測量,因此文章裡不適合直接寫成「這就是典型的鄧寧-克魯格效應」。更準確的說法是,目前觀察到一種 confidence/performance miscalibration:部分參與者主觀認為自己更會辨識資訊,但獨立測驗並沒有支持這種感覺。

AI是不是會讓人去技能化?這份研究只能回答特定的真假新聞任務

Cognitive offloading可以拿來理解,但不能把結果直接套到所有知識工作

研究作者把結果放進 cognitive offloading 與 deskilling 的討論裡並不奇怪,因為把原本由大腦完成的工作交給工具,本來就可能改變相關技能的使用頻率。GPS、計算機與各種自動化系統都曾出現類似討論,而 AI 現在開始接手的不只計算與路線規劃,還包含摘要、搜尋、分類、比較證據與提出判斷。

但這份 MIT 實驗只直接測到一件事:67 名美英成年人,在四週內使用一套特定的 GPT-4o+Google Search 說服型 Chatbot 判斷 49 組真假新聞圖片與標題之後,獨立 misinformation discernment 並沒有得到持續改善,而且剛使用完 AI 後的辨識表現隨時間惡化。它沒有測試寫程式、財務分析、研究整理、法律判讀或日常工作決策,因此不能直接推成「任何原本需要動腦、現在交給 AI 的工作都會退化」。

比較合理的延伸是:如果某項能力本來希望繼續保有,而 AI Workflow 長期把相關推理過程全部替代掉,是否還有足夠的自主練習,值得另外檢查。這是一個從研究延伸出的工作流問題,不是這篇研究已經證明的普遍定律。

醫療領域也出現Deskilling訊號,但還不能證明是同一個機制

AI輔助大腸鏡研究看到的是相關性,而且本身也是觀察性研究

MIT 論文引用的一項 2025 年《The Lancet Gastroenterology & Hepatology》研究,確實提供另一個值得比較的案例。研究觀察波蘭四間內視鏡中心導入 AI Polyp Detection 前後,在沒有 AI 輔助的大腸鏡檢查裡,adenoma detection rate 從導入前的 28.4% 降到導入後的 22.4%,絕對差約 6 個百分點,作者因此認為長期接觸 AI 可能影響醫師在沒有工具時的檢查表現。

不過,這是一項 retrospective observational study,不是把醫師隨機分成「長期依賴 AI」與「完全不用 AI」再比較技能變化的實驗,因此不能直接證明 AI 導致醫師能力下降,也不能證明它和 MIT 假新聞實驗存在完全相同的心理機制。兩份研究比較適合共同支持一個較保守的問題:當 AI 長期介入原本需要專業判斷的工作後,拿掉 AI 時的表現是否會受到影響,開始值得被獨立量測,而不能只看工具開著時的準確率。

關鍵可能不只在「有沒有用AI」,而在AI有沒有把推理過程一起拿走

Guided Questions與Deep Probing和較好的後續表現有關,但這一段是探索性分析

這份研究最有實務價值的一段,是研究團隊把數千段 Human-AI Conversations 交給 LLM-as-a-judge,分類成 21 種互動策略,再觀察不同策略和當下、後續準確率的相關性。這一段不是預先隨機分派不同教學法的實驗,因此結果只能說「哪些互動方式和較好的表現一起出現」,不能直接當成已證實的因果介入。

其中 asking guided questions 很有意思。AI 在互動中一直用引導式問題要求參與者思考時,當下辨識表現反而略差,但使用 AI 後再自己判斷假新聞的表現較好,相關係數約 r = 0.29,達到統計顯著;probe deeper over messages 同樣和較好的後續獨立表現呈正相關,約 r = 0.19。研究作者因此認為,這類互動可能具有 scaffolding 的作用,也就是不急著把答案送到面前,而是讓使用者多走一點推理過程。

另一邊則很有反差。直接給答案、把 AI 當成外部事實驗證器,和較差的獨立表現存在關聯;反覆要求使用者評估自己的 confidence,在 After AI 階段甚至和較差表現呈明顯負相關。這些結果都還需要更大的隨機實驗驗證,但至少顯示「讓 AI 多問幾句」和「讓 AI 直接把答案講完」可能不是同一種學習體驗。

因此,「教練型 AI」與「拐杖型 AI」可以留下作為文章的理解框架,但不要寫成研究已經證明兩套固定模式。研究目前真正找到的是 interaction strategy 和後續表現之間的探索性關聯。

突發新聞是AI最不可靠的時候嗎?這是研究者的延伸提醒,不是本實驗測出的結果

MIT News 在介紹研究時另外引用研究團隊的提醒,認為情緒高度集中的 Breaking News 特別容易同時出現大量錯誤資訊,也可能讓 AI 系統犯錯,因此在重大政治、戰爭或突發事件剛發生時,不應把 Chatbot 回答當成單一事實來源。

不過,這項說法不是四週實驗直接比較「Breaking News vs. 一般新聞」之後得到的結果。實驗素材雖然涵蓋 Election、Protest、Court Proceedings、Diplomatic Events、Health 與 Disaster 等主題,但研究沒有建立一個「高情緒新聞組」來證明模型在這些情況下錯得更多。

所以這一段比較適合寫成研究者延伸提出的風險,而不是實驗發現。對實際工作流來說,突發消息也確實適合提高查證門檻:不是因為 MIT 已經量出固定錯誤率,而是事件剛發生時原始資訊本來就少、來源互相引用、內容持續更新,此時不論人工搜尋或 AI 整理,都比較容易把尚未確認的內容當成定論。

把AI從「直接給答案」調成「保留判斷過程」,可以先做五個調整

以下做法是依研究結果延伸出的工作流建議,不是這篇實驗逐項測試過的五種 Intervention,因此比較適合當成降低認知外包程度的方法,而不是保證能防止 deskilling 的公式。

先留下自己的初步判斷,再開AI

碰到需要查證或判斷的資訊,可以先記下目前傾向、理由,以及哪一點最不確定,再讓 AI 介入。這樣至少留下了一次獨立 reasoning attempt,後面看到 AI 的結論時,也比較容易比較「原本忽略了什麼」,而不是從第一秒就只剩閱讀答案。

研究裡的 Persistent Self-Reliant Learners 就有類似使用習慣,他們把 AI 放在確認或挑戰原有判斷的位置,而不是把判斷本身完全交給工具。這仍然只是質性軌跡,不能證明這種做法一定保住能力,但比直接接收答案更符合研究希望保留 active reasoning 的方向。

要求AI先提問,再提供判斷

對需要保留能力的任務,可以把 Prompt 從「判斷這則新聞是真是假」改成「先問三個能幫助檢查來源、證據與反例的問題,等回答後再補充遺漏的地方」。研究裡 Guided Questioning 和後續較好的獨立辨識存在正相關,雖然還不能證明 Prompt 一改就會產生同樣效果,但至少比每次直接取得結論更貼近研究裡的 scaffolding 方向。

例如可以固定要求 AI 先確認:原始消息最早來自哪裡、有哪些細節可以從獨立來源交叉驗證、如果這則資訊是錯的最可能在哪個環節出問題。等這幾個問題處理完,再讓 AI 提供自己的判斷。

高風險資訊保留一個原始來源查核步驟

財務、醫療、法律、工作提案或準備公開發布的事實主張,不適合讓「AI 說有這件事」成為最後一層證據。比較穩定的流程,是讓 AI 協助找到 Source,再回到官方公告、原始論文、法規、財報或第一手文件確認。

這同時也能避免另一個問題:MIT 實驗中的 AI 並不是單純靠模型記憶回答,它還使用 Google Custom Search API,而且研究者事前把 AI 判錯的 6 則新聞排除後才進行正式測試,因此實驗裡的 AI 查證條件其實比隨手打開一個沒有即時搜尋、也沒有預先驗證準確率的 Chatbot 更受控制。

突發消息不要只靠AI決定真假

碰到正在快速發展的事件,不需要硬訂「一定等 24 小時」這種沒有研究依據的時間門檻,比較實際的是等到至少出現可追溯的一手來源,或兩個彼此獨立、可以確認原始資訊的來源,再把內容當成可以引用的事實。

AI 可以用來列出目前有哪些說法、哪一些仍互相矛盾,以及接下來應該確認什麼,但不要讓模型替還沒有穩定來源的事件提前結案。

定期安排一次沒有AI的校準

如果某一類工作已經幾乎每次都依賴 AI,可以偶爾完整做一次沒有 AI 的版本,再拿工具檢查差異。目的不是證明人工一定比較好,而是避免只剩「有 AI 時表現很好」這一項指標。

MIT 研究裡最值得留下的設計概念,就是刻意測 With AI 和 Without AI 兩種表現。日常工作不需要照研究規格每兩週考一次,但如果希望某項技能仍然留在自己身上,就需要偶爾測量工具不在場時還做不做得到。

這份MIT研究有哪些限制?15.3個百分點不能直接套到日常所有AI工作

第一個限制是樣本。研究最後只有 67 名完整參與者,而且全部來自美國與英國,平均年齡約 40 歲,因此不同語言、教育背景與媒體環境下是否會出現相同程度的依賴,目前還不知道。

第二個限制是新聞素材只有 49 則,而且它們來自 MiRAGeNews 的 Headline-Image Pairs,不能直接代表所有文字新聞、社群貼文、Podcast、研究報告或真實查證任務。更值得注意的是,研究原本選了 55 則,AI 先判錯的 6 則被排除,正式實驗只留下 AI 能正確分類的內容,因此這項研究主要測的是「當 AI 本身能給出正確方向時,人長期依賴它會發生什麼」,不是「現實世界裡一個有時候也會判錯的 Chatbot 對判斷力的完整影響」。

第三個限制是只有四週。研究已經觀察到 After AI 階段明顯下降,但每次新 Session 開始前的 baseline 沒有出現同樣幅度的顯著下降,作者也因此提出短期 dependency 或 cognitive fatigue 可能參與其中;更長時間使用之後能力會繼續下降、停在原地,還是停止使用一段時間後恢復,目前都沒有答案。

第四個限制是互動策略分析屬於 exploratory correlation。Guided Questions、Deep Probing 與較好的後續表現很值得追蹤,但研究不是把 67 人隨機分成「直接答案組」「蘇格拉底組」「Deep Probing 組」再比較,因此不能把相關性寫成已經驗證完成的因果教學法。研究作者自己也把不同 Pedagogical Approaches 的比較列為後續研究方向。

AI依賴研究真正值得留下的,不是「不要用AI」

這份 MIT 研究最有意思的地方,不是多了一篇「AI 會讓人變笨」的新聞,而是它把兩種很容易混在一起的表現拆開量:一種是工具在旁邊時,事情做得多準;另一種是工具離開後,原本希望保留的能力還剩多少。

在這個實驗裡,第一項非常漂亮,AI 協助平均把準確率拉高約 21.3 個百分點;第二項卻沒有跟著進步,而且使用 AI 後立即自行辨認新假新聞的能力還出現明顯下降。這不代表所有 AI Workflow 都會造成相同結果,也還不能證明 15.3 個百分點是一種永久 deskilling,但已經足以提醒一件事:AI-assisted performance 和 human learning 不是同一個 KPI。

MIT 教授 Pattie Maes 在談到這份研究時也把重點放在「哪些能力仍希望自己保留」。如果整段 problem-solving 都長期委外給工具,自然不會得到和親自練習一樣的技能成長;Valdemar Danry 則把這件事放進新的 AI Literacy 裡,認為未來不只需要學會怎麼使用模型,也需要知道哪些 critical tasks 不應該完全 offload。

對已經把 AI 放進日常工作流的人來說,真正值得檢查的因此不是「AI 用太多了嗎」,而是目前有哪些任務只是希望得到結果,哪些任務同時還希望保留自己的判斷能力。前一類盡量自動化沒有太大問題;後一類如果每次都讓 AI 從資料蒐集一路做到最後結論,偶爾把工具拿掉測一次,可能比再多加一個 Prompt 技巧更有用。

常見FAQ

MIT研究真的發現使用AI四週後,判斷力下降15.3%嗎?

需要更精確地說。15.3 是百分點,而且指 Week 4 相較 Week 0 的 After AI 測驗,也就是參與者剛使用完 AI,接著立即拿掉 AI 判斷新素材時的獨立準確率下降。每次 Session 一開始、尚未使用 AI 的 baseline 到 Week 4 則下降 6.8 個百分點,而且沒有達到統計顯著,因此不能把研究簡化成「一個月後永久能力下降 15.3%」。

AI協助真的讓真假新聞判斷提高21%嗎?

研究顯示 AI 協助期間的準確率平均提高約 21.3 個百分點,三個 Session 都能看到明顯的短期增益。這代表研究使用的 GPT-4o+Google Search 系統在正式納入的新聞素材上,確實很能幫助參與者把眼前題目判斷正確。

這是不是Dunning-Kruger effect?

研究沒有正式測試 Dunning-Kruger Effect,所以不適合直接下這個診斷。研究確實發現約 27% 的 Progressive Learners 主觀上越來越相信自己從 AI 學會了真假資訊辨識,但客觀表現沒有同步改善,比較安全的說法是出現了主觀自信與實際能力之間的 miscalibration。

蘇格拉底式提問真的可以防止AI依賴嗎?

目前只能說有正向訊號。研究的探索性分析發現 Guided Questions 和較好的後續獨立假新聞辨識有正相關,而且是該階段最強的正向 Predictor;Deep Probing 也呈正相關。但這些策略不是隨機分派,所以還不能證明使用蘇格拉底 Prompt 就一定能防止依賴。

醫師使用AI後也真的會變得比較不會判斷嗎?

2025 年的多中心觀察研究發現,內視鏡中心導入 AI Polyp Detection 後,醫師在沒有 AI 輔助的大腸鏡檢查中,adenoma detection rate 從 28.4% 降至 22.4%。這是值得注意的 deskilling signal,但研究屬於 retrospective observational design,因此只能說 AI exposure 和下降相關,不能直接證明 AI 是唯一原因。

這份研究代表工作時不應該再讓AI整理或查資料嗎?

不是。研究甚至顯示 AI 在場時能大幅提升當下準確率,因此問題不是「要不要用 AI」,而是工作目標。如果任務只要求快速得到結果,自動化可能很合理;如果同時希望持續保有獨立查證、判斷或推理能力,就需要替自主練習留下空間,而不能只用 AI-assisted performance 判斷自己有沒有真的學會。

SUPPORT FENGNIII

喜歡這篇文章嗎?

如果這篇內容對你有幫助,可以透過小額贊助支持本站持續整理更多日文、韓文、旅行與數位工具內容。

小額支持本站

付款將由藍新金流安全處理