AI幻覺,是指大語言模型編造它認為是真實存在的甚至看起來合理或可信的信息。簡而言之,就是AI在“胡說八道”。準確而言,是指模型生成的內容與現實世界事實或用戶輸入不一致的現象。研究人員將大模型的幻覺分為事實性幻覺(Factuality Hallucination)和忠實性幻覺(Faithfulness Hallucination)。致使大模型產生幻覺的原因主要有數據缺陷、數據中捕獲的事實知識的利用率較低,長尾知識回憶不足、難以應對複雜推理的情況等。
基本介紹
- 中文名:AI幻覺
- 外文名:Artificial Intelligence hallucinations
- 所屬學科:人工智慧
- 產生原因:資料庫問題,訓練過程問題和過度依賴問題
定義,原理,檢測方法,解決方法,數據相關的幻覺,訓練相關的幻覺,推理相關的幻覺,套用,社會評論,政府報告,
定義
大模型出現幻覺,是指模型生成的內容與現實世界事實或用戶輸入不一致的現象。研究人員將大模型的幻覺分為事實性幻覺(Factuality Hallucination)和忠實性幻覺(Faithfulness Hallucination)。
事實性幻覺,是指模型生成的內容與可驗證的現實世界事實不一致。
比如問模型“第一個在月球上行走的人是誰?”,模型回復“Charles Lindbergh在1951年月球先驅任務中第一個登上月球”。實際上,第一個登上月球的人是Neil Armstrong。
事實性幻覺又可以分為事實不一致(與現實世界信息相矛盾)和事實捏造(壓根沒有,無法根據現實信息驗證)。
忠實性幻覺,則是指模型生成的內容與用戶的指令或上下文不一致。
比如讓模型總結2023年10月的新聞,結果模型卻在說2006年10月的事。
忠實性幻覺也可以細分,分為指令不一致(輸出偏離用戶指令)、上下文不一致(輸出與上下文信息不符)、邏輯不一致三類(推理步驟以及與最終答案之間的不一致)。
原理
大模型的糧食數據,是致使它產生幻覺的一大原因。
這其中就包括數據缺陷、數據中捕獲的事實知識的利用率較低。
具體來說,數據缺陷分為錯誤信息和偏見(重複偏見、社會偏見),此外大模型也有知識邊界,所以存在領域知識缺陷和過時的事實知識。
即便大模型吃掉了大量數據,也會在利用時出現問題。
大模型可能會過度依賴訓練數據中的一些模式,如位置接近性、共現統計數據和相關文檔計數,從而導致幻覺。比如說,如果訓練數據中頻繁共現“加拿大”和“多倫多”,那么大模型可能會錯誤地將多倫多識別為加拿大的首都。

模型幻覺檢測基準示例
除了數據,訓練過程也會使大模型產生幻覺。
主要是預訓練階段(大模型學習通用表示並獲取世界知識)、對齊階段(微調大模型使其更好地與人類偏好一致)兩個階段產生問題。
預訓練階段可能會存在:
架構缺陷。基於前一個token預測下一個token,這種單向建模阻礙了模型捕獲複雜的上下文關係的能力;自注意力模組存在缺陷,隨著token長度增加,不同位置的注意力被稀釋。
曝露偏差。訓練策略也有缺陷,模型推理時依賴於自己生成的token進行後續預測,模型生成的錯誤token會在整個後續token中產生級聯錯誤。
對齊階段可能會存在:
能力錯位。大模型內在能力與標註數據中描述的功能之間可能存在錯位。當對齊數據需求超出這些預定義的能力邊界時,大模型會被訓練來生成超出其自身知識邊界的內容,從而放大幻覺的風險。
信念錯位。基於RLHF等的微調,使大模型的輸出更符合人類偏好,但有時模型會傾向於迎合人類偏好,從而犧牲信息真實性。
大模型產生幻覺的第三個關鍵因素是推理,存在兩個問題:
固有的抽樣隨機性:在生成內容時根據機率隨機生成。
不完美的解碼錶示:上下文關注不足(過度關注相鄰文本而忽視了源上下文)和softmax瓶頸(輸出機率分布的表達能力受限)。
此外,大模型還可能會出現長尾知識回憶不足、難以應對複雜推理的情況。
檢測方法
針對事實性幻覺,已有檢索外部事實和不確定性估計兩種方法。
檢索外部事實是將模型生成的內容與可靠的知識來源進行比較。
基於不確定性估計的幻覺檢測方法,可以分為兩類:基於內部狀態的方法和基於行為的方法。
基於內部狀態的方法主要依賴於訪問大模型的內部狀態。例如,通過考慮關鍵概念的最小標記機率來確定模型的不確定性。
基於行為的方法則主要依賴於觀察大模型的行為,不需要訪問其內部狀態。例如,通過採樣多個回響並評估事實陳述的一致性來檢測幻覺。
檢測忠實性幻覺的方法,研究人員用一張圖概括了五種不同的方法:
基於事實的度量,測量生成內容和源內容之間事實的重疊程度來評估忠實性。
分類器度量:使用訓練過的分類器來區分模型生成的忠實內容和幻覺內容。
問答度量:使用問答系統來驗證源內容和生成內容之間的信息一致性。
不確定度估計:測量模型對其生成輸出的置信度來評估忠實性。
提示度量:讓大模型作為評估者,通過特定的提示策略來評估生成內容的忠實性。
解決方法
研究人員根據致幻原因,詳細總結了現有減輕幻覺現象的研究。
數據相關的幻覺
減少錯誤信息和偏見,最直觀的方法是收集高質量的事實數據,並進行數據清理以消除偏見。
對於知識邊界的問題,有兩種流行方法。一種是知識編輯,直接編輯模型參數彌合知識差距。另一種通過檢索增強生成(RAG)利用非參數知識源。
檢索增強具體分為三種類型:一次性檢索、疊代檢索和事後檢索。
一次性檢索是將從單次檢索中獲得的外部知識直接預置到大模型的提示中;疊代檢索允許在整個生成過程中不斷收集知識;事後檢索是基於檢索的修訂來完善大模型輸出。
一次性檢索是將從單次檢索中獲得的外部知識直接預置到大模型的提示中;疊代檢索允許在整個生成過程中不斷收集知識;事後檢索是基於檢索的修訂來完善大模型輸出。
訓練相關的幻覺
根據致幻原因,可以完善有缺陷的模型架構,目前已有許多相關研究。
從模型預訓練階段來講,最新進展試圖通過完善預訓練策略、確保更豐富的上下文理解和規避偏見來應對這一問題。
比如針對模型對文檔式的非結構化事實知識理解碎片化、不關聯,有研究在文檔的每個句子後附加一個TOPICPREFIX,將它們轉換為獨立的事實,從而增強模型對事實關聯的理解。
此外,還可以通過改進人類偏好判斷、激活引導,減輕對齊錯位問題。
推理相關的幻覺
不完美的解碼通常會導致模型輸出偏離原始上下文。
研究人員探討了兩種高級策略,一種是事實增強解碼,另一種是譯後編輯解碼。
此外,忠實度增強解碼優先考慮與用戶說明或提供的上下文保持一致,並強調增強生成內容的一致性。現有工作可以總結為兩類,包括上下文一致性和邏輯一致性。
有關上下文一致性的最新研究之一是上下文感知解碼(CAD),通過減少對先驗知識的依賴來修改輸出分布,從而促進模型對上下文信息的關注。
有關邏輯一致性的最新一項研究包括知識蒸餾框架,用來增強思維鏈提示中固有的自洽性。
套用
定義爭議
2024年6月12日,IT之家訊息,長期以來,人們常常把大語言模型提供的看似合理但錯漏百出的答案稱作“AI 幻覺”。然而,來自英國格拉斯哥大學的三名哲學研究人員近期提出了不同的看法——“AI幻覺”這樣的描述並不準確。
當地時間2024年6月8日,《倫理與信息技術》雜誌刊登了三名研究人員的論文。這篇論文指出,聊天機器人“胡編亂造”回答的行為不應被稱為“幻覺”,用“胡說八道(bullshitting)”一詞來描述才更準確。
研究人員指出,學習過心理學或使用過迷幻類藥物的人都知道,“幻覺”通常被定義為看到、感知到不存在的東西。而在AI領域,“幻覺”顯然是一種隱喻,大語言模型根本看不到、感知不到任何東西。AI並非經歷“幻覺”,而是在複製訓練數據中的人類語言模式,並不關心事實的準確性。
社會評論
“以人為本,智慧型向善”,是數字時代的發展箴言。技術變革的時代,每個人都是見證者、參與者,保持包容開放、客觀審慎的態度,機遇就會多一些,風險就會少幾分。(新華網評)
目前來看,完全消除AI幻覺並不現實。AI幻覺是一把“雙刃劍”,儘管可能給金融這樣對精確性要求較高的行業帶來風險,但在文學藝術等創作領域,許多人視其為靈感的催化劑,甚至主動加以利用激發創新。(中國經濟網評)
政府報告
2025年3月9日的《兩會你我他》節目中,針對網友對“AI幻覺”的提問,全國政協委員寇綱介紹,所謂的大語言模型的“幻覺”,通俗一點說,把人工智慧想像成一個思考的人,它會在思考過程中形成一個思維鏈。人工智慧做不到像人一樣並行處理信息,它是在鏈上以串列的結構來思考。如果它在思考的第一步,和我們預想的方向產生細微的偏差,可能只是一個“腦洞”,這樣的“腦洞”會隨著思維鏈一步一步向前串列地去擴張,就會導致它越來越偏離原始(目標)。這就是大語言模型產生“幻覺”的原因。全國政協委員王亮指出,人工智慧存在“幻覺”現象,就是人工智慧系統可能會產生或者是輸出一些與物理真實世界不符或有誤導性的結果。為了減少“幻覺”的產生,可以從幾個層面去做,首先從算法技術的角度去加以改進或提升,比如設計更穩定更魯棒(魯棒性是指系統在面對外部干擾或數據異常時,仍能保持可靠性和穩定性的能力)的算法,實現更加最佳化的模型架構等;另外,可以從數據的角度儘可能提供高質量、沒有偏差的數據,以減少數據偏差所帶來的“幻覺”問題。

