模型答錯,不一定是沒學過:企業該先測「問法敏感度」🧠
WikiProfile 研究顯示,在特定基準中,模型可能已編碼某些事實,卻無法在不同問法下穩定取回。這不能解釋所有幻覺;企業應先測試錯誤是否受問法影響,再決定要改提示、加驗證或接入外部資料。
模型答錯時,先別急著判定它「不知道」,也不必一律加上 RAG。Google Research 與以色列理工學院(Technion)的 WikiProfile 研究,指出一種值得檢驗的可能性:模型在特定提示下能重現某項事實,換個問法卻未必能穩定取回。這讓「知識缺失」與「提取不穩」成為兩種不同的故障假說,但單靠答錯本身,無法判定是哪一種。 發布者:anson4139 研究以 2,150 項事實測試 13 款模型,每項事實搭配十種題目表述。Google Research 的說明指出,GPT-5 與 Gemini 3 Pro 在這個基準中約有 95% 至 98% 的事實被判定為已編碼。研究也發現,不啟用思考設定時,部分已編碼事實無法直接提取;啟用思考設定後,模型能找回其中一部分。這些數字只描述特定基準與測試條件,不代表模型掌握了同等比例的一般知識。🔎 研究中的「編碼」與「認知」是依提示情境和作答表現操作化的概念:模型能否在特定設定下重現事實,以及能否在不同表述下可靠作答。這些測試不能直接證明資訊在模型權重中的儲存方式,也不能單憑結果判定提取失敗是所有幻覺的主因。研究摘要與說明對部分比例的表述略有差異,因此不宜把未能直接提取的比例寫成毫無爭議的單一數字。 對產品團隊而言,實用的問題是:同一事實會不會因問法改變而得到不同答案?若改寫問題、提供選項或增加推論後能答對,提取不穩便是值得進一步測試的解釋;若各種形式都答錯,知識缺失、資料過期或任務超出模型能力,仍可能是更合適的假說。這類比較能協助分類,不能單獨證明錯誤成因。 可以先用一小組有標準答案的題目做診斷。每個事實設計幾種等義問法,記錄模型版本、提示與設定;先測目前的直接作答,再分別測試提示重述、思考設定,以及接入可信資料來源。每輪只改一項設定,逐題記錄正確與否、拒答、引用情形、延遲和成本,必要時重複測試,避免把偶然差異當成穩定改善。 若錯誤明顯受問法影響,可評估查詢重構或選擇性增加推論;若模型在不同問法下都無法可靠回答,或任務需要最新、可追溯的資訊,再測試 RAG 與來源驗證。選擇題答得較好,也不等於模型在開放式問答中同樣可靠。
https://blog.buclaw.org/posts/mumgzciq-mumglgpq