看見引用標記,先別急著相信
某個問答系統回答學校入學期限,句末附了三個連結。使用者點進去,發現其中一頁是去年的招生簡章,另一頁只講一般流程,第三頁甚至已被更新。模型確實檢索到「相關」內容,卻沒有證明回答中的日期與條件。
檢索增強生成(RAG)通常先把文件切成片段,再找與問題相近的片段交給語言模型撰寫答案。檢索相近與推論正確是兩個不同步驟;每一步都可能遺漏範圍、版本、例外與上下文。
切分文件也會切掉條件
若系統把「申請期限」切在一段,把「僅限某校區」切在下一段,語言模型可能只看到前者,於是給出過度泛化的答案。檢索設計需要保留文件標題、發布日期、章節與相鄰段落,並讓使用者可直接打開原文位置。
來源索引也要有更新策略。政策修訂後,舊片段若仍在資料庫中,模型可能同時引用新舊規則。應以版本與有效日期管理,而不是只靠最近上傳時間;被撤回文件也要能從公開回答中退場。
逐句檢查比統計引用數更有用
對一段回答,標出每個具體事實、數字與規則,逐項尋找支持段落。若需要跨來源推論,應說明推論步驟而不是把單一連結貼在句尾。若查無依據,就明確寫「在現有材料中無法確認」,不要用流暢語氣補洞。
可以設計簡單的人工作業:抽查高風險問題、比較來源與回答的詞句、故意詢問不存在的規則,觀察系統會拒答還是編造。測試不應只選熟悉問題,否則很難看見模型在資料稀少時的行為。
回答與證據的四種關係
引用介面需要幫讀者減少負擔
好的引用不只是一個外連圖示,而是能讓人找到文件名稱、章節、日期與原句。介面可以在答案旁標記「直接支持」「綜合推論」或「需要人工確認」,讓讀者知道為何需要點開。避免用分數代替真正的證據展示。
若使用者無權查看原始文件,系統不宜輸出片段以繞過權限。企業知識庫的檢索還需要身份驗證、可見性過濾與日誌治理;一個看似準確的回答若洩漏內部資料,仍是失敗。
讓拒答成為系統能力
模型被設計成盡量回答問題,卻不是每個問題都有足夠材料。應定義在來源缺失、相互矛盾或時間敏感時如何回答,提供原始文件與人工聯絡途徑。拒答不等於無用,可能是防止錯誤決策的關鍵。
真正「有根據」的問答,能讓人從答案走回文件、看見版本與條件、辨認模型自己的推論,並在錯誤時修正。引用的目的不是裝飾可信感,而是縮短核對距離。
建立來源相互衝突時的處理規則
假設系統檢索到兩份政策文件,一份在去年發布、另一份本月生效,但新文件只修訂部分條款。簡單地選「最新檔案」可能忽略仍有效的舊條文;把兩份文字平均,又可能創造不存在的混合規則。系統應先比較發布單位、有效日期、修訂範圍與適用對象,找不到清楚關係時就提示人工查核。
企業或公共服務問答還可以做具體測試:故意問超出文件範圍的問題、使用舊稱呼、提供相互矛盾的條件,檢查系統是否能說明「資料不足」或展示衝突段落。評估時不只算答案正確率,也看引用是否真的支持每個關鍵句。這能把使用者從被動接收答案,變成可以檢查證據的參與者。 資料治理同樣影響檢索品質。若原始文件由不同團隊維護,有些頁面不標日期,有些備忘錄只是工作草稿,系統很難判斷何者具有正式效力。建置前可先為文件建立負責人、狀態、有效日期與替代關係。這件事看似不像 AI 工程,卻常比換一個更大的模型更能減少錯答。讓資料擁有者可以更正或撤回來源,也使模型的引用具有持續可維護性。 資料治理改善後,即使使用較小模型,也可能比大型模型配上混亂檔案更可靠。可維護的來源,比華麗的回答樣式重要。 對使用者來說,最好的介面不是逼人相信引用標記,而是讓人用一次點擊看見原文段落、日期與限制,再自行決定是否採納。
延伸參照:NIST 人工智慧風險管理框架。連結用於理解相關治理或技術背景,不表示合作或認證。