你的RAG真的準確嗎?深入了解REMI的持續評估方法

持續的 RAG 評估將準確性從抽樣的觀點轉化為可計分、可追蹤的證據,便於治理和品質團隊使用。不再只是單個審閱者對少數幾個答案的看法,而是每個回應都會根據上下文的相關性、答案的相關性及其基礎性進行評分,這些分數最終匯總成一條質量領導可以實際檢查的趨勢線。準確性不再是發佈日的印象,而是一個可以指向的持續控制。

一個上週看起來還不錯的 RAG 答案,沒有成為控制。

生產問題更加尖銳:團隊是否能證明為何信任某個 AI 答案,以哪些來源支持它,以及當準確性發生漂移時發生了什麼變化?手動抽查很少留下那種證據,而持續評估可以做到。

為什麼抽查不是一個可辯護的控制

手動審查通常以良好的意圖開始。某人閱讀幾個答案,決定聽起來相關,然後簽字確認。對於試點計畫,這樣做似乎是實際的。然而對於生產 AI,這種方法留下太多未測量的部分。

規模和一致性是當前的主要問題。一個 檢索增強生成 (RAG) 系統在來源內容變更、檢索排名變動或用戶提出的問題超出最初測試集時可能會漂移。隨著規模擴大,這種差距會加大:許多企業 AI 計劃都是通過一個中央數據或 AI 團隊運行,沒有任何中央團隊能夠為系統服務的業務每部分維持特定領域的質量標準。當財務回答和法律回答對「好」的定義不一致時,手動審查沒有提供一致的評判標準。一個評閱者可能重視簡潔的答案,而另一個則期望引用、注意事項或更詳盡的解釋。少數抽樣的答案無法顯示漂移的起點或提供治理的可重複測量。

更深層的問題在於證據。如果一位審閱者詢問檢查了什麼以及昨天的答案今天是否仍然有效時,抽查只有一個尷尬的答案:某人查看過。這對審計文件來說太薄弱了。

準確性必須成為每個答案的可測量信號,而不是項目結束時的抽樣練習。

使準確性可測量的三個評分

關鍵問題不僅僅是,「這個答案好嗎?」這個問題隱藏了原因——在大規模情況下,手動檢查或自動判斷都無法單獨回答。RAG 答案可能因為系統檢索了錯誤的材料、模型忽略了好的材料,或者答案聽起來正確但依賴於從未檢索的事實而失敗。

REMi,是 Progress Agentic RAG 中的評估層,會對每個回應的相關性、準確性和基礎性進行評分,並將這些案例分開成為不同的信號。

  • 上下文相關性顯示檢索是否帶回符合用戶查詢的上下文。
  • 答案相關性專注於回答本身:它是否回答了所問的問題?
  • 而 基礎性 的測試是來源支持——答案是否可以追溯到檢索的上下文。

這些指標很重要,因為每個都回答了不同的治理問題。基礎性是幻覺檢查。如果一個答案說某政策允許某種行為,評估問題不是句子聽起來是否合理,而是檢索的來源材料是否支持該說法。

審查對話變了。質量領導不再需要請條件專家重讀隨機答案,而可以檢查變動的分數、檢索的來源和失去支持的答案。

如何透過分數模式指向失敗

這三個評分在一起閱讀時最有用。單一的低分顯示某些地方出錯。模式則告訴你要查看的地方。

分數模式通常表示什麼治理問題
高答案相關性、低上下文相關性和低基礎性答案解決了問題,但系統未檢索到針對它的支持。模型是否填補了記憶中的空缺?
高上下文相關性、低答案相關性和低基礎性正確的材料被檢索,但答案未妥善使用。生成步驟是否在躲避或總結不當?
高基礎性、低上下文相關性和低答案相關性答案與檢索文本保持接近,但檢索錯誤的文本。系統是否自信地回答了錯誤的問題?

這就是質量劇場與診斷之間的區別。如果檢索漏掉的話,你會調查分塊、元資料、排名或查詢的重寫方式。如果生成失敗,你將查看提示、模型行為或回應策略。如果系統自己基於錯誤的來源,那麼就有一個符合規範的問題。答案看似可追溯,但追蹤仍指向錯誤的地方。

對於 AI 品質工程師來說,速度價值所在。對於治理領導來說,防衛性是關鍵。「不好的答案」的結論只是投訴。「高答案相關性、低基礎性」的結論則是一個失敗模式的記錄。

持續監控使其成為持久控制

單次的清潔評估在發佈時並不證明系統將保持準確性。知識庫會變動。來源文件會被替換。用戶不再提問演示性問題,開始提出那些真正重要的複雜問題。看似健康的系統在推出後沒有任何人觸摸的情況下也可能會漂移。

這就是持續評分的重要性。Progress 文件 REMi 性能視圖跟蹤在七天和三十天的時間窗口內的質量表現。這些時間窗口將孤立的判斷轉化為一條趨勢線。如果上下文相關性在內容同步後下降,質量審查可以從檢索證據開始,而不是泛泛地辯論 AI 是否「變得更糟」。

相同的循環也能揭示知識的空白。未回答問題的跟蹤顯示用戶詢問的資訊系統無法檢索或支持的地方。這對內容擁有者提供了一個改善待辦事項:添加缺失的文檔、改善索引、檢查下一個分數窗口並確認該空白是否在不重建整個管道的情況下解決。

審計記錄應連結來源更新、同步事件、檢索的上下文、生成的答案、REMi 分數和審閱者的決策。這條鏈條讓治理領導在為 AI 結果辯護之前解釋輸入過程。

自動評估工具並不是萬能的,也不應該被視為最終的真相。一個評分模型可能會調整不準。一個指標可能會錯過特定領域的細微差異。解決方案不是回到直覺,而是一個可視化的控制循環。定義評分閾值,命名負責人,在閾值超過時打開例外或改善記錄,並在擴大使用前要求審查。

手動審查仍然有其工作。應該調查分數表現出來的案例,並驗證測量是否與商業風險對齊。它不應該是唯一的一道防線,阻止生產 AI 系統和用戶之間建立信任之源。

準確性必須留下證據

生產 RAG 系統通過不斷證明其工作的方式獲得信任。發佈批准僅是第一個檢查點;持續的評估才是控制。

持續評估使治理和品質團隊擁有共同的證據語言:檢索適配性、回應適配性和來源支持。這些標籤不同,因為失敗的情況也不同。

這些不是抽象的質量標籤,而是決定 AI 體驗是否值得更廣泛使用和更大責任的證據字段。

如果你正在評估 RAG 用於生產使用,請要求答案背後的分數、來源變動後的趨勢,以及當分數下降時的控制措施。要查看測量循環,請從REMi 評估模型或預約一個演示開始。

常見問題

持續評估取代了人工審查嗎?

不,它改變了人工審查使用時間的方式。審查者可以調查分數模式、調整閾值,並專注於質量風險明顯的情況,而不再只是閱讀隨機答案並期望樣本能夠代表生產。

對治理而言,哪個 REMi 指標最重要?

基礎性通常是最與審計相關的指標,因為它詢問答案是否有檢索的上下文支持。上下文相關性和答案相關性仍然重要,因為它們說明了失敗是源於檢索、生成還是兩者之間的不匹配。

當分數下降時,團隊應該怎麼做?

從變動的指標開始。上下文相關性下降會引導團隊檢查檢索、索引、分塊或元資料。當基礎性下降時,尋找不被支持的答案;當答案相關性下降時,檢查生成步驟和問題的解釋方式。

文章來源: Is Your RAG Actually Accurate – Inside REMI’s Approach to Continuous Evaluation

You cannot copy content of this page