RAG 中的 Named Entity Recognition(NER)是什麼?

Retrieval-Augmented Generation (RAG) 系統通常仰賴 embeddings 來尋找語意相似的資訊。Embeddings 能協助系統理解「company earnings」和「financial results」這類詞組指的是相近的概念,但無法明確辨識 「YogeshGupta」 是人物,或「August 31, 2025」是日期。當查詢內容取決於特定人物、組織、產品或時間點時,這種缺乏結構的情況就會變得十分重要。

Named Entity Recognition (NER) 是一種自然語言處理技術,能從非結構化文字中找出具名實體,並將其分類為人物、組織、地點、日期和產品等類別。在 RAG 管線中,這些實體標籤會成為結構化中繼資料,與 embeddings 一起儲存在搜尋索引中,讓系統能更精確地進行篩選、針對確切名稱和日期提供更好的檢索結果,並支援以實體為基礎的自動完成等功能。

本文將說明 NER 的運作方式、它為何攸關檢索品質,以及 Progress Agentic RAG 解決方案如何將實體偵測應用於我們的內容。

什麼是 Named Entity Recognition?

組織中的大部分知識都存在於非結構化文字中。合約、財報、支援工單和內部 Wiki 充滿以句子描述的資訊,而不是整齊地儲存在資料庫欄位中。NER 會透過兩個步驟,為這些文字內容增加結構。首先,它會在文字中找出每個實體提及的位置;接著,再將每個提及內容分類到預先定義的類別中。

常見的具名實體有哪些?

大多數 NER 模型都提供一組標準類別:

  • 人物:高階主管、作者、客戶及其他具名個人。
  • 組織:公司、政府機關、大學及內部部門。
  • 地點:國家、城市、地區及街道地址。
  • 日期與時間:「August 31, 2025」、「Q3 2025」或「the quarter ended August 31」。
  • 事件:財報電話會議、產品發表會、研討會及服務中斷。
  • 產品:產品名稱、型號及 SKU。
  • 數值:貨幣、百分比及數量。

請看以下這個可能出現在財報中的句子:

Yogesh Gupta discussed Progress Software's results for the quarter ended August 31, 2025.

經過 NER 處理後,同一個句子會帶有明確的標籤:

[Yogesh Gupta](PERSON) discussed [Progress Software](ORGANIZATION)'s results for the quarter ended [August 31, 2025](DATE).

文字本身並沒有改變,新增的是系統對這些詞語所代表內容的理解。這些資訊可以與原始文字及其 embedding 一起,以中繼資料的形式儲存。NER 會依據上下文進行分類:在這個句子中,即使「Progress」在其他上下文中可能代表前進,系統仍能判斷它指的是一家公司。

為什麼 NER 對 RAG 管線很重要?

典型的 RAG 管線會將文件切分成多個區塊,為每個區塊轉換成 embedding,然後將所有內容儲存在索引中。接著,語意搜尋會依據意義,將查詢與索引中的內容進行比對。這種方式很適合處理概念性問題,但單靠相似度可能會模糊重要細節。不同公司和季度的財報在語意上都可能十分相似,即使其中只有一份包含使用者想找的資訊。

NER 增加了第二個互補的訊號。當系統在擷取資料時偵測實體,並將其儲存為索引中繼資料後,RAG 系統便能在查詢時以多種方式使用這些資訊:

功能可實現的用途
實體篩選將搜尋範圍限制在提及特定人物、公司、產品或日期的內容區塊。
檢索精準度區分主題相似、但涉及不同實體的文件。
消歧區分作為組織的「Progress」與日常用語中的「progress」。
自動完成使用者輸入查詢時,從索引中的已知實體提供建議。

假設知識庫中包含數年的季度報告,而使用者提出:「Yogesh Gupta 在 Q3 2025 報告中對 AI 有何看法?」僅使用 embedding 的搜尋,可能會找出多個季度中與高階主管和 AI 相關的段落。加入 NER 中繼資料後,系統也能知道哪些區塊提及人物「Yogesh Gupta」以及期間「Q3 2025」,因此可以據此調整結果的權重或進行篩選。

NER 並不是要取代 embeddings。Embeddings 掌握整段內容的意義,而 NER 則標記其中提及的個別人物、公司和日期。兩種訊號搭配使用時,效果最佳。

NER 如何提供更好的回答?

當主題本身與主體的身分同樣重要時,實體辨識能力最能發揮效益。以下是我們認為差異最明顯的情境。

關於特定組織的問題。 如果使用者詢問:「哪些合約提到 Acme Corp?」,語意搜尋可能會輕易找出涉及類似產業、類似公司的合約。組織篩選功能則能將結果縮小至確實出現 Acme Corp 的文件。

對日期敏感的財務查詢。 指引、定價和政策會隨時間變更。將「August 31, 2025」辨識為日期,可以避免系統將不同報告期間的數據混在同一個回答中。

人物查詢。 人名本身包含的語意資訊很少,因此 embeddings 往往無法區分兩位高階主管。人物實體能讓「Yogesh Gupta 對收購有何看法?」這類問題對應到正確的發言者。

相似或容易混淆的名稱。 產品名稱、專案代號和簡短的公司名稱,經常與一般詞彙重疊。將它們分類為實體,可以排除不相關的段落,避免這些內容被放入傳送給 LLM 的上下文中,直接提升生成回答的品質。

NER 如何協助自動建立知識圖譜

NER 能解鎖的其中一項有趣功能是知識圖譜。知識圖譜會將實體表示為節點,並將實體之間的關係表示為邊。在前面的例句中,「Yogesh Gupta」和「Progress Software」會成為節點,而關係擷取步驟則會在兩者之間加入「is CEO of」等關係。

當這項擷取作業套用至整個知識庫時,分散在不同文件中的資訊就能串聯成一個可導覽的圖譜。如此一來,系統便能回答需要追蹤關係,而不只是比對單一段落的問題。

Progress Agentic RAG 中的 NER

Progress Agentic RAG 解決方案會在資料擷取過程中自動執行實體偵測。當我們將資源上傳至 Knowledge Box 時,平台會在內容中辨識涵蓋人物、組織、日期、事件、地點等資訊的16 種內建實體類型。我們也可以針對特定領域的詞彙,自訂實體類型。

如需進一步自訂,Graph Extraction agent 可讓我們描述所關注的實體與關係,並提供引導擷取作業的範例。例如,法律團隊可以定義原告、被告、合約和條款,讓擷取出的實體符合其領域需求,而不是只使用一般類別。

這種區分正是提升搜尋精準度的關鍵。將原告和被告設為不同類型後,團隊就能只找出特定公司作為被告的訴訟文件;這是單一的 PERSON 或 ORGANIZATION 標籤無法表達的資訊。合規團隊也能獲得相同效益,例如對應內部法規代碼和控制項 ID,讓針對單一控制項的問題只回傳受其規範的紀錄,而不是所有讀起來像政策內容的資料。

總結

Named Entity Recognition 能將非結構化文字中隱藏的人名、組織、日期和產品,轉換為結構化中繼資料。在 RAG 管線中,這些中繼資料會與 embeddings 搭配使用,以提升篩選和檢索的精準度、支援以實體為基礎的自動完成、實現匿名化,並為知識圖譜奠定基礎。Progress Agentic RAG 解決方案會在資料擷取時自動處理所有這些工作。

如要了解實體偵測如何套用至您自己的文件,歡迎與 Progress AI 專家預約現場示範,或開始免費試用,將檔案上傳至 Knowledge Box。

常見問題

NER 與關鍵字擷取有什麼不同?

關鍵字擷取會找出最能概括文件主題的詞組,例如「financial results」或「revenue guidance」。NER 則會找出特定提及內容,並將其分類,例如將「Yogesh Gupta」標記為人物,將「August 31, 2025」標記為日期。簡單來說,關鍵字描述文件的主題,而實體則指出文件涉及哪些人事物。

NER 會取代 RAG 系統中的 embeddings 嗎?

不會。Embeddings 掌握整段內容的意義,這正是語意檢索得以運作的原因。NER 則標記該段落中的實體。強大的 RAG 管線會使用 embeddings 尋找相關內容,並在查詢取決於確切名稱或日期時,利用實體中繼資料進行篩選和排序。

NER 能辨識產品代碼或內部專案名稱等自訂、特定領域的實體嗎?

可以。除了內建類別之外,NER 系統也能設定為辨識自訂實體類型。使用 Progress Agentic RAG 解決方案時,我們可以為 Graph Extraction agent 定義自己的實體和關係,並提供描述與範例,協助平台區分內部專案名稱與一般文字。

文章來源: What Is Named Entity Recognition (NER) in RAG?

You cannot copy content of this page