您的工程師一再到兩套彼此不一致的系統裡核對同一件事:料號埋在自由文字備註中,同一家供應商有三種寫法。AI 該用檢索找出答案,還是把答案建成模型,取決於兩個這週就能估出來的數字:這項查詢多常發生,以及每次要花多久。

簡單來說

RAG(檢索增強生成)起步較快。先將紀錄轉成嵌入向量,檢索出最接近的結果,再由語言模型提出建議答案,交由人員確認。

企業本體(business ontology)是一套共用模型,描述企業處理的各種事物,例如元件、驗證資格、製造商與客戶,以及連結它們的規則。它以虛擬知識圖譜的形式對應到既有資料庫上,能回答精確的問題,同時資料仍留在來源系統中。

RAG 的建置成本較低;本體(ontology)的單次查詢成本較低。哪一種勝出,由查詢量決定。

說明插圖:RAG 還是企業本體?選擇之前,先算清楚查詢次數

經過對應的本體能為重複查詢帶來什麼

  • 精確比對變成查詢,而不是人工審閱。 符合規則的比對結果會自動回傳;人員只需審閱需要判斷的部分。
  • 現有軟體照常運作。 只要 ERP 或 PLM 背後的資料庫能透過支援的連線存取,對應層就能讀取資料,不會更動任何紀錄。
  • 下一個自動化能從更前面的起點出發。 第二個工作流程或 AI 代理可沿用已議定的定義,只需針對新資料或新規則補上對應。

FAIS 打造的正是這一層:建在您現有系統之上的基礎本體。您的團隊只需定義一次「核准零件」或「同一製造商」,上層的各項自動化都會讀取這套定義。

一個已上線案例的前後對比

在一篇於 2026 年 3 月 20 日提交至 arXiv 的論文中,來自 Politecnico di Milano、Quantia Consulting 與 Thales Alenia Space 的研究人員介紹了一套工具,能告訴衛星電路板設計人員某個電子元件是否已通過驗證。

過去,設計人員得手動搜尋兩個資料庫:一個是有數萬筆資料的 PLM 資料庫,另一個是人工維護、有數千筆資料的驗證資格目錄。料號散落在自由文字備註裡,製造商名稱也有好幾種寫法。

現在,兩個資料庫都透過 Ontop 對應成一個虛擬知識圖譜。查詢會自動回傳直接比對與相似度比對的結果;向量搜尋則提出「替代」驗證資格,交由設計人員審閱。一套地端部署的 GPT-OSS-120B 模型從 466 個製造商名稱產生了 50 條正規化規則,專家在一場 2 小時的工作坊中修正了其中 9 條。Ontop lens 在查詢時套用這些規則,因此原始名稱完全不受更動。

模型也擷取了料號,每一筆都與 PLM 資料庫比對核實;例外情況由人員處理,主要是約 2% 在文字中缺少料號的驗證資格。驗證工作只花了專家幾個小時,人工作業則估計需要數週。論文提交時,約有 50 位使用者可以存取,評估仍在進行中。

投入曲線在哪裡交會

作者估算了建置投入與每個元件的處理投入(不含硬體與能源):人工審閱不需建置,每個元件約 40 人分鐘;RAG 建置約需 10 人日,每個元件 15 分鐘;知識圖譜建置約需 60 人日,每個元件 5 分鐘。人工審閱只在約 200 個元件以內佔優勢。與人工審閱相比,元件數超過 5,000 個時,知識圖譜可省下 70% 以上的工作量;達到 10,000 個時,可省下 80% 以上。

論文並未說明 RAG 與知識圖譜在哪一點交會,因此我們自行計算,並假設 1 人日為 8 小時(論文未定義這一點):(60 − 10) 人日 × 480 分鐘 ÷ (15 − 5) 分鐘 ≈ 2,400 個元件。以相同假設,也能重現論文中 200 個元件的數字。

RAG 在精確比對上具有競爭力:在 675 個元件上,其 GPT 版本與已上線流程的一致性,在直接比對上 F1 達 92.07%,在替代項目上則降至 61.88%。作者預期更好的模型會把損益平衡點推向更高的查詢量,因此請把 2,400 視為當下的快照。

如何計算您自己的查詢

這只是一家航太公司、一套只含兩個實體的簡單本體:請套用方法,而不是照搬結果。挑選一項重複發生的跨系統核對,寫下:

  • 一年發生幾次;
  • 目前每次要花幾分鐘,包括追問同事的時間;
  • 答錯的代價是什麼;
  • 有多少比例的案例遵循精確規則。

以一家台灣代工製造商為例:工程師要把客戶每份新的物料清單,逐行與 ERP 料件主檔及該客戶的核准零件清單比對。有了經過對應的模型,精確比對的結果會以查詢直接回傳,工程師只需審閱有差異的那幾行。

把次數乘以分鐘數。如果總量不大,或規則還不清楚,就先從檢索著手;作者發現 RAG 很適合快速進行概念驗證。如果次數達到數千次,而且大多數答案都遵循規則,本體較高的建置成本很可能透過更便宜的單次查詢回收。

FAIS 會怎麼建置

我們只對應單一問題所需的資料來源,並與負責維護資料的人員議定權威欄位與比對規則。由模型提出資料清理規則,再由這些專家審核。不確定的比對結果交給指定的審閱人。為第一項查詢建立的模型,會成為下一個工作流程的基礎。

重點:在這項查詢旁寫下每年次數與每次核對所需的分鐘數。這兩個數字會告訴您該先建置什麼。

資料來源

  1. LLM-Enhanced Semantic Data Integration of Electronic Component Qualifications in the Aerospace Domain
  2. [2603.20094] LLM-Enhanced Semantic Data Integration of Electronic Component Qualifications in the Aerospace Domain
  3. Introduction | Ontop
  4. Lenses | Ontop

營運團隊常見問題

企業本體是一套共用模型,描述企業處理的各種事物,例如元件、驗證資格、製造商與客戶,以及連結它們的規則。將它對應到既有資料庫上之後,就能回答精確的問題,同時資料仍留在來源系統中。

什麼情況下,RAG 是較好的第一步?

當查詢不常發生,或比對規則仍不明確時,就選擇 RAG。它所需的建置投入很少,在這項航太研究中約需 10 人日,作者也發現它很適合快速進行概念驗證。

查詢量達到多少,企業本體才能回本?

根據該研究的投入估算,並假設 1 人日為 8 小時,知識圖譜在約 2,400 個元件時超越 RAG。請把這個數字視為當下的快照,並計算您自己每年的查詢次數,以及每次核對所需的分鐘數。