← 返回博客解決方案

政策文件如何變成大模型可理解的數據

一家市級人才服務集團營運嘅區域人才政策諮詢平台,將海量政策文件做結構化同數據化處理,精準提取發布單位、申請條件、補貼標準等政策要素,透過混合式檢索同向量化嵌入等大模型『讀得明、答得準』,並整合到線上小程序同線下實體展廳。

OntiCards 團隊·2026-01-09·7 分鐘閱讀
政策文件如何變成大模型可理解的數據

一家市級人才服務集團,營運住面向區域嘅人才政策諮詢平台。佢面對一個睇落簡單、實情棘手嘅問題:政策文件浩如煙海,而市民同企業真正需要嘅,係「我啱邊條政策、攞到幾多補貼、點樣申請」。而家,呢啲答案正在由「人工翻文件」變成「大模型即問即答」。

背景與痛點

人才政策天然分散喺唔同部門:人社、科技、住建、稅務……每一類政策都有獨立嘅發布渠道、申報窗口同更新節奏。對普通用戶嚟講,政策內容「搵唔到、睇唔明、用唔上」係常態;對諮詢平台嚟講,壓力一樣咁大——政策文件海量,關鍵要素嘅提取長期依賴人工,工作人員要喺大量原文入面搵出發布單位、申請條件、補貼標準、申報時限等要素,再轉述畀諮詢者。呢個唔單止效率低,而且口徑難統一,同一份政策喺唔同諮詢入口可能得到唔同答案。

行業方向已經明確。國家層面發布嘅《政務領域人工智能大模型部署應用指引》提出,政務部門應該圍繞智能問答、輔助辦理、政策服務直達快享等高頻場景探索大模型應用,整合業務資源同知識庫,利用自然語言理解、檢索增強生成(RAG)同知識圖譜等技術提供便捷嘅在線諮詢。關鍵前提係:大模型要「讀得明」政策,政策數據必須先被結構化、標準化——呢個正正係呢間人才服務集團需要解決嘅問題。

我哋點樣做

方案架構總覽
方案架構總覽

項目嘅核心思路,係將「畀人睇嘅政策原文」轉成「畀機器理解嘅政策數據」,再圍繞呢啲數據構建諮詢服務。整體分三步。

第一步:政策要素嘅精準提取。 對政策文件進行結構化同數據化處理,用大模型自動識別並提取政策要素——發布單位、申請條件、補貼標準、申報時限、適用人群等。過去呢啲要素散落喺長篇原文入面,靠人工逐條摘錄;而家由模型批量抽取,再經人工校驗後入庫,形成結構化嘅政策知識庫。

第二步:政策信息嘅標準化同向量化。 提取出嚟嘅要素按統一規範組織,確保字段口徑一致、符合大模型嘅理解要求。隨後透過大模型對數據進行清洗同向量化嵌入,將每一條政策轉化為語義空間入面嘅向量,為之後嘅檢索打好基礎。

第三步:混合式檢索同多端整合。 平台採用混合式檢索技術,支援多種檢索模式——用戶可以用自然語言發問,亦可以透過關鍵詞或條件篩選精準定位,確保唔同習慣嘅用戶都搵到所需信息。平台最終整合於線上小程序同線下實體展廳:市民喺手機上面隨時問,辦事群眾喺展廳一體機上面都得到即時、準確嘅政策諮詢答覆。

落地效果

  • 政策要素由「人工逐條摘錄」變為「模型批量提取 + 人工校驗」,錄入效率同一致性顯著提升;
  • 政策口徑喺平台內統一,唔同諮詢入口對同一政策嘅回答保持一致;
  • 線上小程序同線下展廳雙端覆蓋,諮詢由「等人工、翻文件」變為「即問即答」;
  • 諮詢人員由重複問答入面解放出嚟,將精力集中喺複雜疑難問題嘅處理上面。

經驗沉澱:從項目到 OntiCards

呢個項目驗證咗一件事:政策諮詢類應用嘅成敗,唔喺模型參數大小,而喺數據係咪被整理成模型可以理解嘅樣。要素提取、口徑統一、向量化嵌入、混合檢索——每一步都係喺做「數據治理」,而唔係「模型調優」。當政策變成結構化嘅、帶語義嘅數據資產,大模型嘅能力先至真正釋放。

呢啲經驗沉澱落嚟,成為 OntiCards 喺政務同公共服務領域嘅解決方案。政策要素同我哋嘅數據卡片理念不謀而合:卡片將業務對象(好似「一項政策」)嘅字段、口徑、關係顯式定義出嚟,問數引擎喺呢個基礎上面回答自然語言問題。政策諮詢、辦事指南、申報條件呢類場景,本質上都係「知識結構化 + 自然語言問答」,正正係 OntiCards 擅長處理嘅問題。歡迎訪問 OntiCards 官網 了解更多。

解決方案

對 OntiCards 感興趣?