這個模型是怎麼誕生的?
OpenAI 開源了一顆「會分辨個資的小模型」,但它不認得台灣
2026 年初,OpenAI 釋出 privacy-filter —— 一顆 50M active 參數(MoE 1.5B 總參數)的個資辨識專用模型,採雙向 banded attention + BIOES Viterbi decoder,能在純 CPU 上做高速 PII 偵測。
它的設計理念非常吸引人:把「個資去識別化」這件事,從昂貴的雲端 LLM call,下放到本地能跑的小模型。
但問題是:它只認得 8 種以英文世界為主的個資類別。對「身分證字號 A123456789」、「健保卡號 0000-1234-5678」、「LINE ID」、「車牌 ABC-1234」、「統一編號」這些台灣每天都在文件裡流動的資料完全沒概念。

我們做了三件事

盤點台灣特有 PII 類別
從身分證、健保卡、戶號、軍人證號、醫事字號、PTT 帳號、LINE ID、車牌、駕照、護照……整理出 19 類涵蓋政府、金融、醫療、企業內部常見格式的 taxonomy。

建構真實場景訓練集
18 萬筆訓練資料,其中 9 萬筆來自真實台灣 PDF 文件(公開報告、教科書、專利、新聞),透過 Qwen3-27B 進行細粒度標註並做 IoU 軟去重,避免模型只會背造句、不會看真實文件。

Fine-tune 並完全開源
釋出 privacy-filter-tw 與對應的評測集 ,Apache 2.0,模型權重、訓練資料、評測腳本全部公開可審視。
我們把 OpenAI 一顆通用的小工具,調教成一顆真的「看得懂台灣文件」的小工具,並且讓它可以裝進你自己的機器,不需要送到任何雲端。
可以對哪些客戶產生哪些價值?


核心價值
-
50M active 參數:在一般 CPU 上即可推論,不需要 GPU 機房
-
19 類台灣 PII:姓名、電話、Email、地址、URL、日期、銀行帳號、機密憑證 | 身分證、健保卡、統一編號、護照、駕照、車牌、戶號、LINE ID、PTT 帳號、醫事字號、軍人證號等繁中世界特有格式全覆蓋
-
本地部署:資料完全不出客戶內網,無雲端 API 依賴
-
Apache 2.0:可自由商用、可二次微調、可程式碼審查
-
單一 forward pass + Viterbi 解碼:毫秒級延遲,可嵌入即時管線
-
公開評測透明可驗證:`tw-PII-bench` 短文件 F1 89.3% / 中文件 68.8%

使用場景

雲端 LLM 安全代理層
「我們希望業務同仁能用 ChatGPT 加速文書處理,但會把整份報價單貼上去。」
在公司端架設一個輕量 proxy,所有送往 OpenAI / Anthropic 的訊息先經過 `privacy-filter-tw` 過濾,把客戶姓名、電話、帳號替換成標籤,LLM 回覆後再 mapping 回去。員工無感、合規部門安心。

RAG 知識庫建檔前處理
「我們要把過去十年的客服 ticket 餵進 vector DB,但裡面有大量個資。」
在 ingestion pipeline 中加一個 step:每份文件先過 PII filter,用標籤取代敏感資訊再做 embedding。索引可以全公司搜尋,但不會在向量裡留下任何身分證或電話。

第三方資料外送的合規關卡
「我們要把客戶資料給合作的廣告投放商分析,但法務不准。」
把外送資料先過一遍 PII 遮罩,保留行為與分群所需的結構,去掉個人識別資訊。一份「能用但匿名」的資料集,合作流程不再卡關。

文件自動審閱 / 律師事務所
「我們每天要把客戶寄來的合約掃成可以 review 的版本,個資要塗黑。」
PDF 上傳 → OCR → PII 偵測 → 自動生成已遮罩的可分享版本。原本一份文件人工塗黑要 30 分鐘,現在 30 秒。

醫療 / 健保資料研究
「我們要把病歷做去識別化釋出給研究團隊使用。」
針對醫療場景的姓名、身分證、健保卡號、聯絡電話、地址做自動偵測,搭配人工複核,符合衛福部去識別化規範。

Log / 通報系統脫敏
「除錯時的 production log 不能直接寄給工程師,裡面常常夾帶用戶資料。」
在 log shipping pipeline 中即時過濾,Sentry / Datadog 收到的訊息已經去識別化

履歷 / 應徵者資料前處理
「我們想用 AI 篩履歷,但不希望 AI 看到姓名、學校來判斷(避免偏誤)。」
履歷進系統時先遮罩姓名、聯絡方式、學校、地址,讓 AI 真的只看技能與經歷


