top of page

看得懂台灣的
個資守門員
privacy-filter-tw

一顆能在本地端 CPU 跑、認得 19 類台灣個資的小模型。

讓你能放心把任何文件丟給雲端 LLM。

封面圖.png

這個模型是怎麼誕生的?

OpenAI 開源了一顆「會分辨個資的小模型」,但它不認得台灣

 

2026 年初,OpenAI 釋出 privacy-filter —— 一顆 50M active 參數(MoE 1.5B 總參數)的個資辨識專用模型,採雙向 banded attention + BIOES Viterbi decoder,能在純 CPU 上做高速 PII 偵測。

 

它的設計理念非常吸引人:把「個資去識別化」這件事,從昂貴的雲端 LLM call,下放到本地能跑的小模型。

 

但問題是:它只認得 8 種以英文世界為主的個資類別。對「身分證字號 A123456789」、「健保卡號 0000-1234-5678」、「LINE ID」、「車牌 ABC-1234」、「統一編號」這些台灣每天都在文件裡流動的資料完全沒概念。

ChatGPT Image 2026年6月10日 下午10_21_57.png

我們做了三件事

1.png

盤點台灣特有 PII 類別

從身分證、健保卡、戶號、軍人證號、醫事字號、PTT 帳號、LINE ID、車牌、駕照、護照……整理出 19 類涵蓋政府、金融、醫療、企業內部常見格式的 taxonomy。

icon.png

建構真實場景訓練集

18 萬筆訓練資料,其中 9 萬筆來自真實台灣 PDF 文件(公開報告、教科書、專利、新聞),透過 Qwen3-27B 進行細粒度標註並做 IoU 軟去重,避免模型只會背造句、不會看真實文件。

3.png

Fine-tune 並完全開源

釋出 privacy-filter-tw 與對應的評測集 ,Apache 2.0,模型權重、訓練資料、評測腳本全部公開可審視。

我們把 OpenAI 一顆通用的小工具,調教成一顆真的「看得懂台灣文件」的小工具,並且讓它可以裝進你自己的機器,不需要送到任何雲端。

可以對哪些客戶產生哪些價值?

手機版.png
受眾.png

核心價值

  • 50M active 參數:在一般 CPU 上即可推論,不需要 GPU 機房

  • 19 類台灣 PII:姓名、電話、Email、地址、URL、日期、銀行帳號、機密憑證 | 身分證、健保卡、統一編號、護照、駕照、車牌、戶號、LINE ID、PTT 帳號、醫事字號、軍人證號等繁中世界特有格式全覆蓋

  • 本地部署:資料完全不出客戶內網,無雲端 API 依賴

  • Apache 2.0:可自由商用、可二次微調、可程式碼審查

  • 單一 forward pass + Viterbi 解碼:毫秒級延遲,可嵌入即時管線

  • 公開評測透明可驗證:`tw-PII-bench` 短文件 F1 89.3% / 中文件 68.8%

19個new.png

使用場景

4.png

雲端 LLM 安全代理層

「我們希望業務同仁能用 ChatGPT 加速文書處理,但會把整份報價單貼上去。」

在公司端架設一個輕量 proxy,所有送往 OpenAI / Anthropic 的訊息先經過 `privacy-filter-tw` 過濾,把客戶姓名、電話、帳號替換成標籤,LLM 回覆後再 mapping 回去。員工無感、合規部門安心。

5.png

RAG 知識庫建檔前處理

「我們要把過去十年的客服 ticket 餵進 vector DB,但裡面有大量個資。」

在 ingestion pipeline 中加一個 step:每份文件先過 PII filter,用標籤取代敏感資訊再做 embedding。索引可以全公司搜尋,但不會在向量裡留下任何身分證或電話。

6.png

第三方資料外送的合規關卡

「我們要把客戶資料給合作的廣告投放商分析,但法務不准。」

把外送資料先過一遍 PII 遮罩,保留行為與分群所需的結構,去掉個人識別資訊。一份「能用但匿名」的資料集,合作流程不再卡關。

7.png

文件自動審閱 / 律師事務所

「我們每天要把客戶寄來的合約掃成可以 review 的版本,個資要塗黑。」

PDF 上傳 → OCR → PII 偵測 → 自動生成已遮罩的可分享版本。原本一份文件人工塗黑要 30 分鐘,現在 30 秒。

icon8.png

醫療 / 健保資料研究

「我們要把病歷做去識別化釋出給研究團隊使用。」

針對醫療場景的姓名、身分證、健保卡號、聯絡電話、地址做自動偵測,搭配人工複核,符合衛福部去識別化規範。

9.png

Log / 通報系統脫敏

「除錯時的 production log 不能直接寄給工程師,裡面常常夾帶用戶資料。」

在 log shipping pipeline 中即時過濾,Sentry / Datadog 收到的訊息已經去識別化

10.png

履歷 / 應徵者資料前處理

「我們想用 AI 篩履歷,但不希望 AI 看到姓名、學校來判斷(避免偏誤)。」

履歷進系統時先遮罩姓名、聯絡方式、學校、地址,讓 AI 真的只看技能與經歷

20251125_zhiting_首頁畫面.png

想試用?

企業導入 / 客製訓練:歡迎聯繫我們 marketing@ap-mic.com 討論部署與微調細節

bottom of page