chiefautism

privacy-parser

chiefautism

Reverse of OpenAI Privacy Filter: same 1.5B model, returns PII as structured spans instead of masking.

AI 简介

Privacy Parser 是一个用于从文本中精准识别并结构化提取个人身份信息(PII)的开源工具,基于 OpenAI Privacy Filter 的 1.5B 模型权重实现反向功能。它不进行脱敏掩码,而是输出带类型标签(如 private_email、account_number)和字符位置的结构化 PII 区间。采用 Hybrid 架构:结合大模型 BIOES 序列标注、Viterbi 解码、跨词合并及正则回退机制,在 CPU 上实现约 600ms 延迟与 0.929 F1 分数。适用于数据合规审计、泄露日志分析、第三方数据风险评估等需全面发现原始 PII 的场景。

Python
Apache License 2.0
403
Stars
34
Forks
393
Watchers
1
Issues

Star 增长

今日0
近 7 天0
近 30 天0
综合评分44.63
默认分支main