数据隐私
本地数据脱敏工作台
面向审计资料的本地数据保护工作台,用双引擎、可维护规则和确定性伪名化连接预览、执行与审计留痕。
- 项目范围
- CLI + Windows 桌面应用
- 当前状态
- 已完成
- 我的角色
- 独立开发者

技术栈
- Python
- Polars
- PyQt5
- YAML 规则
- 确定性伪名化
项目解决什么
审计资料往往同时包含表格、JSON、邮件、PDF 和 Word,人工处理既容易遗漏,也难以让同一个人或员工标识在不同文件中保持可追踪的替身。ITA-Maskit 把规则选择、命中预览、本地处理和版本化审计记录串成一条工作流,让敏感值离开原始文件后仍能保留必要的关联关系。
核心功能
- 通过 CLI 或 Windows GUI 选择规则并批量处理
- 在本地处理表格、JSON、邮件、PDF 和 Word
- 正式写出前预览规则命中与样例变化
- 选择遮盖或确定性伪名化
- 使用人员清单补足姓名与员工标识匹配
- 查看统计、输出位置和版本化审计日志
使用流程
- 选择文件、规则集和可选人员数据
- 预验证命中而不写出结果
- 在本地执行遮盖或确定性伪名化
- 查看统计、输出路径和审计日志
使用者可以通过 CLI 或 Windows GUI 选择文件、规则集和人员清单。系统先预览规则命中与样例变化,确认后才在本地批量写出结果;统计、输出位置和版本化审计日志留在同一条处理边界内。
项目亮点
用双引擎覆盖表格与文档
按列处理的表格引擎适合表格数据,可在字段边界上应用规则;全文文档引擎则扫描 JSON、邮件、PDF、Word 等文档内容。两条路径都在本地运行,并沿用同一套预览与规则决策,让跨格式的批量审计资料处理保持可检查。
把脱敏规则变成可维护的数据
规则以 YAML 保存字段映射、匹配策略、遮盖模板和伪名化模板,并把规则版本与处理代码分开。业务规则变化时只需更新经过校验的数据配置;预览和正式执行复用同一版本,减少规则漂移。
保留跨文件关联而不暴露原值
系统先按字段策略归一化输入,再使用用户提供的 pepper 做域分离的 HMAC。相同的归一化值在不同文件中会得到稳定的确定性别名,人员清单还可以补足姓名和员工标识的匹配;原始值不会作为别名暴露,pepper 也只停留在运行配置中。
系统架构
同一版本的规则先驱动预览,再分别进入按列的表格引擎或全文的文档引擎。遮盖或确定性伪名化完成后,系统输出处理结果、统计和版本化审计日志;整个过程不需要把审计文件发送到外部服务。
项目边界
这是一个面向审计资料的本地处理工具,不宣称通过认证或替代部署环境中的访问控制、密钥管理与加密存储;截图使用仓库的脚本演示数据。确定性伪名化不是加密,图片 OCR 与保持版式的 PDF 脱敏仍处于 beta。