脱敏处理:对文件进行敏感信息识别、分类和脱敏处理,支持多种脱敏策略、输出格式和脱敏后代词反向还原
Scanned 9/11/2026
Install to Claude Code
npx -y skills add sunyifeisb-art/legalwork --skill redaction --agent claude-codeInstalls into .claude/skills of the current project.
Are you the author of Redaction?
Add the live security badge to your README — it updates automatically with every re-scan.
[](https://www.skillsdirectory.com/skills/sunyifeisb-art-redaction)More formats (shields.io, HTML) on the badges page.
---
id: redaction
name: 脱敏处理
description: 脱敏处理:对文件进行敏感信息识别、分类和脱敏处理,支持多种脱敏策略、输出格式和脱敏后代词反向还原
version: 0.3.0
---
# 数据脱敏处理
## 概述
| 项目 | 内容 |
|------|------|
| **能力名称** | 数据脱敏处理 |
| **能力编号** | 01 |
| **核心功能** | 对法律文书、合同、证据材料等文件中的敏感信息进行识别、分类、脱敏处理,生成脱敏后的文档和处理报告;支持同一主体多称谓统一映射,并支持基于映射文件对 AI 二次分析结果进行反向还原 |
| **适用场景** | 外部发送前的文件脱敏、内部法律分析中的中间脱敏、公开发布前的全文脱敏、诉讼材料交换中的隐私保护、数据合规审查中的敏感信息处理、AI 分析成果的反向还原 |
| **关键法源** | 《个人信息保护法》第4条(个人信息定义)、第6条(最小必要原则)、第72条(匿名化处理);《数据安全法》第21条(数据分类分级);《民法典》第1034条(隐私权与个人信息保护);《最高人民法院关于适用〈中华人民共和国民事诉讼法〉的解释》第520条(裁判文书上网的隐名处理);《最高人民法院关于人民法院在互联网公布裁判文书的规定》第8-11条(隐名处理规则) |
| **输出物** | 脱敏后文档(原始格式保留)、脱敏处理报告(含敏感信息位置、类型、处理方式)、敏感信息统计表、**mapping.enc 映射文件(含实体聚类信息,用于反向还原)** |
| **关联能力** | 合规审查(前置敏感信息识别)、证据目录生成(脱敏后证据编排)、法律文书起草(脱敏后文本输出)、事实抽取(脱敏后的事实提取)、**AI 二次分析成果的反向还原** |
## 法律声明
> **重要提示:**
> 1. 本技能提供的脱敏处理为辅助性工具,脱敏后的文档仍需人工复核,确保敏感信息已被充分处理。
> 2. 不同场景对脱敏程度的要求不同,用户应根据实际需要选择合适的脱敏策略。过度脱敏可能导致文档失去使用价值,脱敏不足可能导致隐私泄露风险。
> 3. 匿名化(Anonymization)与去标识化(De-identification)在法律效果上存在本质区别。匿名化后的信息不再属于个人信息,而去标识化后的信息仍可能通过技术手段重新识别个人主体。用户应根据《个人信息保护法》的相关要求选择适当的处理方式。
> 4. 涉及国家秘密、商业秘密、未成年人信息、金融账户信息等特殊类型敏感信息时,应遵守相应的专门法律法规。
> 5. AI辅助脱敏不能完全替代人工判断,特别是涉及语义语境分析、间接识别风险判断等需要专业经验的领域。
## 一、核心概念体系
### 1.1 敏感信息分类体系
#### 第一类:个人身份信息(Personally Identifiable Information, PII)
| 子类 | 典型数据 | 识别特征 | 风险等级 | 法律依据 |
|------|----------|----------|----------|----------|
| **直接标识符** | 姓名、身份证号、护照号、社保号、驾驶证号 | 格式固定(如身份证18位、护照9位字母数字组合) | **极高** | 《个人信息保护法》第28条(敏感个人信息) |
| **联系方式** | 手机号、固定电话、邮箱地址、通信地址 | 格式规律(手机号11位数字、邮箱含@符号) | **高** | 《个人信息保护法》第4条 |
| **生物特征** | 人脸图像、指纹、虹膜、声纹、基因数据 | 图像文件或特定编码格式 | **极高** | 《个人信息保护法》第28条(敏感个人信息) |
| **金融信息** | 银行卡号、信用卡号、支付宝/微信账号、证券账户 | 卡号长度16-19位,通常分段显示 | **极高** | 《个人信息保护法》第28条;《反洗钱法》相关条款 |
| **医疗健康** | 病历、诊断记录、体检报告、用药记录、医保卡号 | 含医学术语、医疗机构名称、诊断编码 | **极高** | 《个人信息保护法》第28条;《基本医疗卫生与健康促进法》 |
| **位置轨迹** | GPS坐标、常住地址、行踪轨迹、IP地址 | 经纬度格式、地址文本、IP四段数字 | **中高** | 《个人信息保护法》第28条(行踪信息为敏感信息) |
| **网络标识** | 设备MAC地址、IMEI码、IMSI码、Cookie ID | 特定格式(MAC为16进制12位) | **中** | 《个人信息保护法》第4条;《网络安全法》 |
| **未成年人信息** | 未成年人姓名、学校、班级、家庭住址、照片 | 含年龄暗示或学校名称 | **极高** | 《个人信息保护法》第31条;《未成年人保护法》 |
#### 第二类:法律职业信息
| 子类 | 典型数据 | 识别特征 | 风险等级 |
|------|----------|----------|----------|
| **案件标识** | 案号、仲裁号、公证号、执行案号 | 格式固定(如(2024)京01民初123号) | **高** |
| **当事人信息** | 原告/被告/第三人/申请人/被申请人全称 | 公司名含"有限公司""股份公司"等后缀 | **高** |
| **代理人信息** | 律师姓名、律所名称、执业证号 | "律师""代理人""辩护人"等称谓 | **中高** |
| **司法人员** | 法官、检察官、书记员、鉴定人姓名 | "审判长""审判员""检察员"等称谓 | **中** |
| **证人信息** | 证人姓名、身份、联系方式、证言内容 | "证人""出庭作证"等关键词 | **高** |
| **鉴定机构** | 鉴定机构名称、鉴定人姓名、鉴定编号 | "鉴定中心""鉴定所""鉴定意见"等 | **中** |
#### 第三类:商业敏感信息
| 子类 | 典型数据 | 识别特征 | 风险等级 |
|------|----------|----------|----------|
| **商业秘密** | 配方、工艺、客户名单、采购渠道、定价策略 | 标注"机密""秘密""专有"等字样 | **极高** |
| **财务数据** | 营收、利润、成本、预算、审计报告 | 含金额符号、会计科目、审计意见 | **极高** |
| **合同条款** | 违约金比例、赔偿上限、排他性条款、定价条款 | 含"违约金""赔偿""独家""排他"等关键词 | **高** |
| **竞争情报** | 市场策略、产品规划、研发路线图 | 含"战略""规划""路线图"等关键词 | **高** |
| **员工信息** | 薪酬、绩效考核、人事档案、社保公积金 | 含"工资""绩效""岗位"等HR用语 | **高** |
#### 第四类:特殊保护信息
| 子类 | 法律依据 | 处理要求 |
|------|----------|----------|
| **国家秘密** | 《保守国家秘密法》 | 不得由AI处理,必须由专人按保密规定操作 |
| **军事秘密** | 《国防法》《军事设施保护法》 | 同国家秘密 |
| **商业秘密** | 《反不正当竞争法》第9条 | 脱敏处理须经权利人同意或法律授权 |
| **个人隐私** | 《民法典》第1032条 | 严格保护,非必要不处理 |
| **未成年人信息** | 《未成年人保护法》第76条 | 特别保护,原则上不得公开 |
### 1.2 脱敏策略体系
| 策略类型 | 策略名称 | 描述 | 适用场景 | 示例 | 可逆性 |
|----------|----------|------|----------|------|--------|
| **M** | 完全掩码(Full Mask) | 将敏感信息全部替换为掩码字符 | 公开发布、对外公示、裁判文书上网 | "张三"→"***" | 不可逆 |
| **P** | 部分掩码(Partial Mask) | 保留部分信息,其余掩码 | 外部发送、对方代理交换 | "张三"→"张*";"13812345678"→"138****5678" | 不可逆 |
| **T** | 令牌化(Tokenization) | 用随机令牌替换原始值,保留映射表 | 内部法律分析、多团队协作文档 | "张三"→"当事人A" | 可逆(有映射表) |
| **G** | 泛化(Generalization) | 用更宽泛的概念替代精确值 | 数据统计、趋势分析、脱敏后的研究用途 | "北京朝阳区XX路1号"→"北京市" | 不可逆 |
| **S** | 屏蔽(Suppression) | 直接删除或留空敏感信息 | 非必需的次要敏感信息 | 邮箱、备注中的电话号码→删除 | 不可逆 |
| **R** | 随机置换(Random Substitution) | 用随机值替换原始值,保持格式 | 测试数据生成、系统开发环境 | "张三"→"李四"(随机替换) | 不可逆 |
| **D** | 日期偏移(Date Shifting) | 对日期进行统一偏移 | 时间线分析中保护时间隐私 | "2024-01-15"→"2024-02-15"(偏移30天) | 不可逆(偏移量保密) |
| **E** | 加密存储(Encryption) | 用加密算法对敏感信息加密 | 内部安全存储、跨系统传输 | 原始数据→AES-256密文 | 可逆(有密钥) |
### 1.3 脱敏强度分级
| 级别 | 名称 | 策略组合 | 典型场景 | 信息安全要求 |
|------|------|----------|----------|-------------|
| **L1** | 高度脱敏 | M + S + G | 公开发布、学术研究、数据开放 | 不可逆、不可重识别 |
| **L2** | 中度脱敏 | P + S | 外部法律文书交换、对方代理文件交换 | 不可逆、风险可控 |
| **L3** | 轻度脱敏 | T + E | 内部团队协作、多部门联合办案 | 可逆(有权限控制) |
| **L4** | 名义脱敏 | R + D | 测试数据、演示数据、培训数据 | 伪匿名化 |
### 1.4 实体聚类(Entity Clustering)
为解决同一主体在文档中出现**全称、简称、代词**等多种表述时脱敏代词不一致的问题,v0.3 引入实体聚类:
| 概念 | 说明 | 示例 |
|------|------|------|
| **Canonical(规范名称)** | 聚类中采用的最完整名称 | 北京小米科技有限公司 |
| **Mention(称谓)** | 同一主体的各种表达 | 小米公司、小米科技、该公司、其、甲方 |
| **Cluster ID** | 聚类唯一标识 | company_name_cluster_001 |
| **统一 Token** | 聚类内所有 mention 使用同一脱敏结果 | COMPANY_001 / A公司 |
聚类规则:
1. 文本完全相同 → 同一聚类
2. 文本互相包含(简称 vs 全称)→ 同一聚类
3. 去除地域/组织形式后核心名称相同 → 同一聚类
4. 代词/角色词(甲方/该公司/其)按上下文归属到最近的主体聚类
## 二、操作流程
### 2.1 预处理阶段
**步骤一:文档接收与格式识别**
首先确认待处理文档的格式。支持以下格式:
- **纯文本格式**(.txt、.md):直接进行文本分析
- **办公文档格式**(.docx、.xlsx、.pptx):需要解析为结构化文本后处理,处理后保持原格式输出
- **PDF格式**(.pdf):需要提取文本层或通过OCR识别文字
- **图片格式**(.jpg、.png、.bmp):需要OCR识别后处理
- **代码文件**(.json、.xml、.csv、.html):需要解析结构后逐字段处理
在处理非文本格式时,应向用户说明格式限制,并建议优先使用文本格式以确保脱敏质量。
**步骤二:脱敏目标确认**
与用户确认以下信息:
1. **使用场景**:外部发送/内部法律分析/公开发布/数据统计?
2. **脱敏强度要求**:L1(高度)/ L2(中度)/ L3(轻度)/ L4(名义)?
3. **需要处理的敏感信息类型**:全类型处理还是仅处理特定类型(如仅处理身份证号和手机号)?
4. **是否需要保留部分信息**:如保留姓氏、保留区号等
5. **是否涉及特殊类型信息**:如国家秘密(禁止AI处理)、商业秘密(需授权)?
6. **输出格式要求**:脱敏后文档格式、是否附加处理报告
7. **映射表需求**:是否需要可逆的令牌化映射表(仅限内部场景)
### 2.2 识别阶段
**步骤三:敏感信息扫描与识别**
按照以下优先级进行全面扫描:
| 优先级 | 扫描内容 | 识别方法 |
|--------|----------|----------|
| **P0** | 结构化敏感字段 | 利用正则表达式识别格式固定的敏感信息(身份证号、手机号、银行卡号、邮箱、案号等) |
| **P1** | 语境敏感信息 | 根据上下文语义识别非格式化的敏感信息(个人姓名结合"原告""被告"等语境关键词) |
| **P2** | 间接识别信息 | 识别可能通过组合推理出个人身份的间接信息(如年龄+性别+职业+地区组合) |
| **P3** | 隐式敏感信息 | 识别隐含在段落中的敏感信息(如"家住某小区""在某某单位工作"等) |
扫描时应对每处识别出的敏感信息记录以下元数据:
- 敏感信息原文片段
- 敏感信息类型(PII/法律信息/商业信息)
- 子类型(身份证号/姓名/银行卡号等)
- 在文档中的位置(段落号、行号、字符偏移)
- 置信度评分(高/中/低)
- 是否属于特殊保护类型
### 2.3 脱敏阶段
**步骤四:选择脱敏策略**
根据场景和敏感信息类型,自动推荐脱敏策略:
| 场景 | 身份证号 | 手机号 | 姓名 | 地址 | 金额 | 案号 | 公司名 |
|------|----------|--------|------|------|------|------|--------|
| **外部发送** | P(保留前6后4) | P(保留前3后4) | P(保留姓) | G(保留城市) | G(保留万以上) | P(保留案号前段) | T(当事人A/B) |
| **内部法律分析** | T(当事人ID) | T(联系编码) | T(当事人A/B) | T(地点编码) | T(金额编号) | T(案号编码) | T(主体编号) |
| **公开发布** | M(完全掩码) | M(完全掩码) | M(完全掩码) | S(删除) | G(保留大致范围) | P(保留法院+年份) | M(完全掩码) |
| **数据统计** | S(删除) | S(删除) | S(删除) | G(保留地市级) | G(保留数量级) | S(删除) | T(分类标签) |
**步骤五:敏感信息脱敏执行**
根据选定的策略逐项执行脱敏操作。对每处敏感信息,按照以下模板记录处理记录:
```
## 脱敏处理记录
| 序号 | 敏感信息类型 | 原文片段 | 脱敏策略 | 脱敏后结果 | 位置 | 置信度 |
|------|-------------|----------|----------|-----------|------|--------|
| 1 | 姓名 | 张三 | P(部分掩码) | 张* | 第3段第2行 | 高 |
| 2 | 身份证号 | 110101199001011234 | P(保留前6后4) | 110101********1234 | 第5段第1行 | 高 |
| 3 | 手机号 | 13812345678 | P(保留前3后4) | 138****5678 | 第5段第1行 | 高 |
```
**步骤六:二次检查与交叉验证**
1. **遗漏检查**:对所有P0-P3级别的敏感信息类型进行全面交叉检查,确认无遗漏
2. **过度脱敏检查**:确认脱敏操作没有导致文档丧失使用价值(例如全部文字被掩码)
3. **上下文一致性检查**:同一上下文中的同一实体应使用一致的脱敏映射(如"张三"全文统一替换为"张*"或"当事人A")
4. **格式完整性检查**:确保脱敏后的文档格式完整,表格、列表、序号等结构未被破坏
5. **间接识别风险评估**:评估通过组合多个脱敏后信息能否重新识别个人身份
### 2.4 输出阶段
**步骤七:生成脱敏后文档**
在原始文档基础上应用脱敏操作,生成脱敏后的文档。输出格式包括:
- 脱敏后的原文档(保持原始格式)
- 纯文本格式的脱敏版本(便于后续处理)
- 标注版本(对脱敏位置进行标记,便于人工复核)
**步骤八:生成脱敏处理报告与映射文件**
脱敏处理报告应包括以下内容:
- 基本信息(处理时间、文档名称、场景类型、脱敏强度)
- 处理统计(扫描信息项数、识别敏感信息数量、已处理数量、待人工复核数量)
- 按类型统计(姓名、身份证号、手机号、地址、金额、案号、公司名等)
- 实体聚类表(同一主体的多称谓映射关系)
- 注意事项与复核建议
**映射文件(`mapping.enc`)**是反向还原的关键,包含:
- 每个敏感实体的 `original`(原始文本)和 `redacted`(脱敏后文本)
- `cluster_id` 和 `alias_of`:记录同一主体聚类关系
- `clusters` 列表:每个聚类的 canonical 名称、脱敏结果、所有 mention
### 2.5 反向还原阶段
**步骤九:AI 二次分析结果的还原**
当脱敏后的材料交给 AI 分析后,AI 输出的成果(如大事记、法律关系图、尽调报告)中会继续使用脱敏代词。通过 `mapping.enc` 可进行反向还原:
```bash
python3 redact_agent.py restore mapping.enc ai_analysis.md --output restored.md
```
还原能力:
- 将 `COMPANY_001`、`A公司` 等还原为原始公司名称
- 将 `甲方`、`该公司`、`其` 等代词还原为对应主体
- 支持直接文本输入或文件输入
- 未匹配到的 token 保留原样并输出 `unmatched` 列表
还原限制:
- 只能还原脱敏时记录在 mapping 中的实体
- AI 生成的全新代词或变体若未在 mapping 中,需要人工补充
- 反向还原不恢复不可逆脱敏(如完全掩码、PDF 涂黑)
## 三、不同场景的脱敏规范
### 3.1 法律文书对外发送场景
**场景特点**:法律文书(起诉状、答辩状、代理词、法律意见书等)需要发送给法院、对方当事人或其代理人,需要在保护敏感信息与保持文书可读性之间取得平衡。
**脱敏原则**:
- 当事人姓名:保留姓氏,名用"某"代替(如"张某某"),或使用"原告""被告"等诉讼地位替代
- 身份证号:保留前6位出生地编码和后4位,中间8位掩码(如"110101********1234")
- 手机号:保留前3位和后4位,中间4位掩码(如"138****5678")
- 地址:保留到市级行政区划级别,以下掩码或泛化
- 金额:保留数值但可适当四舍五入,或保留精确值(根据案件需要)
- 案号:保留完整案号(案号本身为公开信息)
- 公司名:保留公司名称但可省略注册号等非必要信息
- 银行账号:保留后4位,其余掩码
### 3.2 内部法律分析场景
**场景特点**:律师事务所内部、公司法务部门内部、多团队联合办案中使用的分析文档,需要在信息共享与隐私保护之间取得平衡。
**脱敏原则**:
- 优先采用令牌化策略(Tokenization),使用"当事人A""相对方B""目标公司C"等代号
- 建立令牌映射表,存储在安全的内部系统中
- 金额信息可保留精确值(内部分析需要)但使用代号关联
- 关键时间节点可保留(内部需要)但使用代号关联
- 地名可保留到区县级(内部需要)但使用代号关联
- 分析完成后,建议在最终对外版本中采用更严格的脱敏策略
### 3.3 公开发布/学术研究场景
**场景特点**:裁判文书上网、案例研究发表、法学论文引用、法律数据库收录等公开场景,隐私保护要求最高。
**脱敏原则**:
- 当事人姓名:完全掩码(使用"***"或"当事人甲/乙")
- 身份证号、手机号、银行账号:完全掩码或删除
- 地址:删除精确地址,保留到城市级别(如需地域分析)
- 公司名:完全掩码(如"某科技公司""某房地产公司")
- 金额:保留数值但不关联具体主体,或仅保留数量级
- 案号:保留案号(案号为公开信息),但可考虑去除当事人姓名与案号的关联
- 时间:可保留但注意防止通过时间线倒推当事人身份
- 特殊职业信息:删除,防止通过职业+地域+年龄的组合推理出身份
### 3.4 证据交换场景
**场景特点**:诉讼或仲裁中的证据交换,涉及双方或多方之间的证据披露,需要在满足证据开示要求与保护商业秘密/隐私之间取得平衡。
**脱敏原则**:
- 涉及对方当事人的直接信息:可不脱敏(对方已掌握自身信息)
- 涉及第三方个人信息:严格脱敏
- 涉及己方商业秘密:申请保密处理或采用保密证据程序
- 涉及国家秘密:不得在证据交换中披露,应按相关程序处理
- 涉及大量个人信息的证据(如员工名册、客户清单):建议申请仅披露摘要或统计信息
- 法院或仲裁庭要求披露的:应在保密令(Confidentiality Order)保护下披露
### 3.5 数据合规审查场景
**场景特点**:对业务系统中的数据处理活动进行合规审查,需要识别系统中存储、传输、处理的敏感信息。
**脱敏原则**:
- 由于审查目的就是识别敏感信息,不应先脱敏再审查
- 审查报告中如包含敏感信息示例,应采用令牌化或部分掩码
- 审查结果中的具体数据样本应泛化处理
- 涉及的个人信息应按照《个人信息保护法》的匿名化标准处理
## 四、识别规则与正则表达式参考
### 4.1 中国大陆个人信息识别规则
| 信息类型 | 格式说明 | 正则表达式参考(非精确,仅用于辅助识别) |
|----------|----------|------------------------------------------|
| **身份证号** | 18位数字(含大写X) | `[1-9]\d{5}(18\|19\|20)\d{2}(0[1-9]\|1[0-2])(0[1-9]\|[12]\d\|3[01])\d{3}[\dX]` |
| **手机号** | 11位数字,以1开头 | `1[3-9]\d{9}` |
| **固定电话** | 区号-号码 | `0\d{2,3}-?\d{7,8}` |
| **邮箱** | 标准邮箱格式 | `[a-zA-Z0-9._%+-]+@[a-zA-Z0-9.-]+\.[a-zA-Z]{2,}` |
| **银行卡号** | 16-19位数字 | `\d{16,19}` |
| **案号** | 法院案号格式 | `(?\d{4})?[::]\s*[^\s]{0,10}(民初\|民终\|刑初\|刑终\|知行初\|行初\|行终\|执\|民再\|刑再)\s*\d{1,6}号?` |
| **IP地址** | IPv4格式 | `\d{1,3}\.\d{1,3}\.\d{1,3}\.\d{1,3}` |
| **车牌号** | 中国车牌格式 | `[京津冀晋蒙辽吉黑沪苏浙皖闽赣鲁豫鄂湘粤桂琼川贵云藏陕甘青宁新][A-Z][A-HJ-NP-Z0-9]{4,6}` |
### 4.2 法律场景专用识别规则
| 信息类型 | 语境关键词 |
|----------|-----------|
| **当事人姓名** | 原告、被告、第三人、申请人、被申请人、上诉人、被上诉人、再审申请人、被申请人、申请人、被执行人 |
| **代理人姓名** | 委托代理人、辩护人、诉讼代理人、特别授权、一般授权、指派、律师事务所 |
| **司法人员姓名** | 审判长、审判员、人民陪审员、书记员、法官、检察官、检察员、助理检察员 |
| **证人姓名** | 证人、出庭作证、证言、证人证言、目击证人 |
| **鉴定信息** | 鉴定机构、鉴定人、司法鉴定、鉴定意见、鉴定结论、鉴定报告 |
| **金额信息** | 人民币、元、万元、标的额、诉讼费、违约金、赔偿金、欠款、借款金额 |
## 五、质量保障
### 5.1 脱敏质量检查清单
```markdown
- [ ] 全文档扫描是否覆盖P0-P3所有级别的敏感信息?
- [ ] 是否已处理所有直接标识符(姓名、身份证号、手机号等)?
- [ ] 是否已处理所有准标识符(年龄、性别、职业、地区等可能组合推理的信息)?
- [ ] 脱敏后文档是否保持了原始格式和结构?
- [ ] 同一实体在全文中是否使用了一致的脱敏替代方案?
- [ ] 段落、表格、列表等结构是否完整?
- [ ] 是否生成了完整的脱敏处理报告?
- [ ] 是否需要人工复核标记的特殊项?
- [ ] 脱敏后的文档是否仍满足使用目的?
- [ ] 是否已评估间接重识别风险?
```
### 5.2 常见错误与防范
| 错误类型 | 典型表现 | 后果 | 防范措施 |
|----------|----------|------|----------|
| **遗漏高位敏感信息** | 只处理了身份证号,忽略了姓名和地址 | 核心隐私泄露 | 按敏感信息分类体系逐类检查 |
| **过度脱敏** | 将案号、法院名称等公开信息也脱敏 | 文档失去法律效力 | 区分公开信息与隐私信息 |
| **脱敏不一致** | 同一人在不同段落使用不同代号 | 读者困惑,文档逻辑断裂 | 建立实体-代号映射表,全文统一替换 |
| **格式破坏** | 脱敏操作导致表格、编号、结构损坏 | 文档无法使用 | 逐段检查格式完整性 |
| **间接重识别** | 多个脱敏数据的组合可推断出身份 | 匿名化失效 | 评估组合信息后进行二次脱敏 |
| **语义上下文泄漏** | 通过语境暗示了敏感信息(如"家住XX小区的当事人") | 间接暴露隐私 | 对语境进行同步脱敏 |
| **特殊格式遗漏** | 图片中的文字未识别、扫描件中的手写体未处理 | 敏感信息残留 | 对所有图文内容进行OCR处理 |
| **元数据泄漏** | 文档属性、修订记录、评论中包含敏感信息 | 隐藏信息泄露 | 清理文档元数据 |
## 六、输出模板
### 6.1 标准脱敏报告模板
```markdown
# 脱敏处理报告
## 基本信息
- 处理时间:{{处理时间}}
- 文档名称:{{文档名称}}
- 场景类型:{{场景类型}}
- 脱敏强度:{{脱敏级别}}
- 文档大小:{{原文大小}}KB → {{脱敏后大小}}KB
## 处理概况
- 扫描信息项数:{{扫描总数}}
- 识别敏感信息:{{识别数量}}处
- 实际处理:{{处理数量}}处({{处理比例}}%)
- 待人工复核:{{复核数量}}处
## 处理明细(摘要)
| 类型 | 数量 | 处理策略 |
|------|------|----------|
| 姓名 | {{数量}} | {{策略}} |
| 身份证号 | {{数量}} | {{策略}} |
| 手机号 | {{数量}} | {{策略}} |
| 地址 | {{数量}} | {{策略}} |
| 金额 | {{数量}} | {{策略}} |
| 其他 | {{数量}} | {{策略}} |
## 特殊说明
{{特殊说明内容}}
## 复核建议
{{复核建议内容}}
```
### 6.2 脱敏后文档格式规范
脱敏后的文档应保持与原文档相同的格式结构。对于脱敏修改的位置,建议使用以下标注方式:
- 掩码文本:使用 `***` 或 `[已脱敏]` 标记
- 令牌化文本:首次出现时标注 `[→当事人A]`,后续直接使用代号
- 泛化文本:在泛化值后标注 `[已泛化]`
- 删除文本:删除后标注 `[已删除]`
- 加密文本:保留 `[加密字段]` 占位符
## 七、使用示例
### 示例一:外部发送场景
**原始文本:**
> 原告张三(身份证号:110101199001011234,手机号:13812345678)与被告李四(身份证号:320102198512095678,手机号:13987654321)房屋买卖合同纠纷一案,本院于2024年1月15日立案。原告张三诉称,其于2023年6月1日与被告李四签订《房屋买卖合同》,约定原告以人民币300万元购买被告位于北京市海淀区中关村大街1号院的房屋一套。原告已支付定金50万元,但被告拒绝办理过户手续。
**脱敏后文本(部分掩码策略):**
> 原告张**(身份证号:110101********1234,手机号:138****5678)与被告李**(身份证号:320102********5678,手机号:139****4321)房屋买卖合同纠纷一案,本院于2024年1月15日立案。原告张**诉称,其于2023年6月1日与被告李**签订《房屋买卖合同》,约定原告以人民币300万元购买被告位于北京市海淀区[具体地址已脱敏]的房屋一套。原告已支付定金50万元,但被告拒绝办理过户手续。
### 示例二:内部法律分析场景
**原始文本(同上例):**
**脱敏后文本(令牌化策略):**
> 原告买方A(身份证号:ID_CARD_001,手机号:PHONE_001)与被告卖方B(身份证号:ID_CARD_002,手机号:PHONE_002)房屋买卖合同纠纷一案,本院于2024年1月15日立案。原告买方A诉称,其于2023年6月1日与被告卖方B签订《房屋买卖合同》,约定原告以人民币AMT_001万元购买被告位于北京市海淀区ADDR_001的房屋一套。原告已支付定金AMT_002万元,但被告拒绝办理过户手续。
**映射表(内部保留):**
> 买方A = 张三 | ID_CARD_001 = 110101199001011234 | PHONE_001 = 13812345678 | AMT_001 = 300 | AMT_002 = 50 | ADDR_001 = 北京市海淀区中关村大街1号院
### 示例三:公开发布场景
**原始文本(同上例):**
**脱敏后文本(完全掩码策略):**
> 原告***(身份证号:***,手机号:***)与被告***(身份证号:***,手机号:***)房屋买卖合同纠纷一案,本院于2024年1月15日立案。原告***诉称,其于2023年6月与被告***签订《房屋买卖合同》,约定原告以人民币***万元购买被告位于北京市的房屋一套。原告已支付定金***万元,但被告拒绝办理过户手续。
## 八、局限性与风险提示
1. **识别精度限制**:基于规则和模式的识别方法无法保证100%的敏感信息识别率。非标准的格式、拼写错误、故意混淆的写法、跨页断行等情况可能导致漏识别。建议对高安全要求的场景进行人工复核。
2. **语义理解限制**:AI对语境的理解有限,难以准确识别所有通过语义暗示的敏感信息。例如"我的老同学在朝阳法院工作"这样的表述可能间接泄漏他人信息。
3. **间接重识别风险**:即使每个敏感字段都做了脱敏处理,通过多个信息的组合(如年龄+职业+所在城市)仍可能准确定位到具体个人。这是匿名化处理中的固有问题,需要在脱敏策略中予以考虑。
4. **格式依赖**:脱敏后的文档格式可能与原始格式存在差异,特别是在处理复杂格式的DOCX、PDF文件时。建议在脱敏后进行格式校对。
5. **法律效力问题**:脱敏后的文档是否具有法律效力,取决于具体场景和法律规定。在向法院提交文件时,应事前确认法院对脱敏文件的要求。
6. **多语言问题**:涉及多语言文档时,敏感信息的识别和脱敏需要基于对应语言的规则处理,不同语言的识别规则差异较大。
Is this your skill, or is something wrong with this listing? Request removal or report an issue. Author removals are honored within 72 hours.
No comments yet. Be the first to comment!