核心思路是构建一个分层、可配置、兼顾安全与体验的防御体系。其目标是在模型生成内容后、呈现给用户前,对可能泄露的敏感信息进行精准识别与妥善处理。
一套完整的输出脱敏方案框架,包含四个核心层次:
第一层:敏感信息检测与识别
这是脱敏的基础,目标是精准定位输出内容中的敏感信息。
1. 多维度敏感信息类型覆盖
| 类别 | 典型示例 |
|---|---|
| 个人身份信息 (PII) | 姓名、身份证号、手机号、邮箱、家庭住址等 |
| 企业商业机密 | 财务数据、客户名单、内部代码、未公开的战略规划等 |
| 凭证与密钥 | API Key、AccessKey、RSA私钥、数据库密码等 |
| 医疗健康数据 | 病历、诊断信息、基因数据等 |
| 其他合规数据 | 银行卡号、IP地址、地理位置等 |
2. 混合检测引擎
单一检测手段难以覆盖所有场景,建议采用“规则 + 模型”的混合方式:
- 规则引擎:基于正则表达式、预定义字典和黑白名单,快速匹配已知模式的敏感信息。例如使用Aho-Corasick多模式匹配算法,可在无敏感信息时O(1)短路跳过。
- AI语义识别:利用专门训练的NER(命名实体识别)模型或可信的大语言模型,识别非结构化文本中的敏感实体。北大肿瘤医院的研究表明,在无GPU环境下通过私有化部署开源大模型(如Gemma2、Llama3),也能高质量完成敏感词识别。
NER(Named Entity Recognition)命名实体识别 - 上下文关联分析:在多轮对话场景中,追踪对话历史,识别单条无害但组合后泄露敏感信息的渐进式风险。
3. 流式实时检测
对于流式输出场景,需在Token生成过程中实时检测,一旦发现风险可立即截断后续生成。采用BERT-LSTM混合模型进行意图识别和格式验证,可在响应生成过程中早停高风险Token,响应延迟仅增加约3ms。
第二层:脱敏处理与策略执行
检测到敏感信息后,根据风险等级执行不同的脱敏策略。
1. 分级脱敏策略
| 风险等级 | 典型场景 | 处理策略 |
|---|---|---|
| 高危 | 明文身份证号、银行卡号、API密钥等 | 强制屏蔽/替换,绝不输出原始值 |
| 中危 | 部分姓名、模糊地址、非关键财务数据 | 脱敏替换,保留数据结构但隐藏具体信息 |
| 低危 | 轻微表述不当、用词不严谨 | 内容降级,进行语句润色或中立化改写 |
2. 脱敏技术手段
- 替换 (Substitution):用占位符或伪造值替换敏感信息。例如将“张三”替换为
${NAME_1},将“13812345678”替换为${PHONE_1}。这种方式能保留文本的语义结构,不影响模型后续处理。 - 遮蔽 (Masking):部分隐藏敏感信息,如将身份证号“110101199001011234”显示为“110101********1234”。
- 泛化 (Generalization):将精确信息模糊化,如将“北京市朝阳区建国路88号”泛化为“北京市”。
- 加密 (Encryption):对敏感字段进行加密存储,仅在授权场景下解密。
- 删除 (Redaction):直接移除敏感信息片段。
3. 可逆与不可逆脱敏
根据业务场景选择:
- 可逆脱敏:建立原始值与占位符的映射表(双射表),响应返回时还原原始值。适用于用户与AI的正常对话场景,保护隐私的同时不影响消息结果。
- 不可逆脱敏:直接替换为固定占位符或随机值,无法还原。适用于日志存储、数据归档等无需还原的场景。
第三层:多级风控与熔断机制
在脱敏处理之上,建立一套完整的输出风控体系。
1. 五级风控机制
| 级别 | 机制 | 说明 |
|---|---|---|
| 一级 | 敏感词熔断 | 命中高危敏感词,立即终止生成流程并标记风险 |
| 二级 | 违规屏蔽 | 识别严重违规内容,整条拦截,替换为合规提示语 |
| 三级 | 流式截断 | 流式生成中实时检测到风险片段,立即停止后续Token生成 |
| 四级 | 内容降级 | 对中危风险进行语句改写、敏感片段替换、语气弱化等柔性处理 |
| 五级 | 合规兜底 | 前述机制全部失效时,启用预设标准化合规话术兜底 |
2. 实时与事后双重检测
- 实时检测:在流式输出过程中,对每个Token或每个句子进行实时规则过滤。
- 事后审核:在输出全部完成后,进行二次深度审核,发现问题的可撤回或标记。
第四层:监控审计与持续运营
1. 全链路日志记录
记录每一次输出的原始内容、脱敏后内容、检测结果、风险等级和处理动作,确保可追溯。
2. 异常告警
对高频敏感信息泄露、异常脱敏失败、绕过检测尝试等行为设置实时告警。
3. 定期评估与迭代
- 定期进行红蓝对抗演练,测试脱敏方案的有效性。
- 根据新的攻击手法和合规要求,持续更新敏感信息库和检测模型。
4. 合规审计
确保脱敏方案符合《数据安全法》《个人信息保护法》等法规要求。
🛠️ 落地实施建议
1. 架构选型
| 部署方式 | 适用场景 | 特点 |
|---|---|---|
| API网关模式 | 企业统一访问外部大模型 | 在用户与大模型之间建立“脱敏缓冲区”,对输入输出进行实时识别和脱敏 |
| SDK嵌入模式 | 自研AI应用 | 在应用中集成脱敏SDK,如llm-privacy-masker、safegate等 |
| MCP协议网关 | 基于MCP的Agent系统 | 通过MCP协议封装脱敏逻辑,工具注册在云端但数据处理在本地 |
2. 实施优先级
建议按以下优先级分阶段推进:
- 先覆盖最敏感的PII和密钥(手机号、身份证、API Key等)
- 再扩展至企业机密和业务数据
- 最后完善多模态内容(图像中的敏感信息、音频中的指令等)
3. 关键原则
- 默认不信任:所有模型输出在展示前都应经过脱敏校验。
- 最小化暴露:仅输出完成任务所必需的信息,非必要不输出。
- 安全与体验平衡:对低风险内容采用柔性降级而非直接屏蔽,避免影响用户体验。