去识别化的悖论：大语言模型时代对HIPAA安全港准则的批判 (Paradox of De-identification: A Critique of HIPAA Safe Harbour in the Age of LLMs) - 专知论文

会员服务 ·

0

识别 · 准则 · 标识符 · 关联 · 语言模型 ·

Paradox of De-identification: A Critique of HIPAA Safe Harbour in the Age of LLMs

翻译：去识别化的悖论：大语言模型时代对HIPAA安全港准则的批判

Lavender Y. Jiang,Xujin Chris Liu,Kyunghyun Cho,Eric K. Oermann

Privacy is a human right that sustains patient-provider trust. Clinical notes capture a patient's private vulnerability and individuality, which are used for care coordination and research. Under HIPAA Safe Harbor, these notes are de-identified to protect patient privacy. However, Safe Harbor was designed for an era of categorical tabular data, focusing on the removal of explicit identifiers while ignoring the latent information found in correlations between identity and quasi-identifiers, which can be captured by modern LLMs. We first formalize these correlations using a causal graph, then validate it empirically through individual re-identification of patients from scrubbed notes. The paradox of de-identification is further shown through a diagnosis ablation: even when all other information is removed, the model can predict the patient's neighborhood based on diagnosis alone. This position paper raises the question of how we can act as a community to uphold patient-provider trust when de-identification is inherently imperfect. We aim to raise awareness and discuss actionable recommendations.

翻译：隐私权是维系医患信任的基本人权。临床记录承载着患者的隐私脆弱性与个体独特性，这些记录被用于医疗协调与科学研究。根据HIPAA安全港准则，这些记录需经过去识别化处理以保护患者隐私。然而，安全港准则设计于分类表格数据时代，其关注点在于移除显式标识符，却忽视了身份标识与准标识符之间关联所蕴含的潜在信息——这些信息能够被现代大语言模型所捕捉。我们首先通过因果图形式化表征这些关联，继而通过对脱敏记录进行个体重识别的实证研究加以验证。诊断消融实验进一步揭示了去识别化的悖论：即使移除所有其他信息，模型仅凭诊断记录即可预测患者所在社区。本立场文件提出核心议题：当去识别化技术存在固有缺陷时，学术共同体应如何协同行动以维护医患信任。我们旨在提升学界认知并探讨可实施的改进方案。

0

相关内容

【ICML2025】隐私防护图像压缩：防御视觉-语言预训练模型的滥用

【ICML2025】隐私防护图像压缩：防御视觉-语言预训练模型的滥用

专知会员服务

5+阅读 · 2025年6月22日

【新书】大规模语言模型的隐私与安全，

【新书】大规模语言模型的隐私与安全，

专知会员服务

29+阅读 · 2024年12月4日

机器遗忘：分类、指标、应用、挑战与展望

机器遗忘：分类、指标、应用、挑战与展望

专知会员服务

36+阅读 · 2024年3月16日

大语言模型安全现状与挑战

大语言模型安全现状与挑战

专知会员服务

87+阅读 · 2024年1月14日

《理解、评估和缓解人工智能系统中的安全风险》美海军67页论文

《理解、评估和缓解人工智能系统中的安全风险》美海军67页论文

专知会员服务

52+阅读 · 2023年3月25日

「中文电子病历命名实体识别」的研究与进展

「中文电子病历命名实体识别」的研究与进展

专知会员服务

30+阅读 · 2022年11月5日

AI时代生物隐私如何保护？马德里自治大学最新《生物特征识别中的隐私增强技术》综述，全面详述生物隐私增强技术

AI时代生物隐私如何保护？马德里自治大学最新《生物特征识别中的隐私增强技术》综述，全面详述生物隐私增强技术

专知会员服务

21+阅读 · 2022年6月24日

《信息安全技术人脸识别数据安全要求》国家标准意见稿

《信息安全技术人脸识别数据安全要求》国家标准意见稿

专知会员服务

31+阅读 · 2022年3月8日

《信息安全技术健康医疗数据安全指南》国家标准，70页pdf

《信息安全技术健康医疗数据安全指南》国家标准，70页pdf

专知会员服务

104+阅读 · 2022年3月4日

香港个人资料私隐专员公署2021年【开发及使用人工智能道德标准指引】

香港个人资料私隐专员公署2021年【开发及使用人工智能道德标准指引】

专知会员服务

13+阅读 · 2022年2月17日

【AI+军事】《用于威胁评估的人工智能工具》加拿大国防研究和发展部技术报告，附中文版pdf

【AI+军事】《用于威胁评估的人工智能工具》加拿大国防研究和发展部技术报告，附中文版pdf

专知

90+阅读 · 2022年4月17日

《人工智能安全测评白皮书》，99页pdf

《人工智能安全测评白皮书》，99页pdf

专知

36+阅读 · 2022年2月26日

CVPR 2019 | 基于密集语义对齐的行人重识别模型：有效解决语义不对齐

CVPR 2019 | 基于密集语义对齐的行人重识别模型：有效解决语义不对齐

微软研究院AI头条

10+阅读 · 2019年7月5日

区块链隐私保护研究综述——祝烈煌详解

区块链隐私保护研究综述——祝烈煌详解

计算机研究与发展

23+阅读 · 2018年11月28日

EMNLP 2018 | 短文本分类，腾讯AI Lab联合港中文提出主题记忆网络

EMNLP 2018 | 短文本分类，腾讯AI Lab联合港中文提出主题记忆网络

机器之心

23+阅读 · 2018年10月23日

中国信通院：人工智能安全白皮书（2018年）（附解读及白皮书下载）

中国信通院：人工智能安全白皮书（2018年）（附解读及白皮书下载）

走向智能论坛

27+阅读 · 2018年9月18日

差分隐私保护：从入门到脱坑

差分隐私保护：从入门到脱坑

FreeBuf

17+阅读 · 2018年9月10日

【论文推荐】最新5篇行人再识别（ReID）相关论文—迁移学习、特征集成、重排序、多通道金字塔、深层生成模型

【论文推荐】最新5篇行人再识别（ReID）相关论文—迁移学习、特征集成、重排序、多通道金字塔、深层生成模型

专知

12+阅读 · 2018年3月24日

AAAI 2018 行为识别论文概览

AAAI 2018 行为识别论文概览

极市平台

18+阅读 · 2018年3月20日

从人脸识别到行人重识别，下一个风口

从人脸识别到行人重识别，下一个风口

计算机视觉战队

13+阅读 · 2017年11月24日

面向跨领域异构数据的患者相似性学习方法及应用

国家自然科学基金

23+阅读 · 2016年12月31日

基于量子模糊承诺体系的生物身份认证系统研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于海量软件片段比对的恶意代码检测方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

面向时空特性的社交网络推演攻击与隐私保护关键技术研究

国家自然科学基金

4+阅读 · 2015年12月31日

面向云的个人健康档案动态访问权限管理研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于多源证据的繁忙水域交管雷达异常目标识别方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

即时通讯匿名隐通道系统模型与算法研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于EHR结构模型和DCM的医学术语协同化方法研究

国家自然科学基金

4+阅读 · 2014年12月31日

网络用户隐私担忧与主动性泄露隐私信息之间的悖论：理论探索和基于社交网络的实证研究

国家自然科学基金

0+阅读 · 2014年12月31日

大数据环境下多媒体网络舆情信息的语义识别与危机响应研究

国家自然科学基金

4+阅读 · 2014年12月31日

Large-scale online deanonymization with LLMs

Arxiv

0+阅读 · 2月18日

Self-Transparency Failures in Expert-Persona LLMs: How Instruction-Following Overrides Disclosure

Arxiv

0+阅读 · 2月13日

SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks

Arxiv

0+阅读 · 2月7日

Systematic Failures in Collective Reasoning under Distributed Information in Multi-Agent LLMs

Arxiv

0+阅读 · 2月6日

Privacy Amplification by Missing Data

Arxiv

0+阅读 · 2月4日

NOIR: Privacy-Preserving Generation of Code with Open-Source LLMs

Arxiv

0+阅读 · 1月22日

Membership Inference Attacks on LLM-based Recommender Systems

Arxiv

0+阅读 · 1月22日

LLMs Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions

Arxiv

0+阅读 · 1月18日

CoSMeTIC: Zero-Knowledge Computational Sparse Merkle Trees with Inclusion-Exclusion Proofs for Clinical Research

Arxiv

0+阅读 · 1月17日

From Defense to Advocacy: Empowering Users to Leverage the Blind Spot of AI Inference

Arxiv

0+阅读 · 1月16日

VIP会员

文章信息

相关主题

相关VIP内容

【ICML2025】隐私防护图像压缩：防御视觉-语言预训练模型的滥用

【ICML2025】隐私防护图像压缩：防御视觉-语言预训练模型的滥用

专知会员服务

5+阅读 · 2025年6月22日

【新书】大规模语言模型的隐私与安全，

【新书】大规模语言模型的隐私与安全，

专知会员服务

29+阅读 · 2024年12月4日

机器遗忘：分类、指标、应用、挑战与展望

机器遗忘：分类、指标、应用、挑战与展望

专知会员服务

36+阅读 · 2024年3月16日

大语言模型安全现状与挑战

大语言模型安全现状与挑战

专知会员服务

87+阅读 · 2024年1月14日

《理解、评估和缓解人工智能系统中的安全风险》美海军67页论文

《理解、评估和缓解人工智能系统中的安全风险》美海军67页论文

专知会员服务

52+阅读 · 2023年3月25日

「中文电子病历命名实体识别」的研究与进展

「中文电子病历命名实体识别」的研究与进展

专知会员服务

30+阅读 · 2022年11月5日

AI时代生物隐私如何保护？马德里自治大学最新《生物特征识别中的隐私增强技术》综述，全面详述生物隐私增强技术

AI时代生物隐私如何保护？马德里自治大学最新《生物特征识别中的隐私增强技术》综述，全面详述生物隐私增强技术

专知会员服务

21+阅读 · 2022年6月24日

《信息安全技术人脸识别数据安全要求》国家标准意见稿

《信息安全技术人脸识别数据安全要求》国家标准意见稿

专知会员服务

31+阅读 · 2022年3月8日

《信息安全技术健康医疗数据安全指南》国家标准，70页pdf

《信息安全技术健康医疗数据安全指南》国家标准，70页pdf

专知会员服务

104+阅读 · 2022年3月4日

香港个人资料私隐专员公署2021年【开发及使用人工智能道德标准指引】

香港个人资料私隐专员公署2021年【开发及使用人工智能道德标准指引】

专知会员服务

13+阅读 · 2022年2月17日

热门VIP内容

开通专知VIP会员享更多权益服务

美国防部门开始扩建金穹反导系统基础设施

《基于选择性深度神经网络分类的弹性无线通信》最新报告

《多域作战中融合网络、电子战与动能机动》

《在东欧磨砺反无人机技能》美陆军最新反无人机训练报告

相关资讯

【AI+军事】《用于威胁评估的人工智能工具》加拿大国防研究和发展部技术报告，附中文版pdf

【AI+军事】《用于威胁评估的人工智能工具》加拿大国防研究和发展部技术报告，附中文版pdf

专知

90+阅读 · 2022年4月17日

《人工智能安全测评白皮书》，99页pdf

《人工智能安全测评白皮书》，99页pdf

专知

36+阅读 · 2022年2月26日

CVPR 2019 | 基于密集语义对齐的行人重识别模型：有效解决语义不对齐

CVPR 2019 | 基于密集语义对齐的行人重识别模型：有效解决语义不对齐

微软研究院AI头条

10+阅读 · 2019年7月5日

区块链隐私保护研究综述——祝烈煌详解

区块链隐私保护研究综述——祝烈煌详解

计算机研究与发展

23+阅读 · 2018年11月28日

EMNLP 2018 | 短文本分类，腾讯AI Lab联合港中文提出主题记忆网络

EMNLP 2018 | 短文本分类，腾讯AI Lab联合港中文提出主题记忆网络

机器之心

23+阅读 · 2018年10月23日

中国信通院：人工智能安全白皮书（2018年）（附解读及白皮书下载）

中国信通院：人工智能安全白皮书（2018年）（附解读及白皮书下载）

走向智能论坛

27+阅读 · 2018年9月18日

差分隐私保护：从入门到脱坑

差分隐私保护：从入门到脱坑

FreeBuf

17+阅读 · 2018年9月10日

【论文推荐】最新5篇行人再识别（ReID）相关论文—迁移学习、特征集成、重排序、多通道金字塔、深层生成模型

【论文推荐】最新5篇行人再识别（ReID）相关论文—迁移学习、特征集成、重排序、多通道金字塔、深层生成模型

专知

12+阅读 · 2018年3月24日

AAAI 2018 行为识别论文概览

AAAI 2018 行为识别论文概览

极市平台

18+阅读 · 2018年3月20日

从人脸识别到行人重识别，下一个风口

从人脸识别到行人重识别，下一个风口

计算机视觉战队

13+阅读 · 2017年11月24日

相关论文

Large-scale online deanonymization with LLMs

Arxiv

0+阅读 · 2月18日

Self-Transparency Failures in Expert-Persona LLMs: How Instruction-Following Overrides Disclosure

Arxiv

0+阅读 · 2月13日

SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks

Arxiv

0+阅读 · 2月7日

Systematic Failures in Collective Reasoning under Distributed Information in Multi-Agent LLMs

Arxiv

0+阅读 · 2月6日

Privacy Amplification by Missing Data

Arxiv

0+阅读 · 2月4日

NOIR: Privacy-Preserving Generation of Code with Open-Source LLMs

Arxiv

0+阅读 · 1月22日

Membership Inference Attacks on LLM-based Recommender Systems

Arxiv

0+阅读 · 1月22日

LLMs Deceive Unintentionally: Emergent Misalignment in Dishonesty from Misaligned Samples to Biased Human-AI Interactions

Arxiv

0+阅读 · 1月18日

CoSMeTIC: Zero-Knowledge Computational Sparse Merkle Trees with Inclusion-Exclusion Proofs for Clinical Research

Arxiv

0+阅读 · 1月17日

From Defense to Advocacy: Empowering Users to Leverage the Blind Spot of AI Inference

Arxiv

0+阅读 · 1月16日

相关基金

面向跨领域异构数据的患者相似性学习方法及应用

国家自然科学基金

23+阅读 · 2016年12月31日

基于量子模糊承诺体系的生物身份认证系统研究

国家自然科学基金

0+阅读 · 2015年12月31日

基于海量软件片段比对的恶意代码检测方法研究

国家自然科学基金

2+阅读 · 2015年12月31日

面向时空特性的社交网络推演攻击与隐私保护关键技术研究

国家自然科学基金

4+阅读 · 2015年12月31日

面向云的个人健康档案动态访问权限管理研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于多源证据的繁忙水域交管雷达异常目标识别方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

即时通讯匿名隐通道系统模型与算法研究

国家自然科学基金

1+阅读 · 2015年12月31日

基于EHR结构模型和DCM的医学术语协同化方法研究

国家自然科学基金

4+阅读 · 2014年12月31日

网络用户隐私担忧与主动性泄露隐私信息之间的悖论：理论探索和基于社交网络的实证研究

国家自然科学基金

0+阅读 · 2014年12月31日

大数据环境下多媒体网络舆情信息的语义识别与危机响应研究

国家自然科学基金

4+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员