Multi-step Jailbreaking Privacy Attacks on ChatGPT - 专知论文

会员服务 ·

0

隐私威胁 · 隐私攻击 · 文本数据 · ChatGPT · 攻击 ·

2023 年 4 月 11 日

Multi-step Jailbreaking Privacy Attacks on ChatGPT

翻译：多步越狱隐私攻击以ChatGPT为例

Haoran Li,Dadi Guo,Wei Fan,Mingshi Xu,Yangqiu Song

from arxiv, Work in progress

With the rapid progress of large language models (LLMs), many downstream NLP tasks can be well solved given good prompts. Though model developers and researchers work hard on dialog safety to avoid generating harmful content from LLMs, it is still challenging to steer AI-generated content (AIGC) for the human good. As powerful LLMs are devouring existing text data from various domains (e.g., GPT-3 is trained on 45TB texts), it is natural to doubt whether the private information is included in the training data and what privacy threats can these LLMs and their downstream applications bring. In this paper, we study the privacy threats from OpenAI's model APIs and New Bing enhanced by ChatGPT and show that application-integrated LLMs may cause more severe privacy threats ever than before. To this end, we conduct extensive experiments to support our claims and discuss LLMs' privacy implications.

翻译：随着大型语言模型（LLMs）的快速发展，许多下游自然语言处理任务在给定良好提示的情况下可以得到有效解决。尽管模型开发者和研究人员在对话安全性方面付出了巨大努力，以避免LLMs生成有害内容，但如何引导人工智能生成内容（AIGC）服务于人类福祉仍然充满挑战。由于强大的LLMs正在吞噬来自各个领域的现有文本数据（例如，GPT-3在45TB文本上训练），人们自然怀疑训练数据中是否包含隐私信息，以及这些LLMs及其下游应用可能带来何种隐私威胁。在本文中，我们研究了由ChatGPT增强的OpenAI模型API和New Bing所带来的隐私威胁，并表明应用集成的LLMs可能引发比以往更严重的隐私威胁。为此，我们进行了大量实验来支持我们的观点，并讨论了LLMs的隐私影响。

1

相关内容

隐私威胁

大模型最权威课程！MIT最新《生成式AI-大模型》课程，MIT斯坦福OpenAI-DeepMind众多专家讲授

大模型最权威课程！MIT最新《生成式AI-大模型》课程，MIT斯坦福OpenAI-DeepMind众多专家讲授

专知会员服务

121+阅读 · 2023年5月26日

【吴恩达新课程】ChatGPT提示工程，ChatGPT Prompt Engineering for Developers

【吴恩达新课程】ChatGPT提示工程，ChatGPT Prompt Engineering for Developers

专知会员服务

104+阅读 · 2023年4月28日

百篇论文纵览大型语言模型最新研究进展

百篇论文纵览大型语言模型最新研究进展

专知会员服务

70+阅读 · 2023年3月31日

【ChatGPT系列报告】斯坦福HAT《生成式人工智能》报告，李飞飞、Percy Liang等大牛评述GAI

【ChatGPT系列报告】斯坦福HAT《生成式人工智能》报告，李飞飞、Percy Liang等大牛评述GAI

专知会员服务

134+阅读 · 2023年3月15日

ChatGPT如何work的？最新《大型语言模型》综述，51页slides

ChatGPT如何work的？最新《大型语言模型》综述，51页slides

专知会员服务

162+阅读 · 2023年2月28日

【ACL2020】对抗性文本生成，Improving Adversarial Text Generation

专知会员服务

52+阅读 · 2020年5月5日

【Google可解释人工智能白皮书】27页pdf，AI Explainability Whitepaper ，Introduction to AI Explanations for AI Platform

【Google可解释人工智能白皮书】27页pdf，AI Explainability Whitepaper ，Introduction to AI Explanations for AI Platform

专知会员服务

128+阅读 · 2019年12月13日

强化学习最新教程，17页pdf

强化学习最新教程，17页pdf

专知会员服务

182+阅读 · 2019年10月11日

【加州大学伯克利分校博士论文】通过自我监督预测学习泛化

【加州大学伯克利分校博士论文】通过自我监督预测学习泛化

专知会员服务

65+阅读 · 2019年10月9日

【SIGGRAPH2019】TensorFlow 2.0深度学习计算机图形学应用

【SIGGRAPH2019】TensorFlow 2.0深度学习计算机图形学应用

专知会员服务

41+阅读 · 2019年10月9日

7 Papers & Radios | Meta「分割一切」AI模型；从T5到GPT-4盘点大语言模型

7 Papers & Radios | Meta「分割一切」AI模型；从T5到GPT-4盘点大语言模型

机器之心

4+阅读 · 2023年4月9日

通过 Play Integrity API 的 nonce 字段提高应用安全性

通过 Play Integrity API 的 nonce 字段提高应用安全性

谷歌开发者

1+阅读 · 2022年7月6日

VCIP 2022 Call for Demos

VCIP 2022 Call for Demos

CCF多媒体专委会

1+阅读 · 2022年6月6日

谷歌可解释人工智能白皮书，27页pdf，Google AI Explainability Whitepaper

谷歌可解释人工智能白皮书，27页pdf，Google AI Explainability Whitepaper

专知

28+阅读 · 2019年12月13日

强化学习的Unsupervised Meta-Learning

强化学习的Unsupervised Meta-Learning

CreateAMind

18+阅读 · 2019年1月7日

A Technical Overview of AI & ML in 2018 & Trends for 2019

A Technical Overview of AI & ML in 2018 & Trends for 2019

待字闺中

18+阅读 · 2018年12月24日

【论文推荐】最新八篇生成对抗网络相关论文—BRE、图像合成、多模态图像生成、非配对多域图、注意力、对抗特征增强、深度对抗性训练

【论文推荐】最新八篇生成对抗网络相关论文—BRE、图像合成、多模态图像生成、非配对多域图、注意力、对抗特征增强、深度对抗性训练

专知

16+阅读 · 2018年5月14日

LibRec 精选：推荐的可解释性[综述]

LibRec 精选：推荐的可解释性[综述]

LibRec智能推荐

10+阅读 · 2018年5月4日

【论文推荐】最新5篇度量学习（Metric Learning）相关论文—人脸验证、BIER、自适应图卷积、注意力机制、单次学习

【论文推荐】最新5篇度量学习（Metric Learning）相关论文—人脸验证、BIER、自适应图卷积、注意力机制、单次学习

专知

17+阅读 · 2018年2月11日

【论文推荐】最新5篇语音识别（ASR）相关论文—音频对抗样本、对抗性语音识别系统、声学模型、序列到序列、口语可理解性矫正

【论文推荐】最新5篇语音识别（ASR）相关论文—音频对抗样本、对抗性语音识别系统、声学模型、序列到序列、口语可理解性矫正

专知

14+阅读 · 2018年2月4日

放射诱导内皮细胞源Microvesicles通过TGF-β/Smad信号通路介导口腔癌放疗抗性的研究

国家自然科学基金

0+阅读 · 2015年12月31日

气道上皮细胞RUNX1调控急性肺损伤肺部炎症机制研究

国家自然科学基金

0+阅读 · 2014年12月31日

光子辅助压缩采样的动态范围提升机制研究

国家自然科学基金

0+阅读 · 2014年12月31日

草莓Agamous基因内含子（FvAGI）长非编码RNA的鉴定及其在转FvAGI基因植株中的作用和机制研究

国家自然科学基金

0+阅读 · 2013年12月31日

HMGB1引起心肌细胞肌浆网钙漏流的作用和机制及其在缺血-再灌注心脏损伤中的作用

国家自然科学基金

0+阅读 · 2013年12月31日

组合公钥密码体制的设计与安全性分析

国家自然科学基金

0+阅读 · 2012年12月31日

Snail1调控STOML2的表达在糖尿病肾病EMT发生中的作用及机制研究

国家自然科学基金

0+阅读 · 2012年12月31日

基于信任和策略的普适计算隐私保护技术研究

国家自然科学基金

1+阅读 · 2009年12月31日

利用模式生物进行锌指蛋白Makorin-2在造血调控中的功能研究

国家自然科学基金

0+阅读 · 2009年12月31日

fgl2基因沉默治疗糖尿病心肌微血管病变及分子机制的实验研究。

国家自然科学基金

0+阅读 · 2009年12月31日

Red teaming ChatGPT via Jailbreaking: Bias, Robustness, Reliability and Toxicity

Arxiv

0+阅读 · 2023年5月29日

BigTrans: Augmenting Large Language Models with Multilingual Translation Capability over 100 Languages

Arxiv

0+阅读 · 2023年5月29日

Model Dementia: Generated Data Makes Models Forget

Arxiv

0+阅读 · 2023年5月27日

On Evaluating Adversarial Robustness of Large Vision-Language Models

Arxiv

0+阅读 · 2023年5月26日

PALR: Personalization Aware LLMs for Recommendation

Arxiv

0+阅读 · 2023年5月26日

Hate Raids on Twitch: Understanding Real-Time Human-Bot Coordinated Attacks in Live Streaming Communities

Arxiv

0+阅读 · 2023年5月25日

Emergence of a phonological bias in ChatGPT

Arxiv

1+阅读 · 2023年5月25日

ChatGPT for PLC/DCS Control Logic Generation

Arxiv

0+阅读 · 2023年5月25日

A Comprehensive Survey of AI-Generated Content (AIGC): A History of Generative AI from GAN to ChatGPT

Arxiv

34+阅读 · 2023年3月7日

Beyond Accuracy: Behavioral Testing of NLP models with CheckList

Arxiv

11+阅读 · 2020年5月8日

VIP会员

文章信息

相关主题

最新内容

《国防领域敏感性分析白皮书》

《国防领域敏感性分析白皮书》

专知会员服务

0+阅读 · 今天3:42

综述 | 从问答到任务完成：Agent系统与Harness设计

综述 | 从问答到任务完成：Agent系统与Harness设计

专知会员服务

3+阅读 · 6月24日

Agentic RL：框架、实践与长程智能体训练

Agentic RL：框架、实践与长程智能体训练

专知会员服务

2+阅读 · 6月24日

反无人机拦截器训练与运用课程：对美国陆军部队发展的启示

反无人机拦截器训练与运用课程：对美国陆军部队发展的启示

专知会员服务

8+阅读 · 6月24日

重新思考无人机时代的生存能力

重新思考无人机时代的生存能力

专知会员服务

6+阅读 · 6月24日

装甲突击旅：现代战争思考、战斗与组织

装甲突击旅：现代战争思考、战斗与组织

专知会员服务

5+阅读 · 6月24日

在人工智能加速决策环境中拓展OODA循环

在人工智能加速决策环境中拓展OODA循环

专知会员服务

6+阅读 · 6月24日

《廉价自杀式无人机战争的军事战略影响：乌克兰与伊朗案例研究》

《廉价自杀式无人机战争的军事战略影响：乌克兰与伊朗案例研究》

专知会员服务

6+阅读 · 6月24日

军事欺骗：供作战战术指挥官使用的工具

军事欺骗：供作战战术指挥官使用的工具

专知会员服务

5+阅读 · 6月24日

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

ICML 2026 | CFPO：用反事实策略优化提升多模态推理

专知会员服务

4+阅读 · 6月23日

综述 | 世界动作模型：少做梦，多行动

综述 | 世界动作模型：少做梦，多行动

专知会员服务

7+阅读 · 6月23日

美以伊冲突：无人机与人工智能的运用

美以伊冲突：无人机与人工智能的运用

专知会员服务

12+阅读 · 6月23日

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

《战时图神经网络：整合以色列-伊朗冲突中的网络安全与无人机智能》最新50页文献

专知会员服务

6+阅读 · 6月23日

《特种部队在透明战场中的生存力》最新报告

《特种部队在透明战场中的生存力》最新报告

专知会员服务

5+阅读 · 6月23日

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

《自主无人机蜂群协同与控制系统：人工智能赋能的战场协同与自主任务编排平台》

专知会员服务

9+阅读 · 6月23日

相关VIP内容

大模型最权威课程！MIT最新《生成式AI-大模型》课程，MIT斯坦福OpenAI-DeepMind众多专家讲授

大模型最权威课程！MIT最新《生成式AI-大模型》课程，MIT斯坦福OpenAI-DeepMind众多专家讲授

专知会员服务

121+阅读 · 2023年5月26日

【吴恩达新课程】ChatGPT提示工程，ChatGPT Prompt Engineering for Developers

【吴恩达新课程】ChatGPT提示工程，ChatGPT Prompt Engineering for Developers

专知会员服务

104+阅读 · 2023年4月28日

百篇论文纵览大型语言模型最新研究进展

百篇论文纵览大型语言模型最新研究进展

专知会员服务

70+阅读 · 2023年3月31日

【ChatGPT系列报告】斯坦福HAT《生成式人工智能》报告，李飞飞、Percy Liang等大牛评述GAI

【ChatGPT系列报告】斯坦福HAT《生成式人工智能》报告，李飞飞、Percy Liang等大牛评述GAI

专知会员服务

134+阅读 · 2023年3月15日

ChatGPT如何work的？最新《大型语言模型》综述，51页slides

ChatGPT如何work的？最新《大型语言模型》综述，51页slides

专知会员服务

162+阅读 · 2023年2月28日

【ACL2020】对抗性文本生成，Improving Adversarial Text Generation

专知会员服务

52+阅读 · 2020年5月5日

【Google可解释人工智能白皮书】27页pdf，AI Explainability Whitepaper ，Introduction to AI Explanations for AI Platform

【Google可解释人工智能白皮书】27页pdf，AI Explainability Whitepaper ，Introduction to AI Explanations for AI Platform

专知会员服务

128+阅读 · 2019年12月13日

强化学习最新教程，17页pdf

强化学习最新教程，17页pdf

专知会员服务

182+阅读 · 2019年10月11日

【加州大学伯克利分校博士论文】通过自我监督预测学习泛化

【加州大学伯克利分校博士论文】通过自我监督预测学习泛化

专知会员服务

65+阅读 · 2019年10月9日

【SIGGRAPH2019】TensorFlow 2.0深度学习计算机图形学应用

【SIGGRAPH2019】TensorFlow 2.0深度学习计算机图形学应用

专知会员服务

41+阅读 · 2019年10月9日

热门VIP内容

开通专知VIP会员享更多权益服务

综述 | 从问答到任务完成：Agent系统与Harness设计

反无人机拦截器训练与运用课程：对美国陆军部队发展的启示

《国防领域敏感性分析白皮书》

Agentic RL：框架、实践与长程智能体训练

相关资讯

7 Papers & Radios | Meta「分割一切」AI模型；从T5到GPT-4盘点大语言模型

7 Papers & Radios | Meta「分割一切」AI模型；从T5到GPT-4盘点大语言模型

机器之心

4+阅读 · 2023年4月9日

通过 Play Integrity API 的 nonce 字段提高应用安全性

通过 Play Integrity API 的 nonce 字段提高应用安全性

谷歌开发者

1+阅读 · 2022年7月6日

VCIP 2022 Call for Demos

VCIP 2022 Call for Demos

CCF多媒体专委会

1+阅读 · 2022年6月6日

谷歌可解释人工智能白皮书，27页pdf，Google AI Explainability Whitepaper

谷歌可解释人工智能白皮书，27页pdf，Google AI Explainability Whitepaper

专知

28+阅读 · 2019年12月13日

强化学习的Unsupervised Meta-Learning

强化学习的Unsupervised Meta-Learning

CreateAMind

18+阅读 · 2019年1月7日

A Technical Overview of AI & ML in 2018 & Trends for 2019

A Technical Overview of AI & ML in 2018 & Trends for 2019

待字闺中

18+阅读 · 2018年12月24日

【论文推荐】最新八篇生成对抗网络相关论文—BRE、图像合成、多模态图像生成、非配对多域图、注意力、对抗特征增强、深度对抗性训练

【论文推荐】最新八篇生成对抗网络相关论文—BRE、图像合成、多模态图像生成、非配对多域图、注意力、对抗特征增强、深度对抗性训练

专知

16+阅读 · 2018年5月14日

LibRec 精选：推荐的可解释性[综述]

LibRec 精选：推荐的可解释性[综述]

LibRec智能推荐

10+阅读 · 2018年5月4日

【论文推荐】最新5篇度量学习（Metric Learning）相关论文—人脸验证、BIER、自适应图卷积、注意力机制、单次学习

【论文推荐】最新5篇度量学习（Metric Learning）相关论文—人脸验证、BIER、自适应图卷积、注意力机制、单次学习

专知

17+阅读 · 2018年2月11日

【论文推荐】最新5篇语音识别（ASR）相关论文—音频对抗样本、对抗性语音识别系统、声学模型、序列到序列、口语可理解性矫正

【论文推荐】最新5篇语音识别（ASR）相关论文—音频对抗样本、对抗性语音识别系统、声学模型、序列到序列、口语可理解性矫正

专知

14+阅读 · 2018年2月4日

相关论文

Red teaming ChatGPT via Jailbreaking: Bias, Robustness, Reliability and Toxicity

Arxiv

0+阅读 · 2023年5月29日

BigTrans: Augmenting Large Language Models with Multilingual Translation Capability over 100 Languages

Arxiv

0+阅读 · 2023年5月29日

Model Dementia: Generated Data Makes Models Forget

Arxiv

0+阅读 · 2023年5月27日

On Evaluating Adversarial Robustness of Large Vision-Language Models

Arxiv

0+阅读 · 2023年5月26日

PALR: Personalization Aware LLMs for Recommendation

Arxiv

0+阅读 · 2023年5月26日

Hate Raids on Twitch: Understanding Real-Time Human-Bot Coordinated Attacks in Live Streaming Communities

Arxiv

0+阅读 · 2023年5月25日

Emergence of a phonological bias in ChatGPT

Arxiv

1+阅读 · 2023年5月25日

ChatGPT for PLC/DCS Control Logic Generation

Arxiv

0+阅读 · 2023年5月25日

A Comprehensive Survey of AI-Generated Content (AIGC): A History of Generative AI from GAN to ChatGPT

Arxiv

34+阅读 · 2023年3月7日

Beyond Accuracy: Behavioral Testing of NLP models with CheckList

Arxiv

11+阅读 · 2020年5月8日

相关基金

放射诱导内皮细胞源Microvesicles通过TGF-β/Smad信号通路介导口腔癌放疗抗性的研究

国家自然科学基金

0+阅读 · 2015年12月31日

气道上皮细胞RUNX1调控急性肺损伤肺部炎症机制研究

国家自然科学基金

0+阅读 · 2014年12月31日

光子辅助压缩采样的动态范围提升机制研究

国家自然科学基金

0+阅读 · 2014年12月31日

草莓Agamous基因内含子（FvAGI）长非编码RNA的鉴定及其在转FvAGI基因植株中的作用和机制研究

国家自然科学基金

0+阅读 · 2013年12月31日

HMGB1引起心肌细胞肌浆网钙漏流的作用和机制及其在缺血-再灌注心脏损伤中的作用

国家自然科学基金

0+阅读 · 2013年12月31日

组合公钥密码体制的设计与安全性分析

国家自然科学基金

0+阅读 · 2012年12月31日

Snail1调控STOML2的表达在糖尿病肾病EMT发生中的作用及机制研究

国家自然科学基金

0+阅读 · 2012年12月31日

基于信任和策略的普适计算隐私保护技术研究

国家自然科学基金

1+阅读 · 2009年12月31日

利用模式生物进行锌指蛋白Makorin-2在造血调控中的功能研究

国家自然科学基金

0+阅读 · 2009年12月31日

fgl2基因沉默治疗糖尿病心肌微血管病变及分子机制的实验研究。

国家自然科学基金

0+阅读 · 2009年12月31日

微信扫码咨询专知VIP会员