信息论视角下欺骗与混淆的本质区分 (Information-theoretic Distinctions Between Deception and Confusion) - 专知论文

会员服务 ·

0

形式化 · 对齐 · 失效 · 失效模式 · 系统 ·

Information-theoretic Distinctions Between Deception and Confusion

翻译：信息论视角下欺骗与混淆的本质区分

from arxiv, Proceedings of the 14th IJCNLP and the 4th AACL (2025)

We propose an information-theoretic formalization of the distinction between two fundamental AI safety failure modes: deceptive alignment and goal drift. While both can lead to systems that appear misaligned, we demonstrate that they represent distinct forms of information divergence occurring at different interfaces in the human-AI system. Deceptive alignment creates entropy between an agent's true goals and its observable behavior, while goal drift, or confusion, creates entropy between the intended human goal and the agent's actual goal. Though often observationally equivalent, these failures necessitate different interventions. We present a formal model and an illustrative thought experiment to clarify this distinction. We offer a formal language for re-examining prominent alignment challenges observed in Large Language Models (LLMs), offering novel perspectives on their underlying causes.

翻译：我们提出了一种信息论形式化框架，用于区分两种基本的人工智能安全失效模式：欺骗性对齐与目标漂移。尽管二者均可能导致系统表现出失准行为，但我们证明它们代表了人机系统不同接口处发生的两种信息发散形式。欺骗性对齐在智能体的真实目标与可观测行为之间产生信息熵，而目标漂移（或称混淆）则在人类预期目标与智能体实际目标之间产生信息熵。虽然这两种失效模式在观测上通常具有等效性，但需要采取不同的干预措施。我们通过构建形式化模型和启发性思想实验来阐明这一区分，并提出一套形式化语言用以重新审视大型语言模型中观察到的显著对齐挑战，从而为其根本成因提供新的理论视角。

0

相关内容

形式化

《深度伪造——错误信息、宣传战与信息战》最新报告

《深度伪造——错误信息、宣传战与信息战》最新报告

专知会员服务

30+阅读 · 2025年7月10日

虚假信息检测综述

虚假信息检测综述

专知会员服务

8+阅读 · 2025年7月9日

大模型如何可信？字节跳动李航等最新《可信赖的大型语言模型》综述，提出可信大模型七大维度，81页pdf

大模型如何可信？字节跳动李航等最新《可信赖的大型语言模型》综述，提出可信大模型七大维度，81页pdf

专知会员服务

88+阅读 · 2023年8月12日

《应用人工智能来识别针对全球定位系统（GPS）的网络欺骗攻击》美国海军136页论文

《应用人工智能来识别针对全球定位系统（GPS）的网络欺骗攻击》美国海军136页论文

专知会员服务

63+阅读 · 2022年9月29日

如何理解信息论？伯克利最新《信息论》图文导论，43页pdf概述信息论中的熵、不确定、熵、互信息、编解码等基础概念

如何理解信息论？伯克利最新《信息论》图文导论，43页pdf概述信息论中的熵、不确定、熵、互信息、编解码等基础概念

专知会员服务

173+阅读 · 2022年7月17日

最新综述论文《人类与人工智能交互中的信任：确定模型、措施和方法》东京工业大学

最新综述论文《人类与人工智能交互中的信任：确定模型、措施和方法》东京工业大学

专知会员服务

30+阅读 · 2022年6月16日

ISWC2020最佳论文《可解释假信息检测的链接可信度评价》

ISWC2020最佳论文《可解释假信息检测的链接可信度评价》

专知会员服务

20+阅读 · 2020年11月7日

异质信息网络分析与应用综述，软件学报-北京邮电大学

异质信息网络分析与应用综述，软件学报-北京邮电大学

专知会员服务

64+阅读 · 2020年7月9日

【DeepMind】人工智能、价值与对齐，Artificial Intelligence, Values, and Alignment

【DeepMind】人工智能、价值与对齐，Artificial Intelligence, Values, and Alignment

专知会员服务

38+阅读 · 2020年1月13日

论深度学习的信息瓶颈理论（On the information bottleneck theory of deep learning）

论深度学习的信息瓶颈理论（On the information bottleneck theory of deep learning）

专知会员服务

66+阅读 · 2019年12月20日

【博士论文】《安全博弈中的分层规划：战略、战术和行动决策的博弈论方法》南加州大学

【博士论文】《安全博弈中的分层规划：战略、战术和行动决策的博弈论方法》南加州大学

专知

24+阅读 · 2022年9月25日

从信息论的角度来理解损失函数

从信息论的角度来理解损失函数

深度学习每日摘要

17+阅读 · 2019年4月7日

【混合智能】人机混合智能的哲学思考

【混合智能】人机混合智能的哲学思考

产业智能官

12+阅读 · 2018年10月28日

从香农熵到手推KL散度：一文带你纵览机器学习中的信息论

从香农熵到手推KL散度：一文带你纵览机器学习中的信息论

算法与数学之美

10+阅读 · 2018年1月14日

基于信息理论的机器学习

基于信息理论的机器学习

专知

22+阅读 · 2017年11月23日

【论文】变分推断（Variational inference)的总结

【论文】变分推断（Variational inference)的总结

机器学习研究会

39+阅读 · 2017年11月16日

【直观详解】信息熵、交叉熵和相对熵

【直观详解】信息熵、交叉熵和相对熵

机器学习研究会

10+阅读 · 2017年11月7日

Representation Learning on Network 网络表示学习

Representation Learning on Network 网络表示学习

全球人工智能

10+阅读 · 2017年10月19日

知识图谱 vs. 对话系统专题讨论 - PaperWeekly 社区

知识图谱 vs. 对话系统专题讨论 - PaperWeekly 社区

PaperWeekly

10+阅读 · 2017年10月18日

FCS 论坛 | 孟德宇：误差建模原理

FCS 论坛 | 孟德宇：误差建模原理

FCS

15+阅读 · 2017年8月17日

正则双极值模糊推理的理论与方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

信息不完全的双边匹配决策方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

广义双随机相位编码系统中以QR码为载体的信息加密及无损恢复

国家自然科学基金

0+阅读 · 2015年12月31日

基于犹豫模糊语言信息的定性决策理论与方法

国家自然科学基金

2+阅读 · 2015年12月31日

基于虚拟原型的信息物理融合系统高效可信构造研究

国家自然科学基金

8+阅读 · 2015年12月31日

面向异构信息网络中实体归类的模糊聚类

国家自然科学基金

1+阅读 · 2015年12月31日

基于信息密度的广义不确定直觉模糊集成算子及其应用

国家自然科学基金

0+阅读 · 2014年12月31日

信息论学习中的正则化及相关高维数据分析方法的数学理论

国家自然科学基金

12+阅读 · 2014年12月31日

不确定性推理与语义网中知识表示的数学基础

国家自然科学基金

18+阅读 · 2012年12月31日

基于博弈论的信息安全理论与方法研究

国家自然科学基金

10+阅读 · 2012年12月31日

On the Structure of Information

Arxiv

0+阅读 · 2月19日

The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes

Arxiv

0+阅读 · 2月17日

Modelling Trust and Trusted Systems: A Category Theoretic Approach

Arxiv

0+阅读 · 2月11日

The Refutability Gap: Challenges in Validating Reasoning by Large Language Models

Arxiv

0+阅读 · 2月10日

The Refutability Gap: Challenges in Validating Reasoning by Large Language Models

Arxiv

0+阅读 · 2月9日

An Information-Theoretic Framework for Comparing Voice and Text Explainability

Arxiv

0+阅读 · 2月6日

OpenDeception: Learning Deception and Trust in Human-AI Interaction via Multi-Agent Simulation

Arxiv

0+阅读 · 2月6日

Information-Theoretic Causal Bounds under Unmeasured Confounding

Arxiv

0+阅读 · 2月3日

On the Separability of Information in Diffusion Models

Arxiv

0+阅读 · 1月30日

Data-Driven Information-Theoretic Causal Bounds under Unmeasured Confounding

Arxiv

0+阅读 · 1月23日

VIP会员

文章信息

相关主题

最新内容

《俄罗斯构建服务于人工智能驱动自主性的主权无人机生态系统》（2026报告）

《俄罗斯构建服务于人工智能驱动自主性的主权无人机生态系统》（2026报告）

专知会员服务

5+阅读 · 今天3:09

2026年俄罗斯新型喷气动力无人机Geran-5的技术规格

2026年俄罗斯新型喷气动力无人机Geran-5的技术规格

专知会员服务

3+阅读 · 今天2:50

基于数据优化的人机协同与机器人僚机

基于数据优化的人机协同与机器人僚机

专知会员服务

3+阅读 · 今天2:08

美太空军发布两份聚焦2040年规划的文件：《2040年未来作战环境》和《2040年目标部队》（附文件）

美太空军发布两份聚焦2040年规划的文件：《2040年未来作战环境》和《2040年目标部队》（附文件）

专知会员服务

8+阅读 · 今天1:51

《为码头高价值舰艇提供反无人机系统防御方案研究》80页

《为码头高价值舰艇提供反无人机系统防御方案研究》80页

专知会员服务

8+阅读 · 4月15日

《认知战作为一个战略域：媒体生态系统、社交网络与社会韧性的侵蚀》

《认知战作为一个战略域：媒体生态系统、社交网络与社会韧性的侵蚀》

专知会员服务

4+阅读 · 4月15日

美陆军设想无人系统司令部

美陆军设想无人系统司令部

专知会员服务

3+阅读 · 4月15日

【博士论文】已对齐人工智能系统的持久脆弱性

【博士论文】已对齐人工智能系统的持久脆弱性

专知会员服务

2+阅读 · 4月15日

人工智能对指挥控制的加速及其对陆军的影响（中文报告）

人工智能对指挥控制的加速及其对陆军的影响（中文报告）

专知会员服务

5+阅读 · 4月15日

扭曲还是编造？视频大语言模型幻觉研究综述

扭曲还是编造？视频大语言模型幻觉研究综述

专知会员服务

3+阅读 · 4月15日

美欧最新（2026）反无人机系统选项、技术与获取一览

美欧最新（2026）反无人机系统选项、技术与获取一览

专知会员服务

6+阅读 · 4月15日

《大语言模型作为战术规划支持工具——来自两项应用研究的结论》2026最新100页报告

《大语言模型作为战术规划支持工具——来自两项应用研究的结论》2026最新100页报告

专知会员服务

5+阅读 · 4月15日

《采用系统思维应对混合战争》125页

《采用系统思维应对混合战争》125页

专知会员服务

6+阅读 · 4月15日

战争机器学习：数据生态系统构建（155页）

战争机器学习：数据生态系统构建（155页）

专知会员服务

9+阅读 · 4月15日

乌克兰军事人工智能助手：NeoLens军事装备人工智能辅助维护平台

乌克兰军事人工智能助手：NeoLens军事装备人工智能辅助维护平台

专知会员服务

4+阅读 · 4月15日

相关VIP内容

《深度伪造——错误信息、宣传战与信息战》最新报告

《深度伪造——错误信息、宣传战与信息战》最新报告

专知会员服务

30+阅读 · 2025年7月10日

虚假信息检测综述

虚假信息检测综述

专知会员服务

8+阅读 · 2025年7月9日

大模型如何可信？字节跳动李航等最新《可信赖的大型语言模型》综述，提出可信大模型七大维度，81页pdf

大模型如何可信？字节跳动李航等最新《可信赖的大型语言模型》综述，提出可信大模型七大维度，81页pdf

专知会员服务

88+阅读 · 2023年8月12日

《应用人工智能来识别针对全球定位系统（GPS）的网络欺骗攻击》美国海军136页论文

《应用人工智能来识别针对全球定位系统（GPS）的网络欺骗攻击》美国海军136页论文

专知会员服务

63+阅读 · 2022年9月29日

如何理解信息论？伯克利最新《信息论》图文导论，43页pdf概述信息论中的熵、不确定、熵、互信息、编解码等基础概念

如何理解信息论？伯克利最新《信息论》图文导论，43页pdf概述信息论中的熵、不确定、熵、互信息、编解码等基础概念

专知会员服务

173+阅读 · 2022年7月17日

最新综述论文《人类与人工智能交互中的信任：确定模型、措施和方法》东京工业大学

最新综述论文《人类与人工智能交互中的信任：确定模型、措施和方法》东京工业大学

专知会员服务

30+阅读 · 2022年6月16日

ISWC2020最佳论文《可解释假信息检测的链接可信度评价》

ISWC2020最佳论文《可解释假信息检测的链接可信度评价》

专知会员服务

20+阅读 · 2020年11月7日

异质信息网络分析与应用综述，软件学报-北京邮电大学

异质信息网络分析与应用综述，软件学报-北京邮电大学

专知会员服务

64+阅读 · 2020年7月9日

【DeepMind】人工智能、价值与对齐，Artificial Intelligence, Values, and Alignment

【DeepMind】人工智能、价值与对齐，Artificial Intelligence, Values, and Alignment

专知会员服务

38+阅读 · 2020年1月13日

论深度学习的信息瓶颈理论（On the information bottleneck theory of deep learning）

论深度学习的信息瓶颈理论（On the information bottleneck theory of deep learning）

专知会员服务

66+阅读 · 2019年12月20日

热门VIP内容

开通专知VIP会员享更多权益服务

2026年俄罗斯新型喷气动力无人机Geran-5的技术规格

美太空军发布两份聚焦2040年规划的文件：《2040年未来作战环境》和《2040年目标部队》（附文件）

《俄罗斯构建服务于人工智能驱动自主性的主权无人机生态系统》（2026报告）

基于数据优化的人机协同与机器人僚机

相关资讯

【博士论文】《安全博弈中的分层规划：战略、战术和行动决策的博弈论方法》南加州大学

【博士论文】《安全博弈中的分层规划：战略、战术和行动决策的博弈论方法》南加州大学

专知

24+阅读 · 2022年9月25日

从信息论的角度来理解损失函数

从信息论的角度来理解损失函数

深度学习每日摘要

17+阅读 · 2019年4月7日

【混合智能】人机混合智能的哲学思考

【混合智能】人机混合智能的哲学思考

产业智能官

12+阅读 · 2018年10月28日

从香农熵到手推KL散度：一文带你纵览机器学习中的信息论

从香农熵到手推KL散度：一文带你纵览机器学习中的信息论

算法与数学之美

10+阅读 · 2018年1月14日

基于信息理论的机器学习

基于信息理论的机器学习

专知

22+阅读 · 2017年11月23日

【论文】变分推断（Variational inference)的总结

【论文】变分推断（Variational inference)的总结

机器学习研究会

39+阅读 · 2017年11月16日

【直观详解】信息熵、交叉熵和相对熵

【直观详解】信息熵、交叉熵和相对熵

机器学习研究会

10+阅读 · 2017年11月7日

Representation Learning on Network 网络表示学习

Representation Learning on Network 网络表示学习

全球人工智能

10+阅读 · 2017年10月19日

知识图谱 vs. 对话系统专题讨论 - PaperWeekly 社区

知识图谱 vs. 对话系统专题讨论 - PaperWeekly 社区

PaperWeekly

10+阅读 · 2017年10月18日

FCS 论坛 | 孟德宇：误差建模原理

FCS 论坛 | 孟德宇：误差建模原理

FCS

15+阅读 · 2017年8月17日

相关论文

On the Structure of Information

Arxiv

0+阅读 · 2月19日

The Obfuscation Atlas: Mapping Where Honesty Emerges in RLVR with Deception Probes

Arxiv

0+阅读 · 2月17日

Modelling Trust and Trusted Systems: A Category Theoretic Approach

Arxiv

0+阅读 · 2月11日

The Refutability Gap: Challenges in Validating Reasoning by Large Language Models

Arxiv

0+阅读 · 2月10日

The Refutability Gap: Challenges in Validating Reasoning by Large Language Models

Arxiv

0+阅读 · 2月9日

An Information-Theoretic Framework for Comparing Voice and Text Explainability

Arxiv

0+阅读 · 2月6日

OpenDeception: Learning Deception and Trust in Human-AI Interaction via Multi-Agent Simulation

Arxiv

0+阅读 · 2月6日

Information-Theoretic Causal Bounds under Unmeasured Confounding

Arxiv

0+阅读 · 2月3日

On the Separability of Information in Diffusion Models

Arxiv

0+阅读 · 1月30日

Data-Driven Information-Theoretic Causal Bounds under Unmeasured Confounding

Arxiv

0+阅读 · 1月23日

相关基金

正则双极值模糊推理的理论与方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

信息不完全的双边匹配决策方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

广义双随机相位编码系统中以QR码为载体的信息加密及无损恢复

国家自然科学基金

0+阅读 · 2015年12月31日

基于犹豫模糊语言信息的定性决策理论与方法

国家自然科学基金

2+阅读 · 2015年12月31日

基于虚拟原型的信息物理融合系统高效可信构造研究

国家自然科学基金

8+阅读 · 2015年12月31日

面向异构信息网络中实体归类的模糊聚类

国家自然科学基金

1+阅读 · 2015年12月31日

基于信息密度的广义不确定直觉模糊集成算子及其应用

国家自然科学基金

0+阅读 · 2014年12月31日

信息论学习中的正则化及相关高维数据分析方法的数学理论

国家自然科学基金

12+阅读 · 2014年12月31日

不确定性推理与语义网中知识表示的数学基础

国家自然科学基金

18+阅读 · 2012年12月31日

基于博弈论的信息安全理论与方法研究

国家自然科学基金

10+阅读 · 2012年12月31日

微信扫码咨询专知VIP会员