Cultural Compass: A Framework for Organizing Societal Norms to Detect Violations in Human-AI Conversations - 专知论文

会员服务 ·

0

交互 · 人机对话 · 人机交互 · AI · 语言处理 ·

Cultural Compass: A Framework for Organizing Societal Norms to Detect Violations in Human-AI Conversations

翻译：文化罗盘：一种用于组织社会规范以检测人机对话中违规行为的框架

Myra Cheng,Vinodkumar Prabhakaran,Alice Oh,Hayk Stepanyan,Aishwarya Verma,Charu Kalia,Erin MacMurray van Liemt,Sunipa Dev

Generative AI models ought to be useful and safe across cross-cultural contexts. One critical step toward this goal is understanding how AI models adhere to sociocultural norms. While this challenge has gained attention in NLP, existing work lacks both nuance and coverage in understanding and evaluating models' norm adherence. We address these gaps by introducing a taxonomy of norms that clarifies their contexts (e.g., distinguishing between human-human norms that models should recognize and human-AI interactional norms that apply to the human-AI interaction itself), specifications (e.g., relevant domains), and mechanisms (e.g., modes of enforcement). We demonstrate how our taxonomy can be operationalized to automatically evaluate models' norm adherence in naturalistic, open-ended settings. Our exploratory analyses suggest that state-of-the-art models frequently violate norms, though violation rates vary by model, interactional context, and country. We further show that violation rates also vary by prompt intent and situational framing. Our taxonomy and demonstrative evaluation pipeline enable nuanced, context-sensitive evaluation of cultural norm adherence in realistic settings.

翻译：生成式人工智能模型应当在跨文化环境中既实用又安全。实现这一目标的关键一步在于理解AI模型如何遵循社会文化规范。尽管这一挑战已在自然语言处理领域受到关注，但现有工作在理解和评估模型规范遵循方面既缺乏细致性也缺乏覆盖度。我们通过引入一种规范分类法来弥补这些不足，该分类法明确了规范的语境（例如，区分模型应当识别的人与人之间的规范与适用于人机交互本身的人机交互规范）、规范说明（例如，相关领域）以及实施机制（例如，执行模式）。我们展示了如何将这一分类法操作化，以在自然、开放式的环境中自动评估模型的规范遵循情况。我们的探索性分析表明，最先进的模型经常违反规范，尽管违规率因模型、交互语境和国家而异。我们进一步证明，违规率还因提示意图和情境框架的不同而变化。我们的分类法和示范性评估流程能够实现对现实场景中文化规范遵循情况的细致、语境敏感的评价。

0

相关内容

美智库《获取生成式人工智能以提升美国防部影响力活动效能》最新报告

美智库《获取生成式人工智能以提升美国防部影响力活动效能》最新报告

专知会员服务

23+阅读 · 2025年7月23日

《军事网络工具中运用生成式人工智能的伦理与对抗风险》最新报告

《军事网络工具中运用生成式人工智能的伦理与对抗风险》最新报告

专知会员服务

17+阅读 · 2025年6月21日

国家标准《网络安全技术生成式人工智能服务安全基本要求》征求意见稿

国家标准《网络安全技术生成式人工智能服务安全基本要求》征求意见稿

专知会员服务

28+阅读 · 2024年6月6日

《人类-人工智能安全：生成式人工智能和控制系统安全的后继者》

《人类-人工智能安全：生成式人工智能和控制系统安全的后继者》

专知会员服务

43+阅读 · 2024年5月27日

生成式人工智能数据标注安全规范

生成式人工智能数据标注安全规范

专知会员服务

52+阅读 · 2024年4月10日

人工智能伦理计算

人工智能伦理计算

专知会员服务

39+阅读 · 2023年10月13日

联合国教科文组织发布《生成式AI与教育未来》应用指南，48页pdf

联合国教科文组织发布《生成式AI与教育未来》应用指南，48页pdf

专知会员服务

49+阅读 · 2023年9月13日

重磅！国家标准《人工智能计算平台安全框架》征求意见稿发布，38页pdf详细规定AI计算安全框架

重磅！国家标准《人工智能计算平台安全框架》征求意见稿发布，38页pdf详细规定AI计算安全框架

专知会员服务

75+阅读 · 2023年6月12日

人工智能安全框架

专知会员服务

64+阅读 · 2021年7月5日

【DeepMind】人工智能、价值与对齐，Artificial Intelligence, Values, and Alignment

【DeepMind】人工智能、价值与对齐，Artificial Intelligence, Values, and Alignment

专知会员服务

38+阅读 · 2020年1月13日

ChatGPT大模型如何做科学研究? CMU提出《大模型智能体系统》，高推理展现出大型语言模型的新兴自主科学研究能力

ChatGPT大模型如何做科学研究? CMU提出《大模型智能体系统》，高推理展现出大型语言模型的新兴自主科学研究能力

专知

17+阅读 · 2023年4月12日

【ChatGPT系列报告】人工智能行业专题报告：多模态AI研究框架，17页ppt

【ChatGPT系列报告】人工智能行业专题报告：多模态AI研究框架，17页ppt

专知

23+阅读 · 2023年4月8日

推荐！《用于兵棋推演和建模的人工智能》兰德、耶鲁大学2022最新16页论文

推荐！《用于兵棋推演和建模的人工智能》兰德、耶鲁大学2022最新16页论文

专知

53+阅读 · 2022年11月14日

【AI+军事】《用于威胁评估的人工智能工具》加拿大国防研究和发展部技术报告，附中文版pdf

【AI+军事】《用于威胁评估的人工智能工具》加拿大国防研究和发展部技术报告，附中文版pdf

专知

91+阅读 · 2022年4月17日

《人工智能安全测评白皮书》，99页pdf

《人工智能安全测评白皮书》，99页pdf

专知

36+阅读 · 2022年2月26日

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

AI科技评论

12+阅读 · 2019年5月2日

知识在检索式对话系统的应用

知识在检索式对话系统的应用

微信AI

32+阅读 · 2018年9月20日

基于深度学习的文本分类6大算法-原理、结构、论文、源码打包分享

基于深度学习的文本分类6大算法-原理、结构、论文、源码打包分享

深度学习与NLP

25+阅读 · 2018年7月18日

人工智能对网络空间安全的影响

人工智能对网络空间安全的影响

走向智能论坛

21+阅读 · 2018年6月7日

【论文】所见所想所真，对抗学习GAN提升跨模态检索效果！阿里巴巴AI Labs等团队最新工作

【论文】所见所想所真，对抗学习GAN提升跨模态检索效果！阿里巴巴AI Labs等团队最新工作

专知

12+阅读 · 2017年12月21日

基于信号理论和众包的社交媒体平台安全性和可信度群体评估方法研究

国家自然科学基金

0+阅读 · 2017年12月31日

基于时空模式的复杂行为识别方法研究

国家自然科学基金

2+阅读 · 2017年12月31日

基于深度学习的复杂场景下人体行为识别研究

国家自然科学基金

9+阅读 · 2015年12月31日

结合知识图谱的概率话题模型研究

国家自然科学基金

10+阅读 · 2015年12月31日

面向社群智能的认知网络中机会数据通信机制研究

国家自然科学基金

0+阅读 · 2015年12月31日

社会化媒体中基于群体智慧的知识萃取、组织与服务

国家自然科学基金

0+阅读 · 2014年12月31日

多域网络安全的异构策略语义形态与验证机制

国家自然科学基金

0+阅读 · 2014年12月31日

面向汉语文本理解的语义计算方法

国家自然科学基金

8+阅读 · 2014年12月31日

多语言大数据环境下的复杂网络行为分析、预测和干预

国家自然科学基金

4+阅读 · 2014年12月31日

智慧城市数字信息资源安全保障研究

国家自然科学基金

18+阅读 · 2014年12月31日

Astra: AI Safety, Trust, & Risk Assessment

Astra: AI Safety, Trust, & Risk Assessment

Arxiv

0+阅读 · 2月19日

RelianceScope: An Analytical Framework for Examining Students' Reliance on Generative AI Chatbots in Problem Solving

Arxiv

0+阅读 · 2月18日

RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding

Arxiv

0+阅读 · 2月14日

Group Selection as a Safeguard Against AI Substitution

Arxiv

0+阅读 · 2月3日

SEA-Guard: Culturally Grounded Multilingual Safeguard for Southeast Asia

Arxiv

0+阅读 · 2月2日

Constructing Safety Cases for AI Systems: A Reusable Template Framework

Arxiv

0+阅读 · 1月30日

SysMoBench: Evaluating AI on Formally Modeling Complex Real-World Systems

Arxiv

0+阅读 · 1月28日

The Case for "Thick Evaluations" of Cultural Representation in AI

Arxiv

0+阅读 · 1月20日

Compass vs Railway Tracks: Unpacking User Mental Models for Communicating Long-Horizon Work to Humans vs. AI

Arxiv

0+阅读 · 1月17日

Provocations from the Humanities for Generative AI Research

Arxiv

0+阅读 · 1月12日

VIP会员

文章信息

相关主题

最新内容

BES：让语言模型通过双向进化搜索自我改进

BES：让语言模型通过双向进化搜索自我改进

专知会员服务

3+阅读 · 5月30日

ICML 2026 | 揭开视觉语言模型计数瓶颈：看得到，却说不出

ICML 2026 | 揭开视觉语言模型计数瓶颈：看得到，却说不出

专知会员服务

3+阅读 · 5月30日

以色列-美国-伊朗战争中的无人机：关键要点

以色列-美国-伊朗战争中的无人机：关键要点

专知会员服务

4+阅读 · 5月30日

美以伊战争：首次人工智能战争——军事自主性困境

美以伊战争：首次人工智能战争——军事自主性困境

专知会员服务

4+阅读 · 5月30日

《Palantir任务保障性软件安全标准（MA-S2）》

《Palantir任务保障性软件安全标准（MA-S2）》

专知会员服务

10+阅读 · 5月30日

《美海军利用扩展现实增强知识流动研究》300页报告

《美海军利用扩展现实增强知识流动研究》300页报告

专知会员服务

6+阅读 · 5月30日

基于声学的无人机检测技术综述

基于声学的无人机检测技术综述

专知会员服务

8+阅读 · 5月30日

《当代混合战争分析框架：俄乌战争经验教训》

《当代混合战争分析框架：俄乌战争经验教训》

专知会员服务

8+阅读 · 5月30日

生成式AI基础小册子绪论解读：一条数学地基路线，178页pdf

生成式AI基础小册子绪论解读：一条数学地基路线，178页pdf

专知会员服务

11+阅读 · 5月29日

AutoScientists：自组织智能体团队驱动长期科学实验

AutoScientists：自组织智能体团队驱动长期科学实验

专知会员服务

6+阅读 · 5月29日

《阿利·伯克级驱逐舰的战损修理：桌面推演结果》报告

《阿利·伯克级驱逐舰的战损修理：桌面推演结果》报告

专知会员服务

6+阅读 · 5月29日

战略前沿人工智能的再思考（中文）

战略前沿人工智能的再思考（中文）

专知会员服务

8+阅读 · 5月29日

《量化地基防空系统间接效应的博弈论方法》

《量化地基防空系统间接效应的博弈论方法》

专知会员服务

6+阅读 · 5月29日

传感器网络：美国如何探测来自伊朗的导弹与无人机

传感器网络：美国如何探测来自伊朗的导弹与无人机

专知会员服务

6+阅读 · 5月29日

《无人机战争中的经济不对称：伊朗“沙赫德-136”对抗以色列“铁穹”防御系统的案例研究》

《无人机战争中的经济不对称：伊朗“沙赫德-136”对抗以色列“铁穹”防御系统的案例研究》

专知会员服务

10+阅读 · 5月29日

相关VIP内容

美智库《获取生成式人工智能以提升美国防部影响力活动效能》最新报告

美智库《获取生成式人工智能以提升美国防部影响力活动效能》最新报告

专知会员服务

23+阅读 · 2025年7月23日

《军事网络工具中运用生成式人工智能的伦理与对抗风险》最新报告

《军事网络工具中运用生成式人工智能的伦理与对抗风险》最新报告

专知会员服务

17+阅读 · 2025年6月21日

国家标准《网络安全技术生成式人工智能服务安全基本要求》征求意见稿

国家标准《网络安全技术生成式人工智能服务安全基本要求》征求意见稿

专知会员服务

28+阅读 · 2024年6月6日

《人类-人工智能安全：生成式人工智能和控制系统安全的后继者》

《人类-人工智能安全：生成式人工智能和控制系统安全的后继者》

专知会员服务

43+阅读 · 2024年5月27日

生成式人工智能数据标注安全规范

生成式人工智能数据标注安全规范

专知会员服务

52+阅读 · 2024年4月10日

人工智能伦理计算

人工智能伦理计算

专知会员服务

39+阅读 · 2023年10月13日

联合国教科文组织发布《生成式AI与教育未来》应用指南，48页pdf

联合国教科文组织发布《生成式AI与教育未来》应用指南，48页pdf

专知会员服务

49+阅读 · 2023年9月13日

重磅！国家标准《人工智能计算平台安全框架》征求意见稿发布，38页pdf详细规定AI计算安全框架

重磅！国家标准《人工智能计算平台安全框架》征求意见稿发布，38页pdf详细规定AI计算安全框架

专知会员服务

75+阅读 · 2023年6月12日

人工智能安全框架

专知会员服务

64+阅读 · 2021年7月5日

【DeepMind】人工智能、价值与对齐，Artificial Intelligence, Values, and Alignment

【DeepMind】人工智能、价值与对齐，Artificial Intelligence, Values, and Alignment

专知会员服务

38+阅读 · 2020年1月13日

热门VIP内容

开通专知VIP会员享更多权益服务

ICML 2026 | 揭开视觉语言模型计数瓶颈：看得到，却说不出

美以伊战争：首次人工智能战争——军事自主性困境

BES：让语言模型通过双向进化搜索自我改进

以色列-美国-伊朗战争中的无人机：关键要点

相关资讯

ChatGPT大模型如何做科学研究? CMU提出《大模型智能体系统》，高推理展现出大型语言模型的新兴自主科学研究能力

ChatGPT大模型如何做科学研究? CMU提出《大模型智能体系统》，高推理展现出大型语言模型的新兴自主科学研究能力

专知

17+阅读 · 2023年4月12日

【ChatGPT系列报告】人工智能行业专题报告：多模态AI研究框架，17页ppt

【ChatGPT系列报告】人工智能行业专题报告：多模态AI研究框架，17页ppt

专知

23+阅读 · 2023年4月8日

推荐！《用于兵棋推演和建模的人工智能》兰德、耶鲁大学2022最新16页论文

推荐！《用于兵棋推演和建模的人工智能》兰德、耶鲁大学2022最新16页论文

专知

53+阅读 · 2022年11月14日

【AI+军事】《用于威胁评估的人工智能工具》加拿大国防研究和发展部技术报告，附中文版pdf

【AI+军事】《用于威胁评估的人工智能工具》加拿大国防研究和发展部技术报告，附中文版pdf

专知

91+阅读 · 2022年4月17日

《人工智能安全测评白皮书》，99页pdf

《人工智能安全测评白皮书》，99页pdf

专知

36+阅读 · 2022年2月26日

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

中科院自动化所提出 BIFT 模型：面向自然语言生成，同步双向推断

AI科技评论

12+阅读 · 2019年5月2日

知识在检索式对话系统的应用

知识在检索式对话系统的应用

微信AI

32+阅读 · 2018年9月20日

基于深度学习的文本分类6大算法-原理、结构、论文、源码打包分享

基于深度学习的文本分类6大算法-原理、结构、论文、源码打包分享

深度学习与NLP

25+阅读 · 2018年7月18日

人工智能对网络空间安全的影响

人工智能对网络空间安全的影响

走向智能论坛

21+阅读 · 2018年6月7日

【论文】所见所想所真，对抗学习GAN提升跨模态检索效果！阿里巴巴AI Labs等团队最新工作

【论文】所见所想所真，对抗学习GAN提升跨模态检索效果！阿里巴巴AI Labs等团队最新工作

专知

12+阅读 · 2017年12月21日

相关论文

Astra: AI Safety, Trust, & Risk Assessment

Astra: AI Safety, Trust, & Risk Assessment

Arxiv

0+阅读 · 2月19日

RelianceScope: An Analytical Framework for Examining Students' Reliance on Generative AI Chatbots in Problem Solving

Arxiv

0+阅读 · 2月18日

RAVENEA: A Benchmark for Multimodal Retrieval-Augmented Visual Culture Understanding

Arxiv

0+阅读 · 2月14日

Group Selection as a Safeguard Against AI Substitution

Arxiv

0+阅读 · 2月3日

SEA-Guard: Culturally Grounded Multilingual Safeguard for Southeast Asia

Arxiv

0+阅读 · 2月2日

Constructing Safety Cases for AI Systems: A Reusable Template Framework

Arxiv

0+阅读 · 1月30日

SysMoBench: Evaluating AI on Formally Modeling Complex Real-World Systems

Arxiv

0+阅读 · 1月28日

The Case for "Thick Evaluations" of Cultural Representation in AI

Arxiv

0+阅读 · 1月20日

Compass vs Railway Tracks: Unpacking User Mental Models for Communicating Long-Horizon Work to Humans vs. AI

Arxiv

0+阅读 · 1月17日

Provocations from the Humanities for Generative AI Research

Arxiv

0+阅读 · 1月12日

相关基金

基于信号理论和众包的社交媒体平台安全性和可信度群体评估方法研究

国家自然科学基金

0+阅读 · 2017年12月31日

基于时空模式的复杂行为识别方法研究

国家自然科学基金

2+阅读 · 2017年12月31日

基于深度学习的复杂场景下人体行为识别研究

国家自然科学基金

9+阅读 · 2015年12月31日

结合知识图谱的概率话题模型研究

国家自然科学基金

10+阅读 · 2015年12月31日

面向社群智能的认知网络中机会数据通信机制研究

国家自然科学基金

0+阅读 · 2015年12月31日

社会化媒体中基于群体智慧的知识萃取、组织与服务

国家自然科学基金

0+阅读 · 2014年12月31日

多域网络安全的异构策略语义形态与验证机制

国家自然科学基金

0+阅读 · 2014年12月31日

面向汉语文本理解的语义计算方法

国家自然科学基金

8+阅读 · 2014年12月31日

多语言大数据环境下的复杂网络行为分析、预测和干预

国家自然科学基金

4+阅读 · 2014年12月31日

智慧城市数字信息资源安全保障研究

国家自然科学基金

18+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员