基于分位数曲线的模拟器保真度无模型评估方法 (Model-Free Assessment of Simulator Fidelity via Quantile Curves) - 专知论文

会员服务 ·

0

输出 · 模型评估 · 样本 · 推断 · 不确定 ·

Model-Free Assessment of Simulator Fidelity via Quantile Curves

翻译：基于分位数曲线的模拟器保真度无模型评估方法

Garud Iyengar,Yu-Shiou Willy Lin,Kaizheng Wang

from arxiv, 35 pages, 14 figures

As generative AI models are increasingly used to simulate real-world systems, quantifying the ``sim-to-real'' gap is critical. The distributional discrepancy between real and simulated outputs is a random variable driven by the stochastic input scenario. A fundamental challenge is that for any given input, the ground-truth and simulated output distributions are only observable through finite batches of samples, often of heterogeneous sizes. This renders standard predictive inference methods inapplicable, as they seek to quantify uncertainty in observable outputs rather than their underlying population parameters. To address this, we construct confidence sets for these latent parameters and use them to derive a robust proxy for the sim-to-real discrepancy. We then estimate the quantile function of this proxy to provide a comprehensive risk profile of the simulator. Our method is model-agnostic and handles general output spaces, such as categorical survey responses and continuous multi-dimensional sensor data. By rigorously accounting for sampling error, the resulting risk profile supports statistical inference for the real output distribution in a new scenario, the calculation of risk measures like Conditional Value-at-Risk (CVaR), and principled comparisons across simulators. We demonstrate the practical utility of this method by evaluating the alignment of four major LLMs with human populations on the WorldValueBench dataset.

翻译：随着生成式人工智能模型日益广泛地应用于现实世界系统的模拟，量化"模拟-现实"差距变得至关重要。真实输出与模拟输出之间的分布差异是一个由随机输入场景驱动的随机变量。一个根本性挑战在于：对于任意给定输入，真实分布与模拟输出分布仅能通过有限批次的样本进行观测，且这些样本的规模往往存在异质性。这使得标准的预测推断方法无法适用，因为这些方法旨在量化可观测输出的不确定性，而非其潜在总体参数的不确定性。为解决此问题，我们为这些隐参数构建置信集，并利用其推导出模拟-现实差异的稳健代理指标。随后通过估计该代理指标的分位数函数，为模拟器提供全面的风险画像。我们的方法具有模型无关性，可处理包括分类调查响应与连续多维传感器数据在内的通用输出空间。通过严格考虑抽样误差，所得风险画像能够支持以下应用：新场景中真实输出分布的统计推断、条件风险价值（CVaR）等风险指标的计算，以及跨模拟器的原则性比较。我们通过在WorldValueBench数据集上评估四个主流大语言模型与人类群体的对齐度，验证了该方法的实际效用。

0

相关内容

【牛津大学博士论文】学习分布不确定性估计的语义分割，191页pdf

【牛津大学博士论文】学习分布不确定性估计的语义分割，191页pdf

专知会员服务

30+阅读 · 2024年7月31日

【伯克利博士论文】零样本机器人感知的视觉-语言表示，74页pdf

【伯克利博士论文】零样本机器人感知的视觉-语言表示，74页pdf

专知会员服务

30+阅读 · 2024年5月13日

【牛津大学博士论文】基于评分规则的生成模型统计推断, 274页pdf

【牛津大学博士论文】基于评分规则的生成模型统计推断, 274页pdf

专知会员服务

40+阅读 · 2023年7月5日

《生成式模型: 变分自编码器与扩散模型》，75页ppt，Google DeepMind科学家Ruiqi Gao

《生成式模型: 变分自编码器与扩散模型》，75页ppt，Google DeepMind科学家Ruiqi Gao

专知会员服务

66+阅读 · 2023年6月10日

【MIT博士论文】机器学习模型鲁棒性的探索、改进与验证，208页pdf

【MIT博士论文】机器学习模型鲁棒性的探索、改进与验证，208页pdf

专知会员服务

47+阅读 · 2023年4月2日

《一种与领域无关的终身学习系统表征方法》70页长论文

《一种与领域无关的终身学习系统表征方法》70页长论文

专知会员服务

22+阅读 · 2023年3月15日

机器学习模型如何可靠？191页最新《机器学习模型在户外的鲁棒性、评估和自适应》博士论文

机器学习模型如何可靠？191页最新《机器学习模型在户外的鲁棒性、评估和自适应》博士论文

专知会员服务

46+阅读 · 2023年3月11日

深度模型如何可信？牛津大学博士论文《具有硬逻辑约束的深度学习》，158页pdf

深度模型如何可信？牛津大学博士论文《具有硬逻辑约束的深度学习》，158页pdf

专知会员服务

43+阅读 · 2022年10月14日

什么是扩散模型？谷歌大脑Calvin Luo最新《扩散模型理解》，带你对基于评分与基于能量的扩散模型的统一视角数学理解

什么是扩散模型？谷歌大脑Calvin Luo最新《扩散模型理解》，带你对基于评分与基于能量的扩散模型的统一视角数学理解

专知会员服务

83+阅读 · 2022年8月27日

【斯坦福博士论文】深度生成模型的评估，126页pdf

专知会员服务

36+阅读 · 2021年7月19日

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

专知

10+阅读 · 2023年4月6日

【干货书】MLOps是什么？MLOps实战：操作机器学习模型，461页pdf

【干货书】MLOps是什么？MLOps实战：操作机器学习模型，461页pdf

专知

15+阅读 · 2022年2月16日

您可以相信模型的不确定性吗？

您可以相信模型的不确定性吗？

TensorFlow

14+阅读 · 2020年1月31日

赛尔笔记 | 条件变分自编码器（CVAE）

赛尔笔记 | 条件变分自编码器（CVAE）

AINLP

28+阅读 · 2019年11月8日

Dropout、梯度消失/爆炸、Adam优化算法，神经网络优化算法看这一篇就够了

Dropout、梯度消失/爆炸、Adam优化算法，神经网络优化算法看这一篇就够了

AI100

14+阅读 · 2019年9月1日

斯坦福CS236-深度生成模型2019-全套课程资料分享

斯坦福CS236-深度生成模型2019-全套课程资料分享

深度学习与NLP

20+阅读 · 2019年8月20日

开发 | 谷歌对无监督解耦方法进行了大规模评估，还开源了用来实验的开发库！

开发 | 谷歌对无监督解耦方法进行了大规模评估，还开源了用来实验的开发库！

AI科技评论

10+阅读 · 2019年5月13日

你的算法可靠吗？神经网络不确定性度量

你的算法可靠吗？神经网络不确定性度量

专知

40+阅读 · 2019年4月27日

这可能是「多模态机器学习」最通俗易懂的介绍

这可能是「多模态机器学习」最通俗易懂的介绍

计算机视觉life

113+阅读 · 2018年12月20日

变分自编码器（Variational Autoencoder, VAE）通俗教程，细节、基础、符号解释很齐全

变分自编码器（Variational Autoencoder, VAE）通俗教程，细节、基础、符号解释很齐全

CreateAMind

12+阅读 · 2018年4月7日

测量误差数据下部分线性模型有约束统计推断理论

国家自然科学基金

2+阅读 · 2015年12月31日

分布无关的概率图模型结构学习方法的研究

国家自然科学基金

4+阅读 · 2015年12月31日

含非正态及缺失数据的结构方程模型分析

国家自然科学基金

0+阅读 · 2015年12月31日

方差正则化的分类模型选择方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

复杂数据模型中的分布逼近方法

国家自然科学基金

3+阅读 · 2014年12月31日

高维数据下的模型平均方法

国家自然科学基金

6+阅读 · 2014年12月31日

测量误差数据下约束线性模型的有偏估计及变量选择研究

国家自然科学基金

0+阅读 · 2014年12月31日

线性时序关系下推理的概率计量化模型

国家自然科学基金

0+阅读 · 2014年12月31日

广义线性模型的组变量选择及其在信用评分中的应用

国家自然科学基金

2+阅读 · 2014年12月31日

变换结构方程模型的非参数贝叶斯分析

国家自然科学基金

4+阅读 · 2014年12月31日

Latent Diffusion Model without Variational Autoencoder

Arxiv

0+阅读 · 3月2日

Model Agreement via Anchoring

Arxiv

0+阅读 · 2月26日

Quantifying and Attributing Submodel Uncertainty in Stochastic Simulation Models and Digital Twins

Arxiv

0+阅读 · 2月18日

Stabilizing Test-Time Adaptation of High-Dimensional Simulation Surrogates via D-Optimal Statistics

Arxiv

0+阅读 · 2月17日

Don't Forget Its Variance! The Minimum Path Variance Principle for Accurate and Stable Score-Based Models

Arxiv

0+阅读 · 2月17日

Simulating the Real World: A Unified Survey of Multimodal Generative Models

Arxiv

0+阅读 · 2月16日

A Survey on Generative Modeling with Limited Data, Few Shots, and Zero Shot

Arxiv

0+阅读 · 2月14日

Self-Supervised Image Super-Resolution Quality Assessment based on Content-Free Multi-Model Oriented Representation Learning

Arxiv

0+阅读 · 2月11日

Nonparametric estimation of a factorizable density using diffusion models

Arxiv

0+阅读 · 2月11日

The Redundancy of Non-Singular Channel Simulation

Arxiv

0+阅读 · 2月7日

VIP会员

文章信息

相关主题

最新内容

认知战的本体论基础（2026中文报告）

认知战的本体论基础（2026中文报告）

专知会员服务

3+阅读 · 57分钟前

美空军条令（2026）：外国对内防御

美空军条令（2026）：外国对内防御

专知会员服务

2+阅读 · 今天1:32

美国与以色列如何在攻击伊朗中使用人工智能

美国与以色列如何在攻击伊朗中使用人工智能

专知会员服务

5+阅读 · 4月16日

《面向大语言模型引导规划、Bandit算法驱动探索与多智能体导航的分层决策问题研究》180页

《面向大语言模型引导规划、Bandit算法驱动探索与多智能体导航的分层决策问题研究》180页

专知会员服务

6+阅读 · 4月16日

《自动化战略情报管控》

《自动化战略情报管控》

专知会员服务

3+阅读 · 4月16日

《反无人机蜂群技术研究：基于小队策略构建大规模无人机防御》

《反无人机蜂群技术研究：基于小队策略构建大规模无人机防御》

专知会员服务

9+阅读 · 4月16日

得失评估：审视对伊朗战争的轨迹（简报）

得失评估：审视对伊朗战争的轨迹（简报）

专知会员服务

3+阅读 · 4月16日

【CMU博士论文】迈向可解释机器学习的理论基础

【CMU博士论文】迈向可解释机器学习的理论基础

专知会员服务

3+阅读 · 4月16日

CVPR 2026 | HulluEdit：基于正交子空间编辑的多模态大语言模型幻觉缓解框架

CVPR 2026 | HulluEdit：基于正交子空间编辑的多模态大语言模型幻觉缓解框架

专知会员服务

3+阅读 · 4月16日

无人机视觉语言导航：研究进展、挑战与技术路线图

无人机视觉语言导航：研究进展、挑战与技术路线图

专知会员服务

2+阅读 · 4月16日

《基于强化学习的反无人机蜂群拦截优先级排序》

《基于强化学习的反无人机蜂群拦截优先级排序》

专知会员服务

9+阅读 · 4月16日

乌克兰反无人机方案“天穹哨兵”解析：一款人工智能驱动的近程防空系统

乌克兰反无人机方案“天穹哨兵”解析：一款人工智能驱动的近程防空系统

专知会员服务

4+阅读 · 4月16日

美军2026条令《指挥官装甲装备维护技能测试计划》

美军2026条令《指挥官装甲装备维护技能测试计划》

专知会员服务

6+阅读 · 4月16日

《俄罗斯构建服务于人工智能驱动自主性的主权无人机生态系统》（2026报告）

《俄罗斯构建服务于人工智能驱动自主性的主权无人机生态系统》（2026报告）

专知会员服务

8+阅读 · 4月16日

2026年俄罗斯新型喷气动力无人机Geran-5的技术规格

2026年俄罗斯新型喷气动力无人机Geran-5的技术规格

专知会员服务

4+阅读 · 4月16日

相关VIP内容

【牛津大学博士论文】学习分布不确定性估计的语义分割，191页pdf

【牛津大学博士论文】学习分布不确定性估计的语义分割，191页pdf

专知会员服务

30+阅读 · 2024年7月31日

【伯克利博士论文】零样本机器人感知的视觉-语言表示，74页pdf

【伯克利博士论文】零样本机器人感知的视觉-语言表示，74页pdf

专知会员服务

30+阅读 · 2024年5月13日

【牛津大学博士论文】基于评分规则的生成模型统计推断, 274页pdf

【牛津大学博士论文】基于评分规则的生成模型统计推断, 274页pdf

专知会员服务

40+阅读 · 2023年7月5日

《生成式模型: 变分自编码器与扩散模型》，75页ppt，Google DeepMind科学家Ruiqi Gao

《生成式模型: 变分自编码器与扩散模型》，75页ppt，Google DeepMind科学家Ruiqi Gao

专知会员服务

66+阅读 · 2023年6月10日

【MIT博士论文】机器学习模型鲁棒性的探索、改进与验证，208页pdf

【MIT博士论文】机器学习模型鲁棒性的探索、改进与验证，208页pdf

专知会员服务

47+阅读 · 2023年4月2日

《一种与领域无关的终身学习系统表征方法》70页长论文

《一种与领域无关的终身学习系统表征方法》70页长论文

专知会员服务

22+阅读 · 2023年3月15日

机器学习模型如何可靠？191页最新《机器学习模型在户外的鲁棒性、评估和自适应》博士论文

机器学习模型如何可靠？191页最新《机器学习模型在户外的鲁棒性、评估和自适应》博士论文

专知会员服务

46+阅读 · 2023年3月11日

深度模型如何可信？牛津大学博士论文《具有硬逻辑约束的深度学习》，158页pdf

深度模型如何可信？牛津大学博士论文《具有硬逻辑约束的深度学习》，158页pdf

专知会员服务

43+阅读 · 2022年10月14日

什么是扩散模型？谷歌大脑Calvin Luo最新《扩散模型理解》，带你对基于评分与基于能量的扩散模型的统一视角数学理解

什么是扩散模型？谷歌大脑Calvin Luo最新《扩散模型理解》，带你对基于评分与基于能量的扩散模型的统一视角数学理解

专知会员服务

83+阅读 · 2022年8月27日

【斯坦福博士论文】深度生成模型的评估，126页pdf

专知会员服务

36+阅读 · 2021年7月19日

热门VIP内容

开通专知VIP会员享更多权益服务

美空军条令（2026）：外国对内防御

《面向大语言模型引导规划、Bandit算法驱动探索与多智能体导航的分层决策问题研究》180页

认知战的本体论基础（2026中文报告）

美国与以色列如何在攻击伊朗中使用人工智能

相关资讯

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

多模态怎么用自监督？爱丁堡等最新《自监督多模态学习》综述，详述目标函数、数据对齐和模型架构

专知

10+阅读 · 2023年4月6日

【干货书】MLOps是什么？MLOps实战：操作机器学习模型，461页pdf

【干货书】MLOps是什么？MLOps实战：操作机器学习模型，461页pdf

专知

15+阅读 · 2022年2月16日

您可以相信模型的不确定性吗？

您可以相信模型的不确定性吗？

TensorFlow

14+阅读 · 2020年1月31日

赛尔笔记 | 条件变分自编码器（CVAE）

赛尔笔记 | 条件变分自编码器（CVAE）

AINLP

28+阅读 · 2019年11月8日

Dropout、梯度消失/爆炸、Adam优化算法，神经网络优化算法看这一篇就够了

Dropout、梯度消失/爆炸、Adam优化算法，神经网络优化算法看这一篇就够了

AI100

14+阅读 · 2019年9月1日

斯坦福CS236-深度生成模型2019-全套课程资料分享

斯坦福CS236-深度生成模型2019-全套课程资料分享

深度学习与NLP

20+阅读 · 2019年8月20日

开发 | 谷歌对无监督解耦方法进行了大规模评估，还开源了用来实验的开发库！

开发 | 谷歌对无监督解耦方法进行了大规模评估，还开源了用来实验的开发库！

AI科技评论

10+阅读 · 2019年5月13日

你的算法可靠吗？神经网络不确定性度量

你的算法可靠吗？神经网络不确定性度量

专知

40+阅读 · 2019年4月27日

这可能是「多模态机器学习」最通俗易懂的介绍

这可能是「多模态机器学习」最通俗易懂的介绍

计算机视觉life

113+阅读 · 2018年12月20日

变分自编码器（Variational Autoencoder, VAE）通俗教程，细节、基础、符号解释很齐全

变分自编码器（Variational Autoencoder, VAE）通俗教程，细节、基础、符号解释很齐全

CreateAMind

12+阅读 · 2018年4月7日

相关论文

Latent Diffusion Model without Variational Autoencoder

Arxiv

0+阅读 · 3月2日

Model Agreement via Anchoring

Arxiv

0+阅读 · 2月26日

Quantifying and Attributing Submodel Uncertainty in Stochastic Simulation Models and Digital Twins

Arxiv

0+阅读 · 2月18日

Stabilizing Test-Time Adaptation of High-Dimensional Simulation Surrogates via D-Optimal Statistics

Arxiv

0+阅读 · 2月17日

Don't Forget Its Variance! The Minimum Path Variance Principle for Accurate and Stable Score-Based Models

Arxiv

0+阅读 · 2月17日

Simulating the Real World: A Unified Survey of Multimodal Generative Models

Arxiv

0+阅读 · 2月16日

A Survey on Generative Modeling with Limited Data, Few Shots, and Zero Shot

Arxiv

0+阅读 · 2月14日

Self-Supervised Image Super-Resolution Quality Assessment based on Content-Free Multi-Model Oriented Representation Learning

Arxiv

0+阅读 · 2月11日

Nonparametric estimation of a factorizable density using diffusion models

Arxiv

0+阅读 · 2月11日

The Redundancy of Non-Singular Channel Simulation

Arxiv

0+阅读 · 2月7日

相关基金

测量误差数据下部分线性模型有约束统计推断理论

国家自然科学基金

2+阅读 · 2015年12月31日

分布无关的概率图模型结构学习方法的研究

国家自然科学基金

4+阅读 · 2015年12月31日

含非正态及缺失数据的结构方程模型分析

国家自然科学基金

0+阅读 · 2015年12月31日

方差正则化的分类模型选择方法研究

国家自然科学基金

1+阅读 · 2015年12月31日

复杂数据模型中的分布逼近方法

国家自然科学基金

3+阅读 · 2014年12月31日

高维数据下的模型平均方法

国家自然科学基金

6+阅读 · 2014年12月31日

测量误差数据下约束线性模型的有偏估计及变量选择研究

国家自然科学基金

0+阅读 · 2014年12月31日

线性时序关系下推理的概率计量化模型

国家自然科学基金

0+阅读 · 2014年12月31日

广义线性模型的组变量选择及其在信用评分中的应用

国家自然科学基金

2+阅读 · 2014年12月31日

变换结构方程模型的非参数贝叶斯分析

国家自然科学基金

4+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员