We demonstrate a user-focused verification approach for evaluating probability forecasts of binary outcomes (also known as probabilistic classifiers) that is (i) based on proper scoring rules, (ii) focuses on user decision thresholds, and (iii) provides actionable insights. We argue that the widespread use of categorical performance diagrams and the critical success index to evaluate probabilistic forecasts may produce misleading results and instead illustrate how Murphy diagrams are better for understanding performance across user decision thresholds. The use of proper scoring rules that account for the relative importance of different user decision thresholds is shown to impact scores of overall performance, as well as supporting measures of discrimination and calibration. These methods are demonstrated by evaluating several probabilistic thunderstorm forecast systems. Furthermore, we illustrate an approach that allows a fair comparison between continuous probabilistic forecasts and categorical outlooks using the FIxed Risk Multicategorical (FIRM) score and establish the relationship between the FIRM score and Murphy diagrams. The results highlight how the performance of thunderstorm forecasts produced for tropical Australian waters varies between operational meteorologists and an automated system depending on what decision thresholds a user is acting on. A hindcast of a new automated system is shown to generally perform better than both meteorologists and the old automated system across tropical Australian waters. While the methods are illustrated using thunderstorm forecasts, they are applicable for evaluating probabilistic forecasts for any situation with binary outcomes.


翻译:我们提出了一种面向用户的验证方法,用于评估二元结果(也称为概率分类器)的概率预报。该方法(i)基于精确评分规则,(ii)聚焦于用户决策阈值,并(iii)提供可操作的见解。我们认为,广泛使用分类性能图和临界成功指数来评估概率预报可能产生误导性结果,并相应阐述了墨菲图如何能更好地理解不同用户决策阈值下的表现。通过纳入不同用户决策阈值的相对重要性,精确评分规则的使用被证明会影响整体性能得分,以及区分度和校准度的支持性度量。这些方法通过评估多个雷暴概率预报系统进行了演示。此外,我们阐述了一种方法,允许使用固定风险多分类(FIRM)评分对连续概率预报与分类预报进行公平比较,并建立了FIRM评分与墨菲图之间的关系。结果凸显了热带澳大利亚海域雷暴预报的表现如何根据用户所依据的决策阈值,在业务气象学家与自动化系统之间产生差异。一项新自动化系统的后报结果显示,在整个热带澳大利亚海域,其表现普遍优于气象学家和旧自动化系统。虽然这些方法通过雷暴预报进行了演示,但它们适用于评估任何二元结果情境下的概率预报。

0
下载
关闭预览

相关内容

FlowQA: Grasping Flow in History for Conversational Machine Comprehension
专知会员服务
34+阅读 · 2019年10月18日
Stabilizing Transformers for Reinforcement Learning
专知会员服务
60+阅读 · 2019年10月17日
《DeepGCNs: Making GCNs Go as Deep as CNNs》
专知会员服务
32+阅读 · 2019年10月17日
Keras François Chollet 《Deep Learning with Python 》, 386页pdf
专知会员服务
164+阅读 · 2019年10月12日
Transferring Knowledge across Learning Processes
CreateAMind
29+阅读 · 2019年5月18日
强化学习的Unsupervised Meta-Learning
CreateAMind
18+阅读 · 2019年1月7日
Unsupervised Learning via Meta-Learning
CreateAMind
44+阅读 · 2019年1月3日
A Technical Overview of AI & ML in 2018 & Trends for 2019
待字闺中
18+阅读 · 2018年12月24日
disentangled-representation-papers
CreateAMind
26+阅读 · 2018年9月12日
STRCF for Visual Object Tracking
统计学习与视觉计算组
15+阅读 · 2018年5月29日
Hierarchical Imitation - Reinforcement Learning
CreateAMind
19+阅读 · 2018年5月25日
Focal Loss for Dense Object Detection
统计学习与视觉计算组
12+阅读 · 2018年3月15日
IJCAI | Cascade Dynamics Modeling with Attention-based RNN
KingsGarden
13+阅读 · 2017年7月16日
From Softmax to Sparsemax-ICML16(1)
KingsGarden
74+阅读 · 2016年11月26日
国家自然科学基金
18+阅读 · 2017年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
2+阅读 · 2014年12月31日
国家自然科学基金
6+阅读 · 2014年12月31日
Arxiv
0+阅读 · 2024年1月19日
VIP会员
最新内容
学习数据的几何:形状空间分析数学综述
专知会员服务
7+阅读 · 6月17日
定向能反无人机系统最新发展动态
专知会员服务
8+阅读 · 6月17日
从燃煤战舰到算法战争:水面指挥的永恒要求
专知会员服务
6+阅读 · 6月17日
相关资讯
Transferring Knowledge across Learning Processes
CreateAMind
29+阅读 · 2019年5月18日
强化学习的Unsupervised Meta-Learning
CreateAMind
18+阅读 · 2019年1月7日
Unsupervised Learning via Meta-Learning
CreateAMind
44+阅读 · 2019年1月3日
A Technical Overview of AI & ML in 2018 & Trends for 2019
待字闺中
18+阅读 · 2018年12月24日
disentangled-representation-papers
CreateAMind
26+阅读 · 2018年9月12日
STRCF for Visual Object Tracking
统计学习与视觉计算组
15+阅读 · 2018年5月29日
Hierarchical Imitation - Reinforcement Learning
CreateAMind
19+阅读 · 2018年5月25日
Focal Loss for Dense Object Detection
统计学习与视觉计算组
12+阅读 · 2018年3月15日
IJCAI | Cascade Dynamics Modeling with Attention-based RNN
KingsGarden
13+阅读 · 2017年7月16日
From Softmax to Sparsemax-ICML16(1)
KingsGarden
74+阅读 · 2016年11月26日
相关基金
国家自然科学基金
18+阅读 · 2017年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
3+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
2+阅读 · 2014年12月31日
国家自然科学基金
6+阅读 · 2014年12月31日
Top
微信扫码咨询专知VIP会员