Runtime Variation in Big Data Analytics - 专知论文

会员服务 ·

0

时变 · 分析 · 调度 · 体验质量 · 时间一致性 ·

2023 年 4 月 7 日

Runtime Variation in Big Data Analytics

翻译：大数据分析中的运行时变异

Yiwen Zhu,Rathijit Sen,Robert Horton,John Mark, Agosta

from arxiv, Sigmod 2023

The dynamic nature of resource allocation and runtime conditions on Cloud can result in high variability in a job's runtime across multiple iterations, leading to a poor experience. Identifying the sources of such variation and being able to predict and adjust for them is crucial to cloud service providers to design reliable data processing pipelines, provision and allocate resources, adjust pricing services, meet SLOs and debug performance hazards. In this paper, we analyze the runtime variation of millions of production SCOPE jobs on Cosmos, an exabyte-scale internal analytics platform at Microsoft. We propose an innovative 2-step approach to predict job runtime distribution by characterizing typical distribution shapes combined with a classification model with an average accuracy of >96%, out-performing traditional regression models and better capturing long tails. We examine factors such as job plan characteristics and inputs, resource allocation, physical cluster heterogeneity and utilization, and scheduling policies. To the best of our knowledge, this is the first study on predicting categories of runtime distributions for enterprise analytics workloads at scale. Furthermore, we examine how our methods can be used to analyze what-if scenarios, focusing on the impact of resource allocation, scheduling, and physical cluster provisioning decisions on a job's runtime consistency and predictability.

翻译：云环境中资源分配与运行时条件的动态特性会导致作业在多次迭代中的运行时间出现高度变异，从而带来不良体验。识别此类变异的根源并能够预测和调整它们，对于云服务提供商设计可靠的数据处理管道、配置和分配资源、调整定价服务、满足服务等级协议（SLO）以及调试性能瓶颈至关重要。本文分析了微软Cosmos平台（一个EB级内部分析平台）上数百万生产环境SCOPE作业的运行时变异。我们提出了一种创新的两步法，通过刻画典型的分布形态并结合分类模型来预测作业运行时分布，平均准确率超过96%，优于传统回归模型并能更准确地捕捉长尾分布。我们考察了作业计划特征与输入、资源分配、物理集群异构性与利用率以及调度策略等因素。据我们所知，这是首次针对企业级分析工作负载在规模上预测运行时分布类别的系统性研究。此外，我们探讨了如何利用所提方法分析假设场景，重点关注资源分配、调度和物理集群配置决策对作业运行时一致性和可预测性的影响。

0

相关内容

宾夕法尼亚大学最新《不确定性估计》课程笔记，134页pdf，附Slides

宾夕法尼亚大学最新《不确定性估计》课程笔记，134页pdf，附Slides

专知会员服务

49+阅读 · 2022年11月13日

【SIGMOD教程】高效数据标签的众包实践:聚合、增量重标签和定价，附180页slides

【SIGMOD教程】高效数据标签的众包实践:聚合、增量重标签和定价，附180页slides

专知会员服务

11+阅读 · 2022年10月20日

【ETH】最新《几何数据分析》2020课程，附PPT下载

专知会员服务

45+阅读 · 2020年12月18日

【新书】Azure 深度学习，在微软人工智能平台上构建和部署人工智能解决方案 | Deep Learning with Azure，Building and Deploying Artificial Intelligence Solutions on the Microsoft AI Platform，附298页pdf

【新书】Azure 深度学习，在微软人工智能平台上构建和部署人工智能解决方案 | Deep Learning with Azure，Building and Deploying Artificial Intelligence Solutions on the Microsoft AI Platform，附298页pdf

专知会员服务

44+阅读 · 2020年1月13日

【新书】贝叶斯网络进展与新应用，附全书下载

【新书】贝叶斯网络进展与新应用，附全书下载

专知会员服务

122+阅读 · 2019年12月9日

【O'Reilly AI Conference 2019】部署大规模分布式数据（How to deploy large-scale distributed data analytics and machine learning on containers (sponsored by HPE))，HPE BlueData，Thomas Phelan

【O'Reilly AI Conference 2019】部署大规模分布式数据（How to deploy large-scale distributed data analytics and machine learning on containers (sponsored by HPE))，HPE BlueData，Thomas Phelan

专知会员服务

19+阅读 · 2019年11月5日

社交网络上议题社群的公共焦虑研究，中国人民大学新闻学院塔娜讲师，第八届全国社会媒体处理大会SMP2019

社交网络上议题社群的公共焦虑研究，中国人民大学新闻学院塔娜讲师，第八届全国社会媒体处理大会SMP2019

专知会员服务

15+阅读 · 2019年10月23日

强化学习最新教程，17页pdf

强化学习最新教程，17页pdf

专知会员服务

182+阅读 · 2019年10月11日

机器学习入门的经验与建议

机器学习入门的经验与建议

专知会员服务

94+阅读 · 2019年10月10日

【加州大学伯克利分校博士论文】通过自我监督预测学习泛化

【加州大学伯克利分校博士论文】通过自我监督预测学习泛化

专知会员服务

65+阅读 · 2019年10月9日

灾难性遗忘问题新视角：迁移-干扰平衡

灾难性遗忘问题新视角：迁移-干扰平衡

CreateAMind

17+阅读 · 2019年7月6日

Hierarchically Structured Meta-learning

Hierarchically Structured Meta-learning

CreateAMind

27+阅读 · 2019年5月22日

无监督元学习表示学习

无监督元学习表示学习

CreateAMind

27+阅读 · 2019年1月4日

大数据 | 顶级SCI期刊专刊/国际会议信息7条

大数据 | 顶级SCI期刊专刊/国际会议信息7条

Call4Papers

10+阅读 · 2018年12月29日

利用动态深度学习预测金融时间序列基于Python

利用动态深度学习预测金融时间序列基于Python

量化投资与机器学习

18+阅读 · 2018年10月30日

vae 相关论文表示学习 1

vae 相关论文表示学习 1

CreateAMind

12+阅读 · 2018年9月6日

【论文推荐】最新六篇主题模型相关论文—动态主题模型、主题趋势、大规模并行采样、随机采样、非参主题建模

【论文推荐】最新六篇主题模型相关论文—动态主题模型、主题趋势、大规模并行采样、随机采样、非参主题建模

专知

14+阅读 · 2018年6月24日

【论文推荐】最新六篇主题模型相关论文—收敛率、大规模、深度主题建模、优化、情绪强度、广义动态主题模型

【论文推荐】最新六篇主题模型相关论文—收敛率、大规模、深度主题建模、优化、情绪强度、广义动态主题模型

专知

11+阅读 · 2018年3月29日

【推荐】RNN/LSTM时序预测

【推荐】RNN/LSTM时序预测

机器学习研究会

25+阅读 · 2017年9月8日

【推荐】SVM实例教程

【推荐】SVM实例教程

机器学习研究会

17+阅读 · 2017年8月26日

云计算环境中面向时间约束的大规模并行业务流程的监控策略研究

国家自然科学基金

2+阅读 · 2015年12月31日

台风时空点过程下海洋平台的维修策略研究

国家自然科学基金

0+阅读 · 2015年12月31日

GB-InSAR图像误差特征分析与改正模型研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于大数据分析的互联网服务性能管理体系结构研究

国家自然科学基金

2+阅读 · 2014年12月31日

基于光学特性测量的气溶胶吸湿增长因子观测研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向弹性用户的异构Small Cell网络动态资源优化与管控方法

国家自然科学基金

1+阅读 · 2014年12月31日

黄河源区径流量对地表覆盖动态变化的响应研究

国家自然科学基金

0+阅读 · 2013年12月31日

基于云计算和数据空间的网络安全态势感知关键技术研究

国家自然科学基金

7+阅读 · 2012年12月31日

云计算环境下的多源信息服务系统研究

国家自然科学基金

3+阅读 · 2011年12月31日

服务管理中承诺服务完成时间和服务按时完成率的决策

国家自然科学基金

0+阅读 · 2008年12月31日

PAD-Net: An Efficient Framework for Dynamic Networks

Arxiv

0+阅读 · 2023年5月26日

Mixed Hierarchy Network for Image Restoration

Arxiv

0+阅读 · 2023年5月26日

The GNAR-edge model: A network autoregressive model for networks with time-varying edge weights

Arxiv

0+阅读 · 2023年5月25日

Do You Hear The People Sing? Key Point Analysis via Iterative Clustering and Abstractive Summarisation

Arxiv

0+阅读 · 2023年5月25日

Towards Adaptive Prefix Tuning for Parameter-Efficient Language Model Fine-tuning

Arxiv

0+阅读 · 2023年5月24日

STAR: Boosting Low-Resource Event Extraction by Structure-to-Text Data Generation with Large Language Models

Arxiv

0+阅读 · 2023年5月24日

Towards Efficient Multi-Agent Learning Systems

Arxiv

0+阅读 · 2023年5月24日

Meta-Learning to Cluster

Meta-Learning to Cluster

Arxiv

18+阅读 · 2019年10月30日

Class-Balanced Loss Based on Effective Number of Samples

Arxiv

12+阅读 · 2019年1月16日

Attention Is All You Need

Arxiv

29+阅读 · 2017年12月6日

VIP会员

文章信息

相关主题

时间一致性

最新内容

印度精确打击与指挥架构的断层

印度精确打击与指挥架构的断层

专知会员服务

2+阅读 · 7月20日

《NASA喷气推进实验室：高耐久轻质常驻空观测系统（HELIOS）》429页

《NASA喷气推进实验室：高耐久轻质常驻空观测系统（HELIOS）》429页

专知会员服务

4+阅读 · 7月20日

美空军AI完成F-16战斗机自主空战历史性试飞

美空军AI完成F-16战斗机自主空战历史性试飞

专知会员服务

4+阅读 · 7月20日

《美政府问责局——武器系统年度评估（2026年）：强制要求成熟技术或可推动转向快速交付》249页

《美政府问责局——武器系统年度评估（2026年）：强制要求成熟技术或可推动转向快速交付》249页

专知会员服务

4+阅读 · 7月20日

《美国陆军：通过弹性分布式模型库实现自适应AI优势》

《美国陆军：通过弹性分布式模型库实现自适应AI优势》

专知会员服务

3+阅读 · 7月20日

博士论文 | 理解与改进大语言模型推理：从反转诅咒到连续思维链

博士论文 | 理解与改进大语言模型推理：从反转诅咒到连续思维链

专知会员服务

5+阅读 · 7月20日

综述 | 终身视觉表征：持续自监督学习CSSL系统综述

综述 | 终身视觉表征：持续自监督学习CSSL系统综述

专知会员服务

4+阅读 · 7月20日

深入Project Maven：为何人工智能在战场上依然失灵

深入Project Maven：为何人工智能在战场上依然失灵

专知会员服务

14+阅读 · 7月19日

锻造未来士兵：外骨骼、基因工程与赛博格

锻造未来士兵：外骨骼、基因工程与赛博格

专知会员服务

7+阅读 · 7月19日

《无人机系统（UAS）通信网状网络试验性部署》50页报告

《无人机系统（UAS）通信网状网络试验性部署》50页报告

专知会员服务

7+阅读 · 7月19日

《无人机蜂群通信技术研究》50页

《无人机蜂群通信技术研究》50页

专知会员服务

8+阅读 · 7月19日

《基于智能体建模与仿真的无人机蜂群模型目标定位涌现行为比较分析》360页

《基于智能体建模与仿真的无人机蜂群模型目标定位涌现行为比较分析》360页

专知会员服务

11+阅读 · 7月18日

欧洲智能弹药战略创新管理：迈向制导弹药、巡飞系统与自主无人机蜂群的技术主权研究路线图

欧洲智能弹药战略创新管理：迈向制导弹药、巡飞系统与自主无人机蜂群的技术主权研究路线图

专知会员服务

8+阅读 · 7月18日

从领域适配到部署与可解释：Berkeley博士论文解析大语言模型真实落地

从领域适配到部署与可解释：Berkeley博士论文解析大语言模型真实落地

专知会员服务

13+阅读 · 7月18日

综述 | 长程智能体研究全景：基础、演化、框架、优化与前沿

综述 | 长程智能体研究全景：基础、演化、框架、优化与前沿

专知会员服务

9+阅读 · 7月18日

相关VIP内容

宾夕法尼亚大学最新《不确定性估计》课程笔记，134页pdf，附Slides

宾夕法尼亚大学最新《不确定性估计》课程笔记，134页pdf，附Slides

专知会员服务

49+阅读 · 2022年11月13日

【SIGMOD教程】高效数据标签的众包实践:聚合、增量重标签和定价，附180页slides

【SIGMOD教程】高效数据标签的众包实践:聚合、增量重标签和定价，附180页slides

专知会员服务

11+阅读 · 2022年10月20日

【ETH】最新《几何数据分析》2020课程，附PPT下载

专知会员服务

45+阅读 · 2020年12月18日

【新书】Azure 深度学习，在微软人工智能平台上构建和部署人工智能解决方案 | Deep Learning with Azure，Building and Deploying Artificial Intelligence Solutions on the Microsoft AI Platform，附298页pdf

【新书】Azure 深度学习，在微软人工智能平台上构建和部署人工智能解决方案 | Deep Learning with Azure，Building and Deploying Artificial Intelligence Solutions on the Microsoft AI Platform，附298页pdf

专知会员服务

44+阅读 · 2020年1月13日

【新书】贝叶斯网络进展与新应用，附全书下载

【新书】贝叶斯网络进展与新应用，附全书下载

专知会员服务

122+阅读 · 2019年12月9日

【O'Reilly AI Conference 2019】部署大规模分布式数据（How to deploy large-scale distributed data analytics and machine learning on containers (sponsored by HPE))，HPE BlueData，Thomas Phelan

【O'Reilly AI Conference 2019】部署大规模分布式数据（How to deploy large-scale distributed data analytics and machine learning on containers (sponsored by HPE))，HPE BlueData，Thomas Phelan

专知会员服务

19+阅读 · 2019年11月5日

社交网络上议题社群的公共焦虑研究，中国人民大学新闻学院塔娜讲师，第八届全国社会媒体处理大会SMP2019

社交网络上议题社群的公共焦虑研究，中国人民大学新闻学院塔娜讲师，第八届全国社会媒体处理大会SMP2019

专知会员服务

15+阅读 · 2019年10月23日

强化学习最新教程，17页pdf

强化学习最新教程，17页pdf

专知会员服务

182+阅读 · 2019年10月11日

机器学习入门的经验与建议

机器学习入门的经验与建议

专知会员服务

94+阅读 · 2019年10月10日

【加州大学伯克利分校博士论文】通过自我监督预测学习泛化

【加州大学伯克利分校博士论文】通过自我监督预测学习泛化

专知会员服务

65+阅读 · 2019年10月9日

热门VIP内容

开通专知VIP会员享更多权益服务

《NASA喷气推进实验室：高耐久轻质常驻空观测系统（HELIOS）》429页

《美政府问责局——武器系统年度评估（2026年）：强制要求成熟技术或可推动转向快速交付》249页

印度精确打击与指挥架构的断层

美空军AI完成F-16战斗机自主空战历史性试飞

相关资讯

灾难性遗忘问题新视角：迁移-干扰平衡

灾难性遗忘问题新视角：迁移-干扰平衡

CreateAMind

17+阅读 · 2019年7月6日

Hierarchically Structured Meta-learning

Hierarchically Structured Meta-learning

CreateAMind

27+阅读 · 2019年5月22日

无监督元学习表示学习

无监督元学习表示学习

CreateAMind

27+阅读 · 2019年1月4日

大数据 | 顶级SCI期刊专刊/国际会议信息7条

大数据 | 顶级SCI期刊专刊/国际会议信息7条

Call4Papers

10+阅读 · 2018年12月29日

利用动态深度学习预测金融时间序列基于Python

利用动态深度学习预测金融时间序列基于Python

量化投资与机器学习

18+阅读 · 2018年10月30日

vae 相关论文表示学习 1

vae 相关论文表示学习 1

CreateAMind

12+阅读 · 2018年9月6日

【论文推荐】最新六篇主题模型相关论文—动态主题模型、主题趋势、大规模并行采样、随机采样、非参主题建模

【论文推荐】最新六篇主题模型相关论文—动态主题模型、主题趋势、大规模并行采样、随机采样、非参主题建模

专知

14+阅读 · 2018年6月24日

【论文推荐】最新六篇主题模型相关论文—收敛率、大规模、深度主题建模、优化、情绪强度、广义动态主题模型

【论文推荐】最新六篇主题模型相关论文—收敛率、大规模、深度主题建模、优化、情绪强度、广义动态主题模型

专知

11+阅读 · 2018年3月29日

【推荐】RNN/LSTM时序预测

【推荐】RNN/LSTM时序预测

机器学习研究会

25+阅读 · 2017年9月8日

【推荐】SVM实例教程

【推荐】SVM实例教程

机器学习研究会

17+阅读 · 2017年8月26日

相关论文

PAD-Net: An Efficient Framework for Dynamic Networks

Arxiv

0+阅读 · 2023年5月26日

Mixed Hierarchy Network for Image Restoration

Arxiv

0+阅读 · 2023年5月26日

The GNAR-edge model: A network autoregressive model for networks with time-varying edge weights

Arxiv

0+阅读 · 2023年5月25日

Do You Hear The People Sing? Key Point Analysis via Iterative Clustering and Abstractive Summarisation

Arxiv

0+阅读 · 2023年5月25日

Towards Adaptive Prefix Tuning for Parameter-Efficient Language Model Fine-tuning

Arxiv

0+阅读 · 2023年5月24日

STAR: Boosting Low-Resource Event Extraction by Structure-to-Text Data Generation with Large Language Models

Arxiv

0+阅读 · 2023年5月24日

Towards Efficient Multi-Agent Learning Systems

Arxiv

0+阅读 · 2023年5月24日

Meta-Learning to Cluster

Meta-Learning to Cluster

Arxiv

18+阅读 · 2019年10月30日

Class-Balanced Loss Based on Effective Number of Samples

Arxiv

12+阅读 · 2019年1月16日

Attention Is All You Need

Arxiv

29+阅读 · 2017年12月6日

相关基金

云计算环境中面向时间约束的大规模并行业务流程的监控策略研究

国家自然科学基金

2+阅读 · 2015年12月31日

台风时空点过程下海洋平台的维修策略研究

国家自然科学基金

0+阅读 · 2015年12月31日

GB-InSAR图像误差特征分析与改正模型研究

国家自然科学基金

0+阅读 · 2014年12月31日

基于大数据分析的互联网服务性能管理体系结构研究

国家自然科学基金

2+阅读 · 2014年12月31日

基于光学特性测量的气溶胶吸湿增长因子观测研究

国家自然科学基金

0+阅读 · 2014年12月31日

面向弹性用户的异构Small Cell网络动态资源优化与管控方法

国家自然科学基金

1+阅读 · 2014年12月31日

黄河源区径流量对地表覆盖动态变化的响应研究

国家自然科学基金

0+阅读 · 2013年12月31日

基于云计算和数据空间的网络安全态势感知关键技术研究

国家自然科学基金

7+阅读 · 2012年12月31日

云计算环境下的多源信息服务系统研究

国家自然科学基金

3+阅读 · 2011年12月31日

服务管理中承诺服务完成时间和服务按时完成率的决策

国家自然科学基金

0+阅读 · 2008年12月31日

微信扫码咨询专知VIP会员