Compile-Time Java Stream Fusion via mapMulti - 专知论文

会员服务 ·

0

Java · 融合 · 展开 · 优化器 · 流 ·

Compile-Time Java Stream Fusion via mapMulti

翻译：通过 mapMulti 实现 Java 流的编译时融合

Yegor Bugayenko,Maxim Trunnikov,Vladimir Zakharov

The Java Stream API, introduced in Java 8, makes data processing more expressive and concise compared to imperative loops. However, this abstraction can come with significant performance overhead, often due to the creation of multiple intermediate objects during pipeline execution. In functional languages such as Haskell, this problem is addressed through stream fusion, a compile-time optimization that eliminates unnecessary intermediate structures. Inspired by this idea, Streamliner was the first tool to perform ahead-of-time, bytecode-to-bytecode stream optimization for Java by unrolling stream pipelines into imperative loops. In this paper, we introduce an open-source optimizer that takes a different approach. Instead of unrolling streams into loops, it merges consecutive map() and filter() operations into a single mapMulti() call, available since Java 16. Our method avoids several limitations of Streamliner, including its sensitivity to escaping objects in lambda expressions and its restrictions on assigning or passing streams as variables. We evaluated our optimizer on nine benchmarks and observed superior performance in two cases and comparable results in most others. We also applied it to the bytecode of Apache Kafka, successfully executing all 31,799 unit tests without failures.

翻译：Java 8 引入的 Java Stream API 相较于命令式循环，使数据处理更具表现力和简洁性。然而，这种抽象可能带来显著的性能开销，通常源于管道执行期间创建的多个中间对象。在 Haskell 等函数式语言中，此问题通过流融合（一种消除不必要中间结构的编译时优化）得以解决。受此思想启发，Streamliner 成为首个通过将流管道展开为命令式循环来对 Java 进行提前、字节码到字节码流优化的工具。本文介绍了一种采用不同方法的开源优化器：它并非将流展开为循环，而是将连续的 map() 和 filter() 操作合并为单个 mapMulti() 调用（该功能自 Java 16 起可用）。我们的方法避免了 Streamliner 的若干局限性，包括其对 lambda 表达式中转义对象的敏感性，以及对将流分配或传递为变量的限制。我们在九个基准测试上评估了该优化器，观察到两个案例中性能显著提升，其余多数案例结果相当。我们还将其应用于 Apache Kafka 的字节码，成功执行了所有 31,799 个单元测试且无失败。

0

相关内容

Java

Java 是一门编程语言，拥有跨平台、面向对象、泛型编程等特性。

从静态模板到动态运行时图：大语言模型智能体（LLM Agents）工作流优化综述

从静态模板到动态运行时图：大语言模型智能体（LLM Agents）工作流优化综述

专知会员服务

23+阅读 · 3月30日

大语言模型时代下的模型合并：方法、应用与未来方向

大语言模型时代下的模型合并：方法、应用与未来方向

专知会员服务

14+阅读 · 3月11日

使用多模态语言模型生成图像

使用多模态语言模型生成图像

专知会员服务

32+阅读 · 2023年8月23日

【斯坦福博士论文】深度学习核编译为局部感知数据流，109页pdf

【斯坦福博士论文】深度学习核编译为局部感知数据流，109页pdf

专知会员服务

28+阅读 · 2023年4月5日

【ICML2022】Branchformer:并行MLP-Attention架构，捕捉局部和全局上下文，用于语音识别和理解

【ICML2022】Branchformer:并行MLP-Attention架构，捕捉局部和全局上下文，用于语音识别和理解

专知会员服务

25+阅读 · 2022年7月8日

【Manning新书】掌握流式处理系统-实时事件处理，Grokking Streaming Systems Real-time event processing

【Manning新书】掌握流式处理系统-实时事件处理，Grokking Streaming Systems Real-time event processing

专知会员服务

47+阅读 · 2022年3月22日

【2022新书】掌握Kafka Streams和ksqlDB，436页pdf，构建实时数据系统

【2022新书】掌握Kafka Streams和ksqlDB，436页pdf，构建实时数据系统

专知会员服务

47+阅读 · 2022年2月25日

【2020新书】Java基础, 408页pdf，快节奏和实用的介绍世界上最流行的编程语言之一Java

【2020新书】Java基础, 408页pdf，快节奏和实用的介绍世界上最流行的编程语言之一Java

专知会员服务

52+阅读 · 2020年12月21日

【实用书】流数据处理，Streaming Data，219页pdf

【实用书】流数据处理，Streaming Data，219页pdf

专知会员服务

78+阅读 · 2020年4月24日

TensorFlow 2.2为keras.Model加入train_step方法，开发者可自由定义模型自动训练过程

TensorFlow 2.2为keras.Model加入train_step方法，开发者可自由定义模型自动训练过程

专知会员服务

36+阅读 · 2020年3月27日

【2022新书】掌握Kafka Streams和ksqlDB，436页pdf，构建实时数据系统

【2022新书】掌握Kafka Streams和ksqlDB，436页pdf，构建实时数据系统

专知

10+阅读 · 2022年2月25日

基于 SonarQube 的增量代码扫描

基于 SonarQube 的增量代码扫描

DevOps时代

12+阅读 · 2019年7月18日

加入Transformer-XL，这个PyTorch包能调用各种NLP预训练模型

加入Transformer-XL，这个PyTorch包能调用各种NLP预训练模型

机器之心

15+阅读 · 2019年2月13日

R工程化—Rest API 之plumber包

R工程化—Rest API 之plumber包

R语言中文社区

11+阅读 · 2018年12月25日

【大数据】StreamSets：一个大数据采集工具

【大数据】StreamSets：一个大数据采集工具

产业智能官

40+阅读 · 2018年12月5日

【干货】使用TensorFlow官方Java API调用TensorFlow模型（附代码）

【干货】使用TensorFlow官方Java API调用TensorFlow模型（附代码）

专知

20+阅读 · 2018年4月22日

【下载】JAVA程序员深度学习实用指引《Deep Learning: Practical Neural Networks》

【下载】JAVA程序员深度学习实用指引《Deep Learning: Practical Neural Networks》

专知

12+阅读 · 2017年12月7日

最新Apache Spark平台的NLP库,助你轻松搞定自然语言处理任务

最新Apache Spark平台的NLP库,助你轻松搞定自然语言处理任务

专知

11+阅读 · 2017年11月29日

赛尔原创 | Pointer Networks在自然语言处理领域中的应用

赛尔原创 | Pointer Networks在自然语言处理领域中的应用

哈工大SCIR

14+阅读 · 2017年11月6日

并行算法演进，从MapReduce到MPI

并行算法演进，从MapReduce到MPI

凡人机器学习

10+阅读 · 2017年11月5日

基于略图挖掘的在不同时空域的网络流式数据实时处理

国家自然科学基金

1+阅读 · 2015年12月31日

基于上下文精化的并发对象活性的描述及验证

国家自然科学基金

1+阅读 · 2015年12月31日

多标记文本数据流分类方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

数据中心网络中延时敏感的传输控制协议

国家自然科学基金

0+阅读 · 2015年12月31日

面向安全关键系统的时间可预测多核代码生成方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

数据中心资源利用率敏感的编译方法

国家自然科学基金

0+阅读 · 2015年12月31日

动态自适应的可伸缩视频流媒体组播编码-传输联合优化

国家自然科学基金

0+阅读 · 2015年12月31日

云计算环境中面向时间约束的大规模并行业务流程的监控策略研究

国家自然科学基金

2+阅读 · 2015年12月31日

海量数据流实时分发技术研究

国家自然科学基金

3+阅读 · 2015年12月31日

云环境中支持混合并行模式的科学工作流的执行优化

国家自然科学基金

0+阅读 · 2014年12月31日

BlobShuffle: Cost-Effective Repartitioning in Stream Processing Systems via Object Storage Exemplified with Kafka Streams

Arxiv

0+阅读 · 6月2日

R+R: Reassessing Java Security API Misuse in Current LLMs: A Replication on JCA and JSSE APIs with External Security Knowledge

Arxiv

0+阅读 · 5月29日

Misleading Microbenchmarks on the Java Virtual Machines

Arxiv

0+阅读 · 5月22日

JEDI: Java Evaluation of Declarative and Imperative Queries

Arxiv

0+阅读 · 5月22日

WhisperPipe: A Resource-Efficient Streaming Architecture for Real-Time Automatic Speech Recognition

Arxiv

0+阅读 · 4月28日

Hierarchical Decomposition of Separable Workflow-Nets

Arxiv

0+阅读 · 4月20日

Contextualizing Sink Knowledge for Java Vulnerability Discovery

Arxiv

0+阅读 · 4月19日

Discrete Flow Maps

Arxiv

0+阅读 · 4月14日

Classport: Designing Runtime Dependency Introspection for Java

Arxiv

0+阅读 · 4月14日

Contextualizing Sink Knowledge for Java Vulnerability Discovery

Arxiv

0+阅读 · 4月2日

VIP会员

文章信息

相关主题

最新内容

《远程自主系统可扩展态势感知的解决方案》32页2026最新报告

《远程自主系统可扩展态势感知的解决方案》32页2026最新报告

专知会员服务

1+阅读 · 今天13:32

《基于强化学习的自动化红队测试》

《基于强化学习的自动化红队测试》

专知会员服务

1+阅读 · 今天13:21

《下一代无人机-卫星通信：人工智能创新与未来展望》32页长综述

《下一代无人机-卫星通信：人工智能创新与未来展望》32页长综述

专知会员服务

3+阅读 · 今天13:12

“天降毒雾”：无人机如何使化学战重返乌克兰战场

“天降毒雾”：无人机如何使化学战重返乌克兰战场

专知会员服务

0+阅读 · 今天11:28

伊朗不对称防空战略的演进

伊朗不对称防空战略的演进

专知会员服务

2+阅读 · 今天11:10

对抗环境下超视距目标打击的情报支援

对抗环境下超视距目标打击的情报支援

专知会员服务

10+阅读 · 7月22日

《面向复杂地形下无人机跟踪地面机器人（UAV–UGV）的自适应多滤波器扩展卡尔曼滤波框架》

《面向复杂地形下无人机跟踪地面机器人（UAV–UGV）的自适应多滤波器扩展卡尔曼滤波框架》

专知会员服务

4+阅读 · 7月22日

纵深侦察：大规模作战行动中远程侦察与监视之迫切需求

纵深侦察：大规模作战行动中远程侦察与监视之迫切需求

专知会员服务

8+阅读 · 7月22日

共享认知，分布式研判：复杂行动中的美国空军指挥控制（万字长文）

共享认知，分布式研判：复杂行动中的美国空军指挥控制（万字长文）

专知会员服务

10+阅读 · 7月22日

《无人机对海面作战影响评估》

《无人机对海面作战影响评估》

专知会员服务

15+阅读 · 7月21日

《可损耗无人系统规模化应用对美国军事转型的战略影响（2022-2030）》2026年270页

《可损耗无人系统规模化应用对美国军事转型的战略影响（2022-2030）》2026年270页

专知会员服务

14+阅读 · 7月21日

博士论文 | 后训练如何损害大模型生成多样性？SimpleStrat与Stylus

博士论文 | 后训练如何损害大模型生成多样性？SimpleStrat与Stylus

专知会员服务

4+阅读 · 7月21日

综述 | 面向5G/6G网络的LLM智能体AI：架构、协议与标准化

综述 | 面向5G/6G网络的LLM智能体AI：架构、协议与标准化

专知会员服务

6+阅读 · 7月21日

五角大楼新设无人机办公室（DRPM-UxS）将如何重塑美国无人系统格局（附美国防部设立备忘录）

五角大楼新设无人机办公室（DRPM-UxS）将如何重塑美国无人系统格局（附美国防部设立备忘录）

专知会员服务

9+阅读 · 7月21日

印度精确打击与指挥架构的断层

印度精确打击与指挥架构的断层

专知会员服务

7+阅读 · 7月20日

相关VIP内容

从静态模板到动态运行时图：大语言模型智能体（LLM Agents）工作流优化综述

从静态模板到动态运行时图：大语言模型智能体（LLM Agents）工作流优化综述

专知会员服务

23+阅读 · 3月30日

大语言模型时代下的模型合并：方法、应用与未来方向

大语言模型时代下的模型合并：方法、应用与未来方向

专知会员服务

14+阅读 · 3月11日

使用多模态语言模型生成图像

使用多模态语言模型生成图像

专知会员服务

32+阅读 · 2023年8月23日

【斯坦福博士论文】深度学习核编译为局部感知数据流，109页pdf

【斯坦福博士论文】深度学习核编译为局部感知数据流，109页pdf

专知会员服务

28+阅读 · 2023年4月5日

【ICML2022】Branchformer:并行MLP-Attention架构，捕捉局部和全局上下文，用于语音识别和理解

【ICML2022】Branchformer:并行MLP-Attention架构，捕捉局部和全局上下文，用于语音识别和理解

专知会员服务

25+阅读 · 2022年7月8日

【Manning新书】掌握流式处理系统-实时事件处理，Grokking Streaming Systems Real-time event processing

【Manning新书】掌握流式处理系统-实时事件处理，Grokking Streaming Systems Real-time event processing

专知会员服务

47+阅读 · 2022年3月22日

【2022新书】掌握Kafka Streams和ksqlDB，436页pdf，构建实时数据系统

【2022新书】掌握Kafka Streams和ksqlDB，436页pdf，构建实时数据系统

专知会员服务

47+阅读 · 2022年2月25日

【2020新书】Java基础, 408页pdf，快节奏和实用的介绍世界上最流行的编程语言之一Java

【2020新书】Java基础, 408页pdf，快节奏和实用的介绍世界上最流行的编程语言之一Java

专知会员服务

52+阅读 · 2020年12月21日

【实用书】流数据处理，Streaming Data，219页pdf

【实用书】流数据处理，Streaming Data，219页pdf

专知会员服务

78+阅读 · 2020年4月24日

TensorFlow 2.2为keras.Model加入train_step方法，开发者可自由定义模型自动训练过程

TensorFlow 2.2为keras.Model加入train_step方法，开发者可自由定义模型自动训练过程

专知会员服务

36+阅读 · 2020年3月27日

热门VIP内容

开通专知VIP会员享更多权益服务

《基于强化学习的自动化红队测试》

“天降毒雾”：无人机如何使化学战重返乌克兰战场

《远程自主系统可扩展态势感知的解决方案》32页2026最新报告

《下一代无人机-卫星通信：人工智能创新与未来展望》32页长综述

相关资讯

【2022新书】掌握Kafka Streams和ksqlDB，436页pdf，构建实时数据系统

【2022新书】掌握Kafka Streams和ksqlDB，436页pdf，构建实时数据系统

专知

10+阅读 · 2022年2月25日

基于 SonarQube 的增量代码扫描

基于 SonarQube 的增量代码扫描

DevOps时代

12+阅读 · 2019年7月18日

加入Transformer-XL，这个PyTorch包能调用各种NLP预训练模型

加入Transformer-XL，这个PyTorch包能调用各种NLP预训练模型

机器之心

15+阅读 · 2019年2月13日

R工程化—Rest API 之plumber包

R工程化—Rest API 之plumber包

R语言中文社区

11+阅读 · 2018年12月25日

【大数据】StreamSets：一个大数据采集工具

【大数据】StreamSets：一个大数据采集工具

产业智能官

40+阅读 · 2018年12月5日

【干货】使用TensorFlow官方Java API调用TensorFlow模型（附代码）

【干货】使用TensorFlow官方Java API调用TensorFlow模型（附代码）

专知

20+阅读 · 2018年4月22日

【下载】JAVA程序员深度学习实用指引《Deep Learning: Practical Neural Networks》

【下载】JAVA程序员深度学习实用指引《Deep Learning: Practical Neural Networks》

专知

12+阅读 · 2017年12月7日

最新Apache Spark平台的NLP库,助你轻松搞定自然语言处理任务

最新Apache Spark平台的NLP库,助你轻松搞定自然语言处理任务

专知

11+阅读 · 2017年11月29日

赛尔原创 | Pointer Networks在自然语言处理领域中的应用

赛尔原创 | Pointer Networks在自然语言处理领域中的应用

哈工大SCIR

14+阅读 · 2017年11月6日

并行算法演进，从MapReduce到MPI

并行算法演进，从MapReduce到MPI

凡人机器学习

10+阅读 · 2017年11月5日

相关论文

BlobShuffle: Cost-Effective Repartitioning in Stream Processing Systems via Object Storage Exemplified with Kafka Streams

Arxiv

0+阅读 · 6月2日

R+R: Reassessing Java Security API Misuse in Current LLMs: A Replication on JCA and JSSE APIs with External Security Knowledge

Arxiv

0+阅读 · 5月29日

Misleading Microbenchmarks on the Java Virtual Machines

Arxiv

0+阅读 · 5月22日

JEDI: Java Evaluation of Declarative and Imperative Queries

Arxiv

0+阅读 · 5月22日

WhisperPipe: A Resource-Efficient Streaming Architecture for Real-Time Automatic Speech Recognition

Arxiv

0+阅读 · 4月28日

Hierarchical Decomposition of Separable Workflow-Nets

Arxiv

0+阅读 · 4月20日

Contextualizing Sink Knowledge for Java Vulnerability Discovery

Arxiv

0+阅读 · 4月19日

Discrete Flow Maps

Arxiv

0+阅读 · 4月14日

Classport: Designing Runtime Dependency Introspection for Java

Arxiv

0+阅读 · 4月14日

Contextualizing Sink Knowledge for Java Vulnerability Discovery

Arxiv

0+阅读 · 4月2日

相关基金

基于略图挖掘的在不同时空域的网络流式数据实时处理

国家自然科学基金

1+阅读 · 2015年12月31日

基于上下文精化的并发对象活性的描述及验证

国家自然科学基金

1+阅读 · 2015年12月31日

多标记文本数据流分类方法研究

国家自然科学基金

3+阅读 · 2015年12月31日

数据中心网络中延时敏感的传输控制协议

国家自然科学基金

0+阅读 · 2015年12月31日

面向安全关键系统的时间可预测多核代码生成方法研究

国家自然科学基金

0+阅读 · 2015年12月31日

数据中心资源利用率敏感的编译方法

国家自然科学基金

0+阅读 · 2015年12月31日

动态自适应的可伸缩视频流媒体组播编码-传输联合优化

国家自然科学基金

0+阅读 · 2015年12月31日

云计算环境中面向时间约束的大规模并行业务流程的监控策略研究

国家自然科学基金

2+阅读 · 2015年12月31日

海量数据流实时分发技术研究

国家自然科学基金

3+阅读 · 2015年12月31日

云环境中支持混合并行模式的科学工作流的执行优化

国家自然科学基金

0+阅读 · 2014年12月31日

微信扫码咨询专知VIP会员