Java:手动展开的循环仍然比原始循环快。为什么？-6ren

Java:手动展开的循环仍然比原始循环快。为什么？

转载作者：行者123 更新时间：2023-12-03 15:29:10

考虑以下两个长度为 2 的数组的代码片段:

boolean isOK(int i) {
    for (int j = 0; j < filters.length; ++j) {
        if (!filters[j].isOK(i)) {
            return false;
        }
    }
    return true;
}

和

boolean isOK(int i) {
     return filters[0].isOK(i) && filters[1].isOK(i);
}

我会假设这两个部分的性能在充分热身后应该是相似的。
我已经使用 JMH 微基准测试框架检查了这一点，如所述，例如 here和 here并观察到第二个片段的速度快了 10% 以上。

问题:为什么 Java 没有使用基本的循环展开技术优化我的第一个代码段？
特别是，我想了解以下内容:

我可以轻松生成最适合 2 个过滤器的代码，并且在其他数量的过滤器的情况下仍然可以工作(想象一个简单的构建器):return (filters.length) == 2 ? new FilterChain2(filters) : new FilterChain1(filters) . JITC 可以这样做吗？如果不能，为什么？

JITC 能否检测到 'filters.length==2' 为 最常见的情况并在一些热身后生成最适合这种情况的代码？这应该几乎与手动展开的版本一样最佳。

JITC 能否检测到特定的实例使用非常频繁，然后生成代码 对于这个特定的实例 (它知道过滤器的数量总是2)？ 更新:得到的答案是 JITC 仅在类(class)级别上工作。好的，我知道了。

理想情况下，我希望得到对 JITC 工作原理有深刻理解的人的回答。

基准运行详细信息:

在最新版本的 Java 8 OpenJDK 和 Oracle HotSpot 上试过，结果差不多

使用的 Java 标志:-Xmx4g -Xms4g -server -Xbatch -XX:CICompilerCount=2(没有花哨的标志也得到类似的结果)

顺便说一句，如果我只是在一个循环中运行数十亿次(不是通过 JMH)，我会得到类似的运行时间比率，即第二个片段总是明显更快

典型的基准输出:

Benchmark (filterIndex) Mode Cnt Score Error Units
LoopUnrollingBenchmark.runBenchmark 0 avgt 400 44.202 ± 0.224 ns/op
LoopUnrollingBenchmark.runBenchmark 1 avgt 400 38.347 ± 0.063 ns/op

(第一行对应于第一个片段，第二行对应于第二个。

完整的基准代码:

public class LoopUnrollingBenchmark {

    @State(Scope.Benchmark)
    public static class BenchmarkData {
        public Filter[] filters;
        @Param({"0", "1"})
        public int filterIndex;
        public int num;

        @Setup(Level.Invocation) //similar ratio with Level.TRIAL
        public void setUp() {
            filters = new Filter[]{new FilterChain1(), new FilterChain2()};
            num = new Random().nextInt();
        }
    }

    @Benchmark
    @Fork(warmups = 5, value = 20)
    @BenchmarkMode(Mode.AverageTime)
    @OutputTimeUnit(TimeUnit.NANOSECONDS)
    public int runBenchmark(BenchmarkData data) {
        Filter filter = data.filters[data.filterIndex];
        int sum = 0;
        int num = data.num;
        if (filter.isOK(num)) {
            ++sum;
        }
        if (filter.isOK(num + 1)) {
            ++sum;
        }
        if (filter.isOK(num - 1)) {
            ++sum;
        }
        if (filter.isOK(num * 2)) {
            ++sum;
        }
        if (filter.isOK(num * 3)) {
            ++sum;
        }
        if (filter.isOK(num * 5)) {
            ++sum;
        }
        return sum;
    }


    interface Filter {
        boolean isOK(int i);
    }

    static class Filter1 implements Filter {
        @Override
        public boolean isOK(int i) {
            return i % 3 == 1;
        }
    }

    static class Filter2 implements Filter {
        @Override
        public boolean isOK(int i) {
            return i % 7 == 3;
        }
    }

    static class FilterChain1 implements Filter {
        final Filter[] filters = createLeafFilters();

        @Override
        public boolean isOK(int i) {
            for (int j = 0; j < filters.length; ++j) {
                if (!filters[j].isOK(i)) {
                    return false;
                }
            }
            return true;
        }
    }

    static class FilterChain2 implements Filter {
        final Filter[] filters = createLeafFilters();

        @Override
        public boolean isOK(int i) {
            return filters[0].isOK(i) && filters[1].isOK(i);
        }
    }

    private static Filter[] createLeafFilters() {
        Filter[] filters = new Filter[2];
        filters[0] = new Filter1();
        filters[1] = new Filter2();
        return filters;
    }

    public static void main(String[] args) throws Exception {
        org.openjdk.jmh.Main.main(args);
    }
}

最佳答案

TL;DR 这里性能差异的主要原因与循环展开无关。而是类型推测 和 内联缓存 .

展开策略

事实上，在 HotSpot 术语中，这样的循环被视为计数 , 在某些情况下 JVM 可以展开它们。但不是你的情况。

HotSpot 有两种循环展开策略: 1) 最大程度地展开，即完全移除循环；或 2) 将几个连续的迭代粘合在一起。

只有在 exact number of iterations is known .

  if (!cl->has_exact_trip_count()) {
    // Trip count is not exact.
    return false;
  }

但是，在您的情况下，该函数可能会在第一次迭代后提前返回。

可能会应用部分展开，但 following condition休息展开:

  // Don't unroll if the next round of unrolling would push us
  // over the expected trip count of the loop.  One is subtracted
  // from the expected trip count because the pre-loop normally
  // executes 1 iteration.
  if (UnrollLimitForProfileCheck > 0 &&
      cl->profile_trip_cnt() != COUNT_UNKNOWN &&
      future_unroll_ct        > UnrollLimitForProfileCheck &&
      (float)future_unroll_ct > cl->profile_trip_cnt() - 1.0) {
    return false;
  }

由于在您的情况下，预期的行程计数小于 2，HotSpot 认为即使是两次迭代也不值得展开。请注意，第一次迭代无论如何都会被提取到预循环中( loop peeling optimization)，所以展开在这里确实不是很有用。

类型推测

在您展开的版本中，有两个不同的 invokeinterface字节码。这些站点有两种不同的类型配置文件。第一个接收者总是 Filter1 ，第二个接收者总是 Filter2 .所以，你基本上有两个单态调用站点，HotSpot 可以完美地内联这两个调用——所谓的“内联缓存”，在这种情况下具有 100% 的命中率。

使用循环，只有一个 invokeinterface字节码，只收集一种类型的配置文件。 HotSpot JVM 看到 filters[j].isOK()用 Filter1 调用 86% 次接收器和 14% 次与 Filter2接收者。这将是一个双态调用。幸运的是，HotSpot 也可以推测内联双态调用。它使用条件分支内联两个目标。但是，在这种情况下，命中率最多为 86%，并且性能会受到架构级别相应的错误预测分支的影响。

如果您有 3 个或更多不同的过滤器，情况会更糟。在这种情况下 isOK()将是一个 HotSpot 根本无法内联的超多态调用。因此，编译后的代码将包含一个真正的接口(interface)调用，这会对性能产生更大的影响。

更多关于投机内联的文章 The Black Magic of (Java) Method Dispatch .

结论

为了内联虚拟/接口(interface)调用，HotSpot JVM 收集每个调用字节码的类型配置文件。如果循环中有虚拟调用，则无论循环是否展开，都将只有一种类型的调用配置文件。

为了从虚拟调用优化中获得最佳效果，您需要手动拆分循环，主要是为了拆分类型配置文件。到目前为止，HotSpot 无法自动执行此操作。

关于Java:手动展开的循环仍然比原始循环快。为什么？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/58995731/

文章推荐： macos - Mavericks 中没有 llvm opt 命令

文章推荐： optimization - 清零 V8 的 `hidden classes` 概念

文章推荐： r - 读取单列 CSV 文件的更快方法

css transition in 快，out 快
这看起来很基础，但我想不通。是否有一种简单的 CSS 唯一方法可以使 cssa 真正快速淡入并缓慢淡出。这是为了改变多个 div 的颜色。大约 0.5 秒的缓入和 2 秒的缓出。谢谢! 最佳答案你
Python+C 比纯 C 快(稍微)快
我一直在用各种语言和实现实现相同的代码(在 Blackjack 中发牌而不爆牌的方法的数量)。我注意到的一个奇怪之处是，Python 在 C 中调用分区函数的实现实际上比用 C 编写的整个程序快一点。
XPath:/比//快？
如果我没看错，/ 意味着它右边的节点必须是左边节点的直接子节点，例如/ul/li 返回 li 项，它们是作为文档根的 ul 项的直接子项。 //ul//li 返回 li 项，它们是文档中某处任何 ul
php - mysql随机更新一列(快)
如何随机更新一个表。所以你给一列一个随机值。并且该列(例如“顶部”)是唯一的。如果您在数字 10 到 20 之间进行选择，并且您有 10 行，那么您就不能有未使用的数字。如果你有 Test table
android - 位图创建和绘制速度慢...快
这在一小部分是一个问题(因为我不明白为什么它会有所不同)，在很大程度上是一篇希望能帮助其他一些可怜的程序员的帖子。我有一个代码库，是我大约 5-7 年前第一次开始 Android 编程时编写的，它具
sql - 为什么自连接比 or 快？
我正在尝试过滤关系表以获得满足两个条件的表子集(即:我想要 color_ids 为 1 或 2 的条目的所有 ID)。这是一张结实的 table ，所以我正在尝试尽可能多地进行优化。我想知道是否有人
聊聊PHP中的 === 运算符为什么比 == 快
在上一篇《聊聊PHP中require_once()函数为什么不好用》中给大家介绍了PHP中require_once()为什么不好用的原因，感兴趣的朋友可以去阅读了解一下~ 那么本文将给大家介绍PH
perl - 为什么 FastCGI 快？
很难说出这里问的是什么。这个问题模棱两可、含糊不清、不完整、过于宽泛或言辞激烈，无法以目前的形式合理回答。如需帮助澄清此问题以便可以重新打开，visit the help center . 10年前关
OpenGL 读取像素的速度比 glReadPixels 快
有没有办法提高glReadPixels的速度?目前我做: Gdx.gl.glReadPixels(0, 0, Gdx.graphics.getWidth(), Gdx.graphics.getHeig
r - 为什么:=比`:=`()快？
通常，我以函数形式`:=`()来计算data.table中的多列，认为这是最有效的方法。但是我最近发现它比简单地重复使用:=慢。至少在我的电脑上。我猜想:=的功能形式可能会产生一些开销，但这是它变慢
.net - 为什么三个线程比 10+ 快
我的问题是针对 Windows 环境中多线程的性能问题。在测试我的代码后，我得到的结果是增加线程数不会提高并行计算的性能，并且在经过一些计数后变得更少。到底是怎么回事？是否可以找出最佳线程数的公式:
C: free() 下一个尺寸无效(快)
我看到很少有相同问题的主题，但我仍然无法解决我的问题。这是我的代码 - 使用 XOR 加密的 C 套接字编程当服务器和客户端连接时:- 用户发送消息，例如:你好- 服务器响应，例如:(服务器):你好
c# - 鼠标移动比重绘 wpf 快
我正在定义继承自 Shape 类并实现“几何”属性的形状。这是一个例子: public class Landmark : Shape { public override bool IsInB
Android 执行代码的速度比 PC 快
相同代码在 Android(1Ghz Snapdragon)上的执行速度比我在 3.3 Ghz Core 2 Duo 的 PC(在桌面应用程序中)快 2 倍(PC 的类被复制到 Android 项目)
php - 比 in_array 快？
我需要将一个值与一组数组进行比较。但是，我需要比较 foreach 中的多个值。如果使用 in_array，它可能会很慢，真的很慢。有没有更快的选择？我当前的代码是 foreach($a as $b)
Java 比 C 快
这个问题在这里已经有了答案: How do I write a correct micro-benchmark in Java? (11 个答案) 关闭 9 年前。今天我做了一个简单的测试来比较
Python 实现比 C 快
如果比较不应该以这种方式进行，我深表歉意。我是编程新手，只是很好奇为什么会这样。我有一个包含词嵌入的大型二进制文件 (4.5gb)。每行都有一个单词，后面跟着它的嵌入，它由 300 个浮点值组成。我
c++ - 为什么我的直接四元数乘法比 SSE 快？
我经历了几个不同的四元数乘法实现，但我很惊讶地发现引用实现是迄今为止我最快的实现。这是有问题的实现: inline static quat multiply(const quat& lhs, cons
c++ - 为什么虚函数调用比 dynamic_cast 快？
我写了一个简单的例子，估计调用虚函数的平均时间，使用基类接口(interface)和dynamic_cast和调用非虚函数。这是它: #include #include #include #in
c++ - 比 Stackwalk 快
有没有人知道比“StackWalk”更好/更快的获取调用堆栈的方法？我还认为 stackwalk 在有很多变量的方法上也会变慢......(我想知道商业分析员是做什么的？)我在 Windows 上使用

行者123

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

Java:手动展开的循环仍然比原始循环快。为什么？