java - HashSet vs ArrayList CPU 使用率高-6ren

java - HashSet vs ArrayList CPU 使用率高

转载作者：塔克拉玛干更新时间：2023-11-03 03:54:26

我有 104k 个字符串值，其中 89k 个是唯一的。我想检查这个列表中是否存在一个字符串。

这是我的类及其保存所有这些记录的方法。

public class TestClass {
    private static TestClass singletonObj = null;
    private List<String> stringList= null;

    public static synchronized TestClass getInstance() {
        if(singletonObj == null) {
            singletonObj = new TestClass();
        }
        return singletonObj;
    }


    public boolean isValidString(String token) {
        if(stringList == null) {
            init();
        }
        if(stringList != null && token != null && !token.isEmpty())
            return stringList.contains(token.toLowerCase());
        return false;
    }

    private init() {
     stringList = new ArrayList<String>();
     // put all 104k values in this data structure.
    }
}

我的应用程序尝试同时使用此 isValidString() 方法，每秒大约有 20 个请求。这工作正常，但是当我尝试将数据结构更改为 HashSet 时，CPU 使用率非常高。根据我的理解，Hashset 应该比 ArrayList[o(n)] 表现得更好[o(1)]。任何人都可以向我解释为什么会这样吗？

最佳答案

我创建了一个简单的类来生成 20 个线程，按照这篇文章的底部每秒访问您的字典检查器。

我无法复制您的结果 - 但这可能是因为我有权访问输入数据。我使用了您的 TestClass 实现，从英语开放单词列表 (EOWL) 中导入了约 130,000 个单词。对于 ArrayList 或 HashSet 作为 stringList 的类型，没有看到持续的高 CPU 使用率。

我的猜测是您的问题是由于您的输入数据造成的。我尝试添加我的输入字典两次以创建重复 - 显然使用 ArrayList 这只会使列表长两倍，但是使用 HashSet，这意味着代码被抛出重复。您注意到大约 1/5 的输入数据是重复的。在我的测试中有 1/2 的重复项，我确实看到轻微 CPU 增加了大约 2 秒，然后在 stringList 已初始化。

如果您输入的字符串比我使用的单个单词更复杂，这个“信号”可能会持续更长时间。所以也许那是你的问题。或者 - 也许您有一些其他代码来包装这部分占用 CPU 的部分。

N.B. 我会提醒您，因为其他人在对您的 init 实现发表评论时。在我的实验中，我看到许多线程可以在字典完全初始化之前调用字典检查，从而为相同的测试单词提供不一致的结果。如果它是一个单例对象，为什么不从你的构造函数中调用它呢？

代码 list

带有一些输入数据代码的测试类:

import java.io.File;
import java.io.FileNotFoundException;
import java.io.FileReader;
import java.util.ArrayList;
import java.util.HashSet;
import java.util.List;
import java.util.Scanner;

public class TestClass {
    private static TestClass singletonObj = null;
    //private List<String> stringList = null;

    private HashSet<String> stringList = null;

    public static synchronized TestClass getInstance() {
        if (singletonObj == null) {
            singletonObj = new TestClass();
        }
        return singletonObj;
    }

    public boolean isValidString(String token) {
        if (stringList == null) {
            init();
        }
        if (stringList != null && token != null && !token.isEmpty())
            return stringList.contains(token.toLowerCase());
        return false;
    }

    private void init() {
        String dictDir = "C:\\Users\\Richard\\Documents\\EOWL_CSVs";
        File[] csvs = (new File(dictDir)).listFiles();
        stringList = new HashSet<String>();
        Scanner inFile = null;

        for (File f : csvs) {
            try {
                inFile = new Scanner(new FileReader(f));
            } catch (FileNotFoundException e) {
                e.printStackTrace();
                System.exit(1);
            }

            while (inFile.hasNext()) {
                stringList.add(inFile.next().toLowerCase()
                        .replaceAll("[^a-zA-Z ]", ""));
            }
            inFile.close();
        }

        System.out.println("Dictionary initialised with " + stringList.size()
                + " members");
    }
}

访问它的线程:

import java.io.FileNotFoundException;

public class DictChecker extends Thread {

    TestClass t = null;
    public static int classId = 0;
    String className = null;
    
    
    public void doWork()
    {
        String testString = "Baby";
        if (t.isValidString(testString))
        {
            System.out.println("Got a valid string " + testString + " in class " + className);
        }
        else
        {
            System.out.println(testString + " not in the dictionary");
        }
    }
    
    public void run()
    {
        while (true)
        {
            try {
                DictChecker.sleep(1000);
            } catch (InterruptedException e) {
                e.printStackTrace();
            }
            doWork();
        }
    }
    
    public DictChecker()
    {
        t = TestClass.getInstance();
        className = "dChecker" + classId;
        classId += 1;
        System.out.println("Initialised " + className + " in thread " + this.getName());
    }
    
    public static void main(String[] args) throws FileNotFoundException
    {
        for (int i = 0; i < 20; i++)
        {
             (new DictChecker()).start();
             try {
                DictChecker.sleep(50);//simply to distribute load over the second
            } catch (InterruptedException e) {
                e.printStackTrace();
            } 
        }
    }
}

关于java - HashSet vs ArrayList CPU 使用率高，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/31850073/

文章推荐： java - instanceof List 和 instanceof List 的区别

文章推荐： algorithm - 叠加微积分和方程的排序

文章推荐： javascript - 数组排列/组合

文章推荐： c++ - 从脉冲信号、离散信号和连续信号中获取实际值

cpu-usage - CPU 使用率和 CPU 使用率之间的区别？
我想知道在谈到 CPU 使用率和 CPU 利用率时，术语是否存在科学差异。我觉得这两个词都被用作同义词。它们都描述了 CPU 时间和 CPU 容量之间的关系。 Wikipedia称之为 CPU 使用率
cpu - CPU 指令重新排序的跟踪
我研究了一些关于处理器和 Tomasulo 算法的指令重新排序的内容。为了更深入地了解这个主题，我想知道是否有任何方法可以(获取跟踪)查看为给定程序完成的实际动态重新排序？我想给出一个输入程序并查
cpu-architecture - 本地 CPU 可能会降低远程 CPU 的数据包接收性能
我有一台配备 2 个 Intel Xeon CPU E5-2620 (Sandy Bridge) 和 10Gbps 82599 NIC(2 个端口)的服务器，用于高性能计算。从 PCI 关联性中，我看
cpu - 用户 CPU 时间 vs 系统 CPU 时间？
您能详细解释一下“用户 CPU 时间”和“系统 CPU 时间”吗？我读了很多，但我不太理解。最佳答案区别在于时间花在用户空间还是内核空间。用户 CPU 时间是处理器运行程序代码(或库中的代码)所花
cpu - 如何确定 CPU 是否与 ARM v5 cpu 指令兼容
我想知道如何识别 CPU 是否与 ARM v5 指令集兼容。假设 ARM v7 指令与 ARM v5 兼容是否正确？最佳答案您可以阅读 CPUID base register获得PARTNO。然
c - 如何在单个 CPU 的多个 cpu 内核上设置亲和性而不是在多个 CPU 上？
我目前在具有多个六核 CPU 的服务器上使用 C 多线程。我想将我的一些线程的亲和性设置为单个 CPU 的各个核心。我使用过 pthread_setaffinity_np() 和 sched_seta
android - 在traceview中Incl CPU Time，Excl CPU Time，Incl Real CPU Time，Excl Real CPU Time是什么意思？
1) 独占时间是在方法中花费的时间2) 包含时间是在方法中花费的时间加上在任何被调用函数中花费的时间3)我们称调用方法为“ parent ”，称方法为“子”。引用链接:Click here 这里的问题
c - 编写一段代码，该代码在新 cpu 上比在旧 cpu 上运行的 cpu 周期更多
关闭。这个问题需要多问focused 。目前不接受答案。想要改进此问题吗？更新问题，使其仅关注一个问题 editing this post . 已关闭 5 年前。 Improve this ques
cpu - 编译器完成的指令重新排序与 cpu 完成的指令重新排序之间有什么关系？
好的，所以编译器可以出于性能原因自由地重新排序代码片段。让我们假设一些代码片段，在没有应用优化的情况下直接翻译成机器代码，看起来像这样: machine_instruction_1 machine_i
cpu - "CPU jumps"是什么意思？
我在 zabbix 中有以下默认图表，但我不知道如何解释这些值。谁能解释一下？最佳答案操作系统是一件非常忙碌的事情，尤其是当你让它做某事时(即使你没有做)。当我们看到一个活跃的企业环境时，总会发生
cpu - 缓存是否具有 CPU 的字节序？
换句话说，L1、L2、L3 等缓存是否总是反射(reflect) CPU的字节序 ? 或者总是将数据存储在某些的缓存中更有意义吗？特定字节序 ? 有没有总体设计决策 ? 最佳答案大多数现代缓存不会
cpu - 现代 CPU 是否跳过乘法为零？
我想知道当前的 cpus 是否避免在其中至少一个为零时将两个数字相乘。谢谢最佳答案这取决于 CPU 和(在某些情况下)操作数的类型。较旧/较简单的 CPU 通常使用如下乘法算法: integer
cpu - CUDA 回退到 CPU？
我有一个 CUDA 应用程序，它在一台计算机(配备 GTX 275)上运行良好，而在另一台配备 GeForce 8400 的计算机上运行速度慢了大约 100 倍。我怀疑有某种回退使代码实际上在 CPU
cpu - 堆栈宽度是否始终与 CPU 寄存器大小相同？
例如，对于 8 位 CPU，堆栈大小预计为 8 位宽，16 位 CPU 与 16 位堆栈宽度，以及 32 位、64 位 CPU，等等。是否适用于所有架构？最佳答案 CPU 具有数据总线和地址总线。它
cpu - SIMD 是否需要多核 CPU？
实现 SIMD 是否需要多核 CPU？在阅读有关 SIMD 的维基百科时，我发现了以下短语“多处理元素”。那么这句话和“多核CPU”有什么区别呢？最佳答案不，每个内核通常都可以执行指令集中的大多
cpu - 了解 CPU 流水线阶段与指令吞吐量
我遗漏了一些基本的东西。 CPU 流水线:在基本层面上，为什么指令需要不同数量的时钟周期才能完成，为什么有些指令在多级 CPU 中只需要 1 个周期？除了明显的“不同的指令需要不同的工作量才能完成”
cpu - 超线程 CPU 是实现并行还是仅实现并发？
超线程 CPU 是实现并行还是仅实现并发(上下文切换)？我的猜测是没有并行性，只有通过上下文切换的并发性。最佳答案单个物理 CPU 具有超线程的核心显示为两个逻辑 CPU 到操作系统。 CPU
cpu - 理解 cpu 信息
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。这个问题似乎不是关于 a specific programming problem, a softwar
cpu - 哪些 CPU 指令最耗电？
背景是这样的:下周我们的办公室将有一天因为维护而没有暖气。预计室外温度在 7 至 12 摄氏度之间，因此可能会变冷。可移植电取暖器数量太少，无法满足所有人的需求。但是，在我大约 6-8 平方米的办公
Docker cpu 共享并保证容器的最小分配 CPU
我开发了一个应用程序，该应用程序在我的开发箱上的三个容器中运行，该开发箱具有带超线程的四核，这意味着系统和 docker 使用 8 个核心。容器的 CPU 分配由 docker-compose 完成

塔克拉玛干

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

java - HashSet vs ArrayList CPU 使用率高

代码 list