cluster-computing - 为什么在 Slurm 中重复调用 squeue 不受欢迎？-6ren

cluster-computing - 为什么在 Slurm 中重复调用 squeue 不受欢迎？

转载作者：行者123 更新时间：2023-12-03 23:06:16

27

4

为什么不推荐运行squeue在循环中避免 Slurm 过载，但没有提到 bjobs 的此类限制来自 LSF 的工具或 qstat从 SGE ?
man page为 squeue状态:

PERFORMANCE

Executing squeue sends a remote procedure call to slurmctld. If enough calls from squeue or other Slurm client commands that send remote procedure calls to the slurmctld daemon come in at once, it can result in a degradation of performance of the slurmctld daemon, possibly resulting in a denial of service.

Do not run squeue or other Slurm client commands that send remote procedure calls to slurmctld from loops in shell scripts or other programs. Ensure that programs limit calls to squeue to the minimum necessary for the information you are trying to gather.

据我所知，这不赞成使用例如 watch squeue .这样的警告通常可以在特定于站点的文档中找到，例如 here :

Although squeue is a convenient command to query the status of jobs and queues, please be careful not to issue the command excessively, for example, invoking the query for the status of a job every five seconds or so using a script after a job is submitted.

相比之下，我找不到其他引擎上类似工具的此类警告，例如 qstat 或 bjobs .
我看到人们以重复的方式使用所有这些工具，没有区别，例如 here对于 squeue， here对于 bjobs。
上面来自 Slurm 文档的引用提到了 RPC，它是一种与其他引擎不同的方式吗？ Slurm 和其他网格引擎之间是否存在架构差异，这使得查询所有作业的状态成本更高？

最佳答案

其实运行的关注squeue过快通常更多地来自集群管理员而不是开发人员。在这种特殊情况下，查看 commit message在文档的特定部分中，我们了解到它实际上是由 SchedMD 的客户请求的，因此很可能是运行生产集群的实体。
该建议的重要性随着集群的规模和工作流动而增加。在平均每天运行 5-6 个作业的 10 节点集群上，您会发现来自十几个用户的许多 squeue 击中了 slurm Controller 。要求。但是在 4000 个节点、10000 个用户、1 万个作业/天上，您可能会以可见的方式干扰 Slurm 性能。
我见过至少一个网站覆盖了 qstat具有基于缓存信息的速率限制版本的命令。
从技术角度来看，RPC 是大多数替代方案使用的。

关于cluster-computing - 为什么在 Slurm 中重复调用 squeue 不受欢迎？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/62513304/

27

4

0

文章推荐： airflow - Airflow 调度器问题

文章推荐： c# - 从 Excel 读取的随机日期格式

文章推荐： java - 对于 400 Bad Request 没有得到正确的错误信息

cluster-computing - 野蝇 9 : JGRP000012: discarded message from different cluster hq-cluster (our cluster is ee)
从 Wildfly 8.2.1.Final 升级到 Wildfly 9.0.1.Final 后，我们开始收到很多警告，如下所示: WARNING [org.jgroups.protocols.TCP]
cluster-computing - Terracotta Cluster 仍然是开源的吗？
如果是，在哪里可以找到？!根据this infoq 条目，他们已经开源了。但是现在，他们的网站上没有这样的产品。最佳答案本页，http://terracotta.org/dl/oss-downlo
sql - "clustered"中的 "clustered index"是什么意思？
这个问题已经有答案了: 已关闭12 年前。 Possible Duplicates: Difference between clustered and nonclustered index What
clustered-index - H2数据库: clustered indexes support
我将 H2 数据库用于包含大量时间序列的环境数据。时间序列只是定期(例如每小时一次)记录在数据库中的传感器的测量值。表中存储的数据: CREATE TABLE hydr (dt timestamp
cluster-computing - Cluster 和 MPP super 计算机架构之间有什么区别？
Cluster 和 MPP super 计算机架构之间有什么区别？最佳答案在集群中，每台机器在内存、磁盘等方面都在很大程度上独立于其他机器。它们使用普通网络上的一些变体相互连接。集群主要存在于程序
akka-cluster - 使用akka cluster multi-jvm testkit模拟网络分区
我正在尝试为 akka 集群构建一个大脑 split 解析器。但是很难模拟某些节点无法从原始集群的其余部分访问并形成自己的集群的场景。不能通过停止和重启节点来完成，因为新启动的节点不是同一个节点，因
android - 无法解析导入 com.google.maps (clustering.Cluster)
我正在尝试在我的应用程序中使用集群。但是，在导入语句中，我得到“无法解析导入 com.google.maps (clustering.Cluster)”。此外，在使用 ClusterManager
hadoop - Hive 中 Cluster By 和 CLUSTERED BY 的区别？
我想知道 Hive 中 Cluster By 和 CLUSTERED BY 的主要区别是什么。 Cluster By 用于对表进行分桶。并且会用到Hash函数。 CLUSTERED BY 用于在 re
redis - 如何解决redis cluster "Waiting for the cluster to join"问题？
我有3台机器，为redis集群创建了6个节点，我几个月前创建成功了，但现在它掉线了，我尽力修复它，但它不起作用，所以我清理所有数据并重新创建它从零开始，当我使用以下命令创建集群时，它在这里阻塞，等待节
docker - "--cluster-store"和 "--cluster-advertise"不起作用
我尝试使用 swarm 和 consul 设置 docker 集群。我有 manager、host1 和 host2。我在管理器上运行 consul 和 swarm manager 容器。 $ do
python - tslearn.clustering.TimeSeriesKMeans 与 sklearn.cluster.KMeans
如果我不使用 DTW 作为距离度量，那么 tslearn.clustering.TimeSeriesKMeans 和 sklearn.cluster.KMeans 是否等同？如果不是，谁能告诉我这两
java - Flink Job Cluster 与 Session Cluster - 部署和配置
我正在研究 Flink 1.9.1 的 docker/k8s 部署可能性。我正在阅读/观看 [1][2][3][4]。目前我们确实认为我们会尝试采用作业集群方法，尽管我们想知道这方面的社区趋势是什
r - 层次聚类 : Determine optimal number of cluster and statistically describe Clusters
我可以使用一些关于 R 中方法的建议来确定最佳集群数，然后用不同的统计标准描述集群。我是 R 的新手，对聚类分析的统计基础有基本的了解。确定簇数的方法:在文献中，一种常用的方法是所谓的“肘部准则”，
sql - "Clustered Index Scan (Clustered)"在 SQL Server 执行计划中意味着什么？
我有一个查询无法执行，并显示“由于文件组“DEFAULT”中磁盘空间不足，无法为数据库“TEMPDB”分配新页面”。在排除故障的过程中，我正在检查执行计划。有两个标记为“聚集索引扫描(聚集)”的昂贵
Elasticsearch 索引不工作和错误消息 : node null not part of the cluster Cluster [elasticsearch], 忽略
我刚刚下载了 Elasticsearch 发行版并运行了它。 curl 'localhost:9200' { "status" : 200, "name" : "cbs", "clu
Azure ML : how to change the "cluster purpose" of an existing inference cluster from "dev_test" to "production"?
我有一个集群，其“cluster_ Purpose”设置为“dev_test”。我想将其更改为“生产”。在文档中找不到任何内容。最佳答案回答我自己的问题。这是不可能的。关于Azure ML :
sql-server - SQL Server : Alter a clustered primary index to an non-clustered
如何将主聚集索引更改为非聚集索引。 (作为“辅助”表，我想对“标题”表的外键列使用聚集索引。) 这对我不起作用(错误似乎是合理的:) DROP INDEX ClientUsers.PK_ClientU
python - sklearn 的 KMeans : Cluster centers and cluster means differ. 数值不精确？
我注意到，当使用 sklearn.cluster.KMeans 从方法 .cluster_centers_ 获取集群时，集群中心和每个集群的手动计算均值似乎不会给出完全相同的答案。对于小样本量，差异
java - quartz 调度器 : Trigger some jobs on every cluster node and some only once per cluster
我在集群环境中使用 Quartz Scheduler 作为 Spring bean。我有一些用@NotConcurrent 注释的作业，它们在每个集群中运行一次(即仅在一个节点中，仅在一个线程中)。
javascript - Node.js 的 Cluster 模块和 Learnboost 的 Cluster 模块有什么区别？
Node.js 本身有一个名为 Cluster 的核心模块(引用:http://nodejs.org/docs/v0.8.3/api/cluster.html)，Learnboost 发布了一个名为

首页

博学

6Ren·AI

商城

cluster-computing - 为什么在 Slurm 中重复调用 squeue 不受欢迎？