high-availability - 具有 2 节点 proxmox 的 HA 集群-6ren

high-availability - 具有 2 节点 proxmox 的 HA 集群

转载作者：行者123 更新时间：2023-12-02 19:30:31

26

4

我想在1个节点死亡时实现虚拟机自动迁移。我创建了 proxmox 集群、设置了复制并安装了看门狗 ipmi。但丢失 1 个节点后，什么也没有发生。我用过https://pve.proxmox.com/pve-docs/chapter-ha-manager.html ，和https://pve.proxmox.com/wiki/High_Availability_Cluster_4.x#Hardware_Watchdogs

ha-manager config
ct:100
        group HA
        max_restart 0
        state started

ha-manager status
quorum OK
master node1 (active, Mon May 18 09:18:59 2020)
lrm node1 (idle, Mon May 18 09:19:00 2020)
lrm node2 (active, Mon May 18 09:19:02 2020)
service ct:100 (node2, started)

当我关闭node2时，我记录了:

May 18 08:12:37 node1 pve-ha-crm[2222]: lost lock 'ha_manager_lock - cfs lock update failed - Operation not permitted
May 18 08:12:38 node1 pmxcfs[2008]: [dcdb] notice: start cluster connection
May 18 08:12:38 node1 pmxcfs[2008]: [dcdb] crit: cpg_join failed: 14
May 18 08:12:38 node1 pmxcfs[2008]: [dcdb] crit: can't initialize service
May 18 08:12:42 node1 pve-ha-crm[2222]: status change master => lost_manager_lock
May 18 08:12:42 node1 pve-ha-crm[2222]: watchdog closed (disabled)
May 18 08:12:42 node1 pve-ha-crm[2222]: status change lost_manager_lock => wait_for_quorum
May 18 08:12:44 node1 pmxcfs[2008]: [dcdb] notice: members: 1/2008
May 18 08:12:44 node1 pmxcfs[2008]: [dcdb] notice: all data is up to date
May 18 08:13:00 node1 systemd[1]: Starting Proxmox VE replication runner...
May 18 08:13:01 node1 pvesr[40781]: trying to acquire cfs lock 'file-replication_cfg' ...
May 18 08:13:02 node1 pvesr[40781]: trying to acquire cfs lock 'file-replication_cfg' ...
May 18 08:13:03 node1 pvesr[40781]: trying to acquire cfs lock 'file-replication_cfg' ...
May 18 08:13:04 node1 pvesr[40781]: trying to acquire cfs lock 'file-replication_cfg' ...
May 18 08:13:05 node1 pvesr[40781]: trying to acquire cfs lock 'file-replication_cfg' ...
May 18 08:13:05 node1 pveproxy[39495]: proxy detected vanished client connection
May 18 08:13:06 node1 pvesr[40781]: trying to acquire cfs lock 'file-replication_cfg' ...
May 18 08:13:07 node1 pvesr[40781]: trying to acquire cfs lock 'file-replication_cfg' ...
May 18 08:13:08 node1 pvesr[40781]: trying to acquire cfs lock 'file-replication_cfg' ...
May 18 08:13:09 node1 pvesr[40781]: trying to acquire cfs lock 'file-replication_cfg' ...
May 18 08:13:10 node1 pvesr[40781]: error with cfs lock 'file-replication_cfg': no quorum!

最佳答案

问题出在法定人数上。而且非常重要，并且不能直观地工作。如果您设置了 Proxmox 集群，那么它会打开仲裁机制。要在集群上执行任何操作，它需要每个节点的投票来了解正在发生的情况。需要50%现有节点+1才能接受投票。

当您创建 2 节点集群时，有一个愚蠢的默认设置:它需要 50%+1=2 个节点才能执行任何操作。因此，尽管是“集群”，但如果一个节点挂掉，您甚至无法启动虚拟机/容器，直到两个节点都正常工作为止。

有一个解决方法:在 corosync.conf (/etc/corosync/corosync.conf) 中，您必须启用两个参数:两个节点:1wait_for_all:0

第一个参数定义在两个节点集群情况下需要1票才能执行操作。但对于年轻玩家来说还有另一个陷阱:此设置会自动启用另一个设置:wait_for_all，该设置会禁用集群在开机时的操作，直到所有节点出现。所以这实际上再次破坏了集群。所以你也必须克服这个问题。

仔细阅读此手册页: https://www.systutorials.com/docs/linux/man/5-votequorum/

但是还有另一个问题。 corosync.conf 有 2 个版本:/etc/corosync/corosync.conf和/etc/pve/corosync.conf

每当第二个更改时，第一个就会被覆盖所以你必须编辑后面的一个。但是，当您的第二个节点关闭时，您必须先暂时禁用仲裁，然后编辑文件。

关于high-availability - 具有 2 节点 proxmox 的 HA 集群，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/61863694/

26

4

0

文章推荐： javascript - 从外部 Javascript 文件调用方法

文章推荐： r - 无法通过 RStudio 的任务调度程序启动浏览器

文章推荐： javascript - 拉斐尔路径未显示

文章推荐： android - 从 XML 文件中查找另一个模块中的资源 - Android

high-availability - 尼菲 : High Availbility (HA)
从下面的链接中读取，我相信当 Nifi 集群中的一个节点出现故障时，数据将不会被处理，直到该节点恢复运行 --- 因此由故障节点处理的流文件/数据不会被另一个节点接管集群中的节点。 https://c
machine-learning - "high-capacity cnn"或 "high-capacity architecture"的定义是什么？
我在这两篇论文中发现了“high-capacity cnn”这个短语: 1. Rich feature hierarchies for accurate object detection and se
html - 任何人都可以为我改变这个吗？评级系统 css 从 "high to low"到 "low to high"
目前我想使用来自 http://codepen.io/JaxoDI/pen/DtsdH 的评级系统.但目前它在您从右向左悬停时有效。请随意在给定的链接中尝试一下。但我想要一个从左到右悬停的评级系统。
algorithm - 何时使用 low < high 或 low + 1 < high for loop invariant
我读过多篇文章，包括 Jon Bentley 的二分查找章节。这是我对 CORRECT 二进制搜索逻辑的理解，它在我所做的简单测试中有效: binarysearch (arr, low, high,
html - `high` 中的 `A floating box must be placed as high as possible.` 是什么意思？
我的问题与下面的有点不同 CSS Float Logic .我的问题是关于 height 比这更具体的概念。这里有规则 https://www.w3.org/TR/CSS22/visuren.htm
recursion - FP : What does "order" mean in "high order" functions? 递归函数是否为 "high order"函数？
当我们说“高阶”函数时，我怀疑“阶”的真正含义是什么？例如，我有一个嵌入式函数调用: f.g.h 那么它叫“三阶”函数吗？ “高阶”函数是静态函数累加的概念吗？然后当我有一个递归函数 f 时，在运行时
python - `mid = low + (high -low)//2` 比 `(low + high)//2` 有什么好处？
我正在研究树问题 Convert Sorted Array to Binary Search Tree - LeetCode Given an array where elements are sor
macos-high-sierra - 是否可以在 High Sierra (10.13.6) 上安装 Xcode 10.2？
我最近将 iPhone 设备中的 iOS 升级到 12.2(为我的应用程序“Match4app”提供对最新版本的支持)，这似乎与 Xcode 10.1 不兼容。我应该将 Xcode 更新到 10.2
java - 为什么在 Java 中 (high + low)/2 是错误的，但 (high + low) >>> 1 不是？
我了解 >>> 修复了溢出:当添加两个大的正长时，您最终可能会得到一个负数。有人能解释一下这种按位移位如何神奇地解决溢出问题吗？它与 >> 有何不同？我的怀疑:我认为这与 Java 使用二进制补码这
heroku - "high"交通轨道应用程序的托管问题
我有一个关于托管高流量 Rails 应用程序的问题。问题是我有 3/4 年的 Ruby on Rails 应用程序经验，但我以前从未有过高流量网站。我真的很兴奋，因为这对我和我的同事来说是“下一个层次
delphi - 为什么优化器不消除循环中的 High？
人们说 Delphi 在整数运算上生成了非常好的优化代码。我在 Delphi 2007 中尝试了以下示例，并看到编译器生成的汇编代码。 program p1000; {$APPTYPE CONSOLE
Azure服务总线: High Availability
我目前正在构建一个混合云解决方案，需要将消息写入队列以供稍后处理。队列具有高可用性(99.999+% 的正常运行时间)是绝对必要的。我的选择是将消息读/写到本地 ZeroMQ 高可用性对或 Azur
javascript - High 图表条形图中的对齐问题
我正在使用 Highcharts 创建此条形图。条形的对齐方式不在部分的中间(就像第一个红色条形图不在 2016 年 1 月的中间)。是否有任何选项可以将所有栏放置在每个部分的中间？最佳答案我找到
c# - 如何验证调用堆栈上的参数 "high up"？
我一直在阅读 Framework Design Guidelines 一书，这是一本关于在 .NET 中设计框架的书，其中摘录了框架设计者对每个部分(例如参数设计、异常处理等)所做的决定。在参数设计
apache - 在Mac High Sierra上停止Apache服务器
我正在尝试停止Macbook上的Apache服务器。我尝试了以下 $ sudo apachectl stop /System/Library/LaunchDaemons/org.apache.htt
high-availability - Airflow 设置以实现高可用性
如何在高可用性中部署 apache Airflow (正式称为 airbnb 的 Airflow )调度程序？我不是在询问显然应该在高可用性配置中部署的后端 DB 或 RabbitMQ。我的主要关
optimization - "high contrast"曲线的快速公式
我的内部循环包含一个计算，分析显示有问题。这个想法是采用灰度像素 x (0 .5，x =0)-1, ... x, erf(x), ... x, tanh(x), .
javascript - High Chart 气泡图的不同形状
我们如何定制 HighChart 的 Bubble Chart具有不同的形状。就像我们代表 4 种不同的事件类型一样，我们不仅需要 4 种不同颜色的气泡，而且还需要每个气泡具有不同的形状，如圆形、三
Azure文件存储: High count of ClientOtherError
刚刚注意到我在 Azure 中的文件共享存储出现“ClientOtherError”的概率非常高。他们的成功率在 50-100% 之间。有人有任何经验可以解释为什么会这样吗？所附图表以红色/橙色显
elasticsearch - 闲置时Elasticsearch High CPU
我是Elasticsearch的新手，遇到了一个问题，甚至在故障排除方面也遇到了困难。我的Elasticsearch(1.1.1)当前正在使CPU处于运行状态，即使没有进行搜索或建立索引也是如此。 C

首页

博学

6Ren·AI

商城

high-availability - 具有 2 节点 proxmox 的 HA 集群