ServiceMesh5：异常重试和超时保护提升服务可用性

转载作者：撒哈拉更新时间：2024-12-12 10:25:15

65

4

★ ServiceMesh系列。

1 背景

在复杂的互联网场景中，不可避免的会出现请求失败或者超时的情况。从程序的的响应结果来看，一般是Response返回5xx状态的错误；从用户的角度去看，一般是请求结果不符合预期，即操作失败（如转账失败、下单失败、信息获取不到等）。偶发的不可避免的5xx请求错误，产生的原因有很多种，比如:

网络延迟或者抖动
服务器资源不足（CPU、内存走高、连接池满）
服务器故障
符合某些特定条件下的服务程序bug（大都非必现）

2 系统稳定性等级划分

大部分服务容忍低频、偶发的5xx错误，并使用可用性级别来衡量系统的健壮性，级别系数越高，健壮性越好，如下:

等级描述	故障时长（年）	可用行等级
基本可用性	87.6h	99%
较高可用	8.8h	99.9%
非常高的可用性（大部分故障可自动恢复）	52m	99.99%
极高可用性	5m	99.999%

对于强系统可靠性、强结果预期性要求的系统，如转账、下单、付款，即使微小的可用性降级也是不可接受，用户强烈需要接收到正确的结果。可以想想你付款的时候发现付款失败有多么惊慌，订外卖的时候获取信息失败有多么沮丧，这些都是用户痛点.

3 请求异常的治理手段

3.1 采用异常重试实现故障恢复

通过上面的故障原因分析我们知道，排除了必现的程序逻辑错误，大部分环境导致的错误是可以通过重试进行恢复的。治理的手段主要是采用异常重试来实现的，通过重试负载到健康实例上（实例越多重试成功率越高），降低用户感知到的故障频率.

执行过程说明。

这边以示例服务 Svc-A 向 Svc-B 发起访问为例子。
第1次执行失败之后，根据策略，间隔25ms之后发起第2次请求。
会看到有两条日志，日志的trace_id 一致，说明他是同一个调用过程（1个调用过程，包含2次请求，首发1次与重试1次）
请求方为同一个实例 Svc-A-Instance1，说明请求发起方一致。
被请求方发生了变动，说明调度到新的实例（Svc-B-Instance1 到 Svc-B-Instance2）。
返回正常的 200 。

因为我们的负载均衡模式默认是RR，所以实例越多，实际上重试成功的概率会越高。比如有50个实例，其中一个实例出故障，导致执行返回5xx，那么第二次请求的时候一般来说会有 49/50 的成功概率。如下图:

3.2 Istio策略实现

注释比较清晰了，这边就不解释了.

# VirtualService
apiVersion: networking.istio.io/v1beta1
kind: VirtualService
metadata:
  name: xx-svc-b-vs
  namespace: kube-ns-xx
spec:
  hosts:
  - svc_b.google.com # 治理发往 svc-b 服务的流量
  http:
  - match:  # 匹配条件的流量进行治理
    - uri:
        prefix: /v1.0/userinfo   # 匹配路由前缀为 /v1.0/userinfo 的，比如 /v1.0/userinfo/1305015
    retries:
      attempts: 1  # 重试一次
      perTryTimeout: 1s  # 首次调用和每次重试的超时时间
      retryOn: 5xx  # 重试触发的条件
    timeout: 2.5s  #  请求整体超时时间为2.5s，无论重试多少次，超过该时间就断开。
    route:
    - destination:
        host: svc_b.google.com
      weight: 100
  - route:  # 其他未匹配的流量默认不治理，直接流转
    - destination:
        host: svc_c.google.com
      weight: 100

4 请求超时的治理手段

4.1 请求超时的主要原因

网络延迟或者抖动或者丢包，从而导致响应时间变长。
容器甚至云主机资源瓶颈情况：如CPU使用率过高、内存使用是否正常、磁盘IO压力情况、网络时延情况等资源使用情况异常，也可能导致响应时间变长。
负载均衡性问题：多实例下分配的流量不均衡，目前看云基础场景，这个情况不多见。
突发洪峰请求：如流不存在非预期的流量，作为主打对内的项目，突发洪峰请求主要还是程序的调用不合理或者程序bug（内存泄露、循环调用、缓存击穿等）。

单个副本，长耗时容易造成队列堆积，对资源损耗很大，快速的释放或者调度开是一个比较好的办法，是一种普遍可接受的降级方案，否则超时阻塞会导致服务长时间不可用。
而且这种影响是水平扩散的，同服务上的其他功能也会被争抢资源。

4.2 Istio的治理手段

4.2.1 超时重试

对服务的核心接口进行细粒度配置，具体接口超时时间应该在 ≥ TP 99.9（满足999‰的网络请求所需要的最低耗时）的耗时，可以考虑重试.

4.2.2 超时熔断

通过指定超时时间对请求进行断连，达到降级的目的。避免长时间队列阻塞，导致雪崩沿调用向上传递，造成整个链路崩溃.

4.3 Istio策略实现

关注下方代码中的两个星号 ★ 的属性:

perTryTimeout 指的是首次调用和每次重试的超时时间，超过这个时间，说明请求大概率已经pending住了，则进行重试，争取落到其他健康实例上，更快拿回的结果。
timeout 指的是请求整体超时时间为2.5s，无论重试多少次，超过该时间就断开，这是一种保护策略，避免过度重试或者长时间Pending导致服务恶化甚至雪崩。

# VirtualService
apiVersion: networking.istio.io/v1beta1
kind: VirtualService
metadata:
  name: xx-svc-b-vs
  namespace: kube-ns-xx
spec:
  hosts:
  - svc_b.google.com # 治理发往 svc-b 服务的流量
  http:
  - match:  # 匹配条件的流量进行治理
    - uri:
        prefix: /v1.0/userinfo   # 匹配路由前缀为 /v1.0/userinfo 的，比如 /v1.0/userinfo/1305015
    retries:
      attempts: 1  # 重试一次
      perTryTimeout: 1s  #  ★ 首次调用和每次重试的超时时间
      retryOn: 5xx  # 重试触发的条件
    timeout: 2.5s  #  ★ 请求整体超时时间为2.5s，无论重试多少次，超过该时间就断开。
    route:
    - destination:
        host: svc_b.google.com
      weight: 100
  - route:  # 其他未匹配的流量默认不治理，直接流转
    - destination:
        host: svc_c.google.com
      weight: 100

5 总结

本文我们介绍了使用服务网格进行异常重试和超时熔断的治理。Istio提供了丰富的治理能力，后续的章节我们逐一了解下故障注入、熔断限流、异常驱逐等高级用法.

最后此篇关于ServiceMesh5：异常重试和超时保护提升服务可用性的文章就讲到这里了,如果你想了解更多关于ServiceMesh5：异常重试和超时保护提升服务可用性的内容请搜索CFSDN的文章或继续浏览相关文章，希望大家以后支持我的博客！。

65

4

0

文章推荐：图片渲染API：极速生成电商、社媒、营销、横幅、证书等图片！

文章推荐：零基础学习人工智能—Python—Pytorch学习（十一）

文章推荐：人工评估|基础概念

文章推荐： LeetCode题集-6-Z字形变换

wcf - .NET RIA 服务/WCF 服务
我们正在创建一个 n 层 Silverlight LOB 应用程序，并且正在考虑使用 .NET RIA 服务。我们不清楚这与我们当前的 WCF 服务 API 的关系在哪里。我们当前的架构是: 银光
docker - docker-compose up <服务>无法正确启动<服务>
上下文:我在celery + rabbitmq堆栈上有一个主工作系统。系统已docker化(此处未提供worker服务) version: '2' services: rabbit:
c# - 托管 Web 服务/WCF 服务？
我是 Windows Azure 新手，我正在尝试将我的 Web 应用程序部署到 Windows Azure。在我的应用程序中，我使用了一些 Web 服务，现在我想知道如何在 Windows Azur
c# - Web 服务/wcf 服务，返回数据集是否更好？
因此，根据我对服务的了解，自定义对象似乎是写入服务以返回数据的方式。如果我正在编写将用于 1) 填充数据库或 2) 为网站提供信息的服务，是否有返回数据集/数据表而不是包含所有这些的自定义对象列表的用
json - Azureml Web 服务 - 如何从实验创建供移动应用程序使用的 Rest 服务？
我在 google 和 stackoverflow 上都找过答案，但似乎找不到。我正在尝试将 azure 实验的输出获取到应用程序。我使用 ibuildapp 和谷歌表单制作了该应用程序。如何使用 g
kubernetes - 服务 "kubernetes"已删除 - 意外删除了 kubernetes 服务
我不小心删除了 kubernetes svc: service "kubernetes" deleted 使用: kubectl delete svc --all 我该怎么办？我只是想删除服务，以便
php - Android Web 服务 - "poke"Web 服务
我正在努力确定解决网络服务问题的最有效方法。我的情况:我正在开发一个 Android 应用程序，它通过 Web 服务从 mysql 数据库(在我自己的服务器 PC 上)存储和检索数据。用户按下提交按
android - 什么时候绑定(bind)服务，什么时候不绑定(bind)服务
我一直在翻阅 Android 文档，我很好奇。什么时候绑定(bind)服务而不是不绑定(bind)服务？它提供了哪些优点/限制？最佳答案 When would you bind a service
hadoop - Hive 服务、HiveServer2 和 MetaStore 服务？
我试图从架构的角度理解 hive，我指的是 Tom White 关于 Hadoop 的书。我遇到了以下关于配置单元的术语:Hive Services、hiveserver2、metastore 等。
c# - Windows 服务(托管 WCF 服务)在启动时立即停止
我的问题:安装服务后我无法导航到基地址，因为服务不会继续运行(立即停止)。我需要在服务器或我的机器上做些什么才能使 baseAddress 有效吗？背景:我正在尝试学习如何使用 Windows 服务
ASP.NET Web 服务(复数)或具有多个类的 Web 服务
我正在努力就 Web 服务的正确组织做出决定。我应该有多个 ASMX 来代表 Web 服务中的不同功能，还是应该有一个 ASMX？如果我有多个 ASMX，这不构成多个 Web 服务吗？如果我只有一
Azure 服务 WebRole 中托管的 WCF REST 服务 : AccessControlService?
我正在从事一个在 azure 平台上提供休息服务的项目。该服务由 iPhone 客户端使用，这是选择其余方法的重要原因之一。我们希望通过 AccessControlService(ACS) 并使用
ionic-framework - ionic 服务 VS ionic 服务 -c
我是 Ionic 新手，正在使用 Ionic 3.9.2 我有几个终端命令来为我的 ionic 应用程序提供服务，但是，我没有发现这两个命令之间有任何区别。 ionic serve 和 ionic s
Java Web 服务。如何在 Java 控制台应用程序中创建 Web 服务？
关闭。这个问题需要多问focused 。目前不接受答案。想要改进此问题吗？更新问题，使其仅关注一个问题 editing this post . 已关闭 8 年前。 Improve this ques
web-services - 标准 Web 服务 v 安全 Web 服务
作为项目的一部分，我期待着问这个问题。我过去有开发和使用 Web 服务的经验，并且非常熟悉这些服务。但是，有人告诉我，作为下一个项目的一部分，我将需要使用“安全”的 Web 服务。您能否提供一些见解，
cordova - 如何使用 Apache Cordova 调用 wcf 服务/Web 服务
我浏览了很多关于这个问题的信息，但找不到解决方案。这里的问题是，我想使用 Apache Cordova 和 Visual Studio 连接到 wcf。因此，如果有人找到合适的工作解决方案，请发布链接
c# - 从 jquery/javascript 调用 Windows 服务 wcf 服务
我在 Windows 服务中托管了一个 WCF(从 MS 网站示例中选取)，我可以使用 SOAP UI 访问和调用方法。但是，当我尝试使用 jquery 从 Web 应用程序调用相同的方法时，我不断收
php - 如何保护 web 服务，以便只有我的 android 应用程序可以使用我的 web 服务
我们构建了一个 Android 应用程序，它从 Android 向我的 PHP 服务器发送 HTTP 请求。作为响应，Web 服务将 JSON 对象发送到 Android 应用程序以显示结果。就像其
android - 如何将值传递给 Android 应用程序中的 Soap 服务(ASMX 服务)中的标志枚举参数
我想在 android 应用程序中调用 soap web 服务，它需要一个枚举值作为参数，它是一个标志枚举。如何从 Android 应用程序将一些值作为标志枚举传递给此 Web 服务方法？我使用 K
android - 无法在模拟器上运行 Google Play 服务(需要更新 Google Play 服务)
我尝试在模拟器上安装 Google Play。我已按照 Google Dev Site 中的说明进行操作. 使用 ADV 管理器似乎没问题，设备的目标是 Google API 版本 22，但是当我运行

首页

博学

6Ren·AI

商城