architecture - 高流量网站上的Solr安全数据导入和核心交换-6ren

architecture - 高流量网站上的Solr安全数据导入和核心交换

转载作者：行者123 更新时间：2023-12-04 04:31:43

25

4

各位技术人员大家好，

假设我们有一个(PHP)网站，每月有数百万的访问者，并且我们在该网站上运行SolR索引，其中托管了400万个文档。 Solr在4台单独的服务器上运行，其中一台服务器为主服务器，其他3台服务器被复制。

每5分钟可以将成千上万个文档插入Solr中。除此之外，用户可以更新其帐户，这也将触发solr更新。

我正在寻找一种安全的策略来快速安全地重建索引而不丢失任何文档。并具有安全的增量/更新策略。我已经考虑过一种策略，因此我想与这里的专家分享该策略，以听取他们的意见，以及我是否应该采用这种方法，或者他们可能会建议(完全)不同。

Solr数据导入

对于所有操作，我想使用一个数据导入处理程序。我想将数据和增量导入混合到一个像DataImportHandlerDeltaQueryViaFullImport这样的配置文件中。我们正在使用MySQL数据库作为数据源。

重建索引

为了重建索引，我要牢记以下几点:我们在“实时”核心附近创建了一个称为“重新索引”的新核心。使用dataimporthandler，我们可以完全重建整个文档集(400万个文档)，总共花费大约1-2个小时。在实时索引上，每分钟仍然会有一些更新，插入和删除。

重建大约花了1-2个小时之后，新索引仍然不再是最新的。为了减小延迟，我们对新内核执行一次“增量”导入，以提交最近1-2小时内的所有更改。完成此操作后，将进行核心交换。每分钟运行一次的常规“增量”导入处理程序将选择此新内核。

提交对实时核心的更新

为了保持实时运行的正常运行，我们每分钟运行一次增量导入。由于进行了核心交换，因此将对跟踪索引的核心(现在是事件的核心)进行跟踪并保持最新状态。我猜如果该索引延迟几分钟会不会真的是一个问题，因为dataimport.properties也将被交换？进口增量已经超过了这几分钟的延迟，但应该是可能的。

希望您了解我的处境和策略，并建议我在您眼中的做法是否正确。我也想知道是否有我没有想到的瓶颈？我们正在运行Solr 1.4版。

我确实有一个问题，复制呢？如果主服务器交换核心，从属将如何处理呢？

交换时丢失文档是否存在任何风险？

提前致谢!

最佳答案

好(难)的问题!

完全导入是一项非常繁重的操作，通常最好运行增量查询以仅将索引更新为RDMS中的最新更改。我明白了为什么在需要进行完全导入时交换主服务器的原因:当完全导入在新内核上运行时，您可以使用增量导入来更新实时内核，因为它需要两个小时。听起来不错，只要不经常使用完全导入即可。

关于复制，在交换主内核之前，我将确保没有任何复制正在进行。有关复制如何工作的更多详细信息，如果您还没有这样做，可以查看Solr wiki。

此外，在交换主内核之前，我将确保在事件内核上没有运行任何增量导入。

关于architecture - 高流量网站上的Solr安全数据导入和核心交换，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/9462017/

25

4

0

文章推荐： inheritance - Groovy在这里做什么？

spring 安全、方法安全和 url 安全
我正在学习 Spring 安全性，但我对它的灵活性感到困惑.. 我知道我可以通过在标签中定义规则来保护网址然后我看到有一个@secure 注释可以保护方法。然后还有其他注释来保护域(或 POJO)
java - key 安全 - 如何确保 key 安全？
假设有一个 key 加密 key 位于内存中并且未写入文件或数据库... byte[] kek = new byte[32]; secureRandom.nextBytes(kek); byte[]
Spring 安全 3.2.0 > <安全 :form-login/> deprecated
我有 Spring Security 3.2.0 RC1 的问题我正在使用标签来连接我这表示“方法‘setF
flutter 安全
我正在创建一个使用 Node Js 服务器 API 的 Flutter 应用程序。对于授权，我决定将 JWT 与私钥/公钥一起使用。服务器和移动客户端之间的通信使用 HTTPS。 Flutter 应用
Javascript 安全
在过去的几年里，我一直在使用范围从 Raphael.js 的 javascript 库。至 D3 ，我已经为自己的教育操纵了来自网络各地的动画。我已经从各种 git 存储库下载了 js 脚本，例如 s
python +安全
在 python 中实现身份验证的好方法是什么？已经存在的东西也很好。我需要它通过不受信任的网络连接进行身份验证。它不需要太高级，只要足以安全地获取通用密码即可。我查看了 ssl 模块。但那个模块让我
Hadoop 安全
我正在尝试学习“如何在 Hadoop 中实现 Kerberos？”我已经看过这个文档 https://issues.apache.org/jira/browse/HADOOP-4487我还了解了基本的
phpmyadmin 安全
我有一个带有 apache2、php、mysql 的生产服务器。我现在只有一个站点 (mysite.com) 作为虚拟主机。我想把 phpmyadmin、webalizer 和 webmin 放在那里
记OPNsense防火墙的安装过程-安全
前些天在网上看到防火墙软件OPNsense，对其有了兴趣，以前写过一个其前面的一个软件M0n0wall（关于m0n0wa
Spring 安全+火力地堡
我在 Spring Boot 和 oauth2(由 Google 提供)上编写了 rest 后端，在 "/login" 上自动重定向。除了 web 的 oauth 之外，我还想在移动后端进行 Fire
c++ - 从派生类调用带有抽象基类的类——安全
我想调用类 Foo，它的构造函数中有抽象类 Base。我希望能够从派生自 Base 的 Derived 调用 Foo 并使用 Derived覆盖方法而不是 Base 的方法。我只能按照指示使用原始指
Codeigniter session 安全
如何提高 session 的安全性？ $this->session->userdata('userid') 我一直在为我的 ajax 调用扔掉这个小坏蛋。有些情况我没有。然后我想，使用 DOM 中的
security - assembly 安全
我目前正在为某些人提供程序集编译服务。他们可以在在线编辑器中输入汇编代码并进行编译。然后编译它时，代码通过ajax请求发送到我的服务器，编译并返回程序的输出。但是，我想知道我可以做些什么来防止对服务
security - 安全、黑客等方面的良好资源？
就目前而言，这个问题不适合我们的问答形式。我们希望答案得到事实、引用或专业知识的支持，但这个问题可能会引起辩论、争论、投票或扩展讨论。如果您觉得这个问题可以改进并可能重新打开，visit the he
php - $_session 安全
目前，我通过将 session 中的 key 与 MySQl 数据库中的相同 key 相匹配来验证用户 session 。我使用随机数重新生成 session ，该随机数在每个页面加载时都受 MD5
ASP.Net 安全
Microsoft 模式与实践团队提供了一个很棒的 pdf，称为:“构建安全的 asp.net 应用程序”。 microsoft pdf 由于它是为 .Net 1.0 编写的，所以现在有点旧了。有谁知
lua - (安全)随机字符串？
在 Lua 中，通常会使用 math.random 生成随机值和/或字符串。 & math.randomseed , 其中 os.time用于 math.randomseed . 然而，这种方法有一个
security - ColdFusion 安全
就目前而言，这个问题不适合我们的问答形式。我们希望答案得到事实、引用资料或专业知识的支持，但这个问题可能会引发辩论、争论、投票或扩展讨论。如果您觉得这个问题可以改进并可能重新打开，visit the
javascript - Ajax 安全
我们有一个严重依赖 Ajax 的应用程序。确保对服务器端脚本的请求不是通过独立程序而是通过坐在浏览器上的实际用户的好方法是什么最佳答案真的没有。通过浏览器发送的任何请求都可以由独立程序伪造。归
security - Websocket 安全
我正在寻找使用 WebSockets 与我们的服务器通信来实现 web (angular) 和 iPhone 应用程序。在过去使用 HTTP 请求时，我们使用请求数据、url、时间戳等的哈希值来验证和

首页

博学

6Ren·AI

商城

architecture - 高流量网站上的Solr安全数据导入和核心交换