random - ElasticSearch 每天一致的排序顺序，但跨天随机化-6ren

random - ElasticSearch 每天一致的排序顺序，但跨天随机化

转载作者：行者123 更新时间：2023-11-29 02:55:19

我正在尝试返回过滤查询的随机结果，以便让我的所有文档都有机会出现在第一页结果中。为了在重复搜索期间不混淆用户(并轻松支持分页)，结果应与当天保持一致。

为此，我开发了以下脚本排序查询。它将文档 id(一个 guid，所以已经相当随机)与每日盐(只是一年中的某一天和当年的组合)结合起来，并对结果进行哈希处理以产生我期望的相当随机的字符串，它只会改变为“每日盐”每天都在变化(忽略此特定查询中的无关元素，它是从代码生成的)。

{
  "from": 0,
  "size": 20,
  "sort": {
    "_script": {
      "order": "asc",
      "type": "string",
      "script": "org.elasticsearch.common.Digest.md5Hex(dailySalt + doc['id'].value)",
      "params": {
        "dailySalt": "184-2013"
      }
    }
  },
  "query": {
    "filtered": {
      "query": {
        "match_all": {}
      },
      "filter": {
        "bool": {
          "must": [
            {
              "term": {
                "tag_id": "Some Tag"
              }
            },
            {
              "match_all": {}
            }
          ]
        }
      }
    }
  },
  "fields": [
    "id"
  ]
}

灵感来自 this similar question and answer

它有效，但不是很好。当我增加每天的盐分时，我得到的结果略有不同，但相同的文档不断出现在顶部结果周围。它们略有移动，但绝对具有一致的模式。

我尝试将哈希函数更改为我发现的另一个:org.elasticsearch.cluster.routing.operation.hash.djb.DjbHashFunction.DJB_HASH但它给出了与常见顶级结果非常相似的结果。

我不是密码学专家，所以我认为这是常见哈希函数的行为，并且必须有一些特殊的哈希函数用于基于相似输入的更多随机结果？

是否有人熟悉 ElasticSearch 中可用的搜索引擎？我正在使用 Searchbox.io (云托管 Elasticsearch 服务)所以安装我自己的自定义功能不是一个选项。

还是我从一个完全错误的角度来解决这个问题？

编辑我只是查看了脚本生成的结果排序键，脚本似乎只应用于结果的第一页，然后对第一页进行排序(而不是应用于整个结果集并因此更改文档在第一页内)。

这是我的第一页结果(为简洁起见进行了编辑)。但是您可以仅在第一页上看到排序键从 0c*** 到 fa***，对于前 0 - 20 个文档，总共约 200 个文档。

使用 'dailySalt' = 185-2013

{
"took": 2,
"timed_out": false,
"_shards": {
    "total": 1,
    "successful": 1,
    "failed": 0
},
"hits": {
    "total": 196,
    "max_score": null,
    "hits": [{
        "fields": {
            "id": "27662ef8-d2a7-4fde-80f6-1571b83c4cde"
        },
        "sort": ["0cbf8b4e7927f0a53a5b82f2630ff9ad"]
    }, {
        "fields": {
            "id": "d9b11797-053f-495e-a676-0ec959dba879"
        },
        "sort": ["0fa8730a5239f8a3d1286cbe16619bfa"]
    }, {
        "fields": {
            "id": "482c893f-1083-4860-892e-1b25cf442199"
        },
        "sort": ["295edd71cc48ac41c5e2f91315abf5ce"]
    }, {
        "fields": {
            "id": "581fd0f1-9ecb-4e5c-920b-06413bfbf4f7"
        },
        "sort": ["4b9f0d17bc2333d13a1963b4f6afb829"]
    }, {
        "fields": {
            "id": "de3dddb8-e296-4446-ac4c-135cc925669d"
        },
        "sort": ["4c5d0bcb50f5b600e539ba46b33b1007"]
    }, {
        "fields": {
            "id": "c83ad22e-80b4-40f1-8e56-2153a1a1f9e8"
        },
        "sort": ["55efe0a692ab3205405f1c74732b8205"]
    }, {
        "fields": {
            "id": "7bd19829-4f37-4e02-9fd1-0239b8ae8db4"
        },
        "sort": ["5adcd22c7c507244d7ba382812accdf3"]
    }, {
        "fields": {
            "id": "42fcec43-851f-4133-a8db-1d2bf0b86ec8"
        },
        "sort": ["6757f46bd554e3353a2ebf35c6b3d24c"]
    }, {
        "fields": {
            "id": "e119132b-4e93-4047-8513-1ce2452f0cdd"
        },
        "sort": ["6dbcb59a2b5e91523896d57695251b29"]
    }, {
        "fields": {
            "id": "7d0acf5d-7c14-45a2-97b7-17939ff512f4"
        },
        "sort": ["9d99752ec0802e55dcfb3c83bcd2e4bb"]
    }, {
        "fields": {
            "id": "2cdc21e4-3312-460b-9a18-094e4f95a56c"
        },
        "sort": ["9dc43d1d39e64cfe04c6d7b8f565faaa"]
    }, {
        "fields": {
            "id": "0f665cb3-5648-416c-b08f-146d2a019319"
        },
        "sort": ["b61bb718fe63a287b6fcdc8bcd638604"]
    }, {
        "fields": {
            "id": "1e852d49-2b3b-4d7a-9f1b-1495b94e723e"
        },
        "sort": ["ba7ad8a3a6e195a6bc28e341f9d6965b"]
    }, {
        "fields": {
            "id": "ca2a5922-bb42-4317-b61c-129925436a1f"
        },
        "sort": ["bca0411cf8d67b4dcd5b205a5010367f"]
    }, {
        "fields": {
            "id": "b1dac760-7d73-4b60-bd6d-08ea9453e68c"
        },
        "sort": ["be3714cfb2517e98d525aaea6e40cfa5"]
    }, {
        "fields": {
            "id": "c4b08def-59db-4ac0-b16f-0c3fae4c01f2"
        },
        "sort": ["c4220b31c305d536c7a7d1639da32c66"]
    }, {
        "fields": {
            "id": "cc7ac1fd-3e88-4503-a837-2000ebb6e2d9"
        },
        "sort": ["ceb5710fe2418fe3b353bf7b1f737570"]
    }, {
        "fields": {
            "id": "5a5f90c9-b44f-4ca2-9d16-117c8e9fd388"
        },
        "sort": ["dc5fea76598633cb08c1459983ebca62"]
    }, {
        "fields": {
            "id": "6d811d5b-4138-4a41-a186-1b9aa2b65623"
        },
        "sort": ["ea3c55ac123ac9e819b145402407d1de"]
    }, {
        "fields": {
            "id": "b489d2da-b4a1-44de-acde-219109edd42f"
        },
        "sort": ["fab53cc11983b45b081d4b01df555c59"]
    }]
}
}

最佳答案

MD5 是一个 cryptographic hash function ，并且此类函数具有称为 avalanche effect 的属性.简而言之，即使是输入的微小变化也会完全改变输出。例如，您可以使用在线 MD5 计算器对此进行试验。

There are no chance collisions要么——你不会找到两个散列为相同值的字符串，即使你花了一生的时间试图找到它们。

这两个属性保证您编写的脚本每天为每个文档永远生成唯一的随机值。散列函数不是这里的问题。

有多少文件？每页显示多少个结果？看到什么样的模式？某个文档随机出现在首页上的可能性可能大得惊人。

关于random - ElasticSearch 每天一致的排序顺序，但跨天随机化，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/17439629/

文章推荐： ElasticSearch 使用 MongoDB-River 插件返回零命中

文章推荐： php - 防止重复预订 PHP/MYSQL

排序
我正在尝试对每个条目有多个值的关联数组进行排序。例如 [0] => stdClass Object ( [type] => node [sid] => 158 [score] => 0.059600
mysql - 排序 - 按日期 ASC 排序
我在 mysql 中有“日期”列以这种格式保存日期 2014 年 9 月 17 日(日-月-年) 我需要对它们进行升序排序，所以我使用了这个命令: SELECT * FROM table ORDER
MySQL 排序，限制为 MS SQL 排序
我目前正在将 MySQL 存储过程重写为 MS SQL 存储过程，但遇到了问题。在 MySQL 存储过程中，有一个游标，它根据最近的日期 (effdate) 选择一个值并将其放入变量 (thestt
java - 通过从 mysql 中选择(排序)排序
我想要 gwt r.QuestionId- 排序。但是我得到未排序的 QuestionId 尽管我提到了 QuestionId ASC 的顺序。 SELECT r.QuestionId,
Python scandir() 排序\POSIX readdir 排序
我有一个关于在 scandir 函数中排序的基本问题。到目前为止，我阅读了 POSIX readdir 的手册页，但没有找到有关订购保证的具体信息。但是当我遍历大目录(无法更改，只读)时，我在多个系
sql - 排序、排序、筛选 SQL Server 的复杂组合
基本上我必须从 SQL 数据库中构建项目列表，但是用户可以选择对 7 个过滤器的任意组合进行过滤，也可以选择要排序的列以及按方向排序。正如您可以想象的那样，这会以大量不同的组合进行编码，并且数据集非
mysql - 按日期 ASC 排序，但组内按 DESC 排序
我有两张 table 。想象第一个是一个目录，包含很多文件(第二个表)。第二个表(文件)包含修改日期。现在，我想选择所有目录并按修改日期 ASC 对它们进行排序(因此，最新的修改最上面)。我不想显
mysql - 首先按(条件)排序，然后按(条件)排序
我想先根据用户的状态然后根据用户名来排序我的 sql 请求。该状态由 user_type 列设置: 1=活跃，2=不活跃，3=创始人。我会使用此请求来执行此操作，但它不起作用，因为我想在“活跃”成员
c++ - sort a, b, c是否等同于sort c；排序 b;排序？
在 C++ 中，我必须实现一个“类似 Excel/Access”(引用)的查询生成器，以允许对数据集进行自定义排序。如果您在 Excel 中使用查询构建器或 SQL 中的“ORDER BY a, b,
MongoDB 按字段 A 排序，如果字段 B != null 否则按字段 C 排序
我面临这样的挑战: 检索按字段 A 排序的文档如果字段 B 存在/不为空 . 否则按字段排序 C. 在 SQL 世界中，我会做两个查询并创建一个 UNION SELECT，但我不知道如何从 Mon
dart - 在 Dart 中，如何仅使用级联或链式调用来干净地映射/排序/折叠/排序/扩展？
我想对源列表执行以下操作: map 列表排序折叠排序展开列表其中一些方法(例如map和toList)是可链接的，因为它们返回非空对象。但是，sort 方法返回 void，因为它对 List
linux - 有人可以解释重新格式化 awk () | 输出的最佳方法吗？排序 | uniq-c |排序-rg？
我制作了一个用于分析 Windows 日志消息编号的脚本。 uniq -c 数字的输出很难预测，因为根据数字的大小会有不同的空白。此时，我手动删除了空白。这是对消息进行排序和计数的命令: cat n
python - 在 Python 字典中按值(降序)排序，然后按键(升序)排序
我有以下词典: mydict1 = {1: 11, 2: 4, 5: 1, 6: 1} mydict2 = {1: 1, 5: 1} 对于它们中的每一个，我想首先按值(降序)排序，然后按键(升序)排序
delphi - 如何使用多个比较器在 TObjectList<> 中进行类似于 Excel 的按 A 排序，然后按 B 排序
我刚刚开始使用泛型，目前在对多个字段进行排序时遇到问题。案例: 我有一个 PeopleList 作为 TObjectList我希望能够通过一次选择一个排序字段，但尽可能保留以前的排序来制作类似 Ex
sql - 如果 Column1 不为空，则按 Column1 排序，否则按 Column2 排序
有没有办法在 sql 中组合 ORDER BY 和 IS NULL 以便我可以在列不为空时按列排序，但如果它为null，按另一列排序？最佳答案类似于: ORDER BY CASE WHEN
mysql - 排序 mysql 结果。按 col1 排序，按 col2 分组
我有一个包含 2 列“id”和“name”的表。 id 是常规的自动增量索引，name 只是 varchar。 id name 1 john 2 mary 3 pop 4 mary 5 j
node.js - API 分页、过滤、排序 VS CLIENT 分页、过滤、排序
场景网站页面有一个带有分页、过滤、排序功能的表格 View 。表中的数据是从REST API服务器获取的，数据包含数百万条记录。数据库 REST API 服务器 Web 服务器浏览器问
objective-c - 获取 NSDictionary 键的 NSArray，按 Value 排序，然后按 Key 排序
假设我有一本字典，其中的键(单词)和值(分数)如下: GOD 8 DONG 16 DOG 8 XI 21 我想创建一个字典键(单词)的 NSArray，首先按分数排序，然后按字
mysql - sphinx 搜索查询前 20 个按标题 WEIGHT 排序，后 20 个按标题 ASC 排序，无重复输出
如何在 sphinx 上通过 sql 命令选择前 20 行按标题 WEIGHT 排序，接下来 20 行按标题 ASC 排序(总共 40 个结果)，但不要给出重复的标题输出。我尝试了这个 sql 命令
SQLite - 排序
我有一个奇怪的问题，当从 SQLite 数据库中选择信息并根据日期排序时，返回的结果无效。我的SQL语句是这样的: Select pk from usersDates order by dateti

行者123

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

random - ElasticSearch 每天一致的排序顺序，但跨天随机化