artificial-intelligence - 确定数据库中项目之间的相似性-6ren

artificial-intelligence - 确定数据库中项目之间的相似性

转载作者：行者123 更新时间：2023-12-04 08:44:03

25

4

我们有一个包含数亿条日志数据记录的数据库。我们试图将这些日志数据“分组”为可能与日志数据库中的其他条目具有相同的性质。例如:

记录 X 可能包含一个日志条目，如:

Change Transaction ABC123 Assigned To Server US91

并且记录 Y 可能包含一个日志条目，如:

Change Transaction XYZ789 Assigned To Server GB47

对我们人类来说，这两个日志条目很容易被识别为可能以某种方式相关。现在，记录 X 和记录 Y 之间可能有 1000 万行。并且可能有数千个其他条目与 X 和 Y 相似，有些条目完全不同但有其他相似的记录。

我试图确定的是将相似项目组合在一起的最佳方式，并以 XX% 的确定性说，记录 X 和记录 Y 可能具有相同的性质。或者也许更好的说法是系统会查看记录 Y 并根据您的内容说您最喜欢与所有其他记录并列的记录 X。

我已经看到一些提到自然语言处理和其他查找字符串之间相似性的方法(例如只是强制执行一些 Levenshtein 计算) - 但是对我们来说，我们还有以下两个额外的挑战:

内容是机器生成的 - 不是人工生成的

与我们确定给定查询的结果的搜索引擎方法相反 - 我们试图对一个巨大的存储库进行分类，并根据它们之间的相似程度对它们进行分组。

感谢您的输入!

最佳答案

有趣的问题。显然，这里存在规模问题，因为您并不真的想开始将每个记录与数据库中的每个其他记录进行比较。我相信我会考虑增加“已知类型”列表并针对该列表中的类型对记录进行评分，以查看每个记录在该列表中是否有匹配项。

“评分”部分有望在这里得到一些好的答案——你对已知类型进行评分的能力是让它发挥作用的关键，我觉得你比我们处于更好的位置来做到这一点。也许是某种 soundex 匹配？或者，如果您能弄清楚如何“发现”新记录的哪些部分发生了变化，您可以将已知类型定义为正则表达式。

那时，对于每条记录，您都希望确定您有匹配(高置信度)或匹配(低置信度)或很可能根本没有匹配。在最后一种情况下，您可能找到了一个新的“类型”，应该将其添加到“已知类型”列表中。如果您跟踪您匹配的每条记录的分数，您还可以返回低分匹配并查看稍后处理中是否出现更好的匹配。

关于artificial-intelligence - 确定数据库中项目之间的相似性，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/8526865/

25

4

0

文章推荐： twitter-bootstrap - 如何制作无响应的表格？

文章推荐： artificial-intelligence - 大脑的计算机模拟

business-intelligence - 什么是 “business intelligence”软件？
Closed. This question is off-topic。它当前不接受答案。想改善这个问题吗？ Update the question，所以它是用于堆栈溢出的on-topic。已关闭8
artificial-intelligence - 我应该为这个神经网络使用哪个激活函数？
我们正在为跳棋游戏开发神经网络。在我们的训练数据中， 0代表空白单元格，1代表白 block ，-1代表白王，2代表黑 block ，-2代表黑王因此，我们需要的是范围为 [-2, 2] 的激活函数
business-intelligence - 如何生成澳大利亚ABN号码？
很难说出这里要问什么。这个问题模棱两可、含糊不清、不完整、过于宽泛或夸夸其谈，无法以目前的形式得到合理的回答。如需帮助澄清此问题以便重新打开，visit the help center . 关闭 9
artificial-intelligence - 什么时候一种启发式比另一种更好？
我回答了一个问题，其中给出了两个启发式算法，要对其进行 A* 以找到从起始状态到目标状态的路径。其中一种启发式方法通过减少一个节点的扩展找到了一条路径 - 现在出于这个原因，我们可以说这种启发式方法
artificial-intelligence - 哪种是编写网络机器人的最佳编程语言？
就目前而言，这个问题不适合我们的问答形式。我们希望答案得到事实、引用资料或专业知识的支持，但这个问题可能会引发辩论、争论、投票或扩展讨论。如果您觉得这个问题可以改进并可能重新打开，visit the
artificial-intelligence - C中的逻辑编程
我正在尝试用 C 语言实现一些 AI 规划算法，但被基本概念困住了 :) 在跳到主要问题之前，我尝试实现一些支持命题逻辑的小框架: FORMULA f = PROPOSITION(a + 3 > 0)
artificial-intelligence - 决策树是试图最大化信息增益还是熵？
我知道决策树试图将具有高熵的分类器放在决策树上。然而，信息增益如何发挥作用呢？信息增益定义为: InformationGain = EntropyBefore - EntropyAfter 决策树是
artificial-intelligence - 如何应用梳子法？
我正在研究梳子方法，以减少模糊逻辑规则的“组合爆炸”。有一个示例，摘自“Programming Game AI from example”(由 Mat Buckland 撰写): The theory
artificial-intelligence - 我在哪里可以通过真实世界示例获得对所有人工智能技术的非常简单的介绍
我知道人工智能领域非常广阔，有很多关于它的书籍。但我只想知道我可以得到所有人工智能技术的简单介绍的任何资源，例如它希望有 1 或 2 页的介绍所有技术及其示例，说明如何应用它们或将它们用于什么目的。
artificial-intelligence - 当蒙特卡罗树搜索达到内存限制时该怎么办
我最近对游戏中应用的蒙特卡罗树搜索产生了兴趣。我读过几篇论文，但我使用“蒙特卡罗树搜索”Chaslot, G 的博士论文，因为我发现它更容易理解蒙特卡罗树搜索的基础知识我试图对其进行编码，但遇到了
artificial-intelligence - 学习概率图形模型的好资源
我最近开始在 coursera 上学习概率图形模型，开始后 2 周我开始相信我在概率方面不是那么好，因此我什至无法关注第一个主题(贝叶斯网络)。话虽如此，我想努力学习这门类(class)，所以您能否向
artificial-intelligence - 识别数字序列中的模式
我觉得这应该是AI的问题。是否有任何算法可以在给定任何数字序列的情况下找到模式？模式可以是抽象的，因为它可以是... 例如: 12112111211112 ... ( increasing num
artificial-intelligence - 确定神经网络感知器的偏差？
这是我了解神经网络开始的一件事，是我不太了解最初要设置“偏见”的原因吗？我了解Perceptron会根据以下内容计算其输出： P * W + b> 0 然后可以基于b = b + [G-O]计算学习
artificial-intelligence - 连续蛇游戏的神经网络帮助
我正在尝试为“连续蛇”游戏实现 AI。它与普通的蛇游戏非常不同，至少就 AI 而言。基本上，蛇的驾驶方式有点像汽车，两个玩家中第一个撞上他的踪迹或另一个人的踪迹输掉比赛。此外，屏幕环绕其边框。如果您
artificial-intelligence - 什么是启发式函数
有人可以用非常简单的词来解释它是什么。也提供一个例子。因此，例如，如果您必须找到某事物的启发式函数，它应该是什么样子的？以问题为例: 对于水壶问题http://www.math.tamu.edu/~
artificial-intelligence - 在文本中查找相关词的算法
我想要一个词(例如“Apple)并处理一个文本(或者更多)。我想提出相关的术语。例如:处理Apple的文档并发现iPod，iPhone，Mac是与“苹果”相关的术语。关于如何解决这个问题的任何想法？
artificial-intelligence - 用于人脑模拟的开源软件
关闭。这个问题不满足Stack Overflow guidelines .它目前不接受答案。想改善这个问题吗？更新问题，使其成为 on-topic对于堆栈溢出。 6年前关闭。 Improve thi
artificial-intelligence - 马尔可夫决策过程问题
关闭。这个问题需要debugging details .它目前不接受答案。想改善这个问题吗？更新问题，使其成为 on-topic对于堆栈溢出。 7年前关闭。 Improve this questio
artificial-intelligence - 权重初始化
我计划将 Nguyen-Widrow 算法用于具有的 NN多个隐藏层 .在研究的过程中，我发现了很多歧义，我想澄清一下。以下是 Nguyen-Widrow 算法的伪代码 Initial
artificial-intelligence - 有没有积极的强化学习竞赛？
我喜欢在强化学习方面做兼职研究。近年来(截至2009年)在rl-competition.org举办了强化学习竞赛。有一些非常有趣的问题，但这似乎已停止。我很想提高我的技能和知识，并与该领域的其他爱好者

首页

博学

6Ren·AI

商城

artificial-intelligence - 确定数据库中项目之间的相似性