sqlite - 在 SQLite 中从接近重复的行(由 GROUP BY、HAVING、COUNT 确定)中选择 "first"(由 ORDER BY 确定)行-6ren

sqlite - 在 SQLite 中从接近重复的行(由 GROUP BY、HAVING、COUNT 确定)中选择 "first"(由 ORDER BY 确定)行

转载作者：IT王子更新时间：2023-10-29 06:29:57

31

4

我有一个问题有点超出我的范围(我真的很高兴我是 Beta)涉及重复项(所以 GROUP BY, HAVING, COUNT)，通过将解决方案保留在 SQLite 附带的标准函数中而变得更加复杂。我正在使用来自 Python 的 sqlite3 模块。

示例表工作人员，列:

* ID: integer, auto-incrementing
* ColA: integer
* ColB: varchar(20)
* UserType: varchar(20)
* LoadMe: Boolean

(是的，SQLite 的数据类型是名义上的)

我的数据表 Workers，一开始看起来像:

ID  ColA  ColB  UserType  LoadMe
1   1     a     Alpha     0
2   1     b     Beta      0
3   2     a     Alpha     0
4   2     a     Beta      0
5   2     b     Delta     0
6   2     b     Alpha     0
7   1     a     Delta     0
8   1     b     Epsilon   0 
9   1     c     Gamma     0
10  4     b     Delta     0
11  5     a     Alpha     0
12  5     a     Beta      0
13  5     b     Gamma     0
14  5     a     Alpha     0

我想启用所有在 ColA 和 ColB 之间具有独特组合的 worker ，以便在新工厂装载到卡车上。对于那些 ColA 和 ColB 的独特组合有多个 worker 的重复项(双胞胎、三胞胎等，可能通过 Bokanovsky 的过程)，我想从每组重复项中只选择一个。为了使问题更难解决，我还希望能够以某种形式的 ORDER BY 根据 UserType 从每组重复项中选择一个。我可能希望选择用户类型为“Alpha”的第一个“副本”来解决一个非常聪明的问题，或者ORDER BY UserType DESC，这样我就可以为最低的 worker 。

您可以看到 ID 9、10 和 13 具有独特的 ColA 和 ColB 组合，最容易识别。然而，1-a、1-b、2-a、2-b 和 5-a 组合中有重复项。

我目前的流程，目前为止:

0) 每个人都有一个唯一的 ID 号。这是在出生时完成的。

1) SET 所有 Worker 为 LoadMe = 1。

UPDATE Workers
SET LoadMe = 1

2) 根据两列中的相似性查找我的重复项 (GROUP BY ColA, ColB):

SELECT Wk1.*
FROM Workers AS Wk1
INNER JOIN (
    SELECT ColA, ColB
    FROM Workers
    GROUP BY ColA, ColB
    HAVING COUNT(*) > 1
) AS Wk2
ON Wk1.ColA = Wk2.ColA
AND Wk1.ColB = Wk2.ColB
ORDER BY ColA, ColB

3) 将我所有的重复设置为 LoadMe = 0。

UPDATE Workers
SET LoadMe = 0
WHERE ID IN (
    SELECT Wk1.ID
    FROM Workers AS Wk1
    INNER JOIN (
        SELECT ColA, ColB
        FROM Workers
        GROUP BY ColA, ColB
        HAVING COUNT(*) > 1
    ) AS Wk2
    ON Wk1.ColA = Wk2.ColA
    AND Wk1.ColB = Wk2.ColB
)

4) 对于我的 GROUP BY 中的每组重复项，ORDERed BY UserType，仅 SELECT一个，列表中的第一个，将 LoadMe SET 设置为 1。

这张表看起来像:

ID  ColA  ColB  UserType  LoadMe
1   1     a     Alpha     1
2   1     b     Beta      1
3   2     a     Alpha     1
4   2     a     Beta      0
5   2     b     Delta     0
6   2     b     Alpha     1
7   1     a     Delta     0
8   1     b     Epsilon   0
9   1     c     Gamma     1
10  4     b     Delta     1
11  5     a     Alpha     1
12  5     a     Beta      0
13  5     b     Gamma     1
14  5     a     Alpha     0

ORDERed BY ColA、ColB、UserType，然后是 ID，然后按 GROUP BY 列分解，(最后间隔为清晰度)相同的数据可能看起来像:

ID  ColA  ColB  UserType  LoadMe
1   1     a     Alpha     1
7   1     a     Delta     0

2   1     b     Beta      1
8   1     b     Epsilon   0

9   1     c     Gamma     1

3   2     a     Alpha     1
4   2     a     Beta      0

6   2     b     Alpha     1
5   2     b     Delta     0

10  4     b     Delta     1

11  5     a     Alpha     1
14  5     a     Alpha     0
12  5     a     Beta      0

13  5     b     Gamma     1

我对最后一步感到困惑，觉得自己像个 Epsilon-minus 半白痴。我以前一直将重复项从数据库中提取到程序空间并在 Python 中工作，但这种情况并不少见，我想更永久地解决这个问题。

最佳答案

我喜欢把这样的问题分解一下。第一步是识别唯一的 ColA、ColB 对:

SELECT ColA,ColB FROM Workers GROUP BY ColA,ColB

现在，对于这些对中的每一对，您要找到最高优先级的记录。连接不起作用，因为您最终会为每个唯一对得到多条记录，但子查询会起作用:

SELECT ColA,ColB,
    (SELECT id FROM Workers w1 
    WHERE w1.ColA=w2.ColA AND w1.ColB=w2.ColB 
    ORDER BY UserType LIMIT 1) AS id
FROM Workers w2 GROUP BY ColA,ColB;

您可以更改子查询中的ORDER BY 子句来控制优先级。 LIMIT 1 确保每个子查询只有一条记录(否则 sqlite 将返回匹配 WHERE 子句的最后一条记录，尽管我不确定是否能保证) .

此查询的结果是要加载的记录列表，其中包含 ColA, ColB, id。我可能会直接从那里工作并摆脱 LoadMe 但如果你想保留它你可以这样做:

BEGIN TRANSACTION;
UPDATE Workers SET LoadMe=0;
UPDATE Workers SET LoadMe=1
WHERE id IN (SELECT 
    (SELECT id FROM Workers w1 
    WHERE w1.ColA=w2.ColA AND w1.ColB=w2.ColB 
    ORDER BY UserType LIMIT 1) AS id
    FROM Workers w2 GROUP BY ColA,ColB);
COMMIT;

这会清除 LoadMe 标志，然后为我们上次查询返回的每条记录将其设置为 1。交易保证这一切的发生或失败都作为一个步骤，并且永远不会让您的 LoadMe 字段处于不一致的状态。

关于sqlite - 在 SQLite 中从接近重复的行(由 GROUP BY、HAVING、COUNT 确定)中选择 "first"(由 ORDER BY 确定)行，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/7391571/

31

4

0

文章推荐： ruby-on-rails - 将 USD "money"转换为数字的 Ruby 字符串

文章推荐： javascript - 使用html5从safari浏览器将blob插入sqlite

java - Selenium Web 驱动程序无法单击前台对话框的“确定”按钮并找到后台对话框的“确定”按钮
我正在使用 Selenium Web 驱动程序 3.0，并且想要从打开的两个对话框(一个在后台，第二个在前台)的 Activity 对话框中单击“确定”按钮。如何从 html 下面的父 div 单击前
android - 在 flutter 中，我使用AlertDialog，它具有2个操作按钮“确定”和“取消”，单击“确定”时，我要转到新屏幕并结束当前屏幕？
actions: [ FlatButton( onPressed: () {
sqlite - 在 SQLite 中从接近重复的行(由 GROUP BY、HAVING、COUNT 确定)中选择 "first"(由 ORDER BY 确定)行
我有一个问题有点超出我的范围(我真的很高兴我是 Beta)涉及重复项(所以 GROUP BY, HAVING, COUNT)，通过将解决方案保留在 SQLite 附带的标准函数中而变得更加复杂。我正在
perl - 确定$ sth是否有行而不消耗它？
使用DBI是否可以确定SELECT语句的已执行语句句柄是否返回任何行而不从中获取行？ IE。就像是: use DBI; ... my $sth = $dbh->prepare("SELECT ..."
语义用户界面模式关闭-确定/取消回调
是否可以为“确定”和“关闭”按钮指定回调函数？如果是JQuery Modal，则可以在初始化时使用按钮字典指定回调函数。 Semantic-ui模态是否提供类似的功能？按下确定后，我该如何寻求其他逻
selenium - 阅读警报消息并单击“确定”
我想阅读警报中的消息。示例:如果警报显示“错误的电子邮件地址”。怎么读呢？意味着我想将该消息存储在字符串中。如何在“警报”中单击“确定”...？？如何使用 Selenium 来做到这一点？最佳
javascript - 确定 if 语句中是否选择了任何选项
我有一个删除按钮: 我试图首先查明是否已选择一个网站，如果已选择一个网站，我需要确定是否已选择一个或多个列表项，如果是，则继续删除这些项目。我的 if 语句不断返回“您必须首先选择您的列表”，即使它
.net - 确定.NET中对象图的内存使用率
部分出于好奇——我们想知道在我们的应用程序中发生了什么——部分是因为我们需要在我们的代码中找到一些潜在的问题，我喜欢在我们的网络应用程序运行时跟踪一些一般值。这尤其包括某些对象图的分配内存。我们的应
jquery - 甜蜜警报不会等到用户单击“确定”
我将 SweetAlert 与 Symfony 结合使用，我希望用户在完成删除操作之前进行确认。发生的情况是，当用户单击删除按钮时，SweetAlert 会弹出，然后立即消失，并且该项目被删除。在
c# - 确定.NET中随机生成的代码中是否包含任何淫秽词语的有效方法
我们有一个应用程序可以生成不包括字母 O 的随机基数 35 [0-9A-Z]。我正在寻找一种解决方案来查找包含任何淫秽英语单词的代码，而无需搜索包含 10,000 个条目的列表每个生成的代码。每秒生成
c - 确定、存储和打印给定范围内的所有整数
这是我做的: #include #include int betweenArray(int a, int b){ int *arr,i,range; range = b - a +
javascript - 在提示中单击“确定”
我知道如何创建警报和确认框，但我不知道如何做的是实际单击“确定”。我有一个弹出确认框的页面。我想使用 Java Script 插件单击“确定”。基本上，我希望我的代码单击页面上的链接，然后在出现提
javascript - 无法使用甜蜜警报单击“确定”
代码: swal('Your ORDER has been placed Successfully!!!'); window.location="index.php"; 甜蜜警报工
python - 确定 OR 正则表达式的哪个片段与字符串匹配
>>> import re >>> s = "These are the words in a sentence" >>> regex = re.compile('are|words') >>> [m
确定 2 个数组是否不相交的算法
使用确定的理想散列函数给出随机期望线性时间算法两个数组 A[1..n] 和 B[1..n] 是否不相交，即 A 的元素是否也是 B 的元素。谁能告诉我如何做到这一点，甚至如何开始考虑它？最佳答案
java - 确定 while 循环的迭代次数
我在计算机科学课上有这段代码: int input=15; while (input < n ) { input = input *3;} 这段代码有 log3(n/15) 次循环的上限。我们怎样才能
确定 TicTacToe 游戏状态的算法？
我有一个允许 2 位玩家玩 TicTacToe 的程序。在每个玩家移动之后，它应该在那个点显示棋盘并返回一个名为 Status 的枚举，显示玩家是否应该继续，如果玩家赢了，还是平局。但是，该算法要么返
确定 Y 轴标签和位置的算法？
给定一个 y 值数组，例如 [-3400, -1000, 500, 1200, 3790]，我如何确定“好的”Y 轴标签并将它们放置在网格上？ ^ ---(6,000)-|---
php - 确定 WHERE 语句的哪些部分失败
假设我有一个检查用户登录的 SQL 语句: SELECT * FROM users WHERE username='test@example.com', password='abc123', expi
indexing - 确定 Teradata 中表的主索引
teradata中有返回表中哪一列被定义为主索引的命令吗？我没有制作一些我正在处理的表，也没有尝试优化我对这些表的连接。谢谢! 最佳答案有dbc.IndicesV，其中IndexNumber=1表示

首页

博学

6Ren·AI

商城

sqlite - 在 SQLite 中从接近重复的行(由 GROUP BY、HAVING、COUNT 确定)中选择 "first"(由 ORDER BY 确定)行