Python 正则表达式模块即使重叠 = True 也找不到所有匹配项-6ren

Python 正则表达式模块即使重叠 = True 也找不到所有匹配项

转载作者：行者123 更新时间：2023-12-02 02:24:54

25

4

我正在使用 PyPy regex module具有重叠匹配支持。

我有以下代码，其中有一个字符串 A，我正在使用正则表达式查找在正则表达式中定义的 DNA 模式。我想找到与我的 RE 的所有匹配项，包括重叠的匹配项。正则表达式缺少其中一个匹配项，我不知道如何修复它。

import regex as re
A = "GGGGAGAAGGGGGGCCTTCCTGGGTCCCCGAGAGTGCAGACATGCCTGGGTCCACAGCCACGGTTTGGG"
GQ_list = re.findall(r"[G]{3,6}[ACTG]{1,33}[G]{3,6}[ACTG]{1,33}[G]{3,6}[ACTG]{1,33}[G]{3,6}", A, overlapped=True)

GQ_list 返回:

['GGGGAGAAGGGGGGCCTTCCTGGGTCCCCGAGAGTGCAGACATGCCTGGGTCCACAGCCACGGTTTGGG',
 'GGGAGAAGGGGGGCCTTCCTGGGTCCCCGAGAGTGCAGACATGCCTGGGTCCACAGCCACGGTTTGGG',
 'GGGGGGCCTTCCTGGGTCCCCGAGAGTGCAGACATGCCTGGGTCCACAGCCACGGTTTGGG',
 'GGGGGCCTTCCTGGGTCCCCGAGAGTGCAGACATGCCTGGGTCCACAGCCACGGTTTGGG',
 'GGGGCCTTCCTGGGTCCCCGAGAGTGCAGACATGCCTGGGTCCACAGCCACGGTTTGGG',
 'GGGCCTTCCTGGGTCCCCGAGAGTGCAGACATGCCTGGGTCCACAGCCACGGTTTGGG']

缺少 "GGGGAGAAGGGGGGCCTTCCTGGGTCCCCGAGAGTGCAGACATGCCTGGG"，它位于我的字符串 A 中并且与正则表达式模式匹配。这里有什么问题吗？我应该进行哪些更改才能获得所有可能的匹配(包括重叠的匹配)？

最佳答案

tdlr:由于同一起始字符串索引处可能存在多个正则表达式匹配，re.findall 或其他正则表达式方法将只能为每个起始索引找到 1 个匹配项。您必须分解搜索才能找到全部...

您遇到的问题是正则表达式 findall 无法找到每个索引中的所有组合；它依次从每个索引中仅找到一个匹配项——通常是最长的匹配项。查找重叠匹配的技术仍然会错过单个字符串索引中可能的多个匹配。您需要修改您的方法。

如果你检查你的正则表达式:

([G]{3,6}[ACTG]{1,33}[G]{3,6}[ACTG]{1,33}[G]{3,6}[ACTG]{1,33}[G]{3,6})

您会注意到，匹配的序列必须以至少 3 个 G 开始，并以相同的序列结束。 GGG[in_ Between_part]GGG 之间的序列短至 9 个字符，长至 84 个字符(并且可能包含相同的 'GGG' 起始/结束序列的)。

我们可以使用该信息来查找符合该描述的所有可能的字符串序列。然后我们使用您的正则表达式来过滤所识别的序列确实是我们想要的序列。

首先找到每个可能的'GGG'的字符串索引，这是子字符串开始或结束的位置(根据定义):

s = "GGGGAGAAGGGGGGCCTTCCTGGGTCCCCGAGAGTGCAGACATGCCTGGGTCCACAGCCACGGTTTGGG"

offset=0
indicies=[]
while (s_idx:=s[offset:].find('GGG'))>-1:
    indicies.append(s_idx+offset)
    offset+=s_idx+1

>>> indicies
[0, 1, 8, 9, 10, 11, 21, 47, 66]
# these are the indicies of 'GGG' that might be that start or end
# of a sub string of interest.

现在我们有了字符串中每个 'GGG' 的起始索引。我们现在可以使用正则表达式和 bisect 模块来过滤正则表达式字符串中所有可能的匹配项。

我们正在使用bisect找到候选结束 anchor 的结束位置，该位置与开始 anchor 相同。 bisect 模块允许我们构建一个形成子字符串的切片，a) 以 'GGG' 开头(来自 indicies 列表)，b) 以 ' 结尾GGG' 和 c) 的起始 anchor 和结束 anchor 之间的长度为 9 到 84 个字符。然后我们使用 re.fullmatch确保候选子字符串完全匹配您的模式:

import re 
import bisect 

matches=[]  
min_len=3+9
max_len=3+84
pat=re.compile(r'([G]{3,6}[ACTG]{1,33}[G]{3,6}[ACTG]{1,33}[G]{3,6}[ACTG]{1,33}[G]{3,6})')
for x in indicies:
    min_offest=bisect.bisect(indicies,x+min_len)
    max_offset=bisect.bisect(indicies,x+max_len)
    for idx in indicies[min_offest:]+indicies[max_offset:]:
        candidate=s[x:idx+3]
        if pat.fullmatch(candidate):
            matches.append(candidate)

现在我们可以打印找到的所有匹配项，其索引在 s 中，长度:

>>> for ss in matches: print((s.index(ss), len(ss)),ss)
# This is only a primitive shortcut. If you want the actual
# index, save it when 'candidate' matches the regex

打印所有八个唯一匹配项，包括来自相同起始索引的匹配项:

(0, 50) GGGGAGAAGGGGGGCCTTCCTGGGTCCCCGAGAGTGCAGACATGCCTGGG
(0, 69) GGGGAGAAGGGGGGCCTTCCTGGGTCCCCGAGAGTGCAGACATGCCTGGGTCCACAGCCACGGTTTGGG
(1, 49) GGGAGAAGGGGGGCCTTCCTGGGTCCCCGAGAGTGCAGACATGCCTGGG
(1, 68) GGGAGAAGGGGGGCCTTCCTGGGTCCCCGAGAGTGCAGACATGCCTGGGTCCACAGCCACGGTTTGGG
(8, 61) GGGGGGCCTTCCTGGGTCCCCGAGAGTGCAGACATGCCTGGGTCCACAGCCACGGTTTGGG
(9, 60) GGGGGCCTTCCTGGGTCCCCGAGAGTGCAGACATGCCTGGGTCCACAGCCACGGTTTGGG
(10, 59) GGGGCCTTCCTGGGTCCCCGAGAGTGCAGACATGCCTGGGTCCACAGCCACGGTTTGGG
(11, 58) GGGCCTTCCTGGGTCCCCGAGAGTGCAGACATGCCTGGGTCCACAGCCACGGTTTGGG

注意:

正如评论中所述，regex module 确实支持可变宽度lookbehinds。

因此，您可能会想做:

m1=regex.findall(r'([G]{3,6}[ACTG]{1,33}[G]{3,6}[ACTG]{1,33}[G]{3,6}[ACTG]{1,33}[G]{3,6})', s, overlapped=True)     
# produces 6 unique matches 
m2=regex.findall(r'(?<=([G]{3,6}[ACTG]{1,33}[G]{3,6}[ACTG]{1,33}[G]{3,6}[ACTG]{1,33}[G]{3,6}))', s, overlapped=True)
# produces 2 matches, but one is a duplicate from m1

虽然此组合找到了 1 个额外的字符串，即您要查找的字符串，但它没有找到所有 8 个唯一匹配项。索引 1 处的字符串 GGGAGAAGGGGGGCCTTCCTGGGTCCCCGAGAGTGCAGACATGCCTGGG 丢失。

关于Python 正则表达式模块即使重叠 = True 也找不到所有匹配项，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/65833679/

25

4

0

文章推荐： clojure - 我可以在 Clojure 的宏中引用宏吗？

文章推荐： Flutteronic 调度代码在下一个事件循环上运行的方法

文章推荐： python - 多线程代码通过 Robot 文件执行两次

文章推荐： unix - GPG仅在内存中解密/加密字符串

找不到 Python 模块 "cx_Oracle"模块
我最近在我的机器上安装了 cx_Oracle 模块，以便连接到远程 Oracle 数据库服务器。 (我身边没有 Oracle 客户端)。 Python:版本 2.7 x86 Oracle:版本 11.
python - Timeit 模块 - 将参数传递给 python timeit 模块
我想从 python timeit 模块检查打印以下内容需要多少时间，如何打印， import timeit x = [x for x in range(10000)] timeit.timeit("
javascript - 我该如何修复 --> 文件是 CommonJS 模块；它可以转换为 ES6 模块
我盯着 vs 代码编辑器上的 java 脚本编码，当我尝试将外部模块包含到我的项目中时，代码编辑器提出了这样的建议 -->(文件是 CommonJS 模块；它可能会转换为 ES6 模块。 )..有什么
javascript - 如何在 ES6 模块 Node 应用程序中包含 commonjs 模块？
我有一个 Node 应用程序，我想在标准 ES6 模块格式中使用(即 "type": "module" in the package.json ，并始终使用 import 和 export)而不转译为
css - BlueprintJS 未加载其图标 CSS 模块，但能够加载核心 CSS 模块
我正在学习将 BlueprintJS 合并到我的 React 网络应用程序中，并且在加载某些 CSS 模块时遇到了很多麻烦。我已经安装了 npm install @blueprintjs/core和
javascript - 将 RequireJS 模块 (AMD) 重构为 Webpack 模块 (CommonJS)
我需要重构一堆具有这样的调用的文件 define(['module1','module2','module3' etc...], function(a, b, c etc...) { //bun
javascript - 是否使用 : var app = angular. 模块...或简单地使用 : angular. 模块(
我是 Angular 的新手，正在学习各种教程(Codecademy、thinkster.io 等)，并且已经看到了声明应用程序容器的两种方法。首先: var app = angular.module
unit-testing - 在 OCaml 中使用 OUnit 模块 - 未绑定(bind)模块 OUnit 错误
我正在尝试将 OUnit 与 OCaml 一起使用。单元代码源码(unit.ml)如下: open OUnit let empty_list = [] let list_a = [1;2;3] le
javascript - "Argument ' 模块 ' is not a function, got Object"- 使用 webpack 导入 Angular 模块
我在 Angular 1.x 应用程序中使用 webpack 和 ES6 模块。在我设置的 webpack.config 中: resolve: { alias: { 'angular':
node-modules - 内部/模块/cjs/loader.js :750 return process. dlopen(模块，path.toNamespacedPath(文件名))；
internal/modules/cjs/loader.js:750 return process.dlopen(module, path.toNamespacedPath(filename));
JavaScript 模块
在本教程中，您将借助示例了解 JavaScript 中的模块。随着我们的程序变得越来越大，它可能包含许多行代码。您可以使用模块根据功能将代码分隔在单独的文件中，而不是将所有内容都放在一个文件
JavaScript 模块
我想知道是否可以将此代码更改为仅调用 MyModule.RED 而不是 MyModule.COLORS.RED。我尝试将 mod 设置为变量来存储颜色，但似乎不起作用。难道是我方法不对？ (funct
JavaScript 模块
我有以下代码。它是一个 JavaScript 模块。 (function() { // Object var Cahootsy; Cahootsy = { hello:
angular - 模块 : when and why?
关闭。这个问题是 opinion-based 。它目前不接受答案。想要改进这个问题？更新问题，以便 editing this post 可以用事实和引文来回答它。关闭 2 年前。 Improve
Lua极简入门指南（六）：模块
从用户的角度来看，一个模块能够通过 require 加载并返回一个 table，模块导出的接口都被定义在此 table 中（此 table 被作为一个 namespace）。所有的标准库都是模块。标
ruby 模块
Ruby的模块非常类似类,除了: 模块不可以有实体模块不可以有子类模块由module...end定义. 实际上...模块的'模块类'是'类的类'这个类的父类.搞懂了吗?不懂?让我们继续看
Perl GetOptions 模块
我有一个脚本，它从 CLI 获取 3 个输入变量并将其分别插入到 3 个变量: GetOptions("old_path=s" => \$old_path, "var=s" =
Python 模块，引用同一包中的其他模块？
我有一个简单的 python 包，其目录结构如下: wibble | |-----foo | |----ping.py | |-----bar | |----pong.py 简单的
ocaml - 无法解构仿函数(模块)
这种语法会非常有用——这不起作用有什么原因吗？谢谢! module Foo = { let bar: string = "bar" }; let bar = Foo.bar; /* works *
shell 模块 : < with ansible
我想运行一个命令: - name: install pip shell: "python {"changed": true, "cmd": "python <(curl https://boot

首页

博学

6Ren·AI

商城

Python 正则表达式模块即使重叠 = True 也找不到所有匹配项