Numpy 和 Biopython 必须集成吗？-6ren

Numpy 和 Biopython 必须集成吗？

转载作者：行者123 更新时间：2023-12-03 01:20:59

25

4

例如...我有两个脚本用于查看(多序列比对)MSA 是否具有超过 50 列且间隙少于 50%。

第一次使用 BioPython 需要 4.2 秒，在 609 列的 16281 个序列的 MSA 中(fasta 格式的 Pfam 的 PF00085)。 [Biopython的Multiple Sequence Alignment对象的getitem方法消耗大量时间]

第二个使用简单的 IO 通过 MSA 生成2D Numpy 数组，在相同的对齐方式中仅花费1.2 秒。

我认为处理 MSA 对象的 Numpy 方法更有用、更快。例如，您可以使用 bool numpy 数组来选择特定的行和列。实际上，删除和选择列(例如消除超过 50% 间隙的列)非常耗时，并且在 Biopython 中没有得到很好的实现。我认为这对于 PDB 坐标的 nx3 numpy 数组也很有用。

我有五个想法，也许只有一两个有用:

1 - 基于 numpy 而不是 str 创建一个 Seq 和多序列比对对象 (Bio.Align.MultipleSeqAlignment)。这可能是兼容性问题......也许这不是一个好主意。我不知道。

2 - 在 Biopython 中创建一个更快的方法，用于从 Biopython 对象获取 numpy 数组版本。我尝试为多序列对齐对象生成 numpy 数组，但这会多次调用 getitem 方法，并且比单独使用 Biopython 更耗时。但是，也许具有更多编程技能的人可以做得更好。

3 - 为 numpy 或 scipy 创建一个模块，并为对齐和 PDB 提供 IO 支持。也许更简单、更有用的想法。

4 - 创建另一个完整的 Bio 模块，但基于 numpy。也许在 scipy 或 numpy 内部。

5 - 像想法 2 和 3 一样，创建模块和方法以实现 Biopython 和 numpy 对象之间更快、更高效的兼容性。

你觉得怎么样？哪些想法更好？你有更好的主意吗？可以做点什么吗？我想与 Biopython 项目合作...我认为与 numpy 集成可能是一个好的开始。

非常感谢;)

P.D.:我的两个脚本...慢，基于Biopython:

#!/usr/bin/python2.7

from sys import argv
from Bio import AlignIO
aln = AlignIO.read(open(argv[1],"r"), "fasta")
longitud = aln.get_alignment_length()
if longitud > 150:
    corte = 0.5 * len(aln)
    j = 0
    i = 0
    while j<50 and i<longitud:    
        if aln[:,i].count("-") < corte:
            j += 1
        i += 1
    if j>=50:
        print argv[1]

基于 numpy 数组的最快:

#!/usr/bin/python2.7

from sys import argv
import numpy as np

with open(argv[1],'r') as archivo:
    secuencias=[]
    identificadores=[]
    temp=[]
    for linea in archivo:
        if linea[0]=='>':
            identificadores.append(linea[1:].replace('\n',''))
            secuencias.append(list(temp))
            temp=""
        else:
            temp += linea.replace('\n','')
    secuencias.append(list(temp))

sec = np.array(secuencias[1:])
ide = np.array(identificadores)

if len(ide)>150:
    corte = len(ide) * 0.5
    if np.sum(np.sum(sec=='-',1) < corte) >= 50:
        print argv[1]

最佳答案

如果您要对 MSA 对象执行大量操作，将它们视为字符数组很有用，那么我只需使用 Biopython 的 AlignIO 来加载对齐，然后将其转换为 NumPy 字符数组。例如:

import numpy as nump
from Bio import AlignIO
filename = "opuntia.aln"
format = "clustal"
alignment = AlignIO.read(filename, format)
align_array = numpy.array([list(rec) for rec in alignment], numpy.character)

这个快速示例可以轻松地作为 to_array 方法添加到对齐对象中，或者包含在教程中。有帮助吗？

当然，您仍然需要支付所有对象创建的开销(Seq 对象、SeqRecord 对象、空注释字典、对齐对象等)，但这就是 AlignIO 接口(interface)的缺点 - 它适用于相对较重的对象模型。这对于 FASTA 和 Clustal 等简单格式来说并不是真正需要的，但对于 Stockholm 等丰富的对齐格式更有用。

关于Numpy 和 Biopython 必须集成吗？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/13552916/

25

4

0

文章推荐： javascript - 从 Web 应用程序导出/导入 RSA key 对

文章推荐： javascript - 将数组映射到由数组值作为键的对象

文章推荐： silverlight - App.xaml 在 Silverlight 中有何用途？

java - 在finally{}中捕获异常？必须？
我感到困惑...... 我在 .jsp 中编写了一个小例程。最后需要关闭ResultSet、Statement和Connection。我也在finally { }中编写了结束代码，但是当页面运行时，它
c - 必须(应该)避免使用标准库中的哪些函数？
我在 Stack Overflow 上读到一些 C 函数是“过时的”或“应该避免”。你能给我一些这种功能的例子以及原因吗？这些功能有哪些替代方案？我们可以安全地使用它们 - 有什么好的做法吗？最
java - x 必须 < bitmap.width()
我正在构建一个应用程序，它可以拍照、显示图片，然后一旦被点击，就会在点击的任何地方返回图片的颜色。它在崩溃之前到达了水龙头。我得到 x 必须是 < bitmap.width() 的错误就我的理解而
elasticsearch - Elastic Search 必须 + 至少一个过滤器查询中的 SHOULD
我试图根据几个因素向用户提出建议: •建议只能是同一所大学的学生•建议必须至少匹配一个其他字段我以为我有它，但问题是这个查询将返回同一所学校的所有学生，而不管其他情况: PUT /user/.per
python - 我*必须*在我的数据库中存储第三方凭证。最好的办法？
我的应用程序必须从第三方读取 SSL 网址。我如何最好地将第三方凭证存储在我自己的数据库中，以保护第三方凭证不被泄露？兼顾绝对的安全性和实用性。对凭据进行单向哈希处理没有用，因为我必须将凭据恢复为明文
ruby-on-rails - 必须 to_json 以字符串形式返回一个 mongoid
在我的 Rails API 中，我希望 Mongo 对象作为 JSON 字符串返回，Mongo UID 作为“id”属性而不是“_id”对象。我希望我的 API 返回以下 JSON: { "
c - 服务器多线程，协议(protocol)必须？和更多
假设应用层协议(protocol)是通过UDP实现的。客户端需要超时，因此服务器需要保留与其通信的每个客户端的状态。还假设使用了select。实现多线程服务器总是最好的吗？我认为链接列表也会做同样
java - 当 GC 不(必须)运行并且程序完成执行时会发生什么？
考虑一个非常短的程序，我在其中分配了一点内存。我被告知，GC 在程序分配大量内存并且分配达到限制的情况下运行。我不知道这个限制到底是多少，但我认为它必须足够高，这样 GC 才不会频繁运行并减慢程序的
iphone - 究竟什么时候*必须*应用程序包含 Reachability 类来测试网络可达性？
根据 Cocoa with Love当应用程序需要 WiFi(而不是蜂窝网络)时需要可达性，例如如果应用加载大量视频并且不适合在 3G 网络上使用。我的应用程序使用互联网，无论是 WiFi 还是 3
javascript - jQuery 悬停缩略图，但需要时间更新主镜头，必须 catch
我正在寻找更好的解决方案来解决我面临的这个问题。如果您将鼠标悬停在缩略图上，它会淡出较大的镜头并淡入新的镜头，这很好，但是当转到目标缩略图并且您的鼠标再悬停一些时，它会更改为您的鼠标经过并拍摄的其他
windows - 高完整性 token 是否*必须*启用管理员组？
启用 UAC 并使用管理帐户登录后，您将获得两个 token : 提升的 token ；这已启用 Administrators 组，具有高完整性(即强制性完整性标签 SID 为 S-1-16-1228
reactjs - 我是否*必须*展平 React.JS 中的所有分层组件声明？
我想知道在 React 中创建动态选择组件的规范方法是什么。我是否必须创建一个单独的组件来根据下面的代码返回选项，以便能够通过每个条目的 props 自定义值，然后将它们包含到单独的选择组件中？ p>
Datagrid 分页 : Invalid CurrentPageIndex value. 必须 >= 0
我有一个启用了分页的数据网格。我根据过滤条件在数据网格中显示结果。我已经过滤了数据，现在有 2 页。当我转到第二页时。我正在再次执行搜索功能以缩小结果范围。然后我收到类似“无效的 CurrentPag
postgresql - Postgres-必须 to_timestamp() 忽略/不读取日期/时间字符串中间的特定字符
我有原始文本列，其值类似于“2012-07-26T10:33:34”和“2012-07-26T10:56:16”。在使用 Joda-Time 的 Java 中，我可以通过调用轻松地将其转换为日期/从
html - 可以使 div 到达顶部的某个点吗？必须 react 灵敏
您好，我被分配了一项棘手的任务。我需要让一个方形 div 到达顶部的一个点。基本上它看起来像一个正方形 div，顶部有一个宽三 Angular 形。请参阅下面的屏幕截图。顶部的深蓝色只是堆叠在白色 d
android - 为什么我们(必须)使用不同的启动器图标(xhdpi、hdpi 等)
我想知道，为什么我们在 android 中使用不同的启动器图标(大小)。目前您“必须”将图标大小调整为: LDPI - 36 x 36 MDPI - 48 x 48 HDPI - 72 x 72 XH
c++ - 必须 "ask which exact type an object has"是否总是表示设计不好？
在 SO 的几个地方，声称必须知道对象的确切类型并基于此做出决定(以 if-then-else 方式)指向一个设计缺陷，例如here . 我想知道是否总是如此。在当前的一个小型教育项目(我正在使用它来
c++ - 为什么(必须)从 std::iterator 继承？
据我了解，迭代器是一种为客户端提供接口(interface)以观察/迭代/传递自定义集合等内容的机制，而不破坏信息隐藏原则。 STL 容器有自己的迭代器，所以我们可以毫无问题地对它们使用 for (
html - go - 调用 "html/template"时没有足够的参数。必须
我在 Golang 中编写了一个包装函数，用于从多个文件中渲染模板，如下所示: func RenderTemplate(w http.ResponseWriter, data interface{},
c++ - 必须 size() == end() - begin()？ Actor 阵容呢？
据我了解，size_type 和 difference_type 的目的不仅仅是符号——它也是为了解决例如分段架构等，它们可能具有不同的大小。在这种情况下，如果我有一个带有随机访问迭代器的容器，那么

首页

博学

6Ren·AI

商城

Numpy 和 Biopython 必须集成吗？

我有五个想法，也许只有一两个有用: