perl - 如何解析制表符分隔的数据文件并在 Perl 中对提取的数据进行分组？-6ren

perl - 如何解析制表符分隔的数据文件并在 Perl 中对提取的数据进行分组？

转载作者：行者123 更新时间：2023-12-02 08:51:18

我是 Perl 的新手。我需要解析制表符分隔的文本文件。例如:

From name   To name      Timestamp                 Interaction
a             b        Dec  2 06:40:23 IST 2000        comment
c             d        Dec  1 10:40:23 IST 2001          like
e             a        Dec  1 16:03:01 IST 2000         follow
b             c        Dec  2 07:50:29 IST 2002         share
a             c        Dec  2 08:50:29 IST 2001        comment
c             a        Dec 11 12:40:23 IST 2008          like
e             c        Dec  2 07:50:29 IST 2000         like
c             b        Dec 11 12:40:23 IST 2008        follow
b             a        Dec  2 08:50:29 IST 2001        share

解析后，我需要根据用户交互创建组。在这个例子中

a<->b
b<->a
c<->a
a<->c
b<->c
c<->b

为此我们可以创建一个组。我们需要显示组列表。我需要一些关于如何解析文件和表单组的指示？

编辑约束-> 创建组至少需要 3 个用户。交互只不过是在两个用户之间进行一些交流。无论哪种沟通方式都无所谓

我的解决方法是

我们删除了用户之间的重复交互。例如“a<>b like”，如果存在“a<>b follow”，那么我们删除这一行。

创建存储两个用户交互的二维数组，即

          To Name   a       b        c          d

来自姓名

   a                X       <>       <>         X
   b                <>      X        <>         X
   c                <>      <>       X          X 
   d                X       <>       X          X

X=代表没有互动<>=代表互动

在这种方法中，我们从第一行开始，即“a”用户检查“b”。如果“a”与“b”交互，那么我们执行相反的操作，即“b”与“a”交互。对每一列执行相同的步骤。

但这种方法取决于用户数量。如果存在 1000 个用户，那么我们必须创建 1000 X 1000 矩阵。有没有其他方法可以解决这个问题

我添加了示例输入

a   c   Dec  2 06:40:23 IST 2000    comment
f   g   Dec  2 06:40:23 IST 2009    like
c   a   Dec  2 06:40:23 IST 2009    like
g   h   Dec  2 06:40:23 IST 2008    like
a   d   Dec  2 06:40:23 IST 2008    like
r   t   Dec  2 06:40:23 IST 2007    share
d   a   Dec  2 06:40:23 IST 2007    share
t   u   Dec  2 06:40:23 IST 2006    follow
a   e   Dec  2 06:40:23 IST 2006    follow
k   l   Dec  2 06:40:23 IST 2009    like
e   a   Dec  2 06:40:23 IST 2009    like
j   k   Dec  2 06:40:23 IST 2003    like
c   d   Dec  2 06:40:23 IST 2003    like
l   j   Dec  2 06:40:23 IST 2002    like
d   c   Dec  2 06:40:23 IST 2002    like
m   n   Dec  2 06:40:23 IST 2005    like
c   e   Dec  2 06:40:23 IST 2005    like
m   l   Dec  2 06:40:23 IST 2011    like
e   c   Dec  2 06:40:23 IST 2011    like
h   j   Dec  2 06:40:23 IST 2010    like
d   e   Dec  2 06:40:23 IST 2010    like
o   p   Dec  2 06:40:23 IST 2009    like
e   d   Dec  2 06:40:23 IST 2009    like
p   q   Dec  2 06:40:23 IST 2000    comment
q   p   Dec  2 06:40:23 IST 2009    like
a   p   Dec  2 06:40:23 IST 2008    like    
p   a   Dec  2 06:40:23 IST 2007    share
l   p   Dec  2 06:40:23 IST 2003    like
j   l   Dec  2 06:40:23 IST 2002    like
t   r   Dec  2 06:40:23 IST 2000    comment
r   h   Dec  2 06:40:23 IST 2009    like
j   f   Dec  2 06:40:23 IST 2008    like    
g   d   Dec  2 06:40:23 IST 2007    share
w   q   Dec  2 06:40:23 IST 2003    like
o   y   Dec  2 06:40:23 IST 2002    like
x   y   Dec  2 06:40:23 IST 2000    comment
y   x   Dec  2 06:40:23 IST 2009    like
x   z   Dec  2 06:40:23 IST 2008    like    
z   x   Dec  2 06:40:23 IST 2007    share
y   z   Dec  2 06:40:23 IST 2003    like
z   y   Dec  2 06:40:23 IST 2002    like

输出应该是:

(a,c, d, e)
(x,y,z)

最佳答案

解析很容易。只是一个 split /\t/ 可能就够了。然而，Text::xSV或 Text::CSV可能会更好。

对于连接，您可以使用 Graph模块。为了能够有效地使用该模块，您至少需要了解 graph theory 的基础知识.

请注意 strongly connected component定义为:

A directed graph is called strongly connected if there is a path from each vertex in the graph to every other vertex. In particular, this means paths in each direction; a path from a to b and also a path from b to a.

The strongly connected components of a directed graph G are its maximal strongly connected subgraphs.

但是，请注意，如果您有 a <-> b和 b <-> c , a , b , 和 c将形成一个强连接的组件，这意味着这是一个比组中所有成员在两个方向上相互交互更弱的要求。

我们仍然可以使用它来减少搜索空间。一旦你有了候选组，你就可以检查每个候选组，看看它是否符合你对组的定义。如果一个候选组不符合你的要求，那么你可以检查所有少一个成员的子集。如果您在其中未找到任何组，则可以查看所有成员少两个的子集，依此类推，直到达到最小组大小限制。

下面的脚本使用了这个想法。但是，它很可能不会扩展。我强烈怀疑有人可以组合一些 SQL 魔术，但我的头脑太有限了。

#!/usr/bin/env perl

use strict;
use warnings;

use Graph;
use Algorithm::ChooseSubsets;

use constant MIN_SIZE => 3;

my $interactions = Graph->new(
    directed => 1,
);

while (my $interaction = <DATA>) {
    last unless $interaction =~ /\S/;
    my ($from, $to) = split ' ', $interaction, 3;

    $interactions->add_edge($from, $to);
}

my @groups = map {
    is_group($interactions, $_) ? $_
                                : check_subsets($interactions, $_)
} grep @$_ >= MIN_SIZE, $interactions->strongly_connected_components;


print "Groups: \n";
print "[ @$_ ]\n" for @groups;

sub check_subsets {
    my ($graph, $candidate) = @_;

    my @groups;
    for my $size (reverse MIN_SIZE .. (@$candidate - 1)) {
        my $subsets = Algorithm::ChooseSubsets->new(
            set => $candidate,
            size => $size,
        );

        my $groups_found;
        while (my $subset = $subsets->next) {
            if (is_group($interactions, $subset)) {
                ++$groups_found;
                push @groups, $subset;
            }
        }
        last if $groups_found;
    }

    return @groups;
}

sub is_group {
    my ($graph, $candidate) = @_;

    for my $member (@$candidate) {
        for my $other (@$candidate) {
            next if $member eq $other;
            return unless $graph->has_edge($member, $other);
            return unless $graph->has_edge($other, $member);
        }
    }

    return 1;
}

__DATA__
a   c   Dec  2 06:40:23 IST 2000    comment
f   g   Dec  2 06:40:23 IST 2009    like
c   a   Dec  2 06:40:23 IST 2009    like
g   h   Dec  2 06:40:23 IST 2008    like
a   d   Dec  2 06:40:23 IST 2008    like
r   t   Dec  2 06:40:23 IST 2007    share
d   a   Dec  2 06:40:23 IST 2007    share
t   u   Dec  2 06:40:23 IST 2006    follow
a   e   Dec  2 06:40:23 IST 2006    follow
k   l   Dec  2 06:40:23 IST 2009    like
e   a   Dec  2 06:40:23 IST 2009    like
j   k   Dec  2 06:40:23 IST 2003    like
c   d   Dec  2 06:40:23 IST 2003    like
l   j   Dec  2 06:40:23 IST 2002    like
d   c   Dec  2 06:40:23 IST 2002    like
m   n   Dec  2 06:40:23 IST 2005    like
c   e   Dec  2 06:40:23 IST 2005    like
m   l   Dec  2 06:40:23 IST 2011    like
e   c   Dec  2 06:40:23 IST 2011    like
h   j   Dec  2 06:40:23 IST 2010    like
d   e   Dec  2 06:40:23 IST 2010    like
o   p   Dec  2 06:40:23 IST 2009    like
e   d   Dec  2 06:40:23 IST 2009    like
p   q   Dec  2 06:40:23 IST 2000    comment
q   p   Dec  2 06:40:23 IST 2009    like
a   p   Dec  2 06:40:23 IST 2008    like
p   a   Dec  2 06:40:23 IST 2007    share
l   p   Dec  2 06:40:23 IST 2003    like
j   l   Dec  2 06:40:23 IST 2002    like
t   r   Dec  2 06:40:23 IST 2000    comment
r   h   Dec  2 06:40:23 IST 2009    like
j   f   Dec  2 06:40:23 IST 2008    like
g   d   Dec  2 06:40:23 IST 2007    share
w   q   Dec  2 06:40:23 IST 2003    like
o   y   Dec  2 06:40:23 IST 2002    like
x   y   Dec  2 06:40:23 IST 2000    comment
y   x   Dec  2 06:40:23 IST 2009    like
x   z   Dec  2 06:40:23 IST 2008    like
z   x   Dec  2 06:40:23 IST 2007    share
y   z   Dec  2 06:40:23 IST 2003    like
z   y   Dec  2 06:40:23 IST 2002    like

输出:

Groups:[ y z x ][ e d a c ]

关于perl - 如何解析制表符分隔的数据文件并在 Perl 中对提取的数据进行分组？，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/8384752/

文章推荐： Sharepoint designer 2007-添加列表项后重定向到另一个页面

文章推荐：使用 SSH 隧道

文章推荐： perl - 如何在 Perl 中验证 SAML 断言？

javascript - 多个选择的复选框下拉列表由 ; 分隔
我正在尝试从下拉列表中创建一个多选复选框，并通过 ; 连接所选结果。我的代码是这样的: var myobject = { ValueA : 'Text A', ValueB : 'T
javascript - 获取输入值并以 "|"分隔
我有输入，我需要获取值并用 “|” 符号分隔。我的输入: 输出我需要的: 00:00|00:00|00:00 我的代码是: (而且它不工作) var timesArray = $('table').
mysql - 数据库中的拆分数字由破折号 (-) 分隔
我正在尝试将超过 400 万行的列拆分为 4 个新列，问题是我不知道在哪里查看或我应该使用 Google 搜索哪个术语。 (是的，我已经在 Google 和 Stack 中搜索了一个类似的问题，但只在
javascript - 分隔 .CSV 文件中的数字
我有一个很大的 csv 文件，其中充满了用“|”分隔的数字字符，例如: 432452 | 543634 4122442 | 41256512 64523 | 12416 然后我读入数据如下: fs
C# 分隔 args 参数
我有一个程序可以计算多个数字的阶乘。这些数字在 cmd 中作为参数传递: factorial.exe 3 4 5 这将分别计算 3、4 和 5 的阶乘。该程序的早期版本有一个百分比显示堆栈的完整性。我
java - java中根据 "."分隔 double
这个问题已经有答案了: 奥 git _a (6 个回答) 已关闭 9 年前。我有一个双数“547.123456” 我只想使用这个 double 作为“547.1”，就像“.”后面只有 1 个数字我
C# 分隔 args 参数
我有一个程序可以计算多个数字的阶乘。这些数字在 cmd 中作为参数传递: factorial.exe 3 4 5 这将分别计算 3、4 和 5 的阶乘。该程序的早期版本有一个百分比显示堆栈的完整性。我
java - 分隔 arraylist 的元素
我有一个 ArrayList，其中包含一个 messageId、一个 -、一个用户名。示例:E123-sam 我想划分 List 的每个元素，使得 - 之前的部分进入一个 ArrayList ，而之
python - 分隔 Pandas 数据框中共享同一列的月份和年份
我目前有一个“日期”列作为 pandas 数据框的索引，其格式为: January February .... Year2 January February ... Year3 (它来自 pdf 表格
c - mdb工具sql查询表 namespace 分隔
我正在尝试对我的 .mdb 数据库进行 ODBC 查询。我正在使用 mdbtools 驱动程序。该代码是使用 Eclipse 用 C 语言编写的。唯一的问题是，当我写例如: "SELECT 'last
java - 分隔 "if else"语句
我需要知道如何将这两个if else 部分分开。 public static int NextBday(int Bdays, int days){ int daysleft = 0;
mysql - 如何使用计数一列并由每个 id 分隔
我想计算我的员工分开但合并在一起的出勤率 My target output 我的代码 SELECT count(employees_id) as numbers FROM attendance WH
php - 我想在一个单独的列中插入多封电子邮件，并用 # 分隔
关闭。这个问题需要details or clarity .它目前不接受答案。想改进这个问题吗？通过 editing this post 添加细节并澄清问题. 关闭 7 年前。 Improve t
java - 分隔 arraylist 中的每个项目
下面是我的代码的一小段摘录，它从 API 添加了一行。总共有很多行。每一行包含一行数据如 TY8tr,50,34,P,SB, 数据行在数据类型上是一致的。我如何通过 ,'s 拆分数组列表中
javascript - 获取选中的元素并用逗号分隔它们，最后一个元素用 "and"分隔
我想获取选中的元素并用逗号分隔它们，最后一个元素用“and”分隔它的显示输出为: 我想删除最后一个元素后面的逗号 (,) 并在它前面添加 'and'，例如 Sugar, Milk and Extra
javascript - 分隔 JSON 对象的值
我是 JSON 的新手，但在从已解析的 JSON 对象中提取数据时遇到问题: 我有一个 getstats.php 文件，它回显 mysql 查询的 json 编码结果。以下是 php 文件返回的示例:
C++ 字符串解析以 0 分隔
我有一个像这样的数字/字符串(我不确定如何将 int 与字符串相互转换) 000000122310200000223340000700012220000011411000000011011271043

python - 分隔

标签内的文本

我想尝试一些基本的网络抓取，但遇到了一个问题，因为我习惯了简单的 td-tags，在这种情况下，我有一个网页，其中包含以下预标记和其中的所有文本，这意味着刮掉它有点棘手。 11111111 1111

C# 分隔 TCP 消息
出于练习目的，我正在开发 TCP 客户端/服务器系统，我想在两者之间发送特定数据。我已经能够发送字节并让它们显示为字符串。此外，我还可以发送一个特定的字符串(“mb”)并在服务器端弹出一个 Mess
java - 分隔 Unicode 连字字符
在大量的 unicode 字符中，有一些实际上表示多个字符，例如两个 'f' 字符的 U+FB00 连字 ff。有什么方法可以轻松地将这样的字符转换为多个单个字符？最好是标准 Java API 中可用

行者123

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

perl - 如何解析制表符分隔的数据文件并在 Perl 中对提取的数据进行分组？