gpt4 book ai didi

perl - 替换最后一列中的第四列,同时从第三列中选择唯一值

转载 作者:行者123 更新时间:2023-12-02 04:32:13 25 4
gpt4 key购买 nike

我有两个文件,它们都由管道分隔。

第一个文件:可能有大约 10 列,但我对前两列感兴趣,这对于更新第二个文件的列值很有用。

第一个文件详细信息:

1|alpha|s3.3|4|6|7|8|9

2|beta|s3.3|4|6|7|8|9

20|charlie|s3.3|4|6|7|8|9

6|romeo|s3.3|4|6|7|8|9

第二个文件详细信息:

a1|a2|**bob**|a3|a4|a5|a6|a7|a8|**1**|a10|a11|a12

a1|a2|**ray**|a3|a4|a5|a6|a7|a8||a10|a11|a12

a1|a2|**kate**|a3|a4|a5|a6|a7|a8|**20**|a10|a11|a12

a1|a2|**bob**|a3|a4|a5|a6|a7|a8|**6**|a10|a11|a12

a1|a2|**bob**|a3|a4|a5|a6|a7|a8|**45**|a10|a11|a12

我的要求是从第三列中查找唯一值,并替换最后一列中的第四列。倒数第四列可能有也可能没有数字 number 。该数字也将出现在第一个文件的第一个字段中。我需要用第一个文件第二列中出现的相应值替换(第二个文件)这个数字。

预期输出:

唯一字符串: ray kate bob

a1|a2|bob|a3|a4|a5|a6|a7|a8|**alpha**|a10|a11|a12

a1|a2|ray|a3|a4|a5|a6|a7|a8||a10|a11|a12

a1|a2|kate|a3|a4|a5|a6|a7|a8|**charlie**|a10|a11|a12

a1|a2|bob|a3|a4|a5|a6|a7|a8|**romeo**|a10|a11|a12

a1|a2|bob|a3|a4|a5|a6|a7|a8|45|a10|a11|a12

我可以使用下面的命令选择唯一的字符串

awk -F'|' '{a[$3]++}END{for(i in a){print i}}' 文件名

我不想读取第二个文件两次,第一次选择唯一的字符串,第二次替换最后一个文件的第四列,因为文件大小很大。大约有 500mb,而且这样的文件有很多。

目前我正在使用 perl (Text::CSV) 模块读取第一个文件(该文件很小)并将前两列加载到哈希中,将第一列视为键第二个是值(value)。然后读取第二个文件并用哈希值替换n-4列。但这似乎很耗时,因为 Text::CSV 解析似乎很慢。

任何牢记速度的 awk/perl 解决方案都会非常有帮助:)

注意:忽略文本周围的 ** 星号,它们只是为了突出显示它们不是数据的一部分。

更新:代码

#!/usr/bin/perl
use strict;
use warnings;
use Scalar::Utils;
use Text::CSV;
my %hash;
my $csv = Text::CSV->new({ sep_char => '|' });

my $file = $ARGV[0] or die "Need to get CSV file on the command line\n";

open(my $data, '<', $file) or die "Could not open '$file' $!\n";
while (my $line = <$data>) {
chomp $line;

if ($csv->parse($line)) {

my @fields = $csv->fields();
$hash{$field[0]}=$field[1];

} else {
warn "Line could not be parsed: $line\n";
}
}
close($data);

my $csv = Text::CSV->new({ sep_char => '|' , blank_is_undef => 1 , eol => "\n"});
my $file2 = $ARGV[1] or die "Need to get CSV file on the command line\n";

open ( my $fh,'>','/tmp/outputfile') or die "Could not open file $!\n";
open(my $data2, '<', $file2) or die "Could not open '$file' $!\n";
while (my $line = <$data2>) {
chomp $line;

if ($csv->parse($line)) {

my @fields = $csv->fields();
if (defined ($field[-4]) && looks_like_number($field[-4]))
{
$field[-4]=$hash{$field[-4]};
}

$csv->print($fh,\@fields);
} else {
warn "Line could not be parsed: $line\n";
}
}
close($data2);
close($fh);

最佳答案

这是一个不使用Text::CSV的选项:

use strict;
use warnings;

@ARGV == 3 or die 'Usage: perl firstFile secondFile outFile';

my ( %hash, %seen );
local $" = '|';

while (<>) {
my ( $key, $val ) = split /\|/, $_, 3;
$hash{$key} = $val;
last if eof;
}

open my $outFH, '>', pop or die $!;

while (<>) {
my @F = split /\|/;
$seen{ $F[2] } = undef;
$F[-4] = $hash{ $F[-4] } if exists $hash{ $F[-4] };
print $outFH "@F";
}

close $outFH;

print 'unique string : ', join( ' ', reverse sort keys %seen ), "\n";

命令行用法:perl firstFile secondaryFile outFile

数据集中 outFile 的内容(已删除星号):

a1|a2|bob|a3|a4|a5|a6|a7|a8|alpha|a10|a11|a12
a1|a2|ray|a3|a4|a5|a6|a7|a8||a10|a11|a12
a1|a2|kate|a3|a4|a5|a6|a7|a8|charlie|a10|a11|a12
a1|a2|bob|a3|a4|a5|a6|a7|a8|romeo|a10|a11|a12
a1|a2|bob|a3|a4|a5|a6|a7|a8|45|a10|a11|a12

标准输出:

unique string : ray kate bob

希望这有帮助!

关于perl - 替换最后一列中的第四列,同时从第三列中选择唯一值,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/22768817/

25 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com