xml - 在 Perl 中将类似 XML 的格式转换为 CSV-6ren

xml - 在 Perl 中将类似 XML 的格式转换为 CSV

转载作者：行者123 更新时间：2023-12-02 19:08:46

26

4

所以，我有一个如下所示的文件:

random stuff in the beginning...

 <component>
   <name>bob</name>
   <age>7</age>
   <country>Great_Britain</country>
 </component>

 <component>
   <name>bob_secondbob</name>
   <age>7</age>
   <country>Great_Britain</country>
 </component>

 <component>
   <name>bam</name>
   <age>7</age>
   <country>Great_Britain</country>
 </component>

等等...

而且，我想将其作为 CSV 格式，如下所示:

name,age,country
bob,7,Great_Britain
bob_secondbob,7,Great_Britain
bam,7,Great_Britain

所以我想知道我该怎么做？

所以我当前的代码有像 bob 和 bam 这样的词，所以我一直像这样查找它并使用 sed 来获取值:

grep -A4 "<component>" $file | grep -A4 "<name>$bob.*</name>" | grep "<name>" 
grep -A4 "<component>" $file | grep -A4 "<name>$bob.*</name>" | grep "<age>"
grep -A4 "<component>" $file | grep -A4 "<name>$bob.*</name>" | grep "<country>"

etc...

其中变量$bob是“bob”；

但问题是有 2 个 bob.* 实例，我不知道如何将它们分开，以便将它们打印出来......

我查看了 XML 模块，但该文件不是完全 XML，所以我无法使用它...

就像 bam 一样，通过 grep 可以很容易地打印出来，但是如果有多个 bob.* 实例，而我需要它们，我不知道如何正确打印出来，因为 grep 会返回多个结果。

关于我如何解决这个问题有什么建议吗？

最佳答案

明确指出“文件不是完全 XML”并且不能使用 XML 库。真糟糕:(

然后使用正则表达式对其进行解析。请记住，人们必须始终关注输入文件以查看其格式是否发生变化；即使是最小的更改也很容易使正则表达式失效，充其量会导致程序崩溃，或者更糟糕的是，会导致安静的错误。^†

显示的格式很容易解析。这是一个基本的做法，解析类似 XML 的 component任何标签及其值的部分，然后按所需顺序打印给定的一组实际标签。

use warnings;
use strict;
use feature 'say';

my $section_name = 'component';   # XML-like section to parse
my @tags = qw(name age country);  # given tags and their order

my (%record, $in_XML);

while (<>) {
    if    (/^\s*<$section_name>\s*$/)   { $in_XML = 1 }
    elsif (/^\s*<\/$section_name>\s*$/) { $in_XML = 0 } 
    
    if ( $in_XML and m{<([^<]+)> ([^<]+) </\g{1}>}x ) { 
        push @{$record{$1}}, $2; 
    }   
}

# Print out CSV-style output, with given tags
say join ',', @tags;
for my $i (0..$#{$record{$tags[0]}}) { 
    say join ',', map { $record{$_}->[$i] } @tags;
}

对标签做了一些假设。一些重要的:每个标签对都在一行上；所有标签名称都是唯一的。如果这些不包含需要调整的代码，可以做什么，但需要一些工作。

除了匹配类似 XML 的开始和结束标记对之外，<tagname>...</tagname> ，我还添加了一个标志，用于指示何时在 component 内进行处理部分。测试 if 内的标志条件允许在 XML 之外进行其他处理，否则我们可能会 next if not $in_XML;之前if健康)状况。如果文本中的其他地方不会出现意外的类似 XML 的标记对，那么这整个过程可能就没有必要了。

请注意，不必指定和使用 @tags但可以打印文件中找到的标签，即 my @tags = keys %record ，如果这是可以接受的并且顺序无关紧要。

请添加测试来测试这些标签及其值是否确实符合预期。现实的输入文件往往偶尔会丢失或意外的部分。

^† 如果可能的话，最好纠正“不是完全 XML”(使其成为 XML)并使用库。

关于xml - 在 Perl 中将类似 XML 的格式转换为 CSV，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/64655663/

26

4

0

文章推荐： antlr - ANTLR语法中[\p{Lu}]的含义

文章推荐： python - 使用 django channel 保存数据库更改

xml - 如何在没有源 xml 文件根节点的情况下将一个 xml 文件包含在另一个 xml 中？
正如标题中所问，我有两个如下结构的 XML 文件 A.xml //here I want to include B.xml
c# - 如何将等 xml 标签格式更改为
我有一个 xml 文件。根据我的要求，我需要更新空标签，例如我需要更改 to .是否可以像那样更改标签.. 谢谢... 最佳答案 var xmlString=" "; var properStri
xml - Golang : get inner xml from xml with xml.解码
我有这样简单的 XML: Song Playing 09:41:18 Frederic Delius Violin Son
xml - XML 阅读器是否应该忽略 XML 文件中的连续空格？
在我的工作中，我们有自己的 XML 类来构建 DOM，但我不确定应该如何处理连续的空格？例如 Hello World 当它被读入 DOM 时，文本节点应该包含 Hello 和 World
xml - 比较来自不同 XML 文件的元素值并附加到第一个 XML
我有以下 2 个 xml 文件，我必须通过比较 wd:Task_Name_ID 和 TaskID 的 XML 文件 2。例如，Main XML File-1 wd:Task_Name_ID 具有以下
xml - 使 XML 构建器从字符串中插入 XML
我在 Rails 应用程序中有一个 XML View ，需要从另一个文件插入 XML 以进行测试。我想说“构建器，只需盲目地填充这个字符串，因为它已经是 xml”，但我在文档中看不到这样做的任何内容
xml - XML 数据和 XML 元数据之间有什么区别？
我正在重建一些 XML 提要，因此我正在研究何时使用元素以及何时使用带有 XML 的属性。一些网站说“数据在元素中，元数据在属性中。” 那么，两者有什么区别呢？让我们以 W3Schools 为例:
xml - 文档中的多个 XML 声明是否为格式正确的 XML？
在同一个文档中有两个 XML 声明是否是格式正确的 XML？ hello 我相信不是，但是我找不到支持我的消息来源。来自 Extensible Markup Language
xml - 在 XML 中包装任意 XML
我需要在包装器 XML 文档中嵌入任意(语法上有效的)XML 文档。嵌入式文档被视为纯文本，在解析包装文档时不需要可解析。我知道“CDATA trick”，但如果内部 XML 文档本身包含 CDAT
xml - XML 解析器和 XML 处理器是否相同？
XML 解析器和 XML 处理器是两个不同的东西吗？他们是两个不同的工作吗？最佳答案 XML 解析器和 XML 处理器是一样的。它不适用于其他语言。 XML 是通用数据标记语言。解析 XML 文件已
xml - 在保留格式的同时从文件读取 XML 和从文件读取 XML
我使用这个 perl 代码从一个文件中读取 XML，然后写入另一个文件(我的完整脚本有添加属性的代码): #!usr/bin/perl -w use strict; use XML::DOM; use
xml - 使用 PowerShell 将 system.xml.xml 元素转换为 system.xml.xml 文档
我正在编写一个我了解有限的历史脚本。对象 A 的类型为 system.xml.xmlelement，我需要将其转换为类型 system.xml.xmldocument 以与对象 B 进行比较(类型
xml - 如何将子节点结构从一个 XML 文件复制到另一个 XML 文件(合并两个 XML 文件)？
我有以下两个 XML 文件: 文件1 101 102 103 501 502 503
xml - 如何将子节点结构从一个 XML 文件复制到另一个 XML 文件(合并两个 XML 文件)？
我有以下两个 XML 文件: 文件1 101 102 103 501 502 503
java - 转换性能 XML>XSL>XML 与 XML>JAXB>XML
我有一个案例，其中一个 xml 作为输入，另一个 xml 作为输出:我可以选择使用 XSL 和通过 JAXB 进行 Unmarshalling 编码。性能方面，有什么真正的区别吗？最佳答案首先，程
java - 从 XML 元素获取 XML 时的标签顺序(XML 包含 XML)？
我有包含 XML 的 XML，我想使用 JAXB 解析它 qwqweqwezxcasdasd eee 解析器 public static NotificationRequest parse(Strin
xml - 无法使用 XML 架构和 Perl (XML::LibXML) 验证 XML
xml: mario de2f15d014d40b93578d255e6221fd60 Mario F 23 maria maria
java.net.MalformedURLException : no protocol: [c:\XML\file. xml，c :\XML\file2. xml，c :\XML\file3. xml]
尝试更新 xml 文件数组时出现以下错误。代码片段: File dir = new File("c:\\XML"); File[] files = dir.listFiles(new Filenam
xml - 如何使用 ConvertTo-Xml 和 Select-Xml 加载或读取 XML 文件？
我怎样才能完成这样的事情: PS /home/nicholas/powershell> PS /home/nicholas/powershell> $date=(Get-Date | ConvertT
xml - 删除 XML 节点以将 XML 日志文件的大小减小到给定大小
我在从 xml 文件中删除节点时遇到一些困难。我发现很多其他人通过各种方式在 powershell 中执行此操作的示例，下面的代码似乎与我见过的许多其他示例相同，但我没有得到所需的行为。我的目标是将

首页

博学

6Ren·AI

商城

xml - 在 Perl 中将类似 XML 的格式转换为 CSV