c# - 如何从 XML 数据中提取特定数据-6ren

c# - 如何从 XML 数据中提取特定数据

转载作者：数据小太阳更新时间：2023-10-29 02:34:38

我正在使用以下代码片段来解析一些 XML 数据并将其转换为 CSV。我可以转换整个 XML 数据并将其转储到一个文件中，但是我的要求发生了变化，现在我很困惑。

public void xmlToCSVfiltered(string p, int e)
        {                 
            string all_lines1 = File.ReadAllText(p);

            all_lines1 = "<Root>" + all_lines1 + "</Root>";
            XmlDocument doc_all = new XmlDocument();
            doc_all.LoadXml(all_lines1);
            StreamWriter write_all = new StreamWriter(FILENAME2);
            XmlNodeList rows_all = doc_all.GetElementsByTagName("XML");

            List<string[]> filtered = new List<string[]>();

            foreach (XmlNode rowtemp in rows_all)
            {
                List<string> children_all = new List<string>();
                foreach (XmlNode childtemp in rowtemp.ChildNodes)
                {
                    children_all.Add(Regex.Replace(childtemp.InnerText, "\\s+", " "));     // <------- Fixed the Bug , Advisories dont span          
                }  
                string.Join(",", children_all.ToArray());

                //write_all.WriteLine(string.Join(",", children_all.ToArray()));

                if (children_all.Contains(e.toString()))
                {
                    filtered.Add(children_all.ToArray());
                    write_all.WriteLine(children_all);
                }
            }
            write_all.Flush();
            write_all.Close();

            foreach (var res in filtered)
            {
                Console.WriteLine(string.Join(",", res));
            }
        }

我的输入看起来像下面这样......我现在的目标是只转换那些“事件”并编译成具有一定数量的 CSV。比方说，我只想将元素 <EVENT> 下的第二个数据值的那些事件转换为 CSV是 4627。它只会转换那些事件，在下面的输入情况下，两者都在下面提到。

<XML><HEADER>1.0,770162,20121009133435,3,</HEADER>20121009133435,721,5,1,0,0,0,00:00,00:00,<EVENT>00032134826064957,4627,</EVENT><DRUG>1,1872161156,7,0,10000</DRUG><DOSE>1,0,5000000,0,10000000,0</DOSE><CAREAREA>1 </CAREAREA><ENCOUNTER></ENCOUNTER><ADVISORY>Keep it simple or spell
        tham ALL out. For some reason 
        that is not the case
        please press the on button 
        when trying to activate
        device codes also available on
    list</ADVISORY><CAREGIVER></CAREGIVER><PATIENT></PATIENT><LOCATION>20121009133435,00-1d-71-0a-71-80,-66</LOCATION><ROUTE></ROUTE><SITE></SITE><POWER>0,50</POWER></XML> 
<XML><HEADER>2.0,773162,20121009133435,3,</HEADER>20121004133435,761,5,1,0,0,0,00:00,00:00,<EVENT>00032134826064957,4627,</EVENT><DRUG>1,18735166156,7,0,10000</DRUG><DOSE>1,0,5000000,0,10000000,0</DOSE><CAREAREA>1 </CAREAREA><ENCOUNTER></ENCOUNTER><ADVISORY>Keep it simple or spell
        tham ALL out. For some reason 
        that is not the case
        please press the on button 
        when trying to activate
        device codes also available on
    list</ADVISORY><CAREGIVER></CAREGIVER><PATIENT></PATIENT><LOCATION>20121009133435,00-1d-71-0a-71-80,-66</LOCATION><ROUTE></ROUTE><SITE></SITE><POWER>0,50</POWER></XML> 

.. goes on

到目前为止，我的方法是将所有内容转换为 CSV 并将其存储在某种数据结构中，然后逐行查询该数据结构并查看该数字是否存在，如果存在，则将其写入文件行按行。我的函数将 XML 文件的路径和我们在 XML 数据中查找的数字作为参数。我是 C# 的新手，我无法理解如何更改上面的函数。任何帮助将不胜感激!

编辑:

示例输入:

<XML><HEADER>1.0,770162,20121009133435,3,</HEADER>20121009133435,721,5,1,0,0,0,00:00,00:00,<EVENT>00032134826064957,4627,</EVENT><DRUG>1,1872161156,7,0,10000</DRUG><DOSE>1,0,5000000,0,10000000,0</DOSE><CAREAREA>1 </CAREAREA><ENCOUNTER></ENCOUNTER><ADVISORY>Keep it simple or spell
    tham ALL out. For some reason 
    that is not the case
    please press the on button 
    when trying to activate
    device codes also available on
list</ADVISORY><CAREGIVER></CAREGIVER><PATIENT></PATIENT><LOCATION>20121009133435,00-1d-71-0a- 

    <XML><HEADER>1.0,770162,20121009133435,3,</HEADER>20121009133435,721,5,1,0,0,0,00:00,00:00,<EVENT>00032134826064957,4623,</EVENT><DRUG>1,1872161156,7,0,10000</DRUG><DOSE>1,0,5000000,0,10000000,0</DOSE><CAREAREA>1 </CAREAREA><ENCOUNTER></ENCOUNTER><ADVISORY>Keep it simple or spell
        tham ALL out. For some reason 
        that is not the case
        please press the on button 
        when trying to activate
        device codes also available on
    list</ADVISORY><CAREGIVER></CAREGIVER><PATIENT></PATIENT><LOCATION>20121009133435,00-1d-71-0a-

要求的输出:

1.0,770162,20121009133435,3,,20121009133435,721,5,1,0,0,0,00:00,00:00,,00032134 26064957,4627,1,,1872161156,7,0,10000,1,0,5000000,0,10000000,0,1 ,,Keep it simple or spell
    tham ALL out. For some reason 
    that is not the case
    please press the on button 
    when trying to activate
    device codes also available on
list,,,20121009133435,00-1d-71-0a-71-80,-66,,,0,50

如果我调用 xmlToCSVfiltered(file, 4627); 就会出现上述情况另请注意，输出将像 CSV 文件中一样是一条水平线，但我无法在此处真正格式化它以使其看起来像那样。

最佳答案

我将 XmlDocumnet 更改为 XDocument，这样我就可以使用 Xml Linq。我还在测试中使用了 StringReader 来读取字符串而不是从文件中读取。您可以将代码转换回原始 File.ReadAlltext。

using System;
using System.Collections.Generic;
using System.Linq;
using System.Text;
using System.Xml;
using System.Xml.Linq;
using System.IO;
using System.Text.RegularExpressions;

namespace ConsoleApplication1
{
    class Program
    {
        const string FILENAME2 = @"c:\temp\test.txt";
        static void Main(string[] args)
        {
            string input = 
            "<XML><HEADER>1.0,770162,20121009133435,3,</HEADER>20121009133435,721,5,1,0,0,0,00:00,00:00,<EVENT>00032134826064957,4627,</EVENT><DRUG>1,1872161156,7,0,10000</DRUG><DOSE>1,0,5000000,0,10000000,0</DOSE><CAREAREA>1 </CAREAREA><ENCOUNTER></ENCOUNTER><ADVISORY>Keep it simple or spell\n" +
                    "tham ALL out. For some reason \n" +
                    "that is not the case\n" +
                    "please press the on button\n" + 
                    "when trying to activate\n" +
                    "device codes also available on\n" +
                "list</ADVISORY><CAREGIVER></CAREGIVER><PATIENT></PATIENT><LOCATION>20121009133435,00-1d-71-0a-71-80,-66</LOCATION><ROUTE></ROUTE><SITE></SITE><POWER>0,50</POWER></XML>\n" + 
            "<XML><HEADER>2.0,773162,20121009133435,3,</HEADER>20121004133435,761,5,1,0,0,0,00:00,00:00,<EVENT>00032134826064957,4627,</EVENT><DRUG>1,18735166156,7,0,10000</DRUG><DOSE>1,0,5000000,0,10000000,0</DOSE><CAREAREA>1 </CAREAREA><ENCOUNTER></ENCOUNTER><ADVISORY>Keep it simple or spell\n" +
                    "tham ALL out. For some reason\n" + 
                    "that is not the case\n" +
                    "please press the on button\n" + 
                    "when trying to activate\n" +
                   "device codes also available on\n" +
                "list</ADVISORY><CAREGIVER></CAREGIVER><PATIENT></PATIENT><LOCATION>20121009133435,00-1d-71-0a-71-80,-66</LOCATION><ROUTE></ROUTE><SITE></SITE><POWER>0,50</POWER></XML>\n";

            xmlToCSVfiltered(input, 4627); 

        }
        static public void xmlToCSVfiltered(string p, int e)
        {
            //string all_lines1 = File.ReadAllText(p);
            StringReader reader = new StringReader(p);
            string all_lines1 = reader.ReadToEnd();

            all_lines1 = "<Root>" + all_lines1 + "</Root>";
            XDocument doc_all = XDocument.Parse(all_lines1);
            StreamWriter write_all = new StreamWriter(FILENAME2);
            List<XElement> rows_all = doc_all.Descendants("XML").Where(x => x.Element("EVENT").Value.Split(new char[] {','}).Skip(1).Take(1).FirstOrDefault() == e.ToString()).ToList();

            List<string[]> filtered = new List<string[]>();

            foreach (XElement rowtemp in rows_all)
            {
                List<string> children_all = new List<string>();
                foreach (XElement childtemp in rowtemp.Elements())
                {
                    children_all.Add(Regex.Replace(childtemp.Value, "\\s+", " "));     // <------- Fixed the Bug , Advisories dont span          
                }
                string.Join(",", children_all.ToArray());

                //write_all.WriteLine(string.Join(",", children_all.ToArray()));

                if (children_all.Contains(e.ToString()))
                {
                    filtered.Add(children_all.ToArray());
                    write_all.WriteLine(children_all);
                }
            }
            write_all.Flush();
            write_all.Close();

            foreach (var res in filtered)
            {
                Console.WriteLine(string.Join(",", res));
            }
        }
    }
}

关于c# - 如何从 XML 数据中提取特定数据，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/30788096/

文章推荐： xml - 使用 XSL 合并 XML 文件会删除匹配的元素

文章推荐： go - 单值上下文中的多值 http.PostForm()

文章推荐： json - 从文件中解析json

文章推荐： golang cgo : libevent handler values are set to null during execution

java - 如何使用 Ruby、PHP 或 Java 解析/提取/提取 ASP.net 网站内容？
我正在做一个业余爱好项目，使用 Ruby、PHP 或 Java 来抓取 ASP.net 网站的内容。例如，如果网站 url“www.myaspnet.com/home.aspx”。我想从 home.a
r - 提取/之间的字符串
如果我有这些字符串： mystrings <- c("X2/D2/F4", "X10/D9/F4", "X3/D22/F4",
regex - 提取 | 之间的最后一个单词|
我有以下数据集 > head(names$SAMPLE_ID) [1] "Bacteria|Proteobacteria|Gammaproteobacteria|Pseudomonadales|Mor
grails - 提取: 'join'被忽略
设置: 3个域类A，B和C。A和B在插件中。 C在依赖于此插件的应用程序中。 class A{ B b static mapping = { b fetch: 'joi
JAVA StAX 提取
我不知道如何提取 XML 文件中的开始标记元素名称。我很接近〜意味着没有错误，我正在获取标签名称，但我正在获取标签名称加上信息。我得到的是: {http://www.publishing.org}au
regex - 提取 "?"之后的文本
我有一个字符串 x <- "Name of the Student? Michael Sneider" 我想从中提取“Michael Sneider”。我用过: str_extract_all(x,
Java - 提取 [* ... *] 之间的所有内容
我有一个如下所示的文本文件: [* content I want *] [ more content ] 我想读取该文件并能够提取我想要的内容。我能做的最好的事情如下，但它会返回 [更多内容] 请注意
Twig 提取 FOR 循环变量
假设我有一个项目集合 $collection = array( 'item1' => array( 'post' => $post, 'ca
java - 读取一个文本文件并写入多个文本文件以进行过滤/提取
我正在寻找一种过滤文本文件的方法。我有许多文件夹名称，其中包含许多文本文件，文本文件有几个没有人员，每个人员有 10 个群集/组(我在这里只显示了 3 个)。但是每个组/簇可能包含几个原语(我在这里展
python - Unicode 提取
我已经编写了一个从某个网页中提取网址的代码，我面临的问题是它不会以网页上相同的方式提取网址，我的意思是如果该网址位于某些网页中法语，它不会按原样提取它。我该如何解决这个问题？ import reque
c# - 提取 ZipFile
如何在 C# 中提取 ZipFile？(ZipFile 是包含文件和目录) 最佳答案为此使用工具。类似于 SharpZip .据我所知 - .NET 不支持开箱即用的 ZIP 文件。来自 here
c++ - 提取[]之间内容的正则表达式
我有一个表达: [training_width]:lofmimics 我要提取[]之间的内容，在上面的例子中我要 training_width 我试过以下方法: QRegularExpression
bash - 提取 "$@"中最后一个参数之前的参数
我正在尝试创建一个 Bash 脚本，该脚本将从命令行给出的最后一个参数提取到一个变量中以供其他地方使用。这是我正在处理的脚本: #!/bin/bash # compact - archive and
Javascript 提取 *.com
我正在寻找一个 JavaScript 函数/正则表达式来从 URI 中提取 *.com...(在客户端完成) 它应该适用于以下情况: siphone.com = siphone.com qwr.sip
python - BeautifulSoup 提取
关闭。这个问题需要更多focused .它目前不接受答案。想改进这个问题吗？更新问题，使其只关注一个问题 editing this post . 关闭 8 年前。 Improve this qu
Python JSON 提取
编辑:添加了实际的 JSON 对象和代码以供审查我有这种格式的 JSON(只是这种层次结构，假设 JSON 正常工作) {u'kind': u'calendar#events', u'default
python - 提取标签的内容
我已经编写了代码来使用 BeautifulSoup 提取一本书的 url 和标题来自页面。但它并没有在 > 之间提取惊人的 super 科学故事 1930 年 4 月这本书的名字。和标签。如何提
Java，提取$符号之间的单词
使用 Java，我想提取美元符号 $ 之间的单词。例如: String = " this is first attribute $color$. this is the second attribu
string - 提取.txt文件中以00开头的数字
您好，我正在尝试找到一种方法来确定字符串中的常量，然后提取该常量左侧的一定数量的字符。例如-我有一个 .txt 文件，在那个文件的某处有数字 00nnn 数字的例子是 00234 00765 ...
php操作（删除,提取,增加）zip文件方法详解
php读取zip文件(删除文件,提取文件,增加文件)实例从zip压缩文件中提取文件复制代码代码如下: <?php /* php 从zip压缩文件

数据小太阳

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城

c# - 如何从 XML 数据中提取特定数据