gpt4 book ai didi

java - 在 Java 中使用 XPATH 处理分层 XML 文档。效率?

转载 作者:太空宇宙 更新时间:2023-11-04 08:45:20 26 4
gpt4 key购买 nike

这个问题的变体已经在这里被问过好几次了,但我的问题更多的是关于在 Java 中使用 XPATH 的总体效率的问题。

我的任务:获取有关地理位置的维基百科文章,并从中创建分层数据结构。

我已经获得了 wiki 页面的 XML 版本,并根据直观的模式重新格式化。我还制作了一系列非常简单的类,代表管理层次结构的不同级别,例如:

public class Province implements java.io.Serializable {

private ArrayList<City> cities = new ArrayList<City>();
private String hanzi;
private String pinyin;


public Province(String hanzi, String pinyin) {
this.hanzi = hanzi;
this.pinyin = pinyin;
}

以及添加城市的方法、一些 getter 和 setter 方法以及 toString()。

这是我正在处理的 XML 文件类型的示例:

<mediawiki>
<page>
<title>Tianjin</title>
<revision>
<id>2064019</id>
<text xml:space="preserve">
<province>
<hanzi>天津</hanzi>
<pinyin>Tianjin</pinyin>

<Level2>
<hanzi>和平</hanzi>
<pinyin>Heping</pinyin>
<zip>300000</zip>
</Level2>

<Level2>
<hanzi>河东</hanzi>
<pinyin>Hedong</pinyin>
<zip>300000</zip>
</Level2>

</province>
</text>
</revision>
</page>

...

</mediawiki>

此时我基本上已经有了一个功能设置,但代码极其重复,并且没有考虑地理数据固有的层次结构性质。理想情况下,我可以在某个级别停止(假设“关注”某个特定省份),并且从该点开始仅以相对术语引用事物,以最大程度地减少我必须爬行整个文档的次数。作为示例(请注意,我使用的是对传统文档设置的抽象,但下面的方法几乎与传统方法完全对应):

XPathReader reader = new XPathReader("sourceXML\\Provinces.xml");           
String expression = "/mediawiki/page";
NodeList allProvinces = (NodeList)reader.read(expression, XPathConstants.NODESET);

for(int i=0; i < allProvinces.getLength(); i++) {
expression = "/mediawiki/page[" + i + "]/revision/text/province/hanzi";
String hanzi = reader.read(expression, XPathConstants.STRING).toString();

expression = "/mediawiki/page[" + i + "]/revision/text/province/pinyin";
String pinyin = reader.read(expression, XPathConstants.STRING).toString();

Province currProv = new Province(hanzi, pinyin);



expression = "/mediawiki/page[" + i + "]/revision/text/province/Level2";
NodeList level2 = (NodeList)reader.read(expression, XPathConstants.NODESET);

for(int j=1; j < level2.getLength(); j++) {
expression = "/mediawiki/page[" + i + "]/revision/text/province/Level2[" + j + "]/hanzi";
String hanzi2 = reader.read(expression, XPathConstants.STRING).toString();

expression = "/mediawiki/page[" + i + "]/revision/text/province/Level2[" + j + "]/pinyin";
String pinyin2 = reader.read(expression, XPathConstants.STRING).toString();

City currCity = new City(hanzi2, pinyin2);
currProv.add(currCity);
...
}
}

坦白说,这看起来很愚蠢。我没有考虑到这样一个事实:一旦我达到了我所关心的级别,这些字符串的所有内容都是相同的。我没有引用任何类型的相对路径,每当我遍历文档的一部分时,实际上我都遍历了整个文档。如果我能够暂时屏蔽原始 XML 文档的其余部分,只关注我的省份,并以相对的方式指代此后的所有内容,那就太好了。

我应该特别注意“读取”抽象背后的代价有多大:

xPath.compile(expression);
String result = xPathExpression.evaluate (xmlDocument, returnType);

我本质上是在重新编译一个相同的模式,但结局略有不同?加载感兴趣的部分然后用“currProv/hanzi”之类的东西引用它的子项怎么样?

我研究了解析 XML 的其他方法,“Digester”似乎做了与我想要的类似的事情 http://commons.apache.org/digester/core.html ,但我已经拥有此 XPATH 实现中的几乎所有内容。

我一直怀疑这个问题的解决方案非常简单......但我不太明白解决方案。不管怎样,我感谢您抽出时间!

最佳答案

相对嵌套的 XPath 是正确的选择。

我领导 EclipseLink JAXB 实现 (MOXy),我们通过 @XmlPath 注释提供此功能。如果您已经有了 XPath,那么这将是一个相对简单的映射。

更多信息请参见:

关于java - 在 Java 中使用 XPATH 处理分层 XML 文档。效率?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/4458215/

26 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com