gpt4 book ai didi

php - 如何检索相对于找到的特定 HTML 节点的父元素文本?

转载 作者:可可西里 更新时间:2023-10-31 23:04:28 28 4
gpt4 key购买 nike

我正在编写一个通用的 HTML 资源管理器,可以执行一系列操作,例如访问页面、查找表、查找行、存储数据等。它内部使用 Goutte/Guzzle,因此可以使用 CSS 和 XPath选择器。关于相对于现有结果集选择新结果集,我遇到了一个有趣的问题。

考虑这个演示 HTML:

    <h2>Burrowing</h2>
<ul>
<li>
<a href="/jobs/junior-mole">Junior Mole</a>
</li>
<li>
<a href="/jobs/head-of-badger-partnerships">Head of Badger Partnerships</a>
</li>
<li>
<a href="/jobs/trainee-worm">Trainee Worm</a>
</li>
</ul>

<h2>Tree Surgery</h2>
<ul>
<li>
<a href="/jobs/senior-woodpecker">Senior Woodpecker</a>
</li>
<li>
<a href="/jobs/owl-supervisor">Owl Supervisor</a>
</li>
</ul>

<h2>Grass maintenance</h2>
<ul>
<li>
<a href="/jobs/trainee-sheep">Trainee sheep</a>
</li>
<li>
<a href="/jobs/sheep-shearer">Sheep shearer</a>
</li>
</ul>

<h2>Aerial supervision</h2>
<ul>
<li>
<a href="/jobs/head-magpie-ops">Head of Magpie Operations</a>
</li>
</ul>

我运行这个 CSS 查询来获取链接中的角色(这正确地获取了八个项目):

ul li a

对于每一个,我都想得到类别,即 <h2>紧接在 <ul> 之前在每种情况下。现在我可以用一个绝对的 CSS 选择器来做到这一点:

h2

但是这会得到四个结果,所以我不知道哪个类别 (h2) 与哪个工作(链接)相关。我需要获得八个结果:第一类的三批、第二类的两批、第三类的两批和第四类的一批,因此每个类别都映射到每个角色。

我想知道是否为此需要一个父选择器,所以我从 CSS 切换到 XPath,并首先尝试了这个,它让每个 h2 都有一个紧随其后的列表项:

//h2[(following-sibling::ul)[1]/li/a]

找到具有指定父结构的 h2s,但再次返回四个结果 - 不好。

下一次尝试:

//ul/li[../preceding-sibling::h2[1]]

这会得到正确数量的结果(基于得到一个紧接其前的标题的列表项)但得到的是链接文本,而不是类别文本。

我想过做一个循环——我知道我有八个结果,所以我可以这样做(X 是一个从 1 到 8 循环的注入(inject)变量)。这行得通,但我认为在这里添加一个手动循环相当不雅——我试图让我的规则尽可能通用:

//li[X]/../preceding-sibling::h2[1]

是否有可以返回所需结果的 XPath 操作?为避免疑义,我正在寻找以下内容(或者只是文本元素就可以了):

<h2>Burrowing</h2>
<h2>Burrowing</h2>
<h2>Burrowing</h2>
<h2>Tree Surgery</h2>
<h2>Tree Surgery</h2>
<h2>Grass maintenance</h2>
<h2>Grass maintenance</h2>
<h2>Aerial supervision</h2>

CSS 也可以,但我认为这是不可能的,因为 CSS 没有父运算符(无论如何,Goutte 只是将 CSS 选择器转换为 XPath 选择器)。

由于我使用的是 PHP (5.5),我相信我必须坚持使用 XPath 1.0。

最佳答案

不,没有单一的 XPath 1.0 表达式可以返回您想要的内容。首先因为 XPath 1.0 不允许迭代中间结果,其次因为项目序列是 defined as a node-set - 其中不能有重复。

我可以看到两种可能的解决方案来解决您的问题。要么编写 PHP 代码

  • 首先检索所有相关的 a 节点,例如使用像 //a
  • 这样的表达式
  • 依次将第二个 XPath 表达式应用于它们中的每一个:preceding::h2[1]

你必须自己编写 PHP 代码,因为我的技能很差。但我可以提供一个替代方案:您也可以使用 XSLT 1.0 转换,there are XSLT 1.0 processors在 PHP 中。

样式表

<?xml version="1.0" encoding="UTF-8" ?>
<xsl:transform xmlns:xsl="http://www.w3.org/1999/XSL/Transform" version="1.0">
<xsl:output method="xml" omit-xml-declaration="yes" indent="yes" />

<xsl:template match="/">
<xsl:for-each select="//a">
<xsl:copy-of select="preceding::h2[1]"/>
</xsl:for-each>
</xsl:template>

</xsl:transform>

应用于您的输入(添加根元素后),结果为

<h2>Burrowing</h2>
<h2>Burrowing</h2>
<h2>Burrowing</h2>
<h2>Tree Surgery</h2>
<h2>Tree Surgery</h2>
<h2>Grass maintenance</h2>
<h2>Grass maintenance</h2>
<h2>Aerial supervision</h2>

在线试用 here .顺便说一下,如果您对如何使用 for 在 XPath 2.0 中做到这一点感兴趣,正如您在评论中提到的那样,请参阅 this version instead :

for $a in //a return $a/preceding::h2[1]

关于php - 如何检索相对于找到的特定 HTML 节点的父元素文本?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/28242541/

28 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com