php - 如何使用 PHP Curl 解析 xml 站点地图并单独加载每个 url-6ren

php - 如何使用 PHP Curl 解析 xml 站点地图并单独加载每个 url

转载作者：可可西里更新时间：2023-11-01 13:09:43

26

4

我正在尝试编写一个脚本来读取远程 sitemap.xml 并解析其中的 url，然后依次加载每个以预缓存它们以加快浏览速度。

这背后的原因:我们正在开发的系统将 DITA XML 即时写入浏览器，第一次加载页面时，等待时间可能在 8 到 10 秒之间。之后的后续加载可能只有 1 秒。显然，为了更好的用户体验，预缓存页面是一个额外的好处。

每次我们在此服务器上准备新发布或执行任何测试/修补时，我们都必须清除缓存，因此我们的想法是编写一个脚本来解析站点地图并加载每个 url。

经过一些阅读后，我决定最好的方法是使用 PHP 和 Curl。我不知道这是否是个好主意。我更熟悉 Perl，但目前系统上既没有安装 PHP 也没有安装 Perl，所以我认为将我的脚趾浸入 PHP 池中可能会很好。

到目前为止，我从“互联网”获取的代码读取 sitemap.xml 并将其写入我们服务器上的 xml 文件，并在浏览器中显示。据我所知，这只是一次转储整个文件吗？

<?php
$ver = "Sitemap Parser version 0.2";
echo "<p><strong>". $ver . "</strong></p>";


$ch = curl_init();
curl_setopt($ch, CURLOPT_URL, 'http://ourdomain.com/sitemap.xml;jsessionid=1j1agloz5ke7l?id=1j1agloz5ke7l');
curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1);
$xml = curl_exec ($ch);
curl_close ($ch);
if (@simplexml_load_string($xml)) {
    $fp = fopen('feed.xml', 'w');
    fwrite($fp, $xml);
    echo $xml;
    fclose($fp);
}
?>

与其将整个文档转储到文件或屏幕上，不如遍历 xml 结构并仅获取我需要的 url。

xml格式如下:

<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance" xsi:schemaLocation="http://www.sitemaps.org/schemas/sitemap/0.9&#x9;http://www.sitemaps.org/schemas/sitemap/0.9/sitemap.xsd">
    <url>
        <loc>http://ourdomain.com:80/content/en/FAMILY-201103311115/Family_FLJONLINE_FLJ_2009_07_4</loc>
        <lastmod>2011-03-31T11:25:01.984+01:00</lastmod>
        <changefreq>monthly</changefreq>
        <priority>1.0</priority>
    </url>
    <url>
        <loc>http://ourdomain.com:80/content/en/FAMILY-201103311115/Family_FLJONLINE_FLJ_2009_07_9</loc>
        <lastmod>2011-03-31T11:25:04.734+01:00</lastmod>
        <changefreq>monthly</changefreq>
        <priority>1.0</priority>
    </url>

我试过使用 SimpleXML:

curl_setopt($ch, CURLOPT_URL, 'http://onlineservices.letterpart.com/sitemap.xml;jsessionid=1j1agloz5ke7l?id=1j1agloz5ke7l');
curl_setopt($ch, CURLOPT_RETURNTRANSFER, 1);
$data = curl_exec ($ch);
curl_close ($ch);

$xml = new SimpleXMLElement($data);
$url = $xml->url->loc;
echo $url;

这会将第一个 url 打印到屏幕上，这是个好消息!

http://ourdomain.com:80/content/en/FAMILY-201103311115/Family_FLJONLINE_FLJ_2009_07_4

我的下一步是尝试阅读文档中的所有位置，所以我尝试了:

foreach ($xml->url) {
    $url = $xml->url->loc;
    echo $url;
}

希望这会捕获 url 中的每个位置，但它什么也没产生，我被困在这里。

请有人指导我获取多个 parent 的 child ，然后加载此页面并缓存它的最佳方式，我假设这是一个简单的 GET？

我希望我提供了足够的信息。如果我遗漏了什么(除了实际编写 PHP 的能力。请说 ;-)

谢谢。

最佳答案

您似乎没有任何值(value)来保存 foreach 的结果:

foreach ($xml->url as $url_list) {
    $url = $url_list->loc;
    echo $url;
}

关于php - 如何使用 PHP Curl 解析 xml 站点地图并单独加载每个 url，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/5977212/

26

4

0

文章推荐： php - 验证变量是否为有效 GD 图像资源的方法？

文章推荐： html - 某些平板电脑中的响应式导航栏中断

文章推荐： javascript - 没有选中属性的复选框

文章推荐： php - 正则表达式从字符串 PHP 中删除年份

java - 如何反转字符串中的每个单词(单独)？
Java 专家需要您的帮助。今天我在一次采访中被问到这个问题，但我无法解决。所以我需要一个解决方案来解决这个问题；反转字符串 Input : Hello, World! Output : oll
javascript - 将项目添加到数组中 - 单独
目标:单击按钮并将成分作为单独的项目添加到数组中。当前设置: 这给出:蓝莓芒果柠檬汁然后我希望能够通过单击按钮将成分作为单独的项目添加到数组中: var allI
javascript - 正则表达式匹配双引号内的单引号(单独)？
如何编写正则表达式来匹配它(参见箭头): "this is a ->'' this is a "test' there is another "test' 第二种情况 /\b'/ Regex Demo
javascript - 从数组中删除所有项目(单独)
我有一个数组，其中包含有限数量的项目。我想随机删除项目，直到所有项目都被使用过一次。示例 [1,2,3,4,5] 使用了随机数 5，所以我不想再这样了。使用了随机数 2，所以我不想再这样了。等等..
android - 单独/小组开发人员如何在多个设备上进行测试？
首先，抱歉，如果这太主观了，我只是不知道还能怎么问/去哪里问。无论如何，鉴于我最近的所有问题，我准备很快发布一个 Android 应用程序，并且大部分测试都是在我的手机 Droid 上完成的。我真的
delphi - 单独 .pas 文件中的字符串
这可能不是这个问题的正确位置，如果不合适请随意移动它。我标记为 Delphi/Pascal 因为这是我在 atm 中工作的内容，但这可能适用于我猜的所有编程。无论如何，我正在做一些代码清理，并考虑将
javascript - 单独(组织)快速路线
我像这样分隔了其余 api 的路由。有没有更好的方法来组织路由器？还是我现在的做法没问题？ app.js app.use('/api/auth',auth); 应用程序/ Controller /au
excel - 单独 Excel 工作表中特定数据的总和
我在 2 个单独的工作表中包含以下数据: 表1: A B C D a ff dd ff ee b 12 10 10 12 表2: A B C
jquery - 单独 HTML 文件中的可单击行可在新选项卡中打开不同的链接
我正在使用 jQuery，并在位于单独 HTML 文件中的表中获取了几行。单击时，每一行都会成功重定向到本地 HTML 文件。 (使用window.location) 我想要实现的目标我想要完成的是
html - 单独
的重叠背景图像会产生比它们本身更暗的阴影
我有重叠背景图像的问题，当它们重叠时会导致阴影比不重叠时更暗，从而产生不均匀的阴影。我有一个高度灵活的盒子，带有一些透明的背景图像和阴影以创建漂亮的边框。盒子本质上是 3 个元素。您可以在此处找到
c# - 单独 git 存储库中的服务结构项目
按照正常的微服务框架，我们希望将每个微服务放入其自己的 git 存储库中，然后为 Service Fabric 项目创建一个存储库。当我们更新其中一个微服务时，Service Fabric 项目将仅重
html - 单独 html 的多个包含
我想将多个片段嵌入到一个指令中。这是我的设置方式。 Everyone Development (3)
linux - 单独 Gzip 多个文件并保留原始文件
我希望在保留原件的同时将多个文件 gzip 到一个目录中(到多个 .gz 文件中)。我可以使用这些命令来处理单个文件: find . -type f -name "*cache.html" -exe
performance - 我如何知道 Eclipse 插件使用了多少内存(单独)
有没有办法分别知道每个 Eclipse 插件消耗了多少内存？最佳答案进行堆转储并使用例如分析它Eclipse Memory Analyser . 如需更多信息，请参阅 Analyzing Equi
gradle - Gradle-单独(其他)git存储库中DSL的通用部分
我们使用cusrom插件并以这种方式定义脚本(这是一个近似的伪代码): //It is common part for every script (1) environments { "env1"
单独 Dll 中的 Signalr Hub
我在控制台应用程序中托管了一个集线器，并有一个 WPF 应用程序连接到它。它工作得很好。然后我将集线器移到一个单独的项目中，并将主机的引用添加到新项目中。现在我收到 500 错误，没有其他详细信息。
单独 JAR 文件中的 JavaBeans 类
是否可以在单独的 JAR 文件中为 JavaBean 构建类？具体来说，JavaBean 在一个 JAR 文件中具有 Bean 和 BeanInfo 类，而自定义属性编辑器类位于另一个 JAR 文件中
C#、MAF、单独 AppDomain 中的未处理异常管理
好的，所以我有一个 MAF 应用程序，它在单独的应用程序域中加载每个插件。这非常适合我的需要，因为它允许我在运行时动态卸载和重新加载我的插件。问题是，我需要能够在子应用域中处理未处理的异常，捕获它，
mysql - SQL - 在另一个表上查找至少两个不同/单独/不同的值
在参加在线数据库类(class)(针对初学者)时，我注意到一个问题，我必须查找涉及...至少两个不同值的查询...例如， ELMASRI 书中的 COMPANY 数据库指出:查找至少从事两个不同项目的
css - 单独 div 中两行图像之间的空间，仅出现在一个特定行上
(首先:我已经尝试了涉及边距、边框等的所有选项。) Link to problematic page. Link to similarly constructed, non-problematic p

首页

博学

6Ren·AI

商城

php - 如何使用 PHP Curl 解析 xml 站点地图并单独加载每个 url