html - 使用 golang 解析损坏的 HTML-6ren

html - 使用 golang 解析损坏的 HTML

转载作者：IT老高更新时间：2023-10-28 13:09:48

29

4

我需要在 HTML 字符串中查找元素。不幸的是，HTML 几乎被破坏了(例如，没有开始对的结束标签)。

我尝试将 XPath 与 launchpad.net/xmlpath 一起使用，但它无法解析 HTML 文件，这该死的错误。

如何使用 golang 在损坏的 HTML 中查找元素？我更喜欢使用 XPath，但如果我可以使用它来查找具有特定 id 或类的标签，我也愿意接受其他解决方案。

最佳答案

好像net/html完成这项工作。

这就是我现在正在做的事情:

package main

import (
    "strings"
    "golang.org/x/net/html"
    "log"
    "bytes"
    "gopkg.in/xmlpath.v2"
)

func main() {
    brokenHtml := `<!DOCTYPE html><html><body><h1 id="someid">My First Heading</h1><p>paragraph</body></html>`

    reader := strings.NewReader(brokenHtml)
    root, err := html.Parse(reader)

    if err != nil {
        log.Fatal(err)
    }

    var b bytes.Buffer
    html.Render(&b, root)
    fixedHtml := b.String()

    reader = strings.NewReader(fixedHtml)
    xmlroot, xmlerr := xmlpath.ParseHTML(reader)

    if xmlerr != nil {
        log.Fatal(xmlerr)
    }

    var xpath string
    xpath = `//h1[@id='someid']`
    path := xmlpath.MustCompile(xpath)
    if value, ok := path.String(xmlroot); ok {
        log.Println("Found:", value)
    }
}

关于html - 使用 golang 解析损坏的 HTML，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/24101721/

29

4

0

文章推荐： go - Golang 中的简单 SSH 端口转发

文章推荐： android - Android中的R类是什么？

文章推荐： android - 设置背景Drawable时填充在哪里？

文章推荐： Python - Pymongo 插入和更新文档

c - Posix AIO 损坏/损坏？
关闭。这个问题需要更多focused .它目前不接受答案。想改进这个问题吗？更新问题，使其只关注一个问题 editing this post . 关闭 8 年前。 Improve this qu
F# - 损坏 "then"
我目前正在尝试制作一个非常简单的应用程序，它会根据一天中的时间问候。我的代码是: open System let read() = Console.Read() let readLine() = Co
elasticsearch - 损坏/未分配的Elasticsearch索引
我已经运行Elasticsearch服务很长时间了，但是突然遇到了以下情况由以下原因导致:org.elasticsearch.index.translog.TranslogCorruptedExce
browser - Cookie 损坏
我对执行以下操作的 php 重定向脚本有一个奇怪的问题: 在用户的浏览器中植入 Cookie，或者读取现有 Cookie(如果有)。将用户重定向到另一个网址(重定向的网址是原始网址中的参数，例如 h
itext - 表格单元格水平对齐被忽略/损坏
我正在使用 iText 7.0.0(Java 风格)，似乎表格单元格 HorizontalAlignment 被忽略，因为 CENTER 和 RIGHT 都不起作用。你能重现这个吗？ see th
swift - 变量多线程访问 - 损坏
简而言之: 我有一个可以从多个线程访问的计数器变量。尽管我已经实现了多线程读/写保护，但该变量似乎仍然以不一致的方式同时写入，导致计数器结果不正确。深入杂草: 我使用的“for 循环”会在后台触发大
Java:ArrayList 损坏？
我有一个 REST 项目，在访问控制服务类中保存用户的ArrayList。一切都工作正常，直到 REST Web 服务突然抛出 java.util.NoSuchElementException。单步查
正常重启后 MySQL 损坏
已关闭。此问题不符合Stack Overflow guidelines 。它目前不接受答案。这个问题似乎不是关于 a specific programming problem, a software
javascript - 刷新页面时本地存储加载投票(损坏)
当我刷新页面时，我无法显示 voteUp/Down，因为如果我执行 voteUp/Down(+1 或 -1) 并刷新页面，这会再次返回 voteUp/Down (0)。过去我使用 JSON，但社区推荐
c++ - 为什么链表中的数据在嵌套函数中发生更改/损坏？
我正在为离散时间 CPU 调度模拟器编写代码。它只是生成流程并相应地安排它们。我目前正在实现 FCFS 计划。我理解离散时间模拟器的本质，但我在用 C++ 实现时遇到了麻烦。问题出现在handleN
centos - Rpmdb 损坏
尝试使用 yum 部署包时出现错误: 2016-07-07 14:14:31,296 - ERROR - error: rpmdb: BDB0113 Thread/process 6723/1
堆的 C++ 损坏
我有一个简单的同步队列 template class SynchronisedQueue { public: void Enqueue(const T& d
Hadoop 损坏 block
我正在使用 hadoop 0.20.append 和 hbase 0.90.0。我将少量数据上传到 Hbase，然后出于评估目的杀死了 HMaster 和 Namenode。在此之后，我向 Hbase
PHP session 损坏
我使用 symfony 框架 1.4 创建了一个网站。我正在使用 sfguard 进行身份验证。现在，这在 WAMP (windows) 上运行良好。我可以在不同的浏览器上登录多个帐户并使用该网站。
java - HashMap 损坏/性能问题
目前我已经实现了 HashMap private static Map cached = new HashMap(); 和 Item 是一个具有属性的对象 Date expireTime 和 byte
WPF 单向绑定(bind)损坏
我试图将 2 个不同的 WPF 控件绑定(bind)到 ViewModel 中的同一属性，即 CheckBox.IsChecked 和 Expander.IsExpanded。我想要实现的行为是让 C
Gradle processResources 损坏 .jks
我希望这是一个简单的问题，但我没有找到答案。我想让 build.gradle 文件通过替换某些变量来设置我的 Spring Boot 应用程序中的版本。这与广告一样有效: def tokens =
c++ - 库包含 WinRT 损坏
已关闭。此问题需要 debugging details 。目前不接受答案。编辑问题以包含 desired behavior, a specific problem or error, and the
c++ - OpenGL 批处理渲染器中的纹理出血/损坏
这个问题在这里已经有了答案: In a fragment shader, why can't I use a flat input integer to index a uniform array o
java - OSM xml 损坏？
我已经下载了 OSM 世界地图。解析时出现异常: osm bound changeset (...) changeset Exception in thread "main" org.xml.sax.

首页

博学

6Ren·AI

商城

html - 使用 golang 解析损坏的 HTML