- Java 双重比较
- java - 比较器与 Apache BeanComparator
- Objective-C 完成 block 导致额外的方法调用?
- database - RESTful URI 是否应该公开数据库主键?
lxml html5parser似乎忽略了我传递给它的任何 namespaceHTMLElements=False
选项。它将我给它的所有元素放入 HTML 命名空间而不是(预期的)void 命名空间。
这是一个重现问题的简单案例:
echo "<p>" | python -c "from sys import stdin; \
from lxml.html import html5parser as h5, tostring; \
print tostring(h5.parse(stdin, h5.HTMLParser(namespaceHTMLElements=False)))"
输出是这样的:
<html:html xmlns:html="http://www.w3.org/1999/xhtml"><html:head></html:head><html:body><html:p>
</html:p></html:body></html:html>
可以看出,html
元素和所有其他元素都在 HTML 命名空间中。
预期的输出是这样的:
<html><head></head><body><p>
</p></body></html>
我知道 namespaceHTMLElements
是一个 html5lib 选项,而不是 lxml 自己直接使用的原生 lxml 选项。 lxml 应该只调用 html5lib 并以 html5lib 按预期使用它的方式将该选项传递给 html5lib。
我仍然没有找到让 lxml html5parser 遵守 namespaceHTMLElements
的方法。但需要明确的是,另一种方法是直接调用 html5lib,如下所示:
echo "<p>" | python -c "from sys import stdin; \
import html5lib; from lxml import html; \
doc = html5lib.parse(stdin, treebuilder='lxml', namespaceHTMLElements=False); \
print html.tostring(doc)"
一些我已经知道的事情:
html
element must be placed into the HTML namespace —html5lib 做什么namespaceHTMLElements=False
作为覆盖默认“将 html
元素放入 HTML 命名空间”行为的选项。namespaceHTMLElements=False
传递给它时,一切都按预期工作——html
元素进入 void 命名空间.将一些 printf 黑入 html5lib 源代码,我观察到:
namespaceHTMLElements=False
调用 html5libnamespaceHTMLElements
,然后第二次有 namespaceHTMLElements=False
综上所述,很明显问题出在 lxml 和 html5lib 之间的接口(interface)上。我不确定为什么 lxml 两次调用 html5lib 但我认为这可能是因为出于某种原因它首先尝试创建自己的新实例 XHTMLParser
在做我实际要求的事情之前要做的,就是创建一个它自己的 HTMLParser
的实例。
所以也许它确实对 html5lib 进行了两次调用这一事实导致 html5lib 有点“锁定”第一次调用产生的默认 namespaceHTMLElements=True
行为,然后忽略 namespaceHTMLElements=False
指令,当它在第二次调用中看到它时。
也许以这种方式进行两次调用时,lxml 要么打破了 html5lib 中的某些假设,要么实际上以一种设计不打算使用的方式滥用 html5lib API。
或者根本不是 lxml 对 html5lib 进行两次单独调用的结果,而是它使用 html5lib 接口(interface)的方式存在其他问题。
无论如何,我很想听听其他人是否遇到过这个问题并有解决方法——或者至少对发生这种情况的原因有一些了解。
最佳答案
我在源代码中关注了 lxml 如何将参数传递给 html5lib。大多数函数都有一个整理*kws,然后交给下一个函数。在调用实际 html5 解析器时的最后步骤之一中,它被删除并使用 2 个固定参数调用解析器。
(我昨天遇到了同样的问题,刚到这个问题,忘记了细节,请允许我放弃任何代码片段和引用。)
无论如何,这证实了在 2018 年,如果由于某种原因调用 lxml 自己的解析器不是一个选项,直接调用 html5lib 仍然是首选方式。
(我的用例是:解析蹩脚的 html 并拥有 xpath。)
关于html - lxml html5parser 忽略 "namespaceHTMLElements=False"选项,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/32731479/
大家好, 我看到了来自 java 项目中的 jsp 页面。 想问一下这些html标签有什么区别。 请多多指教。 示例代码如下: 最佳答案 使用struts-html标签库,其中只是普
我有一个页面,我正在从电子邮件中读取 HTML。 有时,来自电子邮件的文本包含 HTML 和 CSS,它完全改变了我的页面样式。 我不希望我的页面样式因此受到影响。我如何严格阅读特定 div(框)内的
我知道有类似的问题,但我想对我的特定代码进行一些输入。 我有一个图像,我将其切成 9 块,并创建了一个 3x3 HTML 表来显示它。 但是我的表在行之间有空格,但在列之间没有空格。我没有使用任何 C
编辑:Waylan 的回答成功了!谢谢! 我正在尝试压缩文档的 .html 文件以发送给客户。目标是获得与浏览实际网站相同的体验。 打开 .html 文件时,单击的任何链接都会转到父文件夹,而不是特定
编辑:Waylan 的回答成功了!谢谢! 我正在尝试压缩文档的 .html 文件以发送给客户。目标是获得与浏览实际网站相同的体验。 打开 .html 文件时,单击的任何链接都会转到父文件夹,而不是特定
这是 question 的扩展.我正在尝试解析嵌入在 Blogger 博客的 XML 备份中的 HTML 片段,并用 InDesign 标签重新标记它们。 Blogger 并未对其任何帖子的 HTML
我知道在 html 中元素之间的换行符被视为空格,但我认为当您尝试使用响应式布局时这非常可怕。 例如,这里我们有预期和正确的行为,但要获得它,我必须删除元素之间的 html 中的换行符: https:
我正在尝试将文本文件显示为 html。我正在使用 ionic 。我正在发送一个 html 格式的响应,但在一个文本文件中发送到配置文件页面。它在 .ts 页面的变量名中。 @Component({
假设我有一个 html 文档: test 我想在浏览器中显示该代码。然后我会创建类似的东西: <html>test<html> 为了在中间制作 gubbins,我有一个函数
HTML 元素和 HTML 标签有什么区别?渲染有什么区别吗?使用标签或元素时有什么特殊注意事项吗? 最佳答案 是一个标签,特别是一个开始标签 也是一个标签,一个结束标签 This is a para
我有这个表格的模态形式。该表正在填充大量数据,但我不想分页。相反,我想以模式形式降低表格的高度并为表格添加溢出。下面是我的代码,但它不起作用。 请问我该如何实现? CSS #table{
我记得有一个 Linux 命令可以从给定的 URL 返回 HTML 代码。您可以将 URL 作为此命令的参数,然后返回 HTML 代码,而不是在浏览器中输入 URL。 哪个命令执行此操作? 最佳答案
我有一个 html 页面,我想在其中包含另一个有很多链接的 html 页面。我能够使用 iframe 实现它,但我希望 iframe 内的页面具有与原始页面相同的文本和链接颜色属性,我不想要滚动条,我
我正在使用 HTML 写一本书。如果我把它写在一个 html 文件中,整个代码就会变长,所以我想将每一章保存到不同的文件中,然后将它们加载到主 html 中。我的意思是有像 chapter1.html
在显示之前,我必须将一个网站重定向到另一个网站。我试过使用 .htaccess,但它给我带来了问题。我也使用过 javavscript 和 meta,但在加载我要从中传输的页面之前它不起作用。帮助?
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。 我们不允许提问寻求书籍、工具、软件库等的推荐。您可以编辑问题,以便用事实和引用来回答。 关闭 7 年前。
如何打印“html”标签,包括“”?如何在不使用文本区域和 Javascript 的情况下对任何标签执行此操作? 最佳答案 使用HTML character references : <html
我需要将 Ruby on Rails 应用程序中的 html.slim 文件转换为 html.erb。有什么简单的方法吗?我尝试了 Stack Overflow 和其他网站中列出的许多选项。但对我没有
这个问题在这里已经有了答案: Is it necessary to write HEAD, BODY and HTML tags? (6 个答案) 关闭 8 年前。 我在 gitHub 上找到了这个
如果不允许通过 JavaScript 进行额外的 DOM 操作,我正在寻找可以加载外部资源的元素列表。我正在尝试使用 HTML 查看器托管来自第三方的电子邮件,当发生这种情况时,我需要删除任何自动加载
我是一名优秀的程序员,十分优秀!