- objective-c - iOS 5 : Can you override UIAppearance customisations in specific classes?
- iphone - 如何将 CGFontRef 转换为 UIFont?
- ios - 以编程方式关闭标记的信息窗口 google maps iOS
- ios - Xcode 5 - 尝试验证存档时出现 "No application records were found"
我每天都会看到询问如何从一些 HTML 字符串中解析或提取内容的问题,第一个回答/评论总是“不要使用 RegEx 来解析 HTML,否则你会感到愤怒!” (最后一部分有时会被省略)。
这让我很困惑,我一直认为一般来说,解析任何复杂字符串的最佳方法是使用正则表达式。那么 HTML 解析器是如何工作的呢?不是用正则表达式解析么。
使用正则表达式的一个特别论点是,并不总是有解析替代方案(例如 JavaScript,其中 DOMDocument 不是普遍可用的选项)。例如,jQuery 似乎可以很好地使用正则表达式将 HTML 字符串转换为 DOM 节点。
不确定是否要继续讨论这个问题,这是一个真正的问题,我想得到回答,而不是真正打算成为一个讨论话题。
最佳答案
So how does a HTML parser work? Doesn't it use regular expressions to parse?
嗯,不。
如果您回想起一门计算理论类(class),如果您参加过一门编译器类(class)或类似类(class),您可能会想起有不同种类的语言和计算模型。我没有资格详述所有细节,但我可以和您一起回顾几个要点。
最简单的语言和计算类型(出于这些目的)是常规语言。这些可以用正则表达式生成,并用有限自动机识别。基本上,这意味着这些语言中的“解析”字符串使用状态,而不是辅助内存。 HTML 当然不是一种常规语言。仔细想想,标签列表可以任意深度嵌套。例如,表格可以包含表格,每个表格可以包含很多嵌套标签。使用正则表达式,您也许可以挑选出一对标签,但肯定不能任意嵌套。
不正则的经典简单语言正确匹配括号。尽可能地尝试,您将永远无法构建一个永远有效的正则表达式(或有限自动机)。您需要内存来跟踪嵌套深度。
具有内存堆栈的状态机是计算模型的下一个优势。这称为下推自动机,它可以识别由上下文无关文法生成的语言。在这里,我们可以识别正确匹配的括号——事实上,堆栈是它的完美内存模型。
嗯,这对 HTML 来说足够好了吗?可悲的是没有。也许对于 super 骗子仔细验证的 XML,实际上,其中所有的标签总是完美地排列在一起。在现实世界的 HTML 中,您可以轻松找到类似 <b><i>wow!</b></i>
的片段.这显然没有嵌套,所以为了正确解析它,堆栈不够强大。
下一级别的计算是由通用语法生成并由图灵机识别的语言。这被普遍认为是有效的最强大的计算模型——一个带有辅助内存的状态机,其内存可以在任何地方修改。这就是编程语言可以做的。这就是 HTML 存在的复杂程度。
用一句话概括这里的一切:要解析一般的 HTML,您需要一种真正的编程语言,而不是正则表达式。
HTML 的解析方式与其他语言的解析方式相同:词法分析和解析。词法分析步骤将单个字符流分解为有意义的标记。解析步骤使用状态和内存将标记组装成一个逻辑连贯的文档,可以对其进行操作。
关于html - 如果不使用正则表达式,HTML 解析如何工作?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/2400623/
大家好, 我看到了来自 java 项目中的 jsp 页面。 想问一下这些html标签有什么区别。 请多多指教。 示例代码如下: 最佳答案 使用struts-html标签库,其中只是普
我有一个页面,我正在从电子邮件中读取 HTML。 有时,来自电子邮件的文本包含 HTML 和 CSS,它完全改变了我的页面样式。 我不希望我的页面样式因此受到影响。我如何严格阅读特定 div(框)内的
我知道有类似的问题,但我想对我的特定代码进行一些输入。 我有一个图像,我将其切成 9 块,并创建了一个 3x3 HTML 表来显示它。 但是我的表在行之间有空格,但在列之间没有空格。我没有使用任何 C
编辑:Waylan 的回答成功了!谢谢! 我正在尝试压缩文档的 .html 文件以发送给客户。目标是获得与浏览实际网站相同的体验。 打开 .html 文件时,单击的任何链接都会转到父文件夹,而不是特定
编辑:Waylan 的回答成功了!谢谢! 我正在尝试压缩文档的 .html 文件以发送给客户。目标是获得与浏览实际网站相同的体验。 打开 .html 文件时,单击的任何链接都会转到父文件夹,而不是特定
这是 question 的扩展.我正在尝试解析嵌入在 Blogger 博客的 XML 备份中的 HTML 片段,并用 InDesign 标签重新标记它们。 Blogger 并未对其任何帖子的 HTML
我知道在 html 中元素之间的换行符被视为空格,但我认为当您尝试使用响应式布局时这非常可怕。 例如,这里我们有预期和正确的行为,但要获得它,我必须删除元素之间的 html 中的换行符: https:
我正在尝试将文本文件显示为 html。我正在使用 ionic 。我正在发送一个 html 格式的响应,但在一个文本文件中发送到配置文件页面。它在 .ts 页面的变量名中。 @Component({
假设我有一个 html 文档: test 我想在浏览器中显示该代码。然后我会创建类似的东西: <html>test<html> 为了在中间制作 gubbins,我有一个函数
HTML 元素和 HTML 标签有什么区别?渲染有什么区别吗?使用标签或元素时有什么特殊注意事项吗? 最佳答案 是一个标签,特别是一个开始标签 也是一个标签,一个结束标签 This is a para
我有这个表格的模态形式。该表正在填充大量数据,但我不想分页。相反,我想以模式形式降低表格的高度并为表格添加溢出。下面是我的代码,但它不起作用。 请问我该如何实现? CSS #table{
我记得有一个 Linux 命令可以从给定的 URL 返回 HTML 代码。您可以将 URL 作为此命令的参数,然后返回 HTML 代码,而不是在浏览器中输入 URL。 哪个命令执行此操作? 最佳答案
我有一个 html 页面,我想在其中包含另一个有很多链接的 html 页面。我能够使用 iframe 实现它,但我希望 iframe 内的页面具有与原始页面相同的文本和链接颜色属性,我不想要滚动条,我
我正在使用 HTML 写一本书。如果我把它写在一个 html 文件中,整个代码就会变长,所以我想将每一章保存到不同的文件中,然后将它们加载到主 html 中。我的意思是有像 chapter1.html
在显示之前,我必须将一个网站重定向到另一个网站。我试过使用 .htaccess,但它给我带来了问题。我也使用过 javavscript 和 meta,但在加载我要从中传输的页面之前它不起作用。帮助?
关闭。这个问题不符合Stack Overflow guidelines .它目前不接受答案。 我们不允许提问寻求书籍、工具、软件库等的推荐。您可以编辑问题,以便用事实和引用来回答。 关闭 7 年前。
如何打印“html”标签,包括“”?如何在不使用文本区域和 Javascript 的情况下对任何标签执行此操作? 最佳答案 使用HTML character references : <html
我需要将 Ruby on Rails 应用程序中的 html.slim 文件转换为 html.erb。有什么简单的方法吗?我尝试了 Stack Overflow 和其他网站中列出的许多选项。但对我没有
这个问题在这里已经有了答案: Is it necessary to write HEAD, BODY and HTML tags? (6 个答案) 关闭 8 年前。 我在 gitHub 上找到了这个
如果不允许通过 JavaScript 进行额外的 DOM 操作,我正在寻找可以加载外部资源的元素列表。我正在尝试使用 HTML 查看器托管来自第三方的电子邮件,当发生这种情况时,我需要删除任何自动加载
我是一名优秀的程序员,十分优秀!