Python3 刮刀。直到最后才解析 xpath-6ren

Python3 刮刀。直到最后才解析 xpath

转载作者：行者123 更新时间：2023-12-01 03:59:02

25

4

我正在使用lxml.html模块

from lxml import html   

page = html.parse('http://directory.ccnecommunity.org/reports/rptAccreditedPrograms_New.asp?sort=institution')

# print(page.content)

unis = page.xpath('//tr/td[@valign="top" and @style="width: 50%;padding-right:15px"]/h3/text()')

print(unis.__len__())

with open('workfile.txt', 'w') as f:
    for uni in unis:
        f.write(uni + '\n')

这里的网站( http://directory.ccnecommunity.org/reports/rptAccreditedPrograms_New.asp?sort=institution#Z )充满了大学。

问题在于它解析到字母“H”(244 个unis)。我不明白为什么，因为我看到它解析所有 HTML 直到最后。

我还记录了我自己，244 不是 python3 中列表或任何内容的限制。

最佳答案

那个 HTML 页面根本就不是 HTML，它完全被破坏了。但以下将做你想做的。它使用 BeautifulSoup解析器。

from lxml.html.soupparser import parse
import urllib

url = 'http://directory.ccnecommunity.org/reports/rptAccreditedPrograms_New.asp?sort=institution'
page = parse(urllib.request.urlopen(url))
unis = page.xpath('//tr/td[@valign="top" and @style="width: 50%;padding-right:15px"]/h3/text()')

参见http://lxml.de/lxmlhtml.html#really-broken-pages了解更多信息。

关于Python3 刮刀。直到最后才解析 xpath，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/36924654/

25

4

0

文章推荐： javascript - D3 折线图 - 无法显示线条

文章推荐： php - 尝试使用ajax jquery将2个变量传递给php

文章推荐： symfony - symfony 2 中的同一个 url 需要多个角色

文章推荐： jquery - 函数删除未定义 - Jquery (Ajax)

scala - 从尝试返回一个值 - 最后
这个问题在这里已经有了答案: “return” and “try-catch-finally” block evaluation in scala (2 个回答) 7年前关闭。为什么method1返
jquery 选择器之前-最后
我有一个动态列表，需要选择最后一项之前的项目。 drag your favorites here var lastLiId = $(".album
JMeter Once Only Controller 最后
我想为每个线程执行特定操作，因此，我认为tearDown Thread Group 不起作用。是否有任何替代方法可以仅在线程的最后一次迭代时运行“仅一次 Controller ”？谢谢。最佳答案
Perl && 做 { 最后; };
在我的书中它使用了这样的东西: for($ARGV[0]) { Expression && do { print "..."; last; }; ... } for 循环不完整吗？另外，do 的意义何
JMeter Once Only Controller 最后
我想为每个线程执行特定操作，因此，我认为tearDown Thread Group 不起作用。是否有任何替代方法可以仅在线程的最后一次迭代时运行“仅一次 Controller ”？谢谢。最佳答案
c# - 最后:是否保证在任何情况下都会被调用
有没有可能 finally 不会被调用但应用程序仍在运行？我在那里释放信号量 finally { _semParallelUpdates.Re
css - 最后，有时倒数第二
我收藏了对齐的元素，以便它们形成两列。使用 nth-last-child 的组合和 nth-child(even) - 或任何其他选择器 - 是否可以将样式应用于以下两者之一:a)最后两个(假设
c# - 最后，是什么触发了捕获变量的新实例？
我正在阅读 Jon Skeet 的 C# in Depth . 在第 156 页，他有一个示例， list 5.13“使用多个委托(delegate)捕获多个变量实例化”。 List list = n
excel - 最后 4 个结果的总和形成具有多个条件的列
我在 AM4:AM1000 范围内有一个数据列表(从上到下有间隙)，它总是被添加到其中，我想在其中查找和总结最后 4 个结果。但我只想找到与单独列相对应的结果，范围 AL4:AL1000 等于单元格
PowerShell 尝试/捕获/最后
我最近编写了一个运行良好的 PowerShell 脚本 - 然而，我现在想升级该脚本并添加一些错误检查/处理 - 但我似乎被第一个障碍难住了。为什么下面的代码不起作用？ try { Remove-
python - 最后 else if 语句不打印
这个问题在这里已经有了答案: Why does "a == x or y or z" always evaluate to True? How can I compare "a" to all of
django 最后 30 个条目列表及计数
使用 Django 中这样的模型，如何检索 30 天的条目并计算当天添加的条目数。 class Entry(models.Model): ... entered = models.Da
java - 最后 block 不设置java中变量的值
我有以下代码。 public static void main(String[] args) { // TODO Auto-generated method stub
python - 最后 else if 语句不打印
这个问题在这里已经有了答案: Why does "a == x or y or z" always evaluate to True? How can I compare "a" to all of
java - 尝试/最后 - 工作面试
这个问题已经有答案了: Multiple returns: Which one sets the final return value? (7 个回答) 已关闭 8 年前。我正在经历几个在工作面试中
python3 : how to print groupby. 最后()？
$ cat n2.txt apn,date 3704-156,11/04/2019 3704-156,11/22/2019 5515-004,10/23/2019 3732-231,10/07/201
c++ - 最后 5 个元素的读取访问权限
我可以在 C/C++ 中设置/禁用普通数组最后几个元素的读(或写)访问权限吗？由于我无法使用其他进程的内存，我怀疑这是可能的，但如何实现呢？我用谷歌搜索但找不到。如果可以，怎样做？因为我想尝试这样
C# - 将键盘事件发送到(最后)选定窗口
我想使用在这里找到的虚拟键盘组件 http://www.codeproject.com/KB/miscctrl/touchscreenkeyboard.aspx就像 Windows 中的屏幕键盘 (O
php - 选择 *，最后(日期时间)
我正在运行一个 while 循环来获取每个对话的最新消息，但是我收到了错误 [18-Feb-2012 21:14:59] PHP Warning: mysql_fetch_array(): supp
Python 最后 60 个月末
这个问题在这里已经有了答案: How to get the last day of the month? (44 个答案) 关闭 8 年前。这是我在这里的第一篇文章，所以如果我做错了请告诉我...

首页

博学

6Ren·AI

商城

Python3 刮刀。直到最后才解析 xpath