python - 无法使用 beautifulsoup 检索 <a> 标记 href(以 "?"而不是 http/s 开头)-6ren

python - 无法使用 beautifulsoup 检索标记 href(以 "?"而不是 http/s 开头)

转载作者：行者123 更新时间：2023-11-27 23:37:32

25

4

这是我第一次网络抓取，我正在尝试网络抓取，只有以下网站的页面 (1-...):

http://jobs.monster.com/search/?q=data%20science

使用 python beautifulsoup，但它似乎无法识别页面的标签。标签看起来像这样:

<a href="?q=data-science&amp;page=1" class="page-link">1</a>

我的部分代码如下所示:

import urlparse
import urllib
import re
from bs4 import BeautifulSoup

# start with this page
url = "http://jobs.monster.com/search/?q=data%20science"
       #http://jobs.monster.com/search/?q=data%20science&page=2

# stack of urls from nytimes
urls = [url]
#print urls

# visited urls
visited = [url]

while len(urls) > 0:
    try:
        htmltext = urllib.urlopen(urls[0]).read()
    except:
        print urls[0]

    soup = BeautifulSoup(htmltext)


    urls.pop(0)

    for tag in soup.find_all('a', {'class':'page-link'}):
        print tag

我没有收到任何错误，但也没有打印出任何内容...我猜这是因为 href 不是以 http/s 开头？

有人能帮忙吗？

谢谢

最佳答案

问题是当您的站点加载 urllib 时，它不包含类 page-link 的 anchor 。

无论您在浏览器中看到什么。这是因为 JavaScript 创建了指向下一个站点的页面链接。如果您使用具有良好开发工具的浏览器(我使用 Chrome)，您可以禁用网站上的 JavaScript 执行。如果您这样做并再次加载网站，您将看到分页消失。

但要解决您的问题，您可以提取职位结果计数并根据此值创建 URL 列表:每个站点显示 20 个职位发布。您可以将结果计数除以 20，看看您需要抓取多少页。当然，这仅适用于结果低于 1000 的搜索。超过 1000 个结果只会显示“1000+ 个结果”，因此您无法真正计算页面数量。

但是，如果您仔细查看加载页面的源代码，您可以找到创建分页的 JavaScript 标记。这包括您可以用来创建要抓取的 URL 列表的页面总数。当然，这将包括一些文本解析，但如果您投入一些时间，您可以找到一种方法来进行解析。

如果您有足够的页面，您可以创建一个循环(或生成器)并将您的注释行用于下一个 url:

for p in range(2,page_count+1):
      url = "http://jobs.monster.com/search/?q=data%20science&page="+str(p)

或

urls = ["http://jobs.monster.com/search/?q=data%20science&page="+str(p) for p in range(2, page_count+1)]

循环从 2 开始，因为您已经拥有第一个站点，因此无需再次加载它。

关于python - 无法使用 beautifulsoup 检索 <a> 标记 href(以 "?"而不是 http/s 开头)，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/33159895/

25

4

0

文章推荐： css - 如何让 img 在 flex-end 对齐？

文章推荐： Javascript 用复选框改变颜色

文章推荐： css - 固定背景大小在移动版 chrome 中不起作用

文章推荐： javascript - 如何设置 Meteor Insert AutoForm 将数据插入集合？

javascript - puppeteer 获取 href 数组，然后遍历每个 href 和该页面上的 href
我正在尝试通过 node.js 中的 puppeteer 抓取数据目前，我正在寻找一个脚本，用于抓取 well.ca 某个部分中的所有数据现在，这是我试图通过 node.js 实现的方法/逻辑 1
html - href =""、 href ="#"和 href ="javascript:void(0)"有什么区别？
href=""、href="#" 和 href="javascript:void(0)" 之间有什么区别? 它们有哪些不同的用途，什么时候一个比另一个更好？最佳答案 href=""将重新加载当前页面
javascript - 使用 href 值查找 anchor 标记并使用新的 href 值更改 href 值
这是html代码: Delivery Schedule Route Abstract Report 我有 href 值。使用 href 值，我应该找到 anchor 标记并使用 jQuery
javascript - this.href 不返回 href
我不确定是不是因为我使用的是 Wordpress 但 this.href 没有返回包含它们的项目的 href(例如在“联系人”上它返回 http://www.domain.net/undefined反
html - href 悬停影响另一个 href
这个问题在这里已经有了答案: Is there a "previous sibling" selector? (33 个答案) 关闭 8 年前。
html - href 里面的 href
这个问题在这里已经有了答案: Are you allowed to nest a link inside of a link? (9 个回答) 关闭 6 年前。我有一个可点击的面板，其中有一个工具
html - href 中的跨浏览器 href？
我的 css 如下所示 ul.sometclass li a { display:inline-block; } 我的 html 看起来像 outer test
html - "a[href*=#]:not([href=#])"代码是什么意思？
我没看明白这段代码是什么意思？ a[href*=#]:not([href=#]) 谢谢! 最佳答案简单地: a[href*=#] 获取 href 中包含 # 的所有 anchor (a)。但是有:
href - document.getElementById 包含 href
document.getElementById("IDOFELEMENT"); 将其转换为链接的正确方法是什么？我可以写吗 document.getElementById("IDOFELEME
reactjs - href 变成 data-href
所以我在我的 Next JS 应用程序中遇到了这个奇怪的问题，我导入了谷歌字体，如下所示在我的浏览器中显示的不是 href，而是 data-href="..."，所以问题是谷歌无法将此识别为链接
javascript - 从所选选项中获取 href 值并更改按钮的 href
我想获取所选选项的 href 值，以便我现在可以转到使用按钮选择的链接。这是我的代码
javascript - 获取一个链接的 href 并将其放入另一个链接的 href
我正在尝试获取我的一个链接的 href 并将其克隆/复制到另一个链接的 href 这是我正在尝试的 var link = $('.topbook'); var link2 =
javascript - 从一个链接获取 href 并克隆到另一个 href
我基本上是试图从一个链接获取href，然后将其填充到另一个链接中: HTML: Link to thing Link to duplicate 脚本: $('.main-link').attr('hr
html - href 中的 href 的解决方案？
我使用的 CSS 工具提示必须包含在“a href”中才能工作。 iPad [add_to_cart_anchor item="ipad"]purchase the iPad[/add_to_c
c# - 用封闭的 HREFS 替换电子邮件和 HREFS
我有一个以前是纯文本的电子邮件正文，但现在我把它变成了 HTML。电子邮件是使用多种方法生成的，但没有一种方法易于转换。我有的是: Some content emailaddress@somethi
python - 当 ['href' ] 元素是超链接时如何提取 href
我正在尝试从网页中抓取数据，然后通过提取下一页的 href 来转到下一页。但是，在这种情况下，包含下一页的 href 的标签是 href='#next'。使用 Chrome 检查此元素后，当我将鼠标
href - 是什么意思？
在我的 html 页面中，我看到一个链接，其“查看源代码”代码如下: 当我将鼠标悬停在链接上并单击它时，我看到了一个有效链接。但我无法找到生成此 URL 的位置和方式。我发现类 a.view 是在其
javascript - this.href 与 $(this).attr ('href' )
看完这篇文章net.tutsplus.com/tutorials/javascript-ajax/14-helpful-jquery-tricks-notes-and-best-practices/我
href - 如何在 SvelteKit 中使用 Relative Href？
我想用 SvelteKit 构建一个 Web 应用程序，其中一页列出所有项目(带有潜在的搜索查询参数)，然后每个单独的项目一页。如果我必须使用后端生成的所有内容以老式方式构建它，我的路径将是 /ite
javascript - 警报显示一些 href，而其他则不显示，我想要包含该词的所有 href
此 js 搜索包含 page=fleet 的 href其中: var links = document.querySelectorAll('a[href*="page=fleet"]'); var h

首页

博学

6Ren·AI

商城

python - 无法使用 beautifulsoup 检索标记 href(以 "?"而不是 http/s 开头)

首页

博学

6Ren·AI

商城

python - 无法使用 beautifulsoup 检索 标记 href(以 "?"而不是 http/s 开头)

python - 无法使用 beautifulsoup 检索标记 href(以 "?"而不是 http/s 开头)