Python Selenium 抓取不正确的括号集(Python、Selenium、MySQL)

转载作者：行者123 更新时间：2023-11-30 21:35:31

25

4

问题:

我有一些代码可以抓取 https://au.pcpartpicker.com/products/cpu/overall-list/#它获取每组括号内的文本，并通过匹配名称将它们添加到 MySQL 数据库中，这可以正常工作，但是如果条目有 2 组括号，它会选择第二组，请参见下文。

例子

代码:

这是我的代码:

import mysql.connector
from bs4 import BeautifulSoup as soup
from selenium import webdriver
import time, re

mydb = mysql.connector.connect(
  host="host",
  user="user",
  passwd="passwd",
  database="database"
)

mycursor = mydb.cursor()

d = webdriver.Chrome('D:/Uskompuf/Downloads/chromedriver')
d.get('https://au.pcpartpicker.com/products/cpu/overall-list/#page=1')
def cpus(_source):
  result = soup(_source, 'html.parser').find('ul', {'id':'category_content'}).find_all('li')
  _titles = list(filter(None, [(lambda x:'' if x is None else x.text)(i.find('div', {'class':'title'})) for i in result]))
  data = [list(filter(None, [re.findall('(?<=\().*?(?=\))', c.text) for c in i.find_all('div')])) for i in result]
  return _titles, [a for *_, [a] in filter(None, data)]


_titles, _cpus = cpus(d.page_source)
sql = "UPDATE cpu set family = %s where name = %s"
mycursor.executemany(sql, list(zip(_cpus, _titles)))
print(sql, list(zip(_cpus, _titles)))
mydb.commit()
_last_page = soup(d.page_source, 'html.parser').find_all('a', {'href':re.compile('#page\=\d+')})[-1].text
for i in range(2, int(_last_page)+1):
   d.get(f'https://au.pcpartpicker.com/products/cpu/overall-list/#page={i}') 
   time.sleep(3)
   _titles, _cpus = cpus(d.page_source)
   sql = "UPDATE cpu set family = %s where name = %s"
   mycursor.executemany(sql, list(zip(_cpus, _titles)))
   mydb.commit()

mydb.commit()

更新

我厌倦了@Daniel Scott 的以下代码

改变

_titles = list(filter(None, [(lambda x:'' if x is None else x.text)(i.find('div', {'class':'title'})) for i in result]))

到

_titles = list(filter(None, [(lambda x:'' if x is None else str(x.text).split(")")[0])(i.find('div', {'class':'title'})) for i in result]))

但是我似乎仍然得到 on-die和 on die有什么想法吗？

更新2

这是两个括号似乎都是 title 的一部分的类然而

我在想我可能必须改变这个str(x.text).split(") ？

更新 3

我已将代码更改为

import mysql.connector
from bs4 import BeautifulSoup as soup
from selenium import webdriver
import time, re

mydb = mysql.connector.connect(
  host="host",
  user="root",
  passwd="passwd",
  database="database"
)

mycursor = mydb.cursor()

d = webdriver.Chrome('D:/Uskompuf/Downloads/chromedriver')
d.get('https://au.pcpartpicker.com/products/cpu/overall-list/#page=1')
def cpus(_source):
  result = soup(_source, 'html.parser').find('ul', {'id':'category_content'}).find_all('li')
  _titles = list(filter(None, [(lambda x:'' if x is None else x.text)(i.find('div', {'class':'title'})) for i in result]))
  data = [list(filter(None, [re.findall('(?<=\().*?(?=\))', c.text) for c in i.find_all('div')])) for i in result]
  data2=[]
  for i in data:
      ii=0
      arr2=[]
      for c in i:
        # Skep the rest of section if we've already seen a closing bracket
        if (")" in c) and ii>1:
            a=1
        if ")" in c:
            ii+=1
        try:
            arr2.append(c.replace("(","").replace(")",""))
        except Exception:
            pass
      data2.append(arr2)
  data = data2
  return _titles, [a for *_, [a] in filter(None, data)]

_titles, _cpus = cpus(d.page_source)
sql = "UPDATE cpu set family = %s where name = %s"
mycursor.executemany(sql, list(zip(_cpus, _titles)))
mydb.commit()
_last_page = soup(d.page_source, 'html.parser').find_all('a', {'href':re.compile('#page\=\d+')})[-1].text
for i in range(2, int(_last_page)+1):
   d.get(f'https://au.pcpartpicker.com/products/cpu/overall-list/#page={i}') 
   time.sleep(3)
   _titles, _cpus = cpus(d.page_source)
   sql = "UPDATE cpu set family = %s where name = %s"
   mycursor.executemany(sql, list(zip(_cpus, _titles)))
   mydb.commit()

mydb.commit()

根据答案更新，但是这个 no 根本不起作用，因为我的数据库中所有 family 值都为 Null。

数据运行后print(data)返回。

有什么想法吗？

更新 4

没有运气回到基地 1。

更新 5

如果我print([list(filter(None, [re.findall('(?<=\().*?(?=\))', c.text) for c in i.find_all('div')])) for i in result])

这是我不想要的示例，我需要摆脱片上。

[['0'], ['0'], ['OEM/Tray'], ['Godavari'], ['on-die']]

更新 6

我认为这是需要更改的代码:

return _titles, [a for *_, [a] in filter(None, data)]

其他:

如果您需要更多信息，请告诉我。

谢谢

最佳答案

您可以更改行:

_titles = list(filter(None,
[(lambda x:'' if x is None else x.text)(i.find('div',
{'class':'title'})) for i in result]))

对此:

_titles = list(filter(None,
[(lambda x:'' if x is None else str(x.text).split(")")[0])(i.find('div',
{'class':'title'})) for i in result]))

这应该改变它，以便将双括号分成两个字符串，并且只使用第一个。让我知道这是否适合您!

引用:Splitting strings

更新

我的抓取工具目前真的断断续续，我无法正确解决这个问题。

在这一行之后:

data = [list(filter(None, [re.findall('(?<=\().*?(?=\))', c.text) for c in i.find_all('div')])) for i in result]

粘贴这个:

data2=[]
    for i in data:
        ii=0
        arr2=[]
        for c in i:
            # Skep the rest of section if we've already seen a closing bracket
            if (")" in c) and ii>1:
                a=1
            if ")" in c:
                ii+=1
            try:
                arr2.append(c.replace("(","").replace(")",""))
            except Exception:
                pass
        data2.append(arr2)
    data = data2

它的代码是如此丑陋，它呼唤否决票。但至少这对你来说是一个开始，所以你不会放慢脚步。它遍历数组并忽略每个 ul 中出现的第二个括号。

干杯伙计。

关于Python Selenium 抓取不正确的括号集(Python、Selenium、MySQL)，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/54048478/

25

4

0

文章推荐： php - 如何使用php函数将mysql查询输出到csv更改列值

文章推荐： c - 使用 'system' 调用在 C 中执行 WGET 命令(linux)

文章推荐： c - 注释如何改变程序的输出？

文章推荐： c# - 与 StructureMap 4.6 transient 生命周期混淆

selenium - Selenium IDE、Selenium RC 和 Selenium WebDriver 之间有什么区别？
Selenium IDE、Selenium RC 和 Selenium WebDriver 有什么区别；我们可以在什么样的项目中使用它们？任何建议将不胜感激。最佳答案 Selenium IDE 是一
selenium - 如何压缩 Selenium 客户端和 Selenium 服务器之间的传输
我的 Selenium 服务器在远程服务器上运行。我从我的本地 PC 启动我的 Selenium 脚本，它从网站获取数据。例如，我的 Selenium 脚本执行这段 JS 代码: JSON.stri
selenium - "//div[.//a[text()=' SELENIUM'] ]"and "//div[//a[text() ='SELENIUM' ]]"在 Selenium xpath中有什么区别
Selenium 中“//div[.//a[text()='SELENIUM']]”和“//div[//a[text()='SELENIUM']]”有什么区别xpath。有人可以澄清我在 xpath
selenium - Selenium 中每个测试的多个断言与单个断言？
我正在创建自动冒烟测试。我读到在单元测试中使用多个断言不是一个好的做法，这条规则是否也适用于使用 selenium 的 webdriver 测试？在我的冒烟测试中，有时我会使用 20 多个断言来验证
selenium - selenium IDE中添加两个变量
我在一个变量中存储了一个值，在另一个变量中存储了第二个值，现在我想将这两个数字相加。我无法做到这一点，我尝试过下面的代码，但它不起作用 store 6 w sto
selenium - Selenium 中回车键和回车键的区别
Selenium 中的回车键和回车键有什么区别？ This related SO answer并且提供的链接说明它们是不同的。我还注意到，在使用 Firefox 24.2 时，回车键将发送一个 HTM
selenium - 如何使用 Selenium 3 设置 Selenium Grid
以下是我遇到异常的详细信息: 当我使用以下命令启动节点时，出现如下错误: F:\SeleniumGrid\Jars>java -jar selenium-server-standalone-3.0.0
selenium - 是否有 Selenium 2 版本的 Selenium IDE？
我是的新手 Selenium 我对版本号有点困惑。 Selenium 2.0 2011年发布。我刚刚下载了 Selenium IDE Firefox 扩展，版本为 1.7.2 .是否还有 IDE 的
selenium - 我如何停止断言失败时关闭浏览器窗口的代码接收/ Selenium ？
我正在使用 Selenium 运行Codeception 2。我可以看到 Selenium 打开了浏览器并运行了测试。然后，我从代码接收中得到一个错误，即存在失败的断言。我知道有一个HTML文件可以
selenium - Selenium 3的新功能是什么
Closed. This question needs to be more focused。它当前不接受答案。想要改善这个问题吗？更新问题，使它仅关注editing this post的一个问题。
selenium - Selenium 运行中如何关闭弹出窗口？
我想关闭弹出窗口(已知的窗口名称)，然后返回到原始窗口。我该怎么办？如果我无法获得窗口中关闭按钮的常量。那么有没有达到目标的一般行为？最佳答案你有没有尝试过: selenium.Close()
selenium - 错误后如何继续使用webdriver/selenium
我正在用webdriver做一个测试机器人。我有一个场景，它单击一个按钮，打开一个新窗口，并且它通过特定的xpath搜索元素，但是有时没有这样的元素，因为可以将其禁用，并且出现此错误：org.open
selenium - Selenium :如何等待选择中的选项被填充？
我是第一次使用Selenium，对这些选项不知所措。我在Firefox中使用IDE。当我的页面加载时，它随后通过JSONP请求获取值，并在其中填充选择中的选项。我如何让Selenium等待选择中的
selenium-webdriver - 如何在运行 Selenium Selenium nightwatch.js测试时保持打开的开发人员工具？
我开始使用nightwatch.js编写e2e测试，我注意到我想在目标浏览器的控制台（开发人员工具）中手动检查一些错误。但总是在我打开开发者控制台时，浏览器会自动关闭它。这是selenium还是nig
selenium - Selenium 没有这种元素异常
我正在尝试使用以下方式刮除Glassdoor的评论: https://github.com/MatthewChatham/glassdoor-review-scraper 但是我得到了错误并且不知道如
selenium - Selenium Grid总是执行我的测试的多余实例
背景我设置了一个Selenium Grid项目，以在两种不同的浏览器Chrome和Firefox中执行测试。我正在使用Gradle执行测试。该测试将成功执行两次，一次按预期在Chrome中执行，一次
selenium - 使用 phpunit/selenium 保持 selenium 浏览器打开
当测试失败时，运行 selenium 测试的浏览器将关闭。这在尝试调试时没有帮助。我知道我可以在失败时选择屏幕截图，但如果没有整个上下文，这并没有帮助。在浏览器仍然可用的情况下，我可以回击并检查发生了
selenium - 使用 Selenium Web 驱动程序或 selenium RC
使用 Selenium Web 驱动程序而不是 Selenium RC 启动新的测试框架是个好主意吗？对于 Selenium Web 驱动程序，并非所有 Selenium 方法都已实现。那么使用 Se
selenium - Selenium 标识符的建议命名约定
我使用 selenium 页面对象模型来定义所有页面元素。我对元素命名所遵循的命名约定不太相信，并且感觉太长了。请对此提出建议。 @FindBy(xpath = "//tbody[@id='tabvi
selenium - 等待处理程序注册 - selenium
有一个带有按钮的 html 页面，我的 Selenium 测试正在测试，当单击按钮时，会执行一个操作。问题是，看起来点击发生在 javascript 执行之前 - 在处理程序绑定(bind)到页面之

首页

博学

6Ren·AI

商城

Python Selenium 抓取不正确的括号集(Python、Selenium、MySQL)

问题:

例子

代码:

更新

更新2

更新 3

更新 4

更新 5

更新 6

其他:

更新