gpt4 book ai didi

python - pickle Selenium Webdriver 对象

转载 作者:太空狗 更新时间:2023-10-30 01:15:01 24 4
gpt4 key购买 nike

我想序列化并存储一个 selenium webdriver 对象,以便稍后在我的代码中的其他地方使用它。我正在尝试使用 pickle 来做到这一点。如果有另一种方法可以保存 webdriver 对象的状态,这样我可以稍后再次调用它,那就太好了(我不能只重新加载 url,因为我正在查看的网站是 javascript-heavy 并且当前页面取决于我目前点击的内容)。

目前,我有这样的代码。

import pickle
from selenium import webdriver

d = webdriver.PhantomJS()
d.get(url)
d.find_element_by_xpath(xpath).click()
p = pickle.dumps(d, pickle.HIGHEST_PROTOCOL)
# Stuff happens here.
new_driver = pickle.loads(p)
print new_driver.page_source.encode('utf-8', 'ignore')

当我运行它时,出现以下错误(错误发生在打印时,而不是之前):

    return self.driver.page_source.encode('utf-8', 'ignore')
File "/home/eric/dev/crawler-env/local/lib/python2.7/site-packages/selenium/webdriver/remote/webdriver.py", line 436, in page_source
return self.execute(Command.GET_PAGE_SOURCE)['value']
File "/home/eric/dev/crawler-env/local/lib/python2.7/site-packages/selenium/webdriver/remote/webdriver.py", line 163, in execute
response = self.command_executor.execute(driver_command, params)
File "/home/eric/dev/crawler-env/local/lib/python2.7/site-packages/selenium/webdriver/remote/remote_connection.py", line 349, in execute
return self._request(url, method=command_info[0], data=data)
File "/home/eric/dev/crawler-env/local/lib/python2.7/site-packages/selenium/webdriver/remote/remote_connection.py", line 396, in _request
response = opener.open(request)
File "/usr/lib/python2.7/urllib2.py", line 404, in open
response = self._open(req, data)
File "/usr/lib/python2.7/urllib2.py", line 422, in _open
'_open', req)
File "/usr/lib/python2.7/urllib2.py", line 382, in _call_chain
result = func(*args)
File "/usr/lib/python2.7/urllib2.py", line 1214, in http_open
return self.do_open(httplib.HTTPConnection, req)
File "/usr/lib/python2.7/urllib2.py", line 1184, in do_open
raise URLError(err)
urllib2.URLError: <urlopen error [Errno 111] Connection refused>

是否可以序列化我的 webdriver 对象?如果不是,我有什么选择?

更新:

经过进一步检查,即使我再次执行类似 d.get(url) 的操作而不是打印页面源代码,它也会给我同样的错误。 webdriver 对象在 pickled/unpickled 时会发生什么事吗?

最佳答案

我能够 pickle selenium.webdriver.Remote 对象。 dill 或 pickle 都无法序列化 selenium.webdriver.Chrome 对象,python 在其中创建并运行浏览器进程。但是,如果我 (1) 运行独立的 java selenium2 网络服务器,(2) 在一个进程中,创建一个 selenium.webdriver.Remote 连接到该服务器并将其 pickle/dill 到一个文件,(3) 在另一个进程中,它们都可以工作, 反序列化 Remote 实例并使用它。

这导致能够关闭 python 进程,然后重新连接到现有的 webdriver 浏览器并发出新命令(可能来自不同的 python 脚本)。如果我关闭 selenium 网络浏览器,则需要从头开始创建一个新实例。

服务器.py:

import pickle
import selenium.webdriver

EXECUTOR = 'http://127.0.0.1:4444/wd/hub'
FILENAME = '/tmp/pickle'

opt = selenium.webdriver.chrome.options.Options()
capabilities = opt.to_capabilities()
driver = selenium.webdriver.Remote(command_executor=EXECUTOR, desired_capabilities=capabilities)
fp = open(FILENAME, 'wb')
pickle.dump(driver, fp)

客户端.py:

import pickle

FILENAME = '/tmp/pickle'

driver = pickle.load(open(FILENAME, 'rb')
driver.get('http://www.google.com')
el = driver.find_element_by_id('lst-ib')
print(el)

注意事项(2020-08-08):以这种方式 pickle Selenium 在最新的 Selenium (4.x)中停止工作。 Pickle 无法 pickle 内部套接字对象。一种选择是将“selenium=3.141.0”项添加到 setup.py 中的 install_requires 组件,这对我仍然有效。

关于python - pickle Selenium Webdriver 对象,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/25208188/

24 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com