- c - 在位数组中找到第一个零
- linux - Unix 显示有关匹配两种模式之一的文件的信息
- 正则表达式替换多个文件
- linux - 隐藏来自 xtrace 的命令
Incapsula 是一个 Web 应用程序交付平台,可用于防止抓取。
我正在使用 Python 和 Scrapy,我发现了 this ,但它似乎已经过时并且无法与当前的 Incapsula 一起使用。我用我的 target website 测试了 Scrapy 中间件由于中间件无法提取一些混淆参数,我得到了 IndexErrors。
是否可以调整此代码库或 Incapsula 现在是否更改了其操作模式?
我也很好奇如何将 chrome 开发工具中的请求“复制为 cURL”到我的目标页面,并且 chrome 响应包含用户内容,但 curl 响应是一个“incapsula 事件”页面.这是针对 chrome 的,最初清除了 cookies.....
curl 'https://www.radarcupon.es/tienda/fotoprix.com'
-H 'pragma: no-cache' -H 'dnt: 1' -H 'accept-encoding: gzip, deflate, br'
-H 'accept-language: en-GB,en-US;q=0.9,en;q=0.8'
-H 'upgrade-insecure-requests: 1'
-H 'user-agent: Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Ubuntu Chromium/62.0.3202.94 Chrome/62.0.3202.94 Safari/537.36'
-H 'accept: text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,image/apng,*/*;q=0.8'
-H 'cache-control: no-cache' -H 'authority: www.radarcupon.es'
--compressed
我期待双方的第一个请求返回类似 javascript challenge 的东西,这会设置一个 cookie,但它现在似乎不太像那样工作?
最佳答案
与许多其他反抓取服务一样,Incapsula 使用 3 种类型的详细信息来识别网络抓取器:
为了绕过这种保护,我们需要确保这些详细信息与普通网络用户的详细信息相匹配。
自然网络用户通常从住宅或移动 IP 地址连接,其中许多生产抓取器部署在数据中心 IP 地址(谷歌云、AWS 等)上。这 3 种类型非常不同,可以通过分析 IP 数据库来确定。顾名思义:数据中心 - 商业 IP 地址、住宅 - 家庭地址和移动地址是基于蜂窝塔的移动网络(3G、4G 等)
因此,我们希望通过住宅或移动代理池来分发我们的抓取网络。
使用 javascript,这些服务可以分析浏览器环境并构建指纹。如果我们运行浏览器自动化工具(如 Selenium、Playwright 或 Puppeteer)作为网络抓取工具,我们需要确保浏览器环境看起来像用户一样。
这是一个很大的主题,但一个好的开始是看一下 puppeteer-stealth 是什么将补丁应用于浏览器环境以隐藏各种细节的插件,这些细节揭示了浏览器由脚本控制的事实。
注意:puppeteer-stealth
不完整,您需要做额外的工作才能可靠地通过 Incapsula。
所以回答有点简短,但我在我的博客上写了一篇关于这个主题的广泛介绍 How to Avoid Web Scraping Blocking: Javascript
最后,我们的爬虫连接方式也起着重要作用。连接模式可用于确定客户端是真实用户还是机器人。例如,真实用户通常以更困惑的方式浏览网站,例如转到主页、类别页面等。
隐蔽的抓取程序应该在抓取连接模式中引入一些困惑。
由于 Incapsula 依赖于 JS 指纹识别,因此您询问有关使用 CURL 的问题,因此在这种情况下您不会有太多运气。但是,需要注意一些可能对其他系统有帮助的事项:
了解这 3 个区分机器人流量和真实人类流量的细节可以帮助我们开发更隐蔽的抓取工具。如果您想了解更多信息,我在我的博客上写了更多关于这个主题的文章 How to Scrape Without Getting Blocked
关于python - Incapsula 的工作原理以及如何战胜它,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/47581662/
Incapsula 是一个 Web 应用程序交付平台,可用于防止抓取。 我正在使用 Python 和 Scrapy,我发现了 this ,但它似乎已经过时并且无法与当前的 Incapsula 一起使用
我们正在尝试使用 Terraform Incapsula privider 来管理 Imperva 站点和自定义证书资源。 我们能够创建 Imperva 站点资源,但证书资源创建失败。 我们的用例是从
我正在寻找可以为我的静态文件提供服务的低成本/免费 CDN。 (我将从我自己的服务器提供动态文件) 从计划看来,免费计划包括 CDN: https://www.cloudflare.com/plans
如果您需要在您的网站中缓存以降低数据库使用率,您有使用 memcache 来做到这一点吗?或 memcached (例如,在 PHP 中)或者您可以通过使用像 CloudFlare 这样的专业服务来实
如果您需要在您的网站中缓存以降低数据库使用率,您有使用 memcache 来做到这一点吗?或 memcached (例如,在 PHP 中)或者您可以通过使用像 CloudFlare 这样的专业服务来实
我正在运行一个托管在 Windows Azure 上的包含大量图像的网站。后端性能非常好,但图像缩略图(占页面大小的大部分)的响应时间非常不稳定。我正在使用Azure CDN用于服务所有图像,但它们的
我正在尝试使用 URL ping 测试为我的一个 Web 应用程序设置可用性测试。问题是它不断失败并出现以下错误。该网站是公开可用的,当我只使用 IP 时,它会被解析并定向到正确的 url,但出现相同
我是一名优秀的程序员,十分优秀!