- c - 在位数组中找到第一个零
- linux - Unix 显示有关匹配两种模式之一的文件的信息
- 正则表达式替换多个文件
- linux - 隐藏来自 xtrace 的命令
Incapsula 是一个 Web 应用程序交付平台,可用于防止抓取。
我正在使用 Python 和 Scrapy,我发现了 this ,但它似乎已经过时并且无法与当前的 Incapsula 一起使用。我用我的 target website 测试了 Scrapy 中间件由于中间件无法提取一些混淆参数,我得到了 IndexErrors。
是否可以调整此代码库或 Incapsula 现在是否更改了其操作模式?
我也很好奇如何将 chrome 开发工具中的请求“复制为 cURL”到我的目标页面,并且 chrome 响应包含用户内容,但 curl 响应是一个“incapsula 事件”页面.这是针对 chrome 的,最初清除了 cookies.....
curl 'https://www.radarcupon.es/tienda/fotoprix.com'
-H 'pragma: no-cache' -H 'dnt: 1' -H 'accept-encoding: gzip, deflate, br'
-H 'accept-language: en-GB,en-US;q=0.9,en;q=0.8'
-H 'upgrade-insecure-requests: 1'
-H 'user-agent: Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.36 (KHTML, like Gecko) Ubuntu Chromium/62.0.3202.94 Chrome/62.0.3202.94 Safari/537.36'
-H 'accept: text/html,application/xhtml+xml,application/xml;q=0.9,image/webp,image/apng,*/*;q=0.8'
-H 'cache-control: no-cache' -H 'authority: www.radarcupon.es'
--compressed
我期待双方的第一个请求返回类似 javascript challenge 的东西,这会设置一个 cookie,但它现在似乎不太像那样工作?
最佳答案
与许多其他反抓取服务一样,Incapsula 使用 3 种类型的详细信息来识别网络抓取器:
为了绕过这种保护,我们需要确保这些详细信息与普通网络用户的详细信息相匹配。
自然网络用户通常从住宅或移动 IP 地址连接,其中许多生产抓取器部署在数据中心 IP 地址(谷歌云、AWS 等)上。这 3 种类型非常不同,可以通过分析 IP 数据库来确定。顾名思义:数据中心 - 商业 IP 地址、住宅 - 家庭地址和移动地址是基于蜂窝塔的移动网络(3G、4G 等)
因此,我们希望通过住宅或移动代理池来分发我们的抓取网络。
使用 javascript,这些服务可以分析浏览器环境并构建指纹。如果我们运行浏览器自动化工具(如 Selenium、Playwright 或 Puppeteer)作为网络抓取工具,我们需要确保浏览器环境看起来像用户一样。
这是一个很大的主题,但一个好的开始是看一下 puppeteer-stealth 是什么将补丁应用于浏览器环境以隐藏各种细节的插件,这些细节揭示了浏览器由脚本控制的事实。
注意:puppeteer-stealth
不完整,您需要做额外的工作才能可靠地通过 Incapsula。
所以回答有点简短,但我在我的博客上写了一篇关于这个主题的广泛介绍 How to Avoid Web Scraping Blocking: Javascript
最后,我们的爬虫连接方式也起着重要作用。连接模式可用于确定客户端是真实用户还是机器人。例如,真实用户通常以更困惑的方式浏览网站,例如转到主页、类别页面等。
隐蔽的抓取程序应该在抓取连接模式中引入一些困惑。
由于 Incapsula 依赖于 JS 指纹识别,因此您询问有关使用 CURL 的问题,因此在这种情况下您不会有太多运气。但是,需要注意一些可能对其他系统有帮助的事项:
了解这 3 个区分机器人流量和真实人类流量的细节可以帮助我们开发更隐蔽的抓取工具。如果您想了解更多信息,我在我的博客上写了更多关于这个主题的文章 How to Scrape Without Getting Blocked
关于python - Incapsula 的工作原理以及如何战胜它,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/47581662/
我在Windows 10中使用一些简单的Powershell代码遇到了这个奇怪的问题,我认为这可能是我做错了,但我不是Powershell的天才。 我有这个: $ix = [System.Net.Dn
var urlsearch = "http://192.168.10.113:8080/collective-intellegence/StoreClicks?userid=" + userId +
我有一个非常奇怪的问题,过去两天一直让我抓狂。 我有一个我试图控制的串行设备(LS 100 光度计)。使用设置了正确参数的终端(白蚁),我可以发送命令(“MES”),然后是定界符(CR LF),然后我
我目前正试图让无需注册的 COM 使用 Excel 作为客户端,使用 .NET dll 作为服务器。目前,我只是试图让概念验证工作,但遇到了麻烦。 显然,当我使用 Excel 时,我不能简单地使用与可
我开发了简单的 REST API - https://github.com/pavelpetrcz/MandaysFigu - 我的问题是在本地主机上,WildFly 16 服务器的应用程序运行正常。
我遇到了奇怪的情况 - 从 Django shell 创建一些 Mongoengine 对象是成功的,但是从 Django View 创建相同的对象看起来成功,但 MongoDB 中没有出现任何数据。
我是 flask 的新手,只编写了一个相当简单的网络应用程序——没有数据库,只是一个航类搜索 API 的前端。一切正常,但为了提高我的技能,我正在尝试使用应用程序工厂和蓝图重构我的代码。让它与 pus
我的谷歌分析 JavaScript 事件在开发者控制台中运行得很好。 但是当从外部 js 文件包含在页面上时,它们根本不起作用。由于某种原因。 例如; 下面的内容将在包含在控制台中时运行。但当包含在单
这是一本名为“Node.js 8 the Right Way”的书中的任务。你可以在下面看到它: 这是我的解决方案: 'use strict'; const zmq = require('zeromq
我正在阅读文本行,并创建其独特单词的列表(在将它们小写之后)。我可以使它与 flatMap 一起工作,但不能使它与 map 的“子”流一起工作。 flatMap 看起来更简洁和“更好”,但为什么 di
我正在编写一些 PowerShell 脚本来进行一些构建自动化。我发现 here echo $? 根据前面的语句返回真或假。我刚刚发现 echo 是 Write-Output 的别名。 写主机 $?
关闭。这个问题不满足Stack Overflow guidelines .它目前不接受答案。 想改善这个问题吗?更新问题,使其成为 on-topic对于堆栈溢出。 4年前关闭。 Improve thi
我将一个工作 View Controller 类从另一个项目复制到一个新项目中。我无法在新项目中加载 View 。在旧项目中我使用了presentModalViewController。在新版本中,我
我对 javascript 很陌生,所以很难看出我哪里出错了。由于某种原因,我的功能无法正常工作。任何帮助,将不胜感激。我尝试在外部 js 文件、头部/主体中使用它们,但似乎没有任何效果。错误要么出在
我正在尝试学习Flutter中的复选框。 问题是,当我想在Scaffold(body :)中使用复选框时,它正在工作。但我想在不同的地方使用它,例如ListView中的项目。 return Cente
我们当前使用的是 sleuth 2.2.3.RELEASE,我们看不到在 http header 中传递的 userId 字段没有传播。下面是我们的代码。 BaggageField REQUEST_I
我有一个组合框,其中包含一个项目,比如“a”。我想调用该组合框的 Action 监听器,仅在手动选择项目“a”完成时才调用。我也尝试过 ItemStateChanged,但它的工作原理与 Action
你能看一下照片吗?现在,一步前我执行了 this.interrupt()。您可以看到 this.isInterrupted() 为 false。我仔细观察——“这个”没有改变。它具有相同的 ID (1
我们当前使用的是 sleuth 2.2.3.RELEASE,我们看不到在 http header 中传递的 userId 字段没有传播。下面是我们的代码。 BaggageField REQUEST_I
我正在尝试在我的网站上设置一个联系表单,当有人点击发送时,就会运行一个作业,并在该作业中向所有管理员用户发送通知。不过,我在失败的工作表中不断收到此错误: Illuminate\Database\El
我是一名优秀的程序员,十分优秀!