- xml - AJAX/Jquery XML 解析
- 具有多重继承的 XML 模式
- .net - 枚举序列化 Json 与 XML
- XML 简单类型、简单内容、复杂类型、复杂内容
我正在尝试获取特定网页的原始来源。
该页面在加载后立即执行一些修改 DOM 的脚本。我想在任何脚本或用户更改文档中的任何对象之前获取源代码。
使用 Chrome 或 Firefox(可能还有大多数浏览器),我可以查看 DOM(调试实用程序 F12)或查看原始源代码(右键单击,查看源代码)。后者是我想要完成的。
是否可以用 phantomjs/casperjs 做到这一点?
在进入页面之前,我必须登录。这在 casperjs 上运行良好。如果我浏览到该页面并呈现结果,我就知道我在正确的页面上。
casper.thenOpen('http://'+customUrl, function(response) {
this.page.render('example.png'); // *** Renders correct page (current DOM) ***
console.log(this.page.content); // *** Gets current DOM ***
casper.download('view-source:'+customUrl, 'b.html', 'GET'); // *** Blank page ***
console.log(this.getHTML()); // *** Gets current DOM ***
this.debugPage(); // *** Gets current DOM ***
utils.dump(response); // *** No BODY ***
casper.download('http://'+customUrl, 'a.html', 'GET'); // *** Not logged in ?! ***
});
我试过 this.download(url, 'a.html')
但它似乎没有共享相同的上下文,因为它返回 HTML,就好像我没有登录一样,即使如果我使用 cookies casperjs test.casper.js --cookies-file=cookies.txt
运行。
我认为我应该继续分析这个选项。
我也尝试过 casper.open('view-source:url')
而不是 casper.open('http://url')
但它似乎它无法识别该网址,因为我只得到一个空白页面。
我已经使用我拥有的实用程序查看了从服务器获得的原始 HTTP 响应,并且此消息的正文(HTML)是我所需要的,但是当页面在浏览器中加载时,DOM 已经被修改.
我试过:
casper.thenOpen('http://'+url, function(response) {
...
}
但是 response
对象只包含标题和一些其他信息,而不包含正文。
我还尝试了 onResourceRequested 事件。
想法是中止特定网页(引用者)所需的任何资源的下载。
onResourceRequested: function(casperObj, requestData, networkRequest) {
for (var i=0; i < requestData.headers.length; i++) {
var obj = requestData.headers[i];
if (obj.name === "Referer" && obj.value === 'http://'+customUrl) {
networkRequest.abort();
break;
}
}
不幸的是,修改 DOM 的脚本最初似乎内嵌在主 HTML 页面中(或者这段代码没有按照我的意愿执行)。
¿有什么想法吗?
完整代码如下:
phantom.casperTest = true;
phantom.cookiesEnabled = true;
var utils = require('utils');
var casper = require('casper').create({
clientScripts: [],
pageSettings: {
loadImages: false,
loadPlugins: false,
javascriptEnabled: true,
webSecurityEnabled: false
},
logLevel: "error",
verbose: true
});
casper.userAgent('Mozilla/5.0 (Macintosh; Intel Mac OS X)');
casper.start('http://www.xxxxxxx.xxx/login');
casper.waitForSelector('input#login',
function() {
this.evaluate(function(customLogin, customPassword) {
document.getElementById("login").value = customLogin;
document.getElementById("password").value = customPassword;
document.getElementById("button").click();
}, {
"customLogin": customLogin,
"customPassword": customPassword
});
},
function() {
console.log('Can't login.');
},
15000
);
casper.waitForSelector('div#home',
function() {
console.log('Login successfull.');
},
function() {
console.log('Login failed.');
},
15000
);
casper.thenOpen('http://'+customUrl, function(response) {
this.page.render('example.png'); // *** Renders correct page (current DOM) ***
console.log(this.page.content); // *** Gets current DOM ***
casper.download('view-source:'+customUrl, 'b.html', 'GET'); // *** Blank page ***
console.log(this.getHTML()); // *** Gets current DOM ***
this.debugPage(); // *** Gets current DOM ***
utils.dump(response); // *** No BODY ***
casper.download('http://'+customUrl, 'a.html', 'GET'); // *** Not logged in ?! ***
});
最佳答案
嗯,你尝试过使用一些事件吗?例如:
casper.on('load.started', function(resource) {
casper.echo(casper.getPageContent());
});
我觉得不行,试试吧。
问题是:您不能在正常的 casperJS 步骤中执行此操作,因为页面上的脚本已经执行。如果我们可以绑定(bind) on-DOM-Ready 事件,或者有一个像这样的特定 casper 事件,它就可以工作。问题:必须加载页面才能将一些 js 从 Casper 发送到 DOM 环境。所以绑定(bind) onready 是不可能的(我不知道如何)。我认为使用 phantom 我们可以在加载事件后抓取数据,所以只有在页面呈现时。
因此,如果无法通过事件破解它并且可能会有一些延迟,您唯一的解决方案是阻止修改您的 DOM 的脚本。
仍然有 phantomJS 选项,你可以使用它:在 casper 中:
casper.pageSettings.javascriptEnabled = false;
问题是您需要启用 js 才能取回数据,所以它无法工作...:p 是的,没用的评论! :)
否则,您必须阻止使用事件修改 DOM 的所需资源/脚本。
或者您可以使用 resource.received
事件在特定资源修改 DOM 出现之前抓取所需的数据。
事实上,我认为这是不可能的,因为如果您创建一个步骤,在特定资源出现之前从页面取回一些数据,那么在执行您的步骤时,资源将加载.当您的步骤正在抓取数据时,有必要卡住以下资源。
虽然不知道该怎么做,但这些事件可以帮助你:
casper.on('resource.requested', function(request) {
console.log(" request " + request.url);
});
casper.on('resource.received', function(resource) {
console.log(resource.url);
});
casper.on('resource.error',function (request) {
this.echo('[res : id and url + error description] <-- ' + request.id + ' ' + request.url + ' ' + request.errorString);
});
另见 How do you Disable css in CasperJS? .可行的解决方案:您识别脚本并阻止它们。但如果你需要它们,我不知道,这是一个很好的问题。也许我们可以推迟特定脚本的执行。我认为 Casper 和 phantom 不会轻易允许这样做。唯一有用的选项是 abort()
,给我们这个选项:timeout("time -> ms")
!
这里有一个类似的问题:Injecting script before other
关于javascript - 我可以使用 phantomjs/casperjs 获取原始页面源代码(与当前 DOM 相比)吗?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/24069722/
我试图通过这段代码读取未知数量的整数: while (1) { int c = getchar (); if (c == EOF) break;
我正试图找到一个类似于谷歌分析日期选择器的日期选择器: 知道 jQuery 是否提供了类似的东西吗? 最佳答案 这个 Twitter Bootstrap 风格的日期范围选择器非常接近。 https:/
我正在使用 javascript。如何获取当前 URL 的路径并将其分配给我的代码?这是我的代码: $(document).ready(function() { $(".share").hides
如何获得今天的Julian day number (JDN)相等的?或任何日期? 我看了又看,但只发现了一些产生“year-dayOfYear”的函数,而不是:2457854。 最佳答案 在 bash
我有相当简单的 UDP 服务器写在 c 上。 有时我需要知道在套接字中排队的所有 udp 数据包(字节)的当前长度。 据我了解,getsockopt 没有得到这样的信息。 欢迎使用 Linux 和 F
我一直在寻找几个小时来找到一个可以在图像中添加诸如“填充:5px”之类的东西的插件。每个人都通过纯 html 做到这一点吗?我们的客户需要一种方法来简单地使用按钮或右键单击上下文菜单来添加它。有什么建
是否有可能获得当前正在执行的 TCL 脚本的完整路径? 在 PHP 中,它将是:__FILE__ 最佳答案 根据“当前正在执行的 TCL 脚本”的含义,您实际上可能会寻找 info script ,甚
我最近从直接使用 ISession 转向了包装的 ISession,即工作单元类型模式。 我曾经使用 SQL Lite(内存中)对此进行测试。我有一个简单的帮助器类,它配置我的 SessionFact
我按照步骤操作 here在 WebStorm 中配置代码完成和其他内容,但我仍然收到以下语法错误。 我该如何解决这个问题? 最佳答案 通过相应地将“JavaScript 语言版本”(Settings/
我可以为我团队的 TFS 当前 Sprint 任务板添加书签吗?我们有两周的冲刺,因此 URL 每两周更改一次。 默认 URL 的形式为: http://[Server]/tfs/[Project]/
是否有 Subversion 命令可以显示当前版本号? 在svn checkout之后,我想启动一个脚本并需要变量中的修订号。如果有像 svn info get_revision_number 这样的
我正在编写表单的一个组件 首次安装组件时,sources={{}} ,一本空字典。由于该组件包装了现有的 Javascript 库,因此我正在实现一个自定义比较函数。为了让这个 diffing 函数
无论系统时间设置为多少以及机器所在的时区,我都需要正确的 UTC 时间。 (即使我必须打电话到互联网才能同步......) 是否有一些库或其他方法可以优雅地做到这一点? 最佳答案 如果您想获得准确可靠
我一边编码,一边拿出一些我和 friend 建立的旧网站来重新开始工作。我已经有一段时间没有做过任何 AJAX 了,当我试图找出我的代码失败的地方时,我发现没有显示很多资源。我猜这是因为我使用的是旧方
由于对性能的巨大影响,我从不怀疑我现在的桌面CPU是否有分支预测。当然可以。但各种 ARM 产品又如何呢? iPhone或Android手机有分支预测吗?较旧的任天堂 DS?基于 PowerPC 的
我有一个具有以下有效负载的 JWT: { "id": "394a71988caa6cc30601e43f5b6569d52cd7f6df", "jti": "394a71988caa6cc30
从其他一些帖子中,我能够通过以下方式获取当前 URI: 但是以下方法不起作用: 我很好奇为什么上面的方法不起作用,以及如何将当前 URI 分配给字符串。 最佳答案 每the javadocs ,g
我在表格 View 中有几个单元格。现在在任何给定的时间点,我想计算 View 中单元格的当前高度,即如果它是 View 的 3/4,它应该返回 (cellheight)*3/4 高度。 我通过以下方
这是网站的身份验证脚本。这安全吗?是最近的节目吗?它已经过时了吗?是否有“更好更安全的方法”我很新,但我没有看到太多地方使用 header 授权。 如有任何帮助,我们将不胜感激!这是我制作的第一个登录
我已经在其他 stackoverflow 线程上检查过这个错误,但在我的代码中没有发现任何错误。也许我累了,但我觉得还好。 网站.urls.py: from django.conf.urls impo
我是一名优秀的程序员,十分优秀!