javascript - VBA动态网页抓取Excel-6ren

javascript - VBA动态网页抓取Excel

转载作者：行者123 更新时间：2023-12-03 02:50:57

27

4

我有一个关于如何从此网页抓取数据的问题:

http://tvc4.forexpros.com/init.php?family_prefix=tvc4&carrier=64694b96ed4909e815f1d10605ae4e83&time=1513525898&domain_ID=70&lang_ID=70&timezone_ID=31&pair_ID=171&interval=86400&refresh=4&session=session&client=1&user=200743128&width=650&height=750&init_page=instrument&m_pids=&watchlist=&site=https://au.investing.com&version=1.11.2

它似乎被保存在 iframe 中，并且屏幕上出现了一堆 JavaScript。

每当我尝试收集 iframe 下的 span 或 div 或 tr 标签中的元素时，我似乎无法收集其中的数据。

我的目标是 class="pane-legend-item-value pane-legend-line main"元素内保存的内部文本。

显然，内部文本会根据特定时间光标在屏幕上的位置而变化。所以我尝试做的是设置一个 IE，它已经加载了页面并且光标位于正确的位置，在图表的末尾(给我最后一个数据点)，然后你可以将光标移出屏幕，然后我编写了一些简单的代码来抓取该 IE 窗口，然后尝试了 GetElements，此时我无法获取任何数据。

这是我到目前为止的代码，它非常粗糙，因为我在阅读更多选项时一直在尝试编辑，但没有任何胜利:( ...任何想法或帮助将不胜感激!(屏幕截图是也在底部)

Sub InvestingCom()

    Dim IE As InternetExplorer
    Dim htmldoc As MSHTML.IHTMLDocument 'Document object
    Dim eleColth As MSHTML.IHTMLElementCollection 'Element collection for th tags
    Dim eleColtr As MSHTML.IHTMLElementCollection 'Element collection for tr tags
    Dim eleColtd As MSHTML.IHTMLElementCollection 'Element collection for td tags
    Dim eleRow As MSHTML.IHTMLElement 'Row elements
    Dim eleCol As MSHTML.IHTMLElement 'Column elements
    Dim elehr As MSHTML.IHTMLElement 'Header Element
    Dim iframeDoc As MSHTML.HTMLDocument
    Dim frame As HTMLIFrame
    Dim ieURL As String 'URL

    'Take Control of Open IE
    marker = 0
    Set objShell = CreateObject("Shell.Application")
    IE_count = objShell.Windows.Count
    For x = 0 To (IE_count - 1)
        On Error Resume Next
        my_url = objShell.Windows(x).document.Location
        my_title = objShell.Windows(x).document.Title

        If my_title Like "*" & "*" Then 'compare to find if the desired web page is already open
            Set IE = objShell.Windows(x)
            marker = 1
            Exit For
        Else
        End If
    Next

    'Extract data
    Set htmldoc = IE.document 'Document webpage

    ' I have tried span, tr, td etc tags and various other options
    ' I have never actually tried collecting an HTMLFrame but googled it however was unsuccessful
End Sub

Excel 可以找到并与在另一个屏幕上打开的 Excel 和 VB 进行对话的现有 IE 的屏幕截图以及我想要抓取的数据

Screenshot of the already existing IE which excel can find and talk to with excel and VB open on the other screen and the data I would like to scrape

最佳答案

对我来说，处理该页面中的两个嵌套的 iframe 来收集所需的内容确实很困难。但无论如何，我终于把它修好了。运行以下代码并获取您请求的内容:

Sub forexpros()
    Dim IE As New InternetExplorer, html As HTMLDocument
    Dim frm As Object, frmano As Object, post As Object

    With IE
        .Visible = True
        .navigate "http://tvc4.forexpros.com/init.php?family_prefix=tvc4&carrier=64694b96ed4909e815f1d10605ae4e83&time=1513525898&domain_ID=70&lang_ID=70&timezone_ID=31&pair_ID=171&interval=86400&refresh=4&session=session&client=1&user=200743128&width=650&height=750&init_page=instrument&m_pids=&watchlist=&site=https://au.investing.com&version=1.11.2"
        Do Until .readyState = READYSTATE_COMPLETE: Loop
        Application.Wait (Now + TimeValue("0:00:05"))
        Set frm = .document.getElementsByClassName("abs") ''this is the first iframe
        .navigate frm(0).src
        Do Until .readyState = READYSTATE_COMPLETE: Loop
        Application.Wait (Now + TimeValue("0:00:05"))
        Set html = .document
    End With

    Set frmano = html.getElementsByTagName("iframe")(0).contentWindow.document  ''this is the second iframe

    For Each post In frmano.getElementsByClassName("pane-legend-item-value pane-legend-line main")
        Debug.Print post.innerText
    Next post
    IE.Quit
End Sub

关于javascript - VBA动态网页抓取Excel，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/47861303/

27

4

0

文章推荐： javascript - Ajax从restful API获取未定义的列表

文章推荐： javascript - Firebase 按日期排序从今天起的值不起作用

文章推荐： javascript - 将动画悬停在菜单的一项而不是所有项目上

css - 从浏览器中提取光标图像(抓取、抓取...)
如本answer所述，如果浏览器不支持 e，可以设置后备游标。 G。光标:抓取；。我现在的问题是获取这些图像。在我的驱动器上本地搜索“.cur”只给了我系统光标，其中 grab.cur 和 grab
python - Instagram 抓取
以下代码在计算机上运行以从 Instagram 帐户中抓取数据。当我尝试在 VPS 服务器上使用它时，我被重定向到 Instagram 登录页面，因此脚本不起作用。为什么当我在电脑上或服务器上时，I
ruby - 抓取，我的查询参数错误
我在使用 Ruby 和 Mechanize 将 POST 查询传递到站点的网站上。访问站点的查询基于 firebug，如下所示 param.PrdNo=-1¶m.Type=Prop¶m
ruby - 抓取，跟随分页链接
我正在尝试抓取一个具有多个页面结果的网站，例如“1、2、3、4、5...”。每个分页号都是到另一个页面的链接，我需要抓取每个页面。到目前为止，我想出了这个: while lien = page.l
c# - 抓取 htmlagilitypack
我正在使用 HtmlAgilityPack 在 C# Asp.Net 中执行 Scraping，到目前为止，我在从多个 Web 执行 Scratch 时没有遇到问题，但是，尝试弹出以下代码时出现错误
javascript - 抓取 :after content
如果我有一个 css 文件做这样的事情 #foo:after{content:"bar;} ，有没有办法用 javascript 获取 :after 的内容？获取父元素的内容只返回 #foo 元素的内
javascript - 客户端页面调用/抓取？
问题是这样的: 我有一个 Web 应用程序 - 一个经常更改的通知系统 - 在一系列本地计算机上运行。该应用程序每隔几秒刷新一次以显示新信息。计算机仅显示信息，没有键盘或任何输入设备。问题是，如果与
c# - 抓取/模拟浏览帮助
我想制作一个程序来模拟用户浏览网站和点击链接。必须启用 Cookie 和 javascript。我已经在 python 中成功地做到了这一点，但我想把它写成一种可编译的语言(python ide 不会
python - 抓取/忽略空项目
我制作了这个小机器人，它通过搜索参数列表进行处理。它工作正常，直到页面上有几个结果: product_prices_euros 给出了一半为空的项目列表。因此，当我与 product_prices_c
python - 查找并统计网站上单词的匹配项 - 抓取
我需要找到一个单词的匹配项，例如: 在网上找到所有单词“学习”https://www.georgetown.edu/(结果:4个字)(您可以看到它按CTRL + F并搜索) 我有我的 Python 代
python - 抓取\蜘蛛防护
有一个站点\资源提供一些一般统计信息以及搜索工具的界面。这种搜索操作成本高昂，因此我想限制频繁且连续(即自动)的搜索请求(来自人，而不是来自搜索引擎)。我相信有很多现有的技术和框架可以执行一些情报抓
Python HTML 抓取
这并不是真正的抓取，我只是想在网页中找到类具有特定值的 URL。例如: 我想获取 href 值。关于如何做到这一点的任何想法？也许正则表达式？你能发布一些示例代码吗？我猜 html 抓取库，比如 B
python - 如何从无限滚动网站上抓取所有内容？抓取
我正在使用 scrapy。我正在使用的网站具有无限滚动功能。该网站有很多帖子，但我只抓取了 13 个。如何抓取剩余的帖子？这是我的代码: class exampleSpider(scrapy.
python - 无法通过 BeautifulSoup 抓取
我正在尝试从这个 website 中抓取图像和新闻 url .我定义的标签是 root_tag=["div", {"class":"ngp_col ngp_col-bottom-gutter-2 ng
java - 抓取 Cloudflare 站点
关闭。这个问题需要更多focused .它目前不接受答案。想改进这个问题吗？更新问题，使其只关注一个问题 editing this post . 关闭上个月。 Improve this ques
python - 对本地文件夹中的所有文件重复 BeautifulSoup 抓取
我在几个文件夹中有数千个 html 文件，我想从评论中提取数据并将其放入 csv 文件中。这将允许我为项目格式化和清理它。例如，我在这个文件夹中有 640 个 html 文件: D:\My Web S
c# - 通过 VIEWSTATE 抓取
我在编写用于抓取网页的实用程序时遇到了一个问题。我正在发送 POST 请求来检索数据，我模仿我正在抓取的网络行为(根据使用 fiddler 收集的信息)。我已经能够自动替换我的 POST 中除 V
ajax - Yandex AJAX 抓取
对于 Googlebot 的 AJAX 抓取，我在我的网站中使用“_escaped_fragment_”参数。现在我查看了 Yandex 对我网站的搜索结果。我看到搜索结果中不存在 AJAX 响应
Ruby Mechanize 抓取 ResponseCodeError
我正在尝试抓取网站的所有结果页面，它可以工作，但有时脚本会停止并显示此错误: 502 => Net::HTTPBadGateway for https://website.com/id/12/ --
python - 为什么这个网站不能用 bs4 抓取？
我是一个学习网络爬虫的初学者，由于某种原因我无法爬网this地点。当我在 Chrome 中检查它时，代码看起来不错，但是当我用 BeautifulSoup 阅读它时，它不再是可刮的。汤提到“谷歌分析”

首页

博学

6Ren·AI

商城

javascript - VBA动态网页抓取Excel

Excel 可以找到并与在另一个屏幕上打开的 Excel 和 VB 进行对话的现有 IE 的屏幕截图以及我想要抓取的数据