- ubuntu12.04环境下使用kvm ioctl接口实现最简单的虚拟机
- Ubuntu 通过无线网络安装Ubuntu Server启动系统后连接无线网络的方法
- 在Ubuntu上搭建网桥的方法
- ubuntu 虚拟机上网方式及相关配置详解
CFSDN坚持开源创造价值,我们致力于搭建一个资源共享平台,让每一个IT人在这里找到属于你的精彩世界.
这篇CFSDN的博客文章TP5框架使用QueryList采集框架爬小说操作示例由作者收集整理,如果你对这篇文章有兴趣,记得点赞哟.
本文实例讲述了TP5框架使用QueryList采集框架爬小说操作。分享给大家供大家参考,具体如下:
最近想写一个小说网站,就去搜资料,搜出来TP5可以使用QueryList采集框架去爬小说,这里我来给大家详解如何用QueryList去爬小说。 #首先应该下载TP5框架,然后在extend里面建立一个文件夹命名为QL,再去官网下载QueryList,然后把phpQuery.php 和 QueryList.php 两个文件放在QL文件夹下,如图:
##在QueryList.php里面加上命名空间:
1
2
3
4
5
6
7
|
namespace
QL;
require
‘phpQuery.php';
use
phpQuery,Exception,ReflectionClass;
use
Monolog\Logger;
use
Monolog\Handler\StreamHandler;
use
Iterator,Countable,ArrayAccess;
//使用phpQuuery接口
|
#准备工作做好了下来开始采集小说(我们这里以https://www.17k.com/这个网站的免费小说为例) 。
##先找到你要采集的小说的目录页面的url作为采集url 。
##再在url前面加上 view-source: 查看他的源码,找到包含所有章节url的class属性,写好采集规则,执行语句进行采集 。
##采集他的章节名和每一章节的url,因为url采集下来没有域名,需要用正则表达式加上https://www.17k.com 然后采用for循环去一个一个采集每一章节的内容 。
##最后再将采集到的章节名与章节内容存入数据库 。
直接上代码:
1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
40
41
42
43
44
|
<?php
namespace
app\index\Controller;
use
think\Controller;
use
QL\QueryList;
class
Xiaoshuo
extends
Controller
{
public
function
index()
{
//采集目标
//$url = 'https://www.17k.com/list/3032846.html?offset=';
$url
=
'https://www.17k.com/list/3041226.html?offset='
;
//采集规则
$rules
=
array
(
'title'
=>
array
(
'.ellipsis'
,
'text'
),
//获取书每个章节名
'link'
=>
array
(
'.Volume a'
,
'href'
,
'-.folding -copy -a'
),
//获取每个章节链接
);
//开始采集
$data
= QueryList::Query(
$url
,
$rules
)->data;
//var_dump($data);
//求数组长度
$j
=
count
(
$data
);
if
(
$data
)
{
for
(
$i
=0;
$i
<=
$j
-1;
$i
++)
{
$values
= [
'title'
=>
$data
[
$i
][
'title'
],
'link'
=>
$data
[
$i
+1][
'link'
]];
$_POST
[
'url'
]=
$data
[
$i
+1][
'link'
];
if
(!preg_match(
"/^(http|ftp):/"
,
$_POST
[
'url'
]))
//给链接加上域名头
{
$url1
=
'https://www.17k.com'
.
$_POST
[
'url'
];
}
$rules1
=
array
(
'novel'
=>
array
(
'.p'
,
'text'
,
'-li -a'
),
);
$data1
= QueryList::Query(
$url1
,
$rules1
)->data;
//var_dump($data1);
$values1
= [
'title'
=>
$data
[
$i
][
'title'
],
'novel'
=>
$data1
[0][
'novel'
]];
//将章节名、内容插入数据库
$data2
= \think\Db::name(
'novel6'
)->insert(
$values1
);
}
}
}
}
|
我们来打印一下他的章节名和章节内容:
。
注:1.class属性一定要找对 2.采集下来 $data 的第一个数组的link不是第一章的url,下一个才是第一章的,所以 d a t a [ data[" role="presentation" style="position: relative;"> data[ data[i+1][‘link'] 是他第i章的url 。
希望本文所述对大家基于ThinkPHP框架的PHP程序设计有所帮助.
原文链接:https://blog.csdn.net/weixin_42580925/article/details/102688315 。
最后此篇关于TP5框架使用QueryList采集框架爬小说操作示例的文章就讲到这里了,如果你想了解更多关于TP5框架使用QueryList采集框架爬小说操作示例的内容请搜索CFSDN的文章或继续浏览相关文章,希望大家以后支持我的博客! 。
这个问题在这里已经有了答案: 关闭 11 年前。 Possible Duplicate: Sample data for IPv6? 除了 wireshark 在其网站上提供的内容之外,是否有可以下
我正在寻找可以集成到现有应用程序中并使用多拖放功能的示例或任何现成的解决方案。我在互联网上找到的大多数解决方案在将多个项目从 ListBox 等控件拖放到另一个 ListBox 时效果不佳。谁能指出我
我是 GATE Embedded 的新手,我尝试了简单的示例并得到了 NoClassDefFoundError。首先我会解释我尝试了什么 在 D:\project\gate-7.0 中下载并提取 Ga
是否有像 Eclipse 中的 SWT 示例那样的多合一 JFace 控件示例?搜索(在 stackoverflow.com 上使用谷歌搜索和搜索)对我没有帮助。 如果它是一个独立的应用程序或 ecl
我找不到任何可以清楚地解释如何通过 .net API(特别是 c#)使用谷歌计算引擎的内容。有没有人可以指点我什么? 附言我知道 API 引用 ( https://developers.google.
最近在做公司的一个项目时,客户需要我们定时获取他们矩阵系统的数据。在与客户进行对接时,提到他们的接口使用的目前不常用的BASIC 认证。天呢,它好不安全,容易被不法人监听,咋还在使用呀。但是没办法呀,
最近在做公司的一个项目时,客户需要我们定时获取他们矩阵系统的数据。在与客户进行对接时,提到他们的接口使用的目前不常用的BASIC 认证。天呢,它好不安全,容易被不法人监听,咋还在使用呀。但是没办法呀,
我正在尝试为我的应用程序设计配置文件格式并选择了 YAML。但是,这(显然)意味着我需要能够定义、解析和验证正确的 YAML 语法! 在配置文件中,必须有一个名为 widgets 的集合/序列。 .这
你能给我一个使用 pysmb 库连接到一些 samba 服务器的例子吗?我读过有类 smb.SMBConnection.SMBConnection(用户名、密码、my_name、remote_name
linux服务器默认通过22端口用ssh协议登录,这种不安全。今天想做限制,即允许部分来源ip连接服务器。 案例目标:通过iptables规则限制对linux服务器的登录。 处理方法:编
我一直在寻找任何 PostProjectAnalysisTask 工作代码示例,但没有看。 This页面指出 HipChat plugin使用这个钩子(Hook),但在我看来它仍然使用遗留的 Po
我发现了 GWT 的 CustomScrollPanel 以及如何自定义滚动条,但我找不到任何示例或如何设置它。是否有任何示例显示正在使用的自定义滚动条? 最佳答案 这是自定义 native 滚动条的
我正在尝试开发一个 Backbone Marionette 应用程序,我需要知道如何以最佳方式执行 CRUD(创建、读取、更新和销毁)操作。我找不到任何解释这一点的资源(仅适用于 Backbone)。
关闭。这个问题需要details or clarity .它目前不接受答案。 想改进这个问题?通过 editing this post 添加详细信息并澄清问题. 去年关闭。 Improve this
我需要一个提交多个单独请求的 django 表单,如果没有大量定制,我找不到如何做到这一点的示例。即,假设有一个汽车维修店使用的表格。该表格将列出商店能够进行的所有可能的维修,并且用户将选择他们想要进
我有一个 Multi-Tenancy 应用程序。然而,这个相同的应用程序有 liquibase。我需要在我的所有数据源中运行 liquibase,但是我不能使用这个 Bean。 我的应用程序.yml
我了解有关单元测试的一般思想,并已在系统中发生复杂交互的场景中使用它,但我仍然对所有这些原则结合在一起有疑问。 我们被警告不要测试框架或数据库。好的 UI 设计不适合非人工测试。 MVC 框架不包括一
我正在使用 docjure并且它的 select-columns 函数需要一个列映射。我想获取所有列而无需手动指定。 如何将以下内容生成为惰性无限向量序列 [:A :B :C :D :E ... :A
$condition使用说明和 $param在 findByAttributes在 Yii 在大多数情况下,这就是我使用 findByAttributes 的方式 Person::model()->f
我在 Ubuntu 11.10 上安装了 qtcreator sudo apt-get install qtcreator 安装的版本有:QT Creator 2.2.1、QT 4.7.3 当我启动
我是一名优秀的程序员,十分优秀!