- ubuntu12.04环境下使用kvm ioctl接口实现最简单的虚拟机
- Ubuntu 通过无线网络安装Ubuntu Server启动系统后连接无线网络的方法
- 在Ubuntu上搭建网桥的方法
- ubuntu 虚拟机上网方式及相关配置详解
CFSDN坚持开源创造价值,我们致力于搭建一个资源共享平台,让每一个IT人在这里找到属于你的精彩世界.
这篇CFSDN的博客文章Python爬虫工程师面试问题总结由作者收集整理,如果你对这篇文章有兴趣,记得点赞哟.
注:答案一般在网上都能够找到.
1.对if __name__ == 'main'的理解陈述 。
2.python是如何进行内存管理的?
3.请写出一段Python代码实现删除一个list里面的重复元素 。
4.Python里面如何拷贝一个对象?(赋值,浅拷贝,深拷贝的区别) 。
5.介绍一下except的用法和作用?
6.Python中__new__与__init__方法的区别 。
7.常用的网络数据爬取方法 。
8.遇到过得反爬虫策略以及解决方法 。
9.urllib 和 urllib2 的区别 。
10.设计一个基于session登录验证的爬虫方案 。
11.列举网络爬虫所用到的网络数据包,解析包 。
12.熟悉的爬虫框架 。
13.Python在服务器的部署流程,以及环境隔离 。
14.Django 和 Flask 的相同点与不同点,如何进行选择?
15.写一个Python中的单例模式 。
16.Linux部署服务脚本命令(包括启动和停止的shell脚本) 。
17.你用过多线程和异步嘛?除此之外你还用过什么方法来提高爬虫效率?
18.POST 与 GET的区别 。
1)对if __name__ == 'main'的理解陈述 。
__name__是当前模块名,当模块被直接运行时模块名为__main__,也就是当前的模块,当模块被导入时,模块名就不是__main__,即代码将不会执行.
2)python是如何进行内存管理的?
a、对象的引用计数机制 python内部使用引用计数,来保持追踪内存中的对象,Python内部记录了对象有多少个引用,即引用计数,当对象被创建时就创建了一个引用计数,当对象不再需要时,这个对象的引用计数为0时,它被垃圾回收.
b、垃圾回收 。
1>当一个对象的引用计数归零时,它将被垃圾收集机制处理掉.
2>当两个对象a和b相互引用时,del语句可以减少a和b的引用计数,并销毁用于引用底层对象 的名称。然而由于每个对象都包含一个对其他对象的应用,因此引用计数不会归零,对象也不会销毁。(从而导致内存泄露)。为解决这一问题,解释器会定期执行一个循环检测器,搜索不可访问对象的循环并删除它们.
c、内存池机制 。
Python提供了对内存的垃圾收集机制,但是它将不用的内存放到内存池而不是返回给操作系统.
1>Pymalloc机制。为了加速Python的执行效率,Python引入了一个内存池机制,用于管理 对小块内存的申请和释放.
2>Python中所有小于256个字节的对象都使用pymalloc实现的分配器,而大的对象则使用 系统的malloc.
3>对于Python对象,如整数,浮点数和List,都有其独立的私有内存池,对象间不共享他们的内存池。也就是说如果你分配又释放了大量的整数,用于缓存这些整数的内存就不能再分配给浮点数.
3)请写出一段Python代码实现删除一个list里面的重复元素 。
1
2
3
4
5
6
7
8
9
|
# 1.使用set函数
list
=
[
1
,
3
,
4
,
5
,
51
,
2
,
3
]
set
(
list
)
# 2.使用字典函数,
>>> a
=
[
1
,
2
,
4
,
2
,
4
,
5
,
6
,
5
,
7
,
8
,
9
,
0
]
>>> b
=
{}
>>> b
=
b.fromkeys(a)
>>> c
=
list
(b.keys())
>>> c
|
4)Python里面如何拷贝一个对象?(赋值,浅拷贝,深拷贝的区别) 。
赋值(=),就是创建了对象的一个新的引用,修改其中任意一个变量都会影响到另一个.
浅拷贝:创建一个新的对象,但它包含的是对原始对象中包含项的引用(如果用引用的方式修改其中一个对象,另外一个也会修改改变){1,完全切片方法;2,工厂函数,如list();3,copy模块的copy()函数} 。
深拷贝:创建一个新的对象,并且递归的复制它所包含的对象(修改其中一个,另外一个不会改变){copy模块的deep.deepcopy()函数} 。
5)介绍一下except的用法和作用?
try…except…except…else… 。
执行try下的语句,如果引发异常,则执行过程会跳到except语句。对每个except分支顺序尝试执行,如果引发的异常与except中的异常组匹配,执行相应的语句。如果所有的except都不匹配,则异常会传递到下一个调用本代码的最高层try代码中.
try下的语句正常执行,则执行else块代码。如果发生异常,就不会执行如果存在finally语句,最后总是会执行.
6)Python中__new__与__init__方法的区别 。
__new__:它是创建对象时调用,会返回当前对象的一个实例,可以用__new__来实现单例 。
__init__:它是创建对象后调用,对当前对象的一些实例初始化,无返回值 。
7)常用的网络数据爬取方法 。
8)遇到过得反爬虫策略以及解决方法 。
1.通过headers反爬虫 。
2.基于用户行为的发爬虫:(同一IP短时间内访问的频率) 。
3.动态网页反爬虫(通过ajax请求数据,或者通过JavaScript生成) 。
4.对部分数据进行加密处理的(数据是乱码) 。
解决方法:
对于基本网页的抓取可以自定义headers,添加headers的数据 。
使用多个代理ip进行抓取或者设置抓取的频率降低一些,动态网页的可以使用selenium + phantomjs 进行抓取 。
对部分数据进行加密的,可以使用selenium进行截图,使用python自带的pytesseract库进行识别,但是比较慢最直接的方法是找到加密的方法进行逆向推理.
9)urllib 和 urllib2 的区别 。
urllib 和urllib2都是接受URL请求的相关模块,但是urllib2可以接受一个Request类的实例来设置URL请求的headers,urllib仅可以接受URL。urllib不可以伪装你的User-Agent字符串.
urllib提供urlencode()方法用来GET查询字符串的产生,而urllib2没有。这是为何urllib常和urllib2一起使用的原因.
10)设计一个基于session登录验证的爬虫方案 。
11)列举网络爬虫所用到的网络数据包,解析包 。
网络数据包 urllib、urllib2、requests 。
解析包 re、xpath、beautiful soup、lxml 。
12)熟悉的爬虫框架 。
Scrapy框架 根据自己的实际情况回答 。
13)Python在服务器的部署流程,以及环境隔离 。
14)Django 和 Flask 的相同点与不同点,如何进行选择?
15)写一个Python中的单例模式 。
1
2
3
4
5
6
7
8
9
10
11
12
|
class
Singleton(
object
):
_instance
=
None
def
__new__(
cls
,
*
args,
*
*
kw):
if
not
cls
._instance:
cls
._instance
=
super
(Singleton,
cls
).__new__(
cls
,
*
args,
*
*
kw)
return
cls
._instance
class
MyClass(Singleton):
a
=
1
one
=
MyClass()
two
=
MyClass()
id
(one)
=
id
(two)
>>>
True
|
16)Linux部署服务脚本命令(包括启动和停止的shell脚本) 。
17)你用过多线程和异步嘛?除此之外你还用过什么方法来提高爬虫效率?
18)POST与 GET的区别 。
19)什么是lambda函数?它有什么好处?
lambda 表达式,通常是在需要一个函数,但是又不想费神去命名一个函数的场合下使用,也就是指匿名函数 。
lambda函数:首要用途是指点短小的回调函数 。
1
2
3
|
lambda
[arguments]:expression
>>> a
=
lambdax,y:x
+
y
>>> a(
3
,
11
)
|
原文链接:https://segmentfault.com/a/1190000013874845 。
最后此篇关于Python爬虫工程师面试问题总结的文章就讲到这里了,如果你想了解更多关于Python爬虫工程师面试问题总结的内容请搜索CFSDN的文章或继续浏览相关文章,希望大家以后支持我的博客! 。
关闭。这个问题是off-topic .它目前不接受答案。 想要改进这个问题? Update the question所以它是on-topic用于堆栈溢出。 关闭 12 年前。 Improve thi
我有一个动态网格,其中的数据功能需要正常工作,这样我才能逐步复制网格中的数据。假设在第 5 行中,我输入 10,则从第 6 行开始的后续行应从 11 开始读取,依此类推。 如果我转到空白的第一行并输入
我有一个关于我的按钮消失的问题 我已经把一个图像作为我的按钮 用这个函数动画 function example_animate(px) { $('#cont
我有一个具有 Facebook 连接和经典用户名/密码登录的网站。目前,如果用户单击 facebook_connect 按钮,系统即可运行。但是,我想将现有帐户链接到 facebook,因为用户可以选
我有一个正在为 iOS 开发的应用程序,该应用程序执行以下操作 加载和设置注释并启动核心定位和缩放到位置。 map 上有很多注释,从数据加载不会花很长时间,但将它们实际渲染到 map 上需要一段时间。
我被推荐使用 Heroku for Ruby on Rails 托管,到目前为止,我认为我真的会喜欢它。只是想知道是否有人可以帮助我找出问题所在。 我按照那里的说明在该网站上创建应用程序,创建并提交
我看过很多关于 SSL 错误的帖子和信息,我自己也偶然发现了一个。 我正在尝试使用 GlobalSign CA BE 证书通过 Android WebView 访问网页,但出现了不可信错误。 对于大多
我想开始使用 OpenGL 3+ 和 4,但我在使用 Glew 时遇到了问题。我试图将 glew32.lib 包含在附加依赖项中,并且我已将库和 .dll 移动到主文件夹中,因此不应该有任何路径问题。
我已经盯着这两个下载页面的源代码看了一段时间,但我似乎找不到问题。 我有两个下载页面,一个 javascript 可以工作,一个没有。 工作:http://justupload.it/v/lfd7不是
我一直在使用 jQuery,只是尝试在单击链接时替换文本字段以及隐藏/显示内容项。它似乎在 IE 中工作得很好,但我似乎无法让它在 FF 中工作。 我的 jQuery: $(function() {
我正在尝试为 NDK 编译套接字库,但出现以下两个错误: error: 'close' was not declared in this scope 和 error: 'min' is not a m
我正在使用 Selenium 浏览器自动化框架测试网站。在测试过程中,我切换到特定的框架,我们将其称为“frame_1”。后来,我在 Select 类中使用了 deselectAll() 方法。不久之
我正在尝试通过 Python 创建到 Heroku PostgreSQL 数据库的连接。我将 Windows10 与 Python 3.6.8 和 PostgreSQL 9.6 一起使用。 我从“ht
我有一个包含 2 列的数据框,我想根据两列之间的比较创建第三列。 所以逻辑是:第 1 列 val = 3,第 2 列 val = 4,因此新列值什么都没有 第 1 列 val = 3,第 2 列 va
我想知道如何调试 iphone 5 中的 css 问题。 我尝试使用 firelite 插件。但是从纵向旋转到横向时,火石占据了整个屏幕。 有没有其他方法可以调试 iphone 5 中的 css 问题
所以我有点难以理解为什么这不起作用。我正在尝试替换我正在处理的示例站点上的类别复选框。我试图让它做以下事情:未选中时以一种方式出现,悬停时以另一种方式出现(选中或未选中)选中时以第三种方式出现(而不是
Javascript CSS 问题: 我正在使用一个文本框来写入一个 div。我使用以下 javascript 获取文本框来执行此操作: function process_input(){
你好,我很难理解 P、NP 和多项式时间缩减的主题。我试过在网上搜索它并问过我的一些 friend ,但我没有得到任何好的答案。 我想问一个关于这个话题的一般性问题: 设 A,B 为 P 中的语言(或
你好,我一直在研究 https://leetcode.com/problems/2-keys-keyboard/并想到了这个动态规划问题。 您从空白页上的“A”开始,完成后得到一个数字 n,页面上应该
我正在使用 Cocoapods 和 KIF 在 Xcode 服务器上运行持续集成。我已经成功地为一个项目设置了它来报告每次提交。我现在正在使用第二个项目并收到错误: Bot Issue: warnin
我是一名优秀的程序员,十分优秀!