- mongodb - 在 MongoDB mapreduce 中,如何展平值对象?
- javascript - 对象传播与 Object.assign
- html - 输入类型 ="submit"Vs 按钮标签它们可以互换吗?
- sql - 使用 MongoDB 而不是 MS SQL Server 的优缺点
我正在尝试用 python 编写一个网络代理。目标是访问像这样的网址: http://proxyurl/http://anothersite.com/
并查看 http://anothersite.com
的内容就像你平时一样。通过滥用 requests 库,我已经取得了不错的成绩,但这并不是 requests 框架的真正预期用途。我用 twisted 写了代理之前,但我不知道如何将它与我正在尝试做的事情联系起来。这是我目前所处的位置......
import os
import urlparse
import requests
import tornado.ioloop
import tornado.web
from tornado import template
ROOT = os.path.dirname(os.path.abspath(__file__))
path = lambda *a: os.path.join(ROOT, *a)
loader = template.Loader(path(ROOT, 'templates'))
class ProxyHandler(tornado.web.RequestHandler):
def get(self, slug):
if slug.startswith("http://") or slug.startswith("https://"):
if self.get_argument("start", None) == "true":
parsed = urlparse.urlparse(slug)
self.set_cookie("scheme", value=parsed.scheme)
self.set_cookie("netloc", value=parsed.netloc)
self.set_cookie("urlpath", value=parsed.path)
#external resource
else:
response = requests.get(slug)
headers = response.headers
if 'content-type' in headers:
self.set_header('Content-type', headers['content-type'])
if 'length' in headers:
self.set_header('length', headers['length'])
for block in response.iter_content(1024):
self.write(block)
self.finish()
return
else:
#absolute
if slug.startswith('/'):
slug = "{scheme}://{netloc}{original_slug}".format(
scheme=self.get_cookie('scheme'),
netloc=self.get_cookie('netloc'),
original_slug=slug,
)
#relative
else:
slug = "{scheme}://{netloc}{path}{original_slug}".format(
scheme=self.get_cookie('scheme'),
netloc=self.get_cookie('netloc'),
path=self.get_cookie('urlpath'),
original_slug=slug,
)
response = requests.get(slug)
#get the headers
headers = response.headers
#get doctype
doctype = None
if '<!doctype' in response.content.lower()[:9]:
doctype = response.content[:response.content.find('>')+1]
if 'content-type' in headers:
self.set_header('Content-type', headers['content-type'])
if 'length' in headers:
self.set_header('length', headers['length'])
self.write(response.content)
application = tornado.web.Application([
(r"/(.+)", ProxyHandler),
])
if __name__ == "__main__":
application.listen(8888)
tornado.ioloop.IOLoop.instance().start()
请注意,如果查询字符串中有 start=true,我会设置一个 cookie 来保留方案、netloc 和 urlpath。这样,然后命中代理的任何相对或绝对链接都使用该 cookie 来解析完整的 url。
使用此代码,如果您转到 http://localhost:8888/http://espn.com/?start=true
,您将看到 ESPN 的内容。但是,在以下站点上它根本不起作用:http://www.bottegaveneta.com/us/shop/ .我的问题是,最好的方法是什么?我目前的实现方式是稳健的,还是这样做有一些可怕的陷阱?如果它是正确的,为什么像我指出的那样某些网站根本不起作用?
感谢您的帮助。
最佳答案
我最近写了一个类似的网络应用程序。请注意,这是我的做法。我不是说你应该这样做。以下是我遇到的一些陷阱:
将属性值从相对更改为绝对
涉及的不仅仅是获取页面并将其呈现给客户。很多时候,您无法在没有任何错误的情况下代理网页。
Why are certain sites like the one I pointed out not working at all?
许多网页依赖于资源的相对路径,以便以格式良好的方式显示网页。比如这个图片标签:
<img src="/header.png" />
将导致客户端发出以下请求:
http://proxyurl/header.png
失败了。 'src' 值应转换为:
http://anothersite.com/header.png.
因此,您需要使用 BeautifulSoup 之类的内容来解析 HTML 文档。 ,遍历所有标签并检查以下属性:
'src', 'lowsrc', 'href'
并且相应地改变它们的值,这样标签就变成了:
<img src="http://anothersite.com/header.png" />
此方法适用于更多标签,而不仅仅是图像标签。 a、script、link、li 和 frame 是您应该更改的几个也是。
HTML 恶作剧
前面的方法应该能让你走得更远,但你还没有完成。
两者
<style type="text/css" media="all">@import "/stylesheet.css?version=120215094129002";</style>
和
<div style="position:absolute;right:8px;background-image:url('/Portals/_default/Skins/BE/images/top_img.gif');height:200px;width:427px;background-repeat:no-repeat;background-position:right top;" >
是使用 BeautifulSoup 难以访问和修改的代码示例.
在第一个示例中,有一个 css @Import 到一个相对 uri。第二个涉及内联 CSS 语句中的 'url()' 方法。
在我的情况下,我最终编写了糟糕的代码来手动修改这些值。您可能想为此使用正则表达式,但我不确定。
重定向
使用 Python-Requests 或 Urllib2,您可以轻松地自动跟踪重定向。只要记住保存新的(基本)uri 是什么;您将需要它来执行“将属性值从相对更改为绝对”操作。
您还需要处理“硬编码”重定向。比如这个:
<meta http-equiv="refresh" content="0;url=http://new-website.com/">
需要改成:
<meta http-equiv="refresh" content="0;url=http://proxyurl/http://new-website.com/">
基础标签
base tag指定文档中所有相对 URL 的基本 URL/目标。您可能想要更改该值。
终于完成了吗?
不。一些网站严重依赖 javascript 在屏幕上绘制内容。这些网站是最难代理的。我一直在考虑使用类似 PhantomJS 的东西或 Ghost获取和评估网页并将结果呈现给客户端。
也许我的source code能帮你。你可以以任何你想要的方式使用它。
关于python - 如何用 Python 编写 Web 代理,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/16524545/
我只想从客户端向服务器发送数组 adc_array=[w, x, y, z]。下面是客户端代码,而我的服务器是在只接受 json 的 python 中。编译代码时我没有收到任何错误,但收到 2 条警告
我是 lua 和 Node js 的新手,我正在尝试将我正在开发的移动应用程序连接到服务器。问题是它连接到服务器,但我尝试传递的数据丢失或无法到达服务器。对我正在做的事情有什么问题有什么想法吗? th
我在这个页面上工作 http://www.haskell.org/haskellwiki/99_questions/Solutions/4 我理解每个函数的含义,看到一个函数可以像这样以多种方式定义,
我目前正在尝试将数据写入 excel 以生成报告。我可以将数据写入 csv 文件,但它不会按照我想要的顺序出现在 excel 中。我需要数据在每列的最佳和最差适应性下打印,而不是全部打印在平均值下。这
所以,我正在做一个项目,现在我有一个问题,所以我想得到你的帮助:) 首先,我已经知道如何编写和读取 .txt 文件,但我想要的不仅仅是 x.hasNext()。 我想知道如何像 .ini 那样编写、读
我正在尝试编写一个函数,该函数将返回作为输入给出的任何数字的阶乘。现在,我的代码绝对是一团糟。请帮忙。 function factorialize(num) { for (var i=num, i
这个问题已经有答案了: Check variable equality against a list of values (16 个回答) 已关闭 4 年前。 有没有一种简洁或更好的方法来编写这个条件
我对 VR 完全陌生,正在 AFrame 中为一个类(class)项目开发 VR 太空射击游戏,并且想知道 AFrame 中是否有 TDD 的任何文档/标准。有人能指出我正确的方向吗? 最佳答案 几乎
我正在尝试创建一个 for 循环,它将重现以下功能代码块,但以一种更具吸引力的方式。这是与 Soundcould 小部件 API 实现一起使用的 here on stackoverflow $(doc
我有一个非常令人困惑的问题。我正在尝试更改属性文件中的属性,但它只是没有更改... 这是代码: package config; import java.io.FileNotFoundException
我对 VR 完全陌生,正在 AFrame 中为一个类(class)项目开发 VR 太空射击游戏,并且想知道 AFrame 中是否有 TDD 的任何文档/标准。有人能指出我正确的方向吗? 最佳答案 几乎
我正在开发一个用户模式(Ring3)代码级调试器。它还应支持.NET可执行文件的本机(x86)调试。基本上,我需要执行以下操作: 1).NET在隐身模式下加载某些模块,而没有LOAD_DLL_DEBU
我有一个列表,我知道有些项目是不必要打印的,我正在尝试通过 if 语句来做到这一点...但是它变得非常复杂,所以有没有什么方法可以在 if 语句中包含多个索引而无需打印重写整个声明。 看起来像这样的东
我很好奇以不同方式编写 if 语句是否会影响程序的速度和效率。所以,例如写一个这样的: bool isActive = true; bool isResponding = false; if (isA
我在搜索网站的源代码时找到了一种以另一种方式(我认为)编写 if 语句的方法。 代替: if(a)b; 或: a?b:''; 我读了: !a||b; 第三种方式和前两种方式一样吗?如果是,为什么我们要
我的数据采用以下格式(HashMap的列表) {TeamName=India, Name=Sachin, Score=170} {TeamName=India, Name=Sehwag, Score=
我目前正在完成 More JOIN operations sqlzoo 的教程,遇到了下面的代码作为#12 的答案: SELECT yr,COUNT(title) FROM movie JOIN ca
我正试图找到一种更好的方法来编写这段代码: def down_up(array, player) 7.downto(3).each do |row| 8.times do |col
出于某种原因,我的缓冲区中充满了乱码,我不确定为什么。我什至用十六进制编辑器检查了我的文件,以验证我的字符是否以 2 字节的 unicode 格式保存。我不确定出了什么问题。 [打开文件] fseek
阅读编码恐怖片时,我刚刚又遇到了 FizzBuzz。 原帖在这里:Coding Horror: Why Can't Programmers.. Program? 对于那些不知道的人:FizzBu
我是一名优秀的程序员,十分优秀!