python - 使用 urllib2 节流-6ren

python - 使用 urllib2 节流

转载作者：太空狗更新时间：2023-10-29 18:20:50

27

4

使用 urllib2 时是否可以轻松限制 kbps？如果是，如果您能指导我使用任何代码示例或资源，我们将不胜感激。

最佳答案

urllib 模块中有urlretrieve(url, filename=None, reporthook=None, data=None) 函数。如果您将 reporthook-函数/对象实现为 token bucket ，或者一个漏桶，你有你的全局速率限制。

编辑: 经过仔细检查，我发现使用 reporthook 进行全局速率限制并不像我想象的那么容易。 reporthook 仅提供下载量和总大小，这些信息本身不足以用于 token 桶。解决它的一种方法是将最后下载的数量存储在每个速率限制器中，但使用全局 token 桶。

编辑 2:将两个代码合并为一个示例。

"""Rate limiters with shared token bucket."""

import os
import sys
import threading
import time
import urllib
import urlparse

class TokenBucket(object):
    """An implementation of the token bucket algorithm.
    source: http://code.activestate.com/recipes/511490/

    >>> bucket = TokenBucket(80, 0.5)
    >>> print bucket.consume(10)
    True
    >>> print bucket.consume(90)
    False
    """
    def __init__(self, tokens, fill_rate):
        """tokens is the total tokens in the bucket. fill_rate is the
        rate in tokens/second that the bucket will be refilled."""
        self.capacity = float(tokens)
        self._tokens = float(tokens)
        self.fill_rate = float(fill_rate)
        self.timestamp = time.time()
        self.lock = threading.RLock()

    def consume(self, tokens):
        """Consume tokens from the bucket. Returns 0 if there were
        sufficient tokens, otherwise the expected time until enough
        tokens become available."""
        self.lock.acquire()
        tokens = max(tokens,self.tokens)
        expected_time = (tokens - self.tokens) / self.fill_rate
        if expected_time <= 0:
            self._tokens -= tokens
        self.lock.release()
        return max(0,expected_time)

    @property
    def tokens(self):
        self.lock.acquire()
        if self._tokens < self.capacity:
            now = time.time()
            delta = self.fill_rate * (now - self.timestamp)
            self._tokens = min(self.capacity, self._tokens + delta)
            self.timestamp = now
        value = self._tokens
        self.lock.release()
        return value

class RateLimit(object):
    """Rate limit a url fetch.
    source: http://mail.python.org/pipermail/python-list/2008-January/472859.html
    (but mostly rewritten)
    """
    def __init__(self, bucket, filename):
        self.bucket = bucket
        self.last_update = 0
        self.last_downloaded_kb = 0

        self.filename = filename
        self.avg_rate = None

    def __call__(self, block_count, block_size, total_size):
        total_kb = total_size / 1024.

        downloaded_kb = (block_count * block_size) / 1024.
        just_downloaded = downloaded_kb - self.last_downloaded_kb
        self.last_downloaded_kb = downloaded_kb

        predicted_size = block_size/1024.

        wait_time = self.bucket.consume(predicted_size)
        while wait_time > 0:
            time.sleep(wait_time)
            wait_time = self.bucket.consume(predicted_size)

        now = time.time()
        delta = now - self.last_update
        if self.last_update != 0:
            if delta > 0:
                rate = just_downloaded / delta
                if self.avg_rate is not None:
                    rate = 0.9 * self.avg_rate + 0.1 * rate
                self.avg_rate = rate
            else:
                rate = self.avg_rate or 0.
            print "%20s: %4.1f%%, %5.1f KiB/s, %.1f/%.1f KiB" % (
                    self.filename, 100. * downloaded_kb / total_kb,
                    rate, downloaded_kb, total_kb,
                )
        self.last_update = now


def main():
    """Fetch the contents of urls"""
    if len(sys.argv) < 4:
        print 'Syntax: %s rate url1 url2 ...' % sys.argv[0]
        raise SystemExit(1)
    rate_limit  = float(sys.argv[1])
    urls = sys.argv[2:]
    bucket = TokenBucket(10*rate_limit, rate_limit)

    print "rate limit = %.1f" % (rate_limit,)

    threads = []
    for url in urls:
        path = urlparse.urlparse(url,'http')[2]
        filename = os.path.basename(path)
        print 'Downloading "%s" to "%s"...' % (url,filename)
        rate_limiter = RateLimit(bucket, filename)
        t = threading.Thread(
            target=urllib.urlretrieve,
            args=(url, filename, rate_limiter))
        t.start()
        threads.append(t)

    for t in threads:
        t.join()

    print 'All downloads finished'

if __name__ == "__main__":
    main()

关于python - 使用 urllib2 节流，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/456649/

27

4

0

文章推荐： rest - Angular2 REST API

文章推荐： c# - EWS : How to update IsRead property of an EmailMessage

文章推荐： python - 拦截 Python 中的切片操作

文章推荐： c# - 如何将此 XOR 加密函数从 Delphi 转换为 C#？

ios - 尝试插入第 3 节，但更新后只有 3 节
我的 Tableview 有 N 个部分，其中 0,1 个部分是固定的。永远不会从 TableView 中删除。但从第2节开始到第N节，可以删除或插入。从第 2 部分到 N 部分 -> 每个部分也有行
assembly - 节/段指令有多重要？
节/段指令有多重要？我注意到它们通常是可选的。另外，我注意到当您包含或不包含它们时，输出大小会发生变化。我正在使用NASM ，如果有帮助的话。最佳答案它们非常重要，因为如果将字符串保存在代码段中
ios - 如何从字典中检索Firestore数据并填充Tableview行/节？
我正在尝试使用已解析并存储在字典中的Firestore数据填充tableview的Sections and Rows，看起来像这样... dataDict = ["Monday": ["Chest",
jQuery:跳转到下一个<节>
所以这应该是相当基本的......我正在这样做，但我想要求一些不同的选择。一种选择是使用“平滑滚动”和 anchor 名称......但我发现这非常不一致。这是我的 HTML 结构:
css - 嵌套文章 "spill over"节
我尝试将 3 篇文章嵌套到一个部分中。为什么它们会溢出部分的边界？ CSS: article{ border-right:solid 1px grey; height:50%; width:30%;
html - 节 id 和类定义覆盖容器高度
早上好伙计们，这只是我在这里的第二个问题，所以请耐心等待我和我的最低要求: 我刚刚写了这篇冗长的消息，说明如何将 ID 和 class 命令放在 section 而不是容器中，以及为什么该部分突然覆
java - JAXB 编码 XMPP 节
我正在尝试使用以下代码段编码消息: JAXBContext jContext = JAXBContext.newInstance(Iq.class); Marshall
java - JAXB 编码 XMPP 节
我正在尝试使用以下代码段编码消息: JAXBContext jContext = JAXBContext.newInstance(Iq.class); Marshall
latex - 如何使章节*、节*和小节*出现在目录中
我需要生成一个 PDF 文档，其中我需要一些“章节”(连同其部分和小节)没有编号但仍包含在 ToC 中。这是我的硕士论文。我正在使用 book 文档类，因为我不喜欢 memoir 默认值。如果我使
java - 匹配 INI 节 block
我正在使用正则表达式来尝试匹配 INI 文件中的节 block 。我正在使用书中给出的食谱Regular Expressions Cookbook ，但它似乎对我不起作用。这是我正在使用的代码: f
linux - Linux 线程中的文件段/节/记录锁
我有一个多线程进程，其中文件由多个线程共享(读取和写入)。有没有什么办法可以让一个线程锁定一个文件段，使其他线程无法访问它？我尝试过fcntl(fd, F_SETLKW, &flock)，但是这个锁只
javascript - 如何避免在多个HTML文件中编写重复代码(使用局部/节/模板等)
Closed. This question needs to be more focused。它当前不接受答案。
java - JAXB 编码 XMPP 节
我正在尝试使用以下代码片段编码消息: JAXBContext jContext = JAXBContext.newInstance(Iq.class); Marshal
ios - Segue 始终不传递行的正确索引路径第 0 节
我使用的是分段 tableView。如果我单击 tableview，它总是将索引路径 0 传递给详细 View Controller 。如果我单击第二行，但它的 indexpath pass 总是传递
linux - Linux 线程中的文件段/节/记录锁
我有一个多线程进程，其中一个文件由多个线程共享(读取和写入)。有没有什么方法可以让一个线程锁定一个文件段，使其他线程无法访问它？我试过fcntl(fd, F_SETLKW, &flock)，但是这个锁
java - JAXB 编码 XMPP 节
我正在尝试使用以下代码片段编码消息: JAXBContext jContext = JAXBContext.newInstance(Iq.class); Marshal
python-sphinx - 在Sphinx中，如何在没有大量开销的情况下创建可链接的 "terminology"节？
我想创建一个“术语”部分，其中包含我正在使用的术语的定义，以便每次我在此术语部分中使用这些术语时，都会创建一个指向该定义的链接。目前，我能想到的最好的方法是: .. |flavor| replace
ibm-mq - 什么是 IBM MQ 节？
文档引用 configuring information with stanzas ，但什么是节？它只是配置子部分的一个花哨名称吗？最佳答案您是对的，在此上下文中，节是指 IBM MQ 配置文件
java - 使用 Smack 接收自定义 XMPP 节
我正在尝试在消息包中接收 XMPP 自定义节。例如， wololo haiooh ... 关键是我知道我会收到一个“custom_sta
Clojure Koan 第 8 节，#5
为什么这是有效的: (= '(:anything :goes :here) (filter (fn [x] true) '(:anything :goes :here))) 但不是这个？ (= (:a

首页

博学

6Ren·AI

商城

python - 使用 urllib2 节流