- html - 出于某种原因,IE8 对我的 Sass 文件中继承的 html5 CSS 不友好?
- JMeter 在响应断言中使用 span 标签的问题
- html - 在 :hover and :active? 上具有不同效果的 CSS 动画
- html - 相对于居中的 html 内容固定的 CSS 重复背景?
首先,我想我应该说我仍然是一个 Django/Python 菜鸟。我正在进行一个允许用户输入 URL 的项目,该网站从该页面中抓取内容并返回超过一定大小的图像和页面标题标签,以便用户可以选择他们想要在其上使用的图像轮廓。我假设这是一个非常标准的场景。我通过使用 Selenium( headless Chrome 浏览器)来获取目标页面内容,使用一些 python 来确定文件大小,然后我的 Django View 将其全部吐出到模板中。然后,我对其进行编码,以便用户选择的图像将被下载并存储在本地。
但是我严重怀疑它的可扩展性,它目前只是在本地运行,我非常担心如果有很多用户同时运行,它会如何应对。每次发出请求时,我都会启动 headless Chrome 浏览器,这听起来效率不高,我必须下载图像来确定它的大小,以便我可以决定它是否足够大。一个示例从我提交 URL 到向用户显示结果花了 12 秒,而通过 www.kit.com 输入相同的目标 URL(它们具有非常相似的网页抓取功能)花了 3 秒。
我没有提供任何代码,因为我的代码做了它应该做的事情,但我认为这种方法是不正确的。总结一下我想要的是:
允许用户输入 URL 并返回该页面中超过特定尺寸(宽度/高度)的所有图像(或仅返回这些图像的 URL)以及页面标题。
考虑到它将在许多用户之间同时运行,这是最有效的解决方案。
让它在 Django (2.0)/Python (3+) 环境中工作。
我并不完全反对使用来自第三方服务的 API(如果存在),但这将是我最不喜欢的选择。
任何帮助/指示将不胜感激。
最佳答案
您可以根据您的情况使用 2 个 python 解决方案:
1) BeautifulSoup ,和 here是如何使用它下载图像的一个很好的答案。您只需将其设为一个单独的函数并将 site
作为参数传递给它即可。但正如你所说,仅解析图像链接也很容易 - 取决于你需要的速度(显然,抓取文件,特别是当文件数量很大时,会比链接慢得多)。该工具仅用于解析和抓取页面内容。
2) Scrapy - 这是更强大的工具、框架,通过它你可以将你的蜘蛛连接到 Django 模型,使用它的 built-in 更有效地操作图像。图像管道。它具有许多功能,可以更加灵活地处理废弃的数据。我不确定您是否需要在您的项目中使用它,以及它在您的情况下是否强大。
另外,我的建议是在一些后台任务中运行蜘蛛,例如 Queue 或 Celery,并通过 AJAX 调用结果,因为解析内容可能需要一些时间 - 所以不要让用户等待响应。
附:在某些情况下,您甚至可以结合使用这两个工具:)
关于python - 在 Django/Python 中从网站抓取图像的有效方法,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/50250478/
我需要将文本放在 中在一个 Div 中,在另一个 Div 中,在另一个 Div 中。所以这是它的样子: #document Change PIN
奇怪的事情发生了。 我有一个基本的 html 代码。 html,头部, body 。(因为我收到了一些反对票,这里是完整的代码) 这是我的CSS: html { backgroun
我正在尝试将 Assets 中的一组图像加载到 UICollectionview 中存在的 ImageView 中,但每当我运行应用程序时它都会显示错误。而且也没有显示图像。 我在ViewDidLoa
我需要根据带参数的 perl 脚本的输出更改一些环境变量。在 tcsh 中,我可以使用别名命令来评估 perl 脚本的输出。 tcsh: alias setsdk 'eval `/localhome/
我使用 Windows 身份验证创建了一个新的 Blazor(服务器端)应用程序,并使用 IIS Express 运行它。它将显示一条消息“Hello Domain\User!”来自右上方的以下 Ra
这是我的方法 void login(Event event);我想知道 Kotlin 中应该如何 最佳答案 在 Kotlin 中通配符运算符是 * 。它指示编译器它是未知的,但一旦知道,就不会有其他类
看下面的代码 for story in book if story.title.length < 140 - var story
我正在尝试用 C 语言学习字符串处理。我写了一个程序,它存储了一些音乐轨道,并帮助用户检查他/她想到的歌曲是否存在于存储的轨道中。这是通过要求用户输入一串字符来完成的。然后程序使用 strstr()
我正在学习 sscanf 并遇到如下格式字符串: sscanf("%[^:]:%[^*=]%*[*=]%n",a,b,&c); 我理解 %[^:] 部分意味着扫描直到遇到 ':' 并将其分配给 a。:
def char_check(x,y): if (str(x) in y or x.find(y) > -1) or (str(y) in x or y.find(x) > -1):
我有一种情况,我想将文本文件中的现有行包含到一个新 block 中。 line 1 line 2 line in block line 3 line 4 应该变成 line 1 line 2 line
我有一个新项目,我正在尝试设置 Django 调试工具栏。首先,我尝试了快速设置,它只涉及将 'debug_toolbar' 添加到我的已安装应用程序列表中。有了这个,当我转到我的根 URL 时,调试
在 Matlab 中,如果我有一个函数 f,例如签名是 f(a,b,c),我可以创建一个只有一个变量 b 的函数,它将使用固定的 a=a1 和 c=c1 调用 f: g = @(b) f(a1, b,
我不明白为什么 ForEach 中的元素之间有多余的垂直间距在 VStack 里面在 ScrollView 里面使用 GeometryReader 时渲染自定义水平分隔线。 Scrol
我想知道,是否有关于何时使用 session 和 cookie 的指南或最佳实践? 什么应该和什么不应该存储在其中?谢谢! 最佳答案 这些文档很好地了解了 session cookie 的安全问题以及
我在 scipy/numpy 中有一个 Nx3 矩阵,我想用它制作一个 3 维条形图,其中 X 轴和 Y 轴由矩阵的第一列和第二列的值、高度确定每个条形的 是矩阵中的第三列,条形的数量由 N 确定。
假设我用两种不同的方式初始化信号量 sem_init(&randomsem,0,1) sem_init(&randomsem,0,0) 现在, sem_wait(&randomsem) 在这两种情况下
我怀疑该值如何存储在“WORD”中,因为 PStr 包含实际输出。? 既然Pstr中存储的是小写到大写的字母,那么在printf中如何将其给出为“WORD”。有人可以吗?解释一下? #include
我有一个 3x3 数组: var my_array = [[0,1,2], [3,4,5], [6,7,8]]; 并想获得它的第一个 2
我意识到您可以使用如下方式轻松检查焦点: var hasFocus = true; $(window).blur(function(){ hasFocus = false; }); $(win
我是一名优秀的程序员,十分优秀!