python - Django Web 应用程序与 BeautifulSoup ，请求-6ren

python - Django Web 应用程序与 BeautifulSoup ，请求

转载作者：太空宇宙更新时间：2023-11-03 21:34:35

我希望有一个网站，当用户输入内容时，他们会获得该网站上的所有抓取数据 View 。

目前，这个 python3 代码通过 jupyter 笔记本工作正常。大家可以在jupyter笔记本上测试一下。但我想要以正确的方式用于用户界面。我知道 Django 可以与 python 代码集成，但我应该把这段代码放在哪里。是 models.py 吗？

from urllib.request import Request, urlopen as uReq 
from bs4 import BeautifulSoup as soup

def make_soup(website) :

    req =  Request(website,headers = {'User-Agent' : 'Mozilla/5.0'})
    uClient = uReq(req)
    page_html = uClient.read()
    uClient.close()
    page_soup = soup(page_html, 'html.parser')
    return page_soup

google_news_url = 'https://www.google.com.my/search?q={}&source=Int&tbm=nws'

def forge_url (q):
    return google_news_url.format(q.replace(' ','+'))

news_url = forge_url (input('Enter Search'))
website = make_soup(news_url)
headlines = website.findAll('h3')
n = 0
for item in headlines :
    top = item.a
    #print(top)
    #print()
    text_headlines = top.text
    print(text_headlines)
    print()
    n +=1

顺便说一句，我应该在views.py和模板中放置什么。谢谢;)

最佳答案

抓取是一项非常耗时的任务，

获取数据需要花费大量时间，处理数据则需要更多时间。

因此，为了使网站能够进行抓取，您必须定义一些后台任务来完成这项工作，而用户可以做其他事情或查看进程栏。

此外，并非所有网站都是服务器端呈现的，因此您无法通过请求或其他类似库获取页面数据。您可以使用selenium通过浏览器(Firefox和Chrome)打开页面，渲染整个页面，然后将源代码传递给BS等库以提取所需的内容。

所以我的建议是:

构建一个 View 来请求页面 URL，
创建一个或多个后台任务来完成繁重的工作(例如使用 celery)
然后在过程完成时将结果传递给用户。

您可以在这里找到命名库:

Selenium

Celery

关于python - Django Web 应用程序与 BeautifulSoup ，请求，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/53315990/

文章推荐： css - 垂直居中 div 内的元素

文章推荐： jquery - css- css 样式与另一个 css 文件冲突

文章推荐： javascript - 如何模拟点击显示:none on hover image (how to listen for any mouse click in a browser)

文章推荐：绝对初学者的Python编程: chapter 3 ERROR

django - 在 Django+Django REST 中创建具有外键关系的嵌套资源
我对 Python-Django 和 web 开发还很陌生，我被困在这个使用 POST 创建新资源的特殊问题上。我正在为 REST API 使用 Django REST 框架，我正在尝试创建一个新资

django - 如何下载使用 Django 存储上传的 Django 媒体文件？
我已经使用 Django-storages 成功地将 Word 文档存储到 S3。 class Document(TitleSlugDescriptionModel, TimeStampedModel

django - 如何在给定 Django 模型对象或查询集的情况下使用 Django 代理模型
我有 2 个关于模型代理的问题，如何从模型对象创建代理对象？如何从模型查询集创建代理查询集？例如，假设我们定义了: from django.contrib.auth.models import

django - 从 Django 测试访问 Django 测试服务器
我想编写一个直接执行 HTTP 请求的单元测试(而不是使用 django.test.client.Client)。如果您好奇为什么 - 那是因为我想测试我从 Django 应用程序公开的 Thrif

django - 如何开始构建 django 网站以及 django 如何构建页面？
我为我的个人网站启动了一个 django 项目来学习 django。到目前为止，我已经将我的开发环境设置为我需要的一切，并遵循 this很棒的教程来创建一些基本的数据结构和模板。现在我想开始使用我之前

django - Python/Django django-registration 添加一个额外的字段
我已经阅读了很多关于如何在使用 Django 注册时添加额外字段的信息，例如 here 、 here 和 here 。代码片段是: forms.py(来自注册应用程序) class Registrat

django - Django:如何从每个 View 写入当前用户名(django)
我正在编写小型社交应用程序。功能之一是在网站标题中写入用户名。因此，例如，如果我登录并且我的名字是Oleg(用户名)，那么我应该看到: Hello, Oleg | Click to edit prof

django - 如何将 django-reversion 添加到使用 django 和 django-rest 框架开发的应用程序中
我有一个使用 Django 和 Django Rest 框架开发的应用程序。我想将 django-reversion 功能添加到我的应用程序中。我已经尝试过http://django-reversi

django - 可以在没有 Django 表单的情况下呈现 Django 表单字段吗？
我有一个简单的 HTML 表单，我没有使用 Django 表单，但现在我想添加一个选择。选择最容易创建为 Django ChoiceField (与通过循环等手动创建选择相反)，但是，如果没有在 D

django - 字符串中的 Django 外键和不带字符串的 Django 外键有什么区别？
我不明白为什么人们以两种方式编写外键，这样做的目的是什么？它们是相同还是不同？我注意到有些人这样写: author = models.ForeignKey(Author, on_delete=mod

django - 使用 Django 评论获取 Django 中评论最多的帖子
我想在我的 Django 应用程序中获取评论最多的十个帖子，但我做不到，因为我想不出合适的方法。我目前正在使用 django 评论框架，并且我已经看到使用 aggregate or annotate

django - Django 管理中日期字段的自定义过滤器，Django 1.2
这对于 Django 1.2 仍然有效吗？ Custom Filter in Django Admin on Django 1.3 or below 我已经尝试过，但管理类中的 list_filter

django - 在 Django 中使用模板变量和 django-compressor
问题在于，当 django-compressor 编译为 .js 文件的 CoffeeScript 文件中引用 {{ STATIC_URL }} 时，它无法正确加载。在我的 django 模板中，我

django - 在事件应用程序上将数据从一个 django 模型移动到另一个(django+south)
我正在尝试将一些字段从一个 django 模型移动到一个新模型。假设我有一个书籍模型: class Book(models.Model): title = models.CharField(max

django - 使用 Django 评论获取 Django 中评论最多的帖子
我想在我的 Django 应用程序中获取评论最多的十个帖子，但我做不到，因为我想不出合适的方法。我目前正在使用 django 评论框架，并且我已经看到使用 aggregate or annotate

django - 比较 django 权限并使用 django 规则
目前我正在寻找在 Django 中实现访问控制。我已经阅读了有关内置权限的内容，但它并不关心每个对象的基础。例如，我想要“只有创建者可以删除自己的项目”之类的权限。所以我读到了 django-guar

django - 如何将 Django 模型的一个字段的值设置为等于其他 Django 模型的其他字段
嗨，我正在将我的 Django 模型的一个字段的值设置为其他模型的另一个字段的值。这个值应该是动态变化的。这是我的第一个模型 class MainModel(AbstractBaseUser, Pe

django - 来自模型的初始表单数据 - Django
我正在尝试为我的模型创建一个编辑表单。我没有使用模型表单，因为根据模型类型，用户可以使用不同的表单。 (例如，其中一个表单有 Tinymce 小部件，而另一个没有。) 有没有什么方法可以使用模型设置表

django - Django 模板中的搜索字段
Django 模板中的搜索字段如何在类似于此图像的 Django 模板中创建搜索字段 http://asciicasts.com/system/photos/1204/original/E354I0

django - Django 如何知道用户是谁？
根据 Django documentation ，如果 Django 安装激活了 AuthenticationMiddleware，HttpRequest 对象有一个“user”属性代表当前登录的用户

太空宇宙

个人简介
我是一名优秀的程序员,十分优秀！

作者热门文章

android - 多次调用 OnPrimaryClipChangedListener

android - 无法更新 RecyclerView 中的 TextView 字段

android.database.CursorIndexOutOfBoundsException : Index 0 requested, 光标大小为 0

android - 使用 AppCompat 时，我们是否需要明确指定其 UI 组件(Spinner、EditText)颜色

滴滴打车优惠券免费领取

全站热门文章

巧用mask属性创建一个纯CSS图标库

Java代码覆盖率super-jacoco

armmattermost

Vulnhub经典靶机：from_sqli_to_shell_i386入门靶机

【Rive】波动文字

Vscode实现应用qss样式表

DocforDevNow

干掉EasyExcel！FastExcel初体验

爬虫自动化脚本+AI赋能

快手后端面试，被面试官秒挂了！

首页

博学

6Ren·AI

商城

python - Django Web 应用程序与 BeautifulSoup ，请求