django - Django Celery 任务中的 Elasticsearch 索引-6ren

django - Django Celery 任务中的 Elasticsearch 索引

转载作者：行者123 更新时间：2023-12-03 01:18:54

24

4

我正在构建一个 Django Web 应用程序来存储文档及其相关元数据。

大部分元数据将存储在底层 MySQL 数据库中，在 Elasticsearch 中索引 OCR 的文档文本以启用全文搜索。我已合并 django-elasticsearch-dsl连接和同步我的数据模型，因为我还在索引(因此，双重存储)我的模型中的一些其他字段。我曾考虑使用 Haystack ，但它缺乏对最新 Elasticsearch 版本的支持。

当通过应用程序的管理界面上传文档时，post_save 信号会自动触发 Celery异步后台任务来执行 OCR，并最终将提取的文本索引到 Elasticsearch。

看到我的模型中没有定义全文字段(并希望避免这样做，因为我不想在数据库中存储或搜索 CLOB)，我正在寻找更新的最佳实践我的 tasks.py 文件中的 Elasticsearch 文档。似乎没有办法使用 django-elasticseach-dsl 做到这一点(但也许我错了？)所以我想知道我是否应该这样做:

尝试使用姐妹 django-elasticsearch-dsl-drf 通过 REST 与 Elasticsearch 交互包裹。

通过使用更普通的 elasticsearch-dsl-py 更松散地将我的应用程序与 Elasticsearch 集成包(基于elasticsearch-py)。使用这种方法我会失去一些“奢侈”，因为我必须编写更多的集成代码，至少如果我想用信号连接我的模型。

有最佳实践吗？还是我没有考虑过的另一种方法？

更新 1:
在尝试实现@Nielk 的答案时，我能够将 OCR 文本(下面的 tasks.py 中的结果 =“test”)持久化到 ElasticSearch 中，但它也保留在 MySQL 数据库中。我仍然对如何将 Submission.rawtext 配置为 ElasticSearch 的通路感到困惑。

模型.py:

class Submission(models.Model):

  rawtext = models.TextField(null=True, blank=True)
  ...
  def type_to_string(self):
    return ""

文件.py:

@registry.register_document
class SubmissionDocument(Document)

  rawtext = fields.TextField(attr="type_to_string")

  def prepare_rawtext(self, instance):
    # self.rawtext = None
    # instance.rawtext = "test"

    return instance.rawtext

  ...

tasks.py(在提交模型 post_save 信号上调用):

  @shared_task
  def process_ocr(my_uuid)

    result = "test" # will ultimately be OCR'd text

    instance = Submission.objects.get(my_uuid=my_uuid)
    instance.rawtext = result
    instance.save()

更新 2(工作解决方案):

模型.py
类提交(模型。模型):

   @property
   def rawtext(self):
      if getattr(self, '_rawtext_local_change', False):
         return self._rawtext
      if not self.pk:
         return None
      from .documents import SubmissionDocument
      try:
         return SubmissionDocument.get(id=self.pk)._rawtext
      except:
         return None

   @rawtext.setter
   def rawtext(self, value):
      self._rawtext_local_change = True
      self._rawtext = value

文件.py

   @registry.register_document
   class SubmissionDocument(Document):

      rawtext = fields.TextField()

      def prepare_rawtext(self, instance):
         return instance.rawtext

任务.py

   @shared_task
   def process_ocr(my_uuid)

      result = "test" # will ultimately be OCR'd text

      # note that you must do a save on property fields, can't do an update
      instance = Submission.objects.get(my_uuid=my_uuid)
      instance.rawtext = result
      instance.save()

最佳答案

您可以在链接到您的模型的文档定义中添加额外字段(参见文档 https://django-elasticsearch-dsl.readthedocs.io/en/latest/fields.html#using-different-attributes-for-model-fields 中的字段 'type_to_field' ，并将其与 'prepare_xxx' 方法相结合，以在创建实例时初始化为空字符串，并更新时的当前值)
那会解决你的问题吗？

编辑 1 -
这就是我的意思:

模型.py

class Submission(models.Model):
    @property
    def rawtext(self):
        if getattr(self, '_rawtext_local_change ', False):
            return self._rawtext
        if not self.pk:
            return None
        from .documents import SubmissionDocument
        return SubmissionDocument.get(meta__id=self.pk).rawtext

    @property.setter
    def rawtext(self, value):
        self._rawtext_local_change = True
        self._rawtext = value

编辑 2 - 修正代码错字

关于django - Django Celery 任务中的 Elasticsearch 索引，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/61282288/

24

4

0

文章推荐： javascript - 根据AnalyserNode数据修改不透明度

文章推荐： sql - 使用Powershell将SQL Server实例添加到中央管理服务器组

文章推荐： powershell - 刷新 PowerShell DSC 资源

django - 在 Django+Django REST 中创建具有外键关系的嵌套资源
我对 Python-Django 和 web 开发还很陌生，我被困在这个使用 POST 创建新资源的特殊问题上。我正在为 REST API 使用 Django REST 框架，我正在尝试创建一个新资
django - 如何下载使用 Django 存储上传的 Django 媒体文件？
我已经使用 Django-storages 成功地将 Word 文档存储到 S3。 class Document(TitleSlugDescriptionModel, TimeStampedModel
django - 如何在给定 Django 模型对象或查询集的情况下使用 Django 代理模型
我有 2 个关于模型代理的问题，如何从模型对象创建代理对象？如何从模型查询集创建代理查询集？例如，假设我们定义了: from django.contrib.auth.models import
django - 从 Django 测试访问 Django 测试服务器
我想编写一个直接执行 HTTP 请求的单元测试(而不是使用 django.test.client.Client)。如果您好奇为什么 - 那是因为我想测试我从 Django 应用程序公开的 Thrif
django - 如何开始构建 django 网站以及 django 如何构建页面？
我为我的个人网站启动了一个 django 项目来学习 django。到目前为止，我已经将我的开发环境设置为我需要的一切，并遵循 this很棒的教程来创建一些基本的数据结构和模板。现在我想开始使用我之前
django - Python/Django django-registration 添加一个额外的字段
我已经阅读了很多关于如何在使用 Django 注册时添加额外字段的信息，例如 here 、 here 和 here 。代码片段是: forms.py(来自注册应用程序) class Registrat
django - Django:如何从每个 View 写入当前用户名(django)
我正在编写小型社交应用程序。功能之一是在网站标题中写入用户名。因此，例如，如果我登录并且我的名字是Oleg(用户名)，那么我应该看到: Hello, Oleg | Click to edit prof
django - 如何将 django-reversion 添加到使用 django 和 django-rest 框架开发的应用程序中
我有一个使用 Django 和 Django Rest 框架开发的应用程序。我想将 django-reversion 功能添加到我的应用程序中。我已经尝试过http://django-reversi
django - 可以在没有 Django 表单的情况下呈现 Django 表单字段吗？
我有一个简单的 HTML 表单，我没有使用 Django 表单，但现在我想添加一个选择。选择最容易创建为 Django ChoiceField (与通过循环等手动创建选择相反)，但是，如果没有在 D
django - 字符串中的 Django 外键和不带字符串的 Django 外键有什么区别？
我不明白为什么人们以两种方式编写外键，这样做的目的是什么？它们是相同还是不同？我注意到有些人这样写: author = models.ForeignKey(Author, on_delete=mod
django - 使用 Django 评论获取 Django 中评论最多的帖子
我想在我的 Django 应用程序中获取评论最多的十个帖子，但我做不到，因为我想不出合适的方法。我目前正在使用 django 评论框架，并且我已经看到使用 aggregate or annotate
django - Django 管理中日期字段的自定义过滤器，Django 1.2
这对于 Django 1.2 仍然有效吗？ Custom Filter in Django Admin on Django 1.3 or below 我已经尝试过，但管理类中的 list_filter
django - 在 Django 中使用模板变量和 django-compressor
问题在于，当 django-compressor 编译为 .js 文件的 CoffeeScript 文件中引用 {{ STATIC_URL }} 时，它无法正确加载。在我的 django 模板中，我
django - 在事件应用程序上将数据从一个 django 模型移动到另一个(django+south)
我正在尝试将一些字段从一个 django 模型移动到一个新模型。假设我有一个书籍模型: class Book(models.Model): title = models.CharField(max
django - 使用 Django 评论获取 Django 中评论最多的帖子
我想在我的 Django 应用程序中获取评论最多的十个帖子，但我做不到，因为我想不出合适的方法。我目前正在使用 django 评论框架，并且我已经看到使用 aggregate or annotate
django - 比较 django 权限并使用 django 规则
目前我正在寻找在 Django 中实现访问控制。我已经阅读了有关内置权限的内容，但它并不关心每个对象的基础。例如，我想要“只有创建者可以删除自己的项目”之类的权限。所以我读到了 django-guar
django - 如何将 Django 模型的一个字段的值设置为等于其他 Django 模型的其他字段
嗨，我正在将我的 Django 模型的一个字段的值设置为其他模型的另一个字段的值。这个值应该是动态变化的。这是我的第一个模型 class MainModel(AbstractBaseUser, Pe
django - 来自模型的初始表单数据 - Django
我正在尝试为我的模型创建一个编辑表单。我没有使用模型表单，因为根据模型类型，用户可以使用不同的表单。 (例如，其中一个表单有 Tinymce 小部件，而另一个没有。) 有没有什么方法可以使用模型设置表
django - Django 模板中的搜索字段
Django 模板中的搜索字段如何在类似于此图像的 Django 模板中创建搜索字段 http://asciicasts.com/system/photos/1204/original/E354I0
django - Django 如何知道用户是谁？
根据 Django documentation ，如果 Django 安装激活了 AuthenticationMiddleware，HttpRequest 对象有一个“user”属性代表当前登录的用户

首页

博学

6Ren·AI

商城

django - Django Celery 任务中的 Elasticsearch 索引