gpt4 book ai didi

azure - LuceneNet 是如何工作的以及以下场景的实现可行性?

转载 作者:行者123 更新时间:2023-12-02 23:21:30 27 4
gpt4 key购买 nike

我是 LuceneNet 的新手..我应该说非常新。我心中有一些疑问,在阅读了大量相关资料后无法消除。嗯,我所处的场景是,我将拥有大量 PDF/文档/Excel/图像,以及包含相关数据的网页。系统中有各种类型的用户,其中一些可以访问特定的 PDF/文档,有些则不能。我将在希望部署应用程序的地方使用 Azure。因此,如果用户搜索某些内容,我只想向他显示那些他有权查看的结果。如果我使用 LuceneNet 可以做到吗?另外,我希望跟踪特定文档/URL 等的点击次数,以便它可以显示在大多数搜索等中。那么是否可以使用 LuceneNet 来实现这一点?如果我想索引 PDF/Doc/Docx/XSL/XSLX/PPT/PPTX 等文件和其中的数据,我需要使用什么东西。我应该如何通过 LuceneNet 存储数据(索引数据)?我的意思是我应该将它存储在 BLOB 存储中吗?值得推荐吗??我希望我的应用程序应该是可扩展的。 LuceneNet 会支持我吗?我可以拥有其辅助角色的多个实例吗?重新索引如何发生?重新索引是否会重新生成所有索引,如果是的话,在重新索引期间我将能够搜索吗?抱歉问了这么多问题,所有问题的顺序也可能不正确。但我是边记忆边问的。

最佳答案

首先,我会推荐一本名为“Lucene In Action”的书,它是针对 Java 的,但它是基于 Lucene 版本 3.0.3,这恰好是当前的 Lucene.NET 版本。API 是相同的,因此它是一个很棒的起始资源。

要回答...1)Lucene.NET中是否可以只显示授权记录?是的..你可以通过多种方式做到这一点。如果需要,您可以按用户分隔索引,或者您可以添加其他字段并始终将这些字段包含在搜索查询中。

2) 是的,您也可以在 Lucene 中跟踪点击(您可以保留点击日志并根据需要插入它们)

3) 如果您想索引 PDF、Docs、Docx...您需要提取文本。 Lucene 不会为你做这件事。因此您可以使用 Office Automation(对于 Word Docs..其免费 API)。 API 是基本的,但如果您想要更成熟/需要花钱的东西,请选择 AsPose(.NET 库,可以完全满足您的需要)

4) 有一个库可以为您抽象 AzureDirectory 并使用 blob 存储。我不推荐它,因为它不适用于:Lucene 3.0.3,存在稳定性问题,并且它使用较旧的存储客户端 API(2.0 之前的版本)。我将使用 Azure IaaS 虚拟机并将 Lucene 索引存储在磁盘上。如果需要,您可以随时扩展和添加更多磁盘,并对磁盘进行 strip 化。

5) 您应该只有一个 IndexWriter,但可以有多个索引搜索器。

6) 从 Lucene 2.9.x 开始,您可以进行“实时”搜索,您可以在其中更新索引,并且执行查询的搜索器可以在没有索引的情况下“近乎”实时地获取新数据完全投入/冲淡。

关于azure - LuceneNet 是如何工作的以及以下场景的实现可行性?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/13476364/

27 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com