gpt4 book ai didi

java - 如何使用 Lucene 索引包含嵌套属性的文档?

转载 作者:行者123 更新时间:2023-12-05 05:20:31 27 4
gpt4 key购买 nike

我会尝试将我的案例减少到必要的程度:我正在构建一个 Web 应用程序(使用 Spring),它带有一个搜索界面,可以让您搜索带注释/标记文本的语料库。在我的数据库 (MongoDB) 中,一个文档代表一本书的一页(总计约 8000 页)。

这是一个 JSON 格式的文档结构示例(为了简洁起见,我删除了很多元数据。此外,这很重要,“ token ”数组在大多数情况下包含多达 700 个对象。):

{
"_id" : ObjectId("5622c29eef86d3c2f23fd62c"),
"scanId" : "592ea208b6d108ee5ae63f79",
"volume" : "Volume I",
"chapters" : [
"Some Chapter Name"
],
"languages" : [
"English",
"German"
],
"tokens" : [
{
"form" : "The",
"index" : 0,
"tags" : [
"ART"
]
},
{
"form" : "house",
"index" : 1,
"tags" : [
"NN",
"NN_P"
]
},
{
"form" : "is",
"index" : 2,
"tags" : [
"V",
"CONJ_C"
]
}
]
}

所以你看我这里没有纯文本。我现在想用 Lucene 建立一个索引来快速搜索这个数据库。问题是我希望能够搜索某些词、它们的标签及其周围的上下文。就像“给我所有包含标记为“NN”的单词“House”后跟一个标记为“V”的单词的所有文档。我找不到使用原生 Lucene 功能来索引这些子结构的方法。

我尝试做的至少能够搜索单词及其标签如下:在我的 Lucene 索引中,文档不代表整个页面,而只代表带有标签的单词/标记。因此,一个索引文档看起来像这样(为了便于阅读,以 JSON 语法表示):

{
"token" : "house",
"tag" : "NN",
"tag" : "NN_P",
"index" : 1,
"pageId" : "5622c29eef86d3c2f23fd62c"
}

... 是的,Lucene 允许我多次使用一个字段。所以现在我可以搜索一个词及其标签,并通过它的 ID 获取对我的数据库中页面对象的引用。但这非常难看,原因有二:我现在有两个完全不同的文档表示(DB 和 Lucene 索引),要处理像我上面提到的那样的复杂查询,我必须查询单词和它的标签,然后进一步查询手动检查检索到的文档中命中的上下文。

所以我的问题是:有没有办法在 Lucene 中索引包含字段/属性的文档,这些字段/属性的值是嵌套对象,而嵌套对象又具有某些属性?

最佳答案

Is there a way to index documents in Lucene containing fields/properties whose values are nested objects that in turn have certain properties?

Elasticsearch 当然可以让您做到这一点。我认为可以在纯 lucene 中完成所有这些工作,但可能需要付出一些努力。

基本上,您需要使用“嵌套”查询:https://www.elastic.co/guide/en/elasticsearch/reference/current/query-dsl-nested-query.html

PUT /my_index
{
"mappings": {
"type1" : {
"properties" : {
"tokens" : {
"type" : "nested"
}
}
}
}
}

这告诉 ES 将该字段的内容索引为单独文档的列表,允许您使用“嵌套”查询单独查询它们:

GET my_index/_search
{
"query": {
"nested": {
"path": "tokens",
"query": {
"bool": {
"must": [
{ "match": { "tokens.form": "house" }},
{ "match": { "tokens.tags": "NN" }}
]
}
}
}
}
}

关于java - 如何使用 Lucene 索引包含嵌套属性的文档?,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/44496719/

27 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com