gpt4 book ai didi

c# - 在 C# 中为信息检索应用程序编写倒排索引

转载 作者:太空狗 更新时间:2023-10-29 18:33:35 26 4
gpt4 key购买 nike

我正在编写一个内部应用程序,其中包含多条文本信息以及关于这些文本的大量数据。这些数据将按条目顺序保存在数据库(SQL Server,尽管这可能会改变)中。

我希望能够搜索这些信息中最相关的信息,其中最相关的信息位于顶部。我最初考虑使用 SQL Server 全文搜索,但它不能像我希望的那样灵活地满足我的其他需求,因此我似乎需要为此开发自己的解决方案。

据我了解,需要的是 inverted index ,然后根据持有的附加信息的结果恢复和修改所述倒排索引的内容(尽管现在这可以留到以后再说,因为我只想倒排索引从数据库中索引主要文本提供的表格/字符串)。

我在 Java 中使用 Hashtable 编写这段代码时遇到了一些问题,其中键作为单词,值作为单词出现的列表,但老实说,我对 C# 还是很陌生,并且只有在处理信息时才真正使用 DataSets 和 DataTables 之类的东西。如果需要,我会在清除这台笔记本电脑的病毒后尽快上传 Java 代码。

如果给定一组来自​​表或字符串列表的条目,如何在 C# 中创建一个倒排索引,最好将其保存到 DataSet/DataTable 中?

编辑: 我忘了说我已经尝试过 Lucene 和 Nutch,但需要我自己的解决方案,因为修改 Lucene 以满足我的需要比编写倒排索引花费的时间要长得多。我将处理大量元数据,这些元数据在基本倒排索引完成后也需要处理,所以我现在需要的只是使用倒排索引在一个区域上进行基本的全文搜索。最后,处理倒排索引并不是我每天都要做的事情,所以尝试一下它会很棒。

最佳答案

以下是我过去在 C# 中成功使用的一种方法的粗略概述:

 struct WordInfo
{
public int position;
public int fieldID;
}

Dictionary<string,List<WordInfo>> invertedIndex=new Dictionary<string,List<WordInfo>>();

public void BuildIndex()
{
foreach (int fieldID in GetDatabaseFieldIDS())
{
string textField=GetDatabaseTextFieldForID(fieldID);

string word;

int position=0;

while(GetNextWord(textField,out word,ref position)==true)
{
WordInfo wi=new WordInfo();

if (invertedIndex.TryGetValue(word,out wi)==false)
{
invertedIndex.Add(word,new List<WordInfo>());
}

wi.Position=position;
wi.fieldID=fieldID;
invertedIndex[word].Add(wi);

}

}
}

注意事项:

GetNextWord() 遍历字段并返回下一个单词和位置。要实现它,请查看使用 string.IndexOf() 和 char 字符类型检查方法(IsAlpha 等)。

GetDatabaseTextFieldForID() 和 GetDatabaseFieldIDS() 不言自明,按需实现。

关于c# - 在 C# 中为信息检索应用程序编写倒排索引,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/2110142/

26 4 0
Copyright 2021 - 2024 cfsdn All Rights Reserved 蜀ICP备2022000587号
广告合作:1813099741@qq.com 6ren.com