c# - 如何优化MySQL bool 全文搜索？ (或者用什么来替换它？)

c# - 如何优化MySQL bool 全文搜索？ (或者用什么来替换它？) - C#

转载作者：可可西里更新时间：2023-11-01 07:46:30

我有一个包含22000行的表，我使用布尔型全文搜索来找到我感兴趣的内容。我的问题是，我创建了一个“动态搜索感觉”，它由一个DataGridView组成，它在每个TextChanged事件之后都会刷新。因为您可能已经知道，在每次事件之后搜索插入的字符串需要很多时间。
我能做些什么来提高搜索速度？
欢迎提出任何建议！

最佳答案

首先，您应该认识到，rdbms对全文索引的支持是一种强制技术，这种技术旨在允许高效访问结构化数据，以处理非结构化文本。（是的，这只是我的看法。如果需要，我可以为它辩护，因为我非常了解这两种技术。；）
那么，如何提高搜索性能呢？
选项一-“完成任务的最佳工具”
在文档库中处理全文搜索的最佳方法是使用专门设计的技术，例如apache的SOLR（lucene）或err的Sphinx，sphinx。
出于以下明确的原因，我强烈建议采用这种方法。
选项二-预装结果
在构建基于文本的搜索解决方案时，通常的方法是将所有文档索引到一个可搜索的索引中，虽然这可能是最方便的方法，但并不是唯一的方法。
假设你正在搜索的内容可以很容易地量化为一组已知的规则，你可以提供更多的“引导”式搜索，而不是简单的无条件全文搜索。我的意思是，如果您的应用程序可能受益于将用户引导到结果，那么您可以将基于已知规则集的各种结果集预加载到它们自己的表中，从而减少要搜索的数据量。
如果您希望大多数用户都能从一组已知顺序的搜索词中受益，那么可以构建搜索ui来支持这些词。
因此，假设大多数用户都在寻找各种各样的汽车，您可以根据车型、年份、条件等提供预定义的搜索。您的搜索ui将被精心设计为一系列下拉菜单，以“引导”用户找到特定的结果。
或者，如果大多数搜索都是针对某个特定的主题（比如说“汽车”），则可以预先定义一个表，其中只包含先前确定与汽车相关的那些记录。
这两种方法都会减少要搜索的记录的数量，从而增加响应时间。
选项三-“自己滚”
如果您无法将外部搜索技术集成到项目中，并且预加载不是一个选项，那么仍然有很多方法可以大幅度提高搜索查询响应时间，但它们会根据您需要完成的任务和希望如何执行搜索而有所不同。
如果您希望用户使用单个关键字或短语以及它们之间的布尔关系进行搜索，那么您可以考虑构建自己的语料库“inverted index”。（这是mysql的布尔型全文搜索已经做的，但是自己做可以更好地控制搜索的速度和准确性。）
要从现有数据构建反向索引，请执行以下操作：
第一步。创建三个表

    // dict - a dictionary containing one row per unique word in corpus      create table dict (          id int primary key,        word varchar      )    // invert - an inverted_index to map words to records in corpus      create table invert (          id int primary key,        rec_id int,        word_id int      )    // stopwords - to contain words to ignore when indexing (like a, an, the, etc)    create table stopwords (       id int primary key,        word varchar      )

Note: This is just a sketch. You'll want to add indexes and constraints, etc. when you actually create these tables.

The stopwords table is used to reduce the size of your index to only those words that matter to users' expected queries. For example, it's rarely useful to index English articles, like 'a', 'an', 'the', since they do not contribute useful meaning to keyword searches.

Typically, you'll require a stopword list specifically crafted to the needs of your application. If you never expect users to include the terms 'red', 'white' or 'blue' in their queries or if these terms appear in every searchable record, you would want to add them to your stopword list.

See the note at the end of this message for instructions on using your own stopwords list in MySQL.

Step 2. Build the Inverted Index

To build an inverted index from your existing records, you'll need to (pseudo-code):

    foreach( word(w) in record(r) ) {      if(w is not in stopwords) {        if( w does not exist in dictionary) {          insert w to dictionary at w.id        }        insert (r.id, w.id) into inverted_index      }    }

Step 3. Query the Inverted Index Using SQL

This step really depends on how you expect queries to submitted to your index.

If queries are to be 'hard-coded', you can simply create the select statement yourself or if you need to support user-entered queries, you'll need to convert whatever query language you choose into an SQL statement (typically done using a simple parser).

Assuming you wish to retrieve all documents matching the logical query '(word1 AND word2) OR word3', a possible approach might be:

CREATE TEMPORARY TABLE temp_results ( rec_id int, count int ) AS 
    ( SELECT rec_id, COUNT(rec_id) AS count 
      FROM invert AS I, dict AS D 
      WHERE I.word_id=D.id AND (D.word='word1' OR D.word='word2') 
      GROUP BY I.rec_id 
      HAVING count=2
    ) 
    UNION (
      SELECT rec_id, 1 AS count 
      FROM invert AS I, dict AS D
      WHERE I.word_id=D.id AND D.word='word3'
    );

SELECT DISTINCT rec_id FROM temp_results;

DROP TABLE temp_results;

注：这只是我头上的第一次传球。我相信有更有效的方法可以将布尔查询表达式转换为有效的sql语句，欢迎提出任何改进建议。
要搜索短语，您需要在倒排索引中添加一个字段，以表示单词在其记录中出现的位置，并将其放入所选内容中。
最后，在添加新记录或删除旧记录时，需要更新反向索引。
最后一句话
“全文检索”属于一个非常大的研究领域，称为“信息检索”或“信息检索”，有许多关于这一主题的书籍，包括
Information Retrieval: Implementing and Evaluating Search Engines作者Stefan Büttcher、Charles L.A.Clarke和Gordon V.Cormack（2010年7月23日）
Search Engines: Information Retrieval in Practice作者布鲁斯·克罗夫特、唐纳德·梅茨勒和特雷弗·斯特罗曼（2009年2月16日）
Building Search Applications: Lucene, LingPipe, and Gate作者Manu Konchady（2008年6月）
查看亚马逊了解更多信息。
笔记
如何在mysql中使用自己的stopwords列表
在mysql中使用自己的stopword列表：
创建自己的stopWords列表，每行一个单词，并将其保存到服务器上的已知位置，如/usr/local/lib/ir/stopWords.txt
编辑my.cnf以添加或更新以下行：[mysqld]
ft_min_word_len=1
ft_max_word_len=40
停止字文件=/usr/local/lib/ir/stopwords.txt
它将法律单词的最小和最大长度设置为1和40，
分别告诉mysqld在哪里可以找到您自定义的停止词列表。
（注意：默认的ft_max_word_len是84，我认为这太过分了。）
并可能导致非实词字符串的运行被编入索引。）
重新启动mysqld
删除并重新创建所有与全文相关的索引

关于c# - 如何优化MySQL bool 全文搜索？ (或者用什么来替换它？) - C#，我们在Stack Overflow上找到一个类似的问题： https://stackoverflow.com/questions/6034976/

文章推荐： php - 衡量性能/优化网站时的有用提示？

文章推荐： mysql - nodejs 和非阻塞噩梦

文章推荐： android - 如何手动刷新谷歌地图？

文章推荐： php - 根据键的值将数组拆分成更小的数组？

mysql - 只有 Mysql OR mysql+sqlite OR mysql+自己的解决方案
目前我正在构建相当大的网络系统，我需要强大的 SQL 数据库解决方案。我选择 Mysql 而不是 Postgres，因为一些任务需要只读(MyISAM 引擎)而其他任务需要大量写入(InnoDB)。
mysql - Linux/mysql 将 mysql 表输出写入文件并保持 mysql 格式。
我在 mysql 中使用如下命令。当它显示表格数据时，它被格式化为一个非常干净的表格，间距均匀且 |作为列分隔符。 SELECT * FROM TABLE_NAME; 当我从 CLI 运行命令时，如下
mysql - 无法从终端加载 mysql 但可以使用系统首选项启动 mysql
我知道这个问题之前已经被问过好几次了，我已经解决了很多问题，但到目前为止没有任何效果。 MySQL 试图将自身安装到的目录 (usr/local/mysql) 肯定有问题。关于我的错误的奇怪之处在于我
mysql - 在 mysql 数据查询上获取不需要的输出 mysql
以下是我的 SQL 数据结构，我正在尝试如下两个查询: Select Wrk_ID, Wrk_LastName, Skill_Desc from Worker, Skill where
mysql - 将本地 mysql 服务器复制到基于云的 mysql
我们有一个本地 mysql 服务器(不在公共(public)域上)，并希望将该服务器复制到我们拥有的 google 云 sql 实例。我的问题是:1.这可能吗？2.我们的本地服务器只能在本地网络上访问
mysql - MySQL 触发器上 MySQL 变量的算术运算
我有一个表(test_table)，其中一些字段值(例如字段 A、B 和 C)是从外部应用程序插入的，还有一个字段(字段 D)，我想从现有表(store_table)插入其值，但在插入前者(A、B 和
mysql - 无法在创建 MySQL 服务器的同一计划中使用 mysql
我想创建一个 AWS RDS 实例，然后使用 terraform 管理数据库用户。因此，首先，我创建了一个 RDS 实例，然后使用创建的 RDS 实例初始化 mysql 提供程序，以进一步将其用于用户
mysql - MySql 用户数量对 MySql 性能影响大吗？
当用户在我的网站上注册时，他们会在我的一个数据库中创建自己的表格。该表存储用户发布的所有帖子。我还想做的是也为他们生成自己的 MySql 用户——该用户仅有权从他们的表中读取、写入和删除。创建它应该
mysql - mysql 表中的下和子类别(coldfusion，mysql)
我有一个关于 ColdFusion 和 Mysql 的问题。我有两个表:PRODUCT 和 PRODUCT_CAT。我想列出包含一些标记为:IS_EXTRANET=1 的特殊产品的类别。所以我写了这个
mysql - 如何使用 MYSQL 运算符选择列所有值都必须可用 - MYSQL
我想获取 recipes_id 列的值，以获取包含 ingredient_id 的 2,17 和 26 条目的值。假设 ingredient_id 2 丢失则不获取记录。我已经尝试过 IN 运算符
mysql - MySQL 服务器和 MySQL 客户端有什么区别
在 Ubuntu 中，我通常安装两者，但 MySQL 的客户端和服务器之间有什么区别。作为奖励，当一个新语句提到它需要 MySQL 5.x 时，它是指客户端、服务器还是两者兼而有之。例如这个链接ht
mysql - mysql - 如何在没有触发器和手动插入的情况下在插入时生成/自动增加 guid mysql？
我重新访问了我的数据库并注意到我有一些 INT 类型的主键。这还不够独特，所以我想我会有一个指导。我来自微软 sql 背景，在 ssms 中你可以选择类型为“uniqeidentifier”并自
mysql - Oracle MySQL 与 MySQL 相同吗？
我的系统上有 MySQL，我正在尝试确定它是 Oracle MySQL 还是 MySQL。 Oracle MySQL 有区别吗: http://www.oracle.com/us/products/m
mysql - 本地 mysql 服务器和生产 mysql 服务器之间的显着性能差异
我是在生产 MySQL 中运行的应用程序的新维护者。之前的维护者已经离开，留下的文档很少，而且联系不上了。我面临的问题是执行以下请求大约需要 10 秒: SELECT COUNT(*) FROM `
mysql - 如何自动将数据从一个 MySQL 数据库传输到另一个 MySQL 数据库？
我有两个位于不同机器上的 MySQL 数据库。我想自动将数据从一台服务器传输到另一台服务器。比方说，我希望每天早上 4:00 进行数据传输。可以吗？是否有任何 MySQL 内置功能可以让我们做到这一
mysql - 从 mysql 目录外的 mysql 表查询？
有什么方法可以使用 jdbc 查询位于 mysql 根目录之外的目录中的 mysql 表，还是必须将它们移动到 mysql 根目录内的数据库文件夹中？我在 Google 上搜索时没有找到任何东西。最
mysql - 使用另一个 mysql 表的值更新 Mysql 表
我在 mysql 数据库中有两个表。成员和 ClassNumbers。两个表都有一个付费年份字段，都有一个代码字段。我想用代码数字表中的值更新成员表中的付费年份，其中成员中的代码与 ClassNumb
mysql - 是否可以将本地 MySQL 数据库复制到远程 MySQL 数据库？
情况:我有 2 台服务器，其中一台当前托管一个实时 WordPress 站点，我希望能够将该站点转移到另一台服务器，以防第一台服务器出现故障。传输源文件很容易；传输数据库是我需要弄清楚如何做的。两台服
mysql - 使用 mysql 查询复制 mysql 数据库
Phpmyadmin 有一个功能是“复制数据库到”..有没有mysql查询来写这个函数？类似于将 db A 复制到新的 db B。最佳答案首先创建复制数据库: CREATE DATABASE du
mysql - 当 mySQL 已安装并由另一个应用程序配置时，为新应用程序配置 mySQL
我有一个使用 mySQL 作为后端的库存软件。我已经在我的计算机上对其进行了测试，并且运行良好。当我在计算机上安装我的软件时，我必须执行以下步骤: 安装 mySQL 服务器将用户名指定为“root

可可西里

个人简介

我是一名优秀的程序员,十分优秀！

作者热门文章

滴滴打车优惠券免费领取

全站热门文章

首页

博学

6Ren·AI

商城