最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Mysql實現(xiàn)全文檢索、關(guān)鍵詞跑分的方法實例

 更新時間:2020年09月03日 10:54:14   作者:云道小破棧  
這篇文章主要給大家介紹了關(guān)于Mysql實現(xiàn)全文檢索、關(guān)鍵詞跑分的相關(guān)資料,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧

一、前言

今天一個同事問我,如何使用 Mysql 實現(xiàn)類似于 ElasticSearch 的全文檢索功能,并且對檢索關(guān)鍵詞跑分?我當時腦子里立馬產(chǎn)生了疑問?為啥不直接用es呢?簡單好用還賊快。但是聽他說,數(shù)據(jù)量不多,客戶給的時間非常有限,根本沒時間去搭建es,所以還是看一下 Mysql 的全文檢索功能吧!

MySQL 從 5.7.6 版本開始,MySQL就內(nèi)置了ngram全文解析器,用來支持中文、日文、韓文分詞。在 MySQL 5.7.6 版本之前,全文索引只支持英文全文索引,不支持中文全文索引,需要利用分詞器把中文段落預處理拆分成單詞,然后存入數(shù)據(jù)庫。本篇文章測試的時候,采用的 Mysql 5.7.6 ,InnoDB數(shù)據(jù)庫引擎。mysql全文檢索

二、全文解析器ngram

ngram就是一段文字里面連續(xù)的n個字的序列。ngram全文解析器能夠?qū)ξ谋具M行分詞,每個單詞是連續(xù)的n個字的序列。
例如,用ngram全文解析器對“你好世界”進行分詞:

n=1: '你', '好', '世', '界' 
n=2: '你好', '好世', '世界' 
n=3: '你好世', '好世界' 
n=4: '你好世界'

MySQL 中使用全局變量 ngram_token_size 來配置 ngram 中 n 的大小,它的取值范圍是1到10,默認值是 2。通常ngram_token_size設(shè)置為要查詢的單詞的最小字數(shù)。如果需要搜索單字,就要把ngram_token_size設(shè)置為 1。在默認值是 2 的情況下,搜索單字是得不到任何結(jié)果的。因為中文單詞最少是兩個漢字,推薦使用默認值 2。

咱們看一下Mysql默認的ngram_token_size大小:

show variables like 'ngram_token_size'

ngram_token_size 變量的兩種設(shè)置方式:

1、啟動mysqld命令時指定

mysqld --ngram_token_size=2

2、修改mysql配置文件

[mysqld] 
ngram_token_size=2

三、全文索引

以某文書數(shù)據(jù)為例,新建數(shù)據(jù)表 t_wenshu ,并且針對文書內(nèi)容字段創(chuàng)建全文索引,導入10w條測試數(shù)據(jù)。

1、建表時創(chuàng)建全文索引

CREATE TABLE `t_wenshu` (
 `province` varchar(255) DEFAULT NULL,
 `caseclass` varchar(255) DEFAULT NULL,
 `casenumber` varchar(255) DEFAULT NULL,
 `caseid` varchar(255) DEFAULT NULL,
 `types` varchar(255) DEFAULT NULL,
 `title` varchar(255) DEFAULT NULL,
 `content` longtext,
 `updatetime` varchar(255) DEFAULT NULL,
 FULLTEXT KEY `content` (`content`) WITH PARSER `ngram`
) ENGINE=InnoDB DEFAULT CHARSET=utf8;

2、通過 alter table 方式

ALTER TABLE t_wenshu ADD FULLTEXT INDEX content_index (content) WITH PARSER ngram;

3、通過 create index 方式

CREATE FULLTEXT INDEX content_index ON t_wenshu (content) WITH PARSER ngram;

四、檢索模式

自然語言檢索

(IN NATURAL LANGUAGE MODE)自然語言模式是 MySQL 默認的全文檢索模式。自然語言模式不能使用操作符,不能指定關(guān)鍵詞必須出現(xiàn)或者必須不能出現(xiàn)等復雜查詢。

布爾檢索

(IN BOOLEAN MODE)剔除一半匹配行以上都有的詞,例如,每行都有this這個詞的話,那用this去查時,會找不到任何結(jié)果,這在記錄條數(shù)特別多時很有用,原因是數(shù)據(jù)庫認為把所有行都找出來是沒有意義的,這時,this幾乎被當作是stopword(中斷詞);布爾檢索模式可以使用操作符,可以支持指定關(guān)鍵詞必須出現(xiàn)或者必須不能出現(xiàn)或者關(guān)鍵詞的權(quán)重高還是低等復雜查詢。

   ● IN BOOLEAN MODE的特色:
      ·不剔除50%以上符合的row。
      ·不自動以相關(guān)性反向排序。
      ·可以對沒有FULLTEXT index的字段進行搜尋,但會非常慢。
      ·限制最長與最短的字符串。
      ·套用Stopwords。

   ● 搜索語法規(guī)則:
     +   一定要有(不含有該關(guān)鍵詞的數(shù)據(jù)條均被忽略)。
     -   不可以有(排除指定關(guān)鍵詞,含有該關(guān)鍵詞的均被忽略)。
     >   提高該條匹配數(shù)據(jù)的權(quán)重值。
     <   降低該條匹配數(shù)據(jù)的權(quán)重值。
     ~   將其相關(guān)性由正轉(zhuǎn)負,表示擁有該字會降低相關(guān)性(但不像-將之排除),只是排在較后面權(quán)重值降低。
     *   萬用字,不像其他語法放在前面,這個要接在字符串后面。
     " " 用雙引號將一段句子包起來表示要完全相符,不可拆字。

查詢擴展檢索

注釋:(WITH QUERY EXPANSION)由于查詢擴展可能帶來許多非相關(guān)性的查詢,謹慎使用!

五、檢索查詢

1)查詢 content 中包含“盜竊罪”的記錄,查詢語句如下

select caseid,content, MATCH ( content) AGAINST ('盜竊罪') as score from t_wenshu where MATCH ( content) AGAINST ('盜竊罪' IN NATURAL LANGUAGE MODE)

2)查詢 content 中包含“尋釁滋事”的記錄,查詢語句如下

select caseid,content, MATCH ( content) AGAINST ('尋釁滋事') as score from t_wenshu where MATCH ( content) AGAINST ('尋釁滋事' IN NATURAL LANGUAGE MODE) ;

3)單個漢字,查詢 content 中包含“我”的記錄,查詢語句如下

select caseid,content, MATCH ( content) AGAINST ('我') as score from t_wenshu where MATCH ( content) AGAINST ('我' IN NATURAL LANGUAGE MODE) ;

備注:因為設(shè)置的全局變量 ngram_token_size 的值為 2。如果想查詢單個漢字,需要在配置文件 my.ini 中修改 ngram_token_size = 1 ,并重啟 mysqld 服務,此處不做嘗試了。

4)查詢字段 content 中包含 “危險駕駛”和“尋釁滋事”的語句如下:

select caseid,content, MATCH (content) AGAINST ('+危險駕駛 +尋釁滋事') as score from t_wenshu where MATCH (content) AGAINST ('+危險駕駛 +尋釁滋事' IN BOOLEAN MODE);

5)查詢字段 content 中包含 “危險駕駛”,但不包含“尋釁滋事”的語句如下:

select caseid,content, MATCH (content) AGAINST ('+危險駕駛 -尋釁滋事') as score from t_wenshu where MATCH (content) AGAINST ('+危險駕駛 -尋釁滋事' IN BOOLEAN MODE);

6)查詢字段 conent 中包含“危險駕駛”或者“尋釁滋事”的語句如下:

select caseid,content, MATCH (content) AGAINST ('危險駕駛 尋釁滋事') as score from t_wenshu where MATCH (content) AGAINST ('危險駕駛 尋釁滋事' IN BOOLEAN MODE);

六、總結(jié)

1)使用 Mysql 全文索引之前,搞清楚各版本支持情況;

2)全文索引比 like + % 快 N 倍,但是可能存在精度問題;

3)如果需要全文索引的是大量數(shù)據(jù),建議先添加數(shù)據(jù),再創(chuàng)建索引;

4)對于中文,可以使用 MySQL 5.7.6 之后的版本,或者 Sphinx、Lucene 等第三方的插件;

5)MATCH()函數(shù)使用的字段名,必須要與創(chuàng)建全文索引時指定的字段名一致,且只能是同一個表的字段不能跨表;

到此這篇關(guān)于Mysql實現(xiàn)全文檢索、關(guān)鍵詞跑分的文章就介紹到這了,更多相關(guān)Mysql全文檢索、關(guān)鍵詞跑分內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • Mysql主從GTID與binlog如何使用

    Mysql主從GTID與binlog如何使用

    MySQL的GTID和binlog是實現(xiàn)高效數(shù)據(jù)復制和恢復的重要機制,GTID保證事務的唯一標識,避免復制沖突;binlog記錄數(shù)據(jù)變更,用于主從復制和數(shù)據(jù)恢復,兩者配合,提高MySQL復制的準確性和管理便捷性
    2024-10-10
  • Mac操作系統(tǒng)下MySQL密碼忘記后重置密碼的方法

    Mac操作系統(tǒng)下MySQL密碼忘記后重置密碼的方法

    本文給大家介紹Mac下忘記MySQL密碼后重置密碼的方法,下面通過關(guān)閉mysql服務器,配置短命令相關(guān)操作,完成重置密碼功能,非常不錯,具有參考借鑒價值,感興趣的朋友可以參考下
    2016-06-06
  • MySQL9.1.0實現(xiàn)最基礎(chǔ)主從復制的步驟

    MySQL9.1.0實現(xiàn)最基礎(chǔ)主從復制的步驟

    本文主要介紹了使用Docker實現(xiàn)MySQL的主從復制,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2025-02-02
  • MySQL實現(xiàn)批量插入以優(yōu)化性能的教程

    MySQL實現(xiàn)批量插入以優(yōu)化性能的教程

    這篇文章主要介紹了MySQL實現(xiàn)批量插入以優(yōu)化性能的教程,文中給出了運行時間來表示性能優(yōu)化后的對比,需要的朋友可以參考下
    2015-04-04
  • Mysql 索引結(jié)構(gòu)直觀圖解介紹

    Mysql 索引結(jié)構(gòu)直觀圖解介紹

    Mysql-索引結(jié)構(gòu)直觀圖解。上一篇剛剛通俗化的說明了B-TREE的幾個結(jié)果與存儲方式,其實跟索引感覺上還是沒有關(guān)聯(lián)起來, 那么本篇,就通過實際的一個數(shù)據(jù)行的例子,說明一下
    2016-12-12
  • mysql 正確清理binlog日志的兩種方法

    mysql 正確清理binlog日志的兩種方法

    這篇文章主要介紹了mysql 正確清理binlog日志的相關(guān)資料,需要的朋友可以參考下
    2017-07-07
  • MySQL性能分析工具profile使用教程

    MySQL性能分析工具profile使用教程

    這篇文章主要介紹了MySQL性能分析工具profile使用教程,本文描述了如何使用MySQL profile,不涉及具體的樣例分析,需要的朋友可以參考下
    2014-10-10
  • 超詳細MySQL使用規(guī)范分享

    超詳細MySQL使用規(guī)范分享

    這篇文章主要介紹了MySQL使用規(guī)范,幫助大家更規(guī)范的操作MySQL,感興趣的朋友可以了解下
    2020-08-08
  • MySQL數(shù)據(jù)庫壓縮版本安裝與配置詳細教程

    MySQL數(shù)據(jù)庫壓縮版本安裝與配置詳細教程

    今天教各位小伙伴怎么安裝及配置Mysql數(shù)據(jù)庫,文中有非常詳細的圖文解說及代碼示例,對剛?cè)腴Tmysql的小伙伴們很有幫助,需要的朋友可以參考下
    2021-05-05
  • mysql仿oracle的decode效果查詢

    mysql仿oracle的decode效果查詢

    今天遇到群里發(fā)的一個問題,覺得有點意思,發(fā)上來看一下
    2011-04-04

最新評論

肇州县| 应用必备| 仁布县| 田阳县| 安多县| 林甸县| 翁源县| 调兵山市| 阳东县| 沾益县| 潜江市| 马龙县| 扶绥县| 盐池县| 阜新市| 平阳县| 甘洛县| 广安市| 酒泉市| 长白| 新津县| 北碚区| 自治县| 保德县| 阳山县| 青海省| 沙田区| 大竹县| 晋城| 延川县| 洮南市| 扎鲁特旗| 灵川县| 清丰县| 麻城市| 池州市| 台江县| 竹北市| 汝州市| 兴化市| 靖远县|