python中文分詞,使用結(jié)巴分詞對python進行分詞(實例講解)
在采集美女站時,需要對關(guān)鍵詞進行分詞,最終采用的是python的結(jié)巴分詞方法。
中文分詞是中文文本處理的一個基礎(chǔ)性工作,結(jié)巴分詞利用進行中文分詞。
其基本實現(xiàn)原理有三點:
1.基于Trie樹結(jié)構(gòu)實現(xiàn)高效的詞圖掃描,生成句子中漢字所有可能成詞情況所構(gòu)成的有向無環(huán)圖(DAG)
2.采用了動態(tài)規(guī)劃查找最大概率路徑, 找出基于詞頻的最大切分組合
3.對于未登錄詞,采用了基于漢字成詞能力的HMM模型,使用了Viterbi算法
安裝(Linux環(huán)境)
下載工具包,解壓后進入目錄下,運行:python setup.py install

模式
1.默認(rèn)模式,試圖將句子最精確地切開,適合文本分析
2.全模式,把句子中所有的可以成詞的詞語都掃描出來,適合搜索引擎
接口
• 組件只提供jieba.cut 方法用于分詞
• cut方法接受兩個輸入?yún)?shù):
• 第一個參數(shù)為需要分詞的字符串
• cut_all參數(shù)用來控制分詞模式
• 待分詞的字符串可以是gbk字符串、utf-8字符串或者unicode
• jieba.cut返回的結(jié)構(gòu)是一個可迭代的generator,可以使用for循環(huán)來獲得分詞后得到的每一個詞語(unicode),也可以用list(jieba.cut(...))轉(zhuǎn)化為list
• seg=jieba.cut("http://www.gg4493.cn/"):
實例
#! -*- coding:utf-8 -*-
import jieba
seg_list = jieba.cut("我來到北京清華大學(xué)", cut_all = True)
print "Full Mode:", ' '.join(seg_list)
seg_list = jieba.cut("我來到北京清華大學(xué)")
print "Default Mode:", ' '.join(seg_list)
結(jié)果

以上這篇python中文分詞,使用結(jié)巴分詞對python進行分詞(實例講解)就是小編分享給大家的全部內(nèi)容了,希望能給大家一個參考,也希望大家多多支持腳本之家。
相關(guān)文章
Python基于pycrypto實現(xiàn)的AES加密和解密算法示例
這篇文章主要介紹了Python基于pycrypto實現(xiàn)的AES加密和解密算法,結(jié)合實例形式分析了Python使用pycrypto模塊進行AES加密與解密操作相關(guān)實現(xiàn)技巧,需要的朋友可以參考下2018-04-04
Python在信息學(xué)競賽中的運用及Python的基本用法(詳解)
下面小編就為大家?guī)硪黄狿ython在信息學(xué)競賽中的運用及Python的基本用法(詳解)。小編覺得挺不錯的,現(xiàn)在就分享給大家,也給大家做個參考。一起跟隨小編過來看看吧2017-08-08
python 實現(xiàn) hive中類似 lateral view explode的功能示例
這篇文章主要介紹了python 實現(xiàn) hive中類似 lateral view explode的功能示例,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧2020-05-05
使用python實現(xiàn)baidu hi自動登錄的代碼
使用python自動登錄baidu hi的代碼,有需要的朋友可以參考下2013-02-02

