最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

使用Python檢測文章抄襲及去重算法原理解析

 更新時(shí)間:2019年06月14日 11:52:54   作者:python派森  
文章去重(或叫網(wǎng)頁去重)是根據(jù)文章(或網(wǎng)頁)的文字內(nèi)容來判斷多個(gè)文章之間是否重復(fù)。這篇文章主要介紹了用Python寫了個(gè)檢測文章抄襲,詳談去重算法原理,需要的朋友可以參考下

在互聯(lián)網(wǎng)出現(xiàn)之前,“抄”很不方便,一是“源”少,而是發(fā)布渠道少;而在互聯(lián)網(wǎng)出現(xiàn)之后,“抄”變得很簡單,鋪天蓋地的“源”源源不斷,發(fā)布渠道也數(shù)不勝數(shù),博客論壇甚至是自建網(wǎng)站,而爬蟲還可以讓“抄”完全自動(dòng)化不費(fèi)勁。這就導(dǎo)致了互聯(lián)網(wǎng)上的“文章”重復(fù)性很高。這里的“文章”只新聞、博客等文字占據(jù)絕大部分內(nèi)容的網(wǎng)頁。

中文新聞網(wǎng)站的“轉(zhuǎn)載”(其實(shí)就是抄)現(xiàn)象非常嚴(yán)重,這種“轉(zhuǎn)載”幾乎是全文照抄,或改下標(biāo)題,或是改下編輯姓名,或是文字個(gè)別字修改。所以,對新聞網(wǎng)頁的去重很有必要。

一、去重算法原理

文章去重(或叫網(wǎng)頁去重)是根據(jù)文章(或網(wǎng)頁)的文字內(nèi)容來判斷多個(gè)文章之間是否重復(fù)。這是爬蟲爬取大量的文本行網(wǎng)頁(新聞網(wǎng)頁、博客網(wǎng)頁等)后要進(jìn)行的非常重要的一項(xiàng)操作,也是搜索引擎非常關(guān)心的一個(gè)問題。搜索引擎中抓取的網(wǎng)頁是海量的,海量文本的去重算法也出現(xiàn)了很多,比如minihash, simhash等等。

在工程實(shí)踐中,對simhash使用了很長一段時(shí)間,有些缺點(diǎn),一是算法比較復(fù)雜、效率較差;二是準(zhǔn)確率一般。

網(wǎng)上也流傳著百度采用的一種方法,用文章最長句子的hash值作為文章的標(biāo)識,hash相同的文章(網(wǎng)頁)就認(rèn)為其內(nèi)容一樣,是重復(fù)的文章(網(wǎng)頁)。

這個(gè)所謂的“百度算法”對工程很友好,但是實(shí)際中還是會(huì)有很多問題。中文網(wǎng)頁的一大特點(diǎn)就是“天下文章一大抄”,各種博文、新聞幾乎一字不改或稍作修改就被網(wǎng)站發(fā)表了。這個(gè)特點(diǎn),很適合這個(gè)“百度算法”。但是,實(shí)際中個(gè)別字的修改,會(huì)導(dǎo)致被轉(zhuǎn)載的最長的那句話不一樣,從而其hash值也不一樣了,最終結(jié)果是,準(zhǔn)確率很高,召回率較低。

為了解決這個(gè)問題,我提出了nshash(top-n longest sentences hash)算法,即:取文章的最長n句話(實(shí)踐下來,n=5效果不錯(cuò))分別做hash值,這n個(gè)hash值作為文章的指紋,就像是人的5個(gè)手指的指紋,每個(gè)指紋都可以唯一確認(rèn)文章的唯一性。這是對“百度算法”的延伸,準(zhǔn)確率還是很高,但是召回率大大提高,原先一個(gè)指紋來確定,現(xiàn)在有n個(gè)指紋來招回了。

二、算法實(shí)現(xiàn)

該算法的原理簡單,實(shí)現(xiàn)起來也不難。比較復(fù)雜一點(diǎn)的是對于一篇文章(網(wǎng)頁)返回一個(gè)similar_id,只要該ID相同則文章相似,通過groupby similar_id即可達(dá)到去重目的。

為了記錄文章指紋和similar_id的關(guān)系,我們需要一個(gè)key-value數(shù)據(jù)庫,本算法實(shí)現(xiàn)了內(nèi)存和硬盤兩種key-value數(shù)據(jù)庫類來記錄這種關(guān)系:

HashDBLeveldb 類:基于leveldb實(shí)現(xiàn), 可用于海量文本的去重;

HashDBMemory 類:基于Python的dict實(shí)現(xiàn),可用于中等數(shù)量(只要Python的dict不報(bào)內(nèi)存錯(cuò)誤)的文本去重。

這兩個(gè)類都具有g(shù)et()和put()兩個(gè)方法,如果你想用Redis或MySQL等其它數(shù)據(jù)庫來實(shí)現(xiàn)HashDB,可以參照這兩個(gè)類的實(shí)現(xiàn)進(jìn)行實(shí)現(xiàn)。

HashDBLeveldb類的實(shí)現(xiàn)

HashDBMemory類的實(shí)現(xiàn)

從效率上看,肯定是HashDBMemory速度更快。利用nshash對17400篇新聞網(wǎng)頁內(nèi)容的測試結(jié)果如下:

HashDBLeveldb: 耗時(shí)2.47秒; HashDBMemory: 耗時(shí)1.6秒;

具體測試代碼請看 example/test.py。

有了這兩個(gè)類,就可以實(shí)現(xiàn)nshash的核心算法了。

首先,對文本進(jìn)行分句,以句號、感嘆號、問號、換行符作為句子的結(jié)尾標(biāo)識,一個(gè)正在表達(dá)式就可以分好句了。

其次,挑選最長的n句話,分別進(jìn)行hash計(jì)算。hash函數(shù)可以用Python自帶模塊hashlib中的md5, sha等等,也可以用我在爬蟲教程中多次提到的farmhash。

最后,我們需要根據(jù)這n個(gè)hash值給文本內(nèi)容一個(gè)similar_id,通過上面兩種HashDB的類的任意一種都可以比較容易實(shí)現(xiàn)。其原理就是,similar_id從0開始,從HashDB中查找這n個(gè)hash值是否有對應(yīng)的similar_id,如果有就返回這個(gè)對應(yīng)的similar_id;如果沒有,就讓當(dāng)前similar_id加1作為這n個(gè)hash值對應(yīng)的similar_id,將這種對應(yīng)關(guān)系存入HashDB,并返回該similar_id即可。

這個(gè)算法實(shí)現(xiàn)為NSHash類:

NSHash類的實(shí)現(xiàn)

三、使用方法

import nshash
nsh = nshash.NSHash(name='test', hashfunc='farmhash', hashdb='memory')
similar_id = nsh.get_similar(doc_text)

NSHash 類有三個(gè)參數(shù):

  • name : 用于hashdb保存到硬盤的文件名,如果hashdb是HashDBMemory, 則用pickle序列化到硬盤;如果是HashDBLeveldb,則leveldb目錄名為:name+'.hashdb'。name按需隨便起即可。
  • hashfunc : 計(jì)算hash值的具體函數(shù)類別,目前實(shí)現(xiàn)兩種類型: md5 和 farmhash 。默認(rèn)是 md5 ,方便Windows上安裝farmhash不方便。
  • hashdb :默認(rèn)是 memory 即選擇HashDBMemory,否則是HashDBLeveldb。

至于如何利用similar_id進(jìn)行海量文本的去重,這要結(jié)合你如何存儲(chǔ)、索引這些海量文本??蓞⒖?code> example/test.py 文件。這個(gè)test是對excel中保存的新聞網(wǎng)頁進(jìn)行去重的例子。

總結(jié)

以上所述是小編給大家介紹的使用Python檢測文章抄襲及去重算法原理解析 ,希望對大家有所幫助,如果大家有任何疑問請給我留言,小編會(huì)及時(shí)回復(fù)大家的。在此也非常感謝大家對腳本之家網(wǎng)站的支持!
如果你覺得本文對你有幫助,歡迎轉(zhuǎn)載,煩請注明出處,謝謝!

相關(guān)文章

  • 教你使用Python提取視頻中的美女圖片

    教你使用Python提取視頻中的美女圖片

    這篇文章主要介紹了教你使用Python提取視頻中的美女圖片,使用?Python?寫一個(gè)逐幀無損保存視頻畫面的小腳本,大概分為三個(gè)步驟,詳細(xì)過程跟隨小編一起看看吧
    2022-04-04
  • python開發(fā)中module模塊用法實(shí)例分析

    python開發(fā)中module模塊用法實(shí)例分析

    這篇文章主要介紹了python開發(fā)中module模塊用法,以實(shí)例形式較為詳細(xì)的分析了Python中模塊的功能、定義及相關(guān)使用技巧,具有一定參考借鑒價(jià)值,需要的朋友可以參考下
    2015-11-11
  • python編程普通及類和靜態(tài)方法示例詳解

    python編程普通及類和靜態(tài)方法示例詳解

    普通方法會(huì)將實(shí)例傳入方法當(dāng)中(通常用self表示),類方法會(huì)將類傳入方法當(dāng)中(通常用cls表示),靜態(tài)方法中傳入與類無關(guān)的變量。下面將舉例詳細(xì)說明
    2021-10-10
  • Python中不同數(shù)據(jù)對象的空值校驗(yàn)的方法小結(jié)

    Python中不同數(shù)據(jù)對象的空值校驗(yàn)的方法小結(jié)

    Python中有多種數(shù)據(jù)對象,每種都有其特定的空值表示方法和校驗(yàn)方式,本文將深入探討這些空值校驗(yàn)的方法,有需要的小伙伴可以參考一下
    2024-04-04
  • 基于Python實(shí)現(xiàn)傻瓜式GIF制作工具

    基于Python實(shí)現(xiàn)傻瓜式GIF制作工具

    有沒有什么內(nèi)容形式,比小視頻更小,比普通圖片更豐富?有,GIF動(dòng)態(tài)圖就是其中一種形式。本文將為大家介紹如何通過Python實(shí)現(xiàn)一個(gè)傻瓜式的gif生成工具,感興趣的可以了解一下
    2021-12-12
  • python?pyvis庫創(chuàng)建可視化交互式網(wǎng)絡(luò)圖

    python?pyvis庫創(chuàng)建可視化交互式網(wǎng)絡(luò)圖

    這篇文章主要為大家介紹了python?pyvis庫創(chuàng)建可視化交互式網(wǎng)絡(luò)圖,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪
    2024-01-01
  • Python操作Mysql實(shí)例代碼教程在線版(查詢手冊)

    Python操作Mysql實(shí)例代碼教程在線版(查詢手冊)

    本文介紹了Python操作MYSQL、執(zhí)行SQL語句、獲取結(jié)果集、遍歷結(jié)果集、取得某個(gè)字段、獲取表字段名、將圖片插入數(shù)據(jù)庫、執(zhí)行事務(wù)等各種代碼實(shí)例和詳細(xì)介紹,代碼居多,是一桌豐盛唯美的代碼大餐
    2013-02-02
  • Python+OpenCV圖像處理——打印圖片屬性、設(shè)置存儲(chǔ)路徑、調(diào)用攝像頭

    Python+OpenCV圖像處理——打印圖片屬性、設(shè)置存儲(chǔ)路徑、調(diào)用攝像頭

    這篇文章主要介紹了Python+OpenCV圖像處理——打印圖片屬性、設(shè)置存儲(chǔ)路徑、調(diào)用攝像頭的示例,幫助大家更好的利用python處理圖片,感興趣的朋友可以了解下
    2020-10-10
  • Python tkinter實(shí)現(xiàn)簡單加法計(jì)算器代碼實(shí)例

    Python tkinter實(shí)現(xiàn)簡單加法計(jì)算器代碼實(shí)例

    這篇文章主要介紹了Python tkinter實(shí)現(xiàn)簡單加法計(jì)算器代碼實(shí)例,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友可以參考下
    2020-05-05
  • OpenCV圖像的幾何變換處理方法詳解

    OpenCV圖像的幾何變換處理方法詳解

    這篇文章主要給大家介紹了關(guān)于OpenCV圖像的幾何變換處理的相關(guān)資料,圖像的幾何變換是指將一幅圖像映射到另一幅圖像內(nèi),有縮放、翻轉(zhuǎn)、仿射變換、透視、重映射等操作,需要的朋友可以參考下
    2024-03-03

最新評論

商城县| 毕节市| 平利县| 达拉特旗| 邢台市| 墨玉县| 洪洞县| 建昌县| 会泽县| 星座| 商南县| 盐边县| 翁源县| 桃园市| 怀宁县| 宁远县| 类乌齐县| 天全县| 黄龙县| 荆门市| 宜州市| 两当县| 高台县| 宜兴市| 修武县| 偏关县| 马关县| 新昌县| 阿拉善左旗| 宁远县| 肃北| 彰化县| 秭归县| 枣庄市| 石嘴山市| 高密市| 石阡县| 澳门| 手机| 江永县| 伊宁市|