最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Python利用模糊哈希實現(xiàn)對比文件相似度

 更新時間:2023年01月28日 14:57:18   作者:nick  
對比兩個文件相似度,python中可通過difflib.SequenceMatcher/ssdeep/python_mmdt/tlsh實現(xiàn),<BR>在大量需要對比,且文件較大時,需要更高的效率,可以考慮模糊哈希,本文就來和大家詳細聊聊

對比兩個文件相似度,python中可通過difflib.SequenceMatcher/ssdeep/python_mmdt/tlsh實現(xiàn),在大量需要對比,且文件較大時,需要更高的效率,可以考慮模糊哈希(fuzzy hash),如ssdeep/python_mmdt

測試過程發(fā)現(xiàn):

  • difflib方法,讀取文件后,可以實現(xiàn)匹配度輸出
  • ssdeep/mmdt/tlsh方法可以實現(xiàn),實現(xiàn)提前模糊哈希值,驗證時,只讀取一次,完成對比,從而優(yōu)化對比時間,及內(nèi)存/cpu消耗
  • tlsh測試時,值越小,相似度越高,在對比小文件時,很不理想
  • 在對比小文件時,三種方法相差不大,在對比大文件(案例中81MB),difflib方法慢的難以接受
  • 在實際環(huán)境中,建議使用mmdt方法,因為ssdeep在二進制對比中差別較大,失去參考價值,具體還有哪些文件類型存在此問題有待考量,

測試環(huán)境:

OS:ubuntu20.04

python:3.8.10

py-tlsh==4.7.2

python-mmdt==0.3.1

ssdeep==3.4

# -*- coding: utf-8 -*-

import ssdeep
import time
from python_mmdt.mmdt.mmdt import MMDT
from difflib import SequenceMatcher

def difflib_test(file1,file2):
    start_time = time.time()
    with open(file1,'rb') as f:
        s1 = f.read()
    with open(file2,'rb') as f:
        s2 = f.read()
    match_obj =  SequenceMatcher(None,s1,s2)
    print("difflib match:",match_obj.ratio())
    end_time = time.time()
    print('difflib_test cost :',end_time-start_time)

def mmdt_test(file1,file2):
    start_time = time.time()
    mmdt=MMDT()
    r1 = mmdt.mmdt_hash(file1)
    print(r1)
    r2 = mmdt.mmdt_hash_streaming(file2)
    print(r2)
    # sim1 = mmdt.mmdt_compare(file1, file2)
    # print("mmdt match:",sim1)
    sim2 = mmdt.mmdt_compare_hash(r1, r2)
    print("mmdt match:",sim2)
    end_time = time.time()
    print('mmdt_test cost :',end_time-start_time)

def ssdeep_test(file1,file2):
    start_time = time.time()
    sig1=ssdeep.hash_from_file(file1)
    sig2=ssdeep.hash_from_file(file2)
    print(sig1)
    print(sig2)
    print("ssdeep match:",ssdeep.compare(sig1,sig2))
    end_time = time.time()
    print('ssdeep_test cost :',end_time-start_time)

if __name__ == '__main__':
    start_time = time.time()
    file1='/root/test/fstab'
    file2='/root/test/fstab2'
    # file1 = '/root/test/initrd.img-5.4.0-125-generic'
    # file2 = '/root/test/initrd.img-5.4.0-135-generic'
    mmdt_test(file1,file2)    
    ssdeep_test(file1,file2)
    difflib_test(file1,file2)
    end_time = time.time()
    print('總執(zhí)行時間:',end_time-start_time)

下面給出對比小文件/大文件效果:

測試tlsh

import tlsh
import time

def tlsh_test(file1,file2):
    start_time = time.time()
    with open(file1,'rb') as f:
        s1 = tlsh.hash(f.read())
    with open(file2,'rb') as f:
        s2 = tlsh.hash(f.read())
    match_obj =  tlsh.diff(s1,s2)
    print("tlsh match:",match_obj)
    end_time = time.time()
    print('difflib_test cost :',end_time-start_time)


if __name__ == '__main__':
    start_time = time.time()
    # file1='/root/test/fstab'
    # file2='/root/test/fstab2'
    file1 = '/root/test/initrd.img-5.4.0-125-generic'
    file2 = '/root/test/initrd.img-5.4.0-135-generic'
    tlsh_test(file1,file2)
    end_time = time.time()
    print('總執(zhí)行時間:',end_time-start_time)

對比小文件/大文件

到此這篇關(guān)于Python利用模糊哈希實現(xiàn)對比文件相似度的文章就介紹到這了,更多相關(guān)Python對比文件相似度內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • Python探針完成調(diào)用庫的數(shù)據(jù)提取

    Python探針完成調(diào)用庫的數(shù)據(jù)提取

    這篇文章主要介紹了Python探針完成調(diào)用庫的數(shù)據(jù)提取,Python中可以通過sys.meta_path來實現(xiàn)import?hook的功能,下文詳細資料介紹,需要的小伙伴可以參考一下
    2022-05-05
  • 利用Python實現(xiàn)讀取Word文檔里的Excel附件

    利用Python實現(xiàn)讀取Word文檔里的Excel附件

    這篇文章主要為大家詳細介紹了如何利用Python實現(xiàn)讀取Word文檔里的Excel附件,文中的示例代碼講解詳細,感興趣的小伙伴可以跟隨小編一起了解一下
    2022-12-12
  • 基于python和flask實現(xiàn)http接口過程解析

    基于python和flask實現(xiàn)http接口過程解析

    這篇文章主要介紹了基于python和flask實現(xiàn)http接口過程解析,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2020-06-06
  • Python入門篇之編程習慣與特點

    Python入門篇之編程習慣與特點

    本文是Python入門篇的第一篇文章,主要講述了Python編程習慣和特點等一些基礎知識,有需要的朋友可以參考下
    2014-10-10
  • python之實現(xiàn)兩個或多個列表相加

    python之實現(xiàn)兩個或多個列表相加

    這篇文章主要介紹了python之實現(xiàn)兩個或多個列表相加方式,具有很好的參考價值,希望對大家有所幫助,如有錯誤或未考慮完全的地方,望不吝賜教
    2023-08-08
  • python merge、concat合并數(shù)據(jù)集的實例講解

    python merge、concat合并數(shù)據(jù)集的實例講解

    下面小編就為大家分享一篇python merge、concat合并數(shù)據(jù)集的實例講解,具有很好的參考價值,希望對大家有所幫助。一起跟隨小編過來看看吧
    2018-04-04
  • Python?PaddleGAN實現(xiàn)調(diào)整照片人物年齡

    Python?PaddleGAN實現(xiàn)調(diào)整照片人物年齡

    這篇文章主要介紹了通過PaddleGAN實現(xiàn)照片人物的老年化和年輕化處理,文中的示例代碼講解有效,對我們學習或工作有一定的幫助,感興趣的可以學習一下
    2021-12-12
  • 將python代碼打包成.exe文件直接運行的具體步驟

    將python代碼打包成.exe文件直接運行的具體步驟

    小編最近收到了一個小伙伴的問題,就是那么多有趣的代碼,怎么發(fā)給別人,讓沒有python環(huán)境的小伙伴也可以使用呢,本文小編將帶著大家探索如何將自己的python代碼打包成.exe可執(zhí)行文件,一起來看看吧
    2024-02-02
  • Python中的sorted函數(shù)應用及文件操作詳解

    Python中的sorted函數(shù)應用及文件操作詳解

    這篇文章主要介紹了Python中的sorted函數(shù)應用及文件操作詳解,python只能將字符串寫入到文本文件,要將數(shù)值數(shù)據(jù)存儲到文本本件中,必須先試用函數(shù)str()將其轉(zhuǎn)換為字符串格式,需要的朋友可以參考下
    2023-12-12
  • Python多進程的使用詳情

    Python多進程的使用詳情

    本篇重點介紹Python多進程的使用,主要介紹其的一些方法及進程的創(chuàng)建等,想進一步了解的小伙伴請跟小編一起進入下文吧
    2021-09-09

最新評論

潞西市| 沈丘县| 林甸县| 中牟县| 四子王旗| 沁阳市| 陕西省| 蓝田县| 长寿区| 江门市| 双鸭山市| 东丰县| 武山县| 防城港市| 灵寿县| 新乡县| 彭州市| 子洲县| 昌邑市| 绵阳市| 迁安市| 永春县| 商城县| 南康市| 五华县| 绥宁县| 黑水县| 内黄县| 昌都县| 精河县| 永福县| 仪征市| 新宾| 崇文区| 阿巴嘎旗| 塔城市| 汉川市| 宝兴县| 霍邱县| 元谋县| 昌邑市|