最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

什么是Java布隆過濾器?如何使用你知道嗎

 更新時間:2022年02月09日 16:45:44   作者:Java技術(shù)債務(wù)  
這篇文章主要為大家詳細介紹了Java布隆過濾器,文中示例代碼介紹的非常詳細,具有一定的參考價值,感興趣的小伙伴們可以參考一下,希望能夠給你帶來幫助

Redis緩存穿透可以通過布隆過濾器進行解決,那么什么是布隆過濾器呢?請往下看。

通常你判斷某個元素是否存在用的是什么?

很多人想到的是HashMap。

確實可以將值映射到 HashMap 的 Key,然后可以在 O(1) 的時間復(fù)雜度內(nèi)返回結(jié)果,效率奇高。但是 HashMap 的實現(xiàn)也有缺點,例如存儲容量占比高,考慮到負載因子的存在,通??臻g是不能被用滿的,而一旦你的值很多例如上億的時候,那 HashMap 占據(jù)的內(nèi)存大小就變得很可觀了。

一、布隆過濾器簡介

布隆過濾器(英語:Bloom Filter)是1970年由布隆提出的。它實際上是一個很長的二進制向量和一系列隨機映射函數(shù)。布隆過濾器可以用于檢索一個元素是否在一個集合中

如果想判斷一個元素是不是在一個集合里,一般想到的是將集合中所有元素保存起來,然后通過比較確定。鏈表、樹、散列表(又叫哈希表,Hash table)等等數(shù)據(jù)結(jié)構(gòu)都是這種思路。但是隨著集合中元素的增加,我們需要的存儲空間越來越大。同時檢索速度也越來越慢,上述三種結(jié)構(gòu)的檢索時間復(fù)雜度分別為O(n),O(log n),O(1)。

布隆過濾器的原理是,當一個元素被加入集合時,通過K個散列函數(shù)將這個元素映射成一個位數(shù)組中的K個點,把它們置為1。檢索時,我們只要看看這些點是不是都是1就(大約)知道集合中有沒有它了:如果這些點有任何一個0,則被檢元素一定不在;如果都是1,則被檢元素很可能在。這就是布隆過濾器的基本思想。 –引自《維基百科,自由的百科全書》

本質(zhì)上布隆過濾器是一種數(shù)據(jù)結(jié)構(gòu),比較巧妙的概率型數(shù)據(jù)結(jié)構(gòu)(probabilistic data structure)高效地插入和查詢,可以用來告訴你 “某樣?xùn)|西一定不存在或者可能存在”。相比于傳統(tǒng)的 List、Set、Map 等數(shù)據(jù)結(jié)構(gòu),它更高效、占用空間更少,但是缺點是其返回的結(jié)果是概率性的,而不是確切的。

當你往簡單數(shù)組或列表中插入新數(shù)據(jù)時,將不會根據(jù)插入項的值來確定該插入項的索引值。這意味著新插入項的索引值與數(shù)據(jù)值之間沒有直接關(guān)系。這樣的話,當你需要在數(shù)組或列表中搜索相應(yīng)值的時候,你必須遍歷已有的集合。若集合中存在大量的數(shù)據(jù),就會影響數(shù)據(jù)查找的效率。

針對這個問題,你可以考慮使用哈希表。利用哈希表你可以通過對 “值” 進行哈希處理來獲得該值對應(yīng)的鍵或索引值,然后把該值存放到列表中對應(yīng)的索引位置。這意味著索引值是由插入項的值所確定的,當你需要判斷列表中是否存在該值時,只需要對值進行哈希處理并在相應(yīng)的索引位置進行搜索即可,這時的搜索速度是非??斓?。

二、布隆過濾器的結(jié)構(gòu)

圖片

根據(jù)定義,布隆過濾器可以檢查值是 “可能在集合中” 還是 “絕對不在集合中”。“可能” 表示有一定的概率,也就是說可能存在一定為誤判率。那為什么會存在誤判呢?下面我們來分析一下具體的原因。

布隆過濾器(Bloom Filter)本質(zhì)上是由長度為 m 的位向量或位列表(僅包含 0 或 1 位值的列表)組成,最初所有的值均設(shè)置為 0,如下圖所示。

圖片

為了將數(shù)據(jù)項添加到布隆過濾器中,我們會提供 K 個不同的哈希函數(shù),并將結(jié)果位置上對應(yīng)位的值置為 “1”。在前面所提到的哈希表中,我們使用的是單個哈希函數(shù),因此只能輸出單個索引值。而對于布隆過濾器來說,我們將使用多個哈希函數(shù),這將會產(chǎn)生多個索引值。

圖片

如上圖所示,當輸入 “semlinker” 時,預(yù)設(shè)的 3 個哈希函數(shù)將輸出 2、4、6,我們把相應(yīng)位置 1。假設(shè)另一個輸入 ”kakuqo“,哈希函數(shù)輸出 3、4 和 7。你可能已經(jīng)注意到,索引位 4 已經(jīng)被先前的 “semlinker” 標記了。此時,我們已經(jīng)使用 “semlinker” 和 ”kakuqo“ 兩個輸入值,填充了位向量。當前位向量的標記狀態(tài)為:

圖片

當對值進行搜索時,與哈希表類似,我們將使用 3 個哈希函數(shù)對 ”搜索的值“ 進行哈希運算,并查看其生成的索引值。假設(shè),當我們搜索 ”fullstack“ 時,3 個哈希函數(shù)輸出的 3 個索引值分別是 2、3 和 7:

圖片

從上圖可以看出,相應(yīng)的索引位都被置為 1,這意味著我們可以說 ”fullstack“ 可能已經(jīng)插入到集合中。事實上這是誤報的情形,產(chǎn)生的原因是由于哈希碰撞導(dǎo)致的巧合而將不同的元素存儲在相同的比特位上。

那么我們?nèi)绾芜x擇哈希函數(shù)個數(shù)和布隆過濾器長度很顯然,過小的布隆過濾器很快所有的bit位均為1,那么查詢?nèi)魏沃刀紩祷?ldquo;可能存在”,起不到過濾的目的了。布隆過濾器的長度會直接影響誤報率,布隆過濾器越長其誤報率越小。

另外,哈希函數(shù)的個數(shù)也需要權(quán)衡,個數(shù)越多則布隆過濾器 bit 位置位 1 的速度越快,且布隆過濾器的效率越低;但是如果太少的話,那我們的誤報率會變高。

圖片

如何選擇適合業(yè)務(wù)的 k 和 m 值呢,幸運的是,布隆過濾器有一個可預(yù)測的誤判率(FPP):

圖片

n 是已經(jīng)添加元素的數(shù)量;

k 哈希的次數(shù);

m 布隆過濾器的長度(如比特數(shù)組的大小);

極端情況下,當布隆過濾器沒有空閑空間時(滿),每一次查詢都會返回 true 。這也就意味著 m 的選擇取決于期望預(yù)計添加元素的數(shù)量 n ,并且 m 需要遠遠大于 n 。

實際情況中,布隆過濾器的長度 m 可以根據(jù)給定的誤判率(FFP)的和期望添加的元素個數(shù) n 的通過如下公式計算:

圖片

了解完上述的內(nèi)容之后,我們可以得出一個結(jié)論:當我們搜索一個值的時候,若該值經(jīng)過 K 個哈希函數(shù)運算后的任何一個索引位為 ”0“,那么該值肯定不在集合中。但如果所有哈希索引值均為 ”1“,則只能說該搜索的值可能存在集合中。

三、布隆過濾器應(yīng)用

在實際工作中,布隆過濾器常見的應(yīng)用場景如下:

  • 網(wǎng)頁爬蟲對 URL 去重,避免爬取相同的 URL 地址;
  • 反垃圾郵件,從數(shù)十億個垃圾郵件列表中判斷某郵箱是否垃圾郵箱;
  • Google Chrome 使用布隆過濾器識別惡意 URL;
  • Medium 使用布隆過濾器避免推薦給用戶已經(jīng)讀過的文章;
  • Google BigTable,Apache HBbase 和 Apache Cassandra 使用布隆過濾器減少對不存在的行和列的查找。

除了上述的應(yīng)用場景之外,布隆過濾器還有一個應(yīng)用場景就是解決緩存穿透的問題。所謂的緩存穿透就是服務(wù)調(diào)用方每次都是查詢不在緩存中的數(shù)據(jù),這樣每次服務(wù)調(diào)用都會到數(shù)據(jù)庫中進行查詢,如果這類請求比較多的話,就會導(dǎo)致數(shù)據(jù)庫壓力增大,這樣緩存就失去了意義。

利用布隆過濾器我們可以預(yù)先把數(shù)據(jù)查詢的主鍵,比如用戶 ID 或文章 ID 緩存到過濾器中。當根據(jù) ID 進行數(shù)據(jù)查詢的時候,我們先判斷該 ID 是否存在,若存在的話,則進行下一步處理。若不存在的話,直接返回,這樣就不會觸發(fā)后續(xù)的數(shù)據(jù)庫查詢。需要注意的是緩存穿透不能完全解決,我們只能將其控制在一個可以容忍的范圍內(nèi)。

四、布隆過濾器的優(yōu)缺點

優(yōu)點

相比于其它的數(shù)據(jù)結(jié)構(gòu),布隆過濾器在空間和時間方面都有巨大的優(yōu)勢。布隆過濾器存儲空間和插入/查詢時間都是常數(shù)(O(k))。另外,散列函數(shù)相互之間沒有關(guān)系,方便由硬件并行實現(xiàn)。布隆過濾器不需要存儲元素本身,在某些對保密要求非常嚴格的場合有優(yōu)勢。

布隆過濾器可以表示全集,其它任何數(shù)據(jù)結(jié)構(gòu)都不能;

k和m相同,使用同一組散列函數(shù)的兩個布隆過濾器的交并運算可以使用位操作進行。

缺點

但是布隆過濾器的缺點和優(yōu)點一樣明顯。誤算率是其中之一。隨著存入的元素數(shù)量增加,誤算率隨之增加。但是如果元素數(shù)量太少,則使用散列表足矣。

另外,一般情況下不能從布隆過濾器中刪除元素。我們很容易想到把位數(shù)組變成整數(shù)數(shù)組,每插入一個元素相應(yīng)的計數(shù)器加1, 這樣刪除元素時將計數(shù)器減掉就可以了。然而要保證安全地刪除元素并非如此簡單。首先我們必須保證刪除的元素的確在布隆過濾器里面。這一點單憑這個過濾器是無法保證的。另外計數(shù)器回繞也會造成問題。

在降低誤算率方面,有不少工作,使得出現(xiàn)了很多布隆過濾器的變種。

五、布隆過濾器實戰(zhàn)

布隆過濾器有很多實現(xiàn)和優(yōu)化,由 Google 開發(fā)著名的 Guava 庫就提供了布隆過濾器(Bloom Filter)的實現(xiàn)。在基于 Maven 的 Java 項目中要使用 Guava 提供的布隆過濾器,只需要引入以下坐標:

<dependency>
   <groupId>com.google.guava</groupId>
   <artifactId>guava</artifactId>
   <version>28.0-jre</version>
</dependency>

復(fù)制代碼在導(dǎo)入 Guava 庫后,我們新建一個 BloomFilterDemo 類,在 main 方法中我們通過 BloomFilter.create 方法來創(chuàng)建一個布隆過濾器,接著我們初始化 1 百萬條數(shù)據(jù)到過濾器中,然后在原有的基礎(chǔ)上增加 10000 條數(shù)據(jù)并判斷這些數(shù)據(jù)是否存在布隆過濾器中:

import com.google.common.base.Charsets;
import com.google.common.hash.BloomFilter;
import com.google.common.hash.Funnels;

public class BloomFilterDemo {
    public static void main(String[] args) {
        int total = 1000000; // 總數(shù)量
        BloomFilter<CharSequence> bf = 
          BloomFilter.create(Funnels.stringFunnel(Charsets.UTF_8), total);
        // 初始化 1000000 條數(shù)據(jù)到過濾器中
        for (int i = 0; i < total; i++) {
            bf.put("" + i);
        }
        // 判斷值是否存在過濾器中
        int count = 0;
        for (int i = 0; i < total + 10000; i++) {
            if (bf.mightContain("" + i)) {
                count++;
            }
        }
        System.out.println("已匹配數(shù)量 " + count);
    }
}

當以上代碼運行后,控制臺會輸出以下結(jié)果:

已匹配數(shù)量 1000309

很明顯以上的輸出結(jié)果已經(jīng)出現(xiàn)了誤報,因為相比預(yù)期的結(jié)果多了 309 個元素,誤判率為:

309/(1000000 + 10000) * 100 ≈ 0.030594059405940593

如果要提高匹配精度的話,我們可以在創(chuàng)建布隆過濾器的時候設(shè)置誤判率 fpp:

BloomFilter<CharSequence> bf = BloomFilter.create(
  Funnels.stringFunnel(Charsets.UTF_8), total, 0.0002
);

在 BloomFilter 內(nèi)部,誤判率 fpp 的默認值是 0.03:

// com/google/common/hash/BloomFilter.classpublic static &lt;T&gt; BloomFilter&lt;T&gt; create(Funnel&lt;? super T&gt; funnel, long expectedInsertions) {  return create(funnel, expectedInsertions, 0.03D);}

在重新設(shè)置誤判率為 0.0002 之后,我們重新運行程序,這時控制臺會輸出以下結(jié)果:

已匹配數(shù)量 1000003

復(fù)制代碼通過觀察以上的結(jié)果,可知誤判率 fpp 的值越小,匹配的精度越高。當減少誤判率 fpp 的值,需要的存儲空間也越大,所以在實際使用過程中需要在誤判率和存儲空間之間做個權(quán)衡。

六、總結(jié)

本文主要介紹的布隆過濾器的概念和常見的應(yīng)用場合,在實戰(zhàn)部分我們演示了 Google 著名的 Guava 庫所提供布隆過濾器(Bloom Filter)的基本使用,同時我們也介紹了布隆過濾器出現(xiàn)誤報的原因及如何提高判斷準確性。最后為了便于大家理解布隆過濾器,我們介紹了一個簡易版的布隆過濾器 SimpleBloomFilter。

本篇文章就到這里了,希望能夠給你帶來幫助,也希望您能夠多多關(guān)注腳本之家的更多內(nèi)容!      

相關(guān)文章

  • Spring注解驅(qū)動之@EventListener注解使用方式

    Spring注解驅(qū)動之@EventListener注解使用方式

    這篇文章主要介紹了Spring注解驅(qū)動之@EventListener注解使用方式,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2022-09-09
  • Mybatis-Plus3.x的創(chuàng)建步驟及使用教程

    Mybatis-Plus3.x的創(chuàng)建步驟及使用教程

    MyBatis-Plus是一個?MyBatis?的增強工具,在?MyBatis?的基礎(chǔ)上只做增強不做改變,為?簡化開發(fā)、提高效率而生,這篇文章主要介紹了Mybatis-Plus3.x的使用,需要的朋友可以參考下
    2023-10-10
  • Spring?Data?Jpa?中原生查詢?REGEXP?的使用詳解

    Spring?Data?Jpa?中原生查詢?REGEXP?的使用詳解

    這篇文章主要介紹了Spring?Data?Jpa?中原生查詢?REGEXP?的使用詳解,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2021-12-12
  • 在SpringBoot中使用lombok的注意事項

    在SpringBoot中使用lombok的注意事項

    這篇文章主要介紹了在SpringBoot中使用lombok的注意事項,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2021-12-12
  • 使用BigInteger實現(xiàn)除法取余

    使用BigInteger實現(xiàn)除法取余

    這篇文章主要介紹了使用BigInteger實現(xiàn)除法取余操作,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2021-08-08
  • 使用Java WebSocket獲取客戶端IP地址的示例代碼

    使用Java WebSocket獲取客戶端IP地址的示例代碼

    在開發(fā)Web應(yīng)用程序時,我們通常需要獲取客戶端的 IP 地址用于日志記錄、身份驗證、限制訪問等操作,本文將介紹如何使用Java WebSocket API獲取客戶端IP地址,以及如何在常見的WebSocket框架中獲得客戶端 IP地址,需要的朋友可以參考下
    2023-11-11
  • 教你如何精準統(tǒng)計出你的接口

    教你如何精準統(tǒng)計出你的接口"QPS"

    今天小編就為大家分享一篇關(guān)于QPS的精準計算方法,小編覺得內(nèi)容挺不錯的,現(xiàn)在分享給大家,具有很好的參考價值,需要的朋友一起跟隨小編來看看吧
    2021-08-08
  • SpringBoot整合ES解析搜索返回字段問題

    SpringBoot整合ES解析搜索返回字段問題

    這篇文章主要介紹了SpringBoot整合ES解析搜索返回字段問題,本文給大家介紹的非常詳細,對大家的學(xué)習(xí)或工作具有一定的參考借鑒價值,需要的朋友可以參考下
    2023-03-03
  • Java 8中HashMap的底層原理解析

    Java 8中HashMap的底層原理解析

    HashMap作為Java中常用的數(shù)據(jù)結(jié)構(gòu)之一,在JDK 1.8中經(jīng)過了一系列的優(yōu)化和改進,深入理解其底層原理,包括哈希算法、數(shù)組與鏈表結(jié)構(gòu)、紅黑樹的引入等,有助于更好地使用和理解HashMap的性能特性,這篇文章主要介紹了Java 8中HashMap的底層原理,需要的朋友可以參考下
    2023-11-11
  • MyBatis-Plus框架整合詳細方法

    MyBatis-Plus框架整合詳細方法

    MyBatis-Plus是一個 MyBatis 的增強工具,在 MyBatis 的基礎(chǔ)上只做增強不做改變,為簡化開發(fā)、提高效率而生這篇文章主要介紹了MyBatis-Plus框架整合,需要的朋友可以參考下
    2022-04-04

最新評論

涿鹿县| 门源| 鄂尔多斯市| 襄樊市| 大同市| 海门市| 诏安县| 岳阳市| 梓潼县| 玉树县| 舒城县| 浏阳市| 吉木萨尔县| 高要市| 长海县| 旌德县| 赤水市| 安顺市| 于都县| 五莲县| 平果县| 河源市| 平原县| 塔城市| 富川| 简阳市| 淮滨县| 阿瓦提县| 武山县| 兴仁县| 潍坊市| 东光县| 宜黄县| 晋中市| 德昌县| 赣榆县| 贺州市| 定兴县| 武强县| 涿鹿县| 潜山县|