Redis實現唯一計數的3種方法分享_Redis

來源:互聯網
上載者:User

唯一計數是網站系統中十分常見的一個功能特性,例如網站需要統計每天訪問的人數 unique visitor (也就是 UV)。計數問題很常見,但解決起來可能十分複雜:一是需要計數的量可能很大,比如大型的網站每天有數百萬的人訪問,資料量相當大;二是通常還希望擴充計數的維度,比如除了需要每天的 UV,還想知道每周或每月的 UV,這樣導致計算十分複雜。

在關聯式資料庫儲存的系統裡,實現唯一計數的方法就是 select count(distinct <item_id>),它十分簡單,但是如果資料量很大,這個語句執行是很慢的。用關聯式資料庫另外一個問題是插入資料效能也不高。

Redis 解決這類計數問題得心應手,相比關聯式資料庫速度更快,消耗資源更少,甚至提供了 3 種不同的方法。

1.基於 set

Redis 的 set 用於儲存唯一的資料集合,通過它可以快速判斷某一個元素是否存在於集合中,也可以快速計算某一個集合的元素個數,另外和可以合并集合到一個新的集合中。涉及的命令如下:

複製代碼 代碼如下:

SISMEMBER key member  # 判斷 member 是否存在
SADD key member  # 往集合中加入 member
SCARD key   # 擷取集合元素個數

基於 set 的方法簡單有效,計數精確,適用面廣,易於理解,它的缺點是消耗資源比較大(當然比起關聯式資料庫是少很多的),如果元素個數很大(比如上億的計數),消耗記憶體很恐怖。

2.基於 bit

Redis 的 bit 可以用於實現比 set 記憶體高度壓縮的計數,它通過一個 bit 1 或 0 來儲存某個元素是否存在資訊。例如網站唯一訪客計數,可以把 user_id 作為 bit 的位移量 offset,設定為 1 表示有訪問,使用 1 MB的空間就可以存放 800 多萬使用者的一天訪問計數情況。涉及的命令如下:

複製代碼 代碼如下:

SETBIT key offset value  # 設定位資訊
GETBIT key offset        # 擷取位資訊
BITCOUNT key [start end] # 計數
BITOP operation destkey key [key ...]  # 位元影像合并

基於 bit 的方法比起 set 空間消耗小得多,但是它要求元素能否簡易對應為位位移,適用面窄了不少,另外它消耗的空間取決於最大位移量,和計數值無關,如果最大位移量很大,消耗記憶體也相當可觀。

3.基於 HyperLogLog

實現超大資料量精確的唯一計數都是比較困難的,但是如果只是近似的話,計算科學裡有很多高效的演算法,其中 HyperLogLog Counting 就是其中非常著名的演算法,它可以僅僅使用 12 k左右的記憶體,實現上億的唯一計數,而且誤差控制在百分之一左右。涉及的命令如下:

複製代碼 代碼如下:

PFADD key element [element ...]  # 加入元素
PFCOUNT key [key ...]   # 計數

這種計數方法真的很神奇,我也沒有徹底弄明白,有興趣可以深入研究相關文章。

redis 提供的這三種唯一計數方式各有優劣,可以充分滿足不同情況下的計數要求。

相關文章

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.