從海量資料尋找有或者沒有出現的資料

來源:互聯網
上載者:User

現在有1千萬個隨機數,隨機數的範圍在1到1億之間。現在要求寫出一種演算法,將1到1億之間沒有在隨機數中的數求出來。  

解決辦法:

一)用一個32位的整數32位表示32個數,1億/32 = 3125000,使用3.125 * 4M byte空間即可儲存1億個數,即index[3125000].
二)對於數n,(n-1) / 32 為其在數組中的下標,table[(n - 1) % 32]與數組中下標(n-1)/32的值使用或操作。
三)表table中值為   table[ 0 ]=0x00000001,
                                table[ 1 ]=0x00000002,
                                ... ...
                                table[29]=0x20000000,
                                table[31]=0x80000000,   等這樣的表示方式,具體的數值使用查表法加快速度。
四)最後算某值是否存在,使用與操作即可計算出。
資料存放區比如:
第一個N=30是一個隨機數,則儲存可以表示為:index[(30-1)/32] = index[0] = index[0] || table[(30-1)%32] /*剛開始時候初始化index[32]={0}*/
                                                                          =  0 || 0x20000000 = 0x20000000;
第二個N=31是一個隨機數,則儲存可以表示為:index[(31-1)/32] = index[0] = index[0] || table[(31-1)%32] /*第30位1,其他位為0*/
                                                                          =  0x20000000 || 0x40000000 = 0x60000000;
... ...
依次類推,即可。
資料驗證比如:
1. 當要查詢30是否存在的時候,由於:(30-1)/32 = 0;(30-1)%32=29;我們只需要計算:index[0] & table[29] 是真還是假,就可以得出30是否存在。
2. 當要查詢31是否存在的時候,由於:(31-1)/32 = 0;(31-1)%32=30;我們只需要計算:index[0] & table[30] 是真還是假,就可以得出31是否存在。
... ...
依次類推,即可。
小結:
        通過分析此題目,首先這種思路和方法,在一定程度上用相對小的空間儲存了大量的資料,節省了比較大的記憶體空間;在運算方面,位元運算的速度相當來說效率是比較高的,因而也再一定程度上節省了時間複雜。

        總之,這種儲存方式和思維方式,在一定方面能夠有效解決海量資料存放區與運算。基於此題目,凡是大量資料篩選,判斷是否存在等問題,我們都可以借鑒此題目的思維和方法。

http://blog.csdn.net/tianmo2010/article/details/6843349

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.