1. 範圍
float和double的範圍是由指數的位元來決定的。
float的指數位有8位,而double的指數位有11位,分布如下:
float:
1bit(符號位) 8bits(指數位) 23bits(尾數位)
double:
1bit(符號位) 11bits(指數位) 52bits(尾數位),如所示。
於是,float的指數範圍為-127~+128,而double的指數範圍為-1023~+1024,並且指數位是按補碼的形式來劃分的。
其中負指數決定了浮點數所能表達的絕對值最小的非零數;而正指數決定了浮點數所能表達的絕對值最大的數,也即決定了浮點數的取值範圍。
float的範圍為-2^128 ~ +2^128,也即-3.40E+38 ~ +3.40E+38;double的範圍為-2^1024 ~ +2^1024,也即-1.79E+308 ~ +1.79E+308。
2. 精度
float和double的精度是由尾數的位元來決定的。浮點數在記憶體中是按科學計數法來儲存的,其整數部分始終是一個隱含著的“1”(後面會講到),由於它是不變的,故不能對精度造成影響。
float:2^23 = 8388608,一共七位,這意味著最多能有7位有效數字,但絕對能保證的為6位,也即float的精度為6~7位有效數字;如果此處不明白可以看一下此處說明:假設有一個十進位小數0.000001,它為6位元,轉化為二進位則需不斷的乘2取整,把0.暫且不看,只看000001,不斷乘2,有多少個2才能達到6位元字的長度呢?答案為19個時剛好能達到6位,大小為524288,顯然沒有包含所有的6位元字,因而當達到20個2時,達到1048576七位元了,顯然可以包含所有的6位元了,因而說絕對精確到小數點後6位;而float所給的尾數部分為23位,2^23=8388608,依然沒有超過7位,所以說最多有7位有效數字。double同理。
double:2^52 = 4503599627370496,一共16位,同理,double的精度為15~16位
下面以float為例說明十進位float轉與二進位float之間的轉換原理
浮點型變數在電腦記憶體中佔用4位元組(Byte),即32-bit。遵循IEEE-754格式標準。
一個浮點數由2部分組成:底數m 和 指數e。
±mantissa × 2exponent 公式中的mantissa 和 exponent使用二進位表示
底數部分 使用2進位數來表示此浮點數的實際值。
指數部分 佔用8-bit的位元,可表示數值範圍為0-255。
但是指數應可正可負,所以IEEE規定,此處算出的次方須減去127才是真正的指數。所以float的指數可從 -127到128.
底數部分實際是佔用24-bit的一個值,由於其最高位始終為 1 ,所以最高位省去不儲存,在儲存中只有23-bit。為什麼最高位會始終為1呢?看此處說明:
{
數字float 9.125在十進位中用科學計算的方式表示為9.125*10^0 ,但是在電腦中,電腦只認識0和1,所以在電腦中是按照科學計算的二進位的方式表示的:
9的二進位表示為1001
0.125的二進位表示為0.001
所以91.25的表示成1001.001 將其表示成二進位的科學計數方式為 1.001001*2^3 (小數點左移三位,後面有說明)
在電腦中,任何一個數都可以表示成1.xxxxxx*2^n 這樣的形式,
其中xxxxx就表示尾數部分,n表示指數部分
其中,因為最高位橙色的1這裡,由於任何的一個數表示成這種形式時這裡都是1,所以在儲存時實際上並不儲存這一位,這使得float的23bit的尾數可以表示24bit的精度,double中52bit的尾數可以表達53bit的精度。
}
到目前為止, 底數部分 23位 加上指數部分 8位 使用了31位。那麼前面說過,float是佔用4個位元組即32-bit,那麼還有一位是幹嘛用的呢? 還有一位,其實就是4位元組中的最高位,用來指示浮點數的正負,當最高位是1時,為負數,最高位是0時,為正數。
浮點數據就是按下表的格式儲存在4個位元組中:
Address+0 Address+1 Address+2 Address+3
電腦內float資料存放區格式:(對應圖中float)
SEEE EEEE EMMM MMMM MMMM MMMM MMMM MMMM
S: 符號位,表示浮點數正負,1為負數,0為正數
E: 指數位,指數加上127後的值的位元
M: 尾數位,24-bit的底數(只儲存23-bit)
主意:這裡有個特例,浮點數 為0時,指數和底數都為0,但此前的公式不成立。
因為2的0次方為1,所以,0是個特例。當然,這個特例也不用認為去幹擾,編譯器會自動去識別。
通過上面的格式,我們下面舉例看下-12.5在電腦中儲存的具體資料:
Address+0 Address+1 Address+2 Address+3
0xC1 0x48 0x00 0x00
接下來我們驗證下上面的資料表示的到底是不是-12.5,從而也看下它的轉換過程。
由於浮點數不是以直接格式儲存,他有幾部分組成,所以要轉換浮點數,首先要把各部分的值分離出來。
Address+0 Address+1 Address+2 Address+3
格式 SEEEEEEE EMMMMMMM MMMMMMMM MMMMMMMM
二進位 11000001 01001000 00000000 00000000
16進位 C1 48 00 00
可見:
S: 為1,是個負數。
E:為 10000010 轉為10進位為130,130-127=3,即實際指數部分為3.
M:為 10010000000000000000000。 這裡,在底數左邊省略儲存了一個1,使用 實際底數表示為 1.10010000000000000000000
到此,我們把三個部分的值都拎出來了,現在,我們通過指數部分E的值來調整底數部分M的值。
調整方法為:
如果指數E為負數,底數的小數點向左移,如果指數E為正數,底數的小數點向右移。小數點移動的位元由指數E 的 絕對值決定。
這裡,E為正3,使用向右移3為即得:1100.10000000000000000000
這個結果就是12.5的二進位浮點數,將他換算成10進位數就看到12.5了,
如何轉換,看下面:
小數點左邊的1100 表示為 (1 × 2^3) + (1 × 2^2) + (0 × 2^1) + (0 × 2^0), 其結果為 12 。
小數點右邊的 .100… 表示為 (1 × 2^-1) + (0 × 2^-2) + (0 × 2^-3) + ... ,其結果為.5 。
以上二值的和為12.5, 由於S 為1,使用為負數,即-12.5 。
所以,16進位 0XC1480000 是浮點數 -12.5 。
上面是如何將電腦儲存中的位元如何轉換成實際浮點數,下面看下如何將一浮點數裝換成電腦儲存格式中的位元。
舉例將17.625換算成 float型。
首先,將17.625換算成二進位位:10001.101 ( 0.625 = 0.5+0.125, 0.5即 1/2, 0.125即 1/8 )
再將 10001.101 小數點向左移,直到小數點前只剩一位 成了 1.0001101 x 2的4次方(因為右移了4位)。此時 我們的底數M和指數E就出來了:
底數部分M,因為小數點前必為1,所以IEEE規定只記錄小數點後的就好,所以此處底數為 0001101 。
指數部分E,實際為4,但須加上127,固為131,即位元 10000011
符號部分S,由於是正數,所以S為0.
綜上所述,17.625的 float 儲存格式就是:
0 10000011 00011010000000000000000
轉換成16進位:0x41 8D 00 00
所以,一看,還是佔用了4個位元組。
實際上在X86電腦中,採用的是小端儲存方式,即低地址儲存低位元據,高地址儲存高位元據。
(10應該為8D,拷貝的圖,沒改)
此貼參考一下三處文章,其中敘述有錯誤的地方已改正。如本帖有錯,還請指正。
http://blog.sina.com.cn/s/blog_8a18c33d01013bke.html
http://blog.csdn.net/guqsir/article/details/7015267
http://www.cnblogs.com/BradMiller/archive/2010/11/25/1887945.html