問題:要求寫一個浮點型資料轉換成字串資料的函數,輸入參數:float var = 8974564.53,輸出結果:string result = "8974564.5300000000"(保留小數點後10位元字)。但是在實際編碼時,無論採用何種方法,所出現的結果是"8974564.5299999993"。
原因:由於十進位小數到二進位小數之間無法一一印射,所以電腦所表示的浮點數僅僅是實數的有限集合。如果電腦無法將8974564.53印射成一個在精度範圍之內準確表達的位元,將用最接近這個數的位元代替。在本例中,電腦無法精確表達資料8974564.53,因此它在它所能表達的有限實數集中選擇了8974564.5299999993(事實上也不是這個數字,只不過由於我們選取的精度而四捨五入成這樣的數字,當我們設定輸出的小數點後數字位元更大時,將顯示為8974564.52999999932944774627685546875)。
解決方案:人為設定浮點數的保留位元。
IEEE制定的單精確度浮點數標記法:1位符號位,8位指數位,23位小數部分;
IEEE制定的雙精確度浮點數標記法:1位符號位,11位指數位,52位小數部分。
可以大致確定電腦在儲存一個浮點數所選取的替代數的誤差:
以雙精確度浮點數8974564.53為例,8974564.53的整數部分位元為:100010001111000011100100,即該浮點數的指數位為23,因此它的小數部分的誤差為pow(0.5, 52 – 23) = 0.000000001862645149230957 ≈ 0.0000000019。通過測試可知兩個相鄰的能夠精確表示的雙精確度浮點數之間的誤差:8974564.5300000012 - 8974564.5299999993 = 0.0000000019,這與之前的計算結果完全吻合。
由此可以斷定為了準確表示雙精確度浮點數8974564.53,小數點後位元不能超過8。
將上面的計算過程設計函數getPrecision:(PS:這個函數無法適用於實際用途,僅僅作為實際編碼時的參考)
#include <stdio.h>
#include <limits.h>
#include <math.h>
#include <assert.h>
#define FLOAT_DECIMAL_DIGITS 23 // 單精確度浮點數小數位 23,指數位8位
#define DOUBLE_DECIMAL_DIGITS 52 // 雙精確度浮點數小數位 52,指數位11位
template<typename Type>
int getPowerBinary(Type number)
{
// 當浮點數整數部分大於一個long int能夠表示的最大值時,顯然它的小數部分是不可能精確表示的,它的整數部分通常也不可能準確表示
assert(number <= LONG_MAX);
if (number >= LONG_MAX) return -1;
// 計算二進位浮點數指數位位元
long int power, integer = static_cast<long int>(number);
for (power = 0; integer >> power > 0; ++power);
return power;
}
int getDecimalDigits(float number)
{
return (FLOAT_DECIMAL_DIGITS + 1 - getPowerBinary(number));
}
int getDecimalDigits(double number)
{
return (DOUBLE_DECIMAL_DIGITS + 1 - getPowerBinary(number));
}
// 取得浮點數表示小數點後數位最佳精確位元
// warning: 此函數只能正常工作在如下情況:number的整數部分小於一個long int所能表示的最大值
template<typename Type>
int getPrecision(Type number)
{
double error = pow(0.5, getDecimalDigits(number));
return static_cast<int>(-(log10(error)));
}