位元深度與採樣率

來源:互聯網
上載者:User

雖然我們並不是數字音頻工程師,但是增加一些關於位元深度和採樣率的背景知識對涉及到數字音樂的每一個人來說都是有好處的。無論你知不知道,這些都是你每天會接觸的東西。無論是突破個人對數字音頻理解的障礙還是作為社交談話中資料,這些都是很棒的背景知識。

概覽

那麼首先我們要瞭解的就是位元深度和採樣率只存在於數字音頻中。在數字音頻中,位元深度描述的是振幅(縱軸),採樣率描述的是頻率(橫軸)。所以,增加我們使用的位元就是提高聲音振幅的解析度,而增加每秒的採樣數則是在增加對聲音頻率的解析度。

在類比系統中(自然世界),音頻是連續和平滑的。在數字系統中,平滑的類比波形只能被近似地採樣,而且限制在一定的振幅範圍裡。當採樣一個聲音時,音頻被切分成了很小的片段(採樣),這些採樣會固定在一個振幅電平上。將訊號修正到某個振幅電平上的處理叫做量化,建立採樣片段的處理叫做採樣。

在下面的圖表裡,形象地展示了一個長達1s的自然正弦波,從0s開始到1s結束的情況。藍色的條代表了正弦波數字量化的近似值,每一條就是一個採樣,被修正到可用的近似振幅電平上。(當然圖表比現實情況要更加粗略。)

根據錄音時選擇,時間長度1s的音頻可能有44.1K,48K個採樣,在24位的情況下包含了-144dB到0dB的振幅電平(16位為-96dB到0dB)。動態範圍的解析度(採樣可以使用的振幅電平單位元量,即圖示的矩形數量)在16位下為65536個,24位下為16777216個。

所以增加位元深度能極大地提升振幅解析度和動態範圍。那麼,動態範圍的增加會在哪裡得以體現呢?因為振幅不能超過0dB,所以增加的dB會被分配到振幅較小的採樣上。因此人們能聽到更多微小的聲音(比如延展到-130dB的混響軌跡),而這些聲音在16位,-96dB的情況下會被削減掉。

取整和捨棄

在數字音頻中,每個採樣都經過分析,處理,轉換成音頻,然後從音箱裡播放出來。當一個採樣在你的DAW裡被處理時(增益,失真等),它們通過基本的乘除運算讓數字代表的採樣被改變。很簡單,如果我們不做取整的處理(1dB的增益需要乘以1.122018454),那麼即使8或4位的採樣精度也會超過24位的空間。

所以,因為我們只有24位,所以這些長的數字必須滿足這個空間。為了這麼做,數位訊號處理器會對最低有效位(LSB - 位元裡的最後一位 - 例如,16位採樣裡的第16個數字)做取整或捨棄的處理。取整相當直接,採用的也是你熟悉的演算法。捨棄則不通過分析就棄掉最低有效位後的資訊。

這兩種處理都是存在一定誤差的,它們會給等式引入誤差,這些誤差通過訊號鏈處理進行累加,最後反應出來。積極的一面是LSB是振幅最小的數字位,所以在16位採樣裡誤差出現在-96dB,24位採樣在-144dB。同時,數位訊號處理器的不同的結構和方式也會導致結果的不同。

抖動處理

我們現在知道了數字訊號處理必然會有很多誤差的存在。那麼,總數的近似值也會出現很多誤差。這些錯誤不僅讓音頻無法完全複原,也引入了不自然的聽感。

為了消除這些不自然,我們將計算而得的低振幅噪音加入用到訊號中,我們稱之為抖動處理。抖動的噪音振幅很低,雖然還是能聽見一些,但比沒有加入的情況要好。

波形展示了抖動處理的效果。抖動被用在上面的波形中。

要記住抖動的噪音是會不斷累積的。當你給訊號增加噪音時,信噪比就降低了。如果反覆操作,這個比例就會持續降低,會給訊號增加不確定的因素。這就是為什麼抖動處理通常被應用在母帶處理的最後一步,而且只使用一次。

抖動處理有一段相當有趣的曆史:

最早的抖動處理出現在二戰時期。轟炸機使用機械電腦來做導航和彈道計算。奇怪的是這些電腦在空中的處理效能更加精確。工程師們意識到,飛機的震動減少了運動部分的誤差。它們的運動變得更有連續性,而不是突然的震動。電腦裡有小的震動電機,它們的震動被成為抖動,這是從中世紀的英文單詞“didderen”衍生而來的,意思是“發抖”。現代辭典定義抖動(dither)為高度緊張,迷惑或焦慮的狀態。在一定程度上來說,抖動讓數字化的系統更接近了類比系統。

- Ken Pohlmann,數字音頻規則

採樣率

根據理論,每秒44.1K的採樣率已經足夠覆蓋人耳的聽力範圍了。你可能在無意中瞭解過尼奎斯特定理,它表述了如何避免混淆現象(一種失真)和如何通過採樣重建所有頻率,它要求使用訊號最高頻率的兩倍來進行採樣(這個定理也應用在音頻之外的媒體上,這裡我們就不進行深入探討了)。

人耳的聽力範圍最高能達到20kHz(多數研究表明這個數字實際是在17K左右),因此40K的採樣率就足夠聽清每一個頻率了。44.1K是行業標準,因為一些原因被當時寡頭壟斷的SONY確定。

那麼長話短說,數字音頻採樣必須高於尼奎斯特頻率,因為實際運用中,採樣會在數模轉換的過程中通過低通濾波來避免混淆現象。低通濾波器的斜度越平緩,製造的成本越低。因此,通常使用低通濾波器的音頻訊號會在2kHz的位置有平緩的斜度。比如,要保留20kHz以下完整的頻譜,必須在44kHz的採樣率下完成(20K[最高頻率]+2K[低通濾波器的斜度]x2[尼奎斯特理論]=44K)

最終,44.1K的標準在Sony和Philips(它們都有相似的最終目的)的鬥爭中被確定。這也是根據音頻採樣率和錄影磁帶剖析學背後的數學理論得出的。這樣音頻和視頻可以在同樣錄影磁帶中共存,擁有更高的性價比。然而,48K是音頻相關的視頻的標準。CD音頻還是保持在44.1K。

圖片是用Logic錄製的“自然”底鼓的採樣電平。你可以看到聲音是怎麼用波形近似的矩形來採樣和量化的。原始的鼓聲不會有這樣的失真。

你能聽到嗎?

有人聲稱自己能夠聽出44.1K採樣率和96K採樣率的區別。大部分人把這種不同歸結於頻寬的增加(96K代表頻率上限為48kHz)。雖然我也意識到更多的採樣會帶來一些細微的清晰度改變,但是因此認為這些不同是因為更高的頻率產生的是不太正確的(至少不是直接相關)。

多種測試表明,實際上是低通濾波造成了這些聽覺上的差異。因為低通濾波對更高採樣率產生的不自然影響已經不在可聽的頻譜範圍裡了。將濾波器切斷的點從22kHz移到48kHz,因此降低了濾波器在可聽範圍內的影響,確保了大部分的不自然現象出現在超聲波的頻譜中。

這樣可以使可聽頻譜更加乾淨,造成了更高的頻譜/採樣率能更真實地還原音訊錯覺。雖然這的確是創造出了更真實的音頻,不過這都是因為使用高的採樣率來抵消數模轉換過程裡低通濾波器設計不足的原因。

這些資訊夠了?

那麼,這就是我要說的。我意識到,這可能需要專門開設一門課程,不過總比一點資訊沒有的好。瞭解你正在使用的工具絕不會是一件壞事,作為音樂創作人,這些都是你需要知曉的細節。不過,對於母帶工程師和發燒友,這些可能不太適合。LLM

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.