產生對抗網路GAN(二) 語音相關_神經網路

來源:互聯網
上載者:User
多任務對抗學習[1]


為了獲得對噪音的魯棒性,引入多任務學習,分為三個網路:
- 輸入網路(綠色),用作特徵提取器
- senone輸出網路(紅色),用作senone分類
- domain輸出網路(藍色),domain這裡指噪音的類型,總共17種雜訊

為了增加對噪音的魯棒性,增加了GRL層(gradient reversal layer),網路在反向傳播的時候,對於domain網路過來的梯度取了 −α ,也就是增加噪音分類的錯誤率,以便獲得senone-discriminative domain-invariant的特徵。
[2]和[1]的思想類似。 SEGAN[3]

主要用來做語音增強(比如降噪)等。
結合conditional GAN和LSGAN,使用 L1 norm,最後的loss如下:
minDVLSGAN(D)=12Ex∼pdata(x,xc)[(D(x,xc)−1)2]+12Exc∼pdata(xc),z∼pz(z)[D(G(z,xc))2]
minGVLSGAN(G)=12Ex∼pdata(xc),z∼pz(z)[(D(G(z,xc))−1)2]+λ∥G(z,x~)−x∥1
一些參數的含義如下:
x : noise speech
xc : clean speech
z : 服從常態分佈的noise samples

訓練流程如下:

訓練的時候需要clean speech和noisy speech的pair,以保證在去除雜訊的同時保留原始語音的資訊。 參考文獻

[1].Adversarial Multi-task Learning of Deep Neural Networks for Robust Speech Recognition
[2].Invariant Representations for Noisy Speech Recognition
[3].SEGAN: Speech Enhancement Generative Adversarial Network

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.