TORCS無人駕駛筆記_機器學習

來源:互聯網
上載者:User

我們這裡使用了環境狀態作為輸入。使用Deep Q-learning做為學習演算法學習。環境獎勵定義為在單位時刻車輛沿跑道的前進距離。另外,如果車出了跑道或者和其他的車輛相撞,會得到額外懲罰。環境狀態包括車輛的速度、加速度、離跑道的左右邊緣的距離,以及跑道的切線夾角,在各個方向上最近的車的距離等等。車的行為包括向上換擋、向下換擋、加速、減速、向左打方向盤、向右打方向盤等等。

與普通的Deep Q-learning相比,我們做了以下的改進。首先,使用了多步TD演算法進行更新。多步TD演算法能比單步演算法每次學習時看到更多的執行部數,因此也能更快地收斂。其次,我們使用了Actor-Critic的架構。它把演算法的策略函數和值函數分別使用兩個網路表示。這樣的表示有兩個優點:1. 策略函數可以使用監督學習的方式進行初始化學習。2. 在環境比較複雜的時候,學習值函數非常的困難。把策略函數和值函數分開學習可以降低策略函數學習的難度。

使用了改進後的Deep Q-learning演算法,我們學習到的策略在TORCS中可以實現沿跑到行走,換道,超車等行為。基本達到了TORCS環境中的基本駕駛的需要。Google DeepMind直接使用映像作為輸入,也獲得了很好的效果,但訓練的過程要慢很多。

現有的增強學習演算法在自動駕駛類比環境中獲得了很有希望的結果。但是可以看到,如果需要增強學習真正能夠在自動駕駛的情境下應用,還需要有很多改進。第一個改進方向是增強學習的自適應能力。現有的增強學習演算法在環境性質發生改變時,需要試錯很多次才能學習到正確的行為。而人在環境發生改變的情況下,只需要很少次試錯就可以學習到正確的行為。如何只用非常少量樣本學習到正確的行為是增強學習能夠實用的重要條件。

第二個重要的改進方向是模型的可解釋性。現在增強學習中的策略函數和值函數都是由深度神經網路表示的,其可解釋性比較差,在實際的使用中出了問題,很難找到原因,也比較難以排查。在自動駕駛這種人命關天的任務中,無法找到原因是完全無法接受的。

第三個重要的改進方向是推理和想象能力。人在學習的過程中很多時候需要有一定的推理和想象能力。比如,在駕駛時,不用親身嘗試,也知道危險的行為會帶來毀滅性的後果。 這是因為人類對這個世界有一個足夠好的模型來推理和想象做出相應行為可能會發生的後果。這種能力不僅對於存在危險行為的環境下下非常重要,在安全的環境中也可以大大加快收斂速度。

只有在這些方向做出了實質突破,增強學習才能真正使用到自動駕駛或是機器人這種重要的任務情境中。希望更多有志之士能投身這項研究,為人工智慧的發展貢獻出自己的力量。

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.