模擬層
3D 模擬器提供一個可以無限重來的賽道。撞牆不用修車,跑一萬圈也不用換電池,所以絕大部分的學習都發生在這裡。
從模擬訓練、策略學習、模型部署,到實體賽道上的驗證與再改進 ——這是一個會不斷回到起點的迴圈。
3D 模擬器提供一個可以無限重來的賽道。撞牆不用修車,跑一萬圈也不用換電池,所以絕大部分的學習都發生在這裡。
PPO 演算法根據每一圈拿到的獎勵,一點一點調整模型的參數。訓練過程中的曲線與回放都留在本機,隨時可以回頭看。
同一個模型放上 TopRacer Car,在 TopRacer Map 2018 上實際跑一趟。這一趟會告訴你,模擬裡學到的東西有多少真的成立。