平台

從模擬訓練、策略學習、模型部署,到實體賽道上的驗證與再改進 ——這是一個會不斷回到起點的迴圈。

三個層次

模擬層

3D 模擬器提供一個可以無限重來的賽道。撞牆不用修車,跑一萬圈也不用換電池,所以絕大部分的學習都發生在這裡。

學習層

PPO 演算法根據每一圈拿到的獎勵,一點一點調整模型的參數。訓練過程中的曲線與回放都留在本機,隨時可以回頭看。

實體層

同一個模型放上 TopRacer Car,在 TopRacer Map 2018 上實際跑一趟。這一趟會告訴你,模擬裡學到的東西有多少真的成立。

為什麼一定要有實體那一段

模擬器再細,也只是真實世界的一個近似。地板的摩擦力、光線的變化、電池電量掉下來之後的動力差異,這些都不會完整出現在模擬裡。實體那一趟跑完,你才知道哪些是模型真的學會了,哪些只是學會了怎麼應付模擬器。這個落差本身就是最值得研究的題目之一。