平台

从模拟训练、策略学习、模型部署,到实体赛道上的验证与再改进 ——这是一个会不断回到起点的循环。

三个层次

模拟层

3D 模拟器提供一个可以无限重来的赛道。撞墙不用修车,跑一万圈也不用换电池,所以绝大部分的学习都发生在这里。

学习层

PPO 算法根据每一圈拿到的奖励,一点一点调整模型的参数。训练过程中的曲线与回放都留在本机,随时可以回头看。

实体层

同一个模型放上 TopRacer Car,在 TopRacer Map 2018 上实际跑一趟。这一趟会告诉你,模拟里学到的东西有多少真的成立。

为什么一定要有实体那一段

模拟器再细,也只是真实世界的一个近似。地板的摩擦力、光线的变化、电池电量掉下来之后的动力差异,这些都不会完整出现在模拟里。实体那一趟跑完,你才知道哪些是模型真的学会了,哪些只是学会了怎么应付模拟器。这个落差本身就是最值得研究的题目之一。