AI 赛车快速免费训练,强化学习教学轻松实现

1/28 小车开进教室 —— 在自己的电脑上无限次训练,在真的赛道上人人下场。

强化学习是一个循环

模型不是写出来的,是跑出来的。跑一轮,看结果,改一改,再跑一轮。

  1. 设计

    决定车子能做哪些动作,以及什么样的表现算好。动作空间与奖励函数是你唯一能对模型下的指令,也是这个循环真正的起点。

    赛道展开成一段一段的网格,沿途每个位置都画着车。
    设计从赛道本身开始 —— 整条赛道摊成一段一段,车沿途每个位置都摊开在眼前。

    相关服务: TopRacer Console

  2. 训练

    在 3D 模拟器里反复尝试,用 PPO 从每一次的结果中学习。撞了就重来,这一步在自己的电脑上完成。

    Console 训练进行中:平均回报逐轮上升的曲线、模拟器里的 3D 相机视野,以及赛道图上以红线画出的每一次尝试。
    PPO 在 Console 里训练 —— 每一轮的平均回报、车在模拟器里看到的画面,和每一次尝试留下的轨迹。

    相关服务: TopRacer Console

  3. 部署与实跑

    把训练好的模型送进 TopRacer Car,在 TopRacer Map 2018 上实际跑一趟 —— 不需要为了上车而重写。

    教室里的实跑:学生和老师围着地上的 TopRacer 赛道,车正在跑。脸部已做模糊处理。
    模型上了真车,在教室地板的 TopRacer Map 2018 跑一圈,全班围着看。

    相关服务: TopRacer Map 2018 TopRacer Car MiniDeepCar 线上赛注册服务

  4. 评测与思考

    从圈速、行驶路径与失误里读出发生了什么事,然后决定下一轮要改什么。想清楚这件事,比再多训练一轮更有用。

    行驶记录查看器重放一趟实跑:当下的相机画面、播放控制,以及模型逐帧实际下的转向角曲线。
    逐帧重放一趟实跑,看模型当下实际下的舵量。

    相关服务: TopRacer Map 2018 TopRacer Car MiniDeepCar

回到第一步 改好的设置回到第一步,再训练一轮。这个循环可以一直跑下去,而每一轮你都看得到它变好了多少。

TopRacer 是为谁做的

我们选 1/28 的小车,是为了让每一个学生都轮得到真车 —— 而不是全班看一台大车表演。

给老师

一间教室、一位老师、一学期跑完整个 AI 循环

1/18 的大车方案是为大型活动设计的:大车要大赛道、大赛道要体育馆、要场租、要空调、要一个团队搬进搬出——所以一年只办得起一次。

TopRacer 用 1/28 的小车:赛道摊在教室地板,下课卷起来收进柜子。训练软件免费——要收费的训练平台连预算科目都难立,免费的连签核都不用;训练在学生自己的电脑上跑,没有云端账单,总预算在下单那天就是最终数字,采购单一页写得完。

更重要的是课排得下去:有些平台一场训练跑好几个小时,这节课按下训练、下周才看得到结果,课就断了。TopRacer 在本机几分钟跑完一轮——当堂改奖励函数、当堂看结果、当堂检讨,一节课就是一个完整的实验循环。从第一堂课到期末班级赛,一位老师就能撑起整套,每个学生的记录都留在工具里,评量有凭有据。

谈谈你的需求

给学生

假设随你改、实验跑不完;练好了,下场见真章

训练系统免费,意思是没有训练次数上限。改一个奖励函数就是一个假设,按下训练就是一次实验——猜错了?改了再跑,今晚可以再试十次。

别的平台每一次实验都在烧钱;你的实验跑不完也不用钱,这才是科学方法该有的样子:不断假设、不断验证。

然后是实体赛:车小到每组桌上放一台,赛道就在教室后面。模型是你一轮一轮实验出来的,练好了当场部署、当场下场,圈速上排行榜,这学期就跟全班比一场。

免费下载 TopRacer Console

给大型赛事主办

同样的场地、同样的预算,十倍的花样

过去的 AI 赛车活动长什么样?一条赛道加一台大车,全场就这一出戏:一台一台轮流跑同一条道,第一年新鲜、第二年重播、第三年观众滑手机。不是预算不够,是大车把整个场地吃掉之后,就再也变不出花样了。

换成 1/28,同一个场地的可能性完全不同:放得进复杂赛道——赛道库几十条,从短道冲刺到上百米的长赛道都有——也放得下好几条不同的赛道同时开跑。资格赛、淘汰赛、多道并行的分组对决,赛制随你排,每一年都能换一套玩法。

赛务不拖累创意:报名、圈速、轨迹、排行榜自动完成,大屏幕直接投排行榜;参赛者赛前在家免费练,来的都是有备而来的,决赛就是好看。

办一场赛

学校与团体采购

TopRacer Car 与 TopRacer Map 2018 即将开售。如果你正在为课程或社团评估,欢迎先与我们谈谈需求。