认识强化学习

用看得懂的语言说明强化学习与 PPO,以及在模拟中学到的东西如何迁移到真实世界。

强化学习是什么

一般的机器学习需要有人先把正确答案准备好。强化学习没有标准答案,只有一个分数:做得好就加分,做得差就扣分。模型要自己去试,从分数的变化里推敲出什么样的动作比较好。这也是为什么它特别适合用开车来说明 —— 没有人能列出「每一种路况下方向盘该转几度」的完整清单,但你很容易判断一趟开得好不好。

奖励函数在做什么

奖励函数就是你给分的规则,也是你唯一能对模型下的指令。把「跑得快」给高分,模型就会开始切弯;再把「压到线」扣分,它才学会在快与稳之间取舍。写奖励函数常常比调参数更关键 —— 模型永远会朝着分数最高的方向去,包括你没想到的那些钻空子的走法。

PPO 是什么

PPO(Proximal Policy Optimization)是目前应用最广的强化学习算法之一。它的核心想法很务实:每次更新都不要改太多。改太少学得慢,改太多则可能一次把先前学到的东西全毁掉,PPO 用一个约束把每次的调整幅度框在合理范围内,因此训练过程比早期的方法稳定得多。

为什么模拟跟真实会有落差

这个落差有个名字,叫 sim-to-real gap。模拟器里的地板摩擦力是一个固定的数字,真实的地板则到处都不一样;模拟里的马达说转多快就转多快,真实的马达会因为电量而变慢。模型在模拟里的好成绩,有一部分来自它真的学会了开车,有一部分则来自它学会了钻模拟器的空子 —— 把车放到实体赛道上跑一趟,是分辨这两者最直接的办法。