强化学习在游戏 AI 中的探索:从 Q-Learning 到 PPO 算法实践
强化学习(RL)通过智能体与环境的交互试错来寻找最优策略,是通用人工智能的重要拼图。
- Q-Learning / DQN:在离散动作空间(如 Atari 小游戏)表现亮眼;
- PPO (Proximal Policy Optimization):现代连续控制任务(机械臂、机器人步态、大模型 RLHF 对齐)的主力算法。
通过设定合理的奖励函数(Reward Shaping),看 AI 从乱跑乱撞到学会惊艳的高难度走位,过程非常有趣!