RL基础学习

Zhenguo Chen | 2026/04/17

强化学习基本概念

概念

结构

常见强化学习算法

DQN

AC

A2C

PPO

graph LR
    A[Agent] -->|action| B[Environment]
    B -->|observation| A
    B -->|reward| A