强化学习基础:MDP、贝尔曼方程、Q学习与DQN 这份思维导图系统梳理强化学习基础,适合人工智能、机器学习、自动控制、数据科学和计算机专业学习者建立序列决策的知识框架。中心主题围绕强化学习从理论到实践的核心路径展开,基础框架部分包含马尔可夫决策过程 MDP、状态、动作、奖励、策略、价值函数和贝尔曼方程,帮助学习者理解智能体如何在环境交互中寻找长期收益;经典方法部分可以串联值迭代、策略迭代、蒙特卡洛方法、时序差分学习和 Q 学习,适合对比有模型与免模型学习;深度突破部分聚焦 DQN、经验回放、目标网络、策略梯度和 Actor-Critic,便于理解深度强化学习如何处理高维状态和复杂策略;它适用于高校课程笔记、AI 论文阅读准备、算法工程师复习、研究生考试延伸学习、项目汇报和技术分享。