导图社区 强化学习基础:MDP、贝尔曼方程、Q学习与DQN
这份思维导图系统梳理强化学习基础,适合人工智能、机器学习、自动控制、数据科学和计算机专业学习者建立序列决策的知识框架。中心主题围绕强化学习从理论到实践的核心路径展开,基础框架部分包含马尔可夫决策过程 MDP、状态、动作、奖励、策略、价值函数和贝尔曼方程,帮助学习者理解智能体如何在环境交互中寻找长期收益;经典方法部分可以串联值迭代、策略迭代、蒙特卡洛方法、时序差分学习和 Q 学习,适合对比有模型与免模型学习;深度突破部分聚焦 DQN、经验回放、目标网络、策略梯度和 Actor-Critic,便于理解深度强化学习如何处理高维状态和复杂策略;它适用于高校课程笔记、AI 论文阅读准备、算法工程师复习、研究生考试延伸学习、项目汇报和技术分享。
提示: 本内容由社区用户上传并分享。平台不对内容的真实性、合法性、知识产权归属及是否侵害第三方权利进行事前审核或保证。本内容可能包含受版权保护的图片、字体或其他第三方素材,使用前请自行确认授权范围。
这份思维导图系统梳理强化学习基础,适合人工智能、机器学习、自动控制、数据科学和计算机专业学习者建立序列决策的知识框架。中心主题围绕强化学习从理论到实践的核心路径展开,基础框架部分包含马尔可夫决策过程 MDP、状态、动作、奖励、策略、价值函数和贝尔曼方程,帮助学习者理解智能体如何在环境交互中寻找长期收益;经典方法部分可以串联值迭代、策略迭代、蒙特卡洛方法、时序差分学习和 Q 学习,适合对比有模型与免模型学习;深度突破部分聚焦 DQN、经验回放、目标网络、策略梯度和 Actor-Critic,便于理解深度强化学习如何处理高维状态和复杂策略;它适用于高校课程笔记、AI 论文阅读准备、算法工程师复习、研究生考试延伸学习、项目汇报和技术分享。
这张自动控制课程思维导图围绕第四章模糊控制展开,主要内容包括模糊控制概述、模糊控制器结构与工作原理、模糊控制器设计方法与实例、模糊PID控制器等部分。图中整理模糊控制定义、发展历程、特点、整体工作链路、模糊化接口、知识库、规则库、推理机、解模糊接口、输入输出变量、隶属度函数、控制规则、参数整定、Mamdani推理、重心法以及常规PID与模糊PID对比等内容。适用场景包括自动化课程学习、控制工程复习、人工智能控制课程、机电一体化教学、工业控制方案资料、毕业设计、课程设计、实验报告整理、技术培训课件和论文资料梳理。适用人群包括自动化专业学生、控制工程学生、教师、工程师、考研复习用户、课程讲师和技术资料编写者。该图适合与控制系统案例、仿真实验、MATLAB练习、PID参数整定资料和模糊规则表一起使用。
这是一篇关于第三章 专家系统与专家控制系统思维导图,想掌握智能控制的核心秘诀?专家系统与PID的完美结合就是答案!本文系统梳理专家控制的核心理论与应用:从专家PID五大规则(误差极大时输出最大控制量、极值状态强控制等)到增量式PID原理从知识表示、推理机制到工业温度/转速控制实战同时剖析传统PID的局限性,对比专家控制的灵活性、鲁棒性等核心优势无论你是备考还是工程应用,这里都有最硬核的专家控制系统知识图谱!不管是课前预习梳理知识框架、课程随堂笔记记录、期中期末专业课突击复习、控制工程考研长线专项复盘,还是专业教师备课制作教学课件、企业自动化工程师梳理智能控制理论知识,该思维导图模板均可直接套用,无需手动搭建知识框架,支持自由增删拓展公式、例题、推导过程,既能打印纸质版线下背诵刷题,也可电子存档线上随时查阅。模板完整串联专家系统、专家控制、专家 PID 三大核心内容,将复杂智能控制理论转化为直观树状导图,大幅降低理论背诵难度,提升专业课复习与刷题复盘效率,是自动化、智能控制相关专业必备复习素材。
社区模板帮助中心,点此进入>>
这份思维导图系统梳理强化学习基础,适合人工智能、机器学习、自动控制、数据科学和计算机专业学习者建立序列决策的知识框架。中心主题围绕强化学习从理论到实践的核心路径展开,基础框架部分包含马尔可夫决策过程 MDP、状态、动作、奖励、策略、价值函数和贝尔曼方程,帮助学习者理解智能体如何在环境交互中寻找长期收益;经典方法部分可以串联值迭代、策略迭代、蒙特卡洛方法、时序差分学习和 Q 学习,适合对比有模型与免模型学习;深度突破部分聚焦 DQN、经验回放、目标网络、策略梯度和 Actor-Critic,便于理解深度强化学习如何处理高维状态和复杂策略;它适用于高校课程笔记、AI 论文阅读准备、算法工程师复习、研究生考试延伸学习、项目汇报和技术分享。
这张自动控制课程思维导图围绕第四章模糊控制展开,主要内容包括模糊控制概述、模糊控制器结构与工作原理、模糊控制器设计方法与实例、模糊PID控制器等部分。图中整理模糊控制定义、发展历程、特点、整体工作链路、模糊化接口、知识库、规则库、推理机、解模糊接口、输入输出变量、隶属度函数、控制规则、参数整定、Mamdani推理、重心法以及常规PID与模糊PID对比等内容。适用场景包括自动化课程学习、控制工程复习、人工智能控制课程、机电一体化教学、工业控制方案资料、毕业设计、课程设计、实验报告整理、技术培训课件和论文资料梳理。适用人群包括自动化专业学生、控制工程学生、教师、工程师、考研复习用户、课程讲师和技术资料编写者。该图适合与控制系统案例、仿真实验、MATLAB练习、PID参数整定资料和模糊规则表一起使用。
这是一篇关于第三章 专家系统与专家控制系统思维导图,想掌握智能控制的核心秘诀?专家系统与PID的完美结合就是答案!本文系统梳理专家控制的核心理论与应用:从专家PID五大规则(误差极大时输出最大控制量、极值状态强控制等)到增量式PID原理从知识表示、推理机制到工业温度/转速控制实战同时剖析传统PID的局限性,对比专家控制的灵活性、鲁棒性等核心优势无论你是备考还是工程应用,这里都有最硬核的专家控制系统知识图谱!不管是课前预习梳理知识框架、课程随堂笔记记录、期中期末专业课突击复习、控制工程考研长线专项复盘,还是专业教师备课制作教学课件、企业自动化工程师梳理智能控制理论知识,该思维导图模板均可直接套用,无需手动搭建知识框架,支持自由增删拓展公式、例题、推导过程,既能打印纸质版线下背诵刷题,也可电子存档线上随时查阅。模板完整串联专家系统、专家控制、专家 PID 三大核心内容,将复杂智能控制理论转化为直观树状导图,大幅降低理论背诵难度,提升专业课复习与刷题复盘效率,是自动化、智能控制相关专业必备复习素材。
强化学习基础
强化学习基本认知
核心定义
基于智能体与环境交互试错的机器学习范式
通过观测状态、执行动作、接收延迟奖赏,自主学习最优策略
目标实现累积奖赏最大化
交互闭环原理
智能体观测环境当前状态
依据状态执行对应动作
环境接收动作后发生状态转移,返回新状态与即时奖赏
智能体基于新状态和奖赏迭代更新行为策略
典型应用场景
离散决策:AlphaGo围棋博弈
连续控制:自动驾驶、猎豹机器人运动控制
环境交互:扫地机器人自主避障
强化学习与监督学习对比
训练样本
监督学习:带精确标签的样本
强化学习:无直接标签,仅延迟奖赏反馈
学习方式
监督学习:被动拟合标准答案
强化学习:主动试错、自主反思学习
优化目标
监督学习:最小化预测误差
强化学习:最大化长期累积奖赏
反馈时效
监督学习:即时反馈
强化学习:延迟反馈
马尔可夫性与MDP模型
马尔可夫性(核心假设)
定义:系统下一时刻状态仅由当前状态决定,与所有历史状态无关
数学公式:pst+1st,st−1,...,s1)=pst+1st
物理意义:未来取决于现在,极大简化状态转移的数学计算,是MDP的理论基础
马尔可夫决策过程(MDP)
定义:标准MDP为四元组 M={S,A,T,r}
S:状态空间,所有系统状态的集合(离散/连续)
A:动作空间,智能体可执行的所有动作集合(离散/连续)
T:状态转移算子,条件概率 ps′s,a,表示当前状态 s 执行动作 a 后转移到 s′ 的概率
r:回报函数 rS×A→R,表征状态-动作对的优劣
MDP优化目标
寻找最优策略参数 θ∗,最大化轨迹期望累积奖赏
参数化策略 πθatst表征状态 st 下执行动作 at 的概率
探索-利用窘境与经典策略
核心窘境定义
探索:尝试新动作,获取未知奖赏信息,追求长期收益
利用:选择当前最优动作,最大化即时奖赏,追求短期收益
无法同时最优,必须动态权衡
极端弊端:仅探索错失最优动作仅利用易陷入局部最优
K-摇臂赌博机模型
单状态简化强化学习模型
赌徒面对 K 个回报未知的摇臂,有限次数内最大化累积奖赏
探索-利用策略的标准测试基准
ε-贪心策略
基本思想:小概率探索,大概率利用
动作选择规则:大概率选择当前最优动作,小概率均匀随机采样
增量Q值更新公式
特点:计算复杂度 O1),无需存储历史数据实践中 ε 随训练衰减,前期探索、后期利用
Softmax策略
基于Boltzmann分布的概率选择策略
参数意义:τ 为温度参数,τ→0 趋近纯贪心,τ→∞趋近均匀随机探索
与ε-贪心区别:ε-贪心探索为盲目随机,Softmax依据奖赏高低分配选择概率,更智能
回报函数设计
常见设计形式
稀疏回报:仅目标达成获正奖励,其余为0,目标明确但学习难度大
稠密回报:基于距离、能量、约束的连续奖惩,学习更稳定
控制类回报:融合速度奖励、能耗惩罚、故障惩罚(如摔倒惩罚)
设计原则
贴合任务核心目标,兼顾约束条件,平衡反馈稀疏度,避免奖励冗余或缺失
有模型学习基础
核心定义
有模型学习(白盒学习):智能体完全已知环境状态转移概率 Ps′s,a 和奖赏函数 rs,a
无需试错,可通过动态规划直接求解最优策略
领域符号映射
强化学习(最大化回报)与经典控制(最小化代价)等价:rs,a=−cx,u
最优性原理与贝尔曼方程
最优性原理
定义:最优决策序列的尾部子序列,必然是尾部子问题的最优解
核心作用:动态规划的理论基石,支持将复杂多阶段决策拆解为简单子问题递推求解
核心值函数
状态值函数 Vπs):状态 s 下遵循策略 π 的期望累积折扣奖赏
状态-动作值函数 Qπs,a):状态 s 下执行动作 a 后,遵循策略 π 的期望累积折扣奖赏
二者区别:Q函数包含初始动作信息,是免模型学习核心V函数仅表征状态整体价值
贝尔曼等式
状态值函数贝尔曼等式
Q函数贝尔曼等式
关联关系:当前价值 = 即时奖赏 + 折扣后的未来价值期望
策略迭代算法
核心模块
策略评估:固定策略 π,迭代更新 Vs 直至收敛,评价当前策略优劣
策略改进:基于值函数贪心更新策略,选取最优动作优化策略
算法步骤
初始化任意初始策略 π0
策略评估:迭代计算当前策略对应的值函数 Vπks
策略改进:πk+1s)=argmaxaQπks,a
重复迭代,直至策略不再更新,收敛到最优策略
值迭代算法
核心思想
跳过显式策略维护,直接基于最优贝尔曼方程迭代更新值函数
将策略贪心操作内嵌到迭代过程,效率更高
迭代公式
算法步骤
计算所有状态-动作对的Q值
状态值取所有动作Q值的最大值,更新 Vs
重复迭代直至值函数收敛
策略迭代与值迭代对比
核心流程:策略迭代为评估+改进交替循环,值迭代直接迭代最优值函数
策略维护:策略迭代显式维护策略,值迭代无显式策略,贪心内嵌迭代
计算效率:策略迭代每轮计算量大,迭代次数少值迭代单轮计算简单,迭代次数多
收敛性:策略迭代单调收敛全局最优,值迭代压缩映射保证收敛全局最优
免模型学习概述
定义与背景
免模型学习(黑盒学习):现实环境中状态转移概率、奖赏函数未知
智能体仅通过与环境交互的样本 s,a,s′,r 试错学习,无需环境先验模型
适用场景
未知迷宫探索、自动驾驶动态场景、游戏AI对弈等环境模型未知的任务
POMDP部分可观测马尔可夫决策过程
定义:MDP的扩展六元组 M={S,A,O,T,E,r}
新增观测空间 O、观测概率 E
核心特点
智能体无法观测完整真实状态,仅能获取局部观测 ot
策略变为 πθatot),更贴合真实工程场景
Q学习算法
核心思想
用时序差分(TD)采样替代有模型的期望计算
仅依靠单条交互样本增量更新Q值,实现无模型迭代
核心更新公式
参数解释:α为学习率(控制新旧权重融合),γ为折扣因子(权衡远期回报),TD目标为下一状态最优动作的折扣价值+即时奖赏
算法特性
异策略算法,采用ε-贪心平衡探索与利用
无需环境转移概率,仅依赖交互样本
维度灾难与值函数近似
维度灾难问题
表格型Q学习仅适用于小规模离散状态空间
面对像素输入、连续状态、超高维状态(围棋、Atari游戏),无法存储所有 s,a 对应的Q值
值函数近似思想
用参数化神经网络 Qϕs,a替代查表
将强化学习转化为监督回归问题,通过梯度下降拟合目标Q值,适配高维状态空间
DQN深度Q网络
朴素Q学习的两大缺陷
数据强相关:连续帧样本高度相似,违背SGD独立同分布假设,训练震荡
目标漂移:TD目标依赖实时网络参数,优化目标持续变化,无法收敛
两大核心创新
经验回放:构建回放缓冲池存储历史样本,训练时随机采样,打破数据相关性、提升数据利用率、降低梯度方差
目标网络:维护实时网络(实时更新)、目标网络(周期性拷贝更新),用固定参数的目标网络计算TD目标,解决目标漂移问题
DQN算法完整步骤
初始化实时网络、目标网络、回放缓冲池
ε-贪心策略与环境交互,存储样本 st,at,st+1,rt 至缓冲池
随机小批量采样样本,计算TD目标
最小化均方误差,更新实时网络参数
每隔固定步数,将实时网络参数拷贝至目标网络
循环迭代直至收敛
核心总结:DQN = Q学习 + 经验回放 + 目标网络
策略梯度方法引入
值函数方法局限性
DQN等基于值函数的方法需通过argmax求解最优动作
无法适配连续动作空间,且难以表达随机性策略
核心思想
摒弃值函数中间环节,直接参数化策略网络 πθas
输入状态输出动作概率分布,直接最大化累积奖赏,天然适配连续控制任务
策略梯度核心理论
优化目标函数
对数微分技巧
核心恒等式:∇θpθτ)=pθτ∇θlogpθτ
作用:将无法直接求导的轨迹概率梯度,转化为可蒙特卡洛采样的期望,是策略梯度可行的基础
策略梯度定理
核心优势
推导过程消去环境转移项、不依赖马尔可夫性,天然适配POMDP场景,适用于真实复杂环境
REINFORCE算法
算法原理
基础蒙特卡洛策略梯度算法
通过采集完整轨迹,用样本均值近似梯度期望,执行梯度上升更新策略参数
算法步骤
当前策略采集多条完整轨迹
基于轨迹回报计算策略梯度近似值
梯度上升更新网络参数
循环迭代直至策略收敛
缺陷
蒙特卡洛采样依赖完整轨迹,回报随机性强,存在高方差问题,训练不稳定、收敛慢
策略梯度方差缩减方法
因果性优化(回报去来)
核心逻辑:t时刻动作不影响历史回报,用t时刻未来累积回报替代总回报,剔除无关历史信息,无偏降方差
基线优化
在梯度公式中减去状态基线 bst(最优为 Vπst)
不改变梯度期望(无偏),但大幅降低方差
优势函数
定义公式:Aπst,at=Qπst,at−Vπst
物理意义:表征当前动作相对于该状态平均回报的优劣程度
A>0:动作优于平均,增大动作概率
A<0:动作劣于平均,减小动作概率
A=0:动作符合预期,无需调整
Actor-Critic架构
双网络结构
Actor(演员):策略网络 πθas),负责输出动作概率、执行决策
Critic(评论家):值网络 Vωs),负责评估状态价值、计算优势函数,指导演员更新
核心价值
融合值函数方法低方差、策略梯度方法适配连续动作的优势
是PPO、SAC等现代强化学习算法的基础框架