Deep Q-Learning
Deep Q-Learning,简称 DQN
- DQN 在 Q-Learning 的基础上,添加神经网络 Q 来计算价值函数
- 网络 Q 的输入为状态向量 $\phi(S)$,输出是所有动作在该状态下的动作价值
- DQN 通过引入网络 Q 来代替原始 Q-Learning 的 Q 表;解决了Q-Learning 只能适用于离散状态空间的局限性;因此 DQN 可用来解决连续状态下离散动作的问题
DQN 算法步骤
- 随机初
分类目录归档:学习
Deep Q-Learning,简称 DQN
DQN 算法步骤
列线图(Alignment Diagram),又称诺莫图(Nomogram 图)
示例说明(以泰坦尼克邮轮数据集中,乘客的死亡二分类预测为例):

Points 是每一个特征的评分参照,Total Points 是所有特征的汇总评分参照Linear Predictor 是汇总评分的线性映TOPSIS (Technique for Order Preference by Similarity to an Ideal Solution) ,也称优劣解距离法,是一种常用的组内综合评价方法,能充分利用原始数据的信息,其结果能精确地反映各评价方案之间的差距
针对多标准/多目标决策问题(MCDM/MCDA),决策者需要面对多种决策标准和可行决策方案,TOPSIS 的作用就是帮助决策者综合考虑多个决策标准,在多个可行决策方案之间找到最优解
TOPSIS 示例:评估 5 所研究生院的教育质量
5 所研究生院的评估数据及其权重如下:
| 院校 | 人均专著 $x_1$ (本/人) |
|---|
前置知识:强化学习入门、蒙特卡洛法、马尔可夫决策过程 MDP
时序差分(temporal difference,TD)
回顾 MDP 中状态价值函数的贝尔曼方程: $$ v_{
马尔可夫过程(Markov process)是一类具有马尔可夫性质的随机过程
马尔可夫性质(Markov property,MP):如果某一个过程未来某个时刻的状态与过去的状态无关,只由现在的状态决定,那么其具
马尔可夫奖励过程(Markov reward process,MRP)
$$ G_{t}=R_{t}+\gamma R_{t+1}+\gamma^2 R_{t+2}+\dots+\gamma^n R_{t+n} $$
强化学习(reinforcement learning,RL)
强化学习的三个基本要素:
注意:
多 Agent 设计技巧:
前置知识:思维链提示 CoT 和自洽性 self-consistency
思维树 ToT (Tree of Thoughts,2023-05):

以“24 点数字”游戏为例来说明 ToT 的实现步骤:
