闭卷重建多臂老虎机与遗憾的对象、公式、算例、算法与失败边界。
人工智能基础 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建蒙特卡洛价值估计的对象、公式、算例、算法与失败边界。
闭卷重建时序差分学习的对象、公式、算例、算法与失败边界。
闭卷重建Q学习的对象、公式、算例、算法与失败边界。
闭卷重建SARSA与在策略控制的对象、公式、算例、算法与失败边界。
闭卷重建探索、UCB与策略评估的对象、公式、算例、算法与失败边界。
闭卷重建函数逼近、离线RL与安全边界的对象、公式、算例、算法与失败边界。
对象:MC等整段轨迹结束后用实际回报估值,无偏但方差可能高。;公式:G_t=Σ_{k≥0}γ^k R_{t+k+1}。;算例:奖励1,2、γ=.5,从起点回报2。;边界:未终止持续任务硬用MC;把不同策略数据混合。。
对象:老虎机在探索未知臂与利用高均值臂间权衡,遗憾比较每步最佳期望。;公式:Regret_T=Tμ*−Σ_t μ_{a_t}。;算例:最优均值.8,10步选择均值.6的臂4次,其余最优,遗憾4×.2=.8。;边界:用实际噪声奖励反推单次决策好坏;只跑一个种子。。
对象:Q-learning以max后继动作作离策略目标,有限表格条件下趋向最优Q。;公式:Q←Q+α[R+γmax_a′Q′−Q]。;算例:Q=2,α=.5,R=1,γ=.9,maxQ′=4,目标4.6,更新为3.3。;边界:把当前行为动作当max变成SARSA;离线外推过估计。。
对象:TD(0)用一步奖励和下一状态估值自举,在线且有偏。;公式:δ=R+γV(S′)−V(S)。;算例:R=2,γ=.5,V(S′)=6,V(S)=4,δ=1。;边界:终止状态仍自举;学习率或状态键错误。。
对象:ε-greedy以1−ε利用、ε随机;UCB以置信奖励低访问动作。;公式:UCB_i=Q_i+c√(ln t/N_i)。;算例:Q=.5、探索项.4,UCB=.9。;边界:ε随机中仍只选非贪心导致概率算错;线上无安全过滤。。
对象:SARSA用实际下一行为动作Q作目标,学到包含探索的策略价值。;公式:Q←Q+α[R+γQ(S′,A′)−Q]。;算例:Q=1,α=.5,R=0,γ=1,Q′=3,新Q=2。;边界:更新后才选A′造成算法口径变化;评估时仍高探索。。
对象:大状态用参数函数;分布外动作、自举和逼近会形成不稳定“致命三元组”。;公式:min E[(y−Q_θ(s,a))²]。;算例:目标3预测1,单样本平方误差4。;边界:在日志从未覆盖动作上取巨大Q直接部署;训练测试转移泄漏。。