闭卷重建期望效用与风险偏好的对象、公式、算例、算法与失败边界。
人工智能基础 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建MDP与马尔可夫性质的对象、公式、算例、算法与失败边界。
闭卷重建Bellman最优方程的对象、公式、算例、算法与失败边界。
闭卷重建价值迭代的对象、公式、算例、算法与失败边界。
闭卷重建策略迭代的对象、公式、算例、算法与失败边界。
闭卷重建POMDP与信念状态的对象、公式、算例、算法与失败边界。
闭卷重建决策评测、鲁棒与约束的对象、公式、算例、算法与失败边界。
对象:MDP由状态、动作、转移、奖励和折扣组成;给当前状态动作后未来与更早历史条件独立。;公式:M=(S,A,P,R,γ)。;算例:状态s执行a以.7到s1奖励2、.3到s2奖励-1,期望即时奖励1.1。;边界:遗漏库存/速度等历史变量;把观测当状态。。
对象:决策在结果概率与效用之间取期望;效用非线性表达风险态度。;公式:EU(a)=Σ_s P(s|a)U(s)。;算例:动作A以.5获10否则0,EU=5;确定得4的EU=4,风险中性选A。;边界:金额直接当效用;漏掉低概率灾难硬约束。。
对象:价值迭代重复Bellman最优备份,折扣MDP收敛;残差给误差证据。;公式:V_{k+1}=T*V_k。;算例:单状态奖励1、自环γ=.5,从V0=0得V1=1,V2=1.5。;边界:原地更新却按同步理论解释;过早以均值残差停止。。
对象:最优价值等于选择使即时奖励加折扣后继价值期望最大的动作。;公式:V*(s)=max_a ΣP(s′|s,a)[R+γV*(s′)]。;算例:动作A确定奖励1后继值5、γ=.9,回报5.5。;边界:把max放进对后继的求和;终止状态仍加未来价值。。
对象:部分可观测决策以状态分布belief作为充分统计,动作后预测再用观测更新。;公式:b′(s′)∝O(o|s′,a)Σ_sP(s′|s,a)b(s)。;算例:预测[.5,.5]乘似然[.9,.1]后归一为[.9,.1]。;边界:直接对最可能状态行动;漏掉动作对观测的影响。。
对象:固定策略先求Vπ,再对每状态贪心改善;策略不变时达到最优。;公式:V^π=R^π+γP^πV^π。;算例:单状态奖励2、自环γ=.5,V=2/(1-.5)=4。;边界:策略评估未收敛就无控制改善;并列动作来回震荡。。
对象:策略评价需多随机种子报告回报分布、尾部风险、约束违规和模型偏差。;公式:CVaR_α=最差α比例回报的均值。;算例:5次回报[-10,0,2,4,5],最差20% CVaR=-10。;边界:只报均值;用训练模型仿真自证策略。。