闭卷重建零和博弈与极大极小的对象、公式、算例、算法与失败边界。
人工智能基础 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建Alpha-Beta剪枝的对象、公式、算例、算法与失败边界。
闭卷重建动作排序与搜索深度的对象、公式、算例、算法与失败边界。
闭卷重建深度截断与评价函数的对象、公式、算例、算法与失败边界。
闭卷重建随机博弈与Expectimax的对象、公式、算例、算法与失败边界。
闭卷重建蒙特卡洛树搜索的对象、公式、算例、算法与失败边界。
闭卷重建博弈评测与时间控制的对象、公式、算例、算法与失败边界。
对象:α是MAX已保证下界,β是MIN已保证上界;α≥β时剩余分支不影响结果。;公式:prune if α≥β。;算例:某MIN节点β=3,祖先α=5,因5≥3可剪剩余子树。;边界:剪枝返回值写错改变决策;未保存玩家视角。。
对象:两人零和完全信息博弈中MAX最大化、MIN最小化终局效用。;公式:V(s)=max_a V(T(s,a))或min_a V(T(s,a))。;算例:MIN子节点叶值[3,5]取3;[2,9]取2;根MAX取max(3,2)=3。;边界:MAX/MIN层写反;效用视角随玩家切换未统一。。
对象:不能搜到终局时以评价函数估计叶局面,并用迭代加深管理时限。;公式:V_d(s)=Eval(s) at cutoff。;算例:评价=2×己方棋子−对方棋子;己3对方4得2。;边界:在递归中途超时返回半成品;评价特征双计。。
对象:好动作先搜可使alpha-beta最好接近O(b^(d/2)),但不改变精确值。;公式:best time≈O(b^(d/2))。;算例:b=4,d=6,最优排序叶代理4³=64,朴素4⁶=4096。;边界:声称排序会改变最优动作;用测试答案泄漏排序。。
对象:MCTS循环选择、扩展、模拟、回传;UCT平衡均值与探索。;公式:UCT=Q_i/N_i+c√(ln N/N_i)。;算例:Q/N=.6,N=100,N_i=4,c=1,探索项√(ln100/4)≈1.073,UCT≈1.673。;边界:回传视角符号错误;零访问节点除零。。
对象:机会节点按结果概率取期望,不能当作对手最坏选择。;公式:V(chance)=Σp_i V_i。;算例:结果值10和-2,概率.25和.75,期望2.5−1.5=1。;边界:把骰子节点用MIN;漏掉低概率高损失结果。。
对象:棋力用配对对局、先后手平衡、Elo置信区间和固定时限评价。;公式:E_A=1/(1+10^((R_B−R_A)/400))。;算例:同分两方预期得分.5;20局预期10分。;边界:只挑胜局;新程序得到更多时间或硬件。。