闭卷重建SLI、SLO与错误预算的故障模型、消息状态、不变量与恢复边界。
分布式系统与可靠服务 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建日志、指标与追踪关联的故障模型、消息状态、不变量与恢复边界。
闭卷重建USE、RED与饱和度的故障模型、消息状态、不变量与恢复边界。
闭卷重建尾延迟与调用扇出的故障模型、消息状态、不变量与恢复边界。
闭卷重建负载模型与容量曲线的故障模型、消息状态、不变量与恢复边界。
闭卷重建排队、限流与负载卸载的故障模型、消息状态、不变量与恢复边界。
闭卷重建实验:SLO与容量分析器的故障模型、消息状态、不变量与恢复边界。
机制:指标发现范围,追踪定位跨服务路径,结构化日志解释具体事件,三者用请求ID和时间对齐;实验:给一次慢请求串联网关、RPC、存储和队列span;边界:高基数标签会压垮指标系统,日志也不能记录密钥和敏感载荷。
机制:SLI量化用户可见成功、延迟或新鲜度,SLO给目标比例,错误预算支持发布与可靠性取舍;实验:计算30天99.9%可用目标允许失败分钟,并分配给计划与非计划事件;边界:节点CPU正常不代表用户成功,SLO也不是对每个短窗口都必须精确满足。
机制:并行扇出请求的整体延迟由最慢关键分支决定,单节点小尾部会被大量分支放大;实验:由单分支成功概率估算100路扇出全部按时概率;边界:盲目hedged request会增加负载并恶化拥塞,必须限额且取消落后请求。
机制:资源看利用率/饱和度/错误,服务看请求率/错误/时延,结合队列判断瓶颈;实验:对线程池、磁盘和RPC分别选择可行动指标;边界:利用率低仍可能有锁或单分片热点,平均值也会隐藏局部饱和。
机制:到达率逼近服务率时等待非线性上升,有界队列、令牌桶和优先级保护关键流量;实验:给速率、桶容量和突发序列计算允许/拒绝请求;边界:无限排队只把错误变成长超时,重试流量也必须计入入口负载。
机制:按读写比、键分布、对象大小、并发和突发建立负载,阶梯压测找SLO首个失守点;实验:固定版本和数据规模逐级增加QPS,记录吞吐、p99、错误与队列;边界:最高瞬时QPS不是安全容量,压测客户端或单热点也可能先成为瓶颈。
机制:从请求样本计算成功率、p50/p95/p99、错误预算消耗和首个容量拐点;实验:覆盖空样本、全成功、混合错误和突发过载测试;边界:分位数算法、观察窗和缺失样本处理必须公开。