闭卷重建先定义问题再采指标的对象、状态、事件、不变量与一个失败反例。
操作系统与系统实验 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
闭卷重建CPU时间、利用率与饱和的对象、状态、事件、不变量与一个失败反例。
闭卷重建内存、缺页与缓存观测的对象、状态、事件、不变量与一个失败反例。
闭卷重建I/O、网络与队列的对象、状态、事件、不变量与一个失败反例。
闭卷重建Little定律与排队直觉的对象、状态、事件、不变量与一个失败反例。
闭卷重建实验:分位数与直方图的对象、状态、事件、不变量与一个失败反例。
闭卷重建实验:USE诊断树的对象、状态、事件、不变量与一个失败反例。
核心机制:user、system、iowait、steal描述不同现象;运行队列和调度延迟揭示饱和;实验入口:比较100% CPU的计算任务与自旋锁任务,用采样剖析区分有效工作和争用;边界:CPU利用率低仍可能被单线程、锁或外部等待限制;iowait也不是磁盘故障证明。
核心机制:性能问题要写工作负载、时间窗、基线、受影响用户和成功阈值,再选择指标;实验入口:针对接口P99从80ms升到900ms,先固定请求类型、发布版本和峰值窗口;边界:平均延迟正常不能反驳尾延迟故障;不同时间窗和分母不可直接比较。
核心机制:吞吐、IOPS、队列深度、服务时间和等待时间共同描述设备;网络还需重传与拥塞窗口;实验入口:对数据库写入峰值同时画块层延迟、队列深度、fsync和应用请求时间线;边界:高队列可能是原因也可能是结果;相关性必须用事件顺序和干预验证。
核心机制:RSS、虚拟空间、页缓存、minor/major fault和回收压力需结合访问模式解释;实验入口:逐步增加工作集,观察minor fault、major fault、换页和P99延迟的拐点;边界:free内存少常因缓存利用,并不自动等于泄漏;泄漏要看不可回收增长与引用。
核心机制:分位数需对排序样本采用明确索引规则,直方图桶保留分布而非只报平均;实验入口:输入延迟样本,输出p50、p95、p99和超过SLO阈值的比例;边界:不同分位数算法在小样本有差异,必须固定定义;聚合分位数通常不能直接平均。
核心机制:稳定系统中平均在途数N等于吞吐X乘平均响应R,单位一致时可反查并发、容量和延迟;实验入口:每秒200请求、平均响应0.15秒时估算平均在途30个,再与连接池大小比较;边界:Little定律不告诉你延迟分布与瓶颈位置;非稳定窗口直接套用会误导。
核心机制:对每类资源依次检查Utilization、Saturation和Errors,并用下一观测缩小假设;实验入口:输入CPU、内存、磁盘、网络指标,输出首个证据最强的诊断分支与下一步观测;边界:诊断树给调查顺序而非自动根因;每一步都要保留替代假设。