跳到正文

分布式系统与可靠服务

从时间、RPC、复制与共识走到分片、事务、存储、流处理、容错、云原生协调和可靠服务项目

84|77 小时|12|高级
开始学习

1第1章 时间、事件与因果顺序

先接受没有完美全局时钟,再学习为事件建立足够的顺序证据。

7

2第2章 RPC、超时与故障模型

把远程调用拆成消息、执行和响应,正视超时后的未知状态。

7

3第3章 复制、一致性与读写语义

从副本为何存在出发,明确不同一致性模型给应用什么承诺。

7

4第4章 共识:Raft、Paxos与安全边界

理解多数派为何能阻止两个不同已提交值,并能推演任期和日志。

7

5第5章 分片、哈希与在线再平衡

把数据拆到节点,同时控制倾斜、迁移和路由一致性。

7

6第6章 分布式事务与跨服务一致性

区分原子提交、隔离与业务补偿,知道每种方案在失败时欠了什么。

7

7第7章 分布式存储系统

连接WAL、LSM、复制和读写路径,能从一次请求追到磁盘。

7

8第8章 流处理、消息与事件时间

从至少一次投递走到水位线、状态和端到端结果语义。

7

9第9章 容错、恢复与灾难演练

用恢复时间线证明系统能在故障后恢复正确服务。

7

10第10章 可观测性、SLO与容量

从用户目标倒推指标、追踪和安全容量,而不是堆仪表盘。

7

11第11章 云原生协调与服务编排

理解控制器、租约、服务发现和滚动发布背后的分布式状态机。

7

12第12章 综合项目:可靠键值服务

把时间、复制、共识、分片、事务、恢复和观测汇成可答辩系统。

7