High-Water Mark 101

前言 在现代分布式系统、流处理引擎和日志系统中,数据的顺序性与进度控制至关重要。如何知道一个节点、消费者、或者整个系统**“处理到哪了”**?这就是 High-Water Mark(高水位线) 的核心意义。 ...

October 29, 2018

PACELC Theorem 101

前言 CAP 定理揭示了分布式系统在「一致性(Consistency)」「可用性(Availability)」与「分区容忍性(Partition Tolerance)」之间的取舍。然而,现实系统中不仅要考虑网络分区,还要在正常情况下权衡延迟与一致性。为此,PACELC 定理应运而生,作为对 CAP 的自然扩展。 ...

October 29, 2018

Failback 101

前言 在分布式系统中,当主节点因故障被替换(Failover)后,如果原主节点恢复正常,系统是否、何时、以及如何让它重新承担主角色?这便是 Failback(故障恢复切回) 的核心问题。 ...

October 25, 2018

Failover 101

前言 在现代分布式系统中,高可用(High Availability) 是基本要求。而高可用的核心能力之一就是:当系统组件出现故障时,是否能自动切换到备份节点或副本继续提供服务。这个自动切换过程,正是“Failover”。 ...

October 25, 2018

Fencing 101

前言 在分布式系统中,我们常用 Lease(租约) 控制某个节点对资源的独占访问。然而,当网络分区或节点故障后,“过期”节点仍可能持有旧的访问权限并发起非法写入,这就引入了一个严重问题:脑裂(Split Brain)写入。 ...

October 25, 2018

Gossip 101

前言 在大规模分布式系统中,节点之间需要高效、可靠地传播状态信息,如节点上线、宕机、负载等。而中心化广播机制很难应对规模扩展、容错要求等问题。Gossip 协议(又称“八卦协议”)作为一种去中心化、鲁棒性强的通信机制,被广泛应用于分布式数据库、服务注册中心、容错系统等场景。 ...

October 25, 2018

Heartbeat 101

前言 在现代分布式系统中,故障检测 是系统高可用的基础能力。系统需要实时感知某个节点是否还“存活”,以便及时做出容错或主备切换。这一机制中,Heartbeat(心跳) 是最核心的技术手段。 ...

October 25, 2018

Lease 101

前言 在分布式系统中,多个节点同时访问或修改同一资源时,如何保证一致性和避免冲突是一个核心问题。传统的锁机制在高延迟和故障环境下难以保证可靠性,因此出现了一种更适合分布式环境的机制 —— Lease(租约)。 ...

October 25, 2018

Phi Accrual Failure Detector algorithm 101

前言 在现代分布式系统中,节点失效检测是系统容错能力的基石。简单的“超时判断”往往无法应对真实网络环境中的延迟波动、抖动等问题,于是更加智能化的失效检测算法应运而生。其中,Phi Accrual Failure Detector(Φ 累积失败探测器) 是被广泛应用的一种算法,如 Cassandra、Akka、Etcd 等系统都基于它构建健康检查机制。 ...

October 25, 2018

Split Brain 101

前言 在现代互联网系统中,分布式系统 被广泛应用来提高可用性、扩展性与容错性。但网络的不稳定、节点的故障或管理上的分歧,常常会引发一个危险的问题:Split Brain(脑裂)。 ...

October 25, 2018