インフラ・クラウド・DevOps · 上級

高可用性と災害復旧

一行でいうと: 一時間のダウンタイムがいくらかかるかを決め、それからどれだけの冗長性を買うかを決める。

解決策の前に目標を定義する

99.9%と99.99%の可用性の差はコストと複雑さの倍数の差だ。ほとんどのビジネスシステムは高い方を必要とせず、必要とする人はお金でそれを正当化できる。

レジリエンスの層

異なる可用性ゾーンにまたがる複数のインスタンス;セカンダリレプリカと自動フェイルオーバーを持つデータベース;ローカル状態への依存なし;障害のあるインスタンスをトラフィックから外すヘルスチェック。

次のステップ——第二の地理的リージョン——はコストと複雑さが重大であり、レイテンシーとデータの一貫性の問題を含む。

災害シナリオ

倒れたサーバーだけでなく:偶発的な削除、データの破損、ロックされたクラウドアカウント。それぞれ異なる答えが必要で、三つすべてに誰かが過去一年に読んだ書かれた計画があるべきだ。

さらに深く

制御された障害訓練を実行する:既知の時間に制御された環境で、インスタンスを落とし、依存関係を切断し、ディスクを埋める。障害下でテストされたことのないシステムはレジリエントではなく、ただテストされていない。