SRE / Platform Engineering Portfolio

SRE
Lab

Reliability Demo APIは、信頼性運用を説明するための公開デモAPIです。
このポートフォリオでは、SLO、監視、Runbook、障害対応までの流れを示します。
Reliability Demo APIは、信頼性運用を説明するための公開デモAPIです。SLO・監視・Runbook・障害対応までの流れを示します。

Current Status

Operational

Availability SLO
99.0%
Health check
200
Error demo
500 expected
View evidence

Operational Design

運用設計

06 areas

01

System diagram

構成

Cloudflare Pages、Workers API、Grafana、GitHub Issueの役割とつながりを示します。Pages、Workers、Grafana、GitHub Issueの関係を示します。

詳細

02

SLO 99.0%

信頼性

正常応答、遅延、意図的なエラー、fallbackを通じてAPIの信頼性を評価します。正常応答・遅延・意図的なエラーで信頼性を評価します。

詳細

03

Alert flow

監視

外形監視、アラート条件、通知先、GitHub Issue化までの流れを示します。外形監視からGitHub Issue化までの流れを示します。

詳細

04

Deploy flow

CI/CD

Pull Request、CI、デプロイ、本番確認、失敗時の切り戻し方針を示します。Pull Requestから検証・デプロイまでの流れを示します。

詳細

05

Incident flow

障害対応

本番確認、Runbook、Postmortemを通じて障害対応の流れを示します。本番確認、Runbook、Postmortemで対応の流れを示します。

詳細

06

Cost guardrail

コスト制御

利用量の把握、予算しきい値、コスト超過時の対応方針を示します。利用量、予算しきい値、コスト超過時の対応を示します。

詳細

Operations Flow

運用の流れ

End-to-end

  1. 01 Request
  2. 02 Pages
  3. 03 Worker API
  4. 04 Monitor
  5. 05 Issue
  6. 06 Runbook