Latency
/api/health の応答時間を見ます。p95がしきい値を超える場合は遅延調査へ進みます。
Monitoring
監視
Reliability Demo APIの監視対象、4大シグナル、アラート条件、通知経路、Runbookへのつながりを整理します。 監視対象、4大シグナル、アラート条件、Runbookへの流れを整理します。
Current scope
Latency · Traffic · Errors · Saturation Alert severity / dedupe / runbookGolden Signals
SRE monitoring
/api/health の応答時間を見ます。p95がしきい値を超える場合は遅延調査へ進みます。
リクエスト数やアクセス増加を確認します。急増時はCost Guardrailやrate limit候補と関連付けます。
/api/health の非200や想定外の5xxを調査対象にします。/api/error の500はデモ挙動として除外します。
Worker実行時間、外部依存、リトライ増加、コスト上限接近を負荷の兆候として扱います。
Monitoring Targets
Synthetic checks
GET /api/health
Primary uptime target
Availability SLIの中心です。HTTP 200をGood Eventとして扱い、連続失敗時に調査対象にします。
GET /api/status
Service inventory check
サービスの状態、構成、アクティブなエンドポイントを確認する補助チェックです。
GET /api/error
Excluded from uptime target
意図的な500エラーデモです。通常の稼働監視やAvailability計算には含めません。
Alert Rules
Human actionable
/api/health が連続して非200を返した場合、可用性低下として調査対象にします。Runbookへ誘導します。
/api/health の応答がしきい値を継続して超えた場合、遅延調査に進みます。
Worker deployやpost-deploy production checkが失敗した場合、変更起因の影響を確認します。
Alert Routing
Signal to action
/api/health と /api/status を外形監視します。
失敗や遅延悪化を条件として検知します。
通知内容をIssue化しやすい形へ整えます。
アラートを対応可能な運用タスクとして記録します。
確認、切り分け、復旧判断へ進みます。
Dedupe
Noise control
service + alert_type + environment を重複判定の基本単位にし、同じ未解決Issueがある場合は新規作成より追記を優先します。
health failure、latency degradationなど、同種のアラートは重複Issueを増やさないようにします。
未解決の対応中Issueがある場合は、対応履歴として追記・更新し、アラート疲れを避けます。
Evidence Links
Docs
Availability、Latency、Error rate、Alert candidatesを定義しています。
Open documentHealth failure、Latency investigation、Rollback、Escalationの確認手順です。
Open runbook現在のAPI状態、SLO、エンドポイント挙動を確認するページです。
Open dashboard