Incidents

Incident
Evidence

障害対応

本番確認記録、障害対応方針、Postmortemテンプレート、フォローアップ管理を整理します。 本番確認、障害対応方針、Postmortem、フォローアップを整理します。

Current scope

Verification · Incident Policy · Postmortem · Follow-up Expected demo errors are not real incidents

Case Study

本番確認記録

Production verification

TYPE

Production verification record

Reliability Demo API MVPを本番反映後に確認した記録です。実障害ではなく、運用証跡として扱います。

DATE

2026-06-19

health、status、fallback、slow、error の期待ステータスとレスポンスを手動確認しました。

RESULT

Passed

/api/error の500は意図的なデモ応答です。Availability failureや実障害として扱いません。

Timeline

確認の流れ

Verification path

01

MVP merged

Reliability Demo API MVPをPRとして取り込み、Production verificationの対象にしました。

02

Endpoint checks

/api/health、/api/status、/api/fallback、/api/slow、/api/error の期待ステータスを確認しました。

03

Evidence recorded

本番確認結果を `docs/incidents/` 配下に記録し、SLO、Runbook、Postmortem整備へつなげました。

04

Follow-up created

SLO / Runbook / Monitoring / Postmortem template整備をフォローアップとして残しました。

Response Flow

障害対応の流れ

Signal to learning

  1. 01Signal

    監視、手動確認、ユーザー影響などの異常シグナルを受け取ります。

  2. 02Triage

    期待されたデモ応答か、実際の影響かを切り分けます。

  3. 03Runbook

    定義済み手順で確認、復旧判断、影響範囲の把握を進めます。

  4. 04Postmortem

    実障害の場合はImpact、Detection、Timeline、Root causeを記録します。

  5. 05Follow-up

    再発防止のIssue / PRへつなげ、改善を追跡します。

Incident Policy

扱いの方針

Do not overclaim

Expected demo behavior

/api/error の500や /api/slow の制御遅延は、デモ用途の期待挙動です。それ単体では実障害として扱いません。

Real incident condition

/api/health の継続失敗、ユーザー影響、デプロイ後の想定外エラーなどがある場合にIncidentとして扱います。

Postmortem condition

実際の影響、SLO違反、復旧判断、再発防止が必要な場合にPostmortemを作成します。

Postmortem

記録テンプレート

Learning system

IMP

Impact

誰に、何が、どのくらい影響したかを記録します。

DET

Detection

どの監視・通知・手動確認で検知したかを明確にします。

TL

Timeline

検知、判断、復旧、再発防止までの時系列を残します。

RCA

Root cause

技術的原因と運用上の原因を分けて整理します。

ACT

Follow-up actions

Issue / PR / owner / statusを対応可能な粒度で追跡します。

Evidence Links

Docs

REC

Production verification record

Reliability Demo API MVPの本番確認記録です。実障害ではなく運用証跡です。

Open record
PM

Postmortem template

実障害が起きた場合に、Impact、Detection、Timeline、Root cause、Follow-upを記録します。

Open template
RUN

Runbook

Health failure、Latency investigation、Fallback behaviorの切り分け手順です。

Open runbook