Define and implement Service Level Indicators (SLIs) and Service Level Objectives (SLOs) using error budgets and alerts. Used when establishing reliability targets, implementing SRE practices, and measuring service performance.
English | 日本語
サービスレベルインジケーター(SLI)、サービスレベル目標(SLO)、エラーバジェットを定義・実装するフレームワーク。
SLI、SLO、エラーバジェットを使用して測定可能な信頼性ターゲットを実装し、信頼性とイノベーション速度のバランスを取ります。
SLA(サービスレベル契約)
↓ 顧客との契約
SLO(サービスレベル目標)
↓ 内部信頼性ターゲット
SLI(サービスレベルインジケーター)
↓ 実際の測定
# 成功したリクエスト / 総リクエスト数
sum(rate(http_requests_total{status!~"5.."}[28d]))
/
sum(rate(http_requests_total[28d]))
# レイテンシ閾値以下のリクエスト / 総リクエスト数
sum(rate(http_request_duration_seconds_bucket{le="0.5"}[28d]))
/
sum(rate(http_request_duration_seconds_count[28d]))
# 成功した書き込み / 総書き込み数
sum(storage_writes_successful_total)
/
sum(storage_writes_total)
参照: references/slo-definitions.mdを参照
| SLO % | ダウンタイム/月 | ダウンタイム/年 | |-------|----------------|----------------| | 99% | 7.2時間 | 3.65日 | | 99.9% | 43.2分 | 8.76時間 | | 99.95%| 21.6分 | 4.38時間 | | 99.99%| 4.32分 | 52.56分 |
考慮事項:
SLOの例:
slos:
- name: api_availability
target: 99.9
window: 28d
sli: |
sum(rate(http_requests_total{status!~"5.."}[28d]))
/
sum(rate(http_requests_total[28d]))
- name: api_latency_p95
target: 99
window: 28d
sli: |
sum(rate(http_request_duration_seconds_bucket{le="0.5"}[28d]))
/
sum(rate(http_request_duration_seconds_count[28d]))
エラーバジェット = 1 - SLOターゲット
例:
error_budget_policy:
- remaining_budget: 100%
action: 通常の開発速度
- remaining_budget: 50%
action: リスクの高い変更の延期を検討
- remaining_budget: 10%
action: 非クリティカルな変更を凍結
- remaining_budget: 0%
action: 機能凍結、信頼性に焦点
参照: references/error-budget.mdを参照
# SLIレコーディングルール
groups:
- name: sli_rules
interval: 30s
rules:
# 可用性SLI
- record: sli:http_availability:ratio
expr: |
sum(rate(http_requests_total{status!~"5.."}[28d]))
/
sum(rate(http_requests_total[28d]))
# レイテンシSLI(リクエスト < 500ms)
- record: sli:http_latency:ratio
expr: |
sum(rate(http_request_duration_seconds_bucket{le="0.5"}[28d]))
/
sum(rate(http_request_duration_seconds_count[28d]))
- name: slo_rules
interval: 5m
rules:
# SLOコンプライアンス(1 = SLO達成、0 = SLO違反)
- record: slo:http_availability:compliance
expr: sli:http_availability:ratio >= bool 0.999
- record: slo:http_latency:compliance
expr: sli:http_latency:ratio >= bool 0.99
# エラーバジェット残量(パーセンテージ)
- record: slo:http_availability:error_budget_remaining
expr: |
(sli:http_availability:ratio - 0.999) / (1 - 0.999) * 100
# エラーバジェットバーンレート
- record: slo:http_availability:burn_rate_5m
expr: |
(1 - (
sum(rate(http_requests_total{status!~"5.."}[5m]))
/
sum(rate(http_requests_total[5m]))
)) / (1 - 0.999)
groups:
- name: slo_alerts
interval: 1m
rules:
# 高速バーン: 14.4倍レート、1時間ウィンドウ
# 1時間でエラーバジェットの2%を消費
- alert: SLOErrorBudgetBurnFast
expr: |
slo:http_availability:burn_rate_1h > 14.4
and
slo:http_availability:burn_rate_5m > 14.4
for: 2m
labels:
severity: critical
annotations:
summary: "Fast error budget burn detected"
description: "Error budget burning at {{ $value }}x rate"
# 低速バーン: 6倍レート、6時間ウィンドウ
# 6時間でエラーバジェットの5%を消費
- alert: SLOErrorBudgetBurnSlow
expr: |
slo:http_availability:burn_rate_6h > 6
and
slo:http_availability:burn_rate_30m > 6
for: 15m
labels:
severity: warning
annotations:
summary: "Slow error budget burn detected"
description: "Error budget burning at {{ $value }}x rate"
# エラーバジェット枯渇
- alert: SLOErrorBudgetExhausted
expr: slo:http_availability:error_budget_remaining < 0
for: 5m
labels:
severity: critical
annotations:
summary: "SLO error budget exhausted"
description: "Error budget remaining: {{ $value }}%"
Grafanaダッシュボード構造:
┌────────────────────────────────────┐
│ SLOコンプライアンス(現在) │
│ ✓ 99.95%(ターゲット: 99.9%) │
├────────────────────────────────────┤
│ エラーバジェット残量: 65% │
│ ████████░░ 65% │
├────────────────────────────────────┤
│ SLIトレンド(28日間) │
│ [時系列グラフ] │
├────────────────────────────────────┤
│ バーンレート分析 │
│ [時間ウィンドウごとのバーンレート] │
└────────────────────────────────────┘
クエリの例:
# 現在のSLOコンプライアンス
sli:http_availability:ratio * 100
# エラーバジェット残量
slo:http_availability:error_budget_remaining
# エラーバジェット枯渇までの日数(現在のバーンレートで)
(slo:http_availability:error_budget_remaining / 100)
*
28
/
(1 - sli:http_availability:ratio) * (1 - 0.999)
# 短期と長期ウィンドウの組み合わせで誤検知を削減
rules:
- alert: SLOBurnRateHigh
expr: |
(
slo:http_availability:burn_rate_1h > 14.4
and
slo:http_availability:burn_rate_5m > 14.4
)
or
(
slo:http_availability:burn_rate_6h > 6
and
slo:http_availability:burn_rate_30m > 6
)
labels:
severity: critical
assets/slo-template.md - SLO定義テンプレートreferences/slo-definitions.md - SLO定義パターンreferences/error-budget.md - エラーバジェット計算prometheus-configuration - メトリクス収集のためgrafana-dashboards - SLO可視化のためSearch for places (restaurants, cafes, etc.) via Google Places API proxy on localhost.
Interact with GitHub using the `gh` CLI. Use `gh issue`, `gh pr`, `gh run`, and `gh api` for issues, PRs, CI runs, and advanced queries.
Create or update AgentSkills. Use when designing, structuring, or packaging skills with scripts, references, and assets.
Start voice calls via the OpenClaw voice-call plugin.
Notion API for creating and managing pages, databases, and blocks.
Gemini CLI for one-shot Q&A, summaries, and generation.
Category:developer