Глоссарий
SLO (Service Level Objective)
Целевой уровень качества сервиса — числовая метрика, отражающая ожидаемую надёжность или производительность. Например: «99.9% запросов должны завершаться успешно за 30-дневное окно». SLO — это внутренняя цель команды, в отличие от SLA, которое является юридическим обязательством.
# Пример SLO в SLOzy
name: "API Latency"
target: 99.9
time_window: "30d"
metric_type: "latency"
metric_query: "histogram_quantile(0.99, rate(http_request_duration_seconds_bucket[5m]))"SLI (Service Level Indicator)
Фактический показатель качества сервиса, который измеряется в реальном времени. SLI отвечает на вопрос «как хорошо работает сервис прямо сейчас». Примеры: latency p99, error rate, throughput. SLI сравнивается с SLO для определения статуса.
SLA (Service Level Agreement)
Юридическое обязательство перед клиентом с указанием гарантированного уровня качества и санкций за его нарушение. SLA обычно жёстче и ниже SLO — бюджет закладывается между SLA и SLO, чтобы успеть среагировать до нарушения контракта.
Пример соотношения:
SLA: 99.0% (юридическое обязательство)
SLO: 99.5% (внутренняя цель)
↑ запас 0.5% — Error BudgetError Budget
Бюджет ошибок — допустимое количество отказов или медленных ответов за времявое окно. Рассчитывается как 100% — SLO%. Если SLO = 99.9% за 30 дней, то Error Budget = 0.1% времени = примерно 43 минуты простоя/медленной работы.
Error budget определяет темп релизов:
- Бюджет есть → можно релизить новые фичи
- Бюджет на исходе → остановить релизы, фокус на стабильности
- Бюджет исчерпан → SLO нарушен, требуется немедленная реакция
Burn Rate
Скорость сжигания Error Budget. Показывает, как быстро расходуется бюджет при текущем уровне ошибок.
Burn Rate = фактическая ошибка / допустимая ошибка
Если Burn Rate = 2, бюджет расходуется в 2 раза быстрее допустимого.SLOzy использует burn rate для алертов:
- alert: CriticalSLOViolation
expr: slo_status == 2Time Window
Времявое окно — период, за который рассчитывается SLO. SLOzy поддерживает:
- 7d — неделя, для быстрой обратной связи
- 30d — месяц, стандартный период
- 90d — квартал, для долгосрочных контрактов
Чем больше окно, тем медленнее реагирует SLO на кратковременные всплески ошибок.
Burn Rate Alerting
Стратегия алертинга, при которой оповещение срабатывает не при нарушении SLO, а при превышении определённой скорости сжигания бюджета. Это позволяет реагировать до того, как SLO будет нарушен.
Пример: если SLO = 99.9% за 30 дней,
алерт при burn rate > 2 за 1 час
→ время до нарушения: примерно 12 часовMulti-window, Multi-burn-rate
Стратегия Google SRE, при которой алерты срабатывают на основе нескольких временных окон и порогов burn rate. SLOzy рекомендует настроить:
- Быстрый алерт (5 мин, burn rate > 10) — для критических проблем
- Медленный алерт (30 мин, burn rate > 3) — для постепенной деградации