Skip to content

Глоссарий

SLO (Service Level Objective)

Целевой уровень качества сервиса — числовая метрика, отражающая ожидаемую надёжность или производительность. Например: «99.9% запросов должны завершаться успешно за 30-дневное окно». SLO — это внутренняя цель команды, в отличие от SLA, которое является юридическим обязательством.

yaml
# Пример SLO в SLOzy
name: "API Latency"
target: 99.9
time_window: "30d"
metric_type: "latency"
metric_query: "histogram_quantile(0.99, rate(http_request_duration_seconds_bucket[5m]))"

SLI (Service Level Indicator)

Фактический показатель качества сервиса, который измеряется в реальном времени. SLI отвечает на вопрос «как хорошо работает сервис прямо сейчас». Примеры: latency p99, error rate, throughput. SLI сравнивается с SLO для определения статуса.

SLA (Service Level Agreement)

Юридическое обязательство перед клиентом с указанием гарантированного уровня качества и санкций за его нарушение. SLA обычно жёстче и ниже SLO — бюджет закладывается между SLA и SLO, чтобы успеть среагировать до нарушения контракта.

Пример соотношения:
  SLA: 99.0% (юридическое обязательство)
  SLO: 99.5% (внутренняя цель)
       ↑ запас 0.5% — Error Budget

Error Budget

Бюджет ошибок — допустимое количество отказов или медленных ответов за времявое окно. Рассчитывается как 100% — SLO%. Если SLO = 99.9% за 30 дней, то Error Budget = 0.1% времени = примерно 43 минуты простоя/медленной работы.

Error budget определяет темп релизов:

  • Бюджет есть → можно релизить новые фичи
  • Бюджет на исходе → остановить релизы, фокус на стабильности
  • Бюджет исчерпан → SLO нарушен, требуется немедленная реакция

Burn Rate

Скорость сжигания Error Budget. Показывает, как быстро расходуется бюджет при текущем уровне ошибок.

Burn Rate = фактическая ошибка / допустимая ошибка

Если Burn Rate = 2, бюджет расходуется в 2 раза быстрее допустимого.

SLOzy использует burn rate для алертов:

yaml
- alert: CriticalSLOViolation
  expr: slo_status == 2

Time Window

Времявое окно — период, за который рассчитывается SLO. SLOzy поддерживает:

  • 7d — неделя, для быстрой обратной связи
  • 30d — месяц, стандартный период
  • 90d — квартал, для долгосрочных контрактов

Чем больше окно, тем медленнее реагирует SLO на кратковременные всплески ошибок.

Burn Rate Alerting

Стратегия алертинга, при которой оповещение срабатывает не при нарушении SLO, а при превышении определённой скорости сжигания бюджета. Это позволяет реагировать до того, как SLO будет нарушен.

Пример: если SLO = 99.9% за 30 дней,
алерт при burn rate > 2 за 1 час
→ время до нарушения: примерно 12 часов

Multi-window, Multi-burn-rate

Стратегия Google SRE, при которой алерты срабатывают на основе нескольких временных окон и порогов burn rate. SLOzy рекомендует настроить:

  • Быстрый алерт (5 мин, burn rate > 10) — для критических проблем
  • Медленный алерт (30 мин, burn rate > 3) — для постепенной деградации