Skip to content

Часто задаваемые вопросы (FAQ)

1. Что такое SLO и зачем он нужен?

SLO (Service Level Objective) — целевой уровень качества сервиса, выраженный в числовых метриках. Например: «99.9% запросов должны выполняться быстрее 200 мс за 30-дневное окно». SLO помогает командам понимать, достаточно ли стабилен сервис для пользователей, и принимать обоснованные решения о релизах.

2. Как SLOzy рассчитывает Error Budget?

Error Budget = 100% — SLO target. Если SLO = 99.9%, то Error Budget = 0.1% от общего времени. SLOzy агрегирует метрики из Prometheus, сравнивает фактические значения с целевыми и вычисляет剩余 бюджета и скорость его сжигания (burn rate).

3. Что означает статус SLO: ok, warning, critical?

  • ok: Error Budget не исчерпан, сервис в пределах нормы
  • warning: Израсходовано более 50% Error Budget за текущее времявое окно
  • critical: Error Budget полностью исчерпан — SLO нарушен

SLOzy отображает статусы на дашборде и через WebSocket передаёт изменения в реальном времени.

4. Можно ли использовать SLOzy без Prometheus?

Да, для ручного ввода метрик. Но основная ценность SLOzy раскрывается в связке с Prometheus — автоматическая ингестия метрик, исторические данные, алерты по burn rate.

5. Как настроить алерты в SLOzy?

Алерты настраиваются через Prometheus Alertmanager. SLOzy экспортирует метрику slo_status и slo_burn_rate. Пример алерта:

yaml
- alert: CriticalSLOViolation
  expr: slo_status{slo_id=".*", status="critical"} > 0
  for: 5m
  labels:
    severity: critical

Также поддерживаются Telegram-уведомления.

6. Как происходит деплой новой версии SLOzy?

Рекомендуется blue-green deployment через Kubernetes. Запускаете deployment-v2.yaml с новой версией, проверяете, переключаете трафик. При проблемах — откат переключением селектора обратно на v1.

7. Как часто нужно делать бэкап?

SLOzy хранит исторические метрики SLO и конфигурации. Рекомендуется ежедневный pg_dump с retention 30 дней. Бэкапы критичны — без них восстановление SLO-истории невозможно.

8. Какие метрики производительности важно мониторить?

  • cache_hit_ratio — эффективность кэширования запросов
  • http_request_duration_seconds — p95 и p99 latency
  • pg_stat_database_numbackends — количество соединений к БД
  • Burn rate — скорость расходования Error Budget

9. Как быстро восстановиться после сбоя?

  1. Определить статус SLO на дашборде
  2. Проверить burn rate — сколько времени осталось до исчерпания бюджета
  3. Использовать алерты Prometheus для выявления первопричины
  4. Применить фикс, наблюдать за восстановлением метрик
  5. После восстановления — автоматический пересчёт SLO статуса

10. Есть ли миграция с другого SLO-инструмента?

SLOzy использует стандартный Prometheus как source of truth. Миграция обычно сводится к импорту Prometheus-запросов через API или интерфейс SLOzy. Для данных, которые не хранятся в Prometheus, используйте ручное создание SLO через UI.