Часто задаваемые вопросы (FAQ)
1. Что такое SLO и зачем он нужен?
SLO (Service Level Objective) — целевой уровень качества сервиса, выраженный в числовых метриках. Например: «99.9% запросов должны выполняться быстрее 200 мс за 30-дневное окно». SLO помогает командам понимать, достаточно ли стабилен сервис для пользователей, и принимать обоснованные решения о релизах.
2. Как SLOzy рассчитывает Error Budget?
Error Budget = 100% — SLO target. Если SLO = 99.9%, то Error Budget = 0.1% от общего времени. SLOzy агрегирует метрики из Prometheus, сравнивает фактические значения с целевыми и вычисляет剩余 бюджета и скорость его сжигания (burn rate).
3. Что означает статус SLO: ok, warning, critical?
- ok: Error Budget не исчерпан, сервис в пределах нормы
- warning: Израсходовано более 50% Error Budget за текущее времявое окно
- critical: Error Budget полностью исчерпан — SLO нарушен
SLOzy отображает статусы на дашборде и через WebSocket передаёт изменения в реальном времени.
4. Можно ли использовать SLOzy без Prometheus?
Да, для ручного ввода метрик. Но основная ценность SLOzy раскрывается в связке с Prometheus — автоматическая ингестия метрик, исторические данные, алерты по burn rate.
5. Как настроить алерты в SLOzy?
Алерты настраиваются через Prometheus Alertmanager. SLOzy экспортирует метрику slo_status и slo_burn_rate. Пример алерта:
- alert: CriticalSLOViolation
expr: slo_status{slo_id=".*", status="critical"} > 0
for: 5m
labels:
severity: criticalТакже поддерживаются Telegram-уведомления.
6. Как происходит деплой новой версии SLOzy?
Рекомендуется blue-green deployment через Kubernetes. Запускаете deployment-v2.yaml с новой версией, проверяете, переключаете трафик. При проблемах — откат переключением селектора обратно на v1.
7. Как часто нужно делать бэкап?
SLOzy хранит исторические метрики SLO и конфигурации. Рекомендуется ежедневный pg_dump с retention 30 дней. Бэкапы критичны — без них восстановление SLO-истории невозможно.
8. Какие метрики производительности важно мониторить?
cache_hit_ratio— эффективность кэширования запросовhttp_request_duration_seconds— p95 и p99 latencypg_stat_database_numbackends— количество соединений к БД- Burn rate — скорость расходования Error Budget
9. Как быстро восстановиться после сбоя?
- Определить статус SLO на дашборде
- Проверить burn rate — сколько времени осталось до исчерпания бюджета
- Использовать алерты Prometheus для выявления первопричины
- Применить фикс, наблюдать за восстановлением метрик
- После восстановления — автоматический пересчёт SLO статуса
10. Есть ли миграция с другого SLO-инструмента?
SLOzy использует стандартный Prometheus как source of truth. Миграция обычно сводится к импорту Prometheus-запросов через API или интерфейс SLOzy. Для данных, которые не хранятся в Prometheus, используйте ручное создание SLO через UI.