Skip to content

Руководство пользователя SLOzy

Полное руководство по использованию коммерческой платформы SLOzy для управления Уровнями обслуживания сервисов (SLO).

👥 Целевая аудитория

Это руководство разработано для:

  • DevOps-инженеров, которые хотят следить за надежностью сервисов
  • Site Reliability Engineers, внедряющих SLO-фреймворки
  • Технических руководителей, управляющих показателями производительности команд
  • Стартапов, не имеющих экспертизы SRE

🏗️ Обзор системы

SLOzy предоставляет комплексное решение для управления и мониторинга SLO и состоит из следующих компонентов:

Основные компоненты

  1. Управление SLO - Создание, обновление и мониторинг SLO
  2. Интеграция с Prometheus - Подключение к нескольким источникам данных Prometheus

Подробнее об архитектуре: Архитектура системы 3. Мониторинг в реальном времени - Дашборды с мгновенными обновлениями 4. Уведомления - Многоканальная система оповещения 5. Кэширование - Кэширование результатов запросов для производительности 6. GitOps - Синхронизация с файлами SLO в репозиториях 7. Аналитика - Обнаружение аномалий и рекомендации

Архитектура

┌─────────────────────────────────────────────────┐
│         Слой приложения SLOzy                     │
├─────────────────────────────────────────────────┤
│  Frontend: React + TypeScript                      │
│  Backend: Go + Gin Framework                     │
│  WebSocket: Обновления в реальном времени      │
├─────────────────────────────────────────────────┤
│         Слой интеграции                     │
├─────────────────────────────────────────────────┤
│  • Ввод метрик Prometheus                      │
│  • GitOps синхронизация репозитории            │
│  • Система доставки уведомлений                │
│  • Слой кэширования запросов                  │
├─────────────────────────────────────────────────┤
│         Слой данных                             │
├─────────────────────────────────────────────────┤
│  PostgreSQL: Постоянные SLOs, пользователи, метрики │
│  Redis: Кэширование, сессии, данные в реальном времени│
│  Time Series DB: Исторические метрики              │
└─────────────────────────────────────────────────┘

🚀 Начало работы

Первые шаги

  1. Установите SLOzy - Следуйте нашему Руководству по установке
  2. Создайте аккаунт - Настройте аутентификацию
  3. Настройте Prometheus - Добавьте источники данных
  4. Создайте первый SLO - Начните мониторинг сразу
  5. Настройте оповещения - Получайте уведомления о проблемах

Основные концепции

Уровни обслуживания (SLOs)

SLO определяют целевой уровень производительности ваших сервисов:

Ключевые компоненты SLO:

  • Целевой процент: Желаемый уровень производительности (например, 99.9%)
  • Временное окно: Период, за который измеряется производительность
  • Тип метрики: Тип отслеживаемой метрики (доступность, задержки, пропускная способность)
  • Запрос Prometheus: Запрос сбора метрик

Пример SLO:

Название: Время ответа API
Цель: 99.9%
Временное окно: 1 час
Метрика: Задержка (P95)
Запрос: histogram_quantile(0.95, rate(http_request_duration_seconds_bucket[5m]))

Error Budget (Бюджет ошибок)

Error Budget представляют количество ошибок, которое вы можете допустить:

Error Budget = (1 - Цель) × Запросов всего

Пример: Для цели 99.9% и 1M запросов:

Error Budget = (1 - 0.999) × 1,000,000 = 1000 допустимых ошибок

Burn Rate (Скорость сгорания)

Скорость, с которой вы потребляете error budget:

Burn Rate = Ошибки в единицу времени / Error Budget в единицу времени

📚 Документация функций

1. Управление SLO

Полное руководство

Создавайте, обновляйте и мониторьте Уровни обслуживания.

Ключевые операции:

  • Создание SLO: Определите цели производительности для ваших сервисов
  • Обновление SLO: Модифицируйте цели и запросы по необходимости
  • Контроль версий: Отслеживайте изменения с git-like версионированием
  • Мониторинг производительности: Смотрите работу в реальном времени по сравнению с целями

Сценарии использования:

  • Мониторинг времени ответа API
  • Отслеживание доступности приложений
  • Измерение пропускной способности
  • Мониторинг производительности базы данных

2. Мониторинг в реальном времени

Полное руководство

Live дашборды с мгновенными обновлениями метрик через WebSocket.

Функции:

  • Live дашборды: Производительность SLO в реальном времени
  • WebSocket обновления: Мгновенные изменения метрик
  • Индикаторы статуса: Здоровое состояние каждого SLO
  • Исторические тренды: Производительность во времени

Навигация:

  • Dashboard → Обзор всех SLO
  • Страница деталей SLO → Индивидуальный мониторинг SLO
  • Metrics в реальном времени → Последние данные о производительности

3. Уведомления

Полное руководство

Многоканальная система оповещения о нарушениях SLO.

Каналы уведомлений:

  • Email: Автоматические email-уведомления
  • Slack: Уведомления в каналы Slack
  • Telegram: Оповещения через Telegram Bot API
  • Mattermost: Уведомления через Mattermost Incoming Webhook
  • Webhook: Пользовательские интеграции через webhook

Подробнее: Настройка каналов уведомлений

Конфигурация оповещений:

  • Создание правил: Определите, когда активировать оповещения
  • Приоритеты: Низкий, средний, высокий, критический
  • Расписание по времени: Правила оповещений по времени
  • Тестовые уведомления: Проверка доставки уведомлений

4. Система кэширования

Полное руководство

Кэширование результатов запросов для улучшения производительности.

Возможности кэша:

  • Автоматическое кэширование: Результаты запросов хранятся для быстрого доступа
  • Настраиваемый TTL: Контроль времени истечения кэша
  • Статистика кэша: Hit rate, использование памяти
  • Ручная инвалидация: Очистка кэша по необходимости

Влияние на производительность:

  • Снижение нагрузки на базу данных на 60-80%
  • Ответы на запросы за секунды
  • Улучшенная масштабируемость

5. Интеграция GitOps

Полное руководство

Синхронизация SLO с файлами репозиториев для GitOps рабочих процессов.

Возможности:

  • Синхронизация репозитория: Автоматическая синхронизация с репозиториями Git
  • Валидация PR: Проверка SLO в pull requests
  • История версий: Отслеживание всех изменений SLO
  • Разрешение конфликтов: Обработка конфликтов при слиянии

Сценарии использования:

  • Infrastructure as Code
  • Управление изменениями
  • Командная работа
  • Соответствие требованиям аудита

🛠️ Конфигурация

Конфигурация приложения

Полное руководство

Переменные окружения и настройки приложения.

Конфигурация базы данных

Полное руководство

Настройка базы данных, миграции и оптимизация.

Настройки безопасности

Полное руководство

Аутентификация, авторизация и настройки безопасности.

Конфигурация мониторинга

Полное руководство

Prometheus, Grafana и настройка оповещений.

🔗 Справочник API

Полная документация API для всех конечных точек:

🚀 Развертывание

Настройка для разработки

Полное руководство

Настройка локальной среды разработки.

Развертывание в Docker

Полное руководство

Развертывание на основе контейнеров.

Развертывание в Kubernetes

Полное руководство

Производственное развертывание в Kubernetes с автомасштабированием.

Подготовка к продакшену

Полное руководство

Жесткая установка безопасности, производительности и надежности.

📊 Операции

Руководство по мониторингу

Полное руководство

Метрики, дашборды и настройка оповещений.

Настройка производительности

Полное руководство

Техники оптимизации и лучшие практики.

Бэкап и восстановление

Полное руководство

Процедуры бэкапа данных и аварийное восстановление.

🛡️ Безопасность

Обзор безопасности

Полное руководство

Архитектура безопасности и модель угроз.

Аутентификация

Полное руководство

Вход, OAuth и управление сессиями.

Авторизация

Полное руководство

RBAC, права доступа и контроль доступа.

🔧 Устранение неполадок

Общие проблемы

Полное руководство

Распространенные проблемы и решения.

FAQ

Полное руководство

Часто задаваемые вопросы.

Глоссарий

Полное руководство

Технические термины и определения.

📞 Поддержка

Для получения дополнительной помощи:

Используйте боковую панель для навигации между разделами. Каждый раздел имеет свое оглавление для быстрой навигации.

📖 Разделы документации

РазделОписаниеЦелевая аудитория
Начало работыУстановка и настройкаВсе пользователи
УстановкаРуководства по установкеDevOps/SRE
КонфигурацияОпции конфигурацииАдминистраторы
ФункцииДокументация функцийВсе пользователи
Справочник APIДокументация APIРазработчики
РазвертываниеРуководства по развертываниюDevOps
ОперацииОперации и мониторингSREs
БезопасностьПрактики безопасностиИнженеры безопасности
Устранение проблемРешение проблемВсе пользователи

Навигация:


Далее: Быстрый старт: Docker Compose ⏭️

Язык: 🇬🇧 English | 🇷🇺 Русский