Руководство пользователя SLOzy
Полное руководство по использованию коммерческой платформы SLOzy для управления Уровнями обслуживания сервисов (SLO).
👥 Целевая аудитория
Это руководство разработано для:
- DevOps-инженеров, которые хотят следить за надежностью сервисов
- Site Reliability Engineers, внедряющих SLO-фреймворки
- Технических руководителей, управляющих показателями производительности команд
- Стартапов, не имеющих экспертизы SRE
🏗️ Обзор системы
SLOzy предоставляет комплексное решение для управления и мониторинга SLO и состоит из следующих компонентов:
Основные компоненты
- Управление SLO - Создание, обновление и мониторинг SLO
- Интеграция с Prometheus - Подключение к нескольким источникам данных Prometheus
Подробнее об архитектуре: Архитектура системы 3. Мониторинг в реальном времени - Дашборды с мгновенными обновлениями 4. Уведомления - Многоканальная система оповещения 5. Кэширование - Кэширование результатов запросов для производительности 6. GitOps - Синхронизация с файлами SLO в репозиториях 7. Аналитика - Обнаружение аномалий и рекомендации
Архитектура
┌─────────────────────────────────────────────────┐
│ Слой приложения SLOzy │
├─────────────────────────────────────────────────┤
│ Frontend: React + TypeScript │
│ Backend: Go + Gin Framework │
│ WebSocket: Обновления в реальном времени │
├─────────────────────────────────────────────────┤
│ Слой интеграции │
├─────────────────────────────────────────────────┤
│ • Ввод метрик Prometheus │
│ • GitOps синхронизация репозитории │
│ • Система доставки уведомлений │
│ • Слой кэширования запросов │
├─────────────────────────────────────────────────┤
│ Слой данных │
├─────────────────────────────────────────────────┤
│ PostgreSQL: Постоянные SLOs, пользователи, метрики │
│ Redis: Кэширование, сессии, данные в реальном времени│
│ Time Series DB: Исторические метрики │
└─────────────────────────────────────────────────┘🚀 Начало работы
Первые шаги
- Установите SLOzy - Следуйте нашему Руководству по установке
- Создайте аккаунт - Настройте аутентификацию
- Настройте Prometheus - Добавьте источники данных
- Создайте первый SLO - Начните мониторинг сразу
- Настройте оповещения - Получайте уведомления о проблемах
Основные концепции
Уровни обслуживания (SLOs)
SLO определяют целевой уровень производительности ваших сервисов:
Ключевые компоненты SLO:
- Целевой процент: Желаемый уровень производительности (например, 99.9%)
- Временное окно: Период, за который измеряется производительность
- Тип метрики: Тип отслеживаемой метрики (доступность, задержки, пропускная способность)
- Запрос Prometheus: Запрос сбора метрик
Пример SLO:
Название: Время ответа API
Цель: 99.9%
Временное окно: 1 час
Метрика: Задержка (P95)
Запрос: histogram_quantile(0.95, rate(http_request_duration_seconds_bucket[5m]))Error Budget (Бюджет ошибок)
Error Budget представляют количество ошибок, которое вы можете допустить:
Error Budget = (1 - Цель) × Запросов всегоПример: Для цели 99.9% и 1M запросов:
Error Budget = (1 - 0.999) × 1,000,000 = 1000 допустимых ошибокBurn Rate (Скорость сгорания)
Скорость, с которой вы потребляете error budget:
Burn Rate = Ошибки в единицу времени / Error Budget в единицу времени📚 Документация функций
1. Управление SLO
Создавайте, обновляйте и мониторьте Уровни обслуживания.
Ключевые операции:
- Создание SLO: Определите цели производительности для ваших сервисов
- Обновление SLO: Модифицируйте цели и запросы по необходимости
- Контроль версий: Отслеживайте изменения с git-like версионированием
- Мониторинг производительности: Смотрите работу в реальном времени по сравнению с целями
Сценарии использования:
- Мониторинг времени ответа API
- Отслеживание доступности приложений
- Измерение пропускной способности
- Мониторинг производительности базы данных
2. Мониторинг в реальном времени
Live дашборды с мгновенными обновлениями метрик через WebSocket.
Функции:
- Live дашборды: Производительность SLO в реальном времени
- WebSocket обновления: Мгновенные изменения метрик
- Индикаторы статуса: Здоровое состояние каждого SLO
- Исторические тренды: Производительность во времени
Навигация:
- Dashboard → Обзор всех SLO
- Страница деталей SLO → Индивидуальный мониторинг SLO
- Metrics в реальном времени → Последние данные о производительности
3. Уведомления
Многоканальная система оповещения о нарушениях SLO.
Каналы уведомлений:
- Email: Автоматические email-уведомления
- Slack: Уведомления в каналы Slack
- Telegram: Оповещения через Telegram Bot API
- Mattermost: Уведомления через Mattermost Incoming Webhook
- Webhook: Пользовательские интеграции через webhook
Подробнее: Настройка каналов уведомлений
Конфигурация оповещений:
- Создание правил: Определите, когда активировать оповещения
- Приоритеты: Низкий, средний, высокий, критический
- Расписание по времени: Правила оповещений по времени
- Тестовые уведомления: Проверка доставки уведомлений
4. Система кэширования
Кэширование результатов запросов для улучшения производительности.
Возможности кэша:
- Автоматическое кэширование: Результаты запросов хранятся для быстрого доступа
- Настраиваемый TTL: Контроль времени истечения кэша
- Статистика кэша: Hit rate, использование памяти
- Ручная инвалидация: Очистка кэша по необходимости
Влияние на производительность:
- Снижение нагрузки на базу данных на 60-80%
- Ответы на запросы за секунды
- Улучшенная масштабируемость
5. Интеграция GitOps
Синхронизация SLO с файлами репозиториев для GitOps рабочих процессов.
Возможности:
- Синхронизация репозитория: Автоматическая синхронизация с репозиториями Git
- Валидация PR: Проверка SLO в pull requests
- История версий: Отслеживание всех изменений SLO
- Разрешение конфликтов: Обработка конфликтов при слиянии
Сценарии использования:
- Infrastructure as Code
- Управление изменениями
- Командная работа
- Соответствие требованиям аудита
🛠️ Конфигурация
Конфигурация приложения
Переменные окружения и настройки приложения.
Конфигурация базы данных
Настройка базы данных, миграции и оптимизация.
Настройки безопасности
Аутентификация, авторизация и настройки безопасности.
Конфигурация мониторинга
Prometheus, Grafana и настройка оповещений.
🔗 Справочник API
Полная документация API для всех конечных точек:
🚀 Развертывание
Настройка для разработки
Настройка локальной среды разработки.
Развертывание в Docker
Развертывание на основе контейнеров.
Развертывание в Kubernetes
Производственное развертывание в Kubernetes с автомасштабированием.
Подготовка к продакшену
Жесткая установка безопасности, производительности и надежности.
📊 Операции
Руководство по мониторингу
Метрики, дашборды и настройка оповещений.
Настройка производительности
Техники оптимизации и лучшие практики.
Бэкап и восстановление
Процедуры бэкапа данных и аварийное восстановление.
🛡️ Безопасность
Обзор безопасности
Архитектура безопасности и модель угроз.
Аутентификация
Вход, OAuth и управление сессиями.
Авторизация
RBAC, права доступа и контроль доступа.
🔧 Устранение неполадок
Общие проблемы
Распространенные проблемы и решения.
FAQ
Часто задаваемые вопросы.
Глоссарий
Технические термины и определения.
📞 Поддержка
Для получения дополнительной помощи:
- Email: support@slozy.net
- Документация: https://slozy.net/docs
- Статус страницы: https://status.slozy.net
- Сообщество: https://community.slozy.net
🗺️ Навигация
Используйте боковую панель для навигации между разделами. Каждый раздел имеет свое оглавление для быстрой навигации.
📖 Разделы документации
| Раздел | Описание | Целевая аудитория |
|---|---|---|
| Начало работы | Установка и настройка | Все пользователи |
| Установка | Руководства по установке | DevOps/SRE |
| Конфигурация | Опции конфигурации | Администраторы |
| Функции | Документация функций | Все пользователи |
| Справочник API | Документация API | Разработчики |
| Развертывание | Руководства по развертыванию | DevOps |
| Операции | Операции и мониторинг | SREs |
| Безопасность | Практики безопасности | Инженеры безопасности |
| Устранение проблем | Решение проблем | Все пользователи |
Навигация:
- 📖 План документации ⏮️
- 🚀 Быстрый старт ⏭️
- 📊 Руководство пользователя 📍
Далее: Быстрый старт: Docker Compose ⏭️