Практические темы ВКР на основе кейса стримингового сервиса

Вместо абстрактного «разработать систему» предлагаю три конкретные темы, которые легко привязать к реальным данным из статьи (скидочные кампании, пиковые нагрузки, работа wearables для сбора метрик здоровья — как дополнительный источник данных).

Тема ВКРАктуальность (отсылка к статье)ЦельКлючевые задачиСтруктура глав
1. Автоматизация CI/CD и canary-развертывание для стримингового сервиса Быстрый выпуск акций (Oscars) требует частых релизов без простоев. Статья показывает, что даже скидочный бандл должен быть доступен 24/7. Спроектировать пайплайн с zero-downtime деплоем и canary-анализом для сервиса подписок.
  • Выбрать инструменты (GitLab CI, ArgoCD, Helm)
  • Настроить прогрессивное развертывание (10% → 50% → 100%)
  • Реализовать откат при росте ошибок >1%
  • Интегрировать мониторинг в пайплайн (Prometheus + AlertManager)
Глава 1 — Обзор CI/CD для высоконагруженных систем; Глава 2 — Архитектура пайплайна (диаграмма C4); Глава 3 — Тестирование на нагрузке и расчет SLA.
2. Auto-scaling и управление затратами в Kubernetes для подписочной платформы Скидка на Hulu/Disney+ вызвала резкий скачок регистраций. Pixel Watch 4 — пример IoT-устройства, генерирующего данные для аналитики, что тоже создаёт нагрузку. Разработать политику автоскейлинга (HPA + VPA + Cluster Autoscaler) с оптимизацией стоимости облачных ресурсов.
  • Построить модель профиля нагрузки (исторические данные из открытых датасетов)
  • Настроить метрики для HPA (CPU, memory, кастомные — RPS, latency)
  • Внедрить spot-инстансы для некритичных компонентов
  • Рассчитать TCO и сравнить с фиксированной инфраструктурой
Глава 1 — Анализ подходов к масштабированию; Глава 2 — Проектирование архитектуры (UML-диаграмма развёртывания); Глава 3 — Эксперимент с нагрузкой и экономический эффект.
3. Мониторинг и observability стримингового сервиса с использованием OpenTelemetry Во время трансляции Оскара критично отслеживать битрейт, буферизацию, ошибки логина. Pixel Watch 4 мог бы передавать телеметрию пользователя (пульс, гео) для персонализации — дополнительный вызов для сбора данных. Внедрить распределённую трассировку и сбор метрик для выявления узких мест при пиковых нагрузках.
  • Развернуть стек OpenTelemetry + Jaeger + Prometheus + Grafana
  • Реализовать трейсинг от запроса на аутентификацию до доставки видео
  • Создать дашборды SLO/SLI (latency p95, error budget, availability)
  • Провести нагрузочное тестирование и зафиксировать улучшения
Глава 1 — Теория observability (модель Three Pillars); Глава 2 — Проектирование системы мониторинга; Глава 3 — Анализ результатов и предложения по оптимизации.

Как привязать статью к конкретной главе ВКР

В Главе 1 (аналитический обзор) используйте пример из статьи: «Во время акции Disney+ снизил цену бандла на 60%, что привело к росту регистраций. Для таких сценариев необходима отказоустойчивая архитектура, поддерживающая Auto-scaling». Сошлитесь на факт из статьи как обоснование актуальности.

В Главе 2 (проектирование) приведите C4-диаграмму контейнеров сервиса подписок. Ниже — пример конфигурации развёртывания с canary strategy:

apiVersion: argoproj.io/v1alpha1
kind: Rollout
metadata:
  name: subscription-api
spec:
  replicas: 10
  strategy:
    canary:
      steps:
      - setWeight: 10
      - pause: {duration: 5m}
      - setWeight: 50
      - pause: {duration: 10m}
      - setWeight: 100
  template:
    metadata:
      labels:
        app: subscription-api
    spec:
      containers:
      - name: api
        image: registry.example.com/subscription:v2.3
  triggers:
  - scalingReplicas

В Главе 3 (тестирование) рассчитайте метрики эффективности: время развёртывания сократилось с 30 мин до 2 мин, частота релизов выросла в 5 раз, error rate не превышал 0.5% во время канарейки. Используйте реальные инструменты: k6 для нагрузки, Grafana для визуализации.

Чему вы научитесь, реализуя такой проект

  • Проектировать отказоустойчивые схемы с zero-downtime (Rolling Update / Canary)
  • Настраивать полноценный CI/CD пайплайн с автоматическими проверками качества
  • Валидировать эффективность автоскейлинга с помощью нагрузочного тестирования
  • Считать TCO/ROI облачной инфраструктуры и обосновывать экономию
  • Подготавливать пояснительную записку по ГОСТ 19 с реальными схемами и листингами