Свой инференс-сервер
Разворачиваете vLLM с OpenAI-совместимым API в Docker с поддержкой GPU, добавляете API-шлюз и балансировку нагрузки перед контейнером модели.
Всё о выводе LLM в продакшн: мониторинг, оптимизация и надёжность систем. 25 уроков · 5 модулей · 750 минут. От выбора модели до продвинутого RAG и capstone-проекта.
Разворачиваете vLLM с OpenAI-совместимым API в Docker с поддержкой GPU, добавляете API-шлюз и балансировку нагрузки перед контейнером модели.
Квантизируете модель (GPTQ/AWQ), включаете KV-cache и continuous batching — и замеряете реальный прирост throughput и снижение latency.
Настраиваете логирование трейсов, дашборд метрик качества и стоимости, алерты на деградацию ответов и всплеск расходов по токенам.
Собираете RAG с векторной базой и контролем цитирования, добавляете fine-tuning через LoRA/QLoRA и оцениваете качество на своём датасете.
Финальный капстоун, объединяющий весь курс: выбор и загрузка модели → инференс на vLLM в Kubernetes → квантизация и батчинг → мониторинг качества и стоимости → CI/CD с автоскейлингом. Готовый проект для портфолио.
Базовый Python и общее представление о работе с API — этого достаточно. Курс начинается с архитектуры LLM-систем и выбора модели, а Docker и Kubernetes объясняются по ходу дела, без требования опыта DevOps.
Для практики с локальным инференсом желателен GPU, но это не блокер: показываем бесплатные облачные варианты и Google Colab, а квантизация и оптимизации из модуля 2 позволяют запускать модели даже на скромном железе.
Большинство курсов про промпты и чатботов на демо-данных. Мы про эксплуатацию: как развернуть инференс, ускорить и удешевить его, следить за качеством и стоимостью — полный набор навыков LLMOps-инженера с проектами в портфолио.
vLLM, TGI и Ollama, Docker и Kubernetes, API-шлюзы и CI/CD, квантизация INT8/INT4 (GPTQ, AWQ), KV-cache и continuous batching, спекулятивный декодинг, мониторинг с Prometheus/Grafana и Langfuse, A/B-тестирование, RAG в продакшне, fine-tuning через LoRA/QLoRA и агентные системы.
Выводить LLM в продакшн самостоятельно: выбирать модель под задачу и бюджет, разворачивать и масштабировать инференс, ускорять его квантизацией и батчингом, контролировать качество и расходы, строить надёжные RAG- и агентные системы.
Все 25 уроков, примеры кода и конфиги Docker/Kubernetes, практические проекты, capstone-пайплайн, все обновления курса, сертификат об окончании и доступ навсегда. Цена — 5 900 ₽.