32 урока · 978 минут · 1 итоговый проект

Data Engineer — инженерия данных для AI

SQL, ClickHouse, Airflow, dbt и Kafka. Научитесь строить пайплайны данных, которые питают RAG и ML-модели.

32
Урока
7
Модулей
978
Минут
1
Итоговый проект
SQLPostgreSQLPythonClickHouseStar SchemaAirflowdbtKafka

Ваш путь в инженерию данных

До курса

Где вы сейчас

  • Данные есть, но разбросаны по CSV, Excel и базам
  • Пайплайны запускаются вручную или «на коленке»
  • SQL и Python — вперемешку с обработкой в памяти
  • Для AI данные не готовы: грязные, без метаданных
  • Нет единого хранилища и контроля качества
После курса

Что вы сможете

  • Строить пайплайны на Python и SQL/PostgreSQL
  • Оркестрировать процессы Airflow и dbt
  • Хранить данные в ClickHouse по Star Schema
  • Стримить события через Kafka в реальном времени
  • Готовить данные для RAG-систем и ML-моделей

7 модулей · 32 урока · 978 минут

От SQL и Python до потоковой обработки и сквозного пайплайна для AI. Каждый модуль закрывается практическим заданием.

Загрузка программы...

Программа курса: 32 уроков, 7 модулей

Полный список тем идёт ниже — по нему можно проверить, закрывает ли курс вашу задачу, до покупки.

Показать все 32 уроков
  1. Модуль 0. SQL и реляционные базы

    PostgreSQL, JOIN, оконные функции, индексы

    1. Роль Data Engineer 30 мин
    2. PostgreSQL: база 32 мин
    3. JOIN и оконные функции 35 мин
    4. Индексы и EXPLAIN 30 мин
    5. Проект: SQL-анализ 28 мин
  2. Модуль 1. Python для данных

    Pandas, Polars, файловые форматы, ETL

    1. Python для данных 30 мин
    2. CSV, Parquet, JSON 28 мин
    3. Pandas и Polars 35 мин
    4. ETL на Python 32 мин
    5. Проект: ETL-пайплайн 25 мин
  3. Модуль 2. Хранилища: ClickHouse

    MergeTree, партиции, оптимизация, EXPLAIN

    1. OLTP vs OLAP 30 мин
    2. ClickHouse и MergeTree 35 мин
    3. Оптимизация и EXPLAIN 31 мин
  4. Модуль 3. Моделирование: Star Schema

    Факты, измерения, витрины, дашборды

    1. Star Schema 30 мин
    2. Витрины данных 30 мин
    3. Проект: DWH + дашборд 30 мин
  5. Модуль 4. Оркестрация: Airflow + dbt

    DAG, модели, тесты, CI/CD

    1. Оркестрация 30 мин
    2. Airflow DAG 35 мин
    3. dbt-модели 32 мин
    4. CI/CD данных 31 мин
    5. Проект: Airflow+dbt 32 мин
  6. Модуль 5. Streaming: Kafka

    Топики, продюсеры, консьюмеры, real-time

    1. Streaming vs Batch 30 мин
    2. Kafka: топики 32 мин
    3. Продюсеры и консьюмеры 31 мин
    4. Kafka → ClickHouse 32 мин
    5. Проект: real-time 30 мин
  7. Модуль 6. Data для AI + проект

    Пайплайн → RAG/ML ready, капстоун

    1. Качество данных 28 мин
    2. Данные для RAG/ML 30 мин
    3. Docker и деплой 30 мин
    4. Капстоун: пайплайн 32 мин
    5. Капстоун: RAG-ready 32 мин
    6. Карьера и портфолио 20 мин

Один итоговый проект

Сквозной пайплайн данных для AI

По достижении всего курса вы соберёте один итоговый проект — сквозной пайплайн данных: от источников (PostgreSQL, Python, Kafka) через хранилище ClickHouse до витрины, готовой для RAG и ML-моделей.

01
SQL + PostgreSQL
02
Python ETL
03
ClickHouse DWH
04
Airflow + dbt
05
Готово к RAG / ML