Построение Data Platform на базе Yandex Cloud
- Миграция данных и обновление версий СУБД
- Репликация и потоковый захват изменений данных
- Загрузка и поставка данных
- Интеграция и обмен между системами хранения и обработки данных
- Аналитические вычисления
- Оркестрация пайплайнов
- Хранение, архивация, жизненный цикл данных
- Производительность и диагностика
- Мониторинг, логи, аудит, биллинг
- Безопасность и доступы
- Управление схемами данных
- Развертывание и настройка кластеров
Миграция данных и обновление версий СУБД
Миграция — задача, в рамках которой требуется перенести данные из одного хранилища в другое: из локальных баз в управляемые облачные, между кластерами или со сменой типа СУБД. Практические руководства в этой группе описывают сценарии переноса для MySQL®, PostgreSQL, ClickHouse®, Greenplum®, MongoDB, YDB, OpenSearch и других систем, а также обновление версий баз данных с минимальным простоем.
Полный перечень руководств
- Асинхронная репликация данных из PostgreSQL в ClickHouse®
- Миграция базы данных из стороннего кластера MySQL® в кластер Yandex Managed Service for MySQL®
- Миграция базы данных из стороннего кластера PostgreSQL в Managed Service for PostgreSQL
- Миграция базы данных из стороннего кластера Valkey™ в Yandex Managed Service for Valkey™
- Миграция базы данных из Yandex Managed Service for MySQL® в сторонний кластер MySQL®
- Миграция базы данных из MySQL® в ClickHouse® с помощью Yandex Data Transfer
- Миграция базы данных из Greenplum® в PostgreSQL
- Миграция данных в Managed Service for ClickHouse® средствами ClickHouse®
- Миграция данных в Yandex Managed Service for ClickHouse® при помощи Yandex Data Transfer
- Миграция данных в Yandex Managed Service for OpenSearch из стороннего кластера OpenSearch с помощью Yandex Data Transfer
- Миграция данных в Yandex Managed Service for OpenSearch из стороннего кластера OpenSearch с помощью Yandex Data Transfer
- Миграция данных в Yandex StoreDoc
- Миграция данных в Yandex Object Storage с помощью Yandex Data Transfer
- Миграция данных из AWS RDS for PostgreSQL в Yandex Managed Service for PostgreSQL с помощью Yandex Data Transfer
- Миграция данных из Yandex Managed Service for MySQL® в Yandex MPP Analytics for PostgreSQL с помощью Yandex Data Transfer
- Миграция данных из Managed Service for MySQL® в Managed Service for PostgreSQL с помощью Data Transfer
- Миграция данных из Managed Service for PostgreSQL в Managed Service for MySQL® с помощью Data Transfer
- Миграция данных из Yandex Managed Service for MySQL® в Yandex MPP Analytics for PostgreSQL с помощью Yandex Data Transfer
- Миграция данных из Managed Service for MySQL® в Managed Service for PostgreSQL с помощью Data Transfer
- Миграция данных из Managed Service for PostgreSQL в Managed Service for MySQL® с помощью Data Transfer
- Загрузка данных из Yandex Managed Service for YDB в Yandex Managed Service for PostgreSQL с помощью Yandex Data Transfer
- Миграция данных из Yandex Object Storage в Yandex Managed Service for MySQL® с помощью Yandex Data Transfer
- Миграция базы данных из Google BigQuery в Yandex Managed Service for ClickHouse®
- Миграция базы данных из Yandex Managed Service for MySQL® в Yandex Managed Service for YDB с помощью Yandex Data Transfer
- Миграция базы данных из Yandex Managed Service for MySQL® в Yandex Object Storage
- Миграция базы данных из Greenplum® в ClickHouse®
- Миграция кластера Yandex Managed Service for PostgreSQL на другую версию c помощью Yandex Data Transfer
- Миграция кластера Yandex StoreDoc с версии 4.4 на 6.0 c помощью Yandex Data Transfer
- Миграция кластера Yandex Data Processing с файловой системой HDFS в другую зону доступности
- Обновление кластера Managed Service for Apache Kafka® с ZooKeeper на кластер с поддержкой KRaft
Репликация и потоковый захват изменений данных
Репликация и CDC (Change Data Capture) — процессы непрерывного отслеживания изменений в источнике и их доставки в приемник в режиме реального времени. Практические руководства этой группы описывают настройку репликации между кластерами, а также захват изменений с помощью Debezium и поставку потоков данных в системы-приемники.
Полный перечень руководств
- Поставка данных из Yandex Managed Service for MySQL® в Yandex Managed Service for Apache Kafka® с помощью Debezium
- Поставка данных из Yandex Managed Service for PostgreSQL в Yandex Managed Service for Apache Kafka® с помощью Debezium
- Поставка данных из Yandex Managed Service for PostgreSQL в Yandex Managed Service for YDB с помощью Yandex Data Transfer
- Поставка данных из Yandex Managed Service for YDB в Yandex Managed Service for Apache Kafka® с помощью Yandex Data Transfer
- Обработка потока изменений Debezium
- Синхронизация данных из стороннего кластера MySQL® в Yandex Managed Service for MySQL® с помощью Yandex Data Transfer
- Миграция базы данных из Managed Service for PostgreSQL
- Логическая репликация PostgreSQL
- Создание реестра схем для поставки данных в формате Debezium CDC из Apache Kafka®
Загрузка и поставка данных
Практические руководства описывают архитектурные шаблоны для построения потоков данных: от источников (внешние базы, файлы, логи, брокеры) к хранилищам и обратно. Рассмотрены сценарии потоковой передачи через YDS, доставки событий из Apache Kafka® и RabbitMQ, пакетной загрузки и сквозного трансфера с помощью Data Transfer.
Полный перечень руководств
- Ввод данных в системы хранения
- Умная обработка логов
- Передача данных в микросервисных архитектурах
- Добавление данных в ClickHouse®
- Получение данных из Yandex Managed Service for Apache Kafka® в Yandex Managed Service for ClickHouse®
- Получение данных из RabbitMQ в Yandex Managed Service for ClickHouse®
- Поставка данных в ksqlDB
- Поставка данных из очереди Data Streams в Managed Service for Apache Kafka® с помощью Yandex Data Transfer
- Поставка данных из Yandex Managed Service for Apache Kafka® в Yandex Data Streams с помощью Yandex Data Transfer
- Поставка данных из Yandex Managed Service for Apache Kafka® в Yandex Managed Service for YDB с помощью Yandex Data Transfer
- Сохранение потока данных Yandex Data Streams в Yandex Managed Service for ClickHouse®
- Поставка данных из очереди Data Streams в Managed Service for YDB с помощью Yandex Data Transfer
- Захват изменений Yandex Managed Service for YDB и поставка в Yandex Data Streams
- Поставка данных из Yandex Managed Service for Apache Kafka® в Yandex Managed Service for PostgreSQL с помощью Yandex Data Transfer
- Поставка данных из Yandex Managed Service for Apache Kafka® в Yandex MPP Analytics for PostgreSQL с помощью Yandex Data Transfer
- Миграция базы данных из стороннего кластера Apache Kafka® в Yandex Managed Service for Apache Kafka®
- Настройка Kafka Connect для работы с кластером Yandex Managed Service for Apache Kafka®
- Перенос данных между кластерами Managed Service for Apache Kafka® с помощью Data Transfer
- Поставка данных из Yandex Managed Service for MySQL® в Yandex Managed Service for Apache Kafka® с помощью Yandex Data Transfer
- Поставка данных из Yandex Managed Service for PostgreSQL в Yandex Managed Service for Apache Kafka® с помощью Yandex Data Transfer
- Поставка данных из Yandex Managed Service for Apache Kafka® в Yandex Managed Service for ClickHouse® с помощью Yandex Data Transfer
- Поставка данных из Yandex Managed Service for Apache Kafka® в Yandex StoreDoc с помощью Yandex Data Transfer
- Поставка данных из Yandex Managed Service for Apache Kafka® в Yandex Managed Service for MySQL® с помощью Yandex Data Transfer
- Поставка данных из Yandex Managed Service for Apache Kafka® в Yandex Managed Service for OpenSearch с помощью Yandex Data Transfer
- Загрузка данных из Яндекс Директ в витрину Yandex Managed Service for ClickHouse® с использованием Yandex Cloud Functions, Yandex Object Storage и Yandex Data Transfer
- Миграция данных из стороннего кластера Greenplum® или PostgreSQL в Yandex MPP Analytics for PostgreSQL с помощью Yandex Data Transfer
- Миграция кластера MySQL®
- Миграция на сторонний кластер MySQL®
- Миграция кластера PostgreSQL
- Миграция кластера MongoDB
- Захват изменений MySQL® и поставка в YDS
- Захват изменений PostgreSQL и поставка в YDS
Интеграция и обмен между системами хранения и обработки данных
Руководства этой группы описывают двусторонний обмен данными между разнородными хранилищами и вычислительными системами: ClickHouse®, Greenplum®, PostgreSQL, YDB, OpenSearch, Object Storage и внешними СУБД через JDBC. Сценарии включают поставку данных из аналитических кластеров в реляционные базы данных, обмен между Object Storage и сервисами управляемых баз данных, а также интеграцию OpenSearch с другими хранилищами.
Полный перечень руководств
- Обмен данными между Yandex Managed Service for ClickHouse® и Yandex Data Processing
- Совместная работа с таблицами Yandex Data Processing с использованием Apache Hive™ Metastore
- Импорт данных из Yandex Object Storage, обработка и экспорт в Yandex Managed Service for ClickHouse®
- Работа с топиками Apache Kafka® с помощью PySpark-заданий в Yandex Data Processing
- Интеграция Yandex Managed Service for ClickHouse® с внешней базой данных Microsoft SQL Server через ClickHouse® JDBC Bridge
- Интеграция Yandex Managed Service for ClickHouse® с Oracle через ClickHouse® JDBC Bridge
- Использование Yandex Object Storage в сервисе Yandex Managed Service for Apache Spark™
- Выполнение аналитических запросов в Yandex Managed Service for PostgreSQL с обработкой в Yandex Managed Service for ClickHouse® при помощи pg_clickhouse и Yandex Data Transfer
- Загрузка данных из Yandex Object Storage в Yandex Managed Service for ClickHouse® с помощью Yandex Data Transfer
- Загрузка данных из Yandex Object Storage в Yandex MPP Analytics for PostgreSQL с помощью Yandex Data Transfer
- Перенос данных из Yandex Object Storage в Yandex Managed Service for PostgreSQL с использованием Yandex Data Transfer
- Загрузка данных из Yandex Object Storage в Yandex Managed Service for YDB с помощью Yandex Data Transfer
- Копирование данных из Managed Service for OpenSearch в Managed Service for ClickHouse® с помощью Yandex Data Transfer
- Копирование данных из Managed Service for OpenSearch в Yandex MPP Analytics for PostgreSQL с помощью Yandex Data Transfer
- Миграция данных из Yandex Managed Service for OpenSearch в Yandex Managed Service for YDB с помощью Yandex Data Transfer
- Загрузка данных из Yandex Managed Service for OpenSearch в Yandex Object Storage с помощью Yandex Data Transfer
- Миграция данных из Yandex Managed Service for PostgreSQL в Yandex Managed Service for OpenSearch с помощью Yandex Data Transfer
- Загрузка данных из Yandex Managed Service for YDB в Yandex Managed Service for ClickHouse® с помощью Yandex Data Transfer
- Миграция базы данных из Managed Service for PostgreSQL в Object Storage
- Загрузка данных из Yandex Managed Service for YDB в Yandex Object Storage с помощью Yandex Data Transfer
Аналитические вычисления
Руководства по запуску аналитических задач: Apache Spark™, PySpark, Apache Hive™ Metastore, MapReduce. Сюда входят сценарии удаленного запуска задач, чтения и записи данных, интеграции Apache Spark™ с Apache Hive™ Metastore и DataSphere, а также загрузки данных из реляционных источников через Sqoop.
Полный перечень руководств
- Работа с заданиями Hive
- Работа с заданиями MapReduce
- Работа с заданиями PySpark
- Работа с заданиями Spark
- Запуск заданий Apache Hive
- Запуск и управление приложениями для Spark и PySpark
- Запуск заданий с удаленных хостов, не входящих в кластер Yandex Data Processing
- Работа с таблицей в Object Storage из PySpark-задания с использованием Apache Hive™ Metastore и Apache Iceberg™
- Запуск PySpark-задания в Yandex Managed Service for YTsaurus
- Интеграция Yandex Managed Service for Apache Spark™ и Apache Hive™ Metastore
- Перенос метаданных между кластерами Yandex Data Processing с помощью Apache Hive™ Metastore
- Использование сервиса Yandex Managed Service for Apache Spark™ в Yandex DataSphere
- Импорт данных из Yandex Managed Service for MySQL® в Yandex Data Processing с помощью Sqoop
- Импорт данных из Yandex Managed Service for PostgreSQL в Yandex Data Processing с помощью Sqoop
Оркестрация пайплайнов
Руководства по описанию автоматизации и планированию выполнения задач обработки данных с помощью Apache Airflow™. Сценарии включают автоматический запуск задач, использование Python SDK внутри DAG, совместный запуск Apache Airflow™ и Apache Spark™, а также настройку уведомлений по почте при сбоях в пайплайнах.
Полный перечень руководств
- Автоматизация задач Yandex Query с помощью Yandex Managed Service for Apache Airflow™
- Отправка запросов к API Yandex Cloud через Yandex Cloud Python SDK
- Автоматизация работы с помощью Yandex Managed Service for Apache Airflow™
- Запуск PySpark-задания с помощью Yandex Managed Service for Apache Airflow™
- Автоматизация работы с Yandex Data Processing с помощью Yandex Managed Service for Apache Airflow™
- Настройка SMTP-сервера для отправки уведомлений по электронной почте
Хранение, архивация, жизненный цикл данных
Руководства по управлению жизненным циклом данных в хранилищах: гибридное хранение, шардирование, политики холодного хранения и ротации индексов в OpenSearch, настройка retention-политик, архивация данных.
Полный перечень руководств
- Использование гибридного хранилища в Yandex Managed Service for ClickHouse®
- Шардирование таблиц Yandex Managed Service for ClickHouse®
- Шардирование коллекций Yandex StoreDoc
- Настройка политики холодного хранилища в Yandex Managed Service for OpenSearch
- Настройка политики индексов в Yandex Managed Service for OpenSearch
- Выгрузка данных Greenplum® в гибридное хранилище Yandex Object Storage
- Отслеживание потери сообщений в топике Apache Kafka®
- Синхронизация данных из топиков Apache Kafka® в бакет Object Storage без использования интернета
Производительность и диагностика
Диагностика узких мест, профилирование и устранение проблем производительности в СУБД и сервисах обработки. Сценарии помогут быстро локализовать и исправить проблемы с нагрузкой и скоростью выполнения запросов.
Полный перечень руководств
- Поиск проблем с производительностью кластера Managed Service for PostgreSQL
- Анализ производительности и оптимизация Managed Service for PostgreSQL
- Анализ производительности и оптимизация Managed Service for MySQL®
- Анализ производительности и оптимизация MongoDB
- Решение проблем с сортировкой строк в PostgreSQL после обновления glibc
Мониторинг, логи, аудит, биллинг
Руководства по обработке и анализу различных видов телеметрии: аудитных логов, логов Cloud Logging, детализированных файлов биллинга, а также настройки уведомлений из OpenSearch и работы с Jupyter Notebook в связке с Yandex Query.
Полный перечень руководств
Безопасность и доступы
Сценарии настройки безопасного доступа к ресурсам платформы данных: аутентификация в OpenSearch через SAML и Keycloak, управление секретами при запуске PySpark‑задач и через Connection Manager, а также настройка DNS-peering для частной сети ClickHouse®.
Полный перечень руководств
- Аутентификация в OpenSearch Dashboards кластера Yandex Managed Service for OpenSearch с помощью Keycloak
- Использование секрета Yandex Lockbox в PySpark-задании для подключения к Yandex Managed Service for PostgreSQL
- Настройка прав доступа к секрету, созданному Yandex Connection Manager, для пользователя Yandex Managed Service for PostgreSQL
- Настройка Yandex Cloud DNS для доступа к кластеру Yandex Managed Service for ClickHouse® из других облачных сетей
Управление схемами данных
Schema Registry — сервис для хранения и управления схемами сообщений в форматах Avro, JSON Schema и Protobuf. Сценарии включают создание и настройку управляемого Schema Registry, работу с REST API, а также интеграцию с Confluent Schema Registry для обеспечения совместимости данных в потоковой обработке.
Полный перечень руководств
- Управление схемами данных в Managed Service for Apache Kafka®
- Использование Managed Schema Registry с Yandex Managed Service for Apache Kafka®
- Использование Managed Schema Registry с Yandex Managed Service for Apache Kafka® с помощью REST API
- Использование Confluent Schema Registry с Yandex Managed Service for Apache Kafka®
Развертывание и настройка кластеров
Специализированные сценарии конфигурации и развертывания кластеров управляемых баз данных: установка веб-интерфейса Apache Kafka®, настройка веб-сервера с файлом конфигурации для работы с протоколом s3, инициализация в Yandex Data Processing через init-скрипты, использование кластера PostgreSQL для 1С, хранение PHP-сессий в кластере Yandex Managed Service for Valkey™, настройка Managed Service for ClickHouse® для Graphite, именованные запросы PXF и подключение лемматизатора к OpenSearch.
Полный перечень руководств
- Самостоятельное развертывание веб-интерфейса Apache Kafka®
- Создание внешней таблицы на базе таблицы из бакета Yandex Object Storage с помощью конфигурационного файла
- Монтирование бакетов Yandex Object Storage к файловой системе хостов Yandex Data Processing
- Создание кластера PostgreSQL для «1С:Предприятия»
- Использование кластера Yandex Managed Service for Valkey™ в качестве хранилища сессий PHP
- Настройка Yandex Managed Service for ClickHouse® для Graphite
- Получение данных из внешних источников с помощью именованных запросов
- Использование плагина yandex-lemmer в Yandex Managed Service for OpenSearch
- Подключение MCP-клиента к кластеру OpenSearch
- Распределенные блокировки для 1С:Предприятия в кластере Yandex Managed Service for Valkey™
- Использование кластера Yandex Managed Service for Valkey™ в качестве хранилища кеша для «1С-Битрикс: Управление сайтом»
- Использование Yandex Managed Service for Valkey™ с модулем Search и моделей Yandex AI Studio для векторного поиска в RAG-системе