Yandex Cloud
Поиск
Связаться с экспертомПопробовать бесплатно
  • Кейсы
  • Документация
  • Блог
  • Все сервисы
    • Cloud Interconnect
    • Cloud Backup
    • Cloud Registry
    • Yandex AI Studio
    • Compute Cloud
    • Object Storage
    • Managed Service for Kubernetes®
    • Yandex BareMetal
    • Smart Web Security
    • Security Deck
    • Managed Service for PostgreSQL
    • Managed Service for ClickHouse®
    • Monium
    • Cloud CDN
    • Network Load Balancer
    • Virtual Private Cloud
    • Cloud DNS
    • Application Load Balancer
    • Yandex Cloud Video
    • Stackland
    • Yandex Cloud Router
    • Yandex Managed Service for Trino
    • Managed Service for MySQL®
    • Managed Service for Valkey™
    • Managed Service for Apache Spark™
    • Yandex StoreDoc
    • Managed Service for OpenSearch
    • Managed Service for Apache Kafka®
    • Data Transfer
    • Yandex MPP Analytics Engine for PostgreSQL
    • Yandex Managed Service for Apache Airflow®
    • Data Processing
    • Yandex MetaData Hub
    • Managed Service for YDB
    • Managed Service for Sharded PostgreSQL
    • Managed Service for YTsaurus
    • Yandex WebSQL
    • DataLens
    • Yandex Search API
    • SpeechSense
    • SpeechKit
    • DataSphere
    • Vision OCR
    • Translate
    • Yandex Neurosupport
    • Yandex Cloud Detection and Response
    • Yandex Identity Hub
    • Key Management Service
    • Certificate Manager
    • Yandex Lockbox
    • Audit Trails
    • SmartCaptcha
    • Cloud Desktop
    • GOST Gateway
    • Yandex SIEM
    • SourceCraft Code Assistant
    • Container Registry
    • Managed Service for GitLab
    • SourceCraft
    • Managed Service for Prometheus®
    • Cloud Functions
    • API Gateway
    • Yandex Cloud Postbox
    • Message Queue
    • Serverless Integrations
    • IoT Core
    • Data Streams
    • Serverless Containers
    • Cloud Notification Service
    • Yandex Query
    • Identity and Access Management
    • Yandex Cloud Console
    • Resource Manager
    • Yandex Cloud Billing
    • Yandex Cloud Quota Manager
    • Cloud Apps
  • Статус работы сервисов
  • Marketplace
    • Популярные
    • Инфраструктура и сеть
    • Платформа данных
    • Искусственный интеллект
    • Безопасность
    • Инструменты DevOps
    • Бессерверные вычисления
    • Управление ресурсами
  • Все решения
    • По отраслям
    • По типу задач
    • Экономика платформы
    • Yandex Cloud Trust
    • Техническая поддержка
    • Каталог партнёров
    • Обучение и сертификация
    • Облако для стартапов
    • Облако для крупного бизнеса
    • Центр технологий для общества
    • Облако для интеграторов
    • Поддержка IT-бизнеса
    • Облако для фрилансеров
    • Обучение и сертификация
    • Блог
    • Документация
    • Контент-программа
    • Мероприятия и вебинары
    • Контакты, чаты и сообщества
    • Идеи
    • Калькулятор цен
    • Тарифы
    • Акции и free tier
  • Кейсы
  • Документация
  • Блог
Создавайте контент и получайте гранты!Готовы написать своё руководство? Участвуйте в контент-программе и получайте гранты на работу с облачными сервисами!
Подробнее о программе
Проект Яндекса
© 2026 ООО «Яндекс.Облако»
Yandex Data Processing
  • Начало работы
    • Все инструкции
      • Подключение к интерфейсам компонентов
      • Использование Sqoop
      • Настройка Apache Iceberg™
        • Настройка Delta Lake в однокластерном режиме
        • Настройка Delta Lake в мультикластерном режиме
        • Советы по настройке и применению Delta Lake
    • Подготовка и использование виртуальных окружений Python
  • Управление доступом
  • Правила тарификации
  • Справочник Terraform
  • Метрики Monitoring
  • Аудитные логи Audit Trails
  • Публичные материалы
  • Вопросы и ответы
  • Обучающие курсы

В этой статье:

  • Оптимизация записи в S3-совместимые хранилища
  • Увеличение эффективности работы оператора OPTIMIZE
  • Синтаксис для конвертации партиционированных таблиц
  • Принудительная очистка истории изменений таблицы
  1. Пошаговые инструкции
  2. Сервисы Apache и другие сторонние сервисы
  3. Delta Lake
  4. Советы по настройке и применению Delta Lake

Советы по настройке и применению Delta Lake

Статья создана
Yandex Cloud
Обновлена 9 июня 2026 г.
Открыть в Markdown
  • Оптимизация записи в S3-совместимые хранилища
  • Увеличение эффективности работы оператора OPTIMIZE
  • Синтаксис для конвертации партиционированных таблиц
  • Принудительная очистка истории изменений таблицы

Оптимизация записи в S3-совместимые хранилищаОптимизация записи в S3-совместимые хранилища

Если часть данных в рамках задания представлена в форматах, отличных от таблиц Delta Lake, то для оптимизации записи данных в S3-совместимые хранилища настройте коммиттеры S3A.

Если все данные в рамках задания хранятся в таблицах Delta Lake, то настройка коммиттеров S3A не нужна. Delta Lake использует свой алгоритм управления записью в S3-совместимые хранилища, функционально эквивалентный коммиттерам S3A.

Увеличение эффективности работы оператора OPTIMIZEУвеличение эффективности работы оператора OPTIMIZE

Оператор OPTIMIZE в Delta Lake 2.0.2 повышает скорость запросов на чтение из таблицы за счет того, что объединяет несколько мелких файлов в более крупные. Это объединение происходит в рамках нескольких параллельных заданий. Максимальное количество таких параллельных заданий регулируется свойством spark.databricks.delta.optimize.maxThreads, и по умолчанию составляет 10.

Чтобы ускорить выполнение процедуры оптимизации при обработке больших таблиц, увеличьте значение для этого свойства. Вы можете использовать намного большие значения, например 100 или 1000, если ресурсы кластера позволяют запустить такое количество параллельных операций.

Синтаксис для конвертации партиционированных таблицСинтаксис для конвертации партиционированных таблиц

Оператор CONVERT TO DELTA преобразует обычные таблицы Spark SQL в формат Delta Lake. Чтобы преобразовать партиционированную таблицу, укажите в запросе колонки партиционирования:

CONVERT TO DELTA table_name PARTITIONED BY (part_col_1 INT, part_col_2 INT);

Принудительная очистка истории изменений таблицыПринудительная очистка истории изменений таблицы

По умолчанию Delta Lake хранит историю изменений таблицы в течение 30 суток. Этот период определен на уровне таблицы в параметре delta.logRetentionDuration и изменить его можно командой:

ALTER TABLE <схема_и_имя_таблицы> SET TBLPROPERTIES ('delta.logRetentionDuration' = "interval <интервал>")

Подробнее об управлении параметрами таблиц в документации Delta Lake.

Чтобы принудительно очистить историю изменений таблицы:

  1. Реорганизуйте данные в таблице, чтобы повысить эффективность доступа:

    OPTIMIZE <имя_таблицы>;
    
  2. Разрешите удаление всей истории изменений:

    SET spark.databricks.delta.retentionDurationCheck.enabled = false;
    
  3. Очистите историю изменений:

    VACUUM <имя_таблицы> RETAIN 0 HOURS;
    

Была ли статья полезна?

Предыдущая
Настройка Delta Lake в мультикластерном режиме
Следующая
Все задания
Создавайте контент и получайте гранты!Готовы написать своё руководство? Участвуйте в контент-программе и получайте гранты на работу с облачными сервисами!
Подробнее о программе
Проект Яндекса
© 2026 ООО «Яндекс.Облако»