В сервисе Yandex Data Proc появилась возможность создавать задачи при помощи CLI и API

Появилась поддержка задач для кластеров Apache Spark, Hadoop® и Hive.

Yandex Scale 2026

24 сентября, Москва и онлайн.
Главная технологическая конференция
Yandex Cloud.

Хочу прийти!

Запускайте задания на кластерах Yandex Data Proc с использованием HTTP или gRPC Data Proc API, а также через Yandex Cloud SDK или YC CLI.

Yandex Data Proc поддерживает четыре типа заданий:

  • sparkJob — Apache Spark
  • pysparkJob — Python API для Apache Spark
  • mapreduceJob — Apache Hadoop®
  • hiveJob — Apache Hive

Зачем нужны задания в Yandex Data Proc?

Задания позволяют упростить использование Hadoop-стека технологий. Процесс обработки данных разделяется на задания, которые можно запускать без непосредственного доступа на хосты в Облаке. Это подходит для выполнения разовых операций и для построения ETL-процессов, а также запуска регулярных аналитических расчётов.

Для каких версий поддерживается создание заданий?

Запуск заданий доступен для кластеров, созданных с версией образа v1.1 и выше. Всю диагностическую информацию о запущенных и выполненных заданиях можно найти в истории операций над кластером, а также в бакете сервиса объектного хранилища данных Object Storage, который был указан при создании кластера.

В версии образа 1.1 компоненты обновились до следующих версий:

  • Hadoop 2.10.0
  • Tez 0.9.2
  • Hive 2.3.6
  • Zookeeper 3.4.14
  • HBase 1.3.5
  • Sqoop 1.4.7
  • Oozie 4.3.1
  • Spark 2.4.4
  • Flume 1.8.0
  • Zeppelin 0.8.2

Подробнее об использовании заданий Spark и PySpark читайте в документации.

author
Команда Yandex Cloud

В сервисе Yandex Data Proc появилась возможность создавать задачи при помощи CLI и API

Войдите, чтобы сохранить пост