В сервисе Yandex Data Proc появилась возможность создавать задачи при помощи CLI и API
Появилась поддержка задач для кластеров Apache Spark™, Hadoop® и Hive™.
Запускайте задания на кластерах Yandex Data Proc с использованием HTTP или gRPC Data Proc API, а также через Yandex Cloud SDK или YC CLI.
Yandex Data Proc поддерживает четыре типа заданий:
sparkJob— Apache Spark™pysparkJob— Python API для Apache Spark™mapreduceJob— Apache Hadoop®hiveJob— Apache Hive™
Зачем нужны задания в Yandex Data Proc?
Задания позволяют упростить использование Hadoop-стека технологий. Процесс обработки данных разделяется на задания, которые можно запускать без непосредственного доступа на хосты в Облаке. Это подходит для выполнения разовых операций и для построения ETL-процессов, а также запуска регулярных аналитических расчётов.
Для каких версий поддерживается создание заданий?
Запуск заданий доступен для кластеров, созданных с версией образа v1.1 и выше. Всю диагностическую информацию о запущенных и выполненных заданиях можно найти в истории операций над кластером, а также в бакете сервиса объектного хранилища данных Object Storage, который был указан при создании кластера.
В версии образа 1.1 компоненты обновились до следующих версий:
- Hadoop 2.10.0
- Tez 0.9.2
- Hive 2.3.6
- Zookeeper 3.4.14
- HBase 1.3.5
- Sqoop 1.4.7
- Oozie 4.3.1
- Spark 2.4.4
- Flume 1.8.0
- Zeppelin 0.8.2
Подробнее об использовании заданий Spark и PySpark читайте в документации.

