Yandex Cloud
Поиск
Связаться с экспертомПопробовать бесплатно
  • Кейсы
  • Документация
  • Блог
  • Все сервисы
    • Cloud Interconnect
    • Cloud Backup
    • Compute Cloud
    • Object Storage
    • Managed Service for Kubernetes®
    • Managed Service for PostgreSQL
    • Managed Service for ClickHouse®
    • Monium
    • Cloud CDN
    • Network Load Balancer
    • Virtual Private Cloud
    • Cloud DNS
    • Application Load Balancer
    • Yandex Cloud Router
    • Managed Service for MySQL®
    • Managed Service for Valkey™
    • Managed Service for Apache Spark™
    • Managed Service for OpenSearch
    • Managed Service for Apache Kafka®
    • Data Transfer
    • Yandex MPP Analytics Engine for PostgreSQL
    • Managed Service for YDB
    • SpeechKit
    • Yandex Identity Hub
    • Key Management Service
    • Certificate Manager
    • Yandex Lockbox
    • Audit Trails
    • Container Registry
    • Managed Service for Prometheus®
    • Message Queue
    • Identity and Access Management
    • Yandex Cloud Console
    • Resource Manager
    • Yandex Cloud Billing
    • Cloud Apps
    • Yandex AI Studio
    • Yandex BareMetal
    • Smart Web Security
    • Security Deck
    • Yandex Cloud Video
    • Stackland
    • Yandex StoreDoc
    • Yandex Managed Service for Apache Airflow®
    • Data Processing
    • Yandex MetaData Hub
    • Yandex WebSQL
    • DataLens
    • Yandex Search API
    • SpeechSense
    • DataSphere
    • Vision OCR
    • Translate
    • Cloud Registry
    • SmartCaptcha
    • Cloud Desktop
    • SourceCraft Code Assistant
    • Managed Service for GitLab
    • Cloud Functions
    • API Gateway
    • Yandex Cloud Postbox
    • Serverless Integrations
    • IoT Core
    • Serverless Containers
    • Cloud Notification Service
    • Yandex Query
  • Статус работы сервисов
  • Marketplace
    • Доступны в регионе
    • Инфраструктура и сеть
    • Платформа данных
    • Искусственный интеллект
    • Безопасность
    • Инструменты DevOps
    • Бессерверные вычисления
    • Управление ресурсами
  • Все решения
    • По отраслям
    • По типу задач
    • Экономика платформы
    • Безопасность
    • Техническая поддержка
    • Каталог партнёров
    • Обучение и сертификация
    • Облако для стартапов
    • Облако для крупного бизнеса
    • Центр технологий для общества
    • Партнёрская программа
    • Поддержка IT-бизнеса
    • Облако для фрилансеров
    • Обучение и сертификация
    • Блог
    • Документация
    • Мероприятия и вебинары
    • Контакты, чаты и сообщества
    • Идеи
    • Калькулятор цен
    • Тарифы
    • Акции и free tier
  • Кейсы
  • Документация
  • Блог
Создавайте контент и получайте гранты!Готовы написать своё руководство? Участвуйте в контент-программе и получайте гранты на работу с облачными сервисами!
Подробнее о программе
Проект Яндекса
© 2026 ТОО «Облачные Сервисы Казахстан»
Yandex Query
RU
    • Форматы данных и алгоритмы сжатия
    • Работа с базами данных Managed Service for ClickHouse®
    • Работа с базами данных Yandex MPP Analytics for PostgreSQL
    • Работа с базами данных Managed Service for MySQL®
    • Работа с базами данных Managed Service for PostgreSQL
    • Работа с базами данных Managed Service for YDB
    • Чтение данных из таблиц Iceberg
  • Управление доступом
  • Правила тарификации
  • Интеграции
  • Аудитные логи Audit Trails
  • Вопросы и ответы
  • Публичные материалы
  • Обучающие курсы

В этой статье:

  • Поддерживаемые форматы данных
  • Формат csv_with_names
  • Формат tsv_with_names
  • Формат json_list
  • Формат json_each_row
  • Формат raw
  • Формат json_as_string
  • Формат parquet
  • Пример чтения данных
  • Поддерживаемые алгоритмы сжатия
  • Чтение
  • Запись в Yandex Object Storage
  • Запись в Yandex Data Streams
  1. Источники и приемники данных
  2. Форматы данных и алгоритмы сжатия

Форматы данных и алгоритмы сжатия

Статья создана
Yandex Cloud
Улучшена
Обновлена 22 июля 2026 г.
Открыть в Markdown
  • Поддерживаемые форматы данных
    • Формат csv_with_names
    • Формат tsv_with_names
    • Формат json_list
    • Формат json_each_row
    • Формат raw
    • Формат json_as_string
    • Формат parquet
  • Пример чтения данных
  • Поддерживаемые алгоритмы сжатия
    • Чтение
    • Запись в Yandex Object Storage
    • Запись в Yandex Data Streams

Ниже описаны поддерживаемые в Yandex Query форматы данных и алгоритмы сжатия.

Поддерживаемые форматы данныхПоддерживаемые форматы данных

В Yandex Query Language поддерживаются следующие форматы данных:

  • csv_with_names;
  • tsv_with_names;
  • json_list;
  • json_each_row;
  • raw;
  • json_as_string;
  • parquet.

Формат csv_with_namesФормат csv_with_names

Формат основан на CSV. Данные размещаются в колонках, разделенных запятыми. Первая строка файла содержит имена колонок.

Пример данных:

Year,Manufacturer,Model,Price
1997,Ford,E350,3000.00
1999,Chevy,"Venture «Extended Edition»",4900.00
Пример запроса
SELECT 
    * 
FROM <соединение>.<путь> 
WITH
(
    format=csv_with_names, 
    SCHEMA
    (
        Year int, 
        Manufacturer string, 
        Model string, 
        Price double
    )
)

Результат выполнения запроса:

# Manufacturer Model Price Year
1 Ford E350 3000 1997
2 Chevy Venture «Extended Edition» 4900 1999

Формат tsv_with_namesФормат tsv_with_names

Формат основан на TSV. Данные размещаются в колонках, разделенных символами табуляции с кодом 0x9. Первая строка файла содержит имена колонок.

Пример данных:

Year    Manufacturer    Model   Price
1997    Ford    E350    3000.00
1999    Chevy   "Venture «Extended Edition»"    4900.00
Пример запроса
SELECT 
    * 
FROM <соединение>.<путь> 
WITH
(
    format=tsv_with_names, 
    SCHEMA
    (
        Year int, 
        Manufacturer string, 
        Model string, 
        Price double
    )
)

Результат выполнения запроса:

# Manufacturer Model Price Year
1 Ford E350 3000 1997
2 Chevy Venture «Extended Edition» 4900 1999

Формат json_listФормат json_list

Формат основан на JSON-представлении данных. Каждый файл должен содержать список объектов в корректном JSON-представлении.

Пример корректных данных (данные представлены в виде списка объектов JSON):

[
    { "Year": 1997, "Manufacturer": "Ford", "Model": "E350", "Price": 3000.0 },
    { "Year": 1999, "Manufacturer": "Chevy", "Model": "Venture «Extended Edition»", "Price": 4900.00 }
]

Пример некорректных данных, в котором объекты не объединены в список:

{ "Year": 1997, "Manufacturer": "Ford", "Model": "E350", "Price": 3000.0 }
{ "Year": 1999, "Manufacturer": "Chevy", "Model": "Venture «Extended Edition»", "Price": 4900.00 }

Формат json_each_rowФормат json_each_row

Формат основан на JSON-представлении данных. Каждая строка файла должна содержать объект в корректном JSON-представлении. Объекты не объединяются в JSON-список. Такой формат используется при передаче данных через потоковые системы, например Yandex Data Streams.

Пример корректных данных (на каждой отдельной строке находится отдельный объект в формате JSON, но эти объекты не объединены в список):

{ "Year": 1997, "Manufacturer": "Ford", "Model": "E350", "Price": 3000.0 },
{ "Year": 1999, "Manufacturer": "Chevy", "Model": "Venture «Extended Edition»", "Price": 4900.00 }
Пример запроса
SELECT 
    * 
FROM <соединение>.<путь> 
WITH
(
    format=json_each_row, 
    SCHEMA
    (
        Year int, 
        Manufacturer string, 
        Model string, 
        Price double
    )
)

Результат выполнения запроса:

# Manufacturer Model Price Year
1 Ford E350 3000 1997
2 Chevy Venture «Extended Edition» 4900 1999

Формат rawФормат raw

Формат позволяет считывать содержимое файлов без преобразований. Полученные данные можно обработать средствами YQL, разделив на строки и столбцы.

Используйте этот формат, если встроенных возможностей разбора исходных данных в Yandex Query недостаточно.

Пример запроса
SELECT 
    * 
FROM <соединение>.<путь> 
WITH
(
    format=raw, 
    SCHEMA
    (
        Data String
    )
)

Результат выполнения запроса:

Year,Manufacturer,Model,Price
1997,Ford,E350,3000.00
1999,Chevy,\"Venture «Extended Edition»\",4900.00

Формат json_as_stringФормат json_as_string

Формат основан на JSON-представлении данных. Он не разбивает входной JSON-документ на поля, а представляет каждую строку файла в виде одного объекта JSON. Используйте этот формат, если список полей может изменяться в разных сообщениях.

В этом формате внутри каждого файла должен находиться:

  • объект в корректном JSON-представлении в каждой отдельной строке файла;
  • объекты в корректном JSON-представлении, объединенные в список.

Пример корректных данных (данные представлены в виде списка объектов JSON):

{ "Year": 1997, "Manufacturer": "Ford", "Model": "E350", "Price": 3000.0 }
{ "Year": 1999, "Manufacturer": "Chevy", "Model": "Venture «Extended Edition»", "Price": 4900.00 }
Пример запроса
SELECT 
    * 
FROM <соединение>.<путь> 
WITH
(
    format=json_as_string, 
    SCHEMA
    (
        Data Json
    )
)

Результат выполнения запроса:

# Data
1 {"Manufacturer": "Ford", "Model": "E350", "Price": 3000, "Year": 1997}
2 {"Manufacturer": "Chevy", "Model": "Venture «Extended Edition»", "Price": 4900, "Year": 1999}

Формат parquetФормат parquet

Формат позволяет считывать содержимое файлов Apache Parquet.

Поддерживаются следующие алгоритмы сжатия внутри файлов Parquet:

  • без сжатия;
  • SNAPPY;
  • GZIP;
  • LZO;
  • BROTLI;
  • LZ4;
  • ZSTD;
  • LZ4_RAW.
Пример запроса
SELECT 
    * 
FROM <соединение>.<путь> 
WITH
(
    format=parquet, 
    SCHEMA
    (
        Year int, 
        Manufacturer string, 
        Model string, 
        Price double
    )
)

Результат выполнения запроса:

# Manufacturer Model Price Year
1 Ford E350 3000 1997
2 Chevy Venture «Extended Edition» 4900 1999

Пример чтения данныхПример чтения данных

Пример запроса для чтения данных из Yandex Object Storage:

SELECT
        *
FROM
    connection.`folder/filename.csv`
WITH(
    format='csv_with_names',
    SCHEMA 
    (
        Year int,
        Manufacturer String,
        Model String,
        Price Double 
    )
);

Где:

Поле Описание
connection Название соединения с Yandex Object Storage
folder/filename.csv Путь к файлу в бакете Yandex Object Storage
SCHEMA Описание схемы данных в файле

Поддерживаемые алгоритмы сжатияПоддерживаемые алгоритмы сжатия

ЧтениеЧтение

В Yandex Query поддерживаются следующие алгоритмы сжатия данных для чтения:

Формат сжатия Название в Query
Gzip gzip
Zstd zstd
LZ4 lz4
Brotli brotli
Bzip2 bzip2
Xz xz

Формат Parquet поддерживает собственные алгоритмы сжатия. Yandex Query позволяет читать данные в формате Parquet с использованием следующих алгоритмов:

Формат сжатия Название в Query
Raw raw
Snappy snappy

Запись в Yandex Object StorageЗапись в Yandex Object Storage

В настоящий момент поддерживается запись в следующих форматах:

Формат данных Название в Query
CSV csv_with_names
Parquet parquet

В Query поддерживаются следующие алгоритмы сжатия данных для записи:

Формат сжатия Название в Query
Gzip gzip
Zstd zstd
LZ4 lz4
Brotli brotli
Bzip2 bzip2
Xz xz

Формат файлов parquet поддерживает собственные внутренние алгоритмы сжатия. Query позволяет записывать данные в формате parquet с использованием следующих алгоритмов сжатия:

Формат сжатия Название в Query
Snappy Без названия, по умолчанию

Запись в Yandex Data StreamsЗапись в Yandex Data Streams

В Data Streams можно выполнять запись только в виде байтового потока, который интепретируется на принимающей стороне.

Настройки форматов файлов и алгоритмов сжатия при записи в Data Streams не применяются.

Была ли статья полезна?

Предыдущая
Подключение с помощью IDE
Следующая
Чтение данных с помощью соединений
Создавайте контент и получайте гранты!Готовы написать своё руководство? Участвуйте в контент-программе и получайте гранты на работу с облачными сервисами!
Подробнее о программе
Проект Яндекса
© 2026 ТОО «Облачные Сервисы Казахстан»