Мониторинг состояния кластера Apache Hive™ Metastore
Данные о состоянии кластера и его хостов доступны в консоли управления
Диагностическая информация о состоянии кластера представлена в виде графиков.
Графики обновляются раз в 15 секунд.
Примечание
На графиках автоматически применяются наиболее подходящие кратные единицы измерения (мегабайты, гигабайты и т. д.).
Вы можете настроить алерты в сервисе Yandex Monitoring для получения уведомлений о сбоях в работе кластера. В Yandex Monitoring используются два порога срабатывания алерта: Warning и Alarm. При превышении заданного порога вы получите оповещения через настроенные каналы уведомлений.
Мониторинг состояния кластера
Для просмотра детальной информации о состоянии кластера Apache Hive™ Metastore:
-
В консоли управления
выберите каталог. -
Перейдите
в сервис Yandex MetaData Hub. -
На панели слева выберите
Metastore-сервер. -
Нажмите на имя нужного кластера и выберите вкладку Мониторинг.
-
Чтобы перейти к работе с метриками, дашбордами или алертами в сервисе Yandex Monitoring, нажмите кнопку Открыть в Monium на панели сверху.
На странице отображаются графики:
-
В блоке API:
- API Calls (rps) — методы с наибольшим количеством выполненных запросов для каждого инстанса кластера. Список методов обновляется динамически. График может отображать до десяти методов.
- API Latency (p95) — 95-й процентиль общего времени выполнения запросов с разбивкой по инстансам.
- Active Calls — количество находящихся в обработке запросов.
- API Latency by method (p95) — методы с наибольшим 95-м процентилем времени выполнения запросов для каждого инстанса кластера. Список методов обновляется динамически. График может отображать до десяти методов.
-
В блоке Transactions & Errors:
- Open Transactions / Connections — количество активных транзакций и подключений:
- Open Transactions — количество активных ACID
-транзакций. - Open Connections — количество активных подключений к кластеру Apache Hive™ Metastore по протоколу Thrift.
- Open Transactions — количество активных ACID
- Compaction Cycle Duration — продолжительность цикла сжатия.
- DirectSQL Errors — количество ошибок при выполнении DirectSQL-запросов, после которых Apache Hive™ Metastore перешел к выполнению запросов через JDO.
- Open Transactions / Connections — количество активных транзакций и подключений:
-
В блоке Connection Pools (только для Apache Hive™ Metastore версии
4.2):-
Connection States — количество JDBC-подключений:
- Active Connections — активные подключения.
- Idle Connections — простаивающие подключения.
- Pending Connections — количество запросов, ожидающих выделения подключения.
- Total Connections — общее количество подключений.
-
Pool Usage (p95) — 95-й процентиль времени, в течение которого приложение удерживает установленное подключение.
-
Connection Creation (p95) — 95-й процентиль продолжительности создания подключения.
-
Pool Connection Timeouts (rps) — количество запросов в секунду, завершившихся таймаутом из-за отсутствия доступных подключений.
-
-
В блоке DB Objects:
- Object Counts — количество баз данных, таблиц и партиций в хранилище кластера Apache Hive™ Metastore.
- Object Operations (rps) — количество операций создания и удаления баз данных, таблиц и партиций в секунду.
-
В блоке Resources:
- Instances — количество инстансов в кластере.
- CPU Usage — использование процессорного времени каждым инстансом в процентах от общего количества доступного времени.
- Memory Usage — использование оперативной памяти каждым инстансом в процентах от общего объема доступной памяти.
-
В блоке JVM Memory:
- JVM Heap — максимальный объем heap-памяти JVM и ее использование каждым инстансом.
- JVM Memory Pools — пулы с наибольшим объемом использованной каждым инстансом памяти JVM. График отображает до шести пулов. Список пулов формируется динамически.
-
В блоке JVM Runtime:
- GC Rate — скорость работы сборщиков мусора старого (G1_Old_Generation) и нового (G1_Young_Generation) поколения на каждом инстансе.
- JVM Pauses — количество остановок всех потоков JVM, длительность которых превысила заданные пороги для информирования и предупреждения.
Настройка алертов в Yandex Monitoring
Чтобы настроить алерты показателей состояния кластера:
- В консоли управления
выберите каталог с кластером, для которого нужно настроить алерты. - Перейдите
в сервис Monitoring. - В блоке Сервисные дашборды выберите Managed Service For Hive Metastore — Cluster Overview.
- На нужном графике нажмите на значок
и выберите пункт Создать алерт. - Если на графике несколько показателей, выберите запрос данных для формирования метрики и нажмите Продолжить. Подробнее о языке запросов в документации Yandex Monitoring.
- Задайте пороговые значения
AlarmиWarningдля срабатывания алерта. - Нажмите кнопку Создать алерт.
Чтобы настроить автоматический мониторинг других показателей состояния кластера:
- Создайте алерт.
- Добавьте метрику состояния.
- В параметрах алерта задайте значения порогов для оповещения.
Рекомендуемые значения порогов для некоторых метрик:
| Метрика | Обозначение | Alarm |
Warning |
|---|---|---|---|
| Использование процессорного времени | cpu_usage |
90% | 80% |
| Использование оперативной памяти | memory_usage |
90% | 80% |
| 95-й процентиль общего времени выполнения запросов | metastore_api_calls_duration_seconds |
10 секунд | 3 секунды |
| Количество запросов, ожидающих выделения подключения | metastore_pool_pending_connections |
— | Больше нуля в течение пяти минут |
| Количество запросов, завершившихся таймаутом из-за отсутствия доступных подключений | metastore_pool_connection_timeouts_total |
Больше нуля | — |
| Количество ошибок при выполнении DirectSQL-запросов, после которых Apache Hive™ Metastore перешел к выполнению запросов через JDO | metastore_directsql_errors_total |
— | Больше нуля |
Полный список поддерживаемых метрик в документации Monitoring.
Состояние и статус кластера
Состояние кластера указывает на его исправность, а Статус показывает, запущен кластер, остановлен или находится в промежуточном состоянии.
Для просмотра состояния и статуса кластера:
- В консоли управления
выберите каталог. - Перейдите
в сервис Yandex MetaData Hub. - На панели слева выберите
Metastore-сервер. - В строке нужного кластера наведите курсор на индикатор в столбце Доступность.
Состояния кластера
|
Состояние |
Описание |
Предлагаемые действия |
|
ALIVE |
Кластер работает в штатном режиме. |
Действий не требуется. |
|
DEGRADED |
Кластер работает не на полную мощность. |
Составьте обращение в службу поддержки
|
|
DEAD |
Кластер неработоспособен. |
Составьте обращение в службу поддержки
|
|
UNKNOWN |
Состояние кластера неизвестно. |
Составьте обращение в службу поддержки
|
Статусы кластера
| Статус | Описание | Предлагаемые действия |
|---|---|---|
| CREATING | Идет подготовка к первому запуску | Подождите немного и приступайте к работе. Время создания кластера зависит от класса хостов. |
| RUNNING | Кластер работает в штатном режиме | Действий не требуется. |
| STOPPING | Кластер останавливается | Через некоторое время кластеру будет присвоен статус STOPPED, и он будет выведен из работы. Действий не требуется. |
| STOPPED | Кластер остановлен | Запустите кластер, чтобы вернуть его в работу. |
| STARTING | Остановленный ранее кластер запускается | Через некоторое время кластеру будет присвоен статус RUNNING. Подождите немного и приступайте к работе. |
| UPDATING | Обновляется конфигурация кластера | По завершении обновления кластеру будет присвоен статус, который был до обновления: RUNNING или STOPPED. |
| ERROR | Произошла ошибка при выполнении операции с кластером или во время окна технического обслуживания | Если кластер долго находится в этом статусе, обратитесь в службу поддержки |
| STATUS_UNKNOWN | Кластер не может определить свой статус | Если кластер долго находится в этом статусе, обратитесь в службу поддержки |