Yandex Cloud
Поиск
Связаться с экспертомПопробовать бесплатно
  • Кейсы
  • Документация
  • Блог
  • Все сервисы
  • Статус работы сервисов
  • Marketplace
    • Доступны в регионе
    • Инфраструктура и сеть
    • Платформа данных
    • Искусственный интеллект
    • Безопасность
    • Инструменты DevOps
    • Бессерверные вычисления
    • Управление ресурсами
  • Все решения
    • По отраслям
    • По типу задач
    • Экономика платформы
    • Безопасность
    • Техническая поддержка
    • Каталог партнёров
    • Обучение и сертификация
    • Облако для стартапов
    • Облако для крупного бизнеса
    • Центр технологий для общества
    • Партнёрская программа
    • Поддержка IT-бизнеса
    • Облако для фрилансеров
    • Обучение и сертификация
    • Блог
    • Документация
    • Мероприятия и вебинары
    • Контакты, чаты и сообщества
    • Идеи
    • Калькулятор цен
    • Тарифы
    • Акции и free tier
  • Кейсы
  • Документация
  • Блог
Создавайте контент и получайте гранты!Готовы написать своё руководство? Участвуйте в контент-программе и получайте гранты на работу с облачными сервисами!
Подробнее о программе
Проект Яндекса
© 2026 ТОО «Облачные Сервисы Казахстан»
Yandex Compute Cloud
KZ
  • Yandex Container Solution
  • Управление доступом
  • Правила тарификации
  • Справочник Terraform
  • Метрики Monitoring
  • Аудитные логи Audit Trails
  • История изменений
    • Общие вопросы
    • Виртуальные машины
    • Ошибка Not enough resources
    • Подключение
    • Диски, снимки, образы
    • Группы виртуальных машин
    • Графические ускорители GPU
    • Мониторинг
    • Лицензирование
    • Решение проблем
    • Все вопросы на одной странице
  • Обучающие курсы
  1. Вопросы и ответы
  2. Графические ускорители GPU

Вопросы и ответы про графические ускорители GPU в Compute Cloud

Статья создана
Yandex Cloud
Обновлена 9 июля 2026 г.
Открыть в Markdown
  • Что делать, если на ВМ перестала работать GPU?

  • Ошибка «Not Supported» при сбросе ускорителей

  • Ошибка «In use by another client» при сбросе ускорителей

  • Ошибка «Unknown Error» при выполнении команд nvidia-smi

  • Ошибка «Warning: persistence mode is disabled on device» при включении режима MIG

Что делать, если на ВМ перестал работать GPU?Что делать, если на ВМ перестал работать GPU?

В таком случае необходимо остановить и снова запустить виртуальную машину. В большинстве случаев требуются именно остановка и повторный запуск, а не перезагрузка, поскольку при перезагрузке ВМ остается на том же хосте, где возникла проблема с GPU.

Ошибка «Not Supported» при сбросе ускорителейОшибка «Not Supported» при сбросе ускорителей

При выполнении sudo nvidia-smi -r возвращается ошибка:

The following GPUs could not be reset:
  GPU 00000000:8B:00.0: Not Supported
  GPU 00000000:8C:00.0: Not Supported

Это значит, что на ускорителях активен NVLink. Отключите его и повторите сброс.

Ошибка «In use by another client» при сбросе ускорителейОшибка «In use by another client» при сбросе ускорителей

При выполнении sudo nvidia-smi -r возвращается ошибка:

The following GPUs could not be reset:
  GPU 00000000:8B:00.0: In use by another client
  GPU 00000000:8C:00.0: In use by another client

2 devices are currently being used by one or more other processes (e.g., Fabric Manager, CUDA application, graphics application such as an X server, or a monitoring application such as another instance of nvidia-smi). Please first kill all processes using these devices and all compute applications running in the system.

Это значит, что ускорители заняты другим процессом, например модулем nvidia_drm с включенным modeset=1 или пользовательским процессом, который удерживает устройство.

Чтобы устранить проблему:

  1. Проверьте, загружен ли модуль nvidia_drm с параметром modeset=1:

    cat /sys/module/nvidia_drm/parameters/modeset
    

    Если в выводе Y, отключите modeset. Для этого создайте файл /etc/modprobe.d/nomodeset.conf со следующим содержимым:

    options nvidia-drm modeset=0
    
  2. Обновите initramfs (Initial RAM File System):

    sudo update-initramfs -u
    
  3. Найдите процессы, удерживающие устройство:

    sudo ls -l /proc/*/fd/* | grep /dev/nvidia
    
    Пример вывода команды
    lrwx------ 1 root             root             64 Jun 17 12:01 /proc/1574/fd/3 -> /dev/nvidiactl
    lrwx------ 1 root             root             64 Jun 17 12:01 /proc/1574/fd/4 -> /dev/nvidia0
    lrwx------ 1 root             root             64 Jun 17 12:01 /proc/1574/fd/5 -> /dev/nvidia0
    lrwx------ 1 root             root             64 Jun 17 12:01 /proc/1574/fd/6 -> /dev/nvidia0
    lrwx------ 1 root             root             64 Jun 17 12:01 /proc/1574/fd/7 -> /dev/nvidia0
    lrwx------ 1 root             root             64 Jun 17 11:59 /proc/904/fd/13 -> /dev/nvidiactl
    lrwx------ 1 root             root             64 Jun 17 11:59 /proc/904/fd/17 -> /dev/nvidia0
    lrwx------ 1 root             root             64 Jun 17 11:59 /proc/904/fd/18 -> /dev/nvidia0
    lrwx------ 1 root             root             64 Jun 17 11:59 /proc/904/fd/19 -> /dev/nvidia0
    lrwx------ 1 root             root             64 Jun 17 11:59 /proc/904/fd/20 -> /dev/nvidia0
    lrwx------ 1 root             root             64 Jun 17 11:59 /proc/904/fd/24 -> /dev/nvidia0
    lrwx------ 1 root             root             64 Jun 17 11:59 /proc/904/fd/25 -> /dev/nvidia0
    lrwx------ 1 root             root             64 Jun 17 11:59 /proc/904/fd/27 -> /dev/nvidia0
    lrwx------ 1 root             root             64 Jun 17 11:59 /proc/904/fd/28 -> /dev/nvidia0
    lrwx------ 1 root             root             64 Jun 17 11:59 /proc/904/fd/29 -> /dev/nvidia0
    lrwx------ 1 root             root             64 Jun 17 11:59 /proc/904/fd/3 -> /dev/nvidiactl
    lrwx------ 1 root             root             64 Jun 17 11:59 /proc/904/fd/39 -> /dev/nvidia0
    lrwx------ 1 root             root             64 Jun 17 11:59 /proc/904/fd/43 -> /dev/nvidia0
    lrwx------ 1 root             root             64 Jun 17 11:59 /proc/904/fd/8 -> /dev/nvidia-modeset
    
  4. Завершите эти процессы командой sudo kill -9 <PID_процесса>.

  5. Повторите сброс ускорителей:

    sudo nvidia-smi -r
    

Совет

Если после перезагрузки ВМ значение modeset снова возвращается к 1, проверьте, что в файловой системе нет других конфигураций, переопределяющих этот параметр:

sudo grep -R "modeset=1" /etc

Ошибка «Unknown Error» при выполнении команд nvidia-smiОшибка «Unknown Error» при выполнении команд nvidia-smi

Если команды nvidia-smi, например nvidia-smi --gpu-reset, возвращают ошибку Unknown Error, перезапустите сервис nvidia-persistenced:

sudo systemctl restart nvidia-persistenced

Ошибка «Warning: persistence mode is disabled on device» при включении режима MIGОшибка «Warning: persistence mode is disabled on device» при включении режима MIG

Если после выполнения команды nvidia-smi -mig 1 в выводе появилось предупреждение Warning: persistence mode is disabled on device ..., запустите сервис nvidia-persistenced:

sudo systemctl start nvidia-persistenced

Была ли статья полезна?

Предыдущая
Группы виртуальных машин
Следующая
Мониторинг
Создавайте контент и получайте гранты!Готовы написать своё руководство? Участвуйте в контент-программе и получайте гранты на работу с облачными сервисами!
Подробнее о программе
Проект Яндекса
© 2026 ТОО «Облачные Сервисы Казахстан»