Общие вопросы про DataSphere
Я могу получить логи моей работы в сервисах?
Да, вы можете запросить информацию о работе с вашими ресурсами из логов сервисов Yandex Cloud. Для этого обратитесь в техническую поддержку
Как узнать, какие персональные данные хранит Yandex Cloud?
Вы можете узнать, какие именно персональные данные хранит Yandex Cloud, обратившись в техническую поддержку. Вы также можете запросить полное удаление ваших персональных данных.
Если проект не открылся, проверьте текущее потребление квот
Что делать, если в проекте невозможно установить пакет или нет доступа к интернету?
Проблемы с интернетом могут возникнуть, если в проекте включена подсеть без настроенного доступа в интернет. Например, при установке пакета через pip может возникнуть ошибка ConnectTimeoutError:
Defaulting to user installation because normal site-packages is not writeable
WARNING: Retrying (Retry(total=4, connect=None, read=None, redirect=None, status=None)) after connection broken by 'ConnectTimeoutError(<HTTPSConnection(host='pypi.org', port=443) at 0x7f42c810ca00>, 'Connection to pypi.org timed out. (connect timeout=15)')': /simple/langchain/
ERROR: Could not find a version that satisfies the requirement langchain (from versions: none)
ERROR: No matching distribution found for langchain
Если для проекта требуется подсеть, настройте NAT-шлюз, чтобы предоставить ей доступ в интернет.
Изменить или отключить подсеть можно в настройках проекта.
Можно ли закрыть вкладку с ноутбуком?
Да. Если вы закроете вкладку с ноутбуком, текущие исполнения продолжат работу, все переменные и результаты вычислений сохранятся, однако вывод результатов исполнений, которые закончились, пока ноутбук был закрыт, не сохранится.
После завершения всех запущенных вычислений ВМ будет закреплена за ноутбуком в течение 3 часов. Вы можете изменить это значение в настройках проекта.
Как указать тип конфигурации для проекта?
Вы можете выбрать конфигурацию вычислительных ресурсов при первом запуске вычислений в ноутбуке DataSphere. Минимальная доступная конфигурация — c1.4 (4 vCPU).
Если запущенную ячейку удалить, вычисления остановятся?
Нет, вычисления будут продолжаться, даже если вы удалите ячейку из ноутбука. Поэтому перед удалением ячейки обязательно остановите ее. Если же вы удалили работающую ячейку, остановите запущенные вычисления. Для этого выберите File ⟶ Stop IDE executions в JupyterLab или нажмите Остановить JupyterLab и ВМ в виджете Запущенные операции на странице проекта.
Как очистить вывод ячеек?
Выберите Edit ⟶ Clear All Outputs в JupyterLab или нажмите правую кнопку мыши на любой ячейке и выберите Clear All Outputs. Во втором случае вывод сбросится только для текущего сеанса.
Можно ли в DataSphere запускать ячейки по расписанию?
Запуск вычислений по расписанию можно реализовать с помощью повторного запуска заданий DataSphere Jobs и их интеграции с Yandex Managed Service for Apache Airflow™.
Также вы можете использовать Yandex Cloud Functions, чтобы автоматически запускать исполнение ноутбука с помощью API DataSphere. Пример использования регулярных запусков подробно описан в руководстве.
Мой браузер не может открыть проект DataSphere в IDE. Как это исправить?
Проект еще загружается. Если долго отображается индикатор загрузки, подождите до 10 минут. Столько может занимать загрузка масштабного проекта со множеством файлов. Следить за сетевой активностью браузера можно на вкладке Network (Сеть) в инструментах разработчика. Чтобы открыть инструменты разработчика, нажмите F12.
Браузер блокирует переход к IDE. В этом случае может отображаться пустая страница или сообщение Веб-страница временно недоступна, Ошибка 503 либо Deadline Exceeded. При открытии проекта в IDE DataSphere перенаправляет запрос на собственный хост с JupyterLab. Современные браузеры могут блокировать такой переход, если вы используете режимы повышенной конфиденциальности, в том числе режим инкогнито. Чтобы открыть проект в IDE, отключите блокирующие настройки:
- Chrome: разрешите использовать сторонние cookie.
- Safari: отключите опцию Отслеживание на веб-сайтах: Предотвращать перекрестное отслеживание в меню Настройки ⟶ Конфиденциальность.
- Яндекс Браузер: разрешите использование сторонних cookie-файлов для DataSphere в настройках браузера в разделе Сайты ⟶ Расширенные настройки сайтов.
- Firefox: нажмите на значок щита в адресной строке и отключите опцию Enhanced Tracking Protection.
Если проект не открылся, убедитесь, что ни одна из квот не достигла предела: перейдите на вкладку Сообщества, выберите сообщество и перейдите на вкладку Квоты.
Мой браузер просит предоставить доступ к хосту JupyterLab. Как его дать?
Сообщение провоцирует экспериментальная опция Chrome, реализующая API доступа к хранилищу. Для ее отключения введите в адресную строку браузера chrome://flags, через строку поиска ниже найдите Storage Access API и переведите эту опцию в статус Disabled.
Как развернуть модель с платформы Hugging Face в DataSphere?
Некоторые библиотеки по умолчанию скачивают модели в заранее определенные директории. После скачивания модель может быть недоступна для импорта, потому что директория располагалась не в хранилище проекта. Чтобы избежать этого, определите правильную директорию для скачивания и указывайте ее при импорте модели:
cache_dir="/home/jupyter/datasphere/project/huggingface_cache_dir/"
config = AutoConfig.from_pretrained("<имя_модели>", cache_dir=cache_dir)
model = AutoModel.from_pretrained("<имя_модели>", config=config, cache_dir=cache_dir)
Чтобы не указывать адрес директории каждый раз, вы можете определить ее в переменной окружения. Это нужно сделать в самом начале ноутбука до импорта библиотек:
import os
os.environ['TRANSFORMERS_CACHE'] = '/home/jupyter/datasphere/project/huggingface_cache_dir/'
Также вы можете установить модель для работы в оффлайн-режиме, воспользовавшись официальной документацией
Почему возникает ошибка Access Denied: Spec gX.X is not available for your cloud?
Ошибка означает, что выбранная конфигурация GPU недоступна в вашем облаке. Для конфигураций, отмеченных сноской 1, доступ открывается после перехода на платное потребление и пополнения баланса платежного аккаунта. Необходимая сумма пополнения указана в самой статье.
После пополнения баланса:
- Остановите вычисления с помощью команды File ⟶ Stop IDE executions и выйдите из проекта.
- Повторно откройте проект в консоли управления
.
Правила тарификации ресурсов внутри проектов приведены в разделе Правила тарификации для DataSphere.
Почему код в ячейках проекта долго запускается?
При запуске кода может долго отображаться сообщение Preparing <имя_конфигурации> instance. Возможные причины:
- В ноутбуке много ячеек или они содержат большой объем кода. Полная загрузка проекта с сотнями ячеек может занимать более 10 минут. По возможности сократите количество ячеек или используйте более производительную конфигурацию вычислительных ресурсов.
- При первом запуске кода DataSphere выделяет и запускает виртуальную машину с выбранной конфигурацией ресурсов. Эта операция может занять некоторое время. Для ускорения запуска можно использовать более производительную конфигурацию.
Почему возникает ошибка Servant not allocatedпри запуске кода?
При запуске кода могут появиться сообщения:
Preparing <имя_конфигурации> instance
Execute error: Servant <имя_конфигурации> not allocated: Internal Error
Ошибка может возникнуть из-за временной нехватки свободных вычислительных ресурсов. Попробуйте использовать другую конфигурацию или повторите запуск позже.
Если в проекте используется собственный Docker-образ, проверьте, воспроизводится ли проблема на публичном образе.
Что делать, если при установке библиотеки возникает ошибка Device or resource busy?
При установке библиотеки может возникнуть ошибка:
ERROR: Could not install packages due to an OSError: [Errno 16] Device or resource busy: '.nfs0000000000009d3a00000018'
Это служебное сообщение, связанное с работой ресурсов. Чтобы устранить ошибку:
- Перезапустите ядро, выбрав в меню Kernel ⟶ Restart Kernel.
- Остановите вычисления: выберите File ⟶ Stop IDE executions в JupyterLab или нажмите Остановить JupyterLab и ВМ в виджете Запущенные операции на странице проекта.