Обучите CV-модель на облачных GPU
В Yandex DataSphere окружение с PyTorch и TensorFlow готово из коробки, GPU подключается по требованию — покупать видеокарты для экспериментов не нужно.

Технологии компьютерного зрения управляют беспилотным транспортом, помогают врачам ставить диагнозы и обеспечивают безопасность на производстве.
Компьютерное зрение (Computer Vision, CV) — это область искусственного интеллекта, которая позволяет машинам интерпретировать визуальную информацию. За последние десять лет эта сфера радикально изменилась
К 2025 году технологии CV стали стандартом во многих индустриях. Исследователи сместили фокус с базовых задач детектирования на более сложные вызовы. Главные из них — трёхмерное восприятие мира
В статье расскажем, как развивалось компьютерное зрение и какие фундаментальные задачи оно решает, рассмотрим актуальный технологический стек, включая фреймворки и наши облачные сервисы, такие как Yandex Vision OCR. В конце проанализируем текущие ограничения и перспективные направления, включая мультимодальные системы и методы самообучения.
Огромная база данных более чем из 14 млн фотографий, размеченных по 20 тыс. категорий, например «кошка», «самолёт», «облако» и т. д.
Цель компьютерного зрения — научить машины понимать визуальные данные так, как это делает человек. Эта дисциплина прошла несколько этапов, и подходы к решению задач за это время сильно изменились.
Всё началось в 1960‑х годах, когда американский учёный в области информатики Лоуренс (Ларри) Робертс в своей диссертации
В 1980‑х годах нейрофизиолог Дэвид Марр предложил иерархическую модель. В книге Vision
Его работа заложила теоретический фундамент для многих последующих исследований.
До начала 2010‑х годов инженеры вручную создавали алгоритмы, которые извлекали из изображений заранее определённые признаки — например, границы объектов, углы или особые точки. Алгоритмы (SIFT
Революция произошла в 2012 году на ежегодном соревновании по распознаванию изображений — Large Scale Visual Recognition Challenge (ILSVRC). Это состязание проводилось с использованием набора данных ImageNet.
Команда из Университета Торонто (Алекс Крижевский, Илья Суцкевер и Джеффри Хинтон) представила глубокую свёрточную нейросеть AlexNet. Эта модель значительно превзошла традиционные подходы. Она снизила частоту ошибок классификации до 15,3%
Одностадийный детектор: за один проход сети сразу предсказывает bounding‑box и класс для каждого объекта.
Одностадийный детектор: использует несколько масштабов «якорей» на разных уровнях фич, чтобы ловить объекты разного размера за один проход.
Двухстадийный детектор: сначала генерирует регионы интереса (RPN), потом классифицирует и уточняет рамки для каждого региона, обычно точнее, но медленнее.
Свёрточная сеть, добавляющая к Faster R‑CNN ветку маски, чтобы одновременно находить объекты, классифицировать их и выдавать бинарную маску каждого экземпляра.
Алгоритм многообъектного трекинга, использующий фильтр Калмана — математический метод, который по прошлым измерениям предсказывает следующее положение объекта и подавляет шум. Параллельно алгоритм берёт признаки внешнего вида из нейросети, чтобы различать объекты. Благодаря этому трекер устойчив к пересечениям и окклюзиям — ситуациям, когда один объект частично или полностью закрывает другой.
Восстанавливает 3D‑структуру сцены и траекторию камеры, анализируя несколько перекрывающихся изображений.
Одновременно оценивает положение камеры/робота и строит карту окружающей среды в реальном времени.
Современное компьютерное зрение охватывает широкий спектр задач: от базовой обработки изображений до сложного анализа видеопотоков и генерации контента. Рассмотрим основные из них.
Классификация — фундаментальная задача. Её цель — присвоить изображению одну или несколько меток из заранее определённого набора классов. Долгое время стандартом были свёрточные сети (CNN), но с 2020 года для этой задачи всё чаще применяют архитектуру Vision Transformers (ViT)
Задача детекции — не только определить, есть ли объект в кадре, но и найти его координаты. Алгоритм детекции возвращает bounding boxes (прямоугольные рамки), которые описывают положение объекта и метку его класса.
Существуют одностадийные архитектуры
Технология позволяет работать в реальном времени — это критически важно для беспилотного транспорта. Также развиваются подходы на основе трансформеров
Сегментация помогает системе детальнее понять сцену. Алгоритм классифицирует каждый пиксель изображения. Различают несколько типов сегментации:
Сегментация незаменима в медицинской диагностике, чтобы, к примеру, выделять опухоли, и в автономном вождении, чтобы точно определять границы проезжей части.
Трекинг
Перейти от плоского изображения к трёхмерному представлению мира — одна из самых сложных задач CV. Традиционные методы, такие как SfM (Structure from Motion) и SLAM (Simultaneous Localization and Mapping), реконструируют геометрию сцены и положение камеры по серии снимков или видеопотоку.
В последние годы революцию произвели нейронные поля излучения
Генерация визуального контента стала одним из самых заметных направлений ИИ. Долгое время стандартом были генеративно‑состязательные сети (GAN
Но к 2025 году доминировать стали диффузионные модели
Video Assistant Referee — система видеопомощи арбитрам в футболе, которая помогает судьям принимать решения в спорных моментах.
Технологии компьютерного зрения активно внедряют в ключевые отрасли экономики:
Подход, при котором модель сама выбирает наиболее «неопределённые» или сложные для неё примеры, а человек размечает именно их. Это позволяет сократить объём ручной разметки и быстрее улучшить качество модели.
Мера ошибки модели, которая показывает, насколько предсказания отличаются от правильных ответов.
Метод оптимизации, при котором модель шаг за шагом корректирует параметры, двигаясь в сторону уменьшения ошибки. Для ускорения берут не все данные сразу, а небольшие случайные выборки (батчи).
Гармоническое среднее точности и полноты. Показывает баланс между тем, сколько объектов найдено, и насколько эти находки правильные.
mean Average Precision — усреднённая точность по всем классам. Используется в задачах детекции, чтобы оценить, насколько хорошо модель находит объекты разных типов.
Intersection over Union — метрика, которая сравнивает площадь пересечения предсказанной и истинной области с площадью их объединения. Чем ближе значение к единице, тем точнее сегментация или детекция.
Чтобы создать эффективную CV‑модель, нужны большие объёмы данных и значительные вычислительные ресурсы. Этот процесс состоит из нескольких этапов.
Он начинается со сбора и подготовки данных. Для большинства задач глубокого обучения требуется размеченный датасет. Качество и разнообразие данных напрямую влияют на точность модели. Размечать данные часто бывает трудоёмко. Чтобы ускорить этот процесс, используют краудсорсинговые платформы. Также применяют методы аугментации данных (искусственное увеличение разнообразия датасета), синтетические данные (сгенерированные компьютерной графикой) и активное обучение.
Следующий шаг — выбор архитектуры нейросети. В зависимости от задачи могут использовать свёрточные нейросети, которые хорошо анализируют пространственные иерархии. Также применяют трансформеры — они эффективнее улавливают глобальные зависимости. Часто используют предобученные модели, которые дообучают под конкретную задачу.
Когда модель обучается, её параметры оптимизируют. Цель — минимизировать функцию потерь. Этот процесс выполняют с помощью алгоритмов стохастического градиентного спуска (например, Adam), который требует высокопроизводительных GPU.
После обучения модель оценивают на тестовом наборе данных. Для этого используют метрики — например, точность, полноту, F1‑меру для классификации, mAP для детекции, IoU для сегментации.
Обучите CV-модель на облачных GPU
В Yandex DataSphere окружение с PyTorch и TensorFlow готово из коробки, GPU подключается по требованию — покупать видеокарты для экспериментов не нужно.
Разработка систем компьютерного зрения опирается на специализированные библиотеки, фреймворки и облачные сервисы.
PyTorch
TensorFlow
Большинство экспериментов и прототипирования с использованием PyTorch проводят в интерактивных средах, таких как Jupyter® Notebook, которая стала незаменимым инструментом для исследователей и дата‑сайентистов. Она позволяет объединять код (на Python™, R и других языках), визуализации, текст и формулы в одном документе.
В контексте компьютерного зрения в Jupyter удобно загружать и просматривать изображения, проводить предварительный анализ данных, поэтапно запускать обучение моделей и сразу же визуализировать результаты — например, отображать bounding boxes после детекции или маски сегментации. Это ускоряет итерации и облегчает отладку моделей.
Чтобы управлять жизненным циклом машинного обучения — от подготовки данных до обучения и развёртывания моделей, — мы предлагаем среду для ML‑разработки Yandex DataSphere, которая объединяет привычный Jupyter® Notebook и вычислительные мощности Yandex Cloud.
OpenCV
Экосистема CV постоянно пополняется специализированными инструментами:
Датасеты изображений и видео — это терабайты данных. Нельзя работать с ними как с обычными файлами в папке. Работа с большими объёмами визуальных данных требует специализированных решений для хранения и версионирования:
Облачные платформы предоставляют готовые API для решения стандартных задач компьютерного зрения без необходимости разрабатывать собственные модели.
Yandex Vision OCR — сервис компьютерного зрения на платформе Yandex Cloud. Он предоставляет API для распознавания текста (OCR) на более чем 40 языках, классификации изображений, обнаружения лиц и модерации контента.
Сервис распознаёт текст в сложных документах, включая таблицы и рукописный ввод, что позволяет автоматизировать документооборот. Yandex Vision OCR легко интегрируется с другими нашими сервисами, например Yandex Object Storage и Yandex Cloud Functions.
Распознайте свой документ
Yandex Vision OCR извлекает текст, таблицы и рукописный ввод на 48 языках — попробуйте в консоли
Направление в машинном обучении, которое разрабатывает методы для объяснения решений нейросетей. Его цель — показать, какие признаки или области данных повлияли на результат модели, чтобы сделать работу ИИ более прозрачной и понятной человеку.
Визуализации, подсвечивающие области изображения, на которые модель обращала больше всего внимания при принятии решения. Они помогают понять, какие фрагменты данных оказались для неё значимыми.
Несмотря на значительный прогресс, компьютерное зрение сталкивается с рядом фундаментальных проблем.
Большинство современных CV‑моделей обучают в режиме «с учителем», и им требуются огромные объёмы размеченных данных. Собирать и аннотировать такие датасеты — дорого и трудоёмко. Это остаётся серьёзным барьером, особенно в узкоспециализированных областях — например, анализе редких заболеваний.
Обучение глубоких нейросетей, особенно больших мультимодальных моделей, требует значительных вычислительных ресурсов
Модели, обученные в одних условиях, могут плохо работать
Глубокие нейросети часто работают как «чёрные ящики»
Системы видеонаблюдения и распознавания лиц могут вызывать опасения
Метод, при котором модель учится различать похожие и непохожие примеры. Она сближает в пространстве представлений объекты, которые относятся к одному случаю (например, разные кадры одного изображения), и отдаляет те, что не связаны между собой.
Neural Radiance Fields — метод, в котором нейросеть моделирует 3D‑сцену как непрерывное поле. Это позволяет по набору 2D‑снимков синтезировать новые фотореалистичные виды сцены с любых ракурсов.
Техника, где сцена представляется облаком трёхмерных размытых точек. Она даёт более быструю и эффективную визуализацию по сравнению с NeRF, сохраняя высокое качество изображения.
Компьютерное зрение продолжает стремительно развиваться. В 2025 году и далее можно ожидать прогресс в нескольких ключевых направлениях.
Один из главных трендов — снижение зависимости от ручной разметки данных. SSL позволяет моделям изучать структуру данных без аннотаций.
SSL‑методы используют входной сигнал для создания обучающих задач. Например, предсказывают скрытую часть изображения или используют контрастное обучение. Это позволяет создавать более универсальные фундаментальные модели.
Будущее ИИ за мультимодальностью — способностью систем понимать информацию из разных источников. Интеграция CV с обработкой естественного языка открыла путь к созданию моделей, способных одновременно «видеть» и читать, — так называемых Vision‑Language Models (VLM).
Такие модели, как, например, CLIP
Современные VLM могут рассуждать о визуальной информации и отвечать на сложные вопросы об изображении.
Способность машин воспринимать мир в 3D в реальном времени критически важна для робототехники, автономного транспорта и метавселенных.
Технологии, подобные NeRF и 3D Gaussian Splatting, будут играть важную роль в создании иммерсивного опыта и обучении роботов взаимодействию с физическим миром.
Продолжится тренд
Ещё одним ключевым направлением становится распространение фундаментальных моделей (Foundation Models). Это огромные предобученные модели, способные решать множество задач «из коробки» или быстро адаптироваться к новым с минимальным количеством примеров. Такие модели станут основой для следующего поколения приложений. Платформы, предоставляющие доступ к этим технологиям, например, Yandex AI Studio, значительно упрощают их использование, предлагая API для интеграции мощных моделей в реальные бизнес‑процессы, что ускоряет внедрение инноваций.
Мультимодальные модели уже доступны
Отправьте изображение визуально-лингвистической модели в Yandex AI Studio