Реконструкция экологических факторов прошлого: как ML помогает читать донные отложения
Палеогеографы месяцами вручную определяют виды древних водорослей в отложениях озёр, чтобы изучать природные условия прошлого. Центр технологий для общества Yandex Cloud и Институт географии РАН обучили модель, которая делает это за доли секунды.
28 сентября 2026 г.
10 минут чтения
Краткий пересказ YandexGPT
Диатомовые водоросли (диатомеи) — одноклеточные организмы с панцирем из диоксида кремния, их изучение позволяет восстановить историю водоёма и климата вокруг него.
Видовой состав диатомей зависит от внешних условий, поэтому они служат высокочувствительными биоиндикаторами.
Определение видов диатомей — сложный и длительный процесс: на анализ одного микропрепарата уходит от двух до восьми часов, а в одной колонке отложений может быть до сотни микропрепаратов.
Существуют алгоритмы автоматической идентификации диатомей (например, DiatomNet и SC-DiatomNet), но их точность недостаточна для научных работ.
Для проекта требуется собственный датасет и обученная под него модель, так как нет общего списка видов диатомей, с которым согласны все учёные.
Датасеты для обучения модели собраны в Институте географии РАН и из открытого источника (Kaggle); обучение проходило в Yandex AI Studio с использованием готовых архитектур, дообученных на снимках диатомей.
Сейчас работает сервис, который позволяет исследователям загружать фотографии с микроскопа и получать определение вида диатомей; на обработку одного изображения уходит меньше 200 миллисекунд.
Точность YOLOv11 на тестовой выборке датасета Института географии РАН составляет 75%, а классификатора DiatomNet на открытом датасете — 70%, но есть ограничения в распознавании повёрнутых, смещённых створок или створок не в фокусе.
Следующая задача — проверить сервис на реальном микропрепарате целиком и сравнить результаты с оценками специалистов.
Планируется наполнять датасет реальными фотографиями уже размеченных видов, применять аугментацию и расширять число видов, которые сервис умеет определять.
Датасет планируют открыть для всего научного сообщества, что повысит надёжность результатов.
Дальше в статье вы встретите термин «класс» — так в машинном обучении называют категорию, которую должна распознать модель. Для диатомового анализа такой категорией всегда служит биологический вид, поэтому в тексте «вид» и «класс» означают одно и то же.
Зачем определять виды водорослей в донных отложениях
Диатомовые водоросли, или диатомеи, — это одноклеточные организмы, клетки которых заключены в стеклянный панцирь из диоксида кремния. Когда водоросль умирает, панцирь опускается на дно и не разлагается, а остаётся в осадке на тысячи лет. Слой за слоем отложения фиксируют историю озера: какие диатомеи жили в нём в разные периоды. Всего известно о 20 тыс. описанных видов.
Период, когда водоём скован льдом.
Набор растворённых в воде солей и минералов.
Цилиндрический образец грунта со дна водоёма, в котором видны слои разных эпох.
Показатель того, сколько в водоёме питательных веществ и, соответственно, жизни: от бедных ими чистых озёр до богатых, где активно растут водоросли.
Наука о природных условиях прошлых геологических эпох.
Виды, которые не привязаны к конкретному региону и встречаются по всему миру.
Каждый вид диатомей требователен к внешним условиям: одному нужна тёплая вода, другой живёт только в кислой среде, третий появляется, когда в озере становится много питательных веществ. Видовой состав зависит от температуры воды, режима ледостава, pH и ионного состава — поэтому диатомеи работают как высокочувствительные биоиндикаторы.
Если поднять со дна колонку отложений и посмотреть, какие виды лежат на той или иной глубине, можно восстановить историю водоёма и климата вокруг него. Например, можно узнать, как менялась площадь акватории, какими были минерализация и трофический статус озера и как на него влиял человек. Этот метод называется диатомовым анализом, и его применяют в палеогеографии, геологии и оценке экологического состояния водоёмов.
Институт географии РАН использует диатомовый анализ для изучения озёр центра Восточно-Европейской равнины, в основном в Ярославской и Костромской области. Виды, которые там встречаются чаще всего, не эндемики, а космополиты, поэтому обученная на информации о них модель применима и к озёрам в других регионах, а не только к областям, которые изучает институт.
Почему определять виды диатомей сложно и долго
Работа начинается со взятия пробы донных отложений. Из неё готовят микропрепарат — предметное стекло с очищенным от органики образцом, накрытое тонким покровным стеклом. Диатомеи изучают при увеличении в тысячу раз: специалист рассматривает микропрепарат под объективом микроскопа и определяет каждую створку, то есть половинку панциря, сверяясь с эталонами. В Институте географии РАН используют определитель диатомей — справочник с описаниями и фотографиями видов для сверки, — и классический четырёхтомник Krammer & Lange-Bertalot, который считается эталонным в мировой практике.
Микрофотографии диатомей:
Микроскопические водоросли, обитающие в толще воды; диатомеи — одна из групп фитопланктона.
Чтобы результат был статистически достоверным, нужно опознать 500–600 створок на один микропрепарат. Это не произвольное число: в осадке сохраняется от 40 до 70% фитопланктона, который жил в момент формирования слоя, то есть картина изначально усечённая. Ещё в 1986 году британский лимнолог Ричард Баттарби выяснил, что при выборке из 300 створок доля каждого вида ещё заметно меняется от подсчёта к подсчёту, а начиная с 500 — стабилизируется.
На то, чтобы определить один микропрепарат, уходит от двух до восьми часов, а в одной колонке отложений их бывает до сотни. Обычно специалист параллельно работает с несколькими колонками, поэтому одна палеогеографическая реконструкция занимает не месяцы, а годы.
Сложнее всего с мелкими видами. Бывают створки размером пять микрон, которые трудно распознать даже при увеличении в тысячу раз. Иногда их просто записывают как мелкие створки семейства Fragilariaceae, потому что сказать точнее невозможно. Похожая ситуация с родом Gomphonema: красивые створки среднего размера, которые очень похожи между собой по форме, и различать приходится по мелким деталям узора.
Готового сервиса для такой задачи до сих пор не было, хотя алгоритмы автоматической идентификации диатомей в научных публикациях есть — например, DiatomNet Gunduz & Gunal, 2024, и SC-DiatomNet Li et al., 2024. Прежде чем разрабатывать своё решение, в институте проверили первый из них: взяли DiatomNet и прогнали на своих изображениях — верными оказались около 30% определений. Для научной работы этого мало: результаты диатомового анализа ложатся в основу публикаций, и ошибка в большинстве определений обесценивает реконструкцию.
Проблема не в качестве алгоритмов, а в данных. Общего списка видов диатомей, с которым согласны все учёные, попросту нет: биологи до сих пор спорят, как правильно называть некоторые виды, и время от времени переименовывают их. Иногда один и тот же вид независимо открывают и описывают дважды под разными названиями — тогда в науке он существует сразу под двумя именами одновременно. Разобраться, какое название сейчас считается правильным, помогает открытая база AlgaeBase — по ней можно проверить, действующее это название или устаревший синоним.
Отсюда и требования к проекту: собственный датасет на материале диатомей из конкретных озёр и обученная под него модель.
Архитектура нейросети для быстрого поиска и определения объектов на изображении.
Архитектура для обучения моделей компьютерного зрения без разметки данных.
Архитектура прогнозирующего самообучения.
Как собирали датасет и обучали модель
Фотографии готовили в Институте географии РАН, а модель обучали совместно со студентами Летнего кампуса ML-Академии Яндекс Образования. Съёмка оказалась отдельной задачей: целые неповреждённые створки чаще попадаются в микропрепаратах, богатых материалом, то есть там, где они лежат плотнее всего и перекрывают друг друга. Приходилось выбирать в кадре участки, где створок меньше и их можно отделить одну от другой, а идентифицируемый объект по возможности выводить в центр снимка. Отдельные створки из кадров вырезала техническая команда.
В работу пошли два датасета:
открытый из базы Kaggle: 51 класс и около 2,2 тыс. изображений;
закрытый от Института географии РАН, собранный при поддержке Российского научного фонда: 46 классов и около 1 тыс. изображений.
Классы здесь равны видам: диатомовый анализ требует определения именно до вида, остановиться на роде нельзя.
Собрать одинаковое количество снимков для всех видов было сложно: какие-то диатомеи встречаются в озёрах постоянно, а какие-то попадаются редко, поэтому по части классов изображений набралось немного. В обучение взяли классы, где было не меньше десяти снимков, а самые малочисленные дополнили синтетическими изображениями с соответствующей пометкой.
Оба датасета, суммарно 45,8 ГБ, хранятся в Yandex Object Storage. Чтобы модель могла с ними работать, данные не выгружали на диск, а подключали к обучающей задаче с помощью параметра s3-mounts: файлы в объектном хранилище становятся доступными как обычные папки на диске, и код читает их напрямую.
Обучение шло в Yandex DataSphere. Модели не писали с нуля, а брали готовые архитектуры, уже обученные распознавать объекты на изображениях, и дообучали их на снимках диатомей. Такой подход сэкономил время и потребовал куда меньше данных, а их в проекте как раз немного. В Yandex DataSphere запускали разные варианты моделей и настраивали параметры обучения, чтобы найти сочетание с лучшим качеством распознавания.
На одном снимке обычно видно сразу несколько створок, поэтому распознавание идёт в два этапа: сначала детекция — найти на фотографии все створки и отделить их от фона, затем классификация — определить вид каждой найденной. Для датасета Института географии РАН оба этапа закрыла YOLOv11: архитектуру настроили так, чтобы она сама справлялась и с детекцией, и с классификацией. Для открытого датасета задачу разделили между двумя моделями: YOLOv11 находила створки, а за классификацию отвечал алгоритм DiatomNet — его сравнивали с DINOv3 и JEPA, но оба показали себя хуже.
Каждый вариант обучался быстро: 30–60 минут на видеокарте T4, а весь перебор архитектур занял около недели.
Что в итоге получилось
Уже сейчас работает сервис, который исследователи могут использовать: команда Yandex Cloud и Институт географии РАН вместе проверяют его на реальных научных задачах. Исследователь загружает фотографию с микроскопа и получает определение вида: если на снимке несколько водорослей, модель находит и распознаёт каждую по отдельности, а не только одну в центре кадра. Можно загрузить сразу несколько снимков вместо одного.
Результат работы сервиса: рамкой выделена найденная створка, рядом — определённый вид и вероятность
На обработку одного изображения уходит меньше 200 миллисекунд. Сейчас инференс идёт на выделенных виртуальных машинах, дальше команда планирует перейти на бессерверные вычисления — это позволит платить только за фактическое время расчётов. Точность YOLOv11 на тестовой выборке датасета Института географии РАН составляет 75%, а классификатора DiatomNet на открытом датасете — 70%. Цифры промежуточные: по мере расширения датасета команда планирует пересчитать метрики на большей выборке классов.
Есть и ограничения: модель уверенно распознаёт крупные, целые и хорошо развёрнутые к камере створки — то есть снимки, похожие на образцы из определителя. Повёрнутые, смещённые к краю кадра или не в фокусе она пропускает в 10–20% случаев в зависимости от датасета. Чаще всего путаница возникает между похожими видами внутри одного рода, а хуже всего дела там, где для обучения было мало примеров — это ожидаемо для любой модели на старте и одна из причин, почему команда сейчас в первую очередь наполняет именно такие классы.
Если вид не входит в число известных модели, сервис честно предлагает выбрать из уже знакомых, а не придумывает ответ.
Что говорят учёные
Для первого теста специалисты института загрузили в сервис шесть снимков, знакомых модели по обучению, — на них сервис отвечал за одну-две секунды, Проверить сервис на новых фотографиях пока не вышло: эта часть сервиса ещё дорабатывается. Именно она и станет следующим шагом — слепая проверка на кадрах, которые модель раньше не видела.
Для тех классов, которые сервис определил, точность составила 70% и выше. Сейчас модель в первую очередь ориентируется на самые яркие и заметные объекты на фотографии, а при работе с диатомеями, которые находятся под углом или смещены от центра, есть возможность дополнительно расширить набор примеров для обучения. В дальнейшем можно вручную дообучить сервис на таких снимках: выбрать класс и указать непосредственно на фотографии, где находится нужная створка. Это позволит расширять возможности модели и будет особенно полезно для научных исследований. При этом уже сейчас технология заметно ускоряет обработку данных по сравнению с ручным анализом. В перспективе сервис сможет одновременно работать с ещё большим объёмом фотографий.
Анна Рудинская
Кандидат географических наук, научный сотрудник лаборатории палеоархивов природной среды Института географии РАН
Какие планы
Ближайшая задача — проверить сервис на реальном микропрепарате целиком, а не на отдельных тестовых снимках. Причём тот же микропрепарат планируют дать нескольким специалистам и сравнить их результаты между собой и с ответом модели. Это покажет не только точность сервиса, но и то, насколько сходятся друг с другом эксперты — такого исследования раньше никто не проводил. Если точность окажется достаточной, в институте смогут официально опираться на результаты сервиса в своих публикациях, а пока это невозможно: без доказанной точности исследование с алгоритмом в основе не пройдёт рецензирование.
Одна из причин, почему сервис пропускает повёрнутые и смещённые к краю кадра створки, — недостаток таких примеров в обучающих данных: пока в датасете в основном чёткие, хорошо развёрнутые к камере снимки. Команда планирует наполнять датасет реальными фотографиями уже размеченных видов и применять аугментацию, то есть искусственно поворачивать и смещать изображения, чтобы модель научилась узнавать водоросли и в менее удобных ракурсах. Расширение числа видов, которые сервис умеет определять, тоже в планах, но пока в приоритете наполнение датасета: институт готов присылать новые фотографии, если разработчики решат, что они нужны.
Датасет, собранный в рамках проекта, планируют открыть для всего научного сообщества — команда Института географии РАН эту идею поддерживает: чем больше исследователей его используют и проверяют, тем надёжнее результат.
Если точность подтвердится, эффект будет ощутимым: диатомовый анализ одной колонки донных отложений может сократиться с нескольких лет до нескольких месяцев. Для других методов палеогеографических реконструкций сроки могут отличаться. Внедрение подобных технологий в науке обычно не происходит быстро.