Помощник египтолога: как ИИ-агент ищет ответы в научных публикациях

Египтологи публикуют до 200 значимых работ ежегодно — уследить за всеми невозможно. Рассказываем, как Центр технологий для общества Yandex Cloud и лаборатория BRAIn Lab МФТИ создали агента, который ищет ответы по базе публикаций о некрополе Гизы.

Краткий пересказ YandexGPT
  • ИИ-агент, помогает египтологам справляться с большим объёмом научных публикаций и освобождать время для собственных исследований.
  • Базой знаний для агента стал некрополь Гизы, потому что там сосредоточены важные материалы о Древнем царстве, корпус публикаций уже сформирован. Кроме того, в Гизе работает российская экспедиция, публикации которой вошли в базу данных.
  • ИИ-агент построен на базе сервисов Yandex Cloud по технологии RAG и рассчитан на четыре типа запросов: поиск информации, суммаризацию, генерацию текста, составление библиографических списков.
  • Для борьбы с «галлюцинациями» ИИ-агента команда провела предобработку данных: заново распознала файлы, очистила страницы, извлекла метаданные и применила алгоритмы семантической близости.
  • Сейчас агент помогает египтологам быстро извлекать информацию из корпуса публикаций, например собирать аналогии к найденным памятникам и проверять тексты.
  • Египтологи подтвердили, что агент подходит для научной работы и помогает в изучении истории некрополя Гизы.
  • В будущем планируется доработать библиографические списки, начать анализ изображений, решить вопросы, связанные с большим объёмом данных, и расширить базу знаний за счёт метаданных, таблиц атрибутов, полевой документации и открытых архивов египтологических журналов.

Зачем египтологам ИИ-агент

Египтологи, изучающие эпоху строительства пирамид, выпускают в год 150–200 только наиболее важных работ: статьи в рецензируемых журналах, монографии, сборники по итогам конференций. А ещё есть сотни менее заметных публикаций. Уследить за всеми почти невозможно — даже в такой узкой научной сфере это трудоёмкая задача.

Чтобы просто оставаться в курсе всего опубликованного, исследователю нужно посвятить чтению практически всё рабочее время. Но задача учёного — не только читать чужие работы: прежде всего он проводит собственные исследования и публикует новые результаты. Совместить одно с другим сложно.

Помочь с этой задачей могли бы большие языковые модели — их египтологи и археологи уже используют в работе. Но здесь всё упирается в вопрос точности: ответ LLM может выглядеть убедительно, но при проверке оказывается, что части фактов доверять нельзя. Для науки это критично.

Отсюда и родилась идея проекта: создать не универсальный чат-бот, а агента, который отвечает строго по проверенному корпусу публикаций и подтверждает каждый ответ ссылками на конкретные источники. В таком случае ему можно доверить рутинную часть работы.

Древнее царство (ок. 2686–2181 гг. до н. э.) — это период крупного расцвета Древнего Египта и первый из трёх великих «золотых веков» его истории. В это время были заложены фундаментальные основы египетской цивилизации, включая её архитектуру, религию, царскую идеологию и государственность. В более поздние эпохи Древнее царство стало для египтян образом идеальной «седой старины».

Почему базой знаний стал именно некрополь Гизы

Проект совместно запустили Центр технологий для общества Yandex Cloud и BRAIn Lab МФТИ — лаборатория фундаментальных исследований ИИ, которая отвечала за техническую разработку агента. Научным партнёром проекта выступил Институт востоковедения РАН.

База знаний посвящена некрополю Гизы: более 800 публикаций, или около 12 ГБ PDF-файлов с иллюстрациями. Все работы находятся в открытом доступе, распознаны с разным качеством и написаны на пяти языках: английском, французском, немецком, итальянском и русском.

Гизу выбрали по трём причинам.

  • Корпус уже был сформирован из доступных онлайн-публикаций.
  • Некрополь Гизы — знаковый. Именно в нём стоят великие пирамиды, и практически любое исследование о Древнем царстве упоминает это место. Материалы из некрополя используют при изучении искусства, культуры, религии, экономики и социальных отношений III тысячелетия до н. э.
  • В Гизе работает российская экспедиция, и её публикации — шесть томов на английском языке — вошли в базу данных отдельным блоком, обособленным от остального массива.

Раньше поиск по этому корпусу выглядел так: исследователь скачивал публикации и искал нужную информацию по ключевым словам с помощью программы, в которой он просматривал файл. Каждая смена языка означала новый поиск, найденные цитаты приходилось вручную собирать в отдельный файл и затем анализировать. На это уходило много времени, но альтернативы до появления агента не было.

Фото: Максим Лебедев

Фото: Максим Лебедев

Фото: Сергей Малых

Как устроен ИИ-агент

С архитектурной точки зрения это агентная система на базе сервисов Yandex Cloud, построенная по технологии RAG. Модель ищет информацию в подключённой базе знаний и формирует ответ на её основе — со ссылками на конкретные источники.

Проект реализовали на платформе Yandex AI Studio, внутри которой доступны языковые модели. База знаний хранится в Yandex Object Storage и разбита на два изолированных контура: общую базу публикаций о Гизе и отдельный раздел с материалами российской экспедиции.

Агент рассчитан на четыре типа запросов:

  • поиск информации по базе;
  • суммаризация;
  • генерация текста на заданную тему;
  • составление библиографических списков.

По этим типам он самостоятельно маршрутизирует все запросы. Если вопрос или просьба исследователя выглядят неоднозначно, агент выбирает поиск: находит подходящие фрагменты в базе и отвечает по ним со ссылками, вместо того чтобы сочинять текст. Так меньше риск получить правдоподобный, но ничем не подтверждённый ответ.

Вот как это выглядит на примере сбора упоминаний о конкретном памятнике. На запрос «Составь список публикаций, в которых упоминается гробница G 7721» ИИ-агент возвращает корректный перечень источников с указанием страниц:

Ответ агента

Publications mentioning tomb G 7721: VETOKHOV, 2019 = Vetokhov S. V. Сердаб в древнеегипетской скальной гробнице Кахерптаха (G 7721) в Гизе: новые данные // Вестник Института востоковедения РАН. 2019. № 3. С. 32–44. muench_antiquity_74_286_2000 [p. 7] kendall_fs_dunham [pp. 5, 12–14] Giza_Eastern_Necropolis_6 [pp. 23–24] giza_necropolis_1 [pp. 173–174] janosi_fs_schmitz [p. 7]

Запрос отправляют через минимальный интерфейс — его специально не усложняли, так как задача была исследовательская, а не продуктовая. Внутри три элемента: выбор модели, диалоговое окно и загрузка собственных документов, которые попадают в общую базу знаний.

У агента нет доступа в интернет, поэтому каждый ответ опирается только на проверенный корпус публикаций. В результате внешние источники не смешиваются с базой, а любую ссылку можно проверить по конкретному PDF-файлу. Если ответа в базе нет, агент прямо сообщает об этом, а не сочиняет правдоподобный текст.

Когда историки и археологи только начинали пользоваться ИИ, было много смешных и грустных историй: специалист получал на запрос цитаты из несуществующих работ и хватался за голову — как же он пропустил столько литературы в своей области! А потом оказывалось, что это галлюцинации. После таких случаев многие коллеги стали скептиками: мол, это студент, который не просто работает спустя рукава, а ещё и занимается подлогом. Первого можно хотя бы научить, а со вторым каши уже не сваришь. Для проверки я сознательно выбирал темы, которые хорошо знаю. И самым ценным оказалось то, что ассистент отвечает по существу и с релевантными ссылками — значит, ему можно доверять и в темах, которыми я раньше не занимался. Для скорости и качества научной работы это огромный плюс.
Максим Лебедев
К. и. н., старший научный сотрудник Института востоковедения РАН

В основе агента — модели Яндекса. Также команда подключила Qwen3 (235B) — исследователь сам выбирает, с какой моделью работать под конкретную задачу. Высокую точность обеспечивает подход RAG — агент отвечает по проверенной базе знаний, а не по «памяти» модели.

Как боролись с галлюцинациями

Первая версия агента много галлюцинировала — в основном из-за качества исходных данных. Часть PDF-файлов прошла через распознавание текста (OCR), часть — нет, поскольку текст был перемешан с иллюстрациями и египетскими иероглифами, которые стандартные системы распознавания не обрабатывают. Из-за этого векторные представления получались «шумными», и поиск по ближайшим векторам работал плохо.

На этапе предобработки команда:

  • заново распознала файлы, в качестве OCR которых были сомнения;
  • вручную очистила страницы, перегруженные изображениями и иероглифами;
  • автоматически извлекла метаданные статей — автора, язык, тематику — с ручной проверкой проблемных мест;
  • применила алгоритмы семантической близости на уровне терминов и предложений, чтобы улучшить качество векторизации.

В результате фактические галлюцинации стали минимальными: цитаты точные, а все ссылки ведут на релевантные страницы конкретных PDF-файлов. Небольшая погрешность есть только в библиографических данных, которые выгружали из открытых онлайн-баз.

Теперь исследователь мог задать агенту конкретный вопрос — например, «Какие основные контексты нахождения каменных орудий в некрополе Гизы?» — и получить релевантный ответ со ссылками.

Какие результаты есть уже сейчас

Лучше всего пользу ИИ-агента иллюстрирует сбор аналогий к найденным памятникам — упоминаний похожих находок в опубликованных материалах других экспедиций. Раньше даже беглый поиск через графические инструменты по основным ключевым словам занимал около полутора часов. Ещё не меньше часа уходило на первичный анализ найденных фрагментов: нужно выделить и типологизировать контексты таких находок.

Теперь исследователь просит агента подобрать ключевые слова, чтобы искать по ним — и всё это занимает несколько минут. В ответе агент сразу предлагает основные типы археологических контекстов и список публикаций из базы знаний, по которым можно перепроверить информацию. Около 2,5 часа ручной работы превращаются в несколько минут.

Полноэкранное изображение

На сложный запрос агент отвечает связным текстом: разбирает контекст, отделяет прямые упоминания от косвенных и подкрепляет каждый вывод ссылкой на конкретную страницу источника

Египтологи оценили ответы агента и подтвердили, что он подходит для научной работы. Эти данные уже помогли в изучении истории некрополя Гизы, в быстром извлечении нужной информации из собранного корпуса публикаций, а также в проверке и уточнении текста седьмого тома в серии публикаций о раскопках Восточного плато Гизы, который выйдет в 2026 году. Помимо этого, команда проверяла отказоустойчивость, скорость обработки и корректность распределения запросов по типам — всё работает надёжно.

Создание ИИ-агента — естественный ответ на стремительный рост объёма научной литературы с одной стороны и недостаток научных кадров с другой. Гиза здесь показательный пример: Плато Великих пирамид — важнейший памятник археологии, материалы которого лежат в основе сотен исследований о культуре, религии и истории Древнего Египта. При этом египтология — небольшая дисциплина: источников у нас много, а специалистов, способных с ними работать, всё ещё очень мало. Получить «искусственного лаборанта», который уже сейчас «знает» корпус более чем из 800 научных работ и умеет находить, сопоставлять и систематизировать информацию из них, — большая научная удача. И очень символично, что в начале этого пути оказались данные из Гизы — о жизни людей, которые стояли у истоков мировой цивилизации.
Максим Лебедев
К. и. н., старший научный сотрудник Института востоковедения РАН
Для нашей лаборатории такие проекты важны сразу по нескольким причинам: молодые ребята пробуют силы на реальных задачах, мы внедряем ИИ там, где он полезен, и помогаем развивать отечественные модели и сервисы, давая командам развёрнутую обратную связь. А главное — нам было важно вернуть исследователю время. Учёный тратит почти весь ресурс, просто чтобы оставаться в курсе литературы, — эту рутину мы хотели отдать машине, но так, чтобы результату можно было доверять. Поэтому агент не сочиняет, а находит и всегда показывает, откуда взял информацию. То, что раньше занимало часы, теперь занимает минуты, и это подтвердили сами египтологи.
Александр Безносиков
Доктор физико-математических наук, руководитель BRAIn Lab

Что ещё предстоит доработать

Из того, что планируем развивать в ближайшее время, — библиографические списки: здесь команда достигла порога возможностей алгоритмического подхода. Чтобы продвинуться дальше, нужна ручная разметка данных, а автоматизировать её мешает специфика источников: во многих статьях встречаются иероглифические тексты, транслитерации и изображения, которые ИИ-инструменты пока не размечают достаточно точно.

Анализ изображений тоже в планах: работа с египетской иероглификой — отдельная масштабная задача. Открыт и вопрос объёма: можно ли применить те же алгоритмы к базам знаний, например, в 1 ТБ, какие есть в личных библиотеках у многих учёных.

Именно с объёмом базы команда связывает и дальнейшее развитие. В неё можно добавить метаданные и таблицы атрибутов к фотографиям, рисункам и чертежам из архивов экспедиций XX века, подключить полевую документацию современных экспедиций, у которой нет проблем с текстовым слоем, а также открытые архивы египтологических журналов. Если базу расширять и регулярно обновлять, агент вырастет из инструмента для одного некрополя в исследовательский сервис для многих памятников и тем.

Центр технологий для общества Yandex Cloud реализует социально значимые проекты в области образования и науки, здравоохранения, экологии и культуры. Если у вас есть похожие проекты, заполните заявку.

Помощник египтолога: как ИИ-агент ищет ответы в научных публикациях

Войдите, чтобы сохранить пост