Нейросети добрались до архивов: как ИИ расшифровывает старинные рукописи и меняет генеалогию

Нейросети Яндекса и московские ИИ-алгоритмы научились читать дореволюционные рукописи. Сервис «Поиск по архивам» открыл доступ к миллионам страниц метрических книг и ревизских сказок. Как работает технология, какие ограничения есть и что это значит для историков и генеалогов.

Проблема расшифровки архивных документов до эпохи ИИ

До недавнего времени работа с дореволюционными архивами была уделом узких специалистов. Метрические книги, исповедные ведомости и ревизские сказки XVIII–XIX веков написаны скорописью, содержат утраченные буквы (ять, фита, ижица) и не имеют единого стандарта почерка. Даже опытные архивисты тратили часы на расшифровку одной страницы, а для генеалогов-любителей такие документы часто оставались «китайской грамотой». Оцифровка и ручной ввод текста требовали колоссальных трудозатрат, что делало массовый поиск по фамилиям или населённым пунктам практически невозможным.

Как нейросети учатся читать рукописи: технология и обучение

Яндекс обучил свою нейросеть на массиве из сотен тысяч реальных рукописных строк XVIII–XIX веков и десятков миллионов сгенерированных примеров. Разметку и верификацию выполняли эксперты-архивисты, которые контролировали качество распознавания. Алгоритм построен на системе оптического распознавания символов (OCR), адаптированной для исторических текстов. Он учитывает особенности почерка, узнаёт вышедшие из употребления буквы и понимает структуру архивных документов — заголовки, колонтитулы, разделители записей. Благодаря этому рукописи, которые неподготовленный человек разбирает с трудом, нейросеть превращает в печатный текст практически мгновенно.

Сервис «Поиск по архивам»: что доступно уже сейчас

В январе 2023 года был запущен сервис «Поиск по архивам» — совместная платформа Главархива Москвы и Яндекса. На старте в нём было представлено более 2,5 миллиона страниц исторических документов с текстовой расшифровкой. К июню 2023 года база выросла до 4,5 миллионов образов, что соответствует более 9 миллионам страниц. Пользователи могут искать по материалам XVIII – начала XX века: метрическим книгам (записи о рождениях, браках и смертях), исповедным ведомостям и ревизским сказкам (результатам переписи податного населения). Документы доступны из Главархива Москвы, архивов Оренбургской, Новгородской, Московской областей и Республики Мордовия.

Как работает поиск и визуализация расшифровки

Интерфейс сервиса позволяет искать документы по каталогу или через строку поиска. Доступны фильтры по годам, архивам, фондам и описям. Рядом со сканом каждой страницы отображается построчная расшифровка, сгенерированная нейросетью. Если навести курсор на нужный фрагмент текста, он подсвечивается на цифровой копии документа, что позволяет быстро сверять распознанное с оригиналом. Это особенно важно, так как даже лучшие алгоритмы могут ошибаться в сложных местах — пользователь может визуально проверить корректность расшифровки.

Результаты и масштаб: сколько документов уже обработано

За первые несколько месяцев работы сервиса пользователи изучили около 2,5 миллионов образов — более половины всех материалов, загруженных на платформу на тот момент. Московские нейросети в рамках эксперимента по внедрению компьютерного зрения в архивное дело проанализировали более 4,5 миллионов образов. К проекту присоединились регионы: Московская, Оренбургская, Новгородская области и Республика Мордовия, чьи архивы также были обработаны столичными ИИ-алгоритмами — около 1,7 миллиона электронных копий документов из региональных хранилищ.

Кому это нужно: от генеалогов-любителей до профессиональных историков

Сервис ориентирован на широкую аудиторию. Для генеалогов-любителей он открывает возможность быстро находить упоминания фамилий, имён и населённых пунктов в метрических книгах — ключевом источнике для составления родословной. Профессиональные историки, социологи и демографы получают инструмент для массового анализа данных: можно изучать динамику рождаемости, миграционные потоки, социальную структуру населения по целым уездам за длительные периоды. Ранее такие исследования требовали месяцев кропотливой работы в читальных залах архивов.

Ограничения и перспективы развития технологии

На данный момент у сервиса есть несколько важных ограничений. Во-первых, пользователи не могут загружать собственные сканы документов для распознавания — доступны только те материалы, которые уже обработаны и выложены платформой. Во-вторых, база пока ограничена архивами нескольких регионов, хотя разработчики обещают постепенное расширение. В-третьих, качество распознавания может снижаться на сильно повреждённых или неразборчивых страницах. Тем не менее, технология продолжает совершенствоваться: нейросеть дообучается на новых данных, а количество доступных документов растёт.

Влияние на архивное дело и смежные области

Внедрение нейросетей в архивную сферу меняет не только скорость доступа к информации, но и саму методологию исследований. Возможность полнотекстового поиска по миллионам страниц позволяет выявлять статистические закономерности, которые раньше были скрыты. Для демографов это шанс реконструировать историю населения целых губерний, для лингвистов — изучать эволюцию письменности и орфографии. Кроме того, технология снижает порог входа для любителей: теперь для поиска предков не нужно специальное образование или навыки палеографии.

Будущее: что дальше и какие задачи стоят перед разработчиками

Основные направления развития включают расширение географии архивов, увеличение точности распознавания (особенно для документов с плохой сохранностью) и, возможно, внедрение функции загрузки пользовательских материалов. Также обсуждается создание мобильного приложения для распознавания рукописей в реальном времени. В перспективе аналогичные технологии могут быть применены к другим историческим источникам — актам гражданского состояния советского периода, церковным книгам других конфессий, рукописным картам. Успех проекта в Москве и регионах показывает, что ИИ способен стать незаменимым помощником в сохранении и изучении культурного наследия.

Вопросы и ответы

Что такое сервис «Поиск по архивам» и как он работает?

Это бесплатная платформа, созданная Главархивом Москвы и Яндексом. Нейросеть на основе оптического распознавания символов расшифровывает рукописные дореволюционные документы и превращает их в печатный текст. Пользователь может искать по фамилиям, населённым пунктам и другим словам, а также видеть построчную расшифровку рядом со сканом оригинала.

Какие документы доступны для поиска?

В сервисе представлены метрические книги (записи о рождениях, браках и смертях), исповедные ведомости и ревизские сказки (переписи населения) XVIII – начала XX века. На данный момент доступны архивы Москвы, Московской, Оренбургской, Новгородской областей и Республики Мордовия.

Можно ли загрузить свои сканы архивных документов для распознавания?

Нет, такая возможность пока не предусмотрена. Сервис работает только с теми документами, которые уже оцифрованы и обработаны платформой. Разработчики обещают расширение функционала в будущем.

Насколько точна расшифровка нейросети?

Точность высокая, но не идеальная. Алгоритм обучен на сотнях тысяч реальных строк и миллионах сгенерированных примеров, однако на сильно повреждённых или неразборчивых страницах возможны ошибки. Пользователь может сверить распознанный текст с оригиналом благодаря подсветке фрагментов на скане.

Кому будет полезен этот сервис?

В первую очередь — генеалогам-любителям, которые ищут информацию о предках. Также он пригодится профессиональным историкам, демографам, социологам и всем, кто изучает историю России XVIII–XIX веков.

Планируется ли расширение базы документов?

Да, разработчики заявляют о постепенном подключении новых архивов из других регионов России. Уже сейчас к проекту присоединились несколько областей, и база продолжает расти.

Есть ли мобильное приложение для сервиса?

На данный момент официального мобильного приложения нет. Сервис доступен через веб-интерфейс. В будущем возможно появление приложения для распознавания рукописей в реальном времени.