Метрические книги, ревизские сказки, исповедные ведомости - почти любой, кто занимался историей своей семьи, знает, как тяжело читать такие документы. Дореформенная орфография, выцветшие чернила, писарский почерк XIX века: на разбор одной страницы может уйти вечер. АрхивРидер решает эту задачу за несколько минут - вы загружаете скан или фотографию, а сервис распознаёт текст и переводит его в понятный современный вид.
В этой статье - пошаговая инструкция по работе с сервисом и отдельный раздел о том, как получить максимально точную расшифровку.
Шаг 1. Зарегистрируйтесь и получите бесплатные баллы
Все операции в сервисе оплачиваются баллами. При регистрации вы получаете 5 бесплатных баллов - этого хватит, чтобы расшифровать пять страниц и понять, подходит ли вам сервис. Ещё 5 баллов можно получить за подписку на наш Telegram-канал - кнопка бонуса есть в личном кабинете.
Как тратятся баллы:
- -1 балл - расшифровка одной обычной страницы документа
- -2 балла - расшифровка разворота (две страницы на одном скане)
- -если обработка завершилась ошибкой, баллы автоматически возвращаются на баланс
Когда бесплатные баллы закончатся, баланс можно пополнить пакетом на странице «Цены»: чем больше пакет, тем дешевле обходится каждая страница.
Шаг 2. Загрузите документ
Прежде чем загружать первую страницу, загляните в раздел «Как получить максимальный результат» - там собраны требования к изображению: разрешение, водяные знаки, снимки экрана, пересжатие мессенджерами. Качество исходника влияет на расшифровку сильнее всего остального, и переснять страницу до загрузки проще, чем расшифровывать её заново.
На странице «Мои документы» перетащите файл в область загрузки или выберите его вручную. Поддерживаются форматы JPG, PNG и PDF. Можно загрузить несколько файлов сразу, но для лучшего качества распознавания мы советуем загружать документы по одному - следующие страницы вы всегда сможете добавить к документу позже.
Сервис справляется и со сложными случаями: артефакты сканирования, шум, нестандартная структура страницы. Если на фотографии разворот книги - две страницы рядом - система определит это автоматически.
Перед первой загрузкой загляните в настройки. В личном кабинете есть два переключателя, которые меняют саму расшифровку. Оба действуют только на новые распознавания, поэтому включать их нужно до загрузки страницы, а не после:
- -«Расшифровка в формате Markdown» - современный текст размечается заголовками (документ → двор → глава семейства), с отдельной строкой на каждого человека и номером персоны в виде сноски. Такую страницу легче читать глазами, и её можно скачать файлом .md - в любой редактор заметок или текстовый процессор. Разметка рассчитана на документы с дворами и списками душ - ревизские сказки, исповедные ведомости.
- -«Автоматическая генерация таблиц» - таблица строится сразу при распознавании. Когда переключатель выключен (так по умолчанию), страница расшифровывается в текст, а таблицу вы собираете кнопкой на странице документа - первый раз бесплатно.
Уже расшифрованные страницы от переключения не меняются: чтобы получить страницу в новом виде, её пришлось бы распознать заново. Поэтому удобнее решить до того, как вы начали загружать дело.
Шаг 3. Дождитесь распознавания
Обработка одной страницы занимает несколько минут. Статус виден в списке документов - когда расшифровка будет готова, документ можно открыть и посмотреть результат.
Шаг 4. Работайте с результатом
На странице документа вы получите:
- -оригинальный текст - то, что написано в документе, с сохранением исходной орфографии
- -современную расшифровку - тот же текст, переведённый в привычный современный вид без потери смысла
- -структурированную таблицу - для метрических книг и других табличных документов данные раскладываются по колонкам: имена, даты, события
Любой блок можно скопировать одной кнопкой. Если вы заметили неточность, откройте встроенный редактор и поправьте текст вручную - ваша версия сохранится рядом с автоматической.
Если страница распознавалась с включённой настройкой «Расшифровка в формате Markdown», современный текст показывается размеченным - с заголовками по дворам и отдельной строкой на человека, - а рядом с кнопкой копирования появляется кнопка выгрузки: страница скачивается файлом .md. Ваши правки выгружаются отдельным файлом, чтобы автоматическая и исправленная версии не перемешивались.
Изображение документа: лупа, масштаб и негатив
На странице документа скан отображается рядом с расшифровкой, и для сверки текста с оригиналом не нужно открывать изображение в отдельной программе - все инструменты встроены.
Лупа. Наведите курсор на изображение - фрагмент под курсором показывается увеличенным. У лупы два режима, переключатель - в панели кнопок справа вверху изображения:
- -панель сбоку - рядом с документом открывается большое окно с увеличенным фрагментом; рамка на изображении показывает, какая область увеличена. Удобно, когда нужно разобрать целую строку или запись
- -линза под курсором - увеличенный фрагмент появляется прямо под курсором и следует за ним. Удобно быстро «пробегать» по странице; у края документа линза выступает наружу, так что текст на самой границе тоже читается
Выбранный режим запоминается. Если лупа не нужна, её можно совсем отключить в личном кабинете - на странице профиля. На телефонах и планшетах лупа не показывается - там работает привычное увеличение жестом.
Масштаб. Кнопки «+» и «−» справа вверху увеличивают и уменьшают само изображение, кнопка «1:1» возвращает исходный размер. Увеличенное изображение можно перемещать, зажав левую кнопку мыши. Пока изображение увеличено, лупа отключена - нажмите «1:1», чтобы вернуть её.
Негатив. Кнопка с наполовину закрашенным кружком в той же панели переворачивает цвета скана: тёмная бумага становится чёрной, а бледные чернила - светлыми. Выцветшие или продавленные чернила, слабый карандаш, тонкие росчерки и записи на потемневшей бумаге в негативе часто читаются заметно лучше, чем в оригинале, - если строка не разбирается, попробуйте переключиться и посмотреть на неё ещё раз. Негатив работает вместе с увеличением, а лупа показывает фрагмент в тех же цветах. Выбор запоминается для этого изображения: вернувшись к странице, вы увидите её в том же виде, а повторное нажатие возвращает обычные цвета.
Поворот. Крайняя левая кнопка панели поворачивает скан на 90° по часовой стрелке - для страниц, снятых боком. Угол, как и негатив, запоминается для этого изображения.
Как сверять текст. Откройте расшифровку рядом со сканом и ведите лупой по строкам оригинала, сравнивая спорные места - имена, фамилии, даты, цифры возраста в табличных колонках. Для разбора одной неразборчивой записи целиком удобнее увеличить изображение кнопкой «+» и подвинуть нужный фрагмент мышью. Найденные ошибки сразу правьте во встроенном редакторе.
Шаг 5. Добавьте следующие страницы
Если документ многостраничный, не загружайте страницы как отдельные документы. На странице уже обработанного документа нажмите «Добавить следующую страницу» - новая страница будет привязана к текущему документу, а сервис учтёт контекст предыдущих страниц при распознавании. Это особенно важно для метрических книг: повторяющиеся фамилии, названия сёл и структура записей помогают системе точнее читать сложные места.
Прежде чем добавлять следующую страницу, перепроверьте результат по уже обработанной: если видите ошибки - поправьте их в редакторе. Исправленный текст станет более точным контекстом для следующих страниц.
Как получить максимальный результат
Качество расшифровки напрямую зависит от того, что и как вы загружаете. Вот проверенные приёмы, которые заметно улучшают результат.
1. Начните с качественного изображения
Это самый важный фактор. Сервис читает ровно то, что видно на картинке: если строка не разбирается глазами при увеличении, её не разберёт и система. Чем выше разрешение, тем лучше - выносные буквы, тонкие росчерки, цифры возраста и правки между строк различаются именно за счёт запаса в пикселях.
Каким должно быть изображение:
- -Высокое разрешение. Для скана - 300 dpi и выше, а для мелкого или плотного почерка лучше 400-600 dpi. Для фотографии - не меньше 8 мегапикселей, то есть примерно 2500-3000 пикселей по длинной стороне страницы; современный телефон даёт это по умолчанию, если не включён режим экономии.
- -Оригинальный файл, а не пересжатая копия. Мессенджеры и соцсети сжимают фотографии в несколько раз и «замыливают» именно мелкие детали почерка. Пересылайте снимок себе файлом (в Telegram - «Отправить без сжатия», в почте - вложением) и загружайте в сервис исходник, а не то, что сохранилось из чата.
- -Цветное или в оттенках серого. Не включайте в телефонных сканерах режимы «документ», «чёрно-белое» и автоконтраст: они выбивают бледные чернила, карандаш и продавленные строки в белый фон. Обычный цветной снимок лучше - усилить контраст можно уже в сервисе кнопкой негатива.
- -Резкое, в фокусе. Проверьте резкость перед загрузкой: если текст трудно прочитать на экране телефона при увеличении, системе тоже будет сложнее.
- -Страница целиком - вместе с полями, номерами записей и подписями на краях. Небольшой запас по краям лучше, чем обрезанная строка.
- -Одна страница или один разворот на файл. Не собирайте несколько страниц в коллаж: сервис считает такой файл одной страницей и разбирает его хуже, чем те же страницы по отдельности.
Чего лучше избегать:
- -Водяных знаков и плашек. Логотипы, полупрозрачные надписи и штампы генеалогических сайтов ложатся прямо на строки и перекрывают буквы - под ними текст теряется и для человека, и для системы. Если есть выбор, берите версию без вотермарка: скан из архива, копию с диска или файл, выданный по запросу.
- -Фотографий экрана. Снимок монитора или ноутбука на телефон даёт муар, блики и пиксельную сетку поверх почерка - это одна из самых частых причин плохой расшифровки. Если документ уже открыт на компьютере, сохраните исходный файл или сделайте снимок экрана средствами системы.
- -Скриншотов превью и миниатюр. В скриншоте ровно столько деталей, сколько было видно на экране. Разверните изображение на весь экран в максимальном масштабе, а лучше скачайте оригинал.
- -Перекоса, бликов и теней. Снимайте строго сверху, текст параллельно краям кадра, при равномерном рассеянном свете - без бликов и теней от рук или телефона. Не используйте цифровой зум, лучше поднесите телефон ближе.
- -Посторонних предметов в кадре - пальцев, линеек, закладок и листов бумаги, перекрывающих текст.
- -Фильтров и «улучшайзеров». Повышение резкости, шумодав и художественная обработка дорисовывают детали, которых в документе нет, и стирают слабые штрихи. Загружайте снимок как есть.
2. Загружайте документы по одному
Пакетная загрузка удобна, но одиночная даёт лучшее качество: каждая страница получает максимум внимания при обработке. Загрузите первую страницу, дождитесь результата, а затем добавляйте следующие через кнопку «Добавить следующую страницу».
3. Держите страницы одного дела вместе
Связанные страницы - главный источник контекста. Когда вы добавляете страницы последовательно в один документ, сервис использует уже распознанные записи: если на предыдущей странице встречалась редкая фамилия, система с большей вероятностью правильно прочитает её и на следующей, даже если там она написана неразборчиво. Для метрических книг и ревизских сказок это даёт ощутимый прирост точности.
4. Разворот или отдельные страницы?
Сервис умеет распознавать развороты (это стоит 2 балла - как две страницы). Но если оригинал в плохом состоянии или текст мелкий, лучше сфотографировать каждую страницу разворота отдельно: изображение получится крупнее и детальнее, а значит - точнее расшифровка.
5. Не пропускайте ручную проверку
Автоматическая расшифровка - это черновик высокого качества, но имена собственные, редкие топонимы и повреждённые фрагменты стоит сверять с оригиналом. В интерфейсе документ и расшифровка отображаются рядом: ведите лупой по строкам скана, увеличьте изображение кнопками или включите негатив, если чернила совсем бледные, а правки вносите во встроенном редакторе. Особенно важно перепроверить страницу до того, как добавите к документу следующую: исправленный текст станет более точным контекстом для новых страниц. Проверенный вами текст - это уже готовый материал для семейного древа или публикации.
6. Если результат всё равно не устроил
- -добавьте к документу соседние страницы - контекст может «вытянуть» спорные места
- -переснимите или пересканируйте оригинал в лучшем качестве и загрузите заново
- -напишите нам на help@archivereader.ru или в Telegram - разберём ваш случай
Коротко
- Зарегистрируйтесь - 5 баллов бесплатно, ещё 5 за подписку на Telegram.
- Загрузите чёткий скан или фото (JPG, PNG, PDF) - лучше по одной странице. Чем выше разрешение, тем лучше; исходный файл без водяных знаков, без пересжатия мессенджером и без съёмки экрана. Настройки расшифровки (Markdown, автоматические таблицы) включите заранее: они действуют только на новые страницы.
- Через несколько минут получите оригинальный текст, современную расшифровку и таблицу.
- Проверьте результат в редакторе и поправьте ошибки, если они есть, - неразборчивое место разбирайте лупой, увеличением или негативом.
- Добавляйте следующие страницы к тому же документу - контекст повышает точность.
Попробуйте на своём документе - первая расшифровка займёт меньше десяти минут вместе с регистрацией.