Отсканированные PDF-файлы, которые невозможно редактировать, знакомы многим. Документ выглядит как текст, но это всего лишь изображение, и любое изменение становится настоящей головной болью. На помощь приходит OCR — технология оптического распознавания символов. Читать далее
Каждое утро мне падает сводка по приложению. Сегодня в ней было: 27 сканов за сутки, из них 10 — с вердиктом “нет данных”. Тридцать семь процентов людей навели камеру на штрихкод и не получили ничего. Разбираю, откуда берётся эта дыра при базе в 112 тысяч товаров, почему OCR-фоллбэк отсекает 39 процентов пользовательских вкладов и где проходит граница между “принять с риском” и “отклонить и потерять данные”. Читать далее
В честь 30-летия OCR мы продолжаем вспоминать, как появились первые отечественные технологии распознавания текста. На прошлой неделе мы рассказали про самую первую такую программу – OCR Tiger, предназначавшуюся для оцифровки книг с целью их дальнейшего переиздания. Сегодня речь…
Это мой первый пост об оптическом распознавании текста (OCR) с использованием Tesseract. Tesserast это очень популярная open source библиотека для OCR поддерживаемая Google, которая дает высокие результаты точности и поддерживает более 100 языков. В этом посте я расскажу как можно работать со стандартным словарем для языковой модели Tesseract и настроить его под свои нужды. Кому интересно, прошу под кат. Читать дальше →