Экстрактор изображений/текста PDF

Извлекайте и просматривайте текст из снимков экрана, фотографий и PDF-файлов в браузере.

Выберите изображения или один PDF-файл, выберите язык текста и извлеките его. Просмотрите каждую страницу рядом с оригиналом, исправьте ошибки, затем скопируйте или загрузите TXT.

Как использовать

Извлечение текста из скриншота или PDF-файла

Выберите изображения или один PDF-файл, выберите язык текста и извлеките его. Просмотрите каждую страницу рядом с оригиналом, исправьте ошибки, затем скопируйте или загрузите TXT.

Пример и ожидаемый результат

Пример: образец счета-фактуры содержит «Итого: 125,50 долларов США». Перед копированием сверьте номера с оригиналом. TXT сохраняет разделители текста и страниц; он не сохраняет таблицы или макет PDF.

Пределы распознавания

До 10 изображений или один PDF-файл с 20 страницами. Печатный текст работает лучше всего. Таблицы, почерк и сложные столбцы требуют ручной проверки. Признание бенгали не поддерживается.

Внимательно проверяйте результаты на арабском, урду и вьетнамском языках: смешанное письмо или акценты могут привести к пропущенным цифрам или буквам.

Первая загрузка

Двигатель и выбранные модели загружаются при необходимости. Файлы остаются в этом браузере. В режиме качества загружается около 31 МБ моделей плюс движок; облегченный режим загружает около 6 МБ моделей. Кэшированные ресурсы можно использовать повторно.

Текстовые слои PDF

Существующий текст PDF извлекается напрямую. Отсканированные страницы используют OCR. Распознать эту страницу снова вызывает распознавание текста, если исходный текстовый слой неполный. Экспорт представляет собой обычный текст, а не PDF-файл с возможностью поиска или таблицу Excel.