Ошибка в обучении Тессеракта с jTessBoxEditor
Я объединил около 50 изображений в один файл .tif с помощью jTessBoxEditor (Linux), но когда я пытаюсь получить файл .box с этим кодом: tesseract mjchar.tif mjchar -l eng --psm 10...
Подборка 159 вопросов с тегом «ocr» на WikiRoot: ответы IT-специалистов по Windows, Linux, Excel, сетям и программированию.
159 вопросов
Я объединил около 50 изображений в один файл .tif с помощью jTessBoxEditor (Linux), но когда я пытаюсь получить файл .box с этим кодом: tesseract mjchar.tif mjchar -l eng --psm 10...
Мне нужно отсортировать большое количество графиков, инфографики по «темам», годам и т. Д. Я перепробовал много программ для этого - классическая версия lightroom и версия CC, кото...
Документы Google при использовании OCR на изображении преобразуют документ в текст. Однако текст - это разные цвета на спектре. Кто-нибудь знает, почему разные цвета создаются для...
Даже после того, как я удалю скрытый текст (через «Удалить скрытый»), я все еще не могу запустить OCR с «ClearScan» (то есть «Редактируемый текст и изображения»). Это странно, пото...
Мне интересно, есть ли способ разделить отсканированную копию страницы (то есть изображение) на изображения составляющих ее слов. Сканируемая книга написана на индийском языке, для...
Ответ: Решением вашей проблемы является использование функции ImageSearch. Если вы нажмете кнопку экрана печати всякий раз, когда появляются эти всплывающие окна, вы можете затем CRTL + V...
Когда я вставляю pdf-файл в Word, он выглядит как изображение еще после того, как OCR обработал документ. Если я иду в строку инструментов и использую «Вставить»> Объект> Тек...
У меня есть mp4 с жестко закодированными субтитрами, и я хочу сделать файл SRT. Я попытался использовать программное обеспечение для распознавания видео AviSub. Время было правильн...
Ответ: Это (вопреки некоторым другим ответам здесь), скорее всего, никак не связано с Acrobat. Большинство (все ?!) профессиональных сканеров документов и большинство полупрофессиональных...
Ответ: Самый простой способ сделать это (не смотря на сложность документа) - использовать программное обеспечение DTP для размещения изображения, блокировки изображения, а затем добавить...
Ответ: Справочная статья Adobe Сканирование бумажного документа в PDF, раздел «Распознать текст - диалоговое окно« Общие параметры »» определяет режимы сканирования следующим образом: Пои...
* Обратите внимание, что я использую компьютер для всего этого. Я пытаюсь извлечь текст из снимка экрана, сделанного на моем компьютере, и когда я попробовал методы, предложенные в...
Извлечение текста из изображений? У меня много изображений, я искал и нашел несколько онлайн-конвертеров, но он не работает, потому что у меня есть 10.000 изображений, поэтому мне...
У меня есть документ со многими страницами, которые имеют столбчатые таблицы, подобные следующим. #1 2.1 This is some text. It can go onto the next line like this. #2 1.3 More text...
Ответ: Adobe Acrobat - это самый простой способ, но не обязательно самая дешевая программа. На Mac PDFPen - это одна из альтернатив, которая может редактировать PDF-файлы и распознавать и...
Я имею дело с загадкой. У меня есть этот файл PDF, который я аннотировал и выделил. Думая, что смогу позже скопировать и вставить абзацы. Это оказалось неправильно, копирование тек...
Мне удалось встроить приложение OCR для обнаружения текста по фотографии https://obserbot.com/, но оно только извлекает точный текст из фотографии и не конвертирует его на нескольк...
Существуют ли какие-либо инструменты для извлечения данных из файлов PDF с использованием этого метода. Допустим, у меня есть 3 категории Изображение - это будет прямоугольная анно...
Ответ: В этом посте приведен пример сценария для чтения множества отдельных страниц и создания многостраничного PDF. Cuneiform сама по себе не создает многостраничных документов. Как извл...
Ответ: А Google показывает несколько решений. Большинство из них нацелены на то, чтобы бухгалтеры обрабатывали отчеты для большого количества клиентов и, следовательно, взимают с нас плат...
Ответ: Если вам просто необходимы факсимильные аппараты и вас не волнует идеальная презентация, рассмотрите камеру, прикрепленную к вертикальной копировальной стойке . Гарантированно не з...
Ответ: Другое хорошее и бесплатное решение (веб-сервис) - https://ocr.space/ - оно хорошо работает с текстом на фоне, например с субтитрами к фильмам. Google предлагает лучшее распознаван...
Ответ: Поскольку вы написали, что выбрали «текст поверх изображения страницы», у вас все равно должны быть оригинальные отсканированные изображения в ваших файлах PDF. Чтобы вернуть его:...
Ответ: Абсолютно законный вопрос. Основной обходной путь - открытие отсканированного документа в редакторе изображений (Photoshop, the GIMP и т. Д.) И увеличение разрешения. Это НЕ привед...
Ответ: Да, это произвольное ограничение, и оно не будет исправлено в Acrobat XI (больше). Рекомендуется экспортировать страницу в формате TIFF и загрузить ее в Acrobat. Теперь все изображ...
Ответ: Неужели нет способа заставить Ghostscript решить эту проблему (с добавлением пробелов между символами)? Кен Шарп говорит то, с чем вы, похоже, сталкиваетесь, является ограничением...
У меня есть отсканированный многостраничный PDF-файл с разрешением 300 точек на дюйм в системе Ubuntu 16.04. Когда я запускаю следующую команду: pdfocr -t -l swe -i *.pdf -o newfil...
Есть ли какой-нибудь способ быстро переписать большой объем текста странным шрифтом (например, что-то вроде BulletMix: https://www.fontstock.net/4041/bulletmix.html )? У меня есть...
Ответ: Включить распознавание текста в Greenshot Как я могу использовать Greenshot для распознавания текста? Чтобы плагин Greenshot OCR (Optical Character Recognition) работал, мы зависим...
Я экспериментировал с использованием Tesseract для распознавания моих PDF-файлов, и он был в основном успешным, особенно с текстами немецкого языка Fraktur (готический шрифт старог...
Ctrl+K или / — быстрый поиск Начните вводить запрос для поиска по сайту