Ошибка в обучении Тессеракта с jTessBoxEditor
Я объединил около 50 изображений в один файл .tif с помощью jTessBoxEditor (Linux), но когда я пытаюсь получить файл .box с этим кодом: tesseract mjchar.tif mjchar -l eng --psm 10...
Подборка 31 вопрос с тегом «tesseract-ocr» на WikiRoot: ответы IT-специалистов по Windows, Linux, Excel, сетям и программированию.
31 вопрос
Я объединил около 50 изображений в один файл .tif с помощью jTessBoxEditor (Linux), но когда я пытаюсь получить файл .box с этим кодом: tesseract mjchar.tif mjchar -l eng --psm 10...
Я работаю над использованием Tesseract для обнаружения некоторых старых древних скриптов. Тессеракт как инструмент показывает только один ответ (вывод) для любого изображения, а ин...
Ответ: Вам необходимо установить Tesseract в соответствии с инструкциями в вики: https://github.com/tesseract-ocr/tesseract/wiki
Я использую Tesseract v4.0.0-beta.1-108-gf291 Изображение 5.jpg не читается (одно слово: символы хорошего размера) tesseract 5.jpg out.txt Я перепробовал все виды параметров --psm...
Есть ли способ конвертировать субтитры dvdsub (на основе изображений) в srt? например с mencoder или ffmpeg в сочетании с тессерактом? Я ищу что-то на основе командной строки, и я...
Мне удалось встроить приложение OCR для обнаружения текста по фотографии https://obserbot.com/, но оно только извлекает точный текст из фотографии и не конвертирует его на нескольк...
Я использую tesseract для обнаружения текста на различных типах изображений, в том числе на снимках экрана, его спутывают волнистые красные и синие подчеркивания для орфографически...
Ответ: Ваш лучший выбор - обучить его тому шрифту, который вы используете. Я не хочу притворяться, что это легкий процесс, это не так, но он должен работать лучше. Кроме того, большинство...
У меня есть отсканированный многостраничный PDF-файл с разрешением 300 точек на дюйм в системе Ubuntu 16.04. Когда я запускаю следующую команду: pdfocr -t -l swe -i *.pdf -o newfil...
Я экспериментировал с использованием Tesseract для распознавания моих PDF-файлов, и он был в основном успешным, особенно с текстами немецкого языка Fraktur (готический шрифт старог...
Ответ: Is there any option to extract Unicode script? When I try it for Unicode like Hindi, Marathi, or Devanagari Script it produces the wrong output. It appears that only Hindi is suppo...
Ответ: Изображения слишком малы для правильной работы. Я взял ваши изображения и просто масштабировал их до высоты 50 пикселей (постоянное разрешение) и побежал tesseract input output -ps...
Ответ: You will need to update the page number (6th column) in each box file and then concatenate the files into one. The page number is zero-based and needs to match the order of the ind...
Поэтому я пытаюсь распознать это изображение: (на самом деле это имена пользователей) используя эту команду в командной строке Windows: tesseract screenshot.png out Однако out.txt...
Ответ: Thanks to Remy F, I could write this solution, with the help of this LaTeX file, which import output.pdf, and rotate it: \documentclass \usepackage[paperwidth=6.38in,paperheight=10...
Точность распознавания символов в моем приложении tess4j OCR очень низкая. Я слышал, что отключение словаря в tess4j повысит точность, позволяя распознавать отдельные символы. Но я...
Ответ: Преобразование в TIFF Вы можете конвертировать JPEG в TIFF: ffmpeg -i input.jpeg -pix_fmt rgba output.tiff Или из видео: ffmpeg -i input.mp4 -pix_fmt rgba out%05d.tiff Важно указат...
Ответ: Установите teseract, используя пакеты sudo apt install tesseract-ocr Сначала проверьте, установлен ли пакет dpkg -l | grep tesseract Поиск / установка доступных связанных пакетов a...
Запуск tesseract makeboxкоманды выдал мне следующую ошибку Error opening data file /opt/local/share/tessdata/eng.traineddata Please make sure the TESSDATA_PREFIX environment variab...
Ответ: Я предполагаю, что вы читаете пост Михаэля Лисснера, чтобы добавить собственный шрифт в Tesseract. Я попробовал то же самое ( convertкоманду) и получил сломанный TIFF, который нель...
Ответ: As mentioned by others you can use 3.02's english language packs for 3.03. Below are the instructions: Download and unzip from here : 1 Install pre-requisites and unzip `sudo apt-f...
Ответ: Yes, you can disable the dictionaries by defining a configuration file containing: load_system_dawg F load_freq_dawg F and specify it with the command.
Ответ: <?php /** * Cli process that gets as 1st argument the output of tesseract ... hocr and dumps * its text nodes * Usage: script.php in.tif.html out.txt */ $inFile = $argv[1]; $out...
Ответ: Please refer Issue 35 of Leptotica: http://code.google.com/p/leptonica/issues/detail?id=35 pixRead for gif have a potential problem related to closing file stream (fclose) that dep...
Ответ: Вы можете использовать следующую ссылку, чтобы узнать больше о том, как тренировать тессеракт. Для исправления файлов ящиков вы можете использовать jTessBoxEditor . Не забывайте, ч...
Ответ: try the psm option. -psm N Set Tesseract to only run a subset of layout analysis and assume a certain form of image. The options for N are: 0 = Orientation and script detection (OS...
Даже при том, что я сделал, convert canvas.png -depth 8 canvas.tifя все еще вижу это сообщение об ошибках: Tesseract Open Source OCR Engine check_legal_image_size:Error:Only 1,2,4,...
Ответ: It appears to be a gtk related problem. Updating gtk to current version should help, but I haven't tried that yet.
Ответ: Установите macports: см. Http://www.macports.org/ для загрузки и инструкции по установке. Обновите дерево портов: sudo port selfupdate Установите тессеракт: sudo port install tesse...
Ответ: Один из способов удалить результаты - это предварительно обработать их, например удалить любые перекосы и пороговые значения. Вы можете использовать открытое резюме. Позже вы может...
Ctrl+K или / — быстрый поиск Начните вводить запрос для поиска по сайту