Вы здесьПроблемы и приемы OCR: dewarp
Опубликовано ср, 06/05/2009 - 04:06 пользователем Ulenspiegel
Если при сканировании книжка не прижата плотно к предметному стеклу, участки строк, находящиеся вблизи разворота, искривляются. При сильном искривлении (заползание на уровень соседней строки) программы распознавания приходят от таких червячков в недоумение. Не знает ли всемогущий All алгоритмов и (что еще лучше) готовых программ для борьбы с таким безобразием ?
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
NickNem RE:Подайте бедному копеечку на книжку с литреса... 1 день
larin RE:Пропал абонемент 4 дня Larisa_F RE:Серия "Новые сказочные повести" издательство "Самовар" ... 2 недели sem14 RE:Серия "Символы времени" издательства "Аграф" 2 недели Larisa_F RE:Серия книг «Судьбы книг» издательства «Книга» 3 недели tvv RE:faq brainstorm =) 3 недели Larisa_F RE:Серия "Что есть что" издательства "Слово"(чего не хватает) 3 недели Larisa_F RE:Серия "Очень прикольная книга", издательство Азбука-классика 3 недели larin RE:абонемент не обновлен 1 месяц sem14 RE:За иллюминатором (серия) - чего не хватает? 1 месяц sem14 RE:Собираем серию: "Мастер серия", издательство "Лимбус". 1 месяц Larisa_F RE:Книжная серия «Сlio» издательства "Евразия" 1 месяц tvv RE:DNS 1 месяц MrMansur RE:<НРЗБ> 1 месяц Stager RE:Беженцы с Флибусты 1 месяц Tramell RE:Серия "Библиотека французской литературы" (Макбел) 1 месяц sem14 RE:Книжная серия "Жизнь в искусстве" издательство "Искусство"... 1 месяц sem14 RE:Современная корейская литература. Книжная серия... 1 месяц Впечатления о книгах
udrees про Атаманов: Обрести тело [СИ] (ЛитРПГ, Самиздат, сетевая литература)
15 02 Хорошее достойное завершение серии про гоблина Амру. Органично вплелись реальная и виртуальная жизни в сюжете. Хорошее описание событий в игровом мире. Несколько удивительный поворот в сюжете в реальном мире по поводу заточения ……… Оценка: хорошо
udrees про Бойн: Аларих, король вестготов: Падение Рима глазами варвара [litres] (Исторические приключения, Публицистика)
15 02 Какая-то странная книга, где Аларих выступает в роли предмета интерьера в комнате что ли. Большая часть книги, да вообще вся книга, это просто описание жизни в Римской империи перед ее падением. Описываются множество персонажей ……… Оценка: плохо
udrees про Атаманов: Стратег из ниоткуда. Книга 2 (Героическая фантастика, Фэнтези, Попаданцы, Самиздат, сетевая литература)
15 02 Хорошо написано продолжение приключений попаданца в племя орков. Можно сказать история возвышения героя, который и вправду «стратег», занимающийся строительством своей империи. Сюда входит не только военное дело, но и множество ……… Оценка: отлично!
Олег Макаров. про Хонихоев: Тренировочный День 13 (Альтернативная история, Юмор: прочее, Самиздат, сетевая литература)
14 02 Немного авторов, которых я бы столько книг в серии выдержал читать. Не могу даже сказать, чем этот подкупает. Но с удовольствием уже тринадцатый раз Оценка: отлично!
бушмен про Аzнеп: Вагнер. Дорога на Бахмут. 300! 30! 3! (О войне)
14 02 Тяжёлая смертельно-опасная работа. Причём, самим бойцы деньги в моменте и не нужны (но семья, медицинская помощь в случае увечья требуют денег) Оценка: отлично!
Barbud про Емельянов: Бастард Александра (Альтернативная история, Исторические приключения, Попаданцы, Самиздат, сетевая литература)
13 02 Вполне читабельно. Местами, правда, несколько затянуто и изрядно сдобрено размышлизмами в ущерб "экшену", но в целом неплохо. Немного позабавило нежелание ГГ браться за внедрение огнестрела на том основании, что порох, будучи ……… Оценка: хорошо
Олег Макаров. про Кириллов: Вернуться (Альтернативная история, Попаданцы, Самиздат, сетевая литература)
12 02 Диван, на котором он лежал, стоял в углу, впритык к стенке торцом и одной из сторон, прямо рядом с закрытой дверью. Прямо напротив него рядом с окном стоял письменный стол. У противоположной стены стояла большая мебельная ……… Оценка: нечитаемо
su24i про Кулаков: Цивилизатор в СССР 1978 (Альтернативная история, Попаданцы, Самиздат, сетевая литература)
12 02 Э-э-э... я думаю Дунька Кулакова сестра автора.... Оценка: нечитаемо
Oleg68 про Сергей Дмитриевич Ауслендер
11 02 Отлично. Настольная книга для тех, кто опустил руки и не борется. Автору уважение.
austvalya про Емец: Таня Гроттер и посох Волхвов (Детская фантастика)
11 02 Жалко Таню. А Лизу жалеть не хочу, она завистлива и эгоистична. Да и преподаватели в этой книге показали себя не с лучшей стороны. Оценка: хорошо.
Sello про Голдсуорти: Во имя Рима: Люди, которые создали империю [In the Name of Rome: The Men Who Won the Roman Empire ru] (История)
11 02 Интереснейшая книга. Правда, стоит свою память держать все время в "боеготовности": в лабиринте дат, имен (второстепенных), которые у разных персонажей порой абсолютно одинаковые, названий населенных пунктов запутаться несложно. Оценка: отлично!
decim про Аллингем: Сладкая опасность (Классический детектив)
11 02 Качество перевода, увы, никакое. Более приличный перевод см. "Сладость риска", изд. "Азбука", 2025. |
Комментарии
Отв: Проблемы и приемы OCR: dewarp
Насчет алгоритмов не знаю (хотя Файнридер вроде что то делает) но как вариант решения за $500 смотри тут: http://lib.rus.ec/node/131676
Отв: Проблемы и приемы OCR: dewarp
Э нет, кривой скан в данном случае - уже данность :( В смысле - готовый DJVU
Отв: Проблемы и приемы OCR: dewarp
В FineReader 8, которым я пользуюсь, в настройках "1. Сканировать/открыть" есть опция "Устранить искажение строк". Очень даже помогает.
В 9-й версии наверняка тоже есть.
Отв: Проблемы и приемы OCR: dewarp
Есть , "streighten lines" и "desкew" - кто из них кто уже не помню за ненадобностью.
можно на страницу провести операцию а можно применить ко всем , но я бы советовал постранично ибо некоторые страницы наоборот как раз портит.
Отв: Проблемы и приемы OCR: dewarp
Да вы чего, издеваетесь, панове ?! deskew - есть, это исправление перекоса (когда книжку положили непараллельно границам окна),
Отв: Проблемы и приемы OCR: dewarp
deskew - это совсем из другой оперы.
Возьмите ложку. Положите ее на стол под уголм 45градусов к краю. Исправьте положение ложки. А теперь СОГНИТЕ ложку поплам и попрубуйте исправить перекос относительно края тем же способом
Отв: Проблемы и приемы OCR: dewarp
В моем случае ложка выглядит примерно так: Я думал, что это именно warp
Отв: Проблемы и приемы OCR: dewarp
Я не издеваюсь , я же сказал что не помню, значит не deskew а второй - staighten text lines:
Отв: Проблемы и приемы OCR: dewarp
Теоретически в 8 и 9 Файнридерах имеется встроенный механизм коррекции:
На практике, выработанной на 4м ещё файнридере, лучшим удалителем искажений в зоне разворота служит левая рука, прижимающая книгу к сканеру в момент сканирования... :)
...Каких либо отдельных программ, позволяющих выпрямлять строки я никогда не встречал. Теоретически это можно проделать в фотошопе, но... страницу, пусть две. А сотню? Сомневаюсь.
Отв: Проблемы и приемы OCR: dewarp
АААА!!!! Спасибо, Jolly Roger - ака, и вправду есть! Они его спрятали неочевидным образом.
Если кто-нибудь еще на эти грабли наступит, тулза работает и выглядит вот так:
Отв: Проблемы и приемы OCR: dewarp
Дык а я о чем ?
Отв: Проблемы и приемы OCR: dewarp
Виноват, подумал, что она в опциях сканирования сидит.
Отв: Проблемы и приемы OCR: dewarp
Вроде бы именно такие искривления исправляет Book Restorer. Подробности на ru-board.
Отв: Спасибо!
Век живи - век учись... Действительно, есть и отдельная программа под задачу:
http://djvu-soft.narod.ru/scan/curved_text.htm
...как я понимаю, у неё настроек побогаче будет. Видимо, для сложных случаев может оказаться предпочтительней.
Отв: Проблемы и приемы OCR: dewarp
На сорсфорже была утилитка unpaper - она, кажется, умела автоматически делать обработку сканированных страниц, выравнивая картинки, зачищая поля и выравнивая интенсивность фона. Заодно резала на страницы, если сканировался разворот.
Отв: Проблемы и приемы OCR: dewarp
http://unpaper.berlios.de
А строки, AFAIK, не ровняет.
Но вобщем ничего, пользуюсь периодически.
Отв: Проблемы и приемы OCR: dewarp
Если нужно подготовить скан для создания дежавю, то лучше выпрямить строки программой BookRestorer. Там же можно сделать все остальное (чистка, обрезка и т. д.)
Отв: Проблемы и приемы OCR: dewarp
Покажите, плз, мне нормально выпрямленные букресторером строки
Я пробовал это делалать, у меня не получилось. У моих знакомых по ру-боарду тоже.
Отв: Проблемы и приемы OCR: dewarp
Показать в буквальном смысле не могу, т. к. не сохраняю исходники во-первых, и не помню какие именно строки были выпрямленыв во-вторых. Но этой функцией пользовался не раз и не два. Настройки дефолтные. Правда, изгиб касался максимум 3-4 строк внизу страницы. Обычно все же стараюсь прижимать книгу к сканеру :) Совсем уж бракованный скан проще переснять, чем маяться с ним.