Вы здесьТипичные ошибки распознавания - собираем статистику для скрипта ФБЕ
Опубликовано чт, 06/01/2011 - 11:12 пользователем TaKir
Собираю статистику по наиболее частым типичным ошибкам распознавания для включения их в скрипт ФБЕ: Варианты: Прошу участвовать всех желающих. Дополненный список я хочу включить в недавно обновленный скрипт "Поиск по набору регэкспов", автор Sclex (http://groups.google.com/group/fiction-book-editor/browse_thread/thread/b4700ee54d255384), работающий под ФБЕ. Сейчас данный скрипт у меня ищет: Использование этого скрипта заметно сокращает время работы над книгой в ФБЕ.
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
sem14 RE:Книжная серия "Жизнь в искусстве" издательство "Искусство"... 5 дней
Larisa_F RE:Дэвид Герберт Лоуренс собрание в 7 томах том 3 6 дней нэнси RE:Подайте бедному копеечку на книжку с литреса... 1 неделя sem14 RE:Собираем серию: "Мастер серия", издательство "Лимбус". 1 неделя Dead_Space RE:Прошу переформатировать, распознать, etc... 1 неделя sibkron RE:«Словенский глагол» 2 недели Tramell RE:Литературная премия имени И.А. Ефремова 2 недели sem14 RE:Серия "Что есть что" издательства "Слово"(чего не хватает) 3 недели larin RE:Оплатил, но абонемент не отображается 3 недели Larisa_F RE:Беляевская премия 1 месяц epoost RE:Чарльз Брокден Браун - Wieland 1 месяц nehug@cheaphub.net RE:Ответственность. 1 месяц nehug@cheaphub.net RE:Доступ 1 месяц Larisa_F RE:Принцесса-бродяжка 1 месяц Larisa_F RE:Серия "Очень прикольная книга", издательство Азбука-классика 1 месяц Tramell RE:Серия "Символы времени" издательства "Аграф" 1 месяц Tramell RE:Серия книг «Судьбы книг» издательства «Книга» 1 месяц Tramell RE:Современная корейская литература. Книжная серия... 1 месяц Впечатления о книгах
Sello про Даллес: Тайная капитуляция (Биографии и Мемуары, Документальная литература)
05 09 История подписания акта капитуляции немцами в Италии, завершившего войну здесь на неделю раньше общей капитуляции. В центре рассказа - знаменитый Карл Вольф, который у Даллеса выглядит вполне симпатично - и, в подтверждение ……… Оценка: хорошо
mysevra про Алатова: Неисправная Анна Том 1 [publisher: SelfPub] (Стимпанк, Самиздат, сетевая литература)
05 09 Ого, решила полистать со скуки, а затянуло, ишь ты. Превосходно. Да, возможно, у героини всё слишком складно налаживается (ну, хоть у кого-то) и всем есть до неё дело, и все ей благоволят - так у меня сейчас самое для подходящее ……… Оценка: отлично!
Олег Макаров. про Яманов: Бесноватый цесаревич. Книга 1 [litres] (Альтернативная история, Попаданцы)
05 09 Англичане вместе с евреями замышляют против России... Вообще антисемитизм такого уровня, какого я, кажется у авторов вообще не встречал. В третьем рейхе Яманов, наверное сошел бы за своего на раз. Вообще, печально, конечно. Пишет-то неплохо.
Stager про Игнатова: Бастард фон Нарбэ (Космическая фантастика)
03 09 Всё же, мировоззрение верующих - оно... странное. Интересно, почему это не считается психическим отклонением? Оценка: неплохо
Barbud про Гончарова: Графиня Суровая (Альтернативная история, Попаданцы)
02 09 Дерьмище редкостное. Первые мысли после попадания - как бы разбогатеть? Чтобы разбогатеть, надо кого-то ограбить. Грабить - так уж и убивать до кучи. Не свои - не жалко. Все это приправлено смердящим шовинизмом, расхожими ……… Оценка: нечитаемо
lwowianin про Гончарова: Истинный облик [litres] (Героическая фантастика, Попаданцы, Юмористическое фэнтези)
31 08 Страшное дело - пропаганда. Хороший автор, талантливые книги, прекрасный язык - но сразу видно, что живёт она в России. Если иностранец - строит козни против Родины, если, не дай бог, гей или лесбиянка - всё, или дураки, или ………
Dead_Space про Гуха: Незалеченные раны. Как травмированные люди становятся теми, кто причиняет боль (Психология, Самосовершенствование)
30 08 ."Отношенческие травмы специфичны для людей. Ни одно другое живое существо не причиняет вред своим сородичам намеренно, разве что при охоте или в период спаривания." При таком уровне экспертизы, проявленном вначале, дальше можно не читать. Оценка: нечитаемо
RamirezElDemoni про Ра   : Задолбанец (Героическая фантастика, Фэнтези, Самиздат, сетевая литература)
30 08 Эксперимент не удался. Вернуть главгера домой в процессе - так себе концовка. Оценка: плохо
Barbud про Тамбовский: Кто остался на трубе [СИ] (Альтернативная история, Социальная фантастика, Попаданцы, Самиздат, сетевая литература)
30 08 Глупость какая-то. Советские школьники в США оставлены почти без присмотра, они там воюют с мафией, охаивают комсомол в разговорах с американцами, живут отдельно в одном доме мальчик с девочкой безо всякого контроля. Не верю. Оценка: нечитаемо
decim про Лукьяненко: Новая фантастика 2026. Антология №10 [сборник litres] (Социальная фантастика, Научная фантастика)
30 08 Легально и бесплатно в количествах на любом самиздатовском сайте. Изводить лес ради тщеславия дебютантов("меня издали на бумаге!") - ну такое. Оценка: плохо
xZiminxx про Мазин: Князь плесковский [АТ] (Альтернативная история, Боевая фантастика, Исторические приключения, Самиздат, сетевая литература)
27 08 На Мазина непохоже вообще . Непонятно кто написал. Оценка: плохо
mysevra про Майер: Eclipse [en] (Любовная фантастика)
27 08 Не понимаю, почему так романтизируют эту историю. Это же так практично: лучше выбрать бессмертное существо, которое обеспечит тебе и здоровье, и богатство, и красоту, чем ютиться с полуживотным в индейской резервации, работая ……… Оценка: плохо |
Комментарии
Отв: Типичные ошибки распознавания - собираем статистику ...
Возможно, это никакая не проблема. Попробуйте ткнуть мышкой где-нибудь в начале текста (т.е. «установить фокус ввода» внутри документа) и запустите скрипт. Я уже попадался и тоже спрашивал.
Отв: Типичные ошибки распознавания - собираем статистику ...
А какой сейчас последний регэсп? По ссылке http://groups.google.com/group/fiction-book-editor/browse_thread/thread/b4700ee54d255384 версия 2.6 но она стерта.
Отв: Типичные ошибки распознавания - собираем статистику ...
Из группы ФБЕ
http://groups.google.com/group/fiction-book-editor/browse_thread/thread/363ae2a696beefca
Александр Клюквин пишет
В процессе работы со словарем внезапно (с) выяснилось, что с кодировкой
словаря KOI8-R пора завязывать. Мне понадобилось выделить кое-какие
приставки. Нужны были однобайтовые символы в большом количестве, приставок
не просто много, их до хрена. А эти символы просто закончились, KOI8-R не
понимает половины использованных мной обозначений.
Благодаря исключительно терпеливой поддержке Сенса, я внес в программу
необходимые изменения (одна строка в описании, не более), скомпилировал и
построил инсталляшку. В результате в этой версии словарь для FBE
присутствует в кодировке UTF-8. В данной сборке включен словарь на сегодня,
27 ноября 2011 года. В нем грандиозные изменения, о них подробно я напишу в
ветке о словаре 1 декабря.
Прошу скачивать, пробовать, писать о неполадках. Одно "но" - вряд ли я
смогу их поправить. Повторюсь, изменение одно: была кодировка KOI8-R, стала
UTF-8, в остальном все должно быть так же, как и прежде. Проверьте словарь.
То есть можно скачать новую FictionBook Editor Release v2.6 (build 27 Nov).exe отсюда: http://code.google.com/p/fictionbookeditor/downloads/list
Изменения в словаре в новой версии:
Отв: Типичные ошибки распознавания - собираем статистику ...
Вчера столкнулся с замечательным пёрлом от OCR.
Улыбнуло.
Отв: Типичные ошибки распознавания - собираем статистику ...
Путаница "п", "л", "д" - это врожденное у FR.
Аналогично часто путает "е" и "с", "к" и "н".
Амперсант "&" часто вставляется как amp;
Потому приводить все примеры смысла нет.
У меня чаще всего"Юнкерс" и "Абрамс" - распознаются как "Юнкере" и "Абраме" , "Pratt & Whitney" как "Pratt amp;Whitney".
Еще частая ошибка в распознавании вместо "Л" - "JI". Обычно в абревиатурах и инициалах, например: "М.Л. Миль" и "Ле Бурже" распознается как "М.JI. Миль" и "JIе Бурже"
Отв: Типичные ошибки распознавания - собираем статистику ...
Добавила в скрипт поиска по регэкспам две строки (стали часто попадаться в последнее время):
tagRegExp("(?<![а-яё])ноя(?![а-яё])","i","Найдено: слово "ноя" ("но я" с опечаткой).","",1);tagRegExp("(?<![а-яё])ия(?![а-яё])","i","Найдено: слово "ия" ("и я" с опечаткой).","",1);
Отв: Типичные ошибки распознавания - собираем статистику ...
Вычитываю книгу "Последнее дело Трента", сверяюсь с книгой,вот что попалось интересного в 3-х главах..)
"мистер Копплс позволил себе несколько минут насладиться ландшафтом, включающим в себя... - в книге включавшим
У нее необычно твердый характер - необычайно
"У мистера Копплса был извиняющий тон" - извиняющийся
Мило.)
Отв: Типичные ошибки распознавания - собираем статистику ...
Не в тему.
Это - ошибки(?) переводчика или редактора, или разница в бумажных изданиях, или ошибки первого верстальщика, но никак не ошибки автоматического распознавания текста и исправления этих ошибок средствами FBE.
Отв: Типичные ошибки распознавания - собираем статистику ...
Переводчика? Смешно,текст абсолютно идентичен.Или Вы думаете он два раза переводил?) Что такие огрехи при перепечатке книг,ну не знаю... В любом случае у меня первое издание журнала "Север" 1990 года, всё-таки может быть стоит на него ориентироваться? Темой я не ошиблась, я считаю,что это Файнридер подменяет слова.
Отв: Типичные ошибки распознавания - собираем статистику ...
Первая еще так-сяк может сойти, остальные вряд ли. Больше на редакторские правки похоже. С какого издания делали уже не узнать.
Отв: Типичные ошибки распознавания - собираем статистику ...
С последней,так по тексту нет сомнений,человек оправдывается,конечно "извиняющийся". Я что-то засомневалась,считаете ли Вы,что такие ошибки нужно исправлять? Какая-то странная реакция. И если их нужно исправлять, сразу спрошу,могу ли я поменять обложку книги?
Отв: Типичные ошибки распознавания - собираем статистику ...
(почесав репу) Наверное да. Раз незнамо с чего делалось, то и обложка от балды прицеплена. А так всё законно будет. Тогда в publish-info надо будет Ваш журнал вписать. Но это по-моему, кто-то может и не согласиться.
Отв: Типичные ошибки распознавания - собираем статистику ...
Это не ошибки FR, Есть небольшие отличия журнального варианта 1974 года и прибалтийского издания 1992 года.
Отв: Типичные ошибки распознавания - собираем статистику ...
Вы меня удивили и запутали,ладно,бросаю вычитку.
Отв: Типичные ошибки распознавания - собираем статистику ...
Зачем же бросать, в петрозаводском издании 90-го года все как в журнале, поэтому правильным будет считать журнал эталоном...
Отв: Типичные ошибки распознавания - собираем статистику ...
Да ладно. :)) Мелочи это всё. А дело нужное. Как сделаете, так и будет.
Отв: Типичные ошибки распознавания - собираем статистику ...
Ок. Если вычитаю до конца *угрожающе*),обложку поменяю.
Отв: Типичные ошибки распознавания - собираем статистику ...
Как в скрипт поиска по регэкспам добавить латинское on (часто распознается вместо он), но так чтобы поиск работал в русскоязычном тексте и не искал это словосочетание в латинице?
Отв: Типичные ошибки распознавания - собираем статистику ...
tagRegExp("(?<![а-яё]) no (?![а-яё])","i","Найдено: слово "no" (вместо "он").","i",1);Поскольку слово, скорее всего, будет внутри предложения, можно "i" из кавычек убрать, останется только:
tagRegExp("(?<![а-яё]) no (?![а-яё])","i","Найдено: слово "no" (вместо "он").","",1);Отв: Типичные ошибки распознавания - собираем статистику ...
Голма, я бестолково сформулировала вопрос. На свежую голову: Как сделать, чтобы искало слово on полностью? Если я вставляю строку, по аналогии с той, что Вы приводите в примере, то ищется и часть слова, к примеру le non-finito.
Заодно вопрос. Файнридер временами гонит халтуру, я не имею ввиду распознавание. Мне надо заменить часто встречаемое ошибочно написанное слово. Делаю замену дважды:направление - вперед и назад. Как показывает практика, замена не всегда срабатывает. Поэтому повторно проделываю поиск с заменой в FBE.Там пока такой проблемы не возникало. Как бороться с ФР11, чтобы замена происходила полностью? А то мне приходится вести словарик слов, которые я заменяла в ФР11, чтобы перепроверить их наличие в FBE.
Отв: Типичные ошибки распознавания - собираем статистику ...
Во-первых, я сделала ошибку: должно быть on, а не no. Во-вторых, Вы правы, ищет не так, как хочется.
Пробуйте так:
addRegExp("[а-я] \on\ [а-я]","","Найдено: on латиницей");Насчёт замены в ФР. Проверьте, чтобы при массовой замене ("заменить все") курсор не стоял внутри нужного слова. Должен быть или до или после него.
Отв: Типичные ошибки распознавания - собираем статистику ...
Спасибо, получилось. Кстати, no - тоже встречается, вместо русского по.
С ФР,чтобы он сделал полную замену нужных слов, я только разве ж не вприсядку танцую. Не помогает. Может зависит от размера текста? С большими объемами ФР не справляется, С Залёй, например ((( Тем более это издание начала 60-х годов. Ошибок распознавания ужас сколько.
Отв: Типичные ошибки распознавания - собираем статистику ...
Продублируйте строку и вставьте no вместо on. Тогда будет искать оба варианта.
Насчёт ФР ничего не могу подсказать, я с такой проблемой не сталкивалась. Все замены происходят штатно.
Единственный момент, который ещё приходит в голову, - это переносы. То есть, если "варан" заменять на "баран", то "ва-ран" не заменится.
А издания 50-60-хх годов - это кошмар OCR-щика. Ужасные шрифты, плохое качество печати. Очень знакомо. Сочувствую.
Отв: Типичные ошибки распознавания - собираем статистику ...
Проверила Ваше предположение. Это действительно так. Слово с переносом - не заменяется. Так что, чем больше объем книги, тем больше вероятность, что 100% замены ошибочного слова может не случиться. Поэтому эту операции буду делать только в FBE.
ЗЫ: проверку осуществляла со словом г-на Виарга. ФН заменил его на привычное Виагра.
Отв: Типичные ошибки распознавания - собираем статистику ...
Если Вы убираете в ФР дефисы, заменяя их на мягкие переносы (по методу ТаКира), то можно делать массовую замену после этого. С другой стороны, всё равно пришлось бы вести список замененных слов, можно тогда сразу и в ФБЕ делать.
По поводу списка: ФР хранит в маске поиска/замены последние 20 слов. Если замен было меньше, список слов можно брать оттуда.
И ещё. В ФБЕ служба "Слова" покажет Вам все те слова, в которых сохранился ненужный дефис. Обзор довольно наглядный.
Другими словами: попробуйте разные способы и выберите тот, который Вам наиболее по душе.
Отв: Типичные ошибки распознавания - собираем статистику ...
Спасибо за советы. Буду на Золе тренироваться.Но мне кажется, в FBE меньше телодвижений придётся делать.
Отв: Типичные ошибки распознавания - собираем статистику ...
При направлении "вперед" - замена срабатывает. При направлении "назад" - не срабатывает, замены не происходит. Вот такая закономерность. У меня, во всяком случае. Во избежание всегда выхожу в начало текста. А вот свежий вопрос - со вчера после очередного обновления Аваста он (Аваст) при попытке запустить Файнридер удаляет экзешник - типа вирус и типа в карантин. Хелп!!! Сижу с отключенным антивирусом, неуютненько как-то. Вариант "игнорировать" или "исключение"не проходит.
Отв: Типичные ошибки распознавания - собираем статистику ...
Это глюк. Так не должно быть.
Насчёт exe-файла: посмотрите в настройках Аваста, где внести исключения, и впишите туда папку ФР.
Отв: Типичные ошибки распознавания - собираем статистику ...
В "исключения" вписала первым делом. Увы, не помогло. Папку-то он не трогает, только экзешник из нее утаскивает.
Отв: Типичные ошибки распознавания - собираем статистику ...
Хммм... Вообще-то, если папка в исключениях, он её совсем не должен проверять.
Может, не так вписана? Обычно прописывается путь к папке. Но я не знаю, как это выглядит в Авасте.
Отв: Типичные ошибки распознавания - собираем статистику ...
Путь прописан стандартно
Выглядит как-то так
Отв: Типичные ошибки распознавания - собираем статистику ...
Тогда не знаю. :(
Единственное, что ещё приходит в голову: на скриншоте длинный путь, содержащий кириллицу.
Я бы попробовала оставить просто ABBYY и убрала бы эту "Новую папку". Знаю программы, чувствительные к такого рода записям. Относится ли к ним Аваст, не в курсе.
Отв: Типичные ошибки распознавания - собираем статистику ...
От жеж.
Мёдом что ли, вам эти противки мажут, что вы никак оторватьсяч от них не можете?
Поставь нормальную реестрозаписываемую версию, сразу от кучи проблем избавишься! Или как вариант, как Антонина, купи лицензионную!
Тема на РуБорде, где можно взять кряк и скачать на максимально быстрой скорости по прямой ссылке прямо с оф.сайта. По-моему, так самый лучший метод: быстро скачиваешь большой файл ФайнРидера с оф.сайта и в это же время скачиваешь масенький такой кряк с файлопомойки. Всё максимально быстро.
А что касается
противокпсевдопортативок, то серут в реестр они побольше, чем реестрозаписываемый FR, кроме того, что очень важно, запускаются из копии папки, и папку TEMP тоже ищут в своей папке. Конкретно эта папка имеет название ...\ThinApp\FineReader\,(точно не помню, но что-то подобное, я один раз даже обалдел, когда узнал ГДЕпротивныйпротативный Файнридер ищет файл для передачи в протативный OpenOffice) а не та папка, в которую вы её "установили".Короче, выброси противку и установи нормальную версию и будет тебе счастье!
Отв: Типичные ошибки распознавания - собираем статистику ...
Распаковала архив ФР непосредственно в корень

с тем же результатом. Утаскивает сразу после разархивации
может потому что пиратский?
Ушла плакать
Отв: Типичные ошибки распознавания - собираем статистику ...
А вот эти две нижние строки - "добавить файл", "пометить файл" - не помогают?
Потом я вижу процесс WinRar, значит, Аваст срабатывает при распаковке. Тогда ещё один совет.
Отключить Аваст, распаковать файл, включить распакованную папку в исключения и пользоваться exe-шником только из этой папки, не распаковывая каждый раз. Лучше даже сделать ярлык на рабочем столе и запускать оттуда.
Вообще-то, это действительно может быть результатом неудачной сборки портабельной версии. Имеет смысл поискать другую.
Отв: Типичные ошибки распознавания - собираем статистику ...
Это на свежеобновлённой базе avast!-a выскакивать стало. Помогает, если в avast!-е в меню "Открыть интерфейс пользователя" и далее в Настройки, затем Глобальные исключения и Обзор добавить путь на папку с ПЧ (он-же FR).
Отв: Типичные ошибки распознавания - собираем статистику ...
После всех танцев с бубном пришлось-таки поставить эту самую реестрозаписываемую версию. Спасибо всем за участие)
Отв: Типичные ошибки распознавания - собираем статистику ...
Не могу найти, хотя где-то уже было (((
Когда в скрипте поиска по регэкспам часто появляется надпись:"сценарий этой страницы замедляет работу Internet Explorer...", что надо сделать чтобы это сообщение не появлялось?
Отв: Типичные ошибки распознавания - собираем статистику ...
Evernet в инструкции Метаграмма-контекст.rtf писала:
...Также в папке находится файл «Отключение окна “сценарий замедляет работу.reg”». Возможно вам приходилось сталкиваться с сообщением, что работа такого-то скрипта замедляет работу системы. Чтобы избавиться от этого надоедливого окошка и нужен этот файл. Запускаем его (ОДНОКРАТНО) и соглашаемся на все.
Подробнее читай: https://groups.google.com/forum/?fromgroups=#!topic/fiction-book-editor/tHAO5U0lU4Q в сообщении от 12-01-11.
Выглядит вообще говоря так (Regedit-ом достаточно поменять один ключ):
Windows Registry Editor Version 5.00
[HKEY_CURRENT_USER\Software\Microsoft\Internet Explorer\Styles]
"MaxScriptStatements"=dword:ffffffff
Удачи!
Отв: Типичные ошибки распознавания - собираем статистику ...
У меня не в программе "метаграммы", а "В поиск ошибок текста" это случилось. Или неважно, алгоритм один и тот же?
Отв: Типичные ошибки распознавания - собираем статистику ...
Да, одно и тоже. Собственно это просчёт Microsoft-а, ими же и залатанный.
RE:Отв: Типичные ошибки распознавания - собираем статистику ...
Тема с обновленным на 06-09-2019 скриптом "Поиск по набору регэкспов": http://lib.rus.ec/node/733790
аналогичная тема на Флибусте http://www.flibusta.is/node/441303
Просьба тестировать новую версию и отписываться в новой теме.
Страницы