Что делать с книгами, в которых нет текстового слоя
Опубликовано чт, 17/12/2009 - 21:38 пользователем Zadd
Forums: Ситуация такая: есть книги в форматах DJVU и PDF, картинок нет, только текст, НО этот текст закодирован в виде картинок
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
sem14 RE:Книжная серия "Жизнь в искусстве" издательство "Искусство"... 3 дня
DGOBLEK RE:Подайте бедному копеечку на книжку с литреса... 1 неделя sibkron RE:"100 славянских романов", серия изд.-ва "Центр книги... 1 неделя larin RE:Пропал абонемент 2 недели Larisa_F RE:Серия "Новые сказочные повести" издательство "Самовар" ... 1 месяц sem14 RE:Серия "Символы времени" издательства "Аграф" 1 месяц Larisa_F RE:Серия книг «Судьбы книг» издательства «Книга» 1 месяц tvv RE:faq brainstorm =) 1 месяц Larisa_F RE:Серия "Что есть что" издательства "Слово"(чего не хватает) 1 месяц Larisa_F RE:Серия "Очень прикольная книга", издательство Азбука-классика 1 месяц larin RE:абонемент не обновлен 1 месяц sem14 RE:За иллюминатором (серия) - чего не хватает? 1 месяц sem14 RE:Собираем серию: "Мастер серия", издательство "Лимбус". 1 месяц Larisa_F RE:Книжная серия «Сlio» издательства "Евразия" 1 месяц tvv RE:DNS 1 месяц MrMansur RE:<НРЗБ> 2 месяца Stager RE:Беженцы с Флибусты 2 месяца Tramell RE:Серия "Библиотека французской литературы" (Макбел) 2 месяца Впечатления о книгах
udrees про Кинг: Техносоциализм. Как неравенство, искусственный интеллект и климатические изменения создают новый миропорядок [litres] (Публицистика)
01 03 В общем-то годная книга, которая раскрывает основные мировые проблемы, лежащие перед человечеством. Автор предлагает четыре варианта развития будущего, из них самый радужный и самый оптимистичный – это конечно техносоциализм. ……… Оценка: хорошо
udrees про Володин: Газлайтер. Том 7 [СИ] (Альтернативная история, Боевая фантастика, Фэнтези, Попаданцы, Самиздат, сетевая литература)
01 03 Примитивная простенькая история-сказка. Написана очень простыми словами, с такими же простыми диалогами героев. Это сказка, конечно, где главный герой прямо супермен, неуязвимый с кучей умений, никто не может ему противостоять. ……… Оценка: неплохо
udrees про Володин: Газлайтер. Том 6 [СИ] (Альтернативная история, Боевая фантастика, Фэнтези, Попаданцы, Самиздат, сетевая литература)
01 03 Эта серия приключений про мальчишку-телепата тянет на Санта-Барбару, как в мыльной опере всегда какие-то интриги, сражения, любовные романы. Написано слишком просто, примитивным языком, который тем не менее легко читается ……… Оценка: неплохо
udrees про Даттон: Мудрость психопатов (Психология)
01 03 Книга будет полезна для общего развития и понимания такого отклонения или разновидности психики как психопатия. ДО этого я читал «Сойти с ума», там тоже в качестве одного из отклонений приводилась психопатия, но подробного ……… Оценка: хорошо
udrees про Андреев: Время Z. Фронт без флангов (Военная документалистика)
01 03 Пропагандистский панегирик идущей СВО. Всю позицию автора можно оценить по одному его предложению: «И слава богу, что случилось 24 февраля 2022 года.» Большая часть книги посвящена восхвалению ЧВК «Вагнер» и его деяниям, ……… Оценка: нечитаемо
Barbud про Лещенко: Чужак [СИ] (Альтернативная история, Исторические приключения, Попаданцы, Самиздат, сетевая литература)
28 02 У автора неплохой слог и достаточно богатый язык, но вместе с тем его творчество навевает несусветную скуку. Действие почти не развивается, оно вязнет то в размышлизмах и рефлексиях, коим несть числа, то в многостраничных ……… Оценка: плохо
mysevra про Уиндем: Миры Джона Уиндема. Том 1 (Научная фантастика)
28 02 Очень освежающе и отрезвляюще на общем фоне, без всех этих крутых супергероев и суровых мачо. «Кукушки Мидвича» тоже понравилась, правда, экранизация 90-х мне показалась поярче. Оценка: отлично!
mysevra про Бонда: Девушка полночи [Pochłaniacz ru] (Триллер, Детективы: прочее)
28 02 Вроде и задумка замечательная, но так тягомотно изложено – сил нет. Оценка: неплохо
mysevra про Хофф: Дао Винни-Пуха (Философия)
28 02 Какая вдохновляющая прелесть! Что-то есть в этом такое, успокаивающее и жизнеутверждающее. Проблема всей этой стройной теории в ключевом условии «познать самого себя», а для этого многим жизни не хватает. Оценка: отлично!
Олег Макаров. про Прядеев: Спящие секреты [СИ] (Фэнтези, Детективы: прочее, Самиздат, сетевая литература)
27 02 Очень слабо написано, не смог читать Оценка: нечитаемо
Олег Макаров. про Прядеев: Позывной «Курсант» (Альтернативная история, Попаданцы, Самиздат, сетевая литература)
27 02 Ужасно написано. Постоянные повторы одних и тех же мыслей, первые 50 страниц книги уместились бы без этого на трёх, максимум четырёх. Бросил. Оценка: нечитаемо
Олег Макаров. про Мунх: Калининград (Изобразительное искусство, фотография)
27 02 Человек сделал epub из обычных фотографий, которые безо всякого к искусству фотографии дара нащёлкал на телефон — а что, так можно было? — видимо, да. — зачем? — не знаю, наверное, хотел писать про себя "автор книги Оценка: нечитаемо |
Отв: Что делать с книгами, в которых нет текстового слоя
?
Отв: Что делать с книгами, в которых нет текстового слоя
А списочек книжек (желательно со ссылками на файлообменники и т.п.) можно? А то ведь может кто (в том числе и я) заинтересуется и OCR-ить поможет?
Отв: Что делать с книгами, в которых нет текстового слоя
http://depositfiles.com/files/kon5m6qr1
http://depositfiles.com/files/t5np6gf08
моя Опера на эти ссылки показывает,будто они неправильные, но переходит по ним нормально.
Я в этих ссылках применил технологию для быстрого скачивания с депозита и летитбита:
если слева от ссылки в браузере на файл депозита или летитбита приставить "sfrom.net/" то файл будет скачан на полной скорости.
Такие ссылки я и написал сначала, но не учел, что ссылки расположены не в командной строке браузера, а на сервере Либрусека, соответственно sfrom.net тоже искался на Либрусеке. Тогда я приставил к адресам ещё один начальный http и все заработало!
Ссылки теперь ведут на быструю скачку файлов с депозита на полной скорости через sfrom.net(видимо у них есть Голд-аккаунты на депозите и летитбите, а вот на Рапиде нету)
Отв: Что делать с книгами, в которых нет текстового слоя
Перевести в джипеги и сделать OCR.
Отв: Что делать с книгами, в которых нет текстового слоя
Технологию процесса - в студию !!!
Отв: Что делать с книгами, в которых нет текстового слоя
"Переконвертить" нельзя. Нужно распознать текст так, как мы распознаем отсканированные картинки.
Нет, не поможет. Поможет только OCR. Переводить в джипеги не нужно, Файнридер (по крайней мере, последние его версии) прекрасно понимает pdf.
Отв: Что делать с книгами, в которых нет текстового слоя
И дежавю тоже ФР понимает. С 9 версии.
Вообще, забавный товарищ.
Как он себе представляет, книги (в виде текстов) в сеть попадают?
Тетеньки машинистки перепечатывают? )))
Отв: Что делать с книгами, в которых нет текстового слоя
Мой девятый не распознаёт. Приходится переводить в PDF.
Отв: Что делать с книгами, в которых нет текстового слоя
Это странно, потому что должен.
http://www.abbyy.ru/support/finereader/90/product_info/FF
Кроме Home Edition. (Но у Вас же не хоум, потому что хоум и pdf не понимает).
Отв: Что делать с книгами, в которых нет текстового слоя
Вообще-то где-то есть файл, который надо положить в специальную папочку, и тогда ФР9 научается распознавать и djvu. Но я что-то не могу его найти. :(
Попробуйте посмотреть здесь. Там внизу есть ещё пара линков.
Отв: Что делать с книгами, в которых нет текстового слоя
UPD
И правда всемогущество! Написала этот пост я, Tanja45. Но вот сайт уверяет меня, что я вовсе даже и не Tanja45, а совсем даже напротив - JuliaVS. Но я пока ему не верю, я точно знаю, что я не JuliaVS.
Отв: Что делать с книгами, в которых нет текстового слоя
На самом деле это представление справедливо для многих видов деят-ти, обычно связанных с компом.
Я называю это "знание о волшебной кнопке". Или программе.
Которая делает все сама. Моментально, красиво и с учетом любых тараканов-пожеланий в мозгу этого знающего.
Отв: Что делать с книгами, в которых нет текстового слоя
А нам? А книжникам? А мы тоже хотим! Это нечестно!
Отв: Что делать с книгами, в которых нет текстового слоя
O, в каком-то фантастическом сериале видела инопланетный девайс для сканирования книг: проводишь им по корешку и через несколько секунд вся книга отсканирована.
UPD Вот, нашла: http://www.youtube.com/watch?v=9CSPW-VUQis Начиная с 8:25 :)
Отв: Что делать с книгами, в которых нет текстового слоя
Отв: Что делать с книгами, в которых нет текстового слоя
Это обо мне что ли?
я например как увижу где в сети текстик txt, html, doc так сразу этот текстик ручками перенабираю в "блокноте" весь текст целиком. добавляю туда тегов
с редакторами FB2 совершенно не знаком
Отв: Что делать с книгами, в которых нет текстового слоя
Уточнение - с билда 724.
Отв: Что делать с книгами, в которых нет текстового слоя
вообще-то "виртуальный принтер"- это такая программа, которая конвертит любые файлы в PDF. Для конвертации нужно эту программу поставить "принтером по умолчанию" и из любой другой программы(из Ворда,Пэйнта,браузера, Блокнота и т.п.) отправить что-то на печать, как это "что-то" конвертится в PDF.
Вот я и подумал, что может есть такой виртуальный принтер, который картинку в PDF переведет в текст в PDF.
Отв: Что делать с книгами, в которых нет текстового слоя
Я в курсе, что такое виртуальный принтер.
Вы поймите, что есть только один способ перевести картинку в текст: ocr (распознавание). Ну, можно еще набрать текст вручную :))
Отв: Что делать с книгами, в которых нет текстового слоя
Вообще-то "виртуальный принтер" - это программа, которая переводит файл на язык, понятный принтеру. Как реальному, так и виртуальному. Её цель именно в этом - что бы принтер понял, как печатать файл. И для целей принтера совершенно не нужен распознанный файл. Его цель - понять, как печатать то, что есть (подгружать шрифты, или печатать их растром; с каким разрешением печатать; цветное или черно-белое, и т.д.). Выходной файл виртуального принтера - .prn или .ps
То, о чем Вы говорите - "конвертит любые файлы в PDF" - это делает программа Acrobat Distiller. Её цель - преобразовать файл .ps в файл .pdf, что бы можно было увидеть глазами то, что мы увидим на печати.
То, что из прикладных программ это делается в один этап, а не в два, не означает, что процесс один. Это просто видимость, результат работы встроенного дистиллера.
В этом и загвоздка - не нужно принтеру, для того, что бы печатать - распознавать. Да и язык Postscript не позволяет (насколько я знаю).
То, что Вы хотите - это не виртуальный принтер, а виртуальный OCR. Что бы программа типа файнридера сделала всю работу, но Вы бы этого даже не заметили, а потом ещё и результат OCR заново записала в pdf. Чисто технически это наверное возможно реализовать. Только зачем?
Отв: Что делать с книгами, в которых нет текстового слоя
Отв: Что делать с книгами, в которых нет текстового слоя
Это подстановка одних шрифтов вместо других. Процесс более простой, чем OCR.
Функция "печатать шрифт как растр" действительно существует. Но это очень простая операция. А вот "растр как текст" - это уже OCR. Процесс сложный и не нужный для целей принтера.
На самом деле я очарован вашей идеей. Действительно, почему нет автоматического аналога этого процесса.
Ведь что мы делаем в Finereader:
1. Открываем изображения.
2. Анализируем текст (рисуем области).
3. Распознаем текст.
4. Сохраняем во внешнее приложение.
Почему же нельзя это автоматизировать, сделать одним процессом. Где мы просто укажем - входной файл - распознать - выходной файл.
Наверное потому, что это не очень нужно - ведь результат получится грязный. Потому что файнридер позволяет на каждом этапе своих процессов контролировать и поправлять результат.
Отв: Что делать с книгами, в которых нет текстового слоя
Отв: Что делать с книгами, в которых нет текстового слоя
niksi, спасибо за подробное разъяснение.
Отв: Что делать с книгами, в которых нет текстового слоя
в комменте http://lib.rus.ec/node/198011#comment-123124 указал ссылки на 2 книжки Малколма Гладуэлла(на Либрусеке есть на англ., а эти на русском)
"Озарение" и "Переломный момент"
Отв: Что делать с книгами, в которых нет текстового слоя
FR Portable 9 распознает без всяких лишних манипуляций )
Отв: Что делать с книгами, в которых нет текстового слоя
А у меня и не Portable, и тоже распознает без всяких манипуляций. Как установился, так и стал распознавать. Но у меня ХР. А у Вас, Игорёк, Vista?