Вы здесьУдаление дублей из архивов по 1000 книг.
Опубликовано вт, 20/01/2009 - 15:27 пользователем Bullfear
Есть такая программа myhomelib. Для работы использует архивы либрусека. В этих архивах примерно 20% дублей. В связи с этим возникает вполне закономерное желание эти дубли убрать. pkn написал для этой цели скрипт. Скрипт перловый.
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
sem14 RE:Серия "Символы времени" издательства "Аграф" 1 день
sem14 RE:Собираем серию: "Азбука-триллер", издательство "Азбука-Терра" 1 день sem14 RE:«Юмористическая серия» 1 день Океана RE:Подайте бедному копеечку на книжку с литреса... 4 дня larin RE:Оплатил. Абонемент не отображается 4 дня larin RE:Оплатил, но абонемент не отображается 1 неделя nehug@cheaphub.net RE:DNS 1 неделя alexk RE:Багрепорт - 2 2 недели sem14 RE:Книжная серия "Жизнь в искусстве" издательство "Искусство"... 3 недели Isais RE:Семейственность в литературе 3 недели Violontan RE:Жан Батист Мольер воскрешенный 3 недели sem14 RE:Гонкуровская премия 4 недели Dead_Space RE:Беженцы с Флибусты 1 месяц Саша из Киева RE:Приключения белочки Рыжки 1 месяц alex-from RE:Оплатил два раза, но абонемента нет 1 месяц Kiesza RE:На 78-м году жизни скончался советский и российский... 1 месяц Paul von Sokolovski RE:Бушков умер. 1 месяц lemma7 RE:Серия «Интеллектуальный детектив» изд-ва АСТ 1 месяц Впечатления о книгах
Олег Макаров. про Муха: Товарищ мэр (Альтернативная история, Попаданцы, Самиздат, сетевая литература)
20 12 Сначала не понял, почему "Альтернативная история" а потом ка-ак понял: 2025 год, Россия в которой закон, справедливость и неподкупная журналистика побеждают алчность, беззаконие и коррупцию. А самизнаетечего и в помине нету. Оценка: хорошо
Никос Костакис про Гор: Шаровая молния 3 (Попаданцы, Самиздат, сетевая литература)
20 12 «напитались» реалиями Незалёжной первых лет XXI века. __________________ Незалёжной? Такого слова в украинском языке нет. В русском тоже. Тогда по-каковски это, а?
alexk про Кош: Лакомство для вампира [СИ] (Городское фэнтези, Мистика, Самиздат, сетевая литература)
20 12 ..ать! Ну на хрена портить все ссылки? Удали ты их вообще, если они тебе мешают. Что за гомосятина?
Sello про Гече: Библейские истории (Критика, Религия)
20 12 Такие книги бессиысленно комментировать. Автор, кстати, занят не столько тем, что "раскрывает несостоятельность представлений о "богодухновенности" библейских сказаний, сколько, анализом, поисками точек соприкосновения историчности ………
Олег Макаров. про Прягин: Даль-цвет. Том 1. Охра (Фэнтези, Попаданцы, Самиздат, сетевая литература)
19 12 Давно не было у меня такого, чтобы дочитать том и «а-а-а! теперь же неизвестно сколько ждать следующего!!!» Отлично. С огромным удовольствием от первой до последней страницы. Оценка: отлично!
Олег Макаров. про Денисов: Извлекатели. Группа «Сибирь» [СИ] (Боевая фантастика, Самиздат, сетевая литература)
19 12 Совершенно долбанутая вещь: люди из “прекрасной России настоящего” в параллельном мире - России, где "Путин не пришёл ко власти и всё разваливается, страну разворовывают либералы”... Оценка: нечитаемо
Дей про Хлеб наемника
18 12 В общем, первые две книги это один ГГ, а остальные - совсем другой, хоть и тот же Артакс. В остальных он уже ленивый, потолстевший, забросивший тренировки. Периодически о нём кто-то вспоминает и выдаёт квест. Автор частенько ………
Никос Костакис про Гор: Шаровая молния [СИ] (Попаданцы, Самиздат, сетевая литература)
17 12 Как там у еще не родившегося Ивасюка? Повсюду буйно квитна черемшина..." ______________________ Ага. "Почему я не сокол?" (с)
decim про Осояну: Дети Великого Шторма [сборник litres] (Героическая фантастика, Фэнтези, Морские приключения)
16 12 Очень похоже на "Дитя приливов" Р.Дж. Баркера. В дамском изводе, т.е. с постоянным и многословным выяснением отношений. Ладно хоть, что не отношенек. Ещё напомнило эпопею Суржикова. Воды налито немало, и если бы подсушить ………
Oleg68 про Кобен: Убегай! [Run Away ru] (Триллер, Детективы: прочее)
16 12 Классная книга. Неожиданный конец. Оценка: отлично! |
Комментарии
Отв: kop-librusec-dedead - очень новая версия.
Странно... параметры ОК, вроде должно было нормально сработать... правда, не видно нормально ли загрузились SQL-таблицы... нельзя ли полностью вывод скрипта увидеть?
Убедил. Как руки дойдут - сделаю.
Отв: kop-librusec-dedead - очень новая версия.
Изволь. Распаковка таблиц заняла чуть больше 20 минут. Дальше уже пошло убиение невиновных файлов, посему скрипт был безжалостно остановлен :) И так уже половину придется перекачивать.

Кстати по поводу sql... А работать по спискам myhomelib скрипт разучился? Если да, то жаль - было намного быстрее.
Отв: kop-librusec-dedead - очень новая версия.
Распаковка - это секунды, там парсинг длинный. Но это от компупера зависит, у меня это три минуты занимает :). Но учту, спасибо, если будет возможность - попробую эту часть ускорить.
Ну извини... я честно предупреждал: "НЕ пользуйтесь этой опцией, если не уверены." ;)
Не, это вряд ли получится. Я много пользуюсь частями именно этого скрипта, с SQL-таблицами, и поддерживать два формата - эт я не потяну.
Теперь по сути: похоже, там баг в скрипте. При единственном фильтре "по языку ru" он нашел всего 5409 желаемых (wanted) книг из 123760. Не может быть чтобы в таблицах было всего 5 тысяч книг на русском. И у меня такой же примерно результат, даже ещё меньше, так что это не разница в Перле или в SQL-таблицах, а баг в скрипте. Буду искать, как только дойдут руки. Постараюсь не затягивать, но прямо сейчас - не могу.
Отв: Удаление дублей из архивов по 1000 книг.
Ну дык на настольном и у меня будет около 3-х минут. Ты на ноуте пораспаковывай :Р
Тоесть косяк в единственном фильтре или именно в фильтре по языку?
*обиженным голосом* Но ты не добавлял "... что в скрипте нет бага" :Р
Ясно, спасибо. Бум ждать, благо сейчас либрусек работает и это не так критично ;)
Отв: Удаление дублей из архивов по 1000 книг.
Баг в скрипте есть всегда. Это аксиома.
kop-librusec-dedead - 0.4.3
kop-librusec-dedead верисия 0.4.3 - прицеплена к посту.
Изменения:
1. Пофиксен злобный баг. Предыдущими версиями не пользоваться, они глюкавые на всю голову!
2. Добавлена опция -testrun : Делать всё как настоящее, но не писать/стирать никаких zip-архивных файлов.
3. Добавлена возможность перезаписывать поверх исходных файлов. Для этого надо чтобы -do (dirout, выходной директорий) показывал туда же где лежат исходные зипы (dirzip), и присутствовала опция -removeoriginals.
Отв: kop-librusec-dedead - 0.4.3
Спасибо, щас потестим :)
Отв: kop-librusec-dedead - 0.4.3
Меня терзают смутные сомнения... На первый взгляд все нормально, однако почти в каждом архиве скрипт находит примерно 250-300 дублей. Так и должно быть? Архивы уже были обработаны старой (безглючной) версией скрипта.
Wanted total 96695
Books total 123760
to be squeezed 27065
Или он просто повторно обьединичивает единички? Тогда все в порядке.
Из замеченного: быстрее стали грузится таблицы, это гуд :)
А вот еще что.
WARNING: Bad member name: "Ketrin_A_List_Etika_bl**stva.fb2" zipf="16988-117987"
C этими файлами можно что-то сделать?
Отв: kop-librusec-dedead - 0.4.3
Повторно объединичивает.
Это тебе показалось :) там ничего не делалось.
АХЕЗ. Звёздочки в имени разрушают перловые regexp-ы. Я пока не могу научиться как бы их правильно сравнивать.
Отв: kop-librusec-dedead - 0.4.3
Странно. Тем не менее факт. Тогда одно из трех:
- Я сонный, поэтому думаю медленнее :)
- Они эээ... Закешировались виндой, ибо ноут уже недели две не перезагружался.
- Что третье? Говорю же - сонный я :Р
Отв: kop-librusec-dedead - 0.4.3
Можно экранировать переменную - /^\Q$membername\E$/
А можно использовать строковое сравнение вместо regexp (должно быть быстрее) - grep {$_ eq $membername} @FN_G;
Отв: kop-librusec-dedead - 0.4.3
Спасибо! Перловковар из меня тот ещё...
Страницы