37 миллионов старых газетных страниц выложены в Сеть
Опубликовано сб, 24/12/2016 - 09:19 пользователем DeMorte
Forums: Как создать самый большой архив периодики в домашних условиях? Американец Том Триниски просто вооружился сканером и взялся за дело в собственной гостиной. Работая в одиночку, Том Триниски сумел оцифровать более 37 миллионов страниц старых газет — это больше, чем в американской Библиотеке Конгресса (крупнейшая библиотека мира), — сообщает Newtonew. Результаты своего труда он выкладывает в открытый доступ на сайте Fulton History, где можно найти архивы более 1000 газет штата Нью-Йорк, некоторых других штатов и Канады. В архиве, который составитель регулярно обновляет, содержатся издания с 1795 по 2007 год. Триниски — инженер на пенсии и любитель старины. Над сайтом и контентом он работал в одиночку, в своём доме. Четырнадцать лет назад он решил отсканировать коллекцию старых открыток с видами округа Фултон, Нью-Йорк (его родной район), чтобы поделиться ими в интернете. Впоследствии к открыткам добавились заметки, рекламные объявления, некрологи, печатные издания. Ресурс до сих пор называется в честь округа Фултон, хотя материалы давно вышли за первичные географические границы. Для оцифровки газет используется программа для оптического распознавания символов, которая иногда ошибается из-за того, что некоторые издания очень старые. Также создатель сайта задействовал микрофильмы, на которых есть следы царапин и пыли, однако это добавляет старым газетным страницам обаяния. Сайт Fulton History не всегда справляется с наплывом гостей, и временно бывает недоступен из некоторых точек мира. Если такое случилось, можно заглянуть на Chronicling America, ещё один открытый ресурс с историческими газетами, на сайт с архивами газет от Бруклинской публичной библиотеки, или прошерстить базу данных Нью-Йоркской публичной библиотеки — здесь тоже есть множество старых изданий, и не только американских.
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
Океана RE:Подайте бедному копеечку на книжку с литреса... 1 день
weis RE:Прошу переформатировать, распознать, etc... 1 неделя larin RE:Заплатила, а абонемента нет и скачать ничего не могу! 2 недели sibkron RE:Серия "Библиотека французской литературы" (Макбел) 3 недели akorish RE:Регистрация 1 месяц Tramell RE:Серия "Очень прикольная книга", издательство Азбука-классика 1 месяц Larisa_F RE:Серия "Я познаю мир" издательства "АСТ, Астрель, Олимп",... 1 месяц konst1 RE:Ух, как я не люблю спамеров! 1 месяц tvv RE:DNS 2 месяца sem14 RE:«Не забыть бы тогда, не простить бы и не потерять!»-2 ... 2 месяца larin RE:Заблокирован 2 месяца konst1 RE:Серия «Интеллектуальный детектив» изд-ва АСТ 3 месяца Larisa_F RE:Серия книг «Судьбы книг» издательства «Книга» 3 месяца fixel RE:Пропал абонемент 3 месяца sem14 RE:Книжная серия "Жизнь в искусстве" издательство "Искусство"... 3 месяца sibkron RE:"100 славянских романов", серия изд.-ва "Центр книги... 3 месяца Larisa_F RE:Серия "Новые сказочные повести" издательство "Самовар" ... 4 месяца sem14 RE:Серия "Символы времени" издательства "Аграф" 4 месяца Впечатления о книгах
lee321 про Прозоров: Темный Лорд: Темный Лорд. Темное пророчество. Меч Эриджуна. Озерная леди. Клятва Темного Лорда [сборник litres] (Героическая фантастика, Фэнтези)
19 06 Читал давно (сразу после опубликования) и тогда понравилось. Написано в "эпоху Гарри Поттера". Немного похоже (тайное паралельное магическое общество, магическая школа, Темный лорд). Вполне оригинальная и интересная история. Оценка: хорошо
gruin про Баренберг: Сага ледяного оазиса [СИ] (Боевая фантастика, Фэнтези, Самиздат, сетевая литература)
19 06 Вполне на уровне. Одобряю. Хотелось бы продолжения Оценка: хорошо
gruin про Прозоров: Темный Лорд: Темный Лорд. Темное пророчество. Меч Эриджуна. Озерная леди. Клятва Темного Лорда [сборник litres] (Героическая фантастика, Фэнтези)
19 06 Написнао много, и всё - дрянь Оценка: нечитаемо
Oleg68 про Кобен: Незнакомец [The Stranger ru] (Детективы: прочее)
19 06 Отличная книга. Сюжет держит до конца в напряжении. Автор, как всегда, на высоте. Оценка: отлично!
Isais про Говоров: Алкамен — театральный мальчик (Историческая проза, Детские приключения)
17 06 До сих пор помню, как я был шокирован в пятом классе, прочитав эту книгу как внеклассное чтение по истории древнего мира. Все было не так — положительные герои не должны исчезать бесследно. Спустя полвека решил перечитать. ……… Оценка: отлично!
Isais про Мун: Меч наемника [Sheepfarmer's Daughter ru] (Героическая фантастика, Фэнтези)
17 06 Производственный роман о карьере наемного солдата (солдатки) в средневековом фэнтезийном сеттинге. Подробно, основательно, без досужих выдумок. Главная фантастика в книге — вежливость, корректность и справедливость, с которой ……… Оценка: плохо
Nicout про Вадим Владимирович Чинцов
17 06 Господи, пусть афтар убьет сибя апстену! Другого способа остановить поток этого говна, похоже, не существует. Этот Чинцов - абсолютный, законченный, и патентованный бездарь с суконным языком, который не имеет понятия о художественной ………
lorealke про Земляной: Сорок третий (Боевая фантастика, Попаданцы, Самиздат, сетевая литература)
16 06 Плоская картонка. Видимо, чукча не читатель. Да и писатель не очень... Оценка: плохо
decim про Слоун: Круглосуточный книжный мистера Пенумбры [litres] [Mr Penumbra's 24 Hour Bookstore ru] (Детективная фантастика, Фэнтези, Городское фэнтези)
16 06 Зазывной блёрб привирает: этой книге очень далеко до Мураками и Эко, пусть автор их и читал, а его похвалы Гуглу конца нулевых не пережили киберпанк Гибсона 1980-х, такие дела. Первое издание, перевод Апрелева, читается ……… Оценка: неплохо
akorish про Гор: Дикий прапор. Книга 3 (Боевая фантастика, Космическая фантастика, Самиздат, сетевая литература)
15 06 Читается легко, герой превратился в бессмертного благородного русского рыцаря в высокотехнологичном супер-мега-звездолете. Оценка: отлично!
akorish про Гор: Дикий прапор. Книга 2 [СИ] (Боевая фантастика, Космическая фантастика, Попаданцы, Самиздат, сетевая литература)
15 06 Неплохая книженция, юмор присутствует, очень приятно, что упомянул Крым ))) Оценка: отлично!
akorish про Гор: Дикий прапор [litres самиздат] (Боевая фантастика, Космическая фантастика, Самиздат, сетевая литература)
15 06 Неплохая книжка, местами забавная. Коньячек, Прапорские темы, как не продать что-то не нужное. Например глистов, ну и многое другое. Оценка: отлично! |
RE:37 миллионов старых газетных страниц выложены в Сеть
Вот это мужик! Респект и уважуха!
От будут ли правообгладатели ему втыкать за использование материалов?
RE:37 миллионов старых газетных страниц выложены в Сеть
Из FAQ_HELP_INDEX:
В. Могу я добавить статью на этот сайт?
О. Ага. Если газета была опубликована в штате Нью-Йорк и не попадает под копирайт...
===
И на первой странице:
Мери Крисмас, библиотекарь!
RE:37 миллионов старых газетных страниц выложены в Сеть
Ну если оно в сети, тогда и все смогут загребти себе. Вот и если начнется массовое пополнение библиотек газетами...
RE:37 миллионов старых газетных страниц выложены в Сеть
Что-то сильно я сомневаюсь что именно 37 млн страниц газет, скорее всего. как пишут в статистике больших библиотек "единиц хранения" - отдельных открыток, рекламных обьявлений и т.д.
Попробуем посчитать.
37 000 000 / 14 лет = 2 642 000 страниц в год / 365 дней = 7 241 страница в день /12 часов = 600 стр в час или 6 страниц в минуту.
Многовато выходит, и это чисто сканирование. + какая-никакая обрезка + каталогизация + выкладка в Сеть.
RE:37 миллионов старых газетных страниц выложены в Сеть
Дети помогали. Или еще кто то.
А какие там страницы, может не такие как у нас. Тогда по несколько страниц за проход.
RE:37 миллионов старых газетных страниц выложены в Сеть
А можно задать вопрос: вы сами пробывали сканировать газеты?
RE:37 миллионов старых газетных страниц выложены в Сеть
Нет.
Но при современному оборудовании много чего возможно.
RE:37 миллионов старых газетных страниц выложены в Сеть
Расчёт - правильный. В исходных статьях ещё написано, что дедуля в последние три года оцифровывает по 250 000 страниц в месяц - те же самые 6 страниц в минуту (если считать, что он работает 24 часа в сутки, не питаясь и не отлучаясь в туалет).
Я тоже заинтересовался гигантскими цифрами в заметке и немного посчитал. А потом полез на англоязычные сайты и все странности исчезли. Всё гораздо проще.
С бумажными газетами дед недолго поработал в самом начале проекта - в 2001-2003 годах, когда у него был только планшетный сканер.
После этого он приобрёл мощный автоматический сканер для обработки микрофильмов (Wicks and Wilson Scanstation production-level microfilm scanner), наладил взаимодействие с библиотеками и запустил поточное производство. Так что последние 14 лет он оцифровывал микрофильмы, а не сами газеты.
Работает дед по 70-80 часов в неделю, и его работа заключается в том, чтобы распаковать привезённые ему микрофильмы, вставить их в мощный сканер-автомат и получить на выходе готовые сканы, практически не требующие дополнительной обработки. Их сразу можно отправлять на сайт.
Так что основную работу проделали десятки библиотекарей, десятилетиями превращавшие бумажные газеты в микрофильмы. А дед пользуется результатами их титанического труда. Это, конечно, не умаляет его заслуг - но объясняет его небывалую для сканировщика "производительность"...
Подробности - здесь:
http://www.thecrowleycompany.com/long-time-client-uses-wwl-scanners-digitize-26-million-newspaper-images/