скрипт для лингвистического анализа текста
Опубликовано вс, 28/12/2008 - 12:58 пользователем Wictor
Forums: Просматривая отзывы на книгу Хаецкой Царство небесное натолкнулся на интересную статистику, сгенерированную скриптом (http://fantlab.ru/work9929): Цитата: Лингвистический анализ текста: Учитывая то, что большинство современных книг весьма низкого качества, задумался: можно ли дать предварительную оценку книги на основании этих цифр. Вообще при выборе книги вы бы на такую статистику обращали бы внимание?
|
Вход на сайтПоиск по блогам и форумамUser menuПоследние комментарии
monochka RE:<НРЗБ> 1 день
Океана RE:Подайте бедному копеечку на книжку с литреса... 1 день sem14 RE:Серия "Символы времени" издательства "Аграф" 3 дня sem14 RE:Собираем серию: "Азбука-триллер", издательство "Азбука-Терра" 4 дня sem14 RE:«Юмористическая серия» 4 дня larin RE:Оплатил. Абонемент не отображается 6 дней larin RE:Оплатил, но абонемент не отображается 1 неделя nehug@cheaphub.net RE:DNS 2 недели alexk RE:Багрепорт - 2 2 недели sem14 RE:Книжная серия "Жизнь в искусстве" издательство "Искусство"... 3 недели Isais RE:Семейственность в литературе 3 недели Violontan RE:Жан Батист Мольер воскрешенный 4 недели sem14 RE:Гонкуровская премия 1 месяц Dead_Space RE:Беженцы с Флибусты 1 месяц Саша из Киева RE:Приключения белочки Рыжки 1 месяц alex-from RE:Оплатил два раза, но абонемента нет 1 месяц Kiesza RE:На 78-м году жизни скончался советский и российский... 1 месяц Paul von Sokolovski RE:Бушков умер. 1 месяц Впечатления о книгах
Олег Макаров. про Тыналин: Инженер 1: паровая империя (Альтернативная история, Приключения: прочее, Попаданцы, Самиздат, сетевая литература)
22 12 Barbud спасибо, подтолкнули поинтересоваться. Вот что я нашёл: В 1856 году (в разгар Крымской войны и реформ Флоренс Найтингейл) медперсонал в больницах не носил белые халаты — это гораздо более поздняя традиция. ОДЕЖДА ………
Barbud про Тыналин: Инженер 1: паровая империя (Альтернативная история, Приключения: прочее, Попаданцы, Самиздат, сетевая литература)
22 12 1856 год... По госпиталю ходит медперсонал в белых халатах... ЧТО? Вспомнились строки пародиста Иванова, написанные по другому поводу, но вполне уместные: "Ты бы, дяденька, прежде чем что-то писать, Потрудился хотя бы об этом узнать". Оценка: нечитаемо
mysevra про Есаулкова: Удивительные истории о ведьмах [litres] (Ужасы, Современная проза)
22 12 По сути – очень интересно, но почему-то получилась лютая кустарщина. Одна надежда была на Бобылёву, но я утомилась ждать и не захотела дочитывать. Оценка: неплохо
mysevra про Государев: Треугольный человек (Психология)
22 12 «Научпоп» в лучшем смысле этого слова - мне как не специалисту было и понятно, и интересно. Оценка: отлично!
mysevra про Козлов: Философские сказки для обдумывающих житье, или Веселая книга о свободе и нравственности (Психология)
22 12 Пустая книга. Хорошо, когда человек высокого о себе мнения; плохо, когда за счёт умаления ценности других. Оценка: плохо
Barbud про Риддер: Парторг (Альтернативная история, Попаданцы, Самиздат, сетевая литература)
21 12 Офицеры, офицеры, офицеры чуть не на каждой странице... Автор хотя бы поинтересовался, когда это слово узаконили в РККА. Оценка: нечитаемо
tvv про Гор: Шаровая молния 3 (Попаданцы, Самиздат, сетевая литература)
21 12 Вероятно, здесь претензия только к букве Ё.
trampak про Кот: Основа русского мира [litres] (Исторические приключения, Публицистика)
21 12 Русские сначала называют что-то русским, чтобы потом это сделать своим. Я.Гашек Оценка: нечитаемо
nambus про Гор: Шаровая молния 3 (Попаданцы, Самиздат, сетевая литература)
21 12 «Незалежная» — это разговорное, часто с оттенком иронии или пренебрежения, название для Украины, происходящее от украинского слова «незалежна», что означает «независимая». В более широком смысле, «незалежный» — это синоним ………
Олег Макаров. про Муха: Товарищ мэр (Альтернативная история, Попаданцы, Самиздат, сетевая литература)
20 12 Сначала не понял, почему "Альтернативная история" а потом ка-ак понял: 2025 год, Россия в которой закон, справедливость и неподкупная журналистика побеждают алчность, беззаконие и коррупцию. А самизнаетечего и в помине нету. Оценка: хорошо
Никос Костакис про Гор: Шаровая молния 3 (Попаданцы, Самиздат, сетевая литература)
20 12 «напитались» реалиями Незалёжной первых лет XXI века. __________________ Незалёжной? Такого слова в украинском языке нет. В русском тоже. Тогда по-каковски это, а?
alexk про Кош: Лакомство для вампира [СИ] (Городское фэнтези, Мистика, Самиздат, сетевая литература)
20 12 ..ать! Ну на хрена портить все ссылки? Удали ты их вообще, если они тебе мешают. Что за гомосятина? |
Отв: скрипт для лингвистического анализа текста
Хотите поверить алгеброй гармонию? :)
Нет. Цифры любопытные, но, увы, о качестве книги они ровным счетом ничего не говорят.
Отв: скрипт для лингвистического анализа текста
А если бедный язык у автора? Ну т.е. значение "Активный словарный запас"?
Отв: скрипт для лингвистического анализа текста
Вы считаете, что у Елены Хаецкой "бедный язык"? :)
Отв: скрипт для лингвистического анализа текста
Я вот тоже очень удивилась. Зато выявилась достоверность "скриповой" оценки текста. :)
Отв: скрипт для лингвистического анализа текста
Под словом "автор" я имел в виду автора гипотетического. Хаецкая мне нравится, хотя в некоторых ее произведения встречаются повторы чуть ли не абзацев. Например куски текста из Саги о Хелоте встречаются в Харольде.
Отв: скрипт для лингвистического анализа текста
Не люблю говорить о сферических конях в вакууме. В Вашем примере активный словарный запас автора "ниже среднего". С творчеством автора Вы знакомы. Значит, можете сделать выводы. Вы считаете, что у данного автора "бедный язык"? Если ответ "да", то Вы можете смело использовать данный скрипт для предварительной оценки произведения :)
Отв: скрипт для лингвистического анализа текста
На именно такую статистику - скорее не обращал бы, чем обращал.
Но вообще-то идея не такая уж дурацкая, гармонию - не гармонию, а некоторые характеристики текста программно поймать вполне можно, хоть тот же "Штампомер" вспомнить. У меня давно свербила идея попробовать на зубок тексты людей, явно не умеющих писать (ака графоманов).
Есть как минимум два довольно легко формализуемых признака графоманского текста:
1. Избыток восклицательных знаков в прямой речи героев.
2. Вязкость словоупотребления, то бишь - одинаковые или однокоренные слова в соседних предложениях (например "Но вообще-то идея не такая уж дурацкая..." и "У меня давно свербила идея...").
Был ешё и третий признак, но я его, каюсь, забыл...
Отв: скрипт для лингвистического анализа текста
Вот ещё можно вдоволь поиграться: http://rusf.ru/books/analysis/ :)
Отв: скрипт для лингвистического анализа текста
Можно обращать и на такую но ... только строить ее не по книге, а по автору. Т.е. ввести весь его опубликованный корпус и построить профиль, желательно в привязке ко времени, что б была видна и динамика. Но при этом не забывать, что это относительные характеристики и их надо сравнивать с "подпольем" и "потолком" ;), т.к. средняя температура по больнице ничего толкового не выявит.