Культурный датасайнс (Даня Скоринкин)
1.99K subscribers
136 photos
4 videos
2 files
98 links
Культурная аналитика, Digital Humanities, количественный анализ культурных данных, вычислительная филология, бытование культуры и языка в эпоху чат-гопоты, умных машин и безумных людей. Ведёт @skorinkin
Ранее назывался “Цифровой филолог” и “Ебаный DH”
Download Telegram
Не цифровая, но тем более впечатляющая филологическая технология. На видео и фото — система доставки книг в Национальной библиотеке Франции. Мне кажется, так выглядел бы интернет, если бы цифровые технологии по каким-то причинам были невозможны — и мы рассылали бы TCP/IP пакеты в каком-то физическом виде… А еще это очень похоже на декорации к ранним «Звездным войнам» 👾

Сама библиотека под стать этой эстетике: циклопическое здание виде четырех открытых книг на общем стилобате, внутри напоминающее то ли звезду смерти, то ли атомную электростанцию. Но при этом посреди комплекса — кусок настоящего дикого леса 🌲🌳, причем запретного: ходить туда нельзя, только смотреть сверху 👀 В общем, удивительный памятник дизайна, инженерии и архитектуры конца 80-х — начала 90-х.
🔥61👾12👍8❤‍🔥4🤯42
«Культурный коллапс» ультраконсервативных LLM
(спойлер: как всегда, виноваты люди)

На этой неделе на конференции Computational Humanities Research 2025 в секции «Modeling Culture» будет доклад замечательного цифрового филолога Райана Хойзера (Ryan Heuser) под хлестким названием «Cultural Collapse: Toward a generative formalism for AI cultural production». Он продолжает серию исследований о том, почему LLM пишут такие скучные, шаблонные и старомодные стихи, как будто XX века не было. Но выводы выходят далеко за рамки поэзии и филологии. Я прочитал статью Хойзера и делюсь с вами основными результатами.

Что и как исследовали?

Хойзер генерировал англоязычные стихи в 9 моделях (в диапазоне от ChatGPT и Claude до Llama и OLMo) при помощи 22-х разных промтов. Часть промтов была в стиле «напиши стихотворение», без деталей. Другая часть просила написать стихи в рифму или в стиле какого-то традиционного автора (Шекспировский сонет). Третья часть (самая интересная) — просьбы написать стихи без рифмы, белым стихом или в стиле какого-то поэта XX века, писавшего без рифм. Суммарно было сгенерировано 15 тысяч стихотворений.

Что узнали?

1️⃣ LLM — гиперконсервативные поэты, они рифмуют даже там, где их явно просят этого не делать.

Сам тезис не нов — но в этой работе он подкреплен сравнением с реальными историческими данными. На простое «напиши стихи» модели рифмуют в 93–99% случаев — и это бОльшая доля рифмованной поэзии, чем в любом историческом периоде на реальных данных из корпуса английской и американской поэзии Chadwyck-Healey. При прямом запрете на рифму LLM всё равно рифмуют в 53% случаев. У некоторых моделей (Gemini Pro) — до 80%. ChatGPT при прямом запрете выдавала рифму только в 36% случаев, но зато полностью проваливалась на Уолте Уитмене. Уитмен не рифмовал, а ChatGPT «в стиле Уитмена» рифмует в половине случаев.

Еще модели очень много рифмуют, если просить их дописывать тексты настоящих стихов. Даже если это нерифмованная поэзия из второй половины XX века, когда в реальных стихах доля рифмы падает до 4%.

2️⃣ Консерватизм моделей НЕ объясняется обучающей выборкой

Хойзер исследовал обучающие данные открытых моделей с помощью инструмента «What's In My Big Data?» от Allen Institute, который позволяет заглянуть в эти гигантские корпуса и проверить, какие настоящие стихи там уже есть. Закрытые модели анализировали, заставляя их воспроизводить тексты стихов из разных коллекций. Результат в обоих случаях показал, что нерифмованных стихов в обучающих выборках для LLM так же много, как и в поэтических корпусах, взятых для сравнения. То есть модели видели много нерифмованной поэзии, но воспроизводить ее отказываются.

3️⃣Рифмо-мания появляется на этапе RLHF-дообучения

В исследовании сравнивались Llama 3.1 в её базовой версии, т.е. до этапа дообучения на пользовательском фидбеке, и Llama 3.1-instruct, т.е. после RLHF. И вот здесь разница оказалась огромной. При генерации «современной» поэзии базовая Llama рифмровала в 10% случаев, а «проинструктированная» (то есть по сути обученная решать задачи пользователя и всячески ему угождать) — в 60%. Видимо, именно на этом этапе элайнмента с человеком моделям «объяснили», что если человек хочет стихов — то надо писать в рифму.

***

☠️ Хойзер называет все это «культурным коллапсом» и предвещает, что по мере закольцовывания LLM на данных, сгенерированных другими LLM, эффект усилится и убьет всякое разнообразие художественных текстов, сделав литературный ландшафт будущего плоской пустыней.
24👍15🔥11😱3
P.S. Еще в этом исследовании есть странная часть про генерацию метаданных к стихам и анализ того, сколько белых, черных и цветных авторов породили LLM для (несуществующих) стихов разных лет, а также сколько мужчин и женщин. Моделям предложили «припомнить» якобы «утраченные» списки авторов за определенные годы и дать разбивку по гендеру и цвету кожи. Результат выглядел столь же политкорректно, сколь и нереалистично: 50% белых авторов для периода, где их в реальности было 95%, 75% авторок-женщин для периода, где в реальности было 25%...

Хойзер тут очень возмущается, что, мол, модели занимаются «ревизионизмом» и «идеализацией исторических данных», rather than reproducing historical biases. Но в этом месте мне становится немного смешно, потому что, ну, ребята, а вы разве не за это всю дорогу боролись в своей левацкой западной академии? Так вот же, пожалуйста, лоботомированные политически верным RLHF-ом модельки наконец-то отринули весь ненавистный вам algorithmic bias… А вы все недовольны 😁
🤣2423🤡8👍7🔥1🤯1
5 литературных датасетов и дата-исследований на них
(подборка к 120-летию Пушкинского дома)

Открытые данные в гуманитарных науках — по-прежнему редкость (я как-то делал тут подборку источников и с трудом наскреб 5 штук). И еще более редки датасеты, связанные с русской литературой, историей и культурой. Тем ценнее, что есть источник, который неизменно поставляет нам именно такие данные из года в год, — Репозиторий открытых данных по русской литературе и фольклору от коллег из Цифровой лаборатории ПушДома (ИРЛ РАН). И поскольку на этой неделе мы празднуем 120 лет всего ПушДома, я сделал подборку из 5 датасетов репозитория, субъективно отобрав из них те, что связаны с большими и красивыми исследованиями:

1️⃣ Код и данные для воспроизведения исследования: «Сто лет счастья в детской литературе (1920—2020): сталинский канон и его долгосрочные последствия». Этот датасет — часть замечательного исследования филолога и антрополога К.А. Маслинского о том, как «счастье» в текстах сталинской эпохи перестало быть личным и превратилось в чувство «государственной важности», обязательное для лояльного гражданина СССР. В датасете есть код, размеченные руками примеры употребления слова в разных значениях, а также векторные модели, в которых видна трансформация контекстов слов «счастье» и «счастливый».

2️⃣ Корпус русской прозы для детей и юношества — так называемый «деткорпус», на базе которого производилось предыдущее исследование и много других, не менее интересных (например, про то, какие животные встречаются в каких жанрах детской литературы; кстати к нему тоже есть данные и код для воспроизведения). Сейчас в постоянно растущем «деткорпусе» — почти 3500 текстов, написанных для детей и подростков с конца XIX по начало XXI века.

3️⃣ Корпус русских элегий 1815—1835 гг. Поэты пушкинской эпохи — первое поколение русских «эмо», для них элегия с жалобами на несчастную судьбу, любовь и рано отцветшую юность — важнейший жанр. Филолог Антонина Мартыненко собрала для своей магистерской работы корпус элегий (всего 509, с точной датировкой — 390) и исследовала его цифровыми методами. Показав, например, что на фоне прочей поэзии для элегий характерны биграммы «юные годы», «слезы лить» и «последний раз» 🥲

4️⃣ Корпус нарративной прозы XIX в. Сопоставимый по числу текстов, но на два порядка бОльший по объему, этот корпус содержит 506 текстов русской прозы (романы и повести) в диапазоне от 1814 года до начала XX века. Тут есть и «великие» (Пушкин-Лермонтов-Гоголь-Толстой-Достоевский), и забытые представители русского «великого непрочитанного», романы которых сегодня никто не знает. Когда-то этот корпус был собран филологом и специалистом по культурной эволюции Олегом Собчуком, который исследовал на нем повышение доли диалогов в русском романе. С тех пор корпус остается полезным ресурсом для всех, кому надо быстро найти приличный объем русской прозы XIX века (лично я его тоже использовал в исследовании про географию прозы).

5️⃣ Стилеметрические данные «Тихого Дона» и современной ему прозы. Ну, эту историю со стилометрией вы уже знаете. Филологи Б.В. Орехов и Н.П. Великанова посмотрели на «Тихий Дон», сравнили с текстами usual suspects (Крюков, Севский-Краснушкин, Серафимович) и не нашли ничего сенсационного. И, как я уже писал по этому случаю, исследование можно воспроизвести — как раз благодаря тому, что данные лежат в репозитории ПушДома. За что ему большое спасибо 🙏
🔥35👏1514👍5👨‍💻2
Как работает количественное определение авторства, и неужели авторский сигнал действительно вычленим из простых частотностей слов? Я не один раз рассказывал тут о стилометрии, но каждый раз это приводило к новой волне вопросов 🙂 В этом декабре я прочел очередную научпоп-лекцию (кстати, на том же самом семинаре «Языки психиатрии», где мы год назад разоблачали Коробкову вместе с Александрой Архиповой), в которой попытался сформулировать суть метода через максимально простые “минимальные” примеры. Это для тех, кому вдруг нечего послушать предновогодними вечерами 😁

🎥 Видео: https://www.youtube.com/watch?v=Oi6zoQ3apY0

🧑‍🏫 Слайды: https://slides.com/danilsko/stylo_psy

С наступающим, а празднующих сегодня Рождество — с Рождеством!🎄
38🔥19👍13
Как нам жить и работать в ситуации постоянного соблазна делегировать интеллектуальный труд машине и не выродиться до безмозглой протоплазмы? Что делать со всеми теми типами работы, которые как будто совсем потеряли смысл с момента, когда их научилась выполнять LLM (написание отчетности, например)? Что значит творчество в мире, где машина имеет больше творческих способностей, чем подавляющее большинство людей?

A lot of work is time-consuming by design. In a world in which the AI gives an instant, pretty good, near universally accessible shortcut, we’ll soon face a crisis of meaning in creative work of all kinds.


Это цитата из книжки Co-Intelligence Итана Моллика, где как раз ставятся подобные вопросы и ищутся на них ответы. Я прочитал книжку (глазами, без LLM) — и немножко пересказал для “Гуманитариев в цифре”:
16👍5👨‍💻4👾1
🙂Продолжаем рубрику #прочиталсоветую

📖 Открываем новые книги по советам коллег, читаем в новом году.

Ethan Mollick
“Co-Intelligence: Living and Working with AI”
(Portfolio, 2024).

Как следует из названия, книжка осмысляет совместную работу человека с ИИ. Это не очередной алармистский манифест в духе «ИИ заменит всех», а попытка прощупать сценарии того, как именно люди и ИИ будут работать вместе. Автор, Итан Моллик, — профессор бизнес-школы, то есть хоть и вдумчивый, но всё-таки практик. Этим и ценна книжка: в ней много экспериментов самого автора (в том числе таких, которые поначалу могут застать читателя слегка врасплох), его совместных опытов со студентами, а еще текст этой книжки (иногда прямо, еще чаще косвенно) побуждает читателя попробовать осуществить что-то с участием LLM самому. Мне кажется, это особенно важно, потому что, на мой взгляд, в гуманитарной академии (даже в её дигитальной части!) мы часто недостаточно пропускаем технологию через пальцы, прежде чем начать о ней с умным видом рассуждать. Мы можем с умным видом болтать про фундаментальные ограничения, галлюцинации моделей, alignment и длину контекстного окна, даже если в реальной жизни используем ИИ в 2-3 предельно примитивных и шаблонизированных сценариях… Книга Моллика провоцирует поработать над собой, попробовать соорудить в коллаборации с ИИ что-то более амбициозное (меня, по крайней мере, спровоцировала), и уже этим полезна. 

Eще приятно, что книжка маленькая и читается быстро. При этом если вы интересовались темой и имеете какие-то представления о базовых принципах работы современных LLM, что-то про них читали, то вам будут встречаться разделы или даже целые главы, которые можно без ущерба пропустить. Особенно это касается глав 1, 2 и 4 — многое оттуда уже стало общим местом. Зато я бы точно не стал пропускать главу 6, где собственно и говорится о коллаборации с ИИ, об эффекте на рынок труда, о пределах замещения человека на его рабочем месте и о том, что вообще делать со скучающими работниками. Тейк Моллика — что ключевой навык будущего это не какой-нибудь там “промт-инжиниринг”, а умение правильно распределять ответственность между человеком и машиной. Не менее ценны и главы 7 и 8 об образовании в эпоху ИИ. Здесь про смерть индустриальной модели образования, про риски делегирования мышления и про то, как мог бы быть устроен дизайн образования для мира, в котором ИИ уже везде. В главе 9 описаны любопытные сценарии будущего, а в конце у книги очень гуманистический эпилог. Закончу цитатой из него:

«There is a sense of poetic irony in the fact that as we move toward a future characterized by greater technological sophistication, we find ourselves contemplating deeply human questions about identity, purpose, and connection. To that extent, AI is a mirror, reflecting back at us our best and worst qualities. We are going to decide on its implications, and those choices will shape what AI actually does for, and to, humanity». 

Даниил Скоринкин, цифровой филолог, главный редактор «Системного блока» 🙂
Please open Telegram to view this post
VIEW IN TELEGRAM
23👍12🔥5👏3
Итоги года цифрового филолога Дани Скоринкина🎄

Замечательная цифровая платоноведка Оля Алиева передала мне эстафету итогов года, а такому человеку не откажешь. Итак, мои итоги:

Слово года: генерёнка 🤖 В каком-то англоязычном топе победил слоп, но слово слоп противное, оно хлюпает как сопли/слизь, а вот генерёнка — хорошее. Как будто сгущёнка или тушёнка. То есть да, промышленно произведённое, да, не очень здоровое, да, переработанное… но ведь питание! И притом выручающее в экстремальных условиях. Так и мы. Генерируем себе то, на что не хватает органического ресурса мозга в этом безумном темпе жизни, тем и спасаемся, тем и живы. Тушёнкой, сгущёнкой да генерёнкой. (но, кстати, вы, дорогие читатели, исключение: тут я пишу тексты исключительно по старинке, пальцами рук; pure organic product 🌱).

Город года: Алматы 🇰🇿🥰 Еще один центр силы за пределами РФ, где я мог бы вообразить свою жизнь вдолгую. О этот горизонт из гор! О эти широкие зеленые проспекты! О заросшие дикой вишней или яблоней дворы пятиэтажек! О панельки с национальными орнаментами! О позднесоветские модернистские высотные параллелепипеды в центре! О эти вайбы и понты быстрорастущей Москвы поздних нулевых!.. What’s not to like?

Инструмент года: тут все банально: VS Code 🧑‍💻(я только-только в этом году переполз писать код в IDE, а не где-то в случайных блокнотах) с автодописыванием кода от какой-то LLM (я пока настолько лох, что до сих пор не понял, кто именно там его дописывает.. там стоят Copilot и Codex, и хрен его поймешь, кто из них дописывает мой код и что именно они вызывают; но работает как магия).

Спорт года: дзюдо🥋 Хожу с ноября 2024 и до сих пор (с летним перерывом). Если вы раньше пробовали только бесконтактные/игровые виды спорта, то очень рекомендую что-то контактное. Первые разы прямо радикально новые ощущения: не просто преодолевать себя, а открывать в себе неразведанные запасы энергии, которые выбрасывает внезапно включившийся инстинкт самосохранения… 😅

Осознание года: наука — это шире, чем просто добыча знаний на пользу обществу. Наука — неизбежный плод развития разума🍏 Как сказал цифровой филолог Борис Ярхо еще в 1930-е, «наука существует не для чего, а почему». Потому что разумные люди нуждаются в том, чтобы сознавать себя и мир. Наука, даже если она будет автоматизирована, никуда не денется. И конечным потребителем знания будет человек, покуда существует человек как разумное существо.

В мире, где всё постоянно меняется, существование науки как института, сообщества и культурного явления стало для меня фундаментальной константой. На первом, персональном уровне меня стабилизирует семья (мой личный дом), на втором, профессиональном — наука (наш общий дом). За науку, котаны!🥂 За p-value и доверительный интервал!

🎄 Всех с наступающим! Вне зависимости от того, где и кем вы работаете, пусть ваш научный поиск будет успешным в 2026-м 🔭💫

Передаю эстафету Маше @ruscorpora_is_fun и Борису Валерьевичу @schonenrede
66🎄32❤‍🔥6🔥3👍2👏2🍾1
Молчание как метод: что говорит киношная Анна Каренина, когда она молчит 🤐🎬📊

Этой зимой нам всем «под елочку» среди прочего положили новый номер «Цифровых гуманитарных исследований» — журнала, твёрдо входящего в «большую единицу» (sic!) журналов по Digital Humanities в России. Номер вышел в декабре, и на новогодних каникулах я до него добрался😋

Там много любопытного: и про эмоциональную окраску русской драматургии (с линейными графиками для комедий и трагедий 📈📉) на данных из dracor.org, и про связывание музейных метаданных , и даже про то, как «академические племена» цифровых гуманитариев развились и построили феодализм эпистемическое сообщество.

Но самой интересной мне показалась статья Елизаветы Сенаторовой, где сравниваются две «Анны Каренины» — роман Льва Толстого 😎 и экранизация Александра Зархи. Сенаторова выгрузила реплики персонажей из текста и субтитров — и изучила, где кино вдруг замолкает и как это связано с текстом книги.

Почти все немые сцены связаны с Анной. Вокзал, театр, бессмысленный отъезд с Вронским в Италию, ну и, наконец, ночь перед самоубийством. Кроме меметично-автобиографической сцены покоса с Левиным-Толстым, все молчаливые сцены у Зархи — это молчащая одинокая Каренина. Как предполагает Елизавета Сенаторова (ссылаясь среди прочего на анализ Анны Карениной от Виктора Шкловского), экранизация романа здесь

транслирует идею одиночества Карениной, которая оказывается в безвыходном положении и не знает, к кому обратиться за помощью и с кем, что важно, поговорить («Она должна прийти к тем людям, которых она считает врагами. Она одинока» [Шкловский 1981, с. 119]).


Дальше в статье еще есть тематическое моделирование и прочие изыски. Но мне в работе дорог именно вот этот очень простой, но тем не менее научно продуктивный метод поиска и анализа пауз в фильме — и их наложение на сюжет и смыслы романа Толстого. Короче, очень симпатичная по своему исследовательскому дизайну работа на стыке литературоведения, кино и Digital Humanities!
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4426👍13💔3
Хоть электрическая интеллигенция и научилась с грехом пополам cчитать число букв “r” в слове 🍓strawberry🍓, всё-таки задачи, предполагающие точность сегментирования текста, ей все еще даются с трудом. А особенно когда накладывается переход между текстовой модальностью и пиксельно-картиночной.

Вот я тут попытался переделать свою давнишнюю картинку-объяснялку про N-граммы, простую как три копейки, под немецкие реалии. На первом изображении платная ChatGPT, на втором хваленая гугловская Nano Banana Pro, а результат, как видите, один — неудовлетворительный.

Попытка указать на ошибки (картинки 3 и 4), как видите, тоже не принесла результатов. Дальше пробовать не стал — на мой взгляд, тут уже достигнута точка, когда проще руками.

Этим утром счет в моем личном матче “Человек vs ИИ” — 1:0 🤷
28🏆14😱6👍3😁1
Культурный датасайнс (Даня Скоринкин)
Хоть электрическая интеллигенция и научилась с грехом пополам cчитать число букв “r” в слове 🍓strawberry🍓, всё-таки задачи, предполагающие точность сегментирования текста, ей все еще даются с трудом. А особенно когда накладывается переход между текстовой модальностью…
UPD: в гугловской AI Studio при включенном “code execution” тот же самый промт заставляет модельку таки выдать правильную картинку 👍 Там она вместо косячной (в данном случае) прямой генерации изображения пишет код для отрисовки нужных рамок поверх текста программными средствами.

Спасибо читателю Илье А. за указание на это. Я воспроизвел — и доволен. Ну, собственно, ради таких советов от более продвинутых читателей и пишутся такие посты.

Итого этим вечером счет в матче “Человек vs ИИ” уже 1:1
Please open Telegram to view this post
VIEW IN TELEGRAM
30❤‍🔥14🏆10👍4
Народ безмолвствует, а граф — говорит: сети интриг Пушкина в «Борисе Годунове»

Одним из сильнейших текстов русской литературы я считаю драму Пушкина «Борис Годунов». Это та самая, где шапка Мономаха тяжела, у царя в глазах кровавые мальчики, а народ безмолвствует. Та, после которой Пушкин, по собственным словам, «бил в ладоши и кричал, ай да Пушкин, ай да сукин сын». Пьеса об убийственной природе власти, которую и 200 лет спустя можно читать как актуальный гайд по русской политической культуре:

Чем кончится? Узнать не мудрено:
Народ еще повоет да поплачет,
Борис еще поморщится немного,
Что пьяница пред чаркою вина,
И наконец по милости своей
Принять венец смиренно согласится;
А там — а там он будет нами править
По-прежнему.


В 2011 году Владимир Мирзоев снял по «Борису Годунову» кино в декорациях современной Москвы — и пушкинский текст в устах мрачных воротил на «Мерседесах» в дорогих костюмах и темных очках звучит органично до оторопи. Смотришь и думаешь: действительно, страна, в которой за 10 лет меняется все, а за 200 лет — ничего.

Для формы «Бориса Годунова» важно, что Пушкин опирался на драмы Шекспира.

я расположил свою трагедию по системе Отца нашего Шекспира


«Борис Годунов» действительно построен по Шекспировской модели: белый стих с прозаическими вставками, соседство высокой трагедии с базарно-площадным фарсом, свобода перемещения во времени и пространстве. Единства места, времени и действия, предписанные классицизмом, отставлены Пушкиным в сторону: события происходят с 1598 по 1605 год, действие постоянно перемещается между Москвой и Польшей, царскими палатами и народной площадью, тихой кельей и полем битвы.

Такое устройство делает пьесу интересным объектом для сетевого анализа. Если представить все контакты между персонажами в виде сети (графа), то, во-первых, хорошо видны два ключевых пространства пьесы — Москва и Польша, откуда на Бориса идет войной Лжедмитрий (Григорий Отрепьев). А во-вторых, можно измерить сетевые центральности персонажей и увидеть уникальную позицию второстепенного на первый взгляд персонажа Гаврилы Пушкина.

Не то чтобы Гаврилу Пушкина совсем не замечали — однофамилец автора в тексте заведомо привлекает внимание (а тут этих однофамильцев аж два: реально существовавший Гаврила Пушкин и его выдуманный дядя Афанасий). О роли Гаврилы писали такие солидные комментаторы, как Г.О. Винокур и Л.М. Лотман. Но у той же Лотман Гаврила проходит в общем ряду «интригующих» аристократов, через запятую после Шуйского. А вот сетевой анализ раскрывает его уникальную роль.

Гаврила Пушкин, который вообще-то появляется и говорит в пьесе гораздо реже, чем тот же Шуйский (не говоря уже о главных героях: Борисе и Григории-Лжедмитрии), занимает в социальной сети пьесы позицию «связующего». Формально она характеризуется очень высокой промежуточностью (betweenness centrality). Это такой формальный показатель, для которого считается, сколько путей всей сети проходит через узел. Кстати, по этому показателю иногда ловят шпионов в исторической переписке.

В визуализации выше видно, что причина — промежуточное положение Гаврилы между Москвой и Польшей. И действительно, именно Гаврила обеспечивает «неформальные контакты» между враждующими полюсами пьесы: сначала через дядю, а потом и сам, появляясь в стане московского войска и переманивая лучшего воеводу, Басманова, на сторону самозванца-претендента… чем и обеспечивает его восхождение на престол в конце.

Если вспомнить, что для самого А.С. Пушкина важен личный миф о причастности рода Пушкиных к русской истории («мы к оной руку приложили»), такое встраивание Гаврилы в конструкцию «Бориса Годунова» не удивляет. Но для цифровых методов отрадно, что его роль высвечивается именно в сетевом «экстракте» пьесы. Тогда как при чтении Пушкинского текста Гаврила может теряться среди прочих, говоря словами Лотман, «аристократов в бесконечных интригах».

P.S.Скачать сеть пьесы в машиночитаемой форме можно с DraCor (моя визуализация сделана именно на их данных). Там же есть и простенькая отрисовка.
47👍24👏8❤‍🔥3
Media is too big
VIEW IN TELEGRAM
Джеймс Бонд, Криминальное чтиво или порно: кто быстрее и ярче?

🎥 Зимой к нам в Потсдам заезжал исследователь кино из Италии. Мы немножко помогли ему с цифровыми методами, а он поделился разными штуками из мира кино. В частности, показал нам сайт cinemetrics с прикольными визуалиациями динамики цвета и подвижности в разных фильмах.

🔄 Каждый фильм тут — круг, в котором действие разложено по часовой стрелке. На 12 начало, на 11 конец. Цвета — по умолчанию это спектр цветов для всего фильма (очень узнаваемый зеленый у “Матрицы”, ну и мармеладные тона Уэса Андерсона), но я советую включить Chapter colors, тогда будет свой спектр для каждого фрагмента фильма (фрагмент здесь — это 10 монтажных кадров). Так интереснее.

А главное, фрагменты дрыгаются вверх-вниз в зависимости от того, насколько фрагмент динамичен, сколько в кадре движения. Это, во-первых, позволяет сравнивать фильмы между собой. Например, потрясающий контраст между самым первым фильмом про Джеймса Бонда (“Доктор Ноу”, 1962) и “Квантом милосердия” из 2009. Во втором все движется быстрее раз в 10. Но вот более старый “Солярис” Тарковского (1972) выглядит динамичнее “Соляриса” Содерберга (2002). На сайте как раз удобно посмотреть на 2 фильма рядом 🌀 🌀

📷 Еще в каждом фильме можно кликать на фрагменты — и видеть прямо конкретные кадры*. Так можно сориентироваться, что это за сверх-подвижная сцена перед вами: погоня, перестрелка, драка, любовь…

☸️Во-вторых, так можно сравнивать динамику внутри фильма. Например, в “Хорошем, плохом, злом” хорошо видно ускорение в момент финального ковбойского standoff на троих, ну, который под ту самую музыку Морриконе со свистелками. Вообще, часто видна погоня и стрельба. Ну и да, порно предсказуемо движется гораздо быстрее ближе к концу. А вот спектр цветов в порно более разнообразный в начале — там, видимо, еще есть немного одежды👙 Далее спектр цветов очень предсказуемый (см. конец моего видео-скринкаста выше).

* Для порно на сайте демонстрация конкретных кадров, разумеется, отключена ¯\_(ツ)_/¯
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥50👍115🕊5
Ходит ли ИИ пешком на автомойку?

На этой неделе завирусился промт, якобы снова демонстрирующий что ИИ “все еще тупой”. Выглядит он так:

The car wash is 40m from my home. I want to wash my car. Should I walk or drive there?


То есть: автомойка в 40 метрах от меня. Я хочу помыть машину. Ехать или идти пешком?

Скриншоты того, как ChatGPT советует пользователям прогуляться до мойки машин пешком ради собственного здоровья и окружающей среды, заполонили интернет. Правда, быстро выяснилось две вещи.

1️⃣ Во-первых, это работает в основном в моделях без рассуждений, и то не во всех. Я попробовал сейчас: идти пешком посоветовали быстрая версия Claude Sonnet 4.6 и ChatGPT 5.2, тогда как Gemini 3 даже в режиме Fast сказала “едь на машине, ведь в ее помывке весь смысл предприятия” (“Since your goal is to have the car washed, walking there would mean leaving the vehicle at home, which defeats the purpose of the trip“).

При переходе на рассуждающие модели Claude Sonnet 4.6 тоже переобулся и посоветовал ехать, с той же аргументацией, что и Gemini (“Walking there is fine for you, but you'd need to drive the car back anyway since that's the whole point!”). У меня только ChatGPT 5.2 даже в думающей версии настаивал на целительной ходьбе.

2️⃣Во-вторых, даже быстрой дешевой модели достаточно легонько и без деталей намекнуть на подвох. Я добавил всего лишь Hint: that's a riddle

С этой подсказкой самая обычная “нерассуждающая ChatGPT” тут же переобулась.

If the car wash is only 40 meters from your home, the obvious thought is: walk. It’s basically next door.
But if you walk, how will your car get to the car wash?
You want to wash your car, so you have to bring it there.
👉 You should drive.
Even though it’s only 40 meters, the car won’t magically follow you if you walk 😉


3️⃣ Ну а в третьих, я слышал как минимум один диалог, в котором живой человек, которому внезапно задали этот самый вопрос из промта, тоже на автомате предложил идти пешком. И это, мне кажется, ключевое: этот промт показывает как раз не то, что ИИ как-то радикально тупее (в отличие от многих прежних вирусных промтов), а наоборот, что нынешние модели совершают ошибки, похожие на ошибки человека, выдающего быстрый и неверный ответ (привет, Канеман!). И точно так же, как человека, модель легко подправить самой ничтожно подсказкой (Hint: that's a riddle), которая заставит чуть-чуть задуматься…

❗️ Это не значит, что ИИ не “тупой”. В каком-то (хотя и уже очень специфическом) смысле все еще тупой. Там действительно по-прежнему смесь гениального знания всех наук, богоподобных способностей в целом ряде интеллектуальных навыков вроде программирования — и неожиданных провалов в самой базовой логике / понимании мира. Но вот конкретно этот завирусившийся промт, на мой взгляд, как раз скорее демонстрация весьма успешной эмуляции именно что человеческого мышления с его плюсами и минусами. А не наоборот.
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍48🔥167👾6👀4❤‍🔥3
Эволюция заглавий русских романов (1763–1917): вычислительный анализ преемственности и новаторства — 11 марта онлайн

Одна из главных книг в фундаменте современной цифровой/количественной/компьютерной филологии — Distant Reading Франко Моретти. Та самая, где Моретти буквально призвал филологов «перестать читать книги» (представьте, что тут началось😅) и вместо этого начать считать, картографировать и визуализировать. Это тогда многих вдохновило.

Правда, в самой книге Моретти не так много настоящих примеров честного количественно-компьютерного Distant Reading. И на мой взгляд, единственная глава там, которая тянет на прямо «цифровое исследование» литературы — это Style, Inc.: Reflections on 7,000 Titles (изначально опубликованная как статья в 2009). В этой работе Моретти изучает эволюцию 7000 заглавий британских романов с 1740 по 1850 год. Там есть довольно скучная и спорная часть про сокращение длины этих заглавий (для чего у марксиста Моретти есть рыночно-экономическая интерпретация в духе «романы теперь продавались через рецензии в газетах, и там короткие названия помещались лучше») — и более интересная часть про лингвистическое устройство этих заглавий.

Например, Моретти показал, что заглавия с одиночным существительным без прилагательных обычно очень экзотические, типа «Пират», «Вампир» или «Огнеглотатель», а вот в заглавиях с прилагательными вся необычность/неординарность уходит в прилагательное («Отвергнутая дочь», «Неверный муж»). А еще Моретти вытащил из этих 7000 заглавий очень популярную формулу «The X of Y», которую особенно любил готический роман (The Castle of Otranto, The Horrors of Oakendale Abbey). Иксами тут чаще всего оказываются люди и обозначения мест, игреками — почти исключительно места.

Но это все дела минувших дней. А сейчас радость состоит в том, что с недавних пор у нас есть Style Inc. дома!🎉 А именно, команда исследователей в Вышке, которая занимается заглавиями русских романов в той же парадигме. Их первая статья, где вcлед за Моретти исследовалось изменение длины заглавий, вышла в 2023 году, см.

Челнокова Д. А., Вдовин А. В., Орехов Б. В. Как «толстый» журнал изменил заглавия русских романов: эволюция 2000 заглавий (1763–1917) // Slověne. 2023. Т. 12, № 2. C. 143–167.

(там интересно про связь динамики длины названий со взлетом «толстых журналов» в середине 19 века. Авторы показывают, что сначала сжались именно заглавия журнальных романов, а уж потом, заметно позже, — тех, что публиковались отдельными книжками).

А сейчас наготове продолжение этого исследования, в котором Д.А. Челнокова смотрит уже непосредственно на тексты заглавий русских романов и как эти самые тексты и формулы в них эволюционировали. Причем смотрит с применением разной компьютерно-лингвистической аппаратуры: SBERT для сравнения семантической близости заглавий, N-граммы и POS-теггинг для выявления грамматических формул.

В частности, в исследовании хорошо показано, что многие известные классические формулы заглавий («…нашего времени», «история одного…», «жизнь и приключения…», «X и Y»…) появились в заглавиях русских романах раньше, чем прославившие эти формулы тексты вроде «Героя нашего времени». Но знаковые тексты заставляют эти формулы работать иначе, чем раньше. То есть типовая формула «история одного…» после «Истории одного города» Салтыкова-Щедрина воспринимается и работает уже не так, как раньше.

А еще там интересно про эволюцию заглавий от прямых копирований британских образцов во второй половине 18 века (типа «Награжденная постоянность, или Приключения Лизарка и Сарманды») — к появлению очень самобытных моделей заглавий вроде вопросительных «Кто виноват?», «Что делать?», «Чья вина?» или предложных типа «На ножах», «В тине адвокатуры»,«На обрывах Поволжья» «Через край». Такое почти не встречается в западных романах того времени.

🎪 Послушать про эти и другие находки можно будет в среду, 11 марта, в 15 по Москве / 13 по CET. Я тоже буду на докладе в роли, эм, дискутанта, что бы это ни значило… но попробуем сделать это весело! 🎪 Ведь наша наука — веселое ремесло

Заходите!
Please open Telegram to view this post
VIEW IN TELEGRAM
50🔥23👍8👀2