От пергамента к данным: зачем размечать средневековые грамоты
Оцифровка средневековых грамот уже давно не ограничивается сканированием и публикацией изображений. Чтобы исследовать целый корпус документов, нужно сравнивать десятки актов, отслеживать устойчивые формулы, связывать оригиналы и копии. Для этого используют TEI-разметку, специальные словари и Semantic Web. В новой статье рассказываем, как устроены базы древних документов.
Что такое грамота и зачем ее изучает дипломатика
Средневековые грамоты фиксировали дарения, продажи, привилегии, судебные решения и распоряжения о земле, воде и правах. Дипломатика изучает не только содержание акта, но и то, как он был оформлен письменно, как составлялся, передавался и сохранялся. Для этого исследователи обращают внимание на оригиналы и копии, печати, подписи, датировку и другие признаки.
TEI, VID и Semantic Web — три инструмента для одной задачи
Скан делает документ доступным, транскрипция — читаемым. Но они не позволяют автоматически сопоставлять имена, даты, места, формулы или типы актов в корпусе из сотен документов. Разметка превращает эти элементы в сопоставимые данные и сохраняет сложность источника в цифровой форме.
TEI задает язык машиночитаемой разметки: с его помощью можно выделять имена, даты, места, исправления и другие особенности текста. VID — международный словарь дипломатической терминологии, а Semantic Web позволяет представить грамоту как сеть связанных сущностей: автора, адресата, свидетелей, место, дату, печать, копию и архивную единицу.
Как устроены базы сербских и каталонских грамот
Проект Medieval Serbian Charters Action при Грацском университете — это база сербских средневековых грамот. Корпус включает около 600 документов, в том числе 330 грамот правителей конца XII — середины XV века; большинство написано на старосербском, около 20% — на греческом и латинском.
Для исследователя Каталонии особенно важны материалы Архива Короны Арагона. Ресурс объединяет грамоты, регистры, картулярии, делопроизводственную документацию, описания фондов и цифровые изображения. Он прежде всего служит каталогом и точкой доступа к документам.
Что такое картулярии
Для цифрового корпуса важно размечать не только отдельные грамоты, но и их место в картулярии — рукописном сборнике копий документов. Например, картулярий Liber Feudorum Maior включает документы IX–XII веков и отражает отношения между графами Барселонскими, позднее королями Арагона, и их вассалами. Если сохранить порядок документов, тематические группы и связи с территориями и участниками, картулярий можно изучать как сложную документальную систему.
Какие вопросы можно задавать цифровым корпусам грамот
Такие корпусы позволяют задавать вопросы о формулах пожалований, свидетелях, оригиналах и копиях, а также связывать документы с картами, просопографическими базами и архивными каталогами. Скан дает изображение, транскрипция — текст, а разметка позволяет сохранить грамоту как часть более широкой системы.
Какие исторические сюжеты раскрывают корпусы цифровых грамот, можно узнать из полной версии материала.
Время чтения: 10 минут
🤖 «Системный Блокъ» @sysblok
Оцифровка средневековых грамот уже давно не ограничивается сканированием и публикацией изображений. Чтобы исследовать целый корпус документов, нужно сравнивать десятки актов, отслеживать устойчивые формулы, связывать оригиналы и копии. Для этого используют TEI-разметку, специальные словари и Semantic Web. В новой статье рассказываем, как устроены базы древних документов.
Что такое грамота и зачем ее изучает дипломатика
Средневековые грамоты фиксировали дарения, продажи, привилегии, судебные решения и распоряжения о земле, воде и правах. Дипломатика изучает не только содержание акта, но и то, как он был оформлен письменно, как составлялся, передавался и сохранялся. Для этого исследователи обращают внимание на оригиналы и копии, печати, подписи, датировку и другие признаки.
TEI, VID и Semantic Web — три инструмента для одной задачи
Скан делает документ доступным, транскрипция — читаемым. Но они не позволяют автоматически сопоставлять имена, даты, места, формулы или типы актов в корпусе из сотен документов. Разметка превращает эти элементы в сопоставимые данные и сохраняет сложность источника в цифровой форме.
TEI задает язык машиночитаемой разметки: с его помощью можно выделять имена, даты, места, исправления и другие особенности текста. VID — международный словарь дипломатической терминологии, а Semantic Web позволяет представить грамоту как сеть связанных сущностей: автора, адресата, свидетелей, место, дату, печать, копию и архивную единицу.
Как устроены базы сербских и каталонских грамот
Проект Medieval Serbian Charters Action при Грацском университете — это база сербских средневековых грамот. Корпус включает около 600 документов, в том числе 330 грамот правителей конца XII — середины XV века; большинство написано на старосербском, около 20% — на греческом и латинском.
Для исследователя Каталонии особенно важны материалы Архива Короны Арагона. Ресурс объединяет грамоты, регистры, картулярии, делопроизводственную документацию, описания фондов и цифровые изображения. Он прежде всего служит каталогом и точкой доступа к документам.
Что такое картулярии
Для цифрового корпуса важно размечать не только отдельные грамоты, но и их место в картулярии — рукописном сборнике копий документов. Например, картулярий Liber Feudorum Maior включает документы IX–XII веков и отражает отношения между графами Барселонскими, позднее королями Арагона, и их вассалами. Если сохранить порядок документов, тематические группы и связи с территориями и участниками, картулярий можно изучать как сложную документальную систему.
Какие вопросы можно задавать цифровым корпусам грамот
Такие корпусы позволяют задавать вопросы о формулах пожалований, свидетелях, оригиналах и копиях, а также связывать документы с картами, просопографическими базами и архивными каталогами. Скан дает изображение, транскрипция — текст, а разметка позволяет сохранить грамоту как часть более широкой системы.
Какие исторические сюжеты раскрывают корпусы цифровых грамот, можно узнать из полной версии материала.
Время чтения: 10 минут
Please open Telegram to view this post
VIEW IN TELEGRAM
❤17🔥7🤩3👍1
От переводчика до AI-тренера: как меняются профессии в эпоху больших языковых моделей
В новом материале рассказываем, как меняются привычные профессии и какие новые роли появляются на рынке труда. А еще бонус — интервью с AI-тренером.
Паниковать или готовиться к переменам?
Регулярно выходят исследования о том, как ИИ меняет рынок труда. По данным отчета Future of Jobs 2025, к 2030 году из-за автоматизации исчезнет 92 миллиона рабочих мест — но появится 170 миллионов новых.
Аналитики Anthropic говорят не о полной автоматизации, а о гибридизации: ИИ берет на себя сбор данных, поиск опечаток и генерацию шаблонов, человек отвечает за фактчекинг, этический контроль и творческие решения. Около 80% компаний планируют обучать сотрудников работе с ИИ, а не увольнять их.
Как меняются привычные профессии
Привычные специальности не исчезают — они адаптируются. Например, переводчик все больше занимается локализацией и культурной адаптацией текста. Технический писатель отвечает за структуру, логику и понятность документации, но готовит текст с помощью ИИ. Программист делегирует написание кода языковым моделям, сосредотачиваясь на архитектуре и тестировании.
Новые профессии
Вместе с ИИ появились роли, которых раньше не существовало.
Промпт-инженер проектирует запросы для языковых моделей, создает масштабируемые инструкции и настраивает работу моделей с внешними источниками данных.
AI-тренер — «учитель» нейросети: пишет эталонные ответы на сложные запросы, оценивает и ранжирует выводы модели по степени полезности, безопасности и достоверности.
ИИ-копирайтер выстраивает алгоритм генерации через ИИ-агентов, проводит фактчекинг и адаптирует результат под конкретную аудиторию.
Лингвист-аналитик оценивает качество генерации, выявляет системные ошибки нейросетей и разрабатывает метрики оценки.
Специалист по этике данных следит за безопасностью и ответственностью ИИ-систем: снижает предвзятость алгоритмов, контролирует атрибуцию источников и фильтрует токсичный контент.
Как это выглядит изнутри: AI-тренер
Андрей Мужщинский тренирует ИИ уже 2,5 года — до этого около 20 лет работал в журналистике и спичрайтинге. По его словам, навыки работы с информацией оказались напрямую применимы:
О будущем профессии Андрей рассуждает без паники:
Больше о новых профессиях и о том, как и чему учиться, когда меняется рынок труда, — в полной версии материала.
Время чтения: 10 минут
🤖 «Системный Блокъ» @sysblok
В новом материале рассказываем, как меняются привычные профессии и какие новые роли появляются на рынке труда. А еще бонус — интервью с AI-тренером.
Паниковать или готовиться к переменам?
Регулярно выходят исследования о том, как ИИ меняет рынок труда. По данным отчета Future of Jobs 2025, к 2030 году из-за автоматизации исчезнет 92 миллиона рабочих мест — но появится 170 миллионов новых.
Аналитики Anthropic говорят не о полной автоматизации, а о гибридизации: ИИ берет на себя сбор данных, поиск опечаток и генерацию шаблонов, человек отвечает за фактчекинг, этический контроль и творческие решения. Около 80% компаний планируют обучать сотрудников работе с ИИ, а не увольнять их.
Как меняются привычные профессии
Привычные специальности не исчезают — они адаптируются. Например, переводчик все больше занимается локализацией и культурной адаптацией текста. Технический писатель отвечает за структуру, логику и понятность документации, но готовит текст с помощью ИИ. Программист делегирует написание кода языковым моделям, сосредотачиваясь на архитектуре и тестировании.
Новые профессии
Вместе с ИИ появились роли, которых раньше не существовало.
Промпт-инженер проектирует запросы для языковых моделей, создает масштабируемые инструкции и настраивает работу моделей с внешними источниками данных.
AI-тренер — «учитель» нейросети: пишет эталонные ответы на сложные запросы, оценивает и ранжирует выводы модели по степени полезности, безопасности и достоверности.
ИИ-копирайтер выстраивает алгоритм генерации через ИИ-агентов, проводит фактчекинг и адаптирует результат под конкретную аудиторию.
Лингвист-аналитик оценивает качество генерации, выявляет системные ошибки нейросетей и разрабатывает метрики оценки.
Специалист по этике данных следит за безопасностью и ответственностью ИИ-систем: снижает предвзятость алгоритмов, контролирует атрибуцию источников и фильтрует токсичный контент.
Как это выглядит изнутри: AI-тренер
Андрей Мужщинский тренирует ИИ уже 2,5 года — до этого около 20 лет работал в журналистике и спичрайтинге. По его словам, навыки работы с информацией оказались напрямую применимы:
«Найти данные, проанализировать их, профактчекать, написать текст понятным языком — все это пригодилось и в работе AI-тренером».
О будущем профессии Андрей рассуждает без паники:
«Нейросеть уже сейчас хорошо творит, складно и красиво пишет, и многие рутинные задачи будут автоматизироваться еще больше. Но без участия человека всё равно никак не обойтись. Кто-то должен контролировать работу, вовремя замечать сбои, оперативно вмешиваться и исправлять ошибки».
Больше о новых профессиях и о том, как и чему учиться, когда меняется рынок труда, — в полной версии материала.
Время чтения: 10 минут
Please open Telegram to view this post
VIEW IN TELEGRAM
❤22👍9🤡4👾4🤔2🦄2
Как самостоятельно учить иностранный язык?
Выбираете между зеленой совой, карточками и «умными» чат-ботами? Набор инструментов для изучения языка меняется вместе с уровнем — от игровых приложений и интервального повторения до языковых корпусов и работы со стилистическими нюансами. В новой статье рассказываем, что использовать на каждом этапе — от A1 до C2.
А1: закладываем базу
Определите свой уровень с помощью бесплатных онлайн-тестов или шкалы CEFR. На A1 важно заложить базу — освоить базовую лексику и простую грамматику, привыкнуть к звучанию языка и сформировать привычку заниматься регулярно. Для этого подойдут Duolingo, Busuu и LingoDeer, а для слов — Anki с интервальным повторением и Drops с визуальными ассоциациями.
A2: подключаем ИИ-диалог
На уровне A2 словарный запас составляет примерно 1000–1200 слов, и уже можно учиться строить связные высказывания и разбирать речь носителей в привычных ситуациях. Для этого ИИ-собеседники помогают моделировать ситуации, объяснять грамматику и тренировать речь, но эффективнее работать с ними по конкретной задаче — например, отрабатывать сцену в аэропорту — и ограничивать сессию 10–15 минутами. Для чтения и аудирования пригодятся LingQ, Smart Book, Clozemaster и Language Reactor.
B1: общаемся в тандеме и ведем дневник
На уровне B1 главное — преодолеть языковой барьер, перейти к связной речи и развить навык понимания из контекста. Здесь ИИ стоит дополнять общением с реальными носителями через HelloTalk или Tandem, а произношение тренировать с помощью YouGlish. Письменную практику можно строить вокруг дневника: писать 5–10 предложений в день, проверять их через Grammarly, LanguageTool или DeepL Write и разбирать ошибки.
B2: переходим к аутентичному языку
На уровне B2 стоит перейти к неадаптированному контенту — книгам, новостям, блогам, лекциям, фильмам и подкастам для широкой аудитории. В процессе важно учиться понимать незнакомую лексику по контексту и активно слушать, используя паузы, повторы и транскрипции. В разговорной практике нужно переходить к абстрактным темам и дискуссиям, а для улучшения произношения использовать технику повторения за диктором («shadowing»).
C1–C2: от свободного владения к виртуозному
На продвинутых уровнях неформальная речь носителей по-прежнему может быть трудной из-за контекста, метафор, аллюзий, игры слов и быстро меняющегося сленга. Здесь помогают соцсети, стендапы и Urban Dictionary, а для проверки частотности и сочетаемости слов — Google Books Ngram Viewer и языковые корпусы BNC, DeReKo, Frantext, CREA и НКРЯ. Можно переходить к классической литературе и сложным текстам, а для работы над письмом и произношением использовать ProWritingAid и The Speech Accent Archive — на этом этапе инструменты помогают разобраться в конкретных языковых нюансах.
А более детальный разбор стратегии изучения языка вы найдете в полной версии.
Время чтения: 20 минут
🤖 «Системный Блокъ» @sysblok
Выбираете между зеленой совой, карточками и «умными» чат-ботами? Набор инструментов для изучения языка меняется вместе с уровнем — от игровых приложений и интервального повторения до языковых корпусов и работы со стилистическими нюансами. В новой статье рассказываем, что использовать на каждом этапе — от A1 до C2.
А1: закладываем базу
Определите свой уровень с помощью бесплатных онлайн-тестов или шкалы CEFR. На A1 важно заложить базу — освоить базовую лексику и простую грамматику, привыкнуть к звучанию языка и сформировать привычку заниматься регулярно. Для этого подойдут Duolingo, Busuu и LingoDeer, а для слов — Anki с интервальным повторением и Drops с визуальными ассоциациями.
A2: подключаем ИИ-диалог
На уровне A2 словарный запас составляет примерно 1000–1200 слов, и уже можно учиться строить связные высказывания и разбирать речь носителей в привычных ситуациях. Для этого ИИ-собеседники помогают моделировать ситуации, объяснять грамматику и тренировать речь, но эффективнее работать с ними по конкретной задаче — например, отрабатывать сцену в аэропорту — и ограничивать сессию 10–15 минутами. Для чтения и аудирования пригодятся LingQ, Smart Book, Clozemaster и Language Reactor.
B1: общаемся в тандеме и ведем дневник
На уровне B1 главное — преодолеть языковой барьер, перейти к связной речи и развить навык понимания из контекста. Здесь ИИ стоит дополнять общением с реальными носителями через HelloTalk или Tandem, а произношение тренировать с помощью YouGlish. Письменную практику можно строить вокруг дневника: писать 5–10 предложений в день, проверять их через Grammarly, LanguageTool или DeepL Write и разбирать ошибки.
B2: переходим к аутентичному языку
На уровне B2 стоит перейти к неадаптированному контенту — книгам, новостям, блогам, лекциям, фильмам и подкастам для широкой аудитории. В процессе важно учиться понимать незнакомую лексику по контексту и активно слушать, используя паузы, повторы и транскрипции. В разговорной практике нужно переходить к абстрактным темам и дискуссиям, а для улучшения произношения использовать технику повторения за диктором («shadowing»).
C1–C2: от свободного владения к виртуозному
На продвинутых уровнях неформальная речь носителей по-прежнему может быть трудной из-за контекста, метафор, аллюзий, игры слов и быстро меняющегося сленга. Здесь помогают соцсети, стендапы и Urban Dictionary, а для проверки частотности и сочетаемости слов — Google Books Ngram Viewer и языковые корпусы BNC, DeReKo, Frantext, CREA и НКРЯ. Можно переходить к классической литературе и сложным текстам, а для работы над письмом и произношением использовать ProWritingAid и The Speech Accent Archive — на этом этапе инструменты помогают разобраться в конкретных языковых нюансах.
А более детальный разбор стратегии изучения языка вы найдете в полной версии.
Время чтения: 20 минут
Please open Telegram to view this post
VIEW IN TELEGRAM
❤31🔥26❤🔥9
«Сад расходящихся рейтингов»: почему ни один книжный топ в России не совпадает с другим?
Абсолютный лидер библиотечных запросов в России — автор, которого нет ни в одном топе маркетплейсов. В онлайн-архивах чаще всего скачивают классику, а читателей самиздата почти не интересуют романтические произведения.
Мы сравнили 1645 позиций из топов магазинов, библиотек, самиздата и онлайн-архивов за 2025 год и нашли четыре разные книжные вселенные.
Самые интересные выводы исследования мы собрали в карточках, а полную версию читайте на сайте.
Время чтения: 10 минут
🤖 «Системный Блокъ» @sysblok
Абсолютный лидер библиотечных запросов в России — автор, которого нет ни в одном топе маркетплейсов. В онлайн-архивах чаще всего скачивают классику, а читателей самиздата почти не интересуют романтические произведения.
Мы сравнили 1645 позиций из топов магазинов, библиотек, самиздата и онлайн-архивов за 2025 год и нашли четыре разные книжные вселенные.
Самые интересные выводы исследования мы собрали в карточках, а полную версию читайте на сайте.
Время чтения: 10 минут
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤31🔥14❤🔥10👍2
🎬 В отечественных фильмах женщины все еще рискуют оказаться «для галочки». Ко Дню российского кино перевыпускаем наше дата-исследование о принципе Смурфетты: почти 40% русскоязычных фильмов имеют перекос в сторону мужских персонажей.
Самые интересные выводы мы собрали в карточках, а полную версию читайте на сайте.
Время чтения: 15 минут
🤖 «Системный Блокъ» @sysblok
Самые интересные выводы мы собрали в карточках, а полную версию читайте на сайте.
Время чтения: 15 минут
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤17💔8❤🔥5🤡5👍1