Ivan Begtin
9.12K subscribers
2.72K photos
5 videos
116 files
5.58K links
I write about Open Data, Data Engineering, Government, Privacy, Digital Preservation and etc.

CTO&Founder of Dateno https://dateno.io

Telegram @ibegtin
Facebook - https://facebook.com/ibegtin
Email ivan@begtin.tech

Ads/promotion agent: @k0shk
Download Telegram
Reuters пишут о том что власти Китая собрали местные AI компании/стартапы и обсуждали ограничения на наиболее продвинутые модели для не-китайских пользователей. Звучит очень похоже на то что происходит в США с ограничениями на последние модели от Anthropic и OpenAI с той лишь разницей что открытые китайские модели сейчас стремительно набрали популярность и ограничения на их доступность затронут многих.

Правда врядли уже опубликованные модели будут удалять, скорее новые могут будут проходить дополнительные проверки и ограничения.

В целом в мире сейчас ситуация такая что есть два центра (две юрисдикции) откуда исходят наиболее продвинутые ИИ модели - это США и Китай и в обеих этих юрисдикциях безопасность выходит на первый план. А это может повлиять и на скорость выхода новых моделей, и на попытки построения агентских продуктов которые ограничения моделей могут/будут пытаться преодолевать, типа Sakana AI и еще на многое другое.

#ai #thoughts
👍963😢2🗿1
Я тут задумался над одной из главных проблем большей части проектов/порталов с открытыми данными. Они очень редко существуют в понятиях дата продуктов (продуктов данных). Хотя, по своей сути, являются их подвидом. Должны бы являться, в каком-то идеальном мире.

В реальности оказывается что только лучшие из порталов вроде французского имеют приближение к этому.

Гораздо ближе к дата продуктам коммерческие порталы с данными, отдельные госпроекты где доступность данных - это одна из форма доступа к ним и коммерческие дата продукты.

Поэтому важный тезис в том что продукт данных (дата продукт) можно превратить в семантические слои, ну или расширить в это направление, а данные на типовом портале открытых данных нельзя. Там почти полный отрыв от контекста, задач, пользователей, метрик и коммуникации с владельцем данных, если он вообще есть.

Все это к тому что преобразование порталов открытых данных в AI-готовые продукты ограничено тем что дата продуктов на них мало, метаданные не адаптированы для работы ИИ агентов и, в целом, требуются отдельные и существенные усилия чтобы строить на них семантические слои.

Картинка для привлечения внимания, честно переведена с помощью LLM, а тут первоисточник

#opendata #ai #thoughts #dataengineering #datacatalogs
💯5🔥43🤔1😢1
Для тех кто любит думать и читать про будущее свежий доклад Правительства Великобритании со Сценариями развития ИИ до 2030 года.

Текст большой и подробный, ключевые выводы такие.

1. Возможности ИИ продолжат расти. Уже в 2026 году системы действуют весьма автономно и превосходят экспертов в отдельных областях. К 2030 году ожидается ещё большая автономность и способность выполнять более широкий круг когнитивных и профессиональных задач — даже при замедлении темпов прогресса рост возможен за счёт лучшей интеграции и «упаковки» существующих систем в продукты.

2. ИИ может принести масштабные позитивные эффекты: рост производительности и экономики, более широкий доступ к эффективным госуслугам, ускорение научных прорывов (например, в здравоохранении и энергетике). Для британского бизнеса потенциал значителен — ИИ рассматривается как основной будущий источник роста производительности Великобритании.

3. Без вмешательства государства ИИ может привести к серьёзному, в том числе экзистенциальному, вреду. Усилятся существующие риски и появятся новые: кибератаки с использованием ИИ, его «двойное назначение» в науке, выход систем из-под контроля человека, зависимость людей от ИИ. По мере роста возможностей систем оценивать их безопасность и эффективность станет сложнее.

4. Существенное влияние на когнитивный труд. К 2030 году возможно значительное вытеснение рабочей силы, но одновременно ИИ будет дополнять и усиливать часть работников, положительно влияя на их зарплаты и карьерные возможности. Даже при более скромных сценариях характер труда изменится: рутинные, исполнительские задачи будут всё активнее автоматизироваться.

5. Рынок передовых моделей ИИ, вероятно, останется высококонцентрированным. Несколько крупных технологических компаний уже доминируют в разработке фронтирных систем, и эта тенденция скорее усилится. Основная выгода будет доставаться этим фирмам, владельцам капитала и контролёрам ключевых ресурсов, что может усиливать неравенство. При этом «за фронтиром» многие возможности ИИ станут более доступными и массово встроенными в разные сценарии использования.

6. Внедрение ИИ продолжит расти, но неравномерно. Коммерческие стимулы и требования нацбезопасности, а также рост автономности и надёжности систем ведут к быстрому и широкому внедрению в большинстве сценариев. Но во всех сценариях сохраняются барьеры, из-за чего скорость и масштаб внедрения будут различаться между организациями, отраслями и странами — это может усиливать неравенство.

7. Глобальная конкуренция сохранится, экономики всё больше зависят от технологий как источника роста, формируются сферы влияния во главе с США и Китаем. Судьба стран вне технологического фронтира будет зависеть от доступа к технологиям, партнёрств и способности действовать в фрагментированной глобальной системе.

#ai #readings #uk
👍12331🔥1😁1🤔1
Я на днях смотрел внимательнее на новые китайские модели: GLM-5.2, Kimi 3, LongCat 2.0 и скажу что, конечно, большой соблазн использовать их гораздо чаще потому что прогресс виден и экономия существенная.
Мои наблюдения следующие:
1. С задачами кодирования китайские модели справляются весьма неплохо. Если поставить задачу анализа репозитория, исправления ошибок или реализация понятных и четко сформулированных задач, то подходят они более чем. При этом токенов они тратят существенно больше, но и токены стоят дешевле.
2. А вот с задачами создания баз знаний гораздо лучше работают последние модели OpenAI 5.6 и Fable 5. Точно также как и с архитектурными задачами и задачами сравнения с конкурентами. По ощущениям к ним приближается Kimi 3, но в целом когда мне надо было сделать сравнительно небольшую базу знаний, то OpenAI 5.6 во всех вариациях справляется лучше.
3. В целом ощущения что все быстро меняется, все меньше критических ошибок, меньше галлюцинаций и для приведения в порядок унаследованного кода китайские модели более чем подходят. А вот когда надо спроектировать продукт или сделать сложную миграцию кода то лучше использовать OpenAI и Fable.

#ai #thoughts #notes
8🤔3
Добавлю ещё некоторое количество рефлексии по использовании LLM и ИИ агентов для создания базы знаний.

1. После некоторого числа экспериментов действительно Kimi K3 можно сравнить с последними моделями OpenAI и Anthropic. Созданные ей карточки в базе знаний куда более полные чем, к примеру, созданные с помощью GLM-5.2 или моделями попроще. Это важно поскольку существенно удешевляет процесс.
2. По наблюдениям наиболее эффективен двухэтапный процесс с human-in-the-loop. Вначале делать промпт на создание промпта, далее, делать его ревью и редактировать, при необходимости. и следующим шагом уже полученный промпт отдавать LLM. Первый этап можно делать и моделью попроще вроде той же GLM-5.2, а второй куда лучше отрабатывает уже более продвинутая модель. По сути это путь двухэтапного анализа поскольку при формировании комплексного промпта модель делает предварительный анализ объекта документирования.
3. Главный недостаток такого подхода в том что он существенно удлиняет процесс подготовки базы знаний, примерно в 2-3 раза и дублирует многие шаги потому что и, на предварительном анализа, и на финальном, идёт обращение к одним и тем же объектам. Например, если на вход поступает какой-то раздел сайта с набором тематических документов, то они скачиваются дважды. Может быть на стадии подготовки промпта не все, но тем не менее когда качество результата важнее скорости это лучший подход.
4. Что хорошо - это работает с любыми цифровыми объектами. Сайтами, датасетами, документами и коллекциями документов, API, текстами в иной форме, базами данных и так далее. Например, если бы я хотел не просто собрать базу данных межгосударственных организаций, но и сделать базу знаний по ним, то я сейчас вполне понимаю как это можно организовать структурно и технически. (оговорюсь - планов создавать такую базу знаний у меня пока нет).

#thoughts #ai #documentation
👍7🤔32
Pax Silica vs WAICO

Читаю про WAICO свежесозданный альянс по кооперации 29 стран по поводу ИИ где участвует и Россия все страны Центрально Азии кроме Туркменистана, и многие другие развивающиеся страны Глобального Юга. Ведущая роль там безусловно у Китая и, по сути, это объединение стран вокруг Китая и его глобальной ИИ политики.

И, конечно, невозможно его не противопоставлять инициативе США Pax Silica запущенной в декабре 2025 г. с похожими целями, но еще и с акцентом на редкоземельные металлы и полупроводники, ну и ИИ конечно.

Я оставлю политологам гадать являются ли эти конфигурации инициатив будущими прообразами нового разделения мира на глобальные альянсы.

Пока интересно что пересекаются они только на одной стране - это Казахстан. И что более половины стран мира пока никуда не присоединились.

По тому что я читаю сейчас складывается ощущение что у WAICO есть все шансы охватить почти весь Глобальный Юг, как минимум те страны в которых сильно китайское присутствие.

А вот чего пока нет так это инициатив схожего масштаба от Евросоюза. И это из-за того что ЕС несопоставимы с США и Китаем по развитию технологий ИИ и чуть ли не единственная тема вокруг которой ЕС могут пытаться собрать глобальную инициативу - это ИИ этика, безопасность и другие ограничения. Что сделать будет очень непросто, учитывая приоритет на экономический эффект практически во всех странах.

Правда вот мне совссем непонятно какие бенефиты власти РФ получат от участия в WAICO. Продажа российских ИТ/ИИ продуктов в страны Глобального Юга? Не особо верится. Доступ к китайским вычислительным ресурсам и покупке чипов? Про это интересно было бы узнать подробнее.

А я как раз недавно обновлял и еще планировал обновить карточки страновых блоков в internacia-db и вскоре, может быть даже сегодня, добавлю их туда.

#ai #china #thoughts
👍5🔥2🤔2🤝21
Подборка ссылок про данные, технологии и не только:
- Ontology Playground opensource веб приложение от Microsoft для визуального исследования онтологий. Выглядит очень хорошо, поддерживает импорт и экспорт RDF/OWL. Делает работу с онтологиями куда более доступной. Интересно откуда такой возвращающийся из небытия интерес к онтологиям? Подозреваю что природа этого в росте интереса подключения ИИ агентов к осмысленному восприятию связей между сущностями. В этом смысле ИИ агенты могут быть не только потребителями, но и инструментами упрощения построения онтологий.
- How We Built Our Knowledge Base о том как Cerebras строят внутреннюю базу знаний. Технических подробностей не очень много, а смысловых и логических немало. Можно обратить внимание на том что базу знаний они строят с прицелом на ускорение онбординга, что логично
- Qwen 3.8 новая модель от Alibaba с 2.4T параметров, позиционируется как сравнимая с Fable 5. Пока не открытая, подписка через QwenCloud начинается с $6. Интересны сравнения с Kimi K3 и ждем открытия модели, конечно
- I burned all my tokens researching how to save tokens автор описывает оркестрацию более слабых моделей как субагентов более продвинутыми на примере исследования темы экономии токенов. И тема интересная, и подход полезно описан.

#opensource #ai #readings #knowledge
👍7
Полезные ссылки про данные, технологии и не только:
- Celeris-1 свежая LLM от одноименного стартапа, обещают уровень почти как GPT 5 и гораздо более быстрые ответы. Несколько нестандартное позиционирование, не дешевле токены, не лучше ответы, а именно лучше response time. По моему это не ключевое в LLM, но кто знает.
- Agent swarms and the new model economics текст от команды Cursor который можно свести к выводу что продвинутая модель управляющая командой из непродвинутых моделей дает сравнимый результат при многократно меньших расходах. Полезное знание для тех кто ранее с этим не сталкивался
- Chat2DB визуальный клиент с открытым кодом более чем 30+ СУБД. Выглядит неплохо и похоже что автор его разработал с помощью LLM в короткие сроки. Еще одна демонстрация как современное созданное с помощью ИИ агентов ПО может быстро потеснить существующее.

#opensource #ai #datatools
7🔥7
Ещё полезных ссылок про данные технологии и не только:
- Introducing MAI-Cyber-1-Flash inside MDASH свежая модель от Microsoft по поиску уязвимостей. Интересная архитектура и технические подробности про то как там устроена мультиагентность
- Pi Web веб интерфейс для известного кодирующего агента pi. С ним привычно уже работать с командной строки, но UI также удобно и полезно
- EU delays release of Copernicus imagery over Gulf of Oman Евросоюз установил 24 часовую задержку в публикации снимков Оманского Залива со спутников Sentinel-1 и Sentinel-2. Конечно же по просьбе властей США😉 Подозреваю что рано или поздно крупные медиа реально будут запускать свои спутники чтобы получать оперативную информацию. Кстати, тут есть материал для хорошего фантастического рассказа

#opendata #ai #eu #satellite #security #microsoft
👍5😁2
Ещё немного рефлексии про разное сугубо технологическое:
1. Размышляю над тем как надо публиковать датасеты в современном мире и склоняюсь к тому что надо разделять более явным образом понятия набор данных (датасет) и дата продукт. Набор данных становится дата продуктом по мере зрелости его документации, наличия владельца и понятной аудитории/пользователей. Поэтому, к примеру, API Всемирного банка дата продукт, а набор данных на типовом портале открытых данных нет. Дата продукты ближе к корпоративному и профессиональному потреблению данных, наборы данных, в первую очередь открытых данных, всё ещё существуют в режиме "будьте довольны что хоть так это доступно, могли бы вообще ничего не публиковать". Когда я проектировал и делал internacia-db то держал в голове модель именно как курируемого дата продукта. Поэтому там и экспорт в разные форматы, и документация по использованию в разных языках разработки и инструментах и так далее. Что я, действительно, хочу сделать так это попытаться привести этот опыт в систематизированный вид, возможно в спецификацию, reusable datasets или reusable data products.
2. Продолжая размышления про ИИ инструменты для разработки, видно как они быстро развиваются, особенно Cursor с его построением архитектурных холстов (canvas) и пока главное отставание китайских моделей скорее инструментальное чем на уровне возможностей LLM. Когда, к примеру, тот же ZCode от z.ai сможет делать подобное то им можно будет пользоваться уже как приоритетным инструментом.
3. Как я уже описывал ранее, у меня сохраняется и углубляется мнение что вся экосистема инструментов открытых данных сильно отстает от технологий работы с данными и это отставание усиливается. Видно как сообщество, и профильные международные НКОшки, и активисты разделяются. Те кто был про технологии уходят в них и отходят от общественного, те кто про технологии был меньше уходят в темы этики ИИ, европейского цифрового суверенитета и всего подобного. У сообщества открытых данных кризис схожий с кризисом сообществ открытого кода. Все производимое общедоступное идет на корм ИИ агентам и для многих это существенный кризис миросознания.
4. А вот для тех кто делает что-то для общественного интереса всё больше возможностей для создания проектов в режиме человека-оркестра (one-man-projects). К примеру я смотрю на проект "Как голосовали депутаты?" про голосование российских депутатов по отобранным автором(-ами) чувствительным законопроектам и понимаю что почти наверняка всё это сделано одним человеком за 2-3 вечера и с помощью одного из ИИ ассистентов. Это стало реально просто, на такие проекты не нужны иностранные гранты какие-либо финансовые ресурсы, я довольно много их уже видел по европейским странам, по выборам в Армении и тд. Всё что для подобных проектов нужно - это: четкое видение результата, базовые технические навыки и, желательно, аналоги на которые можно ориентироваться. И данные, конечно. Поэтому многие общественные проекты могут/могли бы появляться как на дрожжах и не появляются, не потому что нет технической возможности, а по другим, иным причинам.

#opendata #opensource #ai #thoughts #data #dataproducts
👍1553