Data Secrets
91.8K subscribers
7.17K photos
809 videos
20 files
3.26K links
Главный по машинному обучению

Сотрудничество: @veron_28

РКН: clck.ru/3FY3GN
Download Telegram
Когда языковые модели читают текст, они не просто обрабатывают токен за токеном. В каком-то смысле они испытывают от чтения эмоции.

www.goodfire.ai/research/stories-in-space#

Рисерчеры из GoodFire продолжают исследовать так называемую геометрию LLM. Некоторое время назад они показали, что мысли моделей организованы в виде определенных форм. Например, числа – это окружности, и складывая одно число с другим, LLM на самом деле суммируют множество бубликов: t.me/data_secrets/9223.

Теперь они обнаружили новые любопытные детали. Оказывается, внутри моделей существует целый ландшафт эмоциональных состояний.

Ученые взяли LLama, давали ей читать рассказы и наблюдали за состоянием активаций. Так вот по мере чтения модель как бы перемещается по некоторому многомерному пространству состояний, "испытвая" те или иные эмоции в зависимости от того, что происходит в тексте в данный момент.

Причем если визуализировать соответствующие разным эмоциям состояния модели, то получается структура, очень похожая на классическую психологическую модель эмоций человека. Например, радость находится рядом с интересом, страх и гнев имеют схожую высокую интенсивность и тд.

Еще по этой карте можно предсказывать дальнейшие ответы модели. И если искусственно подталкивать активации в направлении определенной эмоции, настроение и суть генераций меняется.

Красиво
1196❤‍🔥49🤯3916😁15🗿11🤨8🤝5🆒4😍1🐳1
Anthropic снова обвинили китайцев в незаконной дистилляции Claude

Никогда такого не было, и вот опять.

Стартап утверждает, что операторы, связанные с Alibaba Qwen, провели крупнейшую на данный момент «атаку» на Claude: они зафиксировали около 28.8 млн взаимодействий через почти 25 000 фейковых аккаунтов за полтора месяца.

Основной целью, по словам Anthropic, было извлечь способности моделей в сфере кодинга, ризонинга и tool use.

Сейчас Anthropic направили нескольким сенаторам официальное письмо, в котором попросили Конгресс отреагировать. Но пока ответа от правительства нет, как и комментариев от Alibaba.
1👏111😎63😁55🔥14🗿14109👍6👾2🕊1🍾1
⚡️ Некоторые юзеры сообщают, что Fable 5 стал снова доступен для выбора в Claude Code.

Также вчера модель снова заметили в Amazon Bedrock.

Скрещиваем пальцы и надеемся
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
13242😁268🤔643👍3🔥3🤩2😎2
Модель BerryLM от RWB вошла в топ-3 бенчмарка MERA

В основном русскоязычном рейтинге дообученная компанией большая языковая модель BerryLM-XL выдала результаты, сопоставимые с GPT-5.4 и Opus 4.6, и в итоге заняла третье место. Еще одна LLM из семейства моделей RWB, BerryLM-v2, сейчас на 5-ом месте рейтинга.

Обе модели Wildberries активно использует для разных прикладных задач. Например, в ИИ-ассистенте для покупателей, сравнении и поиске товаров, и в ИИ-инструментах, помогающих продавцам отвечать на вопросы и отзывы.

Хорошие места в бенчмарках – это здорово, но когда модель при этом еще и действительно работает в продуктах с миллионами пользователей – это уже интереснее.

Лидерборд: mera.a-ai.ru/ru/text/leaderboard
1124😁106🗿26👍185🫡3💯2😎2🎄1
Media is too big
VIEW IN TELEGRAM
Фиона Фанг, Head of Engineering в Claude Code, сказала, что использование агентов делает инженеров более одинокими

Люди перестают обмениваться опытом и в итоге все больше и больше зацикливаются на работе со своими агентами. Кодинг становится «изолированным».

Фанг говорит, что это серьезная проблема, и Anthropic уже стараются с ней бороться. Оказывается, что помимо всяких хакатонов и кодинг-завтраков в компании проводят так называемые «maker time» встречи: инженеры собираются, вместе программируют и делятся практиками использования агентов.

Вы там как, справляетесь с одиночеством? 😭
Please open Telegram to view this post
VIEW IN TELEGRAM
3❤‍🔥130😁72👍2818119👨‍💻73🍾3🦄3🆒1
This media is not supported in your browser
VIEW IN TELEGRAM
Какие-то гении изобрели кебаб-банчмарк

https://evaluateai.ai/app/comparisons/0e156620-928b-4a40-bded-84ed556309c5/results/?view=model

Спасибо за внимание
Please open Telegram to view this post
VIEW IN TELEGRAM
😁20746🔥19🤯6👍542🎉2😎2👌1
Черный рынок токенов в Китае

Исследовательница из Оксфордской лаборатории китайской политики написала статью о том, как китайские провайдеры торгуют токенами по ценам ниже официальных. Иногда цена за доступ к модели может составлять всего 10% от оф.API. Встает вопрос: как?

Так вот варианта, оказывается, три. Выбирайте, какой нравится больше ☕️:

1. Массовый сбор данных. Подобные провайдеры собирают все запросы, ответы и цепочки ризонинга – и перепродают. На этом и зарабатывают.

2. Подмена моделей. Вам продают Opus 4.7, а на деле подсовывают какой-нибудь Qwen местного разлива. И вот уже скидка на мощную модель превращается в прибыль с дешевой.

3. Арбитраж подписки. Например, берут Claude Max за $200 и делят на десятки клиентов через лимиты по токенам в час. Снова профит! Сюда же генерация кучи поддельных API-аккаунтов для получения бесплатных стартовых кредитов, фейковые студенческие аккаунты и перепродажа чужих неиспользованных квот.

Всякие геоблокировки, телефонные верификации, требования к зарубежным картам и все прочее эти прокси с легкостью обходят. Так что рынок разросся, и официалы с этим ничего поделать не могут.

Китайцы пользуются подобным массово, потому что прямой доступ без VPN и иностранных карт для них закрыт. И все, кажется, довольны.
Please open Telegram to view this post
VIEW IN TELEGRAM
136😁793210👍8🤯721👏1🎉1🆒1
OpenAI поделились статистикой по Codex. Есть интересное.

openai.com/index/how-agents-are-transforming-work/

Смотрим:

– Внутри OpenAI Codex теперь составляет 99,8% их выходных токенов, а ChatGPT – только 0,2%.

– Индивидуальные юзеры все еще концентрируются в ChatGPT, а вот у бизнеса токены в Codex составляют ~64% от общего потребления.

Топ-1% самых активных юзеров Codex в среднем запускают агентов на 71 час в сутки (это сумма по всем агентам).

– Со временем люди все больше и больше делегируют агентам действительно долгие задачи. Например, промпты на задачи, которые занимают ~8-часов работы человека, теперь составляют более четверти запросов. Для сравнения, в декабре их было чуть больше 2%.

Исходя из перечисленного, вопрос: это все еще люди вайбкодят с агентами, или уже агенты с людьми?
23110😁5732🔥8👍6🏆2🤝2🫡2👌1
😳
Please open Telegram to view this post
VIEW IN TELEGRAM
1😁37946🤯14119💯9🍾21😎1
Они добрались до OpenAI: правительство США будет одобрять доступ к GPT-5.6 «клиент за клиентом»

Администрация Трампа связалась с Альтманом и «попросила» его не выпускать модель без одобрения. Конечно же, «по соображениям безопасности».

Так что модель сначала выйдет в ограниченном preview, и только когда-нибудь потом (возмооожно) станет доступна простым смертным: во время периода превью чиновники будут «одобрять доступ клиент за клиентом» (цитата Сэма).

Лицензирование де-факто
1🫡1708928🗿19😁10🤯7🤗7🤔4😍2😎2🕊1
Оранжевый – доля токенов американских моделей в OpenRouter
Серый – доля китайских

Сверху разбиение в июне 2025, снизу – в июне 2026

И кто тут теперь техно-лидер? ⌨️

* из статьи Bloomberg
Please open Telegram to view this post
VIEW IN TELEGRAM
11174😁89🤯34👍1610😍6🗿6🏆5💯2🎄2
Итак, встречайте: GPT-5.6

https://openai.com/index/previewing-gpt-5-6-sol/

Анонсировали три модели, в честь солнечной системы (с самооценкой у создателей все ок):

1. Sol – самая крупная и крутая. На многих бенчмарках обходит Mythos, и при этом дешевле в два раза. При этом авторы пишут, что модель использует в три раза меньше токенов. В целом экономия в 5-6 раз (ну типа).

2. Terra – промежуточный вариант. Уже в три раза дешевле Mythos, уверенно обходит Opus 4.8.

3. Luna – самый дешевая и быстрая, но по результатам все еще хороша.

Бенчмарков показали маловато, так что на другие замеры еще посмотрим. Общий доступ обещают в ближайшие недели, пока что модели вышли только для ограниченной группы тестеров.

Хоть бы не повторилась история с Fable 🙏
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1175🔥70👍27🤯13😁5❤‍🔥4🍾4🤔22🍓1
Обновление по Fable и Mythos:

С 12 июня мы тесно сотрудничаем с правительством США, чтобы восстановить доступ к Claude Mythos 5 и Fable 5. Сегодня правительство уведомило нас, что мы можем повторно развернуть Mythos 5 для некоторых организаций США, которые управляют и защищают критическую инфраструктуру.

Мы быстро восстанавливаем доступ для этих организаций, и мы продолжаем работать с правительством, чтобы расширить доступ к Mythos 5 и снова сделать Fable 5 доступным для общего использования.


Честно говоря, пока не слишком обнадеживающе
165🕊33😁20🤔159👍4🎉3🫡3😎2👏1🆒1
Новый дроп от DeepSeek: выложили полностью открытый стек для ускорения генерации LLM

Внутри готовые алгоритмы, обучение, эвал и даже пайплайн для данных. Бери и пользуйся, супер практично. github.com/deepseek-ai/DeepSpec

Основная соль – в алгоритме DSpark. Его DeepSeek уже использует для DeepSeek-V4 Flash и Pro в проде, и, по их данным, относительно старого бейзлайна скорость генерации для пользователя выросла примерно на 60–85%.

Как устроен алгоритм:

– Фундаментально, это небольшая модель, которая пишет черновики для основной LLM. Это называется драфт-модель.

– Такой подход сейчас в моде (Google, например, делают такое для Gemma: t.me/data_secrets/9179), но DeepSeek выводят его на новый уровень. Их драфт-модель работает необычно, в два этапа. Сначала параллельно набрасывается блок токенов, а потом легкий марковский модуль уточняет зависимости между соседними токенами. Благодаря такому подходу драфтер и работает быстро, и не очень сыпится в хвостах.

– После того, как драфтер накидал черновик, основная LLM его проверяет и принимает только правильный префикс, корректируя остальное. При этом DSpark сам решает, сколько токенов отправить на проверку, основываясь на оценках уверенности по токенам и текущей нагрузке на железо.

В результате получаем ускорение минимум в 1.5 раза абсолютно без потери качества. Снимаем шляпу перед DeepSeek за такой опенсорс.
1262🔥83👍43👏4😁3🕊3🤨2🍾2🤗2
Правительство США дропнуло новый бенчмарк для LLM ⚡️
Please open Telegram to view this post
VIEW IN TELEGRAM
😁757👍45🔥3112🗿125🫡5😍3🕊2🐳2🍓2
Media is too big
VIEW IN TELEGRAM
Дарио Амодеи заявил, что опенсорс в ИИ – это «отвлекающий маневр»

Он сказал, что на самом деле это не тот опенсорс, к которому мы привыкли:

«Вы все равно не можете видеть внутренности модели, и основные плюсы опенсорса вроде коллективной доработки работают с сфере ИИ иначе»


Основной аргумент:

«В итоге вам все равно придется хостить ее в облаке»


В довершении CEO Anthropic заявил, что для конкуренции важнее способности модели и ее эффективность на инференсе, а не «ярлык» опенсорса и лицензия.

Мнения? 😐
Please open Telegram to view this post
VIEW IN TELEGRAM
3🗿293😁131601916👍9🔥53🤨2🕊1😎1