Data Secrets
91.8K subscribers
7.17K photos
809 videos
20 files
3.26K links
Главный по машинному обучению

Сотрудничество: @veron_28

РКН: clck.ru/3FY3GN
Download Telegram
This media is not supported in your browser
VIEW IN TELEGRAM
Какие-то гении изобрели кебаб-банчмарк

https://evaluateai.ai/app/comparisons/0e156620-928b-4a40-bded-84ed556309c5/results/?view=model

Спасибо за внимание
Please open Telegram to view this post
VIEW IN TELEGRAM
😁20746🔥19🤯6👍542🎉2😎2👌1
Черный рынок токенов в Китае

Исследовательница из Оксфордской лаборатории китайской политики написала статью о том, как китайские провайдеры торгуют токенами по ценам ниже официальных. Иногда цена за доступ к модели может составлять всего 10% от оф.API. Встает вопрос: как?

Так вот варианта, оказывается, три. Выбирайте, какой нравится больше ☕️:

1. Массовый сбор данных. Подобные провайдеры собирают все запросы, ответы и цепочки ризонинга – и перепродают. На этом и зарабатывают.

2. Подмена моделей. Вам продают Opus 4.7, а на деле подсовывают какой-нибудь Qwen местного разлива. И вот уже скидка на мощную модель превращается в прибыль с дешевой.

3. Арбитраж подписки. Например, берут Claude Max за $200 и делят на десятки клиентов через лимиты по токенам в час. Снова профит! Сюда же генерация кучи поддельных API-аккаунтов для получения бесплатных стартовых кредитов, фейковые студенческие аккаунты и перепродажа чужих неиспользованных квот.

Всякие геоблокировки, телефонные верификации, требования к зарубежным картам и все прочее эти прокси с легкостью обходят. Так что рынок разросся, и официалы с этим ничего поделать не могут.

Китайцы пользуются подобным массово, потому что прямой доступ без VPN и иностранных карт для них закрыт. И все, кажется, довольны.
Please open Telegram to view this post
VIEW IN TELEGRAM
136😁793210👍8🤯721👏1🎉1🆒1
OpenAI поделились статистикой по Codex. Есть интересное.

openai.com/index/how-agents-are-transforming-work/

Смотрим:

– Внутри OpenAI Codex теперь составляет 99,8% их выходных токенов, а ChatGPT – только 0,2%.

– Индивидуальные юзеры все еще концентрируются в ChatGPT, а вот у бизнеса токены в Codex составляют ~64% от общего потребления.

Топ-1% самых активных юзеров Codex в среднем запускают агентов на 71 час в сутки (это сумма по всем агентам).

– Со временем люди все больше и больше делегируют агентам действительно долгие задачи. Например, промпты на задачи, которые занимают ~8-часов работы человека, теперь составляют более четверти запросов. Для сравнения, в декабре их было чуть больше 2%.

Исходя из перечисленного, вопрос: это все еще люди вайбкодят с агентами, или уже агенты с людьми?
23110😁5732🔥8👍6🏆2🤝2🫡2👌1
😳
Please open Telegram to view this post
VIEW IN TELEGRAM
1😁37946🤯14119💯9🍾21😎1
Они добрались до OpenAI: правительство США будет одобрять доступ к GPT-5.6 «клиент за клиентом»

Администрация Трампа связалась с Альтманом и «попросила» его не выпускать модель без одобрения. Конечно же, «по соображениям безопасности».

Так что модель сначала выйдет в ограниченном preview, и только когда-нибудь потом (возмооожно) станет доступна простым смертным: во время периода превью чиновники будут «одобрять доступ клиент за клиентом» (цитата Сэма).

Лицензирование де-факто
1🫡1708928🗿19😁10🤯7🤗7🤔4😍2😎2🕊1
Оранжевый – доля токенов американских моделей в OpenRouter
Серый – доля китайских

Сверху разбиение в июне 2025, снизу – в июне 2026

И кто тут теперь техно-лидер? ⌨️

* из статьи Bloomberg
Please open Telegram to view this post
VIEW IN TELEGRAM
11174😁89🤯34👍1610😍6🗿6🏆5💯2🎄2
Итак, встречайте: GPT-5.6

https://openai.com/index/previewing-gpt-5-6-sol/

Анонсировали три модели, в честь солнечной системы (с самооценкой у создателей все ок):

1. Sol – самая крупная и крутая. На многих бенчмарках обходит Mythos, и при этом дешевле в два раза. При этом авторы пишут, что модель использует в три раза меньше токенов. В целом экономия в 5-6 раз (ну типа).

2. Terra – промежуточный вариант. Уже в три раза дешевле Mythos, уверенно обходит Opus 4.8.

3. Luna – самый дешевая и быстрая, но по результатам все еще хороша.

Бенчмарков показали маловато, так что на другие замеры еще посмотрим. Общий доступ обещают в ближайшие недели, пока что модели вышли только для ограниченной группы тестеров.

Хоть бы не повторилась история с Fable 🙏
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1175🔥70👍27🤯13😁5❤‍🔥4🍾4🤔22🍓1
Обновление по Fable и Mythos:

С 12 июня мы тесно сотрудничаем с правительством США, чтобы восстановить доступ к Claude Mythos 5 и Fable 5. Сегодня правительство уведомило нас, что мы можем повторно развернуть Mythos 5 для некоторых организаций США, которые управляют и защищают критическую инфраструктуру.

Мы быстро восстанавливаем доступ для этих организаций, и мы продолжаем работать с правительством, чтобы расширить доступ к Mythos 5 и снова сделать Fable 5 доступным для общего использования.


Честно говоря, пока не слишком обнадеживающе
165🕊33😁20🤔159👍4🎉3🫡3😎2👏1🆒1
Новый дроп от DeepSeek: выложили полностью открытый стек для ускорения генерации LLM

Внутри готовые алгоритмы, обучение, эвал и даже пайплайн для данных. Бери и пользуйся, супер практично. github.com/deepseek-ai/DeepSpec

Основная соль – в алгоритме DSpark. Его DeepSeek уже использует для DeepSeek-V4 Flash и Pro в проде, и, по их данным, относительно старого бейзлайна скорость генерации для пользователя выросла примерно на 60–85%.

Как устроен алгоритм:

– Фундаментально, это небольшая модель, которая пишет черновики для основной LLM. Это называется драфт-модель.

– Такой подход сейчас в моде (Google, например, делают такое для Gemma: t.me/data_secrets/9179), но DeepSeek выводят его на новый уровень. Их драфт-модель работает необычно, в два этапа. Сначала параллельно набрасывается блок токенов, а потом легкий марковский модуль уточняет зависимости между соседними токенами. Благодаря такому подходу драфтер и работает быстро, и не очень сыпится в хвостах.

– После того, как драфтер накидал черновик, основная LLM его проверяет и принимает только правильный префикс, корректируя остальное. При этом DSpark сам решает, сколько токенов отправить на проверку, основываясь на оценках уверенности по токенам и текущей нагрузке на железо.

В результате получаем ускорение минимум в 1.5 раза абсолютно без потери качества. Снимаем шляпу перед DeepSeek за такой опенсорс.
1262🔥83👍43👏4😁3🕊3🤨2🍾2🤗2
Правительство США дропнуло новый бенчмарк для LLM ⚡️
Please open Telegram to view this post
VIEW IN TELEGRAM
😁757👍45🔥3112🗿125🫡5😍3🕊2🐳2🍓2
Media is too big
VIEW IN TELEGRAM
Дарио Амодеи заявил, что опенсорс в ИИ – это «отвлекающий маневр»

Он сказал, что на самом деле это не тот опенсорс, к которому мы привыкли:

«Вы все равно не можете видеть внутренности модели, и основные плюсы опенсорса вроде коллективной доработки работают с сфере ИИ иначе»


Основной аргумент:

«В итоге вам все равно придется хостить ее в облаке»


В довершении CEO Anthropic заявил, что для конкуренции важнее способности модели и ее эффективность на инференсе, а не «ярлык» опенсорса и лицензия.

Мнения? 😐
Please open Telegram to view this post
VIEW IN TELEGRAM
3🗿293😁131601916👍9🔥53🤨2🕊1😎1
This media is not supported in your browser
VIEW IN TELEGRAM
Чтение мыслей 2.0 от Meta*: компания выпустила Brain2Qwerty v2

В компании сделали модель, которая может с большой точностью восстанавливать текст, который человек молча печатает на клавиатуре. И, кажется, они впервые доказали, что неинвазивные методы могут приближаться к качеству, которое раньше считалось достижимым только после операции на мозге аля Neuralink.

Итак, Brain2Qwerty v2:

– Система основана на Brain2Qwerty v1. Но, в отличие от первой версии, v2 восстанавливает текст без знания момента каждого нажатия клавиши. Она получает непрерывный поток мозговой активности и сразу генерирует предложение целиком.

– Внутри задача разбита на три уровня: есть энкодер, который преобразовывает сырые сигналы MEG в отдельные символы. Дальше эту последовательность обрабатывает Aligner: он пытается понять, где начинаются и заканчиваются слова и строит их эмбеддинги. Далее эти эмбеддинги вместе с исходными сигналами отправляются в LLM, и она уже правит все в конечный вид.

– Выглядит это все как огромная установка стоимостью в миллионы долларов.

Точность относительно предыдущих методов, можно сказать, зашкаливает. Заявляется 61% word accuracy в среднем (около 70% на лучших участниках). При этом система может допускать больше символьных ошибок, чем первая версия, потому что не знает времени нажатия клавиш, но смысл оказывается намного ближе к оригиналу.

И да, это все еще слишком низкая точность для массового применения. НО (и это самое интересное!) исследователи открыли почти идеальный scaling law. Качество продолжает улучшаться почти логарифмически с увеличением объема данных, и насыщения пока не видно.

Так что возможно все, что нужно для очень точного неинвазивного чтения мыслей – это больше данных. В удивительное время живем.

facebookresearch.github.io/brain2qwerty/
2🤯173🔥5222👍94👏3😁33💯1🤗1
Новый дроп в опенсорс от Сбера: выложили токенизатор KVAE-Audio

Фундаментально эта модель решает давнюю проблему обучения диффузионных систем. Им требуется максимально качественное сжатое представление данных, от которого напрямую зависит верхний предел возможностей создания нового контента. Разработчики закрыли эту потребность, представив третью часть семейства KVAE. Ранее команда уже публиковала схожие алгоритмы для работы с видео и картинками, а теперь очередь дошла до аудио формата.

Система способна переваривать треки на частоте 48 кГц, охватывая весь спектр человеческого слуха. Во время обработки алгоритм уплотняет временную шкалу в 960 раз. На выходе получается сверхкомпактное пространство, состоящее из 64 каналов. Такие скромные размерности сильно упрощают жизнь при тренировке генеративных архитектур.

Главный инженерный вызов здесь заключался в адаптации выходных данных именно под диффузию. Классические подходы часто показывают отличные цифры при воссоздании исходного аудио, но плохо справляются с созданием оригинального материала. Чтобы сбалансировать результаты в обеих задачах, авторы применили уникальный метод регуляризации.

Если посмотреть на бенчмарки, новинка уверенно обходит MMAudio от Sony абсолютно по всем фронтам. При сравнении с DACVAE от Meta и SAME-L от Stability AI разработка выигрывает в качестве генерации и держит паритет в реконструкции, при этом обладая значительно меньшим весом.
Код и веса под свободной лицензией MIT уже лежат на GitHub и Hugging Face.

Habr
87🔥38🗿32👍22😁72🤔2💯2🏆1💘1
В будущем не будет продактов, инженеров и дизайнеров: создатель Claude Code Борис Черный сказал, что нас ждет всего 5 архетипов

1. Prototyper: генератор множества идей, только некоторые из которых будут реализованы.

2. Builder: быстро превращает прототипы и идеи в продукт.

3. Sweeper: чистит UX, упрощает код, оптимизирует систему.

4. Grower: берет продукт и итеративно улучшает его с точки зрения Product-Market Fit.

5. Maintainer: владеет зрелой системой и следит за ее безопасностью, надежностью и эффективностью.


При этом эти архетипы не будут зависеть от домена или специфического стека, как большинство современных ролей, и один человек сможет объединять в себе до трех статусов.

В новой системе не нашлось места только эйчарам 🤷‍♂️
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
3😁36257👍4312🗿5👨‍💻4🤯3🕊2🫡2🍓1🍾1
Media is too big
VIEW IN TELEGRAM
VP of Engineering из Spotify дал интервью Борису Черному и случайно стал мемом

Он заявил, что в его компании делается 4500 PR ежедневно, из них 73% – с помощью агентов.

Пользователи в комментариях не поняли, откуда взялись такие огромные цифры:

«Это они добавляют каждую новую песню в git или что-то в таком роде?»

«Наглядное пособие по созданию ИИ-пузыря»

«Зачем? Последняя новая фича в Spotify появлялась 15 лет назад»


Главное, что KPI по токенмаксингу выполнили
😁320😎4127🍓2🫡21👍1🤯1