Data Secrets
91.8K subscribers
7.17K photos
809 videos
20 files
3.26K links
Главный по машинному обучению

Сотрудничество: @veron_28

РКН: clck.ru/3FY3GN
Download Telegram
Почему AI не ускорил разработку в 10 раз

Последние два года все обсуждают, как агенты пишут код. Но в реальных больших продуктах выясняется неожиданная вещь: даже после массового внедрения AI ускорение часто составляет не иксы, а только десятки процентов. Встает вопрос: почему?

Вот тут нашли совсем свежий интересный доклад на эту тему. Выступает Артур Василов, руководитель мобильной разработки Яндекс Браузера. Он рассказал, что они разными способами измеряли эффекты от ИИ, и увидели похожую картину: да, разработчики действительно работают быстрее, но нет, революции пока не произошло.

Причина в том, что кодинг – лишь одна часть большого конвейера. Помимо него есть менеджеры, дизайн, тестирование, кодревью, релизы и множество других этапов. Если ускорить только написание кода, узкое место просто смещается дальше по цепочке.

Поэтому глобально новый тренд в бигтехах, в том числе в Яндексе, не столько на ИИ-агентов как ассистентов, сколько на автоматизацию целых процессов. Команда выделяет повторяющиеся инженерные задачи, которые раньше никто не автоматизировал из-за высокой стоимости разработки, и автоматизирует их с помощью ИИ.

Например, в Яндексе куча людей работают над конфликтами и ошибками при выходе новых версий Chromium. Раньше почти вся эта работа выполнялась вручную. Теперь для таких сценариев строятся специализированные AI-пайплайны, которые помогают разбирать и исправлять подобные проблемы автоматически.

Именно в автоматизации вот таких больших кусков инженерной рутины и лежит основной резерв для ускорения разработки, и это уже действительно будет ускорение в разы.
🤔10138👍34🗿28💯7🤨5🔥3🤯31🕊1🆒1
Ходят слухи, что Anthropic собираются выпускать новую модель

Пару дней назад какие-то инсайдеры говорили, что у них якобы уже готов Mythos 5.1 и соответствующая версия Fable, но по понятным причинам эти модели пока будут жить только внутри стартапа.

Теперь пишут, что на этой неделе антропики собираются выпускать Sonnet 5: модель уже заметили в логах у некоторых провайдеров. Ожидаем 1М контекста, хорошие показатели в кодинге и выгодное соотношение цена/качество.

Решили долго не горевать, дистиллировать Fable в "Sonnet 5" и выпустить заново 👨‍🦯
Please open Telegram to view this post
VIEW IN TELEGRAM
😁28158👍2716😎3🤔2👌1💯1🎄1
Media is too big
VIEW IN TELEGRAM
Anthropic выпустили Claude Tag, и Андрей Карпаты назвал это третьим мощным редизайном UX в истории LLM

Теперь Claude можно добавить как члена команды в канал Slack, вызывать его через @ и делегировать ему задачи.

Он тут же пойдет выполнять таску и вернется с результатами в тот же чат, где можно продолжить диалог и смерджить готовый код, не отрываясь от основной переписки с коллегами. Причем разговор с Claude может перехватить любой человек из канала. Пример ⬆️

Обновление создано для более проактивного и бесшовного стиля работы агента. По словам Anthropic, теперь 65% кода внутри стартапа создается именно благодаря внутренней версии Claude Tag.

www.anthropic.com/news/introducing-claude-tag

А Андрей Карпаты написал про Claude Tag следующее:

Это новая парадигма для взаимодействия с Claude. Имхо, это 3-й крупный редизайн LLM UIUX. Первый заключался в том, что LLM - это веб-сайт, на который вы заходите; второй – в том, что это приложение, которое вы загружаете на свой компьютер. Третий же про то, что это автономная, стойкая, асинхронная сущность с общеорганизационными инструментами и контекстом, работающая вместе с командами людей. Понимание этого займет некоторое время, но это работает, и это потрясающе.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤‍🔥16157🔥25🤯22😁15👍11🤔1174🎉1🦄1
This media is not supported in your browser
VIEW IN TELEGRAM
GLM-5.2 теперь можно запустить локально

Unsloth сделали отличные GGUF 2-bit и 4-bit. Модель 2-bit сохраняет ~82% точности модели и при этом уменьшает потребление памяти на 84%. Запускается на 256GB Mac.

Можно взять даже 1-bit, и все равно будет норм. На простом примере по сравнению с Claude 4.8 Opus и GPT-5.5 модель ведет себя удивительно хорошо ⬆️

huggingface.co/unsloth/GLM-5.2-GGUF

Инструкция по запуску
Please open Telegram to view this post
VIEW IN TELEGRAM
🕊10059👍36🔥23🤨10😁8🤔4🍾31💯1🫡1
Топовая работа для инженера 🥰🤚
😁131🍓23🔥853👍2😍1🆒1
⚡️ OpenAI сделали собственный чип

Архитектура разработана с нуля вместе с Broadcom, а назвали чип Jalapeño. Предназначен халапеньо специально для инференса LLM и соответсвующих систем а-ля Codex.

Сейчас чип проходит стадию тестирования, но ранние внутренние замеры уже показали, что он перформит лучше текущей SOTA на целый ватт.

openai.com/index/openai-broadcom-jalapeno-inference-chip/
Please open Telegram to view this post
VIEW IN TELEGRAM
297🤯29👍22😁10🍾4🔥3👏3😎1
Авито открыли набор на две магистратуры по ML, разработанные совместно с МФТИ и ВШЭ

Самые интересные образовательные программы получаются, когда бигтех приходит в университет не только с финансированием, а еще и с собственными задачами, данными и экспертами. И это как раз случай Авито.

Прямо сейчас открылась отличная возможность поступить в их магистратуры на ML-программы «Прикладное машинное обучение и анализ данных» с МФТИ и «Машинное обучение в цифровом продукте» с ФКН ВШЭ. В основе программ – реальные кейсы компании, а часть занятий будут вести действующие специалисты Авито. Всего в подготовке материалов участвовали более 300 сотрудников.

Стек довольно широкий: это и классический ML, и компьютерное зрение, и рекомендательные системы, и аналитика, и генеративный ИИ. При этом речь идет не про абстрактное изучение алгоритмов, а про применение всего, что вы проходите, в продуктовой среде.

Отдельный плюс: поступать можно из любого региона России. Ждут всех, кто готов всерьез погружаться в ML и перенимать знания из первых рук, от практикующих специалистов.

Подробнее о программах:
«Машинное обучение (ML) в цифровом продукте» в ФКН НИУ ВШЭ
«Прикладное машинное обучение и анализ данных» в МФТИ
😁32🗿1510👍7🤯4🤨21🔥1🎉1🆒1
Когда языковые модели читают текст, они не просто обрабатывают токен за токеном. В каком-то смысле они испытывают от чтения эмоции.

www.goodfire.ai/research/stories-in-space#

Рисерчеры из GoodFire продолжают исследовать так называемую геометрию LLM. Некоторое время назад они показали, что мысли моделей организованы в виде определенных форм. Например, числа – это окружности, и складывая одно число с другим, LLM на самом деле суммируют множество бубликов: t.me/data_secrets/9223.

Теперь они обнаружили новые любопытные детали. Оказывается, внутри моделей существует целый ландшафт эмоциональных состояний.

Ученые взяли LLama, давали ей читать рассказы и наблюдали за состоянием активаций. Так вот по мере чтения модель как бы перемещается по некоторому многомерному пространству состояний, "испытвая" те или иные эмоции в зависимости от того, что происходит в тексте в данный момент.

Причем если визуализировать соответствующие разным эмоциям состояния модели, то получается структура, очень похожая на классическую психологическую модель эмоций человека. Например, радость находится рядом с интересом, страх и гнев имеют схожую высокую интенсивность и тд.

Еще по этой карте можно предсказывать дальнейшие ответы модели. И если искусственно подталкивать активации в направлении определенной эмоции, настроение и суть генераций меняется.

Красиво
1196❤‍🔥49🤯3916😁15🗿11🤨8🤝5🆒4😍1🐳1
Anthropic снова обвинили китайцев в незаконной дистилляции Claude

Никогда такого не было, и вот опять.

Стартап утверждает, что операторы, связанные с Alibaba Qwen, провели крупнейшую на данный момент «атаку» на Claude: они зафиксировали около 28.8 млн взаимодействий через почти 25 000 фейковых аккаунтов за полтора месяца.

Основной целью, по словам Anthropic, было извлечь способности моделей в сфере кодинга, ризонинга и tool use.

Сейчас Anthropic направили нескольким сенаторам официальное письмо, в котором попросили Конгресс отреагировать. Но пока ответа от правительства нет, как и комментариев от Alibaba.
1👏111😎63😁55🔥14🗿14109👍6👾2🕊1🍾1
⚡️ Некоторые юзеры сообщают, что Fable 5 стал снова доступен для выбора в Claude Code.

Также вчера модель снова заметили в Amazon Bedrock.

Скрещиваем пальцы и надеемся
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
13242😁268🤔643👍3🔥3🤩2😎2
Модель BerryLM от RWB вошла в топ-3 бенчмарка MERA

В основном русскоязычном рейтинге дообученная компанией большая языковая модель BerryLM-XL выдала результаты, сопоставимые с GPT-5.4 и Opus 4.6, и в итоге заняла третье место. Еще одна LLM из семейства моделей RWB, BerryLM-v2, сейчас на 5-ом месте рейтинга.

Обе модели Wildberries активно использует для разных прикладных задач. Например, в ИИ-ассистенте для покупателей, сравнении и поиске товаров, и в ИИ-инструментах, помогающих продавцам отвечать на вопросы и отзывы.

Хорошие места в бенчмарках – это здорово, но когда модель при этом еще и действительно работает в продуктах с миллионами пользователей – это уже интереснее.

Лидерборд: mera.a-ai.ru/ru/text/leaderboard
1124😁106🗿26👍185🫡3💯2😎2🎄1
Media is too big
VIEW IN TELEGRAM
Фиона Фанг, Head of Engineering в Claude Code, сказала, что использование агентов делает инженеров более одинокими

Люди перестают обмениваться опытом и в итоге все больше и больше зацикливаются на работе со своими агентами. Кодинг становится «изолированным».

Фанг говорит, что это серьезная проблема, и Anthropic уже стараются с ней бороться. Оказывается, что помимо всяких хакатонов и кодинг-завтраков в компании проводят так называемые «maker time» встречи: инженеры собираются, вместе программируют и делятся практиками использования агентов.

Вы там как, справляетесь с одиночеством? 😭
Please open Telegram to view this post
VIEW IN TELEGRAM
3❤‍🔥130😁72👍2818119👨‍💻73🍾3🦄3🆒1
This media is not supported in your browser
VIEW IN TELEGRAM
Какие-то гении изобрели кебаб-банчмарк

https://evaluateai.ai/app/comparisons/0e156620-928b-4a40-bded-84ed556309c5/results/?view=model

Спасибо за внимание
Please open Telegram to view this post
VIEW IN TELEGRAM
😁20746🔥19🤯6👍542🎉2😎2👌1
Черный рынок токенов в Китае

Исследовательница из Оксфордской лаборатории китайской политики написала статью о том, как китайские провайдеры торгуют токенами по ценам ниже официальных. Иногда цена за доступ к модели может составлять всего 10% от оф.API. Встает вопрос: как?

Так вот варианта, оказывается, три. Выбирайте, какой нравится больше ☕️:

1. Массовый сбор данных. Подобные провайдеры собирают все запросы, ответы и цепочки ризонинга – и перепродают. На этом и зарабатывают.

2. Подмена моделей. Вам продают Opus 4.7, а на деле подсовывают какой-нибудь Qwen местного разлива. И вот уже скидка на мощную модель превращается в прибыль с дешевой.

3. Арбитраж подписки. Например, берут Claude Max за $200 и делят на десятки клиентов через лимиты по токенам в час. Снова профит! Сюда же генерация кучи поддельных API-аккаунтов для получения бесплатных стартовых кредитов, фейковые студенческие аккаунты и перепродажа чужих неиспользованных квот.

Всякие геоблокировки, телефонные верификации, требования к зарубежным картам и все прочее эти прокси с легкостью обходят. Так что рынок разросся, и официалы с этим ничего поделать не могут.

Китайцы пользуются подобным массово, потому что прямой доступ без VPN и иностранных карт для них закрыт. И все, кажется, довольны.
Please open Telegram to view this post
VIEW IN TELEGRAM
136😁793210👍8🤯721👏1🎉1🆒1
OpenAI поделились статистикой по Codex. Есть интересное.

openai.com/index/how-agents-are-transforming-work/

Смотрим:

– Внутри OpenAI Codex теперь составляет 99,8% их выходных токенов, а ChatGPT – только 0,2%.

– Индивидуальные юзеры все еще концентрируются в ChatGPT, а вот у бизнеса токены в Codex составляют ~64% от общего потребления.

Топ-1% самых активных юзеров Codex в среднем запускают агентов на 71 час в сутки (это сумма по всем агентам).

– Со временем люди все больше и больше делегируют агентам действительно долгие задачи. Например, промпты на задачи, которые занимают ~8-часов работы человека, теперь составляют более четверти запросов. Для сравнения, в декабре их было чуть больше 2%.

Исходя из перечисленного, вопрос: это все еще люди вайбкодят с агентами, или уже агенты с людьми?
23110😁5732🔥8👍6🏆2🤝2🫡2👌1
😳
Please open Telegram to view this post
VIEW IN TELEGRAM
1😁37946🤯14119💯9🍾21😎1