Data Secrets

Итак, как же DeepSeek обучили открытую модель уровня o1? Разбираем тех.отчет по полочкам:

🔷 Первое и самое интересное: сразу после претрейна – RL. Обычно за предобучением следует файнтюнинг вида <вопрос-ответ> на размеченных данных, но здесь сразу воткнули чистое обучение с подкреплением.

Базовая модель – DeepSeek-V3-Base. В качестве алгоритма RL традиционно для DeepSeek применяется GRPO, улучшенная версия PPO (очень подробно мы описывали этот алгоритм в нашей большой статье про DeepSeekMath). Отдельно поощряется формат, в котором модель помещает свои рассуждения внутри тегов <think> и </think>.

Уже на этом шаге после нескольких тысяч итераций точность на AIME скакнула с 15.6% до 71.0% (вау!). Итого, получается модель, обученная без разметки вообще – DeepSeek-R1-Zero.

🔷 Для DeepSeek-R1 процесс повторяется с небольшой разницей. Для R1-Zero мы использовали rule-based rewards, когда ответы проверяются только самой системой (например с помощью компилляторов), без внешних разметок. И хотя точность таким образом получается приличная, сами ответы читать сложно: в них смешиваются языки, нет форматирования и тд.

Поэтому в R1 в процесс обучения все-таки добавили разметку в виде готовых цепочек рассуждений. Данные брали из DeepSeek-R1-Zero и, видимо, o1 и улучшали вручную. На них модель дообучают, а затем их же применяют в RL, прикручивая сюда еще и rejection sampling (то есть отборные ответы прямо во время RL добавляются в обучающую дату).

Интересный факт: когда на этапе RL для R1 ввели правило "доля таргетного языка в ответе должна быть больше 0.95", качество немножко просело.

🔷

И, наконец, дистилляция! Тут в качестве базовых моделей брали Qwen и Llama, а учителем выступала R1. Из модельки насемплировали 800,000 примеров, на которых ванильно зафайнтюнили учеников (как работает дистилляция, читайте в нашей статье тут). Тут вообще не использовался RL, но в статье написано, что ученые хотят попробовать его применить.

И еще раз ссылка на полный текст: github.com/deepseek-ai/DeepSeek-R1/blob/main/DeepSeek_R1.pdf

Please open Telegram to view this post

VIEW IN TELEGRAM

Please open Telegram to view this post

VIEW IN TELEGRAM

15👍110❤32🔥16🤯6👌1

16.3K views09:11

Data Secrets

Ну и классика:

😁232🐳27🤔7🦄4👻2

13.1K views12:52

Data Secrets

Там, кажется, Anthropic наконец-то скоро выйдет из спячки

CEO стартапа Дарио Амодеи дал интервью Wall Street Journal и пообещал, что в ближайшем будущем Anthropic подарит нам новые более умные модели, а также улучшенную память для Claude и голосовой режим.

Также прозвучали слова о том, что к 2026 стартап запустит кластер размером 1 млн чипов (ничего такого никогда ранее Anthropic не заявляли).

AGI, кстати, как и ранее, Амодеи прогнозирует к 2027.

Полностью интервью можно посмотреть здесь, длится всего 35 минут

🔥55👍25❤16

14.6K viewsedited 15:20

Data Secrets

Мы?

😁164❤23💯12🗿2

14.5K views17:38

Data Secrets

Сразу несколько источников сообщают о том, что с минуты на минуту Трамп сделает заявление о многомиллиардных инвестициях в ИИ

Reuters пишут о 500 миллиардах долларов, Financial Times о 100 миллиардах.

Сам Трамп выступит через пару минут. Ждем

😎68👀20🤯15❤4👏4😁1🎉1

14.7K viewsedited 21:14

Data Secrets

⚡️

Итак, игра набирает обороты: Трамп анонсировал Stargate ака манхэттенский проект для ИИ

В предприятии участвуют OpenAI, Oracle, SoftBank (интересно, почему Маска на фан-встречу не позвали). Итоговая сумма начальных частных (!) инвестиций – $ 100 млрд, с возможным ростом до 500 в ближайшие 4 года (минимум).

Напоминаем, что все ИИ стартапы Европы в 2024 получили в сумме 13.7 млрд, последний раунд OpenAI был 10 млрд. Так что сумма в 100 млрд звучит просто как революция, цель которой, видимо – не оставить Китаю никаких шансов затмить США в гонке ИИ.

Теперь на место встает и недавний экономический план OpenAI, и осенние питчи Альтмана в Вашингтоне.

Акции Oracle уже улетели вверх, про Nvidia даже думать страшно.

Мы с вами наблюдаем начало чего-то большого

Please open Telegram to view this post

VIEW IN TELEGRAM

👍144🤯77👏16😁9😎6🌚4🫡4❤‍🔥1❤1

21.1K views22:23

Data Secrets

Итак, Stargate. Что нам известно?

➖ На начальном этапе будут реализованы 100 млрд долларов. Государственных денег США здесь нет: среди акционеров SoftBank, OpenAI, Oracle и MGX. SoftBank и OpenAI являются ведущими партнерами, причем SoftBank несет финансовую ответственность, а OpenAI — операционную.

➖ В техно-партнерах помимо Oracle и OpenAI числятся Arm, Microsoft и NVIDIA. Деньги потратят на инфраструктуру, то есть будут строить датацентры и кластеры. Судя по всему, первые кампусы появятся в Техасе, остальные территории пока "оцениваются".

➖ Интересно также, что теперь в силу вступает новое соглашение между OpenAI и Microsoft. Стартап еще больше отдаляется от гиганта: раньше Microsoft фактически конролировало все вычислительные силы Альтмана, теперь же стартап волен сам наращивать мощность и управлять своими датацентрами.

➖ Основной экономический упор на первом этапе – рабочие места. Ожидается, что их Stargate сгенерирует сотни тысяч. В перспективе – конечно, AGI, лидерство США в гонке технологий и ИИ в медицине.

➖ Так как вся компания крутится вокруг OpenAI, фактически они теперь – официальный ИИ Америки. У Google и Anthropic вряд ли остаются шансы после такого.

Пост OpenAI

Please open Telegram to view this post

VIEW IN TELEGRAM

👍95🤔30❤15🔥10😭6😁2🗿2

18.7K viewsedited 08:49

Data Secrets

How it started: 2015, маленькая некоммерческая организация

How it’s going: 2025, инвестиции в размере 2% ВВП США

🔥210🗿40👏16😁10❤‍🔥7😎7🤯2❤1🫡1

13.5K viewsedited 11:12

Data Secrets

Тем временем Perplexity наконец-то запускает API

Проект называется Sonar, о его запуске объявили вчера. Теперь серчинг в интернете на основе ИИ можно встраивать в приложения, то есть каждый может на коленке написать собственный ИИ-поисковик.

Есть два варианта использования: базовый и Sonar Pro (лучше подходит для сложных составных задач). Цены вполне ок: по 1 доллару за миллион инпут-аутпут токенов, для Pro $3/m input $15/m output.

🤩

Please open Telegram to view this post

VIEW IN TELEGRAM

❤40🔥19👍9🙈2

14K views15:26

Data Secrets

🚀

Кажется Operator, который должен открыть эру агентов в OpenAI, выйдет уже на этой неделе

Об этом сообщает The Information. Напоминаем, что Operator это это ИИ-агент для автономного управления компьютером, аналог агента Sonnet от Anthropic. С его помощью можно будет, например, заказать еду, забронировать путешествие или... оставить его работать над проектом и уйти отдыхать.

Учитывая, что почти все релизы у OpenAI выходят в четверг, готовимся увидеть Operator уже завтра

Please open Telegram to view this post

VIEW IN TELEGRAM

👍87👾18🔥14❤8🤯5😁3

14.1K views18:01

Data Secrets

Высок ли потенциал китайских LLM: новое исследование от EpochAI (надеемся, на этот раз не проспонсированное OpenAI)

Основное: исследователи насчитали, что мощности, выделяемые на обучение моделей, в Китае растут почти в два раза медленнее, чем у конкурентов с Запада и Европы. Если для глобала это 4.8x в год, то в Китае 2.9x (если считать с конца 2021).

Это не означает, что потенциала у Китая нет. Например, до 2021 – посмотрите на график – они уверенно давили педаль в пол, за счет чего и догнали мировую индустрию.

А сейчас разрыв опять растет. Конечно, флопсы – это только один из аспектов, и метрики последних моделей DeepSeek нам явно на это указывают, но все-таки недостаток мощности это риск. Например, уже сейчас Китаю бы потребовалось 2 года, чтобы достичь скейла глобального сегодняшнего топ-10. Неужели Gwern был прав?

👍36🔥15🤔5❤4🙈4

14.5K views08:43

Пока OpenAI начинают раскатывать Operator на Pro юзеров (похоже релиз действительно будет сегодня вечером!), китайская ByteDance подгадала момент и выкатила своего такого же агента в опенсорс

Он называется UI-TARS и вышел под лицензией Apache 2.0 (репозиторий). Основан агент на VLM (есть варианты на 2B, 7B и 72B, вот тут веса), на вход принимает картинки аля кадры экрана, а на выход генерирует человекоподобные действия, то есть движения мыши или нажатия на клавиатуру.

Самое интересное: в агенте есть ризонинг! Его обучали как на простых "интуитивных" сценариях, так и на CoT, так что для сложных задач он может поключать размышление и какое-то подобие планирования. Датасеты там, конечно, огромные, и собранные самими ByteDance.

На бенчмарках выглядит ничего. Учитывая, что Operator, вероятно, будет доступен только за 200 долларов, довольно приятный релиз.

Статья здесь

🤯69👍46🔥14❤9❤‍🔥3

17.7K views12:05

Data Secrets

Выиграть $5000 и стать соавтором в статье с CEO ScaleAI в обмен всего на один вопрос? Да запросто. CAIS и ScaleAI запустили конкурс вопросов для сложнейшего в мире бенчмарка для LLM. За каждый подходящий вопрос они обещают 500 до 5000 долларов, а также соавторство…

Помните бенчмарк Humanity’s Last Exam, в который можно было предложить свой вопрос за 5000 долларов? Его опубликовали!

Напоминаем: ученые из CAIS и ScaleAI с сентября собирали самый сложный бенчмарк с вопросами из разных областей. За хорошие вопросы они давали от 500 до 5000 долларов, а также соавторство в статье.

И вот наконец бечмарк вышел! Он состоит из 3000 вопросов и ведущие модели выбивают на нем < 10%. Лучше всех справляется (не поверите) новая R1 от DeepSeek: она выбивает 9.4%, в то время как даже o1 выбивает всего 9.1%.

Среди вопросов бОльшая часть по математике (42%), но также много физики, биологии и других наук. Примеры задачек можно посмотреть в статье.

Датасет | Статья | Репо

❤99🔥43👍27🗿3❤‍🔥1

15.3K views14:56

Data Secrets

⚡️

Вышел Operator!

Да, это тот самый агент, о котором ходило так много слухов последние дни, и которого мы все так долго ждали. Он может самостоятельно управлять компьютером, выполнять сложные задачи и взаимодействовать с браузером.

Например, с помощью Operator можно заказать доставку, спланировать путешествие или забронировать столик.

В основе GPT-4o. На вход подаются скриншоты экрана, на основе которых модель генрирует экшны. При этом все действо разворачивается не в вашем браузере, а на виртуальной машине прямо внутри чата с зашифрованным подключением. В этом окне что-то можно (а иногда и приходится, например в случае с капчами) делать самому.

Говорят, агент особенно хорош в навигации по сайтам. Метрики из блогпоста это подтверждают. Конечно, все еще не уровень человека, но уже большой шаг по направлению к сильным агентам. К тому же на стриме Сэм сказал, что скоро нас ждут и другие подобные оператору релизы.

Operator уже доступен пользователям по подписке Pro (200$/месяц), позже обещают раскатить на плюсов 💵

Please open Telegram to view this post

VIEW IN TELEGRAM

👍94🤔20❤16🤯7🗿3🔥2❤‍🔥1🍌1🤝1

21.5K viewsedited 18:08

About

Blog

Apps

Platform