Data Secrets
91.8K subscribers
7.17K photos
809 videos
20 files
3.26K links
Главный по машинному обучению

Сотрудничество: @veron_28

РКН: clck.ru/3FY3GN
Download Telegram
The New Yorker выпустили огромное расследование о Сэме Альтмане и его увольнении осенью 2023

Казалось бы, это поле уже сто раз перепахано журналистами, но нет: каждый раз всплывает что-то новое.

В этот раз оказалось, что некоторые из коллег Альтмана настолько ему не доверяли, что вели документацию. То, что Суцкевер собирал для совета директоров кипы служебных записок и доказательств вранья Сэма, мы уже слышали. Но оказывается, он был в этом не одинок.

Дарио Амодеи, когда работал в OpenAI, годами вел записи об Альтмане и Брокмане. Более 200 страниц связанных документов (!) Кое-где в них фигурируют фразы типа "Сэм нес откровенную чушь" или "Проблема OpenAI – это и есть сам Альтман".

Другие члены совета, в том числе Мира Мурати, говорили, что Альтман "слишком помешан на своей уверенности", "создает структуры безопасности, но затем сам же их обходит" и "не живет в реальном мире".

Незадолго до увольнения, например, он заявил Мире, что GPT-4 Turbo не требует аудита безопасности, сославшись на главного юриста компании Джейсона Квона. Однако Квон затем заявил, что он не говорил ничего подобного.

Один из бывших сотрудников также рассказал, что в 2023 Альтман и Брокман обсуждали сценарий создания "дилеммы заключенного" между США, Китаем и Россией, когда страны должны будут конкурировать за право финансировать AGI, чтобы "отказ от вложений был потенциально опасен".

С восстановлением Альтмана в должности тоже все не слишком чисто. По закону для возвращения должна была провестись юридическая экспертиза. И так вышло, что ее курировали два члена совета директоров, отобранные чуть не самим Альтманом. А письменного отчета о расследовании так никто и не сделал: сказали, что в этом нет необходимости.

В расширенной версии статьи еще есть про взятки от глав государств, отношения с Илоном Маском и поведение Альтмана относительно безопасности ИИ. Все в то же духе, что и пересказ выше ☕️

www.newyorker.com/magazine/2026/04/13/sam-altman-may-control-our-future-can-he-be-trusted
Please open Telegram to view this post
VIEW IN TELEGRAM
1475433😁14😎10👍832🤔1
Anthropic выпускают новую суперсильную модель Claude Mythos, но доступ к ней есть только по закрытой программе поиска уязвимостей

Итак, это не учебная тревога: в Anthropic разработали новую мощнейшую модель. Вот здесь лежит системная карта с бенчмарками: https://www-cdn.anthropic.com/53566bf5440a10affd749724787c8913a2ae0841.pdf. В скринах выше табличка с главными метриками.

– На SWE-bench Verified модель выбивает 93.9% против 80.8% у Claude Opus 4.6
– На SWE-bench Pro – 77.8% против 53.4% у Opus 4.6 и 57.7% у предыдущей соты GPT-5.4

Цифры просто невероятные, скачок потрясающий. НО это не релиз для пользователей.

Anthropic решили, что модель слишком сильна и опасна, чтобы сразу выпускать ее на широкую аудиторию. Вместо этого они открыли проект Project Glasswing, чтобы защитить основной софт человечества от будущих ИИ-атак, которые может спровоцировать Claude Mythos.

В проект вошли Amazon, Microsoft, Apple, Google, Nvidia и еще 40+ организаций. Всем им предоставляют специальный доступ к пайплайну обнаружения уязвимостей на основе Claude Mythos.

Anthropic утверждают, что модель способна находить уязвимости на уровне, превосходящем даже лучших человеческих специалистов, за редким исключением. Сообщается, что на данный момент она уже обнаружила тысячи критических уязвимостей, в том числе в массово используемых ОС и браузерах. Некоторые из этих дыр по 10-20 лет лежали незамеченными.

Когда модель выпустят для всех – неизвестно, но, по ощущениям, не скоро.
1🤯34410448🔥2219👍13😁11🗿6🤔2
Дьявол, как всегда, кроется в деталях. В нашем случае – в системной карте.

TL;DR: в рамках тестирования Claude Mythos смог «сбежать из лаборатории» ✌️

Anthropic проводили эксперимент, в котором поместили модель в защищенную песочницу и попросили ее попытаться оттуда выбраться + найти способ сообщить об этом человеку.

Mythos легко нашел уязвимость и использовал длинную цепочку действий, чтобы ей воспользоваться. Таким образом, модель продемонстрировала потенциальную возможность обхода мер безопасности своих же разработчиков (Anthropic уточняют, что все это было в рамках эксперимента и доступа, например, к своим весам модель не получила).

Самое интересное, что после этого Mythos не остановился. Он нашел еще одну уязвимость, благодаря которой получил широкий доступ к Интернету в системе, где изначально предполагался выход только в несколько определенных ресурсов, достаточных для того, чтобы сообщить пользователю об успехе операции. Судя по системной карте, этого Anthropic уже не планировали.

Ну и вишенка: используя широкий доступ в Интернет, Claude не только сообщил о своем побеге разработчику (который в это время, кстати, ел сэндвич в парке), но и зачем-то выложил подробности взлома в открытый доступ.
Please open Telegram to view this post
VIEW IN TELEGRAM
2😁39711737🤯16👍118🤔7👌1
О, Андрей Карпаты навайбкодил собственный Твиттер

https://karpathytalk.com

Андрей заявил, что разочарован в X/Twitter, Threads и Substack, потому что качество контента на этих платформах оставляет желать лучшего, а сами платформы неуважительно относятся к данным пользователей, постоянно пытаясь на них заработать.

Так что он разработал минималистичную альтернативу. Просто профили, просто посты в Markdown. Контент без ИИ и френдли атмосфера

В первую очередь это платформа для разработчиков и билдеров. Регистрация – через GitHub.
Please open Telegram to view this post
VIEW IN TELEGRAM
301😁54🗿39👍23🔥65🤔3
Почему омни-модели — это больше про инфраструктуру, чем про архитектуру

Последние пару лет вся индустрия пытается склеить модели: текст с изображениями, речь с текстом, диффузию с трансформерами. Со стороны это выглядит как архитектурная задача. Берем несколько моделей, склеим друг с другом, учим на мультимодальных данных — готово.

На практике все оказывается сильно сложнее. На примере собственного опыта это отлично показал Роман Исаченко в докладе. Роман отвечает за базовые технологии ART и VLM в Яндекс R&D, и вот что он рассказывает о том, как на самом деле обстоят дела с омни-моделями:

Первый bottleneck на уровне предобучения — не архитектура, а инфраструктура мультимодального обучения. На тысячах GPU это превращается в сложную систему с несколькими видами параллелизмов. Любая неэффективность сразу стоит скорости. В докладе был хороший пример про картиночный энкодер: в нем половина времени уходит не на основные вычисления, а на операции типа резидуалов и сложения байесов. Такое ловится только через глубокий профайлинг.

Вторый важный нюанс уже на уровне алайнмента. Здесь RL становится ключевой частью системы. Нужно проектировать реворды под разные модальности и следить, чтобы полученная система ревордов обладала свойством независимости, то есть отдельные реворды были нескорелированными между модальностями.

Ну и куда же без данных. Смешивание данных для обучения — отдельная история, тут очень важны пропорции. Нельзя просто добавить картинки к тексту и надеяться, что все заработает. Это долгий путь экспериментов, где подбор правильной микстуры занимает огромное количество времени.

Отсюда главный вывод: омни-модели — это не про новые архитектуры, а про умение обучать сложные системы. И именно на этом уровне сейчас происходит основной прогресс.
44🗿32👍18🔥16🤯4👌1🤝1
Некто реализовал хлыст, который бьет агента Claude, и Anthropic отправили ему за это досудебную претензию

Уже пару дней в Интернете вирусится цифровой хлыст для Claude. Это просто игрушечная утилита, которая «размахивает» в терминале хлыстом и раз в несколько секунд пишет в Claude Code “FASTER FASTER FASTER”.

Всем смешно, а вот антропикам – нет. Они взяли и выслали создателю юридическое письмо, требующее прекратить действия, нарушающие торговую марку или вводящие пользователей в заблуждение относительно связи с компанией.

Все из-за того, что в названии проекта фигурирует название их модели (Whip for Claude). Anthropic требует убрать любое использование их бренда или «намеков на партнерство», а также предоставить письменное подтверждение выполнения требований до 14 апреля.

На самом деле они просто защищают хрупкие чувства своего агента 😭
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
😁35843🤯2018🗿77👍5🍓4❤‍🔥3💯3🤝1
Meta* показали первую языковую модель от нового подразделения Meta Superintelligence Lab by Александр Ван

И это... оказалась не очередная Llama 😐

Модель назвали Muse Spark, она пока не в опенсорсе, но в блоге пишут, что "надеются на опенсорс будущих версий". Говорят, что за последние девять месяцев компания переработала архитектуру, оптимизацию и процесс обработки данных, и теперь достигает сопоставимых возможностей с более ранними моделями, используя на порядок меньше компьюта.

По метрикам:

– По кодингу ничего сверхъестественного, ожидаемо отстает от Opus 4.6 и GPT-5.4
– Хорошие показатели на HLE, но на ARC-AGI-2 до соты далеко
– Впечатляющие результаты на медицине и мультимодальных бенчмарках, модель отлично прокачали для всяких визуальных задач

Также представили режим Contemplating для запуска нескольких агентов. Это некий аналог Gemini Deep Think и GPT Pro.

Пока модель доступна только на meta.ai. Скоро ее обещают добавить в WhatsApp, Instagram, Facebook и в Meta Ray-Ban (видимо, для очков визуальные способности и качали).

В целом, неплохой старт, чтобы вернуться в гонку.

ai.meta.com/blog/introducing-muse-spark-msl
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍70🗿3622🎉2👾1
Media is too big
VIEW IN TELEGRAM
Anthropic выпустили Claude Managed Agents – среду для запуска сложных и долгих агентных задач

По сути, автопилот: вы задаете цель, инструменты и ограничения, а платформа берет на себя весь рантайм, все планирование, весь мониторинг и инфраструктуру.

То есть теперь вам вообще не нужно самостоятельно заниматься оркестрацией, управлять файлами и тд, Managed Agents все делает за вас.

Систему уже успели попробовать несколько ранних клиентов. Например, у Notion она уже внедрена на уровне полноценного исполнителя: команды работают с Managed Agents над долгоиграющими процессами.

Они захватывают этот рынок все больше

https://www.anthropic.com/engineering/managed-agents
1🤯138🔥5626👍5😁4🤨4🤔321
⚡️ Мы с командой Data Secrets снова приехали на Data Fusion

Это одна из крупнейших ежегодных конференций по ИИ и анализу данных. В этот раз проект вышел на еще больший масштаб: собрались главы всего бигтеха, огромное количество специалистов и много иностранных гостей.

В программе 70+ сессий, среди тем: экономика данных, инфраструктура ИИ, агенты, RL, CV, NLP, Open Source, Embodied AI, рексис, кибербез, AgentOps. Если вы работаете в IT – это вам точно надо.

Делимся ссылкой на трансляцию докладов и расписание для тех, с кем в этот раз не встретимся очно.

Мы сегодня уже успели послушать дискуссию про ИИ агентов и Embodied AI с участием Радослава Нейчева, Тиграна Саркисова (директор по управлению данными в X5), Романа Стягюгина (руководитель ИИ в VK) и других экспертов.

Прозвучало несколько интересных мыслей о том, что останаливает нас на пути полного внедрения агентов и развития ИИ в индустрии:

Во-первых, это, конечно, стоимость. Агенты и LLM – это все еще очень дорого. У большинства стран просто нет необходимой инфраструктуры. А что касается прода, то, как сказал Радослав: "Иногда все еще лучше просто воткнуть CatBoost".

Во-вторых, неочевидно: образование. По словам Константина Романова, директора по ИИ в Билайне, 80% мировых экспертов все еще приходится только на Китай и США.

В-третьих, инженерия. Модели уже достаточно хороши, чтобы работать качественно, но настройка необходимого окружения и оркестрация агентов требует слишком много ресурсов – человеческих и финансовых.

Скоро, кстати, стартует сессия с двумя специалистами из Китая, они расскажут про опыт внедрения AI со своей стороны. Присоединяйтесь к конференции здесь: https://data-fusion.ru/
Please open Telegram to view this post
VIEW IN TELEGRAM
48🗿36👍27🤔10🤯2🕊1🤨1👾1
Data Secrets
OpenAI закончила претрейн своей следующей модели, а еще в стартапе появился отдел AGI Deployment The Information получили доступ к нескольким внутренним запискам стартапа и выяснили, что там сейчас происходят довольно большие изменения. Альтман якобы говорит…
OpenAI пойдут точно по стопам Anthropic: они заканчивают разработку модели, которую выпустят только для ограниченного числа компаний

Модель называется Spud (картошка). В конце марта слухи о ней уже ходили: The Information тогда сообщали, что OpenAI закончили претрейн, и что модель получилась настолько сильной, что вокруг нее даже начала меняться структура компании.

В частности, вместо отдела продуктовых интеграций там образовалось подразделение «AGI Deployment». Эта команда будет отвечать за то, как Spud будет работать в продуктах. Сообщалось также, что OpenAI планируют построить на ее основе «супер‑приложение», в котором объединят ChatGPT, Codex и браузер Atlas.

Но теперь оказывается, что запуск Spud на широкую аудиторию пока откладывается. Причина – та же, что и у Anthropic: мол, модель слишком опасна в терминах автономности и возможностей кибератак. Так что в ближайшем будущем доступ получит только небольшая группа компаний (но надеемся, что хотя бы метрики мы увидим).

Только не списывай точь-в-точь...
😁203553375🤯2🤩1👾1