Data Secrets

Новое исследование от Anthropic: система, которая позволяет мониторить элаймент онлайн

Обычно все тестирования на безопасность проводятся до деплоя, а затем модель уже отдают пользователям. Но что, если (теоретически) что-то пойдет не так уже после того, как систему развернули?

Anthropic предложили фрейморк для анализа диалогов пользователей и выявления ценностей, которые транслирует в этих диалогах Claude. Ценность - это какое-то "соображение" модели, которое оказывает влияние на ответ (как в мультике Головоломка). Помните, как Anthropic выделяли темы диалогов студентов с ботом? Вот тут техника похожая.

По умолчанию в клода заложены ценности "ответственность", "критическое мышление", "полезность для пользователя". Однако статистика показывает, что иногда всплывают такие штуки, как "доминирование" или "аморальность". Это результат джейлбрейков.

То есть система позволяет не только поломки в элайменте находить, но и в реальном времени ловить попытки неэтического использования.

Еще, кстати, интересно, что Claude, хоть и обучен определенным ценностям, не всегда напрямую их продавливает (картинка 3). Например, если запрос связан с прихологической помощью, он пытается переосмыслять ценности пользователя, вместо того, чтобы просто впихивать свои.

Статья

👍45❤18🔥7🗿6

14.8K views14:50

Data Secrets

Google предложили новую обобщенную архитектуру нейросетей, устроенную так, что трансформеры и RNN являются ее частными случаями

Основная проблема сегодняшних моделей – память. У нас есть трансформеры, но их сложно масштабировать на длинный контекст из-за квадратичной сложности операций. У нас есть RNN, но они не параллелятся и постоянно все забывают.

Так что в последнее время выходит все больше работ про все новые и новые подходы к моделированию памяти. И все они строятся на каких-то видах скрещивания: атеншена с линейностью, или гейтов забывания с трансформерами, или скалярной памяти с матричной, ну и тд и тп.

В Google заметили, что почти все эти методы можно описать единым набором правил. Свой фреймворк они назвали MIRAS, и его главная идея в том, что любое проектирование памяти нейросетей сводится к четырем основным выборам:

1. Выбор архитектуры памяти. Память может быть вектором, как в RNN, матрицей, как в трансформерах, отдельной маленькой нейросетью, как в test-time-training подходах, ну или чем-то другим.

2. Выбор attentional bias. Это функция потерь, которую память будет оптимизировать при обновлении. Цель, по сути, всегда одна: точно сопоставлять ключи со значениями, то есть верно восстаналивать связи между словами. В трансформерах, например, attention bias – это непараметрический ℓ₂‑MSE.

3. Retention Gate. Это регуляризация, которая контролирует, как и когда мы избавляемся от ненужной информации. Другими словами, мера консервативности или забывания.

4. Выбор метода оптимизации. Это конкретный рецепт того, как перейти из прошлого состояния памяти в новое, учитывая все компоненты выше. Например, в трансформерах это просто вычисление softmax‑attention, но также это может быть градиентный спуск или его модификации.

Вот и все. Похоже на выбор гиперпараметров. Перебираем набор по рамке и получаем либо уже известную модель, либо новую, с нужными свойствами по стоимости/емкости/устойчивости. И да, трансформеры, RNN и всякие Mamba – тоже частные случаи MIRAS (картинка 2).

И главное: получается, по этому пространству параметров можно гулять и искать локальные минимумы. Google для примера показали три MIRAS инстанса: Moneta, Yaad, Memora. Moneta достигает 93.5% на иголке в стоге сена, при этом перплексия падает мягко и метрики вполне себе на уровне.

Красивая и стройная работа. Читаем полностью тут

⚡106👍57❤31🔥9❤‍🔥3

17.4K views17:58

Data Secrets

OpenAI хотят купить Google Chrome, если представится возможность

В суде продолжается разбирательство по делу о монополизации гуглом рынка поиска. Министерство юстиции, возможно, вынудит компанию отказаться от Chrome.

Вчера на одном из серии таких судебных заседаний присутствовал Ник Терли. Его позвали как свидетеля, сейчас он работает менеджером в OpenAI. Вот что он сказал:

«Если представится возможность, OpenAI будет заинтересована в покупке Chrome. Приобретение Chrome позволит нам предложить юзерам действительно невероятный опыт и показать, как выглядит настоящий первый ИИ-браузер»

😁136👍26🆒8🤯7🤔4🎉3

13K views07:44

Data Secrets

1:11

This media is not supported in your browser

VIEW IN TELEGRAM

LM Arena мощно обновляется

Во-первых, они уже несколько дней тестируют абсолютно свежий интерфейс. В нем все будет немного более интуитивно, а главная страница будет напоминать ChatGPT. Кроме того, также, как в ChatGPT, можно будет просматривать свои прошлые диалоги. Навигация по лидербордам и подача баг-репортов тоже станет проще.

Во-вторых, LM Arena станет компанией. Напоминаем, что сейчас разработку двигает сообщество и группа энтузиастов. Но теперь ребята сообщили о том, что собираются официально оформлять стартап.

В-третьих, сегодня на арену завезли новую большую фичу – Sentiment Control. Эта штука похожа на style control (наш пост-разбор). Идея та же: чтобы получать объективные оценки без человеческого фактора, надо очистить ответ модели от всего лишнего, что может повлиять на голос пользователя, и оставить только чистое содержание.

Так, style control очищает ответы от красивого форматирования, а новый Sentiment Control будет очищать от лести и эмоциональности. Оценки этих факторов будут учитываться в качестве независимых переменных в регрессии Брэдли-Терри, которая используется на арене для подчсета статистики. Это помогает отследить их влияние.

Результаты применения – на картинке выше. Некоторые модели с Sentiment Control поднимаются в рейтинге (Claude-3.7-Sonnet, o1), а некоторые, наоброот, опускаются (Grok-3, Gemma-3, Llama-4-exp). Это значит, что люди действительно склонны иногда отдавать предпочтения более позитивным моделям, а не более умным.

Блогпост

🔥70👍30❤10👀2

13.7K views09:07

Data Secrets

Anthropic выкатили гайд по вайб-кодингу

😎

23 страницы посвящены тому, как программировать с агентами (в частности, с Claude Code). Собраны советы, best practices, примеры, антипримеры и даже готовые промпты.

Отдельное внимание уделяется безопасности данных и мульти-агентным процессам.

Полезно, если пользуетесь каким-нибудь подобным инструментом каждый день

PDF

Please open Telegram to view this post

VIEW IN TELEGRAM

👍98🔥33😁26❤7🤔4😎3🤯1

21.9K views11:39

Data Secrets

OpenAI повысили лимиты и теперь Plus-пользователям доступно 50 запросов к o3 и o4-mini в день. Также o4-mini совсем скоро раскатят на бесплатных юзеров, судя по последнему обновлению.

У Сэма Альтмана, кстати, сегодня День Рождения, исполняется 40 лет. Интересно, праздничный торт нам светит? ✨

Please open Telegram to view this post

VIEW IN TELEGRAM

🔥161🎉52🍾16❤9😁6👍1🍓1🗿1

15.4K views15:05

Data Secrets

Джеффри Хинтон, куча бывших сотрудников OpenAI и еще несколько известных ученых подписали открытое письмо об отмене перехода OpenAI в разряд коммерческой организации

Они настаивают на том, чтобы OpenAI в целях безопасности AGI запретили становится коммерческими, и чтобы стартап юридически связали с его изначальной миссией.

Также в письме требуют пересобрать совет директоров, «удалив» всех, кто активно поддерживал переход и добавив больше «независимых» членов.

Это будет посерьезнее иска Илона Маска. День Рождения у Сэма не задался, видимо

https://notforprivategain.org/

1👍168🗿34😁29🔥10❤7🤨5🤔3🫡1

15.5K views18:31

Data Secrets

1:37

This media is not supported in your browser

VIEW IN TELEGRAM

О, Perplexity анонсировали крутого голосового ассистента для iOS

Это Siri на максималках (наверное, стоило написать в заголовке Siri – ВСЕ): агент сможет использовать браузер и некоторые приложения, рассылать письма, создавать брони, управлять календарем, проигрывать подкасты, YouTube ролики и другое медиа.

Обновить приложение в AppStore и попробовать (это бесплатно) можно уже сейчас

💯68👍32❤16😁7🗿2❤‍🔥1🤯1🤨1👾1

16K viewsedited 07:34

Data Secrets

0:04

This media is not supported in your browser

VIEW IN TELEGRAM

OpenAI ожидает, что к 2029 выручка компании достигнет 125 миллиардов долларов, а к 2030 – 174 миллиардов

По крайней мере, так они говорят инвесторам. Об этом пишет The Information. Основная часть продаж будет генерироваться новыми продуктами, то есть агентами. Также рассматривается возможность продажи рекламы и взимания партнерских сборов.

Для сравнения, выручка стартапа за 2024 – примерно 3,7 миллиарда. То есть прогнозируется рост почти в 34 раза всего за 5 лет.

😁76👍45🔥13🦄8🤯5👌2⚡1❤1🕊1

14.2K views08:56

Data Secrets

0:16

This media is not supported in your browser

VIEW IN TELEGRAM

0:46

This media is not supported in your browser

VIEW IN TELEGRAM

В DeepMind обучили полноценную компьютерную модель... мухи 🪰

Исследователи нарисовали модель тела мухи и с нуля обучили его ходить, летать и вообще вести себя, как настоящее насекомое. Весь процесс происходит в физическом симуляторе MuJoCo. Это тоже разработка DeepMind (вот репа).

MuJoCo создавали для более крупных роботов, конечно, но в целом среда универсальная, поэтому нужно было просто добавить туда несколько новых функций. Например, завихрение воздуха вокруг крыльев, которое позволяет летать, или силу адгезионного сцепления, которое позволяет ползать под любым углом.

Обучали end-to-end методами обучения с подкреплением на видео настоящих мух. Результаты получаются довольно реалистичные: модель действительно летает по нужным траекториям и движения удивительно точные.

"Мы считаем, что такие могут помочь ученым лучше понять, как мозг, тело и окружающая среда влияют на поведение животных. Так мы сможем находить связи, которые не изучить в лаборатории"

Кстати, в прошлом DeepMind уже делали что-то такое с грызунами (наш пост). Говорят, что следующий кандидат на моделирование – рыбка данио-рерио (zebrafish) из семейства карповых. Она разделяет с людьми рекордные 70% генов, кодирующих белки.

Кстати, модельку мухи полностью выложили в опенсорс

👍89🔥45❤17⚡1

20.9K views10:53

Data Secrets

Появились некоторые свежие подробности про открытую модель от OpenAI. Вводим вас в курс:

➖ Она появится в начале лета, лицензию обещают очень демократичную
➖ Пока проект на ранней стадии, разработку возглавляет Эйдан Кларк, вице-президент по исследованиям
➖ Модель будет с ризонингом, но пользователи смогут выключать и включать режим рассуждений
➖ Все-таки модель будет не для GPU-poor юзеров, но в дальнейшем так же выйдут меньшие варианты, они будут не такими требовательными по железу
➖ На момент выпуска мультимодальности не будет, только текст на вход и выход

Последнее, конечно, грустно. Надеемся, метрики не подкачают

Please open Telegram to view this post

VIEW IN TELEGRAM

👍61🔥19❤11

14.1K viewsedited 12:44

Data Secrets

Google показали статистику Gemini (точнее раскрыли в суде)

Насчитали 35 млн DAU (активных пользователей в день) и 350 млн MAU (в месяц). Это уже больше, чем у Anthropic. Для ChatGPT те же показатели составляют соответственно 160 млн и 600 млн.

Зато Gemini, надо сказать, растет быстрее. Пол года назад, для сравнения, их DAU был 9 млн. Это рост почти в 4 раза. ChatGPT за это же время вырос с 90 млн (то есть в 1.7 раз).

🔥85👍30❤14✍7

15.1K views15:26

About

Blog

Apps

Platform