Data Secrets
92.4K subscribers
7.26K photos
827 videos
20 files
3.31K links
Главный по машинному обучению

Сотрудничество: @veron_28

РКН: clck.ru/3FY3GN
Download Telegram
Сертификат ответственной разработки ISO/IEC 42001 добрался до всей линейки Alice AI: что вообще можно проверять в нейросети

По ISO/IEC 42001 оценивают не саму модель, а процессы ее создания и внедрения. Хороший повод разобрать механику на примере генеративных моделей Яндекса – Alice AI VLM и Alice AI ART, которые прошли такой аудит вслед за языковой моделью, сертифицированной год назад. Аудиторов интересуют процессы: пайплайн данных от происхождения до ограничений использования, документация по целям и сценариям применения моделей, процедуры оценки правовых ограничений, мониторинг аномалий. Логика та же, что у ISO 27001 в инфобезе: стандарт не гарантирует, что модель никогда не ошибется, – он подтверждает, что весь жизненный цикл устроен по воспроизводимым и проверяемым процедурам.

Получить такой сертификат непросто: аудит требует раскрыть всю внутреннюю кухню разработки – от подготовки данных до обучения сотрудников. Далеко не каждая компания готова к такому уровню прозрачности. Среди тех, кто на это пошел, – Amazon, Anthropic, Microsoft и теперь Яндекс.
😁134🗿5132👍19🔥5😎5🤨4🤔31🕊1
This media is not supported in your browser
VIEW IN TELEGRAM
OpenAI выпустили миниатюрную клавиатуру специально под Codex

https://openai.com/supply/co-lab/work-louder/

Есть клавиши принять, отклонить, включить push-to-talk, начать новый чат и прочее. Джойстик в углу отвечает за мгновенный запуск типичных сценариев типа отладки, ревью и рефакторинга. А в другом углу – это регулятор уровня рассуждений.
😁19832🔥16167👌3👍2🍓2💯1🗿1
Внезапно выяснилось, что сегодня в США празднуют Национальный День Искусственного Интеллекта

О как

IMB поздравили оригинально
😁18040🔥10😍6👍1🤔1💯1🍓1🍾1🎄1
Kimi K3 здесь

2.8T параметров, 1М контекста. Официальных бенчмарков пока нет, но вроде как модель бьет Fable и Sol на BrowseCamp и выходит на 3 место на GDPval.

https://www.kimi.com/

Модель также доступна по API у нас на платформе DS Lab: https://dslab.tech/ai/models/llm/kimi-k3
1🤯217🔥54🤔2519👍17😁621
Data Secrets
Kimi K3 здесь 2.8T параметров, 1М контекста. Официальных бенчмарков пока нет, но вроде как модель бьет Fable и Sol на BrowseCamp и выходит на 3 место на GDPval. https://www.kimi.com/ Модель также доступна по API у нас на платформе DS Lab: https://dsla…
Про Kimi K3. В итоге модель уверенно бьет Opus 4.8*, но до Fable и Sol дотягивает далеко не везде. Так или иначе, это новая открытая SOTA, и она как никогда близка к закрытым лидерам.

Из интересного также первое место на Frontend Code Arena, с достаточно большим отрывом от Fable и Sol.

А еще, помните то видео, которое Moonshot выпускали как тизер? Так вот его из 56 сырых видео полностью смонтировала сама K3.

* Цена при этом почти в два раза меньше Opus 4.8: $3 input / $15 output за миллион токенов.
🔥23736👍33🤯74🤨3❤‍🔥2😁1💯1🤗1
This media is not supported in your browser
VIEW IN TELEGRAM
В Шэньчжэне стартовал первый в мире MMA чемпионат среди роботов – Ultimate Robot Knock-out Legeng

Выглядит достаточно эпично. Главный приз – полтора миллиона долларов, кстати.
1185😁145🔥46🤯14👏6🏆63👍32💯1🍓1
Список обещаний Илона Маска пополнился: он пообещал сделать X полностью опенсорсным

Речь не о рекомендательном или каком-то отдельном алгоритме, он имеет в виду буквально X целиком.

Кроме того, мы пригласим независимых экспертов для проверки системы, которая сейчас работает, чтобы подтвердить, что открытый исходный код соответствует тому, что действительно запущено. Доверие через полную прозрачность – это единственное, чему стоит верить.
1🔥254🤔65😁2923🤯13👍108🫡3🗿21🍾1
Тем временем разработчики из Moonshot уже намекают на Kimi K3.1, которая будет ближе или лучше Fable и Sol

Держитесь, Альтманы и Амодеи
😁243🔥7534🤯8🎉6😎6👍4🕊42👌1🫡1
Hugging Face × alphaXiv запустили крутой челлендж

В качестве задачи разработчикам и исследователям предлагают взять любую интересующую научную работу и попытаться воспроизвести ее ключевые результаты с помощью агентов.

Цель проекта – создать публичную базу проверок научных работ, чтобы сделать их более прозрачными и воспроизводимыми. Особенно учитывая, что около 70% работ в ИИ не воспроизводятся.

Из приятного: организаторы предлагают GPU-кредиты на 4000$ + отдельные призы от OpenResearch. А сам челлендж закончится 2 августа, так что не упустите возможность поучаствовать.
🔥15732👍12😁5🤯2
Fable 5 оставляют в подписке Max навсегда

На Pro пока привилегия не распространяется, их переводят на использование по кредитам.
😁34654🔥24😢12🍾63😍3🦄3👍1🤔1
Т-Технологии выпустили опенсорс-модель T-Search

Сегодня команда Data Secrets посещает ML Conf. Послушали доклад Анатолия Потапова, руководителя группы фундаментальных технологий LLM в Центре искусственного интеллекта Т-Банка, где как раз презентовали модель.

T-Search это первая открытая русскоязычная модель для Agentic RAG, заточенная на многошаговый поиск для бизнеса.

В отличие от классического RAG с одним запросом, T-Search – агент-ретривер: внутри ReAct-цикл с тремя инструментами – search_corpus, save_and_advance (сохранение чанков, новый раунд) и finalize_ranking (финальный ранжированный список). Ответ модель не генерирует, только отдает evidence-чанки, генерацию берет на себя любая LLM. Это сокращает стоимость инференса на 20–50%.

Агент работает раундами: внутри раунда каждого вот такой ReAct-loop с бюджетом ~32K токенов; при заполнении 75% окна поиск блокируется, и агент либо сохраняет память и переходит в новый раунд, либо финализирует результат. Между раундами передается не вся история вызовов, а сжатое состояние поиска, так контекст остается в разумных пределах даже при глубоком поиске.

Бюджетом поиска можно управлять гибко: один быстрый прогон или несколько параллельных роллаутов с RRF-объединением.

Модель построена на Qwen3.6-35B-A3B, для запуска хватает одной H100. По recall T-Search обходит более крупные открытые модели, включая Qwen3.5-397B, GLM-5.2 и Kimi-K2.6. Вместе с ней выложили два бенчмарка: собранный вручную русскоязычный TRuST и синтетический SynthComp.

Модель уже опубликована на Hugging Face под лицензией Apache 2.0
1👍13156🔥31😁17😢5❤‍🔥4🤯2🕊2😎21🎉1
Alibaba анонсировали Qwen 3.8

Будет 2.4T параметров, и разработчики утверждают, что уступать модель будет разве что Fable.

Qwen3.8-Max-Preview уже можно попробовать в Token Plan, Qoder и QoderWork. Скоро раскатят глобально и выложат веса.

Еще один убийца американского лидерства ⌨️
Please open Telegram to view this post
VIEW IN TELEGRAM
1190🔥82👍35😁1412🤯7🗿5🏆2❤‍🔥1🍓1🫡1
Fable 5 опровергла известную гипотезу Якобиана

Она формулируется так: если у полиномиального отображения постоянный ненулевой якобиан, то у него должен существовать полиномиальный обратный. Надо понимать, что это не очередная узкая проблема математки, а буквально центральный вопрос обратимости полиномиального отображения, который с 30-х годов прошлого века оброс кучей литературы и споров.

До сегодняшнего дня были доказаны только некоторые частные случаи. Найденный Fable пример гипотезу окончательно опровергает.

О решении объявили математики Levent Alpöge и Akhil Mathew, его уже проверили в автоматических верификаторах и подтвердили некоторые независимые математики.

Math is solved?
1🔥279🤯9922😁12👍8🤔5💯5🤨5🫡2😎2🎄1
Сегодня исполняется ровно 57 лет, как люди впервые высадились на Луну

И вот вам минутка интересных фактов: весь оригинальный исходный код, благодаря которому это получилось, лежит в открытом доступе. Опенсорснули несколько лет назад.

Там 145к строк, которые Маргарет Хэмилтон и ее команда написали для командного блока и лунного модуля.

https://github.com/chrislgarry/apollo-11
🔥35590👍38😁15🏆5🗿4🤔2🕊2🍓2🍾2🫡2
Администрация Трампа хочет запретить американским компаниям использовать китайские модели

Обсуждается что-то вроде включения китайских лабораторий в Entity List. Это означает ввод ограничений на их использование в компаниях (возможно для начала только работающих с правительством США), плюс всякие публикации предупреждений о рисках и уязвимостях китайских моделей.

Аргументы уже привычные: риски шпионажа, утечек, кибератак и тд. К большому сожалению американского правительства, просто взять и запретить опенсорс невозможно, поэтому приведет это максимум к неофициальному использованию этих моделей и/или монополии OpenAI и Anthropic.
1195322😁1412🤯8👍6🍾32🕊1🫡1
Т-Банк выпустил опенсорсный рекомендательный фреймворк Perseus

Как и многие крупные компании, T-Банк – это экосистема, которая построена на множестве разных сервисов. Раньше у каждого из таких сервисов была отдельная рекомендательная система. Это, в свою очередь, пораждает множество инфраструктурных неудобств, проблемы с холодным стартом и так далее.

Perseus решает эту проблему. В субботу на Turbo ML мы посетили доклад Кирилла Ляхновича про новый фрейморк, и вот, как он работает 🔽

По сути, это масштабная перестройка всего подхода к экосистемным рекомендациям: вместо отдельных наборов признаков все действия пользователя теперь сваливаются в единую последовательность, как в известном SASRec.

– Действия пользователя со всех сервисов хронологически собираются в единую базу, и эмбеддинги (это важно) обучаются универсально для всех доменов с помощью разных энкодеров;
– Товары описываются текстовыми эмбеддингами, чтобы одинаковые продукты с разными ID в разных магазинах модель воспринимала как одно и то же понятие;
– Инженерно все сделано так, чтобы при обучении не было утечек будущего, а на инференсе не приходилось пересчитывать тяжелые артефакты.

Основное преимущество и уникальность фреймворка в том, что применение не ограничивается рекомендациями. Ядро – это построение единого вектора пользователя из его последовательности действий, а дальше к этому вектору просто прикручивается task head под конкретную задачу в конфиге, без переписывания пайплайна сбора и обработки данных. Причем на вход можно подавать любые данные. То есть та же архитектура готова, например, для решения задачи того, интересен ли пользователю продукт или для оценки дохода по истории транзакций.

Эффект от такой переупаковки получился, само собой, масштабный. В частности, Perseus отлично решает проблему холодного старта: в разных задачах сразу удалось повысить бизнес метрики на +17%, даже если у пользователя не было покупок. В общем, огромная и важная работа.

Приятнее всего – открытый код. Огромный простор для экспериментов и переиспользования.
Please open Telegram to view this post
VIEW IN TELEGRAM
64🔥34👍19😁1684🗿3🫡2🎄2👏1💯1