Data Secrets – Telegram

Data Secrets

77.3K subscribers

6.03K photos

591 videos

20 files

2.42K links

Главный по машинному обучению

Сотрудничество: @veron_28

РКН: clck.ru/3FY3GN

Download Telegram

About

Blog

Apps

Platform

77.3K subscribers

This media is not supported in your browser

VIEW IN TELEGRAM

Ученые из Sakana AI проверили, насколько хорошо модели играют в судоку и оформили все в бенчмарк

Игровые бенчмарки сейчас настоящий тренд. Уже есть для шахмат, шашек, го и куча для компьютерных игр. Но для судоку еще не было. Забавно, что пропуск восполнили именно в японской лаборатории.

Всего в тесте примерно 3000 задач. Есть простые классические, а есть с усложнениями (обычно это всякие картинки, вдоль линий которых числа должны следовать доп.правилам). Некоторые из паззликов вручную нарисовали специально для лаборатории в компании Nikoli, где судоку и изобрели.

Лидерборд сейчас такой:

1. o3-mini high (14%)
2. Gemini 2.5 Pro (она кстати лучше o3-mini high, если смотреть только по сложным задачам 6х6)
3. Qwen 3

o3, видимо, полностью еще не прогнали. Но говорят, что это единственная модель, которая может решать судоку 9х9. Правда, всего на 2.7% и только ванильные, без усложнений. В общем, оказывается, что судоку для LLM – это прямо очень сложно.

Кстати, получился не только крутой бенчмарк, но и датасет, потому что плюсом ко всему Sakana сотрудничали с YouTube каналом Cracking the Cryptic и выложили огромный набор извлеченных из их видео последовательностей решений судоку. Это буквально идеальные трейсы CoT для обучения ризонеров (последнее видео).

Вот репа
Вот тех.отчет
Вот тут можете попробовать решить сложную судоку с изображением лого лабы

👍89❤32🔥1673🕊22

19.7K views06:30

Media is too big

VIEW IN TELEGRAM

Какое-то неоднозначное заявление от ресерчера из Anthropic: в одном свежем подкасте он говорит, что даже если прогресс LLM остановится сегодня и ИИ больше не станет сильнее, текущих возможностей хватит на то, чтобы в течение пяти лет заменить ВСЕХ белых воротничков

Мнение?

😁166💯7632👍2614🤨13🔥7🤔4🤓4❤3

20.7K views09:06

Кажется, сегодня DeepSeek-v3 обновится второй раз

Пока это только слухи, но на Unsloth AI уже появилась страница с документацией о том, как запустить модель «DeepSeek-v3 0526» локально.

Сейчас они доступ закрыли и написали, что выложили статью случайно, основываясь «только на догадках». Официального подтверждения действительно не было, но скоро, видимо, будет.

В статье заявлена была точность на уровне GPT-4.5 и Opus 4. Если правда, то это будет лучшая открытая модель в мире.

❤171👍60🔥48🤔11⚡3👀2🏆1

22.3K views15:02

Все жители Дубая и других городов ОАЭ скоро будут пользоваться ChatGPT Plus бесплатно

Это будет частью партнерства между OpenAI с ОАЭ в рамках проекта Stargate UAE. Основная цель партнерства это строительство в Эмиратах крупнейшего суперкомпьютера, ну а бесплатная подписка для всех жителей страны – это просто маленький бонус 😐

Датацентр, кстати, планируют запустить уже в следующем году. В нем, по планам, будет 1 гигаватт. Обычно такой мощности хватает на обеспечение энергией целого штата, и за пределами США это будет первый кластер такого масштаба.

Please open Telegram to view this post

VIEW IN TELEGRAM

198🔥84❤26🤯11😎9😁666🤔3❤‍🔥2🫡1

23.1K viewsedited 07:16

Media is too big

VIEW IN TELEGRAM

Если вы думали, что ИИ заменит программистов, то берите выше: известный предприниматель Стефан Балабан считает, что ИИ заменит код как таковой

Балабан – CEO Lambda AI, это облачный сервис для аренды GPU, деплоя моделей и тд. Так вот на одном из своих недавних выступлений он выдал вот что:

Написание кода больше не будет иметь смысла. ПО будет просто промптами и будет «вести себя как код». Весь софт будет нейронным. Например, каждый пиксель будет сгенерирован, а не отрисован.

Стар трек?

2🐳157🤔102😁68🔥2215👍1412🤨10❤88🤯3

23.1K views09:24

В 2024 на ИИ пришлась почти треть от всех глобальных инвестиций мира

Это примерно $110 миллиардов долларов. В 2023, на секундочку, показатель был на 62% меньше.

Например в России, Сбер второй год проводит трек акселератора Sber500. В новом интервью Александр Ведяхин подчеркивает, что сейчас там основной упор как раз на ИИ и реальном внедрении в бизнес.

Есть даже доступ к зарубежным менторам, инвесторам и заказчикам + к технологиям Сбера. Выпускники пяти сезонов программы — а это 125 команд — в совокупности привлекли более 3,7 млрд рублей инвестиций и заключили порядка 9500 коммерческих контрактов.

Для маленьких команд с MVP такое может стать окном в глобал

👍85🤯40❤13🤨12😁22🤝11

20.5K views11:53

This media is not supported in your browser

VIEW IN TELEGRAM

Новая SignGemma от Google

Google продолжает идти в интересные специализированные версии Gemma: они анонсировали модель SignGemma специально для высокоточного перевода с языка жестов.

Автоматизировать перевод с жестов – это достаточно сложная задача, потому что люди жестикулируют очень быстро и все по-своему + мимика, в том числе мелкая и сложно уловимая, тоже имеет значение.

Какой точности добились в Google – пока не заявляют, но сама их политика тюнинга моделей под подобные задачи не может не радовать. Обещают, что модель появится уже скоро (ну и будет опенсорсной, как и все геммы).

Если у вас есть соответствующий научный интерес или квалификация, можно даже подать заявку на раннее тестирование

👍129🔥64❤‍🔥20❤8👏5

23.4K views16:07

О, на Hugging Face Spaces теперь есть отдельный стор для MCP

Напоминаем, что HF Spaces – это огромный стор ИИ-приложений, в котором можно найти себе тулзу под любую задачу. Мы писали о нем тут.

Так вот теперь там можно легко находить также MCP. Просто нужно выбрать фильтр «MCP Compatible», и вы получите кучу готовых серверов на любой вкус.

Главное – проверяйте на базовые уязвимости, всякое бывает. А Hugging Face как всегда большие молодцы.

huggingface.co/spaces

❤119👍4718🔥55❤‍🔥2⚡2🗿2☃1

22.4K views17:37

This media is not supported in your browser

VIEW IN TELEGRAM

Тренд на игру в Pokémon докатился и до OpenAI

Они поставили играть o3, лайв трансляцию прохождения можно посмотреть на Твиче здесь. Сбоку на панели также доступны некоторые шаги ризонинга, можно почитать, как модель анализирует карту, обдумывает план и тд.

Напоминаем, что ранее в Pokémon ставили играть Sonnet 3.7 и Gemini 2.5 Pro.

Gemini стала первой моделью, прошедшей игру полностью, ей потребовалось несколько сотен часов. Правда, там были некоторые доп.хаки типа специальной предобработки карты и использования отдельных агентов для решения головоломок (наш пост).

Непонятно, есть ли что-то такое в текущем сетапе с o3. Но все равно очень интересно, как моделька справится

👍6325🔥13❤86😁3🤯2🗿1

19.8K views06:34

Вау, Google раскатали приложение для локального запуска моделек на телефоне

Оно абсолютно бесплатное, опенсорсное и поддерживает даже мультимодальные модели. Инструкция, как запустить:

1. Заходим в репозиторий Google AI Edge Gallery, заходим в Releases и скачиваем файл .apk. Это для Android, на айфоны будет позже.

2. Заходим в приложение, скачиваем одну из моделей оттуда или загружаем свою.

3. Все, теперь вы можете пользоваться этой моделью локально, то есть оффлайн и только на ресурсах вашего телефона.

Особенно хорошо это работает с новыми Gemma 3n, адаптированными специально под локальный запуск.

👍159🔥94❤31🤯77⚡2🏆1

25.4K views09:01

Знаете функцию «Войти с помощью Google / Apple / др»? Скоро так можно будет входить с помощью учетки ChatGPT

Это не просто отдаленные планы компании: вчера OpenAI уже запустили форму поиска разработчиков, которые заинтересованы интегрировать вход по ChatGPT на свои платформы.

Документация по тому, как это будет работать, тут.

Кажется, что это минорная фича, но на самом деле это большой шаг в конкуренции с Google, Microsoft и другими. Чем шире такие интеграции – тем больше OpenAI становится похожа на крупную корпорацию и захватывает внимание людей.

❤96🤔41🤯16🔥12🦄4😁1

19.7K viewsedited 12:23

Media is too big

VIEW IN TELEGRAM

Дуров 🤝 Маск

Только что стало известно, что уже этим летом Grok встроят в Telegram. И это будет не просто официальный бот, а большая колаба:

– Можно будет задавать модели вопросы прямо из поиска в тг
– Агент сможет модерировать чаты и помогать писать сообщения,
– … проверять и суммаризировать посты,
– … и даже генерировать картинки

За такую интеграцию Telegram получит 300 миллионов долларов + долю в акционерном капитале xAI + 50% с каждой проданной через тг подписку на Grok.

Жирно, конечно. Неудивительно, что на фоне новости TON уже взлетел на 23 процента 💵

UPD: Маск опроверг информацию.

UPD 2: Дуров уточнил: согласились в принципе, остались формальности.

Please open Telegram to view this post

VIEW IN TELEGRAM

❤186🔥80👍42😁18🤨8🤔6🫡3🗿3🤯2

23.1K viewsedited 13:03

Исследователи Яндекса разработали и выложили в опенсорс YaMBDa — один из самых больших датасетов в области рекомендательных систем.

В нем 4,79 миллиардов обезличенных пользовательских действий на Яндекс Музыке. Для RecSys это редкость, так как качественных открытых датасетов в этой области дефицит. Тем более очень нечасто такие данные публикуют коммерческие платформы.

Структура YaMBDa (YAndex Music Billion-interactions DAtaset): внутри прослушивания, лайки, дизлайки (то есть неявный фидбэк), некоторые характеристики треков и флаг is_organic, который означает, было ли действие пользователя органическим или вызванным рекомендациями.

Файлы предоставляются в формате Apache Parquet с глобальным временным сплитом. Опять же, удобно, потому что в отличие от Leave-One-Out сохраняется глобальная временная последовательность и исключаются лики.

Допом к датасету идет набор бэйзлайнов (MostPop, DecayPop, ItemKNN, iALS, BPR, SANSA, SASRec). Можно не реализовывать базу, а сразу сравнивать ваши алгоритмы с существующими метриками.

Хабр | Hugging Face

Исследователи Яндекса выложили Yambda — один из крупнейших в мире датасетов для развития рекомендательных систем

Привет! Меня зовут Александр Плошкин, я руковожу группой развития качества персонализации в Яндексе. Сегодня мы открываем доступ к одному из крупнейших рекомендательных датасетов —...

🔥119👍36❤20665🤯421

20.5K viewsedited 13:43

DeepSeek обновили R1

В официальном аккаунте на WeChat разработчики написали, что R1 получила «минорное тестовое обновление», и что попробовать его уже можно на официальном сайте.

Хотя обновление и минорное, пользователи пишут, что теперь рассуждения модели вышли на уровень o3 и стали глубже и дольше (кто-то даже делится неподтвержденными скриншотами 25 минут рассуждений).

Официальных бенчмарков пока нет. Ждем. Если это действительно уровень o3, то какой будет r2?

🔥160👍31👏13❤6😁66🐳3

21.5K viewsedited 15:50

Кто обучает будущих архитекторов AGI

Каждый второй стартап пишет «AI-native» в питч-деке, но остаётся вопрос: кто вообще готовит тех, кто сможет строить такие системы?

Это преподаватели и эксперты-практики, которые не только работают в индустрии, но и делятся знаниями со студентами. Они читают курсы, вытаскивают студентов в реальные проекты и актуализируют программы в университетах.

Yandex ML Prize 2025 как раз про таких — про тех, кто стоит у истоков индустрии, хотя их обычно не видно в релизах и исследованиях. В этом году премия от Яндекса вручает гранты и поддерживает преподавателей, которые формируют будущую экосистему ML в России.

Прием заявок на премию открыт до 22 июня. Категории: от преподавателей со стажем до руководителей целых ML-программ.

👍37🤨24❤17🔥10☃2🗿22

22.2K views16:23

СЕО Anthropic Дарио Амодеи дал интервью изданию Axios и заявил, что ИИ в ближайшие 5 лет поднимет уровень безработицы на 10-20%

По его мнению, ИИ-компаниям и государству надо перестать подслащивать пилюлю и наконец трезво открыть людям глаза на то, что будет происходить в сфере технологий, финансов, консалтинга и тд.

«Половину рабочих мест белых воротничков ИИ заменит в ближайшие 5 лет, и мы к этому не готовы»

Иронично, что заявляет он это сразу после громкого выпуска Claude 4

😁16346🤯24🔥12🗿9👍66❤2💯2

21.4K views17:52

Веса новой R1 официально выложили на HF

По первым бенчмаркам точность теперь действительно примерно на уровне o3 (на картинке – LiveCodeBench). На Aider R1 теперь на уровне Claude 4 Opus.

Сами разработчики пишут, что у версии большой буст в ризонинге, фронтэнде и использовании инструментов.

Снова открытая ризонинг SOTA, получается

huggingface.co/deepseek-ai/DeepSeek-R1-0528

🎉162👍48🔥27❤10👏3🤔3

21.4K views07:20

⚡️

Вышел Apache Spark 4.0. Что интересного в релизе:

1️⃣ Новая архитектура клиент-сервер Spark Connect. Теперь клиентское приложение отделено от кластера Spark. Это значит, что подключаться к Spark можно будет из любой среды и ЯП, включая Python, Scala, Go, Swift и Rust. Кстати, клиент для Python весит всего 1,5 МБ и устанавливается просто через pip install pyspark-connect.

2️⃣ Режим ANSI SQL по умолчанию. Раньше Spark прощал многие ошибки – например, если ты делил на ноль или числа не влезали в столбец, он просто возвращал NULL или тихо обрезал значение. Это было удобно, но могло скрывать баги. Теперь включён режим ANSI SQL по умолчанию – как в классических базах данных. Если в запросе ошибка, Spark сразу об этом скажет и выбросит ошибку. Получается более надежно и предсказуемо.

3️⃣

Materialized Views. Это сохранённый результат SQL-запроса, который может автоматически использоваться при выполнении будущих запросов, если Spark понимает, что часть запроса уже была вычислена и закеширована. То есть теперь повторяющиеся запросы не надо каждый раз пересчитывать, можно просто достать из кэша. Супер существенно для времени и нагрузки на кластер.

4️⃣

Python Data Source API. Это прямо очень приятно: теперь не надо учить Scala, чтобы подключиться к кастомному источнику данных, все можно сделать просто на питоне. Это сильно упрощает интеграцию Spark с веб-сервисами, файлами, базами данных и вообще чем угодно.

5️⃣

Новый тип данных VARIANT. Это специально для полуструктурированных данных. То есть теперь, если у вас где-то лежат вложенные поля или JSON, запросы к ним можно выполнять прямо из коробки, предварительно не описывая схему.

Официальный релиз

Please open Telegram to view this post

VIEW IN TELEGRAM

❤65👍33🔥16❤‍🔥1😁1

21.4K viewsedited 09:04

This media is not supported in your browser

VIEW IN TELEGRAM

Смотрите, какого симпатичного робота-игрока в бадминтон обучили в Robotic Systems Lab в Цюрихе

Робота обучали полностью в симуляции с высокой частотой и крупным пулом параллельных сред (4096 экземпляров), чтобы охватить разнообразие ударов и позиций.

Самое сложное здесь – это точно предсказывать точку перехвата (удара), так что ученые заранее генерировали случайные траектории волана, задавая начальные координаты и скорости по равномерному распределению, а затем отслеживали его положение через HSV-фильтрацию камеры.

Но самое интересное, что здесь основная моделька – это обычная полносвязная (feed-forward) MLP. Ее обучали политике по схеме PPO с AdamW. На выходе она выдаёт параметры (μ и σ) гауссовского распределения действий. Из этого распределения затем и сэмплируются управляющие команды: целевые крутящие моменты или позиции суставов.

Такого бы летом возить с собой на пикники

www.science.org/doi/10.1126/scirobotics.adu3922

❤95👍26🔥1110❤‍🔥31

20K viewsedited 11:20