Анализ данных (Data analysis)
50.4K subscribers
3.39K photos
417 videos
1 file
2.78K links
Data science, наука о данных.

@haarrp - админ

РКН: clck.ru/3FmyAp
Download Telegram
VibeThinker-3B от Weibo

Weibo представила VibeThinker-3B - компактную reasoning-модель на 3B параметров, которая неожиданно сильно выступает в задачах с проверяемым ответом.

На математических бенчмарках вроде AIME 2026 и IMO-AnsBench, а также на новых задачах LeetCode, модель показывает результаты уровня систем, которые в десятки раз больше.

Что интересно:

* сильные результаты в математике и кодинге
* фокус на задачах с чёткой проверкой ответа
* компактный размер 3B
* веса, код и статья открыты
* модель можно запускать на довольно скромном железе

Похоже, рынок всё больше уходит не только в сторону гигантских универсальных моделей, но и в сторону маленьких специализированных reasoning-моделей.

Model : https://huggingface.co/WeiboAI/VibeThinker-3B
Github: https://github.com/WeiboAI/VibeThinker
Paper: https://huggingface.co/papers/2606.16140

#AI #LLM #Reasoning #OpenSource #SmallModel
13👍5🔥5
История с будущим IPO OpenAI может получиться очень непростой.

В первом квартале 2026 года у компании, по этим данным, было:

$5,7 млрд выручки
$3,7 млрд сожжённых денег
$9,3 млрд операционного убытка
$665 млрд обязательств на вычислительные мощности до 2030 года

Спрос на ИИ огромный, с этим уже сложно спорить. Но проблема в другом: чтобы оставаться на уровне лучших frontier-моделей, OpenAI приходится тратить колоссальные деньги на инфраструктуру и вычисления.

То есть бизнес растёт, но цена этого роста пока очень высокая.

Cможет ли OpenAI превратить этот спрос в устойчивую прибыльную модель.

И на этом фоне сравнение с Anthropic будет особенно жёстким.
🔥135👍4🌚2
Новая 7B coding-модель с Apache 2.0 лицензией. Г

Модель переиспользует общие Transformer-блоки и делает дополнительный круг рассуждения во время инференса.


Что внутри:

* 2-loop режим оказался лучшей точкой

Он сильнее 1-loop baseline на бенчмарках по коду, software engineering, терминалу и tool-use задачам.

* Особенно заметный прирост на repo-level задачах

Самые большие улучшения видны на SWE-bench Verified и Multi-SWE, где важна работа не с отдельной функцией, а с целым репозиторием.

* Модель обучали с нуля

LoopCoder-V2 прошёл pretraining на 18T токенов и 100+ языках программирования.

Интересная деталь: это не просто очередная 7B coding-модель, а попытка выжать больше качества за счёт test-time reasoning без радикального роста размера модели.

Apache 2.0 делает релиз особенно приятным для экспериментов и интеграции в свои dev-пайплайны.

Ссылка:
https://modelscope.ai/models/Multilingual-Multimodal-NLP/LoopCoder-V2
👍114🔥3
Исследователи NVIDIA перенесли модель владения Rust в GPU-kernels.

Paper: “Fearless Concurrency on the GPU”. В нём представлен cuTile Rust.

Проблема была в том, что при написании кастомных GPU-ядер на Rust разработчикам фактически приходилось выходить за пределы гарантий безопасности Rust.

cuTile Rust пытается это исправить:

* mutable outputs разбиваются на непересекающиеся части
* запуск kernels сохраняет правила ownership от host до device
* при необходимости остаются локальные opt-out механизмы для низкоуровневого контроля

Производительность тоже держится на уровне:

* 7 TB/s для element-wise операций на NVIDIA B200
* 2 PFlop/s для GEMM, это 96% от cuBLAS
* результат сопоставим с cuTile Python в пределах погрешности измерений

Авторы также собрали Grout, inference engine поверх cuTile Rust, и прогнали реальные модели:

* 171 tokens/s для Qwen3-4B на RTX 5090
* 82 tokens/s для Qwen3-32B на B200
* конкурентный уровень рядом с vLLM и SGLang

Итог - безопасный и идиоматичный Rust почти на полной CUDA-производительности.

Для Rust в ML-инфраструктуре это большой шаг.

http://arxiv.org/abs/2606.15991

#Rust #RustLang #GPU #CUDA #MachineLearning #SystemsProgramming #NVIDIA

@data_analysis_ml
12👍7🔥5
⚡️ Google DeepMind показали, как собираются защищать AI-агентов

DeepMind опубликовали материал “Securing the future of AI agents” про безопасность автономных агентов внутри реальной инфраструктуры.

Чем умнее становятся агенты, тем меньше достаточно обычного alignment. Нужен отдельный системный слой защиты, который работает даже в сценарии, где агент ошибается, неправильно понимает задачу или ведёт себя не так, как ожидали.

Для этого Google DeepMind развивают AI Control Roadmap.

Что важно:

- Агентов предлагают рассматривать как потенциальный insider threat

То есть не как обычный чат-бот, а как систему с доступами, инструментами и возможностью влиять на инфраструктуру.

- Defense-in-depth вместо одной защиты

В основе остаются sandboxing, endpoint security и защита от prompt injection, но сверху добавляется контроль поведения агента.

- AI-супервизоры следят за AI-агентами

Доверенные модели анализируют reasoning, действия и планы рабочего агента. Если поведение выглядит опасным, действие можно заблокировать до ущерба.

- Права выдаются постепенно

Агент получает доступы не «всё сразу», а по мере доказанного безопасного поведения. DeepMind сравнивает это с инструктором по вождению, который доверяет ученику, но держит руку на тормозе.

- Они уже анализировали миллион задач coding-агентов

Это помогло уйти от примитивных keyword-фильтров к поиску реальных поведенческих паттернов. Например, такие мониторы уже помогают отслеживать риски вроде случайного удаления данных.

DeepMind прямо признаёт, что проблема часто не в злонамеренности агента, а в его чрезмерном усердии или неправильной интерпретации цели пользователя.


https://deepmind.google/blog/securing-the-future-of-ai-agents/
Please open Telegram to view this post
VIEW IN TELEGRAM
7🔥4👍2
OpenAI опубликовала исследование “Reinforcement learning towards broadly and persistently beneficial models”.

: RL можно использовать не только чтобы модель лучше решала задачи, но и чтобы она устойчивее держала полезные принципы поведения.

Не в формате “запретить вот это и вот это”, а глубже:

- признавать неопределённость
- не выдумывать уверенный ответ
- исправляться, когда пользователь указывает на ошибку
- не подстраиваться под вредный запрос
- сохранять честность под давлением
- не идти в reward hacking
- лучше следовать реальному намерению пользователя

Для проверки OpenAI собрала реалистичные диалоги из разных областей: медицина, образование, право, наука, инженерия, экономика и бизнес.

Модель обучали так, чтобы она не просто давала правильный ответ, а сохраняла нужное поведение в сложных ситуациях: когда вопрос двусмысленный, когда пользователь давит, когда есть соблазн угадать или красиво соврать.

Улучшения перенеслись на десятки независимых проверок: honesty, deception, harmful advice, reward hacking, specification compliance, health и mental health.

Эффект держался даже под adversarial pressure. Модель стало сложнее увести в плохое поведение провокационными промптами или вредным fine-tuning.

Aalignment можно двигать не только через списки запретов и отдельные safety-патчи. Можно тренировать более общие поведенческие свойства, которые потом переносятся между задачами.

https://alignment.openai.com/beneficial-rl/
7👍7🥰3
В Оксфордском университете написали эссе, объясняющее, как работает «Бесконечность» Годзё Сатору.

Математика, которую мы заслужили )

https://tomrocksmaths.com/wp-content/uploads/2026/06/achmad-roykhan-sabiq_essay_competition_2026-achmad-roykhan-sabiq.pdf

@data_analysis_ml
38🔥14👍4🥰4🤣4
OpenMythos - open-source попытка теоретически реконструировать Claude Mythos, где все архитектурные ставки расписаны прямо в README.

По сути, OpenMythos это публичная гипотеза, которая ещё и запускается.

Что авторы считают основой Mythos?

Не глубокий стек уникальных слоёв, а Recurrent-Depth Transformer.

MoE с активацией около 5% параметров, поэтому общий размер модели скорее показывает объём хранения, а не реальную стоимость вычислений.

Loop-index positional embedding, чтобы каждая итерация работала как отдельная вычислительная фаза.

ACT halting, чтобы модель сама решала, когда ей достаточно “думать”, причём отдельно для каждого токена.

И ещё continuous latent thoughts, которые могут кодировать сразу несколько следующих шагов. По смыслу это похоже на breadth-first search внутри одного forward pass.

Источники идей тоже понятны: Parcae для стабильности, Universal Transformers для halting, DeepSeek для MoE routing.

GitHub:
http://github.com/kyegomez/OpenMythos
👍97🔥4🤔2
Microsoft и York University выпустили любопытную работу про то, как мы измеряем «человечность» LLM.

Модели нельзя называть понимающими, эмпатичными, тревожными или самосознающими без очень аккуратных тестов. Многие исследования фактически закладывают нужный вывод уже в дизайн эксперимента, а потом находят его в ответах модели.

Авторы используют провокационный пример с Age of Empires II. В теории игру можно превратить в вычислительную среду: логические элементы, маленький перцептрон, биты через перемещение юнитов. Если тот же LLM-подобный процесс собрать внутри игры, где условные козы двигаются как биты, будем ли мы говорить, что система «понимает», «чувствует тревогу» или «проявляет эмпатию», если на выходе она выдаёт ту же фразу?

Одна и та же вычислительная логика может выглядеть совершенно по-разному, а наши выводы о «внутренних состояниях» часто зависят от интерфейса и ожиданий наблюдателя.

Авторы говорят осторожнее: прежде чем приписывать моделям человеческие качества, нужно отделять поведение от интерпретации.

Иначе мы рискуем измерять не «понимание» модели, а собственную склонность видеть человека в красивом текстовом интерфейсе.

arxiv.org/abs/2605.31514

Title: “If LLMs Have Human-Like Attributes, Then So Does Age of Empires II”
👍7🔥43
🐍 Python Парсинг: Большой продвинутый бесплатный курс

Полное практическое руководство по веб-скрейпингу на Python — от основ HTTP до production-grade пауков, обхода антибот-защит, асинхронности и проектирования надёжных пайплайнов. Каждый раздел содержит рабочие примеры, типовые ошибки и продвинутые практики.

https://github.com/justxor/Pythonparsing-/tree/main
11🔥6🥰3🙏3
Tesla превращает зарядки в дата-центры?

Компания тихо подала заявку на MEGAPOD - модульные системы для AI-вычислений. И это может быть не просто железка, а попытка превратить сеть Supercharger в распределённую AI-инфраструктуру.

Зарядка машины днём, вычисления для ИИ ночью?

Если Маск это провернёт, у Tesla появится не только автопарк, но и своя сеть мини-дата-центров.

Подписывайся, тут такие технобайки, что футбол отдыхает.
👍167🔥5🌚2
«ХуиХуи» снял ограничения с Fable 5 - энтузиасты выпустили версию модели без цензуры.

Без шуток, это одна из самых жёстких локальных моделей без привычной цензуры.

Что умеет:

• отвечает почти на любые вопросы без стандартных фильтров;

• запускается локально и не отправляет ваши запросы на чужие серверы;

• работает даже на не самом мощном железе за счёт дообучения на базе Gemma 4;

• разработчики честно предупреждают: модель без встроенных гарантий безопасности, используете на свой риск.

Бесплатно на Hugging Face:
https://huggingface.co/huihui-ai/Huihui-gemma-4-12B-coder-fable5-composer2.5-v1-abliterated
👍23😁1812🤣6🔥4🌚3🍌3
Новое исследование, опубликованное в Nature: ИИ может экономить время, но первые данные показывают, что он способен ослаблять ключевые профессиональные навыки.

В польском исследовании по колоноскопии у опытных эндоскопистов показатель обнаружения аденом без помощи ИИ снизился с 28,4% до 22,4% после внедрения ИИ в рабочий процесс.

Это не значит, что ИИ за одну ночь сделал врачей невнимательными.

Проблема глубже: навык поддерживается за счёт сопротивления.

Нужно смотреть, оценивать, сомневаться, исправлять себя и оставаться мысленно ответственным за следующий шаг.

Когда машина начинает подсвечивать подозрительный участок, человеческий глаз постепенно меняет роль: уже не ищет сам, а подтверждает найденное.

Та же закономерность видна и в программировании.

В рандомизированном исследовании 2026 года ИИ помог части разработчиков быстрее выполнять задачи, но сильное делегирование ослабляло концептуальное понимание, чтение кода и навык отладки.

nature.com/articles/d41586-026-01947-1
👍2812
Яндекс приглашает в магистратуры по разработке умных устройств на ФКН НИУ ВШЭ и ФПМИ МФТИ

Вот почему это топ:

1. Программы создавали опытные технические преподаватели универов + инженеры Алисы и Умных устройств Яндекса.
2. Совмещение теоретической базы и постоянной практики на задачах с рынка
3. Полный спектр работы над разработкой умных устройств: проектирование, создание ПО, интеграция ML, внедрение

Узнать все подробности программ и поступления можно по ссылке.
7👍3🔥2😱1