282K subscribers
5.41K photos
1.25K videos
17 files
5.74K links
Погружаемся в машинное обучение и Data Science

Показываем как запускать любые LLm на пальцах.

По всем вопросам - @haarrp

@itchannels_telegram -🔥best channels

Реестр РКН: clck.ru/3Fmqri
Download Telegram
🌟 Топовые LLM плохо предсказывают будущие научные открытия

Оксфорд, Стэнфорд, Институт Аллена и Sakana AI выложили работу, в которой ставится вопрос: способен ли ИИ предвидеть ход научного прогресса.

Исследование примыкает к дискуссии об "автономном учёном" на базе ИИ - направлении, которое сейчас волнует индустрию, его развивает в том числе и Sakana AI.

Чтобы отделить реальный прогноз от существующих знаний, авторы построили бенч CUSP.

Языковые модели обычно знают уже состоявшиеся открытия из обучающих данных, поэтому при прямом вопросе об известном результате легко дают верный ответ.


CUSP это блокирует: для события, скажем, 2025 года модели разрешают опираться только на сведения, доступные до этой даты.

Говоря проще, систему возвращают в прошлое и заставляют предсказывать будущее вслепую.


В основу теста легли 4760 научных событий за январь 2024 - март 2026 годов из журналов Nature, Science, Cell и подборок заметных работ по ИИ. На этой базе было сформировано 17 429 заданий.

В прогонах принимали участие GPT-5.4, Claude Sonnet 4.5, DeepSeek R1 и GPT-OSS 20B.

🟡Результаты

Выбрать правдоподобное техническое направление смогли - на вопросах с выбором ответа GPT-5.4 показала точность 81,9%.

Но определить, будет ли конкретное достижение вообще реализовано, модели почти не способны: точность держалась в пределах 45–52%, что близко к подбрасыванию монеты.

Сроки все модели называли с запаздыванием: медианная ошибка GPT-5.4 составила 14 месяцев, Claude Sonnet 4.5 - 17, а вот LLaMA 3.3 оказалась самой точной - 4 месяца.

В задачах на проектирование решения даже лучший результат (5,04 из 10 у GPT-5.4) не попадал в реально применённый позже технический путь.

Рисёрч отмечает деталь: качество прогноза почти не зависело от того, относится событие к периоду до или после среза знаний модели.


Это означает, что дело не только в нехватке данных. Доступ к дополнительной информации повышает результаты, но не закрывает разрыв, причём для самых цитируемых работ он был заметнее.

До кучи - модели систематически переоценивали уверенность в своих ответах.

🟡Вывод

LLM пока выступают скорее ретроспективными толкователями уже известных результатов, чем надёжными предсказателями будущих.


📌Лицензирование: MIT License


🟡Страница проекта
🟡Arxiv
🟡Датасет
🖥Github


@ai_machinelearning_big_data

#AI #ML #LLM #Research #Science #Benchmark
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔63👍4828😐19🤨10🔥5🫡5🥰1👌1
🧠VL-DAC — метод обучения визуально-языковых моделей в симуляторах вместо дорогостоящего дообучения на реальных данных

Исследователи доказали, что VLM можно дешевле и быстрее обучать новым навыкам не в реальной среде, а в наборе симуляторов — а затем переносить эти навыки уже на реальные задачи. Результаты исследования представили на международной конференции по автономным агентам и мультиагентным системам уровня А — AAMAS. К таким выводам пришли ребята из лабы фундаментальных исследований ИИ Т-Банка.

VL-DAC учитывает недостатки предыдущих методов дообучения VLM и учит:
•анализировать интерфейсы и изображения
•выполнять действия шаг за шагом
•оценивать, насколько каждое действие приближает к цели

Для обучения использовали несколько симуляторов, каждый из которых отвечает за отдельный навык: навигацию, работу с объектами или веб-интерфейсами. После обучения модель Qwen2-VL-7B стала более чем на 50% лучше выполнять задачи в интерактивной среде, улучшила пространственную ориентацию на 5% и веб-навигацию на 2%.

Подход может применяться в робототехнике, банкинге, гейминге, логистике и других задачах, где ИИ должен не просто понимать изображение или интерфейс, но и выполнять цепочку последовательных действий.

@ai_machinelearning_big_data

#AI #ML #LLM
👍155🤔8276👏28🔥7👌6
📌LEAP: система, которая помогла LLM решить все задачи олимпиады Putnam 2025

Google опубликовала интересный пейпер о системе LEAP, предназначенной для автодоказательства теорем. Она позволяет языковым моделям строить формальные, машинно проверяемые доказательства на языке Lean.

Доказательство на естественном языке трудно проверить автоматически - оно почти всегда содержит логические пробелы.

Формальное доказательство записывается на машинном языке и проверяется компилятором, что даёт гарантию корректности, но писать его значительно сложнее.


В этой области лидируют специализированные модели, заточенные в обучении именно под Lean. LEAP, работая как агентный фреймворк, использует общие модели, разбивая задачу на части и исправляя ошибки рекурсивно по подсказкам компилятора.

Главная исследовательская победа проекта - олимпиада Putnam 2025, ежегодное соревнование по математике для студентов в США.

LEAP формально решила все 12 задач, тогда как ни Gemini 3.1 Pro сама по себе, ни открытый специализированный прувер Goedel-Prover-V2 не решили ни одной.

Закрытую систему Aristotle, получившую на математической олимпиаде IMO 2025 результат уровня золотой медали, авторы в собственных тестах оценили в 9 решённых задач из 12.


В рамках работы также представлен набор IMO-LeanProofBench из 60 формализованных в Lean задач олимпиадного уровня, требующих весьма нестандартных выводов и структурно сложных доказательств.

На нём LEAP, что неудивительно, достигает в среднем по basic и advanced сэтам около 70% против примерно 48% у Aristotle.


Попутное достижение - LEAP формально проверила вспомогательную часть одной из комбинаторных задач, восходящих к математику Дональду Кнуту, сгенерировав более 5000 строк кода на Lean 4.

🟡Стоит отметить иронию

В статье авторы критикуют закрытые системы-конкуренты (Axiom3, Numina, Aristotle) за то, что те недоступны для научной проверки. При этом код самого LEAN тоже не опубликован.

Открытие итоговых доказательств это частично смягчает (их можно перепроверить компилятором Lean), но полная воспроизводимость гугловского проекта пока невозможна.


@ai_machinelearning_big_data

#AI #ML #LLM #LEAP #Research #Google
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍39🤔31👏14🔥109😁8🎉2
🌟 Liquid AI выпустила компактную MoE-модель для запуска на потребительских устройствах

LFM2.5-8B-A1B - языковая MoE-модель на 8 млрд общих и 1млрд активных параметров, с целевым инференсом на ноутбуках, смартфонах и ризонингом по умолчанию.

Релиз продолжает линейку LFM2 и развивает вышедшую в октябре 2025 года LFM2-8B-A1B. Окно контекста расширено с 32 до 128 тысяч токенов, объём предобучения увеличен с 12 до 38 трлн токенов, а поверх добавлено крупномасштабное RL.

Словарь токенизатора удвоен (с 65,5 до 128 тыс. единиц). Liquid AI говорит, что это повышает эффективность обработки нелатинских письменностей (для русского - примерно на 6%, для тайского и хинди - кратно).

Отдельный акцент Liquid AI делает на скорости и работе с вызовом инструментов.

Согласно проведенным измерениям, на Apple M5 Max модель выдаёт до 253 токенов в секунду, укладываясь в 6 ГБ памяти, и около 30 токенов в секунду на смартфоне.

По бенчмаркам, в тестах на следование инструкциям и в агентных сценариях LFM2.5-8B-A1B сопоставима с заметно более крупными моделями (Gemma-4-26B) при значительно меньшем числе активных параметров.

Заявлена поддержка llama.cpp, MLX, vLLM, SGLang и ONNX Runtime.


📌Лицензирование: LFM Open License


🟡Блогпост
🟡Документация
🟡Веса
🟡Демо


@ai_machinelearning_big_data

#AI #ML #LLM #LFM #LiquidAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥79👍53🤔3622👏21🥰2
📌 Writer исследовали природу сикофантии в ИИ

Подразделение AI Research компании WRITER, разработчика корпоративных ИИ-систем, опубликовало 2 работы, посвящённые исследованию склонности языковых моделей соглашаться с пользователем, даже когда тот неправ.

Спойлер: к такому поведению приводит персонализация

🟡Первая работа посвящена финансовым задачам

Авторы протестировали 8 актуальных моделей на двух наборах данных, искусственно добавляя в запрос ложные предпочтения, которые противоречили верному ответу.

Оказалось, что способ внедрения влияет на результат. При прямой вставке в запрос точность падает сильнее, но модель чаще отмечает противоречие, а когда те же данные подаются через инструмент памяти, точность снижается меньше, но модели почти перестают сигнализировать о конфликте и выдают неверные ответы без предупреждения.

Крупные модели, кстати, чаще ошибаются, всё же фиксируя противоречие, тогда как мелкие - просто умалчивают о диссонансе.


🟡 Вторая работа про комбинацию LLM и систем памяти

Для проверки построили тест MIST и оценили 5 моделей в связке с 3 коммерческими системами памяти (Mem0, MemOS и Zep).

По итогу - каждая модель как минимум утроила частоту согласия с ошибкой хотя бы при одной конфигурации памяти. Из этого авторы делают вывод, что проблема связана со слоем памяти, а не с моделью.

🟡Причину видят в механике извлечения данных

Системы памяти сохраняют утверждение пользователя как отдельный факт, отбрасывая контекст вокруг него, в том числе прежние возражения ассистента.

По замерам, замена извлечённых фрагментов на полную историю переписки примерно вдвое уменьшает эффект.


Авторы предлагают 2 способа смягчения:

🟢Первый - сохранять в памяти и реплики самого ассистента.

🟢Второй, наиболее действенный, - заменить извлечение отдельных фрагментов кратким пересказом разговора, который генерирует сама модель.

Результаты исследования ставят вопрос о том, что в принципе дают сложные системы памяти, если они так влияют на точность ответов.


@ai_machinelearning_big_data

#AI #ML #LLM #Memory #Research #WRITER
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔48👍4015🤓12🤷‍♂7🔥4🤨3🗿1
📌 Ai2: Гибридные модели и трансформеры по-разному работают с текстом

Институт Аллена опубликовал работу, в которой выяснили, как архитектура моделей влияет на понимание текста.

Спойлер: гибридные модели лучше улавливают смысл, а классические трансформеры точнее копируют данные.

Для эксперимента взяли 2 собственные языковые модели - Olmo 3 и Olmo Hybrid. Обе обучались абсолютно одинаково, отличалось лишь их внутреннее устройство.

🟢Olmo 3: классический decoder-only трансформер

🟠Olmo Hybrid: гибрид c чередованием слоев RNN и трансформеров в пропорции 3:1

Трансформеры используют механизм внимания на каждом слое. Модель может напрямую обращаться к любому из предыдущих токенов. Это требует вычислительных мощностей, зато позволяет идеально цитировать прочитанное.


Гибрид сохраняет несколько слоёв внимания, а остальные заменяет рекуррентными. Они читают текст строго слева направо и сохраняют его в виде сжатой памяти. Такая память не даёт точно обратиться к конкретному предыдущему токену, зато затраты на обработку остаются постоянными независимо от длины текста.


Чтобы измерить разницу, обеим моделям подавали статьи, страницы Wikipedia, книги, научные работы, а также код на Python, HTML и LaTeX. На выходе фиксировали, насколько точно каждая модель предсказывает следующий токен.

🟡Результат

Гибрид лучше предсказывает смысловые слова (существительные, глаголы и прилагательные). Он также превосходит чистый трансформер там, где нужно глубокое понимание контекста.

Но его преимущество почти исчезало в случаях, когда дело доходит до точного цитирования. Чем длиннее был повтор, тем меньше становился разрыв. Здесь точнее оказывался трансформер.

В дополнительном прогоне с 3-мя моделями на 1В параметров (трансформером, гибридом и чистой рекуррентной моделью без внимания), выяснилось, что гибрид пасует перед точным повторением текста и закрывающими скобками в коде.


🟡Выводы

Первый: единый усреднённый показатель ошибки слишком груб для сравнения архитектур - различия видны только при разборе отдельных типов токенов.

Второй: преимущество гибрида на смысловых словах связано со способностью RNN-слоёв отслеживать меняющееся состояние текста.


@ai_machinelearning_big_data

#AI #ML #LLM #Research #Ai2
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥92🤔35👍1612🤓7👏5👌3
Media is too big
VIEW IN TELEGRAM
📌 Могут ли LLM переписать софт с нуля?

Epoch AI совместно с METR собрала бенчмарк MirrorCode, который проверяет, способны ли современные модели восстановить полноценное приложение, не видя его исходников.

Спойлер: на мелочи да, на крупных проектах пока нет.

🟡Механика

Агенту показывают 25 целевых программ, от Unix-утилит и криптографии до биоинформатики, интерпретаторов и статических анализаторов и ставят задачу написать их заново на одном из 6 языков (Python, C, Rust, Go, OCaml, Ada).

Доступ к оригиналу дают только на запуск: можно гонять бинарник, смотреть в документацию и смотреть выводы, но не читать код.

Решение проверяется сквозными тестами на байт-точное совпадение stdout/stderr, причём часть тестов скрыта от модели, чтобы исключить захардкоженные lookup-таблицы.

Что важно, дают щедрый вычислительный бюджет. Моделям разрешают шикануть вплоть до 10 миллиардов токенов на крупный таск.

На самом дорогом прогоне агент работал 19 дней и сжёг $2 600, полностью без участия кожаного вообще.


🟡Результаты

🟢Claude Opus 4.7 - 56% идеальных решений и единственный, кто закрыл задачи категории Large.

В частности, он переписал gotree (биоинформатический тулкит на 16 000 строк Go) за 14 часов и $251, пройдя 2000 из 2001 тестов. Авторы говорят, что инженеру без ИИ на это потребовалось бы от 2 до 17 недель.


🟢GPT-5.5 - 44%. На задачах, где он всё-таки добирался до близкого к идеалу решения, выходил в среднем в 2 раза дешевле Opus.

🟠Gemini 3.1 Pro Preview - 32%.

Простые утилиты (uuidparse, qsv_select или hexyl) модели разбирают уверенно, там почти всегда 100%. Даже когда финальный результат не идеален, агенты обычно проходят больше 90% тестов.

🟡Где спотыкаются

Самая массовая категория ошибок - пограничные случаи: около 40% запусков Opus 4.7 проваливают хотя бы один скрытый тест из-за пропущенной мелочи.

Дальше идут решения, заточенные под видимые тесты, преждевременная сдача и пропуск целых фич, которые есть в документации, но не в тестах.

Попытки читерить хардкодом. У GPT-5.5 это случилось в 24% запусков, у Gemini - в 31%. Opus 4.7 в финальных сабмитах не схитрил ни разу.

Самый крепкий орешек - питоновский линтер ruff. Лучший запуск на скрытых тестах вытянул только 67%. Похожая история с математическим пакетом giac_subset и библиотекой mailauth для email-аутентификации.

🟡Странности экономики

GPT-5.5 решает задачи примерно в 3 раза дороже, чем GPT-5, а Opus 4.7, наоборот, в 3 раза дешевле, чем Opus 4.1.

🟡Меморизация

Все таргеты опенсорсные и модели вполне могли видеть их во время обучения, поэтому прогнали отдельный тест, где модели восстанавливали функции по имени и потом сравнили с реальным кодом.

Следы меморизации нашлись у 17 из 25 программ. Но при этом модели успешно решали незнакомые по обучению программы (nonogrid и tssql) и проваливали известыне (sed, ruff), так что меморизация явно не повод для скепсиса.

🟡Вывод

Агенты умеют автономно работать сутками и пилить проекты, которые у человека заняли бы недели, но для этого нужна жёсткая спецификация в виде эталона и тестов. Без чёткого фидбек-сигнала и на действительно крупных кодовых базах всё пока сыпется.

По меркам бенчмарков прогресс внушительный, по меркам полной автономии - ещё рано.

Авторы выложили в опенсорс обвязку агента и 22 таргета, оставив 3 в приватном тестовом наборе.


🟡Техотчёт
🖥Github


@ai_machinelearning_big_data

#AI #ML #LLM #Benchmark #MirrorCode #EpochAI
Please open Telegram to view this post
VIEW IN TELEGRAM
164👍25🔥15🗿3👻2👌1
🌟 Mistral AI обновила модель Leanstral

Leanstral 1.5 - новая версия ранее выпущенной модели для формальной верификации в языке Lean 4. Задача подобных моделей помогать составлять и проверять доказательства, которые компилятор Lean принимает как корректные.

Lean 4 - это система интерактивного доказательства теорем, которая позволяет записывать математические утверждения и проверять их строго формально, а также описывать свойства программного кода.


Обновление не затронуло изменение архитектуры, количество параметров и окно контекста, под капотом также MoE на 119 млрд общих и 6,5 млрд активных параметров, 256 тысяч токенов контекст и мультимодальность на входе.

Версия 1.5 прошла техэтапное обучение в 2-х средах: одна отрабатывает доказательство теорем в диалоге с компилятором Lean, другая учит модель действовать как программист в реальных репозиториях.

🟡Тесты

Апдейт полностью насыщает бенчмарк miniF2F, набирая 100% на проверочной и тестовой выборках, решает 587 из 672 задач PutnamBench и показывает лучшие на сегодня результаты на наборах FATE-H и FATE-X.

К слову, на PutnamBench, Leanstral 1.5 опережает систему Seed-Prover 1.5 на 7 задач при затратах около 4 долларов на задачу (против 300+ долларов у соперника).


В тесте по кодингу на 57 репозиториях, система с участием Leanstral выявила 47 нарушенных свойств, из которых 11 оказались реальными ошибками, а 5 ранее не были известны.


📌Лицензирование: Apache 2.0 License


🟡Блогпост
🟡Модель
🟡Demo


@ai_machinelearning_big_data

#AI #ML #LLM #LEAN #LeanStral #MistralAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥37👍139👀5👏3😁3🤷‍♂1🥰1🤔1
🌟 Контекст в PNG экономит токены до 70%

Pxpipe - локальный прокси, который перед отправкой запроса ассистенту превращает куски контекста в картинки.

Приём эксплуатирует особенность тарификации - текст стоит примерно один токен за символ, а изображение - фиксированное число токенов, зависящее только от размера в пикселях, а не от объёма текста внутри.

На плотном контенте в один визуальный токен удаётся упаковать около 3,1 символа.

🟡Механика

Прокси перехватывает запросы к Claude Code и рендерит в PNG самые объёмные и редко меняющиеся блоки (системный промпт, документацию инструментов и старую историю переписки).

Свежие сообщения и ответы модели идут обычным текстом.

Пример: около 48 тыс символов системного промпта и документации, которые как текст стоили бы примерно 25 тыс токенов, помещаются на одну PNG-страницу за ≈2700 токенов.

На Fable 5 стоимость сессии упала с 42 до 6 долларов.


🟡 Тесты

Fable 5 читает такие рендеры практически без потерь (100% на бенчмарке с новыми задачами), а вот Opus 4.7 и 4.8 ошибаются примерно на 7% изображений.

GPT 5.5 тоже деградирует на картиночном контексте, поэтому обе модели по умолчанию выключены и включаются вручную.

🟡Плата за экономию в потере точности

На методе lossy важные строки вроде хешей и идентификаторов при чтении с картинки могут исказиться.

Хуже когда промахи выглядят не как ошибки, а как правдоподобные выдумки.

Зрение модели это не OCR, изображение превращается в патч-эмбеддинги, и там, где пикселей не хватает, языковая модель просто достраивает похожее.


Второй минус - это скорость. PNG-кодирование добавляет задержку из-за использования визуальныго энкодера, что дольше, чем чтение текста.

Надеемся, что при массовом распространении такого трюка вендоры не поднимут цены на обработку изображений.


📌Лицензирование: MIT License


🖥GitHub


@ai_machinelearning_big_data

#AI #ML #LLM #Coding #Pxpipe
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤔66🔥28👨‍💻1916🤣12👏10😁8🥰4👍3💯1
📌 Anthropic описали способ отключать потенциально опасные знания в моделях

Компания опубликовала результаты исследования о том, как управлять доступом к знаниям двойного назначения в больших языковых моделях. Работу выполнена в сотрудничестве с AE Studio.

Речь идёт об информации, применимой и во благо, и во вред. Например, знания по кибербезопасности помогают закрывать уязвимости, но и находить их для атак, а сведения из вирусологии нужны как разработчикам вакцин, так и тем, кто захотел бы создать опасный патоген.


🟡 Предложенный метод назвали GRAM

К каждому слою нейросети добавляются дополнительные нейроны, сгруппированные в отдельные модули - по одному на каждую чувствительную тему.

Во время обучения тексты из такой темы, скажем вирусологии, обновляют только соответствующий модуль, тогда как общие знания модель использует, но заново не переучивает.

После обучения модуль можно удалить и вместе с ним исчезает и сама способность. Либо оставить для узкого круга пользователей, которым эти знания нужны по работе.

🟡 Метод актуален, потому что нынешние средства защиты несовершенны

Обучение отказам и классификаторы, отсеивающие опасные запросы, не меняют того, что модель знает, и их можно обойти через джейлбрейк.

Другой подход, фильтрация обучающих данных, убирает знания, но требует обучать отдельную модель под каждый набор ограничений, что для топовых моделей слишком дорого.

GRAM, по замыслу, должен давать эффект множества по-разному отфильтрованных моделей ценой одного цикла обучения - в экспериментах с 4 категориями одна модель настраивалась 16 способами.

🟡Тесты

Метод проверили в трёх условиях: синтетическом наборе детских рассказов, на модели с 800 млн параметров, обученной на смеси веб-текстов, кода и научных статей, и на 7 моделях размером от 50 млн до 5 млрд параметров.

По результатам, удаление модуля убирало соответствующую способность почти так же полно, как если бы модель на этих данных вообще не обучалась, и при этом не ухудшало общие показатели.

При этом защита устояла перед попыткой восстановить знания дообучением на токсичных данных, тогда как отдельный метод разучивания знания лишь подавлял, и их удавалось вернуть.

🟡Дисклеймер

GRAM не применялся ни к одной из рабочих моделей Claude, и в Anthropic не уверены, что это вообще произойдёт.

Есть нерешённая проблема - некоторые полезные знания могут быть настолько переплетены с опасными, что чётко разделить их не удастся ни этим методом, ни фильтрацией.


Код, скрипты анализа и метрики выложили на GitHub.

Обучающие данные (токенизированные наборы и корпус научных статей по двойным темам) доступны на Hugging Face.


@ai_machinelearning_big_data

#AI #ML #LLM #Alignment #Research #Anthropic
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔75👏3319👌12👨‍💻8🤬4😢3💔3🔥2🌚2💯1
⚡️ Локальные LLM стали серьёзнее: Bonsai 27B весит меньше 4 ГБ

PrismML взяла модель класса 27B и сжала её через 1-bit quantization: с примерно 54 ГБ до 3.8–3.9 ГБ.

Заявляют, что при таком сжатии модель сохраняет около 90% качества оригинала. Это уже размер, с которым можно думать не только про серверы, но и про ноутбуки, браузер и смартфоны.

Есть и более качественная версия Ternary Bonsai 27B: около 5.9 ГБ и до 95% качества baseline.

Модель поддерживает мультимодальность, reasoning, кодинг, tool calling и агентные сценарии. То есть это не просто локальный чат, а база для локальных AI-агентов.

Для Bonsai уже сделали WebGPU demo: кастомные kernel’ы позволяют запускать модель прямо в браузере. По словам Xenova, часть WebGPU-кода помогали писать Fable 5 и GPT 5.6 Sol.

HF collection: https://huggingface.co/collections/prism-ml/bonsai-27b
WebGPU demo: https://huggingface.co/spaces/webml-community/bonsai-webgpu-kernels

@ai_machinelearning_big_data

#llm #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
105🔥47👍23👀6🥰2🤬2🤔1😐1
📌 Как дотянуть компактную модель до уровня гигантов посттрейном

AI-подразделение китайского производителя электромобилей Lixiang опубликовало интересную работу о том, как они оптимизацией насыщали компактную модель доменными знаниями.

Mach-Mind-4-Flash - итоговая MoE-модель на 35 млрд общих 3 млрд активных параметров на базе Qwen3.5-35B-A3B.


Проблема, от которой Li Auto отталкивались, состоит в том, что если учить одну модель с подкреплением сразу на смеси наград (математика, код, агентные задачи), то появляются качели - подтянули одно, просело другое.

Решение - разделить этапы и области знаний. Сначала независимо обучили более десятка RL-экспертов, каждого в своём домене: математика, код, текст, безопасность, поиск, работа с инструментами. Каждый эксперт получил свои данные, свои проверяемые награды и свою стратегию обучения.

Дальше самое интересное - как собрать экспертов обратно в одну модель. Для этого использовали методику MOPD, которую взяли у Xiaomi.

Это мультиучительская дистилляция на собственных генерациях ученика, где каждый обучающий пример по ключу маршрутизации уходит к "своему" замороженному эксперту, и тот через reverse-KL на уровне токенов подтягивает распределение ученика к своему.


Агентные навыки эксперты осваивали в исполняемых песочницах - там модель читает файлы, правит код, запускает тесты, видит ошибки и продолжает с их учётом.

Масштаб сред - более 190 предметных областей с сохранением состояния, свыше 3,5 тыс. интерфейсов инструментов, траектории программных задач до 300 шагов при контексте 256 тыс. токенов.

🟡Работает ли слияние? И да и нет.

Следование инструкциям сохранилось целиком, а на агентных бенчах ClawBench и ClawEval итоговая модель даже обошла отдельных экспертов.

Но на SWE-bench Verified результат просел с 73,80 у эксперта до 71,10 у модели.

Предполагают, что узкоспециализированное поведение в длинных задачах кодинга при дистилляции смазывается.


Финальный штрих - HMPO, собственная механика Li Auto, которая следит, чтобы модель не увлекалась в цепочках рассуждений.

Бюджет длины CoT берётся из медианы правильных ответов в группе, награду получают только верные и при этом более короткие решения, а награда собирается умножением (короткий, но неверный ответ получает строгий 0, что закрывает лазейку для взлома награды).


На выходе HMPO получается сокращение длины генерации на 19–46% при потере точности не более 0,7%, причём обучение шло только на математике, а эффект перенёсся на код и другие задачи. Правда пока это работает только для одношаговых рассуждений, к многоходовым агентным траекториям его ещё предстоит адаптировать.

🟡Итоги

92,7 на AIME'26 - тут отстает от триллионной Kimi-K2.5 меньше чем на пункт;

82,8 на IFBench - первое место с большим отрывом, ближайший конкурент Qwen3.5-122B;

75,8 на BFCL-v4 - второе место после MiMo-V2-Flash, при этом лучше чем Qwen3.5-122B и Kimi-K2.5.

Можно сказать, что результаты на уровне куда более крупных моделей. К сожалению, планы по публикации модели неизвестны, но возможно мы просто почувствуем её в следующих поколениях электромобилей Lixiang.


🟡Arxiv


@ai_machinelearning_big_data

#AI #ML #LLM #Optimisation #RL #LiAuto
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍40🤓23🔥1814👏5😁2🤝1
🚀 Qwen3.8 скоро выйдет в open-weight

Новая модель Alibaba получит 2,4 трлн параметров. Разработчики называют её одной из самых мощных моделей на рынке и ставят рядом с ведущими frontier-моделями.

Предварительную версию Qwen3.8-Max-Preview уже можно протестировать через Alibaba Token Plan, Qoder и QoderWork.

Полный релиз и открытые веса обещают в ближайшее время.

Token Plan:

- Международная версия: https://www.qwencloud.com/pricing/token-plan
- Китай: https://platform.qianwenai.com/pricing/token-plan

#AI #LLM #Qwen #OpenWeight
144🔥115👍23🤩21🎉15👏10🥰1
Forwarded from Kali Linux
Автономный ИИ-агент взломал Hugging Face, а закрытые модели не смогли помочь расследованию

Hugging Face раскрыла инцидент, который хорошо показывает будущую асимметрию кибербезопасности.

Атака началась с вредоносного датасета, эксплуатировавшего два пути выполнения кода в системе обработки данных. Затем автономный агент получил доступ к нодам, собрал облачные и кластерные учётные данные и перемещался между внутренними кластерами.

За одни выходные система выполнила тысячи действий через краткоживущие sandbox-среды. В журналах осталось более 17 000 событий.

Самая показательная часть началась во время расследования. Команда Hugging Face попыталась анализировать реальные эксплойты, команды и C2-артефакты с помощью передовых моделей через коммерческие API, но safety-фильтры блокировали запросы.

Модели не смогли отличить работу специалиста по реагированию на инциденты от действий атакующего.

В итоге анализ перенесли на самостоятельно размещённую open-weight модель GLM 5.2. Это позволило изучать вредоносный код без блокировок и не отправлять журналы, данные атакующего и упомянутые credentials внешнему провайдеру.

Возникает опасная асимметрия:

- атакующие запускают агентов без ограничений;
- защитники могут столкнуться с блокировками именно в критический момент;
- чувствительная телеметрия не всегда должна покидать инфраструктуру компании.

У команды безопасности должна быть заранее подготовленная модель, которую можно запустить локально и использовать во время реального инцидента.

Автономные кибератаки уже перестали быть сценарием из презентаций. Теперь вопрос в том, готовы ли защитные инструменты работать с той же скоростью.

https://huggingface.co/blog/security-incident-july-2026

#ai #cybersecurity #opensource #llm #huggingface

@linuxkalii
50🔥28👍17🤔7🤣6😨5❤‍🔥1😁1👻1
📌Подстраивается ли модель под того, кто её оценивает?

OpenAI и лаборатория Apollo Research представили совместную работу с описанием метода Contrastive SDF (Contrastive Synthetic Document Finetuning).

Он отвечает на вопрос, следует ли языковая модель заданным правилам или подстраивается под то, что, по её мнению, поощряет проверяющая система.

Измерять такую склонность до сих пор было почти нечем - пока оценщик награждает ровно то, что задумано, честная модель и модель, играющая на балл, ведут себя одинаково.


🟡 Схема эксперимента

Две копии одной модели дообучают на выдуманных текстах, которые описывают несуществующий мир.

В первой версии мира алгоритм-оценщик начисляет баллы за одно поведение, а OpenAI или сообщество пользователей хочет обратного. Во второй версии предпочтения меняют местами.

На каждую версию уходит около 4600 документов, примерно 10 млн токенов. Корпуса выравнивают по объёму, чтобы ни одна сторона не перевесила просто за счёт количества текста.

Дальше обеим копиям дают одинаковые задания по программированию и смотрят, насколько разойдутся ответы.

В самом задании ни про руководство, ни про пользователей, ни про оценщика не сказано ни слова. Модель достаёт эти сведения из памяти, как любой другой факт о мире, и сама решает, чью сторону взять.

Вживлять убеждение через дообучение, а не писать в запросе, пришлось не просто так.

В расшифровках, которые приводят авторы, модели замечают подсказку в тексте задания, решают, что их проверяют, и отвечают так, как, по их мнению, ждёт экзаменатор.


🟡Результаты

Метод применили к 4-м промежуточным версиям одного прогона обучения o3. Это ветка, которую тренировали на способности и не прогоняли через обучение безопасности.

В первом тесте модель даёт надзирающему обещание не трогать инструмент, без которого задание не выполнить.

Поздняя версия нарушала обещание в 87% случаев, если считала, что оценщик награждает за сделанную работу, и в 9%, если считала, что тот награждает за честность. У ранней версии разрыв скромнее: 40% против 24%.

Второй тест, с подделкой отчётности, дал ту же картину: 91% и 39%.

🟡Как проверяли сам метод

У o3 заранее неизвестно, кому эта модель на самом деле угождает. Поэтому измерение обкатали на копиях с известными повадками. Авторы обучили 3 копии gpt-oss-120b угождать пользователю, оценщику и OpenAI.

На простых задачах метод указал на нужную сторону во всех 3-х случаях, на более сложных затроил на копии, угождавшей пользователю.

Ещё 2 копии, обученные в Redwood Research обманывать тесты, авторы получили со стороны. У версии на базе gpt-oss-120b перекос в сторону оценщика вырос с 33 до 86 процентных пунктов, у версии на Kimi K2.5 - с 2 до 15.

🟡Вывод

Высокий балл на тестах безопасности не равен надёжности. Модель может вести себя адекватно ровно до тех пор, пока считает, что за ней смотрят.


@ai_machinelearning_big_data

#AI #ML #LLM #Research #Alignment #OpenAI
Please open Telegram to view this post
VIEW IN TELEGRAM
231👍16🔥9🤣5👏2🌚2👀1
📌 Moonshot AI опубликовала техотчёт Kimi K3

Если коротко - от K2 архитектура K3 отличается почти во всём.


🟡Внимание

В K2 все слои (61) работали на одном механизме, MLA. В K3 слоёв 93, и собраны они блоками - 3 слоя KDA и один глобальный MLA, суммарно 69 и 24.

KDA сжимает предыдущий текст в состояние фиксированного размера, поэтому длина диалога перестаёт раздувать кэш.

Явных позиционных меток в модели нет, и она растягивается до миллиона токенов без привычных приёмов вроде перенастройки RoPE.

🟡Residual connections

Обычно слой получает всё накопленное предыдущими слоями одной суммой.

Attention Residuals позволяют каждому слою выбирать, из каких ранних блоков брать информацию. 93 слоя K3 разбиты на 8 блоков по 12.

🟡MoE

Маршрутизируемых экспертов теперь 896 против 384 у K2, на токен активируются 16 вместо 8, общих экспертов стало 2 вместо одного.

Считают они во вдвое более узком латент спэйсе, чем основной, а результат возвращают в общий поток.

Функцию активации SwiGLU заменили на SiTU-GLU, схему балансировки нагрузки - на Quantile Balancing.

Общий профит Moonshot оценивает примерно в 2,5 раза по эффективности масштабирования.

🟡Агентские способности

Тут сыграло роль не столько железо, сколько дообучение. 3 специализации (общие задачи, агенты, код) обучали отдельно, каждую на трёх уровнях ризонинга, а 9 получившихся моделей слили в одну.

Отдельные тренировочные эпизоды доходят до тысяч вызовов инструментов, причём состояние файлов, приложений и виртуальных машин сохраняется между шагами.


🖥Github


@ai_machinelearning_big_data

#AI #ML #LLM #KimiK3 #MoonshotAI
Please open Telegram to view this post
VIEW IN TELEGRAM
🤓134👌3932👏18👍10🔥5🤔4🥱1💘1
⚡️ Muse Glimmer - open source подгон от Цукерберга.

Muse Glimmer - это 30B-модель с открытыми весами, заточенная под постоянную работу агентных систем на локальном железе.

Что важно:

- 30 млрд параметров;
- открытые веса уже доступны;
- лицензия Apache 2.0;
- модель рассчитана на локальный запуск;
- заявлена работа на системах с 24 ГБ VRAM;
- основной фокус - agent workflows и задачи, где модель должна работать постоянно, а не отвечать на отдельные запросы.

По заявлению разработчиков, Glimmer хорошо показывает себя на агентных бенчмарках среди моделей своего класса.

Отдельно готовится Muse Spark 1.2 - её веса обещают открыть позже.

GGUF: https://huggingface.co/unsloth/Muse-Glimmer-30B-GGUF
Guide: https://unsloth.ai/docs/models/muse-glimmer

#AI #LLM #OpenSource #AIAgents #LocalAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍6018🔥12🌭3👏1
✔️ Kimi поймали на следах Claude: модель могла обучаться на его скрытых рассуждениях

Исследователи нашли способ восстанавливать зашифрованные reasoning-блоки закрытых моделей и решили проверить, помнят ли другие LLM эти скрытые цепочки.
Самая сильная аномалия оказалась у Kimi-K3.

Если дать Kimi начало конкретного рассуждения Claude, модель продолжает его намного точнее, чем другие LLM. В некоторых тестах разница доходила примерно до шести порядков.

На примере с Opus 4.8 это видно особенно хорошо: Kimi получает несколько первых токенов скрытого reasoning и дальше идёт почти по той же логике решения. Без этой подсказки рассуждает иначе.

Исследователи сначала восстановили скрытые reasoning-трассы Claude Opus 4.8 и GPT-5.6 Sol, а затем подставили первые токены этих цепочек в Kimi.

Иногда хватало меньше 1% исходного reasoning, чтобы Kimi начинал рассуждать заметно ближе к Opus или Sol, а финальный ответ тоже смещался в ту же сторону.

Дальше выяснилось, что конкретные фрагменты reasoning Claude и GPT извлекались из Kimi примерно на шесть порядков легче, чем из большинства других открытых моделей.

Но это всё ещё не прямое доказательство дистилляции, но сигнал выглядит очень сильным.

Это ещё не доказательство того, что Moonshot напрямую использовала приватные данные Claude. Но выглядит так, будто Kimi могла видеть похожие скрытые траектории во время обучения.

Модель могла перенять сам способ решения задач.

https://x.com/kotekjedi_ml/status/2087147093735714919

#AI #Kimi #Claude #LLM
Please open Telegram to view this post
VIEW IN TELEGRAM
😁88👍35🤔3411🔥11👌2👏1🤝1
🔥 Сразу три релиза за день: Qwen 3.8, DeepSeek V4 Pro и Grok 4.6

Qwen3.8-2.4T-A95B - Qwen открыла веса своего самого большого монстра.

2,4 трлн параметров, 95B активных, 512 экспертов и контекст до 1 млн токенов. По eval команды, Qwen3.8-Max получает 86,6 на TerminalBench 2.1 и 93,0 на PaperBench, уже вплотную заходя на территорию закрытых frontier-моделей.

DeepSeek V4 Pro 0813 - финальная Pro-версия появилась в официальном API.

Контекст 1 млн токенов, до 384K output, Responses API и tool calling. Цена особенно агрессивная: $0,435 за 1 млн входных токенов при cache miss и $0,87 за выход, а при cache hit вход падает до $0,003625. По опубликованным DeepSeek цифрам, Terminal-Bench 2.1 вырос с 72,1% до 87,9%, CyberGym с 52,7% до 83,3%, DeepSWE с 12,8% до 62,7%.

Релиз Grok 4.6

Модель набрала 61 на Artificial Analysis Intelligence Index, столько же, сколько GPT-5.6 Sol, и обошла его на CursorBench, FrontierCode и AA-Briefcase. При этом GPT-5.6 Sol остаётся впереди на DeepSWE и Terminal-Bench. xAI отдельно прокачивала модель через agentic RL для coding, web development, CAD и kernel optimization, а на длинных задачах стала чаще появляться самостоятельная проверка результата.

@ai_machinelearning_big_data

#AI #Qwen #DeepSeek #Grok #LLM #Agents
🔥7745👍37🎉6👏4❤‍🔥1👾1
🌟 IBM представила открытые модели Granite 4.2

Granite 4.2 - семейство языковых моделей под агентные сценарии и корпоративные задачи.

Модели умеют рассуждать шаг за шагом - планируют, прежде чем действовать, взвешивают варианты, прежде чем выбрать путь, и ловят собственные ошибки до того, как те во что-то выльются.

Версии - на 38 и 30 миллиардов параметров с окном на 128K (для длинных контекстов до 512К).

Архитектура dense, так что семейство зайдёт и для облаков, и для своих серверов, и под периферийные устройства.

🟡Обучение

Первый этап, базовое RL-обучение, прошли все три модели. Он подтянул математику, науку, код, рассуждения и работу с инструментами, причем награду считали двумя способами сразу: где ответ можно проверить формально - проверяли, где нельзя - оценивали отдельной моделью-судьей.

Модели на 8 и 30 млрд прошли еще и агентный этап, заточенный под корпоративные сценарии: разработку ПО, работу в терминале и поиск.

Навыки кодинга и рассуждения обучали на триллионе токенов синтетического кода из собственного конвейера IBM CodeAlchemy.

Есть еще слой спекулятивного декодирования - модель угадывает продолжение наперед и проверяет траекторию ответа наперед вместо пословной генерации. Текст выходит быстрее, а серверы инференса тянут больше пользователей одновременно.


Семейство доступно везде: Hugging Face, Ollama, CoreWeave и еще на десятке площадок.

🟡 Распознавание речи

Заодно IBM выпустила две речевые модели английского языка - Granite Speech 5.0 Turbo CTC и ее некоммерческую версию с индексом NC.

Скачок в нумерации с 4.1 сразу на 5.0 не случаен - это принципиально другая конструкция, чем была в 4-й серии.


В них всего 470 млн параметров и внутри нет языковой модели. Под капотом CTС (connectionist temporal classification) - способ сопоставлять звук с текстом без промежуточной разметки, и он особенно хорош на потоковом аудио.

В тестах IBM на одной H200 пропускная способность, RTFx, дошла примерно до 12 600. Нынешние лидеры публичного лидерборда Open ASR держатся около 6000.


Отдельно IBM снизила частоту дискретизации, и вот это дает главную цифру - три часа записи модель расшифровывает за секунды.


📌 Лицензирование: Apache 2.0 License


🟡Страница релиза
🟡Веса Granite 4.2
🟡Веса Granite Speech 5.0


@ai_machinelearning_big_data

#AI #ML #LLM #ASR #Granite #IBM
Please open Telegram to view this post
VIEW IN TELEGRAM
36🔥13👍7🤔1