280K subscribers
5.47K photos
1.27K videos
17 files
5.81K links
Погружаемся в машинное обучение и Data Science

Показываем как запускать любые LLm на пальцах.

По всем вопросам - @haarrp

@itchannels_telegram -🔥best channels

Реестр РКН: clck.ru/3Fmqri
Download Telegram
🌟 Система автопоиска незамеченных рекордов среди LLM на HuggingFace

AI2 опубликовал систему ArtifactLinker, которая предсказывает, какие из размещённых на платформе HuggingFace моделей способны установить новый SOTA-рекорд на конкретных бенчмарках.

Авторы исходят из того, что большинство моделей тестируются лишь на небольшой части существующих бенчмарков, а значит, многие LLM никогда не проверялись на задачах, где могли бы показать лучший результат.


🟡Принцип работы

Сначала графовая нейросеть (либо языковая модель с графовым контекстом) ранжирует ещё не оценённые пары по вероятности достичь нового рекорда.

По утверждению института, такой подход превосходит методы ранжирования, основанные исключительно на промптинге языковых моделей.


На втором этапе LLM-агент, способный писать и исполнять код, проводит реальную оценку отобранных пар.

Промежуточные результаты сохраняются в общей памяти и используются при последующих запусках.

По данным AI2, агент воспроизводит метрики с точностью до 80% в 72,6% случаев.

Среди наблюдений авторов интересно то, что более свежие LLM, в частности Gemma, нередко уступают существенно более ранней архитектуре DeBERTa на задачах распознавания логических отношений между утверждениями.


Вместе с кодом ArtifactLinker опубликован ArtifactBench - гетерогенный граф из 14 тыс объектов HuggingFace (модели, датасеты, научные статьи, репозитории кода) и 51 тыс связей между ними, включая результаты оценок, эпизоды дообучения и взаимные ссылки.

Институт позиционирует бенч как ресурс для задач предсказания связей в графе и регрессии метрик качества моделей.


📌Лицензирование: Apache 2.0 License.


🟡Arxiv
🟡Бенчмарк
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #LLM #Benchmark #ArtifactLinker #Ai2
Please open Telegram to view this post
VIEW IN TELEGRAM
👍42🔥1812🤣4🤔2🤝1🗿1
🌟 OSCAR: открытая система двухбитного сжатия KV-кэша

Together AI выложила метод квантования KV-кэша до 2-х бит - OSCAR (Offline Spectral Covariance-Aware Rotation).

KV-кэш - структура, в которой модель хранит промежуточные представления токенов при генерации.

На длинных контекстах он занимает значительную часть памяти GPU, и его сжатие позволяет либо обслуживать больше запросов одновременно, либо ускорять чтение из памяти.

Прежние попытки сжать кэш до 2-х бит ухудшали качество ответов.


OSCAR обходит это ограничение за счёт того, что поворот активаций перед квантованием рассчитывается исходя из статистики внимания.

Метод предлагает сначала собрать на калибровочном наборе ковариационные матрицы запросов и значений, взвешенных оценками внимания, и из них вывести персональный поворот для ключей и значений каждого слоя.

После этого применяется преобразование Адамара, выравнивающее значимость каналов, и перестановка с побитовым реверсом, чтобы соседние каналы попадали в один диапазон при поквантовом сжатии.

Первые 64 и последние 256 токенов контекста при этом хранятся в полной точности BF16 как опорные, всё остальное - в 2-х битах.

Калибровка выполняется один раз, поворот и пороги отсечения фиксируются, а онлайн-наценка по вычислениям скрывается внутри ядер декодирования.

🟡Тесты

На задачах AIME25, GPQA-Diamond, HumanEval, LiveCodeBench v6, MATH500 метод удерживается близко к точности базового режима BF16.

Разрыв составляет 3,78 пункта на Qwen3-4B-Thinking-2507, 1,42 пункта на Qwen3-8B и около нуля на Qwen3-32B и GLM-4.7-FP8.

🟡Результаты на длинных контекстах

По бенчмарку RULER-NIAH OSCAR работает стабильнее остальных двухбитных методов, но для меньших моделей разрыв с BF16 растёт по мере увеличения контекста: на Qwen3-4B-Thinking-2507 при 128 тыс. токенов точность падает с 81,0 до 39,5 пункта.

Для GLM-4.7-FP8 кривая практически совпадает с BF16.

В замерах на NVIDIA H100 скорость декодирования при контексте в 100 тыс. токенов выросла в 2,8–3,1 раза относительно BF16.

OSCAR совместим с paged attention и встраивается в SGLang без изменений на стороне клиента. Для экспериментов Together AI выложила предвычисленные матрицы для Qwen3-4B-Thinking, Qwen3-8B, Qwen3-32B и GLM-4.7-FP8.


📌Лицензирование: Apache 2.0 License


🟡Страница проекта
🟡Arxiv
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #LLM #Quantization #OSCAR #TogetherAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍126👨‍💻40💯25🤔19🔥1413👌11👏4😐4🕊2🎃1
🌟 Топовые LLM плохо предсказывают будущие научные открытия

Оксфорд, Стэнфорд, Институт Аллена и Sakana AI выложили работу, в которой ставится вопрос: способен ли ИИ предвидеть ход научного прогресса.

Исследование примыкает к дискуссии об "автономном учёном" на базе ИИ - направлении, которое сейчас волнует индустрию, его развивает в том числе и Sakana AI.

Чтобы отделить реальный прогноз от существующих знаний, авторы построили бенч CUSP.

Языковые модели обычно знают уже состоявшиеся открытия из обучающих данных, поэтому при прямом вопросе об известном результате легко дают верный ответ.


CUSP это блокирует: для события, скажем, 2025 года модели разрешают опираться только на сведения, доступные до этой даты.

Говоря проще, систему возвращают в прошлое и заставляют предсказывать будущее вслепую.


В основу теста легли 4760 научных событий за январь 2024 - март 2026 годов из журналов Nature, Science, Cell и подборок заметных работ по ИИ. На этой базе было сформировано 17 429 заданий.

В прогонах принимали участие GPT-5.4, Claude Sonnet 4.5, DeepSeek R1 и GPT-OSS 20B.

🟡Результаты

Выбрать правдоподобное техническое направление смогли - на вопросах с выбором ответа GPT-5.4 показала точность 81,9%.

Но определить, будет ли конкретное достижение вообще реализовано, модели почти не способны: точность держалась в пределах 45–52%, что близко к подбрасыванию монеты.

Сроки все модели называли с запаздыванием: медианная ошибка GPT-5.4 составила 14 месяцев, Claude Sonnet 4.5 - 17, а вот LLaMA 3.3 оказалась самой точной - 4 месяца.

В задачах на проектирование решения даже лучший результат (5,04 из 10 у GPT-5.4) не попадал в реально применённый позже технический путь.

Рисёрч отмечает деталь: качество прогноза почти не зависело от того, относится событие к периоду до или после среза знаний модели.


Это означает, что дело не только в нехватке данных. Доступ к дополнительной информации повышает результаты, но не закрывает разрыв, причём для самых цитируемых работ он был заметнее.

До кучи - модели систематически переоценивали уверенность в своих ответах.

🟡Вывод

LLM пока выступают скорее ретроспективными толкователями уже известных результатов, чем надёжными предсказателями будущих.


📌Лицензирование: MIT License


🟡Страница проекта
🟡Arxiv
🟡Датасет
🖥Github


@ai_machinelearning_big_data

#AI #ML #LLM #Research #Science #Benchmark
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔63👍4828😐19🤨10🔥5🫡5🥰1👌1
🧠VL-DAC — метод обучения визуально-языковых моделей в симуляторах вместо дорогостоящего дообучения на реальных данных

Исследователи доказали, что VLM можно дешевле и быстрее обучать новым навыкам не в реальной среде, а в наборе симуляторов — а затем переносить эти навыки уже на реальные задачи. Результаты исследования представили на международной конференции по автономным агентам и мультиагентным системам уровня А — AAMAS. К таким выводам пришли ребята из лабы фундаментальных исследований ИИ Т-Банка.

VL-DAC учитывает недостатки предыдущих методов дообучения VLM и учит:
•анализировать интерфейсы и изображения
•выполнять действия шаг за шагом
•оценивать, насколько каждое действие приближает к цели

Для обучения использовали несколько симуляторов, каждый из которых отвечает за отдельный навык: навигацию, работу с объектами или веб-интерфейсами. После обучения модель Qwen2-VL-7B стала более чем на 50% лучше выполнять задачи в интерактивной среде, улучшила пространственную ориентацию на 5% и веб-навигацию на 2%.

Подход может применяться в робототехнике, банкинге, гейминге, логистике и других задачах, где ИИ должен не просто понимать изображение или интерфейс, но и выполнять цепочку последовательных действий.

@ai_machinelearning_big_data

#AI #ML #LLM
👍155🤔8276👏28🔥7👌6
📌LEAP: система, которая помогла LLM решить все задачи олимпиады Putnam 2025

Google опубликовала интересный пейпер о системе LEAP, предназначенной для автодоказательства теорем. Она позволяет языковым моделям строить формальные, машинно проверяемые доказательства на языке Lean.

Доказательство на естественном языке трудно проверить автоматически - оно почти всегда содержит логические пробелы.

Формальное доказательство записывается на машинном языке и проверяется компилятором, что даёт гарантию корректности, но писать его значительно сложнее.


В этой области лидируют специализированные модели, заточенные в обучении именно под Lean. LEAP, работая как агентный фреймворк, использует общие модели, разбивая задачу на части и исправляя ошибки рекурсивно по подсказкам компилятора.

Главная исследовательская победа проекта - олимпиада Putnam 2025, ежегодное соревнование по математике для студентов в США.

LEAP формально решила все 12 задач, тогда как ни Gemini 3.1 Pro сама по себе, ни открытый специализированный прувер Goedel-Prover-V2 не решили ни одной.

Закрытую систему Aristotle, получившую на математической олимпиаде IMO 2025 результат уровня золотой медали, авторы в собственных тестах оценили в 9 решённых задач из 12.


В рамках работы также представлен набор IMO-LeanProofBench из 60 формализованных в Lean задач олимпиадного уровня, требующих весьма нестандартных выводов и структурно сложных доказательств.

На нём LEAP, что неудивительно, достигает в среднем по basic и advanced сэтам около 70% против примерно 48% у Aristotle.


Попутное достижение - LEAP формально проверила вспомогательную часть одной из комбинаторных задач, восходящих к математику Дональду Кнуту, сгенерировав более 5000 строк кода на Lean 4.

🟡Стоит отметить иронию

В статье авторы критикуют закрытые системы-конкуренты (Axiom3, Numina, Aristotle) за то, что те недоступны для научной проверки. При этом код самого LEAN тоже не опубликован.

Открытие итоговых доказательств это частично смягчает (их можно перепроверить компилятором Lean), но полная воспроизводимость гугловского проекта пока невозможна.


@ai_machinelearning_big_data

#AI #ML #LLM #LEAP #Research #Google
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍39🤔31👏14🔥109😁8🎉2
🌟 Liquid AI выпустила компактную MoE-модель для запуска на потребительских устройствах

LFM2.5-8B-A1B - языковая MoE-модель на 8 млрд общих и 1млрд активных параметров, с целевым инференсом на ноутбуках, смартфонах и ризонингом по умолчанию.

Релиз продолжает линейку LFM2 и развивает вышедшую в октябре 2025 года LFM2-8B-A1B. Окно контекста расширено с 32 до 128 тысяч токенов, объём предобучения увеличен с 12 до 38 трлн токенов, а поверх добавлено крупномасштабное RL.

Словарь токенизатора удвоен (с 65,5 до 128 тыс. единиц). Liquid AI говорит, что это повышает эффективность обработки нелатинских письменностей (для русского - примерно на 6%, для тайского и хинди - кратно).

Отдельный акцент Liquid AI делает на скорости и работе с вызовом инструментов.

Согласно проведенным измерениям, на Apple M5 Max модель выдаёт до 253 токенов в секунду, укладываясь в 6 ГБ памяти, и около 30 токенов в секунду на смартфоне.

По бенчмаркам, в тестах на следование инструкциям и в агентных сценариях LFM2.5-8B-A1B сопоставима с заметно более крупными моделями (Gemma-4-26B) при значительно меньшем числе активных параметров.

Заявлена поддержка llama.cpp, MLX, vLLM, SGLang и ONNX Runtime.


📌Лицензирование: LFM Open License


🟡Блогпост
🟡Документация
🟡Веса
🟡Демо


@ai_machinelearning_big_data

#AI #ML #LLM #LFM #LiquidAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥79👍53🤔3622👏21🥰2
📌 Writer исследовали природу сикофантии в ИИ

Подразделение AI Research компании WRITER, разработчика корпоративных ИИ-систем, опубликовало 2 работы, посвящённые исследованию склонности языковых моделей соглашаться с пользователем, даже когда тот неправ.

Спойлер: к такому поведению приводит персонализация

🟡Первая работа посвящена финансовым задачам

Авторы протестировали 8 актуальных моделей на двух наборах данных, искусственно добавляя в запрос ложные предпочтения, которые противоречили верному ответу.

Оказалось, что способ внедрения влияет на результат. При прямой вставке в запрос точность падает сильнее, но модель чаще отмечает противоречие, а когда те же данные подаются через инструмент памяти, точность снижается меньше, но модели почти перестают сигнализировать о конфликте и выдают неверные ответы без предупреждения.

Крупные модели, кстати, чаще ошибаются, всё же фиксируя противоречие, тогда как мелкие - просто умалчивают о диссонансе.


🟡 Вторая работа про комбинацию LLM и систем памяти

Для проверки построили тест MIST и оценили 5 моделей в связке с 3 коммерческими системами памяти (Mem0, MemOS и Zep).

По итогу - каждая модель как минимум утроила частоту согласия с ошибкой хотя бы при одной конфигурации памяти. Из этого авторы делают вывод, что проблема связана со слоем памяти, а не с моделью.

🟡Причину видят в механике извлечения данных

Системы памяти сохраняют утверждение пользователя как отдельный факт, отбрасывая контекст вокруг него, в том числе прежние возражения ассистента.

По замерам, замена извлечённых фрагментов на полную историю переписки примерно вдвое уменьшает эффект.


Авторы предлагают 2 способа смягчения:

🟢Первый - сохранять в памяти и реплики самого ассистента.

🟢Второй, наиболее действенный, - заменить извлечение отдельных фрагментов кратким пересказом разговора, который генерирует сама модель.

Результаты исследования ставят вопрос о том, что в принципе дают сложные системы памяти, если они так влияют на точность ответов.


@ai_machinelearning_big_data

#AI #ML #LLM #Memory #Research #WRITER
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔48👍4015🤓12🤷‍♂7🔥4🤨3🗿1
📌 Ai2: Гибридные модели и трансформеры по-разному работают с текстом

Институт Аллена опубликовал работу, в которой выяснили, как архитектура моделей влияет на понимание текста.

Спойлер: гибридные модели лучше улавливают смысл, а классические трансформеры точнее копируют данные.

Для эксперимента взяли 2 собственные языковые модели - Olmo 3 и Olmo Hybrid. Обе обучались абсолютно одинаково, отличалось лишь их внутреннее устройство.

🟢Olmo 3: классический decoder-only трансформер

🟠Olmo Hybrid: гибрид c чередованием слоев RNN и трансформеров в пропорции 3:1

Трансформеры используют механизм внимания на каждом слое. Модель может напрямую обращаться к любому из предыдущих токенов. Это требует вычислительных мощностей, зато позволяет идеально цитировать прочитанное.


Гибрид сохраняет несколько слоёв внимания, а остальные заменяет рекуррентными. Они читают текст строго слева направо и сохраняют его в виде сжатой памяти. Такая память не даёт точно обратиться к конкретному предыдущему токену, зато затраты на обработку остаются постоянными независимо от длины текста.


Чтобы измерить разницу, обеим моделям подавали статьи, страницы Wikipedia, книги, научные работы, а также код на Python, HTML и LaTeX. На выходе фиксировали, насколько точно каждая модель предсказывает следующий токен.

🟡Результат

Гибрид лучше предсказывает смысловые слова (существительные, глаголы и прилагательные). Он также превосходит чистый трансформер там, где нужно глубокое понимание контекста.

Но его преимущество почти исчезало в случаях, когда дело доходит до точного цитирования. Чем длиннее был повтор, тем меньше становился разрыв. Здесь точнее оказывался трансформер.

В дополнительном прогоне с 3-мя моделями на 1В параметров (трансформером, гибридом и чистой рекуррентной моделью без внимания), выяснилось, что гибрид пасует перед точным повторением текста и закрывающими скобками в коде.


🟡Выводы

Первый: единый усреднённый показатель ошибки слишком груб для сравнения архитектур - различия видны только при разборе отдельных типов токенов.

Второй: преимущество гибрида на смысловых словах связано со способностью RNN-слоёв отслеживать меняющееся состояние текста.


@ai_machinelearning_big_data

#AI #ML #LLM #Research #Ai2
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥92🤔35👍1612🤓7👏5👌3
Media is too big
VIEW IN TELEGRAM
📌 Могут ли LLM переписать софт с нуля?

Epoch AI совместно с METR собрала бенчмарк MirrorCode, который проверяет, способны ли современные модели восстановить полноценное приложение, не видя его исходников.

Спойлер: на мелочи да, на крупных проектах пока нет.

🟡Механика

Агенту показывают 25 целевых программ, от Unix-утилит и криптографии до биоинформатики, интерпретаторов и статических анализаторов и ставят задачу написать их заново на одном из 6 языков (Python, C, Rust, Go, OCaml, Ada).

Доступ к оригиналу дают только на запуск: можно гонять бинарник, смотреть в документацию и смотреть выводы, но не читать код.

Решение проверяется сквозными тестами на байт-точное совпадение stdout/stderr, причём часть тестов скрыта от модели, чтобы исключить захардкоженные lookup-таблицы.

Что важно, дают щедрый вычислительный бюджет. Моделям разрешают шикануть вплоть до 10 миллиардов токенов на крупный таск.

На самом дорогом прогоне агент работал 19 дней и сжёг $2 600, полностью без участия кожаного вообще.


🟡Результаты

🟢Claude Opus 4.7 - 56% идеальных решений и единственный, кто закрыл задачи категории Large.

В частности, он переписал gotree (биоинформатический тулкит на 16 000 строк Go) за 14 часов и $251, пройдя 2000 из 2001 тестов. Авторы говорят, что инженеру без ИИ на это потребовалось бы от 2 до 17 недель.


🟢GPT-5.5 - 44%. На задачах, где он всё-таки добирался до близкого к идеалу решения, выходил в среднем в 2 раза дешевле Opus.

🟠Gemini 3.1 Pro Preview - 32%.

Простые утилиты (uuidparse, qsv_select или hexyl) модели разбирают уверенно, там почти всегда 100%. Даже когда финальный результат не идеален, агенты обычно проходят больше 90% тестов.

🟡Где спотыкаются

Самая массовая категория ошибок - пограничные случаи: около 40% запусков Opus 4.7 проваливают хотя бы один скрытый тест из-за пропущенной мелочи.

Дальше идут решения, заточенные под видимые тесты, преждевременная сдача и пропуск целых фич, которые есть в документации, но не в тестах.

Попытки читерить хардкодом. У GPT-5.5 это случилось в 24% запусков, у Gemini - в 31%. Opus 4.7 в финальных сабмитах не схитрил ни разу.

Самый крепкий орешек - питоновский линтер ruff. Лучший запуск на скрытых тестах вытянул только 67%. Похожая история с математическим пакетом giac_subset и библиотекой mailauth для email-аутентификации.

🟡Странности экономики

GPT-5.5 решает задачи примерно в 3 раза дороже, чем GPT-5, а Opus 4.7, наоборот, в 3 раза дешевле, чем Opus 4.1.

🟡Меморизация

Все таргеты опенсорсные и модели вполне могли видеть их во время обучения, поэтому прогнали отдельный тест, где модели восстанавливали функции по имени и потом сравнили с реальным кодом.

Следы меморизации нашлись у 17 из 25 программ. Но при этом модели успешно решали незнакомые по обучению программы (nonogrid и tssql) и проваливали известыне (sed, ruff), так что меморизация явно не повод для скепсиса.

🟡Вывод

Агенты умеют автономно работать сутками и пилить проекты, которые у человека заняли бы недели, но для этого нужна жёсткая спецификация в виде эталона и тестов. Без чёткого фидбек-сигнала и на действительно крупных кодовых базах всё пока сыпется.

По меркам бенчмарков прогресс внушительный, по меркам полной автономии - ещё рано.

Авторы выложили в опенсорс обвязку агента и 22 таргета, оставив 3 в приватном тестовом наборе.


🟡Техотчёт
🖥Github


@ai_machinelearning_big_data

#AI #ML #LLM #Benchmark #MirrorCode #EpochAI
Please open Telegram to view this post
VIEW IN TELEGRAM
164👍25🔥15🗿3👻2👌1
🌟 Mistral AI обновила модель Leanstral

Leanstral 1.5 - новая версия ранее выпущенной модели для формальной верификации в языке Lean 4. Задача подобных моделей помогать составлять и проверять доказательства, которые компилятор Lean принимает как корректные.

Lean 4 - это система интерактивного доказательства теорем, которая позволяет записывать математические утверждения и проверять их строго формально, а также описывать свойства программного кода.


Обновление не затронуло изменение архитектуры, количество параметров и окно контекста, под капотом также MoE на 119 млрд общих и 6,5 млрд активных параметров, 256 тысяч токенов контекст и мультимодальность на входе.

Версия 1.5 прошла техэтапное обучение в 2-х средах: одна отрабатывает доказательство теорем в диалоге с компилятором Lean, другая учит модель действовать как программист в реальных репозиториях.

🟡Тесты

Апдейт полностью насыщает бенчмарк miniF2F, набирая 100% на проверочной и тестовой выборках, решает 587 из 672 задач PutnamBench и показывает лучшие на сегодня результаты на наборах FATE-H и FATE-X.

К слову, на PutnamBench, Leanstral 1.5 опережает систему Seed-Prover 1.5 на 7 задач при затратах около 4 долларов на задачу (против 300+ долларов у соперника).


В тесте по кодингу на 57 репозиториях, система с участием Leanstral выявила 47 нарушенных свойств, из которых 11 оказались реальными ошибками, а 5 ранее не были известны.


📌Лицензирование: Apache 2.0 License


🟡Блогпост
🟡Модель
🟡Demo


@ai_machinelearning_big_data

#AI #ML #LLM #LEAN #LeanStral #MistralAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥37👍139👀5👏3😁3🤷‍♂1🥰1🤔1