289K subscribers
5.23K photos
1.2K videos
17 files
5.59K links
Погружаемся в машинное обучение и Data Science

Показываем как запускать любые LLm на пальцах.

По всем вопросам - @haarrp

@itchannels_telegram -🔥best channels

Реестр РКН: clck.ru/3Fmqri
Download Telegram
⚡️ OLMoASR: открытые ASR-модели от AI2.

Институт искусственного интеллекта Аллена выпустил OLMoASR, семейство из 6 моделей для автоматического распознавания английской речи.

▶️Линейка моделей:

🟢OLMoASR-tiny.en (39M);
🟢OLMoASR-base.en (74M);
🟢OLMoASR-small.en (244M);
🟢OLMoASR-medium.en (769M);
🟠OLMoASR-large.en-v1 (1.5B) обученная на 440 тыс. часов аудио;
🟠OLMoASR-large.en-v2 (1.5B) обученная на 680 тыс. часов аудио;

По результатам тестов на 21 датасете, модели OLMoASR показали производительность, сопоставимую с Whisper от OpenAI, а в некоторых случаях и превзошли ее, особенно при работе с длинными аудиозаписями.

Проект полностью открытый: опубликованы не только веса моделей, но и датасет, код для обработки данных, а также скрипты для обучения и оценки. Все компоненты, включая код и данные, доступны на GitHub и Hugging Face.


📌Лицензирование:  Apache 2.0 License.


🟡Статья
🟡Набор моделей
🟡Техотчет
🟡Demo
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #ASR #OLMoASR #AI2
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥4220👍8🥰6
🌟 OLMo Hybrid: RNN плюс трансформер в одной модели.

Институт Аллена опубликовал OLMo Hybrid 7B - модель, которая построена на чередовании слоев Gated DeltaNet и стандартного внимания в соотношении 3:1. Такая архитектура решает больше подзадач из обучающих данных за меньшее число токенов, что напрямую снижает потребность в данных при обучении.

Gated DeltaNet - это RNN с расширением в виде отрицательных значений матрицы переходов. Это небольшое изменение в правиле обновления внутреннего состояния позволяет слоям Gated DeltaNet реализовывать динамику попарной перестановки элементов и за счет этого решать задачи отслеживания состояния, недоступные чистым трансформерам.


В OLMo Hybrid Ai2 показали, что гибридные модели выразительнее суммы своих частей. Существует класс задач (назовем их отслеживание состояния с обращением к памяти), которые не решают ни чистые трансформеры, ни чистые RNN, но гибрид справляется с ними уже при одинарном чередовании типов слоев.

Абляционные эксперименты от 60M до 1B параметров показали, что GDN стабильно лучше Mamba2 как в чистом, так и в гибридном варианте, равномерное чередование слоев лучше концентрации внимания в середине сети, а соотношение 3:1 - оптимальный баланс между качеством и вычислительной стоимостью на средних и крупных масштабах.

🟡Тесты

🟢На MMLU OLMo Hybrid достигает той же точности, что OLMo 3 7B, используя на 49% меньше токенов; на срезе Common Crawl - на 35% меньше.

🟢Коэффициент эффективности использования данных у гибрида равен 83,7 против 94,9 у трансформера.

🟢Экономия данных растет с размером модели: примерно в 1,3 раза на 1B параметров и в 1,9 раза на 70B.

После дообучения и адаптации к длинному контексту OLMo Hybrid обходит OLMo 3 во всех категориях оценки. На RULER при 64k токенах - 85,0 против 70,9 у базовой модели.


📌Лицензирование: Apache 2.0 License.


🟡Статья
🟡Набор моделей
🟡Техотчет


@ai_machinelearning_big_data

#AI #ML #LLM #OLMoHybrid #Ai2
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
186🤩38👍36🔥11💯6👏5🎉2
🌟 WildDet3D: открытая модель монокулярной 3D-детекции по одному снимку.

Институт Аллена представил модель WildDet3D, которая по одному изображению строит 3D-рамки объектов: оценивает их положение, размер и ориентацию в метрических координатах.

Модель принимает сразу несколько типов промптов: текстовый запрос, клик по точке или готовый 2D-бокс от внешнего детектора.

🟡Архитектура состоит из 3 блоков

2D-детектор построен на SAM3 и обрабатывает все типы запросов.

Геометрическая ветка использует энкодер DINOv2 с обучаемым декодером глубины, учитывающим геометрию обзора: направления лучей камеры зашиваются через сферические гармоники, что снимает необходимость в отдельной калибровке.

Третий компонент, 3D-head, объединяет через кросс-внимание 2D-детекции с признаками глубины и поднимает их в полноценные 3D-боксы.

Если на инференсе доступны данные с LiDAR, ToF или стереокамеры, они подмешиваются в ту же геометрическую ветку без переобучения.

🟡Тесты

На бенчмарке Omni3D модель показывает 34,2 AP с текстовыми промптами (это +5,8 пункта к прежнему лидеру 3D-MOOD).

На zero-shot переносе на Argoverse 2 WildDet3D практически удваивает прежний результат: 40,3 ODS против 23,8.

На редких категориях из собственного бенчмарка WildDet3D-Bench успехи, разумеется, еще лучше - 47,4 AP против 2,4 у 3D-MOOD.

🟡Вместе с моделью вышло демо-приложение для iOS.

Оно использует видеопоток с камеры iPhone и данные LiDAR-сенсора, чтобы в реальном времени отрисовывать 3D-боксы поверх сцены как AR-оверлей.

Это наглядная демонстрация того, как монокулярная модель усиливается, когда устройство умеет отдавать дополнительный сигнал глубины.

🟡Третья часть релиза - датасет WildDet3D-Data.

Более 1 млн. изображений и 3,7 млн. верифицированных 3D-аннотаций, охватывающих свыше 13 тыс. категорий объектов. По сценам распределение получилось такое: 52% помещений, 32% городской среды и 15% природы.

Он собран на основе 2D-наборов (COCO, LVIS, Objects365, V3Det): кандидаты в 3D-боксы генерировались 5 независимыми методами оценки геометрии, затем фильтровались, проверялись VLM и дополнительно отбирались людьми.


🟡Статья
🟡Модель
🟡Техотчет
🟡Demo
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #CV #Detection #WildDet3D #Ai2
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤩78👏30👍2311🔥11🎉9🥰3
🌟 Ai2 представил способ обновлять навыки LLM по одному, без полного ретрейна

Институт Аллена выпустил BAR - рецепт посттрейна, в котором доменные эксперты обучаются по отдельности, а затем собираются в единую MoE-модель через обучаемый роутер.

Метод снимает давнюю проблему: как добавить модели новый навык, не переобучая её целиком и не разрушая то, что она уже умела.


Замена код-эксперта на версию, обученную на более качественных данных с RL, даёт +16.5 пунктов на кодинге при почти нулевом влиянии на другие домены. Добавление RL к существующему math-эксперту - +13 пунктов.

Стоимость обновления одного домена масштабируется линейно, а не квадратично, как в монолитном пайплайне, где любое улучшение требует прогона всех доменов заново

Основа BAR - прогрессивное размораживание общих параметров по стадиям. На mid-training они остаются заморожены, а на этапе SFT размораживаются эмбеддинги и хэд: без этого эксперт не умеет вводить новые специальные токены (например, для вызова функций).

На RLVR размораживается всё, включая внимание. Каждый эксперт при этом учится на смеси доменных и общих SFT-данных: чистый доменный SFT ломает следование инструкциям и общие знания.

После обучения эксперты сливаются простым усреднением разошедшихся общих параметров, а роутер дообучается на стратифицированной 5%-й выборке SFT-данных.

Тестовая модель BAR-5x7B на основе Olmo 2 7B с экспертами по математике, коду, tool use и безопасности набирает 49.1 балла против 47.8 у монолитного переобучения на стадии посттрейна и 46.7 у BTX, где эксперты обучаются как полностью независимые плотные модели.


Ai2 выложил полный набор чекпоинтов, на которых валидировался метод: исходную 7B-модель как точку старта, базовый двухэкспертный MoE, а также промежуточные и финальные версии доменных экспертов - по математике и программированию в двух вариантах (после SFT и после SFT+RLVR), плюс экспертов по tool-use и безопасности, обученных только через SFT. Завершает набор итоговая пятиэкспертная MoE-модель с обученным роутером, объединяющая все домены.


📌Лицензирование: Apache 2.0 License.


🟡Набор моделей
🟡Arxiv
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #LLM #Train #BAR #Ai2
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥58🤓32👍13👏129💯5😁1
🌟 Система автопоиска незамеченных рекордов среди LLM на HuggingFace

AI2 опубликовал систему ArtifactLinker, которая предсказывает, какие из размещённых на платформе HuggingFace моделей способны установить новый SOTA-рекорд на конкретных бенчмарках.

Авторы исходят из того, что большинство моделей тестируются лишь на небольшой части существующих бенчмарков, а значит, многие LLM никогда не проверялись на задачах, где могли бы показать лучший результат.


🟡Принцип работы

Сначала графовая нейросеть (либо языковая модель с графовым контекстом) ранжирует ещё не оценённые пары по вероятности достичь нового рекорда.

По утверждению института, такой подход превосходит методы ранжирования, основанные исключительно на промптинге языковых моделей.


На втором этапе LLM-агент, способный писать и исполнять код, проводит реальную оценку отобранных пар.

Промежуточные результаты сохраняются в общей памяти и используются при последующих запусках.

По данным AI2, агент воспроизводит метрики с точностью до 80% в 72,6% случаев.

Среди наблюдений авторов интересно то, что более свежие LLM, в частности Gemma, нередко уступают существенно более ранней архитектуре DeBERTa на задачах распознавания логических отношений между утверждениями.


Вместе с кодом ArtifactLinker опубликован ArtifactBench - гетерогенный граф из 14 тыс объектов HuggingFace (модели, датасеты, научные статьи, репозитории кода) и 51 тыс связей между ними, включая результаты оценок, эпизоды дообучения и взаимные ссылки.

Институт позиционирует бенч как ресурс для задач предсказания связей в графе и регрессии метрик качества моделей.


📌Лицензирование: Apache 2.0 License.


🟡Arxiv
🟡Бенчмарк
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #LLM #Benchmark #ArtifactLinker #Ai2
Please open Telegram to view this post
VIEW IN TELEGRAM
👍42🔥1812🤣4🤔2🤝1🗿1
This media is not supported in your browser
VIEW IN TELEGRAM
🌟 MolmoMotion: модель прогнозирования движения объектов в трёхмерном пространстве

Институт Аллена (Ai2выпустил MolmoMotion - модель, которая предсказывает, как отмеченный в кадре объект будет двигаться в ближайшие секунды.

На вход подаётся кадр или короткая видеоистория, на видимом в сцене предмете отмечаются опорные точки, и добавляется текстовая инструкция (например, "подвинь и поверни деревянную миску с фруктами").

На выходе модель строит траекторию этих точек в трёхмерном пространстве, в метрах относительно камеры.

Под капотом - модель Molmo 2 на 4 млрд параметров. Институт обучил 2 версии:

🟢Авторегрессионный вариант, который достраивает траекторию по шагам;

🟠Версию на основе flow-matching для случаев, когда у действия есть несколько вероятных продолжений.

🟡В открытый релиз вошли только 2 AR-чекпойнта

🟢H3-F30 для типичного видео: 3 кадра истории и прогноз примерно на 2 секунды при 15 FPS;
🟢H1-F32 - когда доступен лишь один кадр.

🟡Помимо моделей опубликованы датасет и бенчмарк

MolmoMotion-1M - набор из 1,16 млн видео, который охватывает 736 типов движения и около 5,6 тыс. объектов.

PointMotionBench состоит из 2,7 тыс. размеченных людьми видеоклипов из сетов DAVIS, HOT3D и WorldTrack.

По замерам Ai2, на этом бенче MolmoMotion точнее всех методов, с которыми его сравнивали, включая генераторы видео и более простые базовые модели.


В симуляции система управления на базе MolmoMotion успешно выполняла 76,3% операций "взять и переставить" против 56,0% у аналога на Molmo 2, а при генерации видео модель улучшила движение по всем пяти измеряемым показателям.


Среди ограничений авторы называют использование лишь 8 точек на объект при обучении. Этого достаточно для общей траектории, но мало для точного описания сложных деформаций.


📌Лицензирование: Apache 2.0 License


🟡Блогпост
🟡Релиз на HuggingFace
🟡Техотчёт
🖥Github


@ai_machinelearning_big_data

#AI #ML # #MolmoMotion #Ai2
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥59👏18😁64👍4🤔4🙏2🥰1
📌 Ai2: Гибридные модели и трансформеры по-разному работают с текстом

Институт Аллена опубликовал работу, в которой выяснили, как архитектура моделей влияет на понимание текста.

Спойлер: гибридные модели лучше улавливают смысл, а классические трансформеры точнее копируют данные.

Для эксперимента взяли 2 собственные языковые модели - Olmo 3 и Olmo Hybrid. Обе обучались абсолютно одинаково, отличалось лишь их внутреннее устройство.

🟢Olmo 3: классический decoder-only трансформер

🟠Olmo Hybrid: гибрид c чередованием слоев RNN и трансформеров в пропорции 3:1

Трансформеры используют механизм внимания на каждом слое. Модель может напрямую обращаться к любому из предыдущих токенов. Это требует вычислительных мощностей, зато позволяет идеально цитировать прочитанное.


Гибрид сохраняет несколько слоёв внимания, а остальные заменяет рекуррентными. Они читают текст строго слева направо и сохраняют его в виде сжатой памяти. Такая память не даёт точно обратиться к конкретному предыдущему токену, зато затраты на обработку остаются постоянными независимо от длины текста.


Чтобы измерить разницу, обеим моделям подавали статьи, страницы Wikipedia, книги, научные работы, а также код на Python, HTML и LaTeX. На выходе фиксировали, насколько точно каждая модель предсказывает следующий токен.

🟡Результат

Гибрид лучше предсказывает смысловые слова (существительные, глаголы и прилагательные). Он также превосходит чистый трансформер там, где нужно глубокое понимание контекста.

Но его преимущество почти исчезало в случаях, когда дело доходит до точного цитирования. Чем длиннее был повтор, тем меньше становился разрыв. Здесь точнее оказывался трансформер.

В дополнительном прогоне с 3-мя моделями на 1В параметров (трансформером, гибридом и чистой рекуррентной моделью без внимания), выяснилось, что гибрид пасует перед точным повторением текста и закрывающими скобками в коде.


🟡Выводы

Первый: единый усреднённый показатель ошибки слишком груб для сравнения архитектур - различия видны только при разборе отдельных типов токенов.

Второй: преимущество гибрида на смысловых словах связано со способностью RNN-слоёв отслеживать меняющееся состояние текста.


@ai_machinelearning_big_data

#AI #ML #LLM #Research #Ai2
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥90🤔35👍1612🤓7👏5👌3