280K subscribers
5.49K photos
1.28K videos
17 files
5.83K links
Погружаемся в машинное обучение и Data Science

Показываем как запускать любые LLm на пальцах.

По всем вопросам - @haarrp

@itchannels_telegram -🔥best channels

Реестр РКН: clck.ru/3Fmqri
Download Telegram
🌟 MiniVLA: компактная Vision-Language-Action модель для робототехники.

AI-лаборатория Стенфордского университета представила модель MiniVLA — усовершенствованную версию Vision-Language-Action (VLA), компактную альтернативу OpenVLA.

Отличительная особенность MiniVLA - сокращенное в 7 раз количество параметров (1 млрд. против 7 миллиардов у OpenVLA), что дает значительное ускорение процессов обучения и инференса.

В архитектуре MiniVLA используется тот же ViT для обработки изображений, что и в OpenVLA, однако в качестве языковой модели используется Qwen 2.5 0.5B вместо Llama 2 7B.

Обучение языковой модели основано на датасете Llava-1.5-Instruct VQA, аналогично базовой модели Prismatic VLM в OpenVLA. Несмотря на уменьшение размера, MiniVLA демонстрирует сопоставимую с OpenVLA производительность в рамках бенчмарка Libero-90 (61.4% против 62%).

Одно главных усовершенствований MiniVLA - применение векторного квантования (VQ) для кластеризации действий (action chunking). Вместо дискретного представления действий, модель прогнозирует их последовательности, которые кодируются в виде M кодовых индексов с помощью VQ-BeT5. Это существенно повышает производительность на Libero-90.

Так, MiniVLA с VQ h8 (action chunks) достигает 77% успеха, в то время как базовая модель MiniVLA и OpenVLA демонстрируют 61.4% и 62% соответственно.

MiniVLA поддерживает подачу на вход нескольких изображений, что позволяет использовать "историю изображений" и серию снимков с носимых целевым роботом камер. Мульти-кадровая возможность способствует повышению производительности на Libero-90: модель MiniVLA с VQ h8 и историей изображений (history=2) достигает 82% успешности, а с кадрами с новимой камеры — 82.1%.

По сделанным замерам производительности, MiniVLA показывает в 2.5 раза более высокую скорость инференса, чем OpenVLA (12.5Hz против 5Hz) на одном GPU NVIDIA L40s.

▶️В репозитории на HF опубликованы несколько вариантов MiniVLA:

🟢Prism with Qwen 2.5 0.5B backbone
🟢MiniVLA 1B Wrist VQ
🟢MiniVLA VQ 1B
🟢MiniVLA Image History (T=2) VQ 1B
🟢MiniVLA 1B
🟢MiniVLA 1B VQ Trained on Bridge V2


📌Лицензирование: MIT License.


🟡Статья
🟡Набор моделей
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #VLA #MiniVLA
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍329🔥6
🚀 Сбер представил Green-VLA — открытый SOTA-фреймворк для управления роботами

Сбер опубликовал технический отчёт Green-VLA по моделям Vision–Language–Action. Это методология для создания Physical AI, который превращает зрение и текст в физические действия. Работа заняла первое место среди статей дня на Hugging Face, обойдя исследования Moonshot AI и ведущих мировых университетов.

Главное о решении:

- Базируется на нейросети ГигаЧат и описывает путь от обучения до настройки робота в реальных условиях.
- Подтвердило эффективность на бенчмарках Google, Стэнфорда и Фрайбургского университета.
- Показало высокую стабильность — на AI Journey 2025 робот Грин под управлением Green-VLA отработал без сбоев более 10 часов.
- Является открытой методологией для создания надёжных и масштабируемых робототехнических систем.

@ai_machinelearning_big_data

#ai #ml #robotics #vla #sber
👍93🤣4723🔥12🤗3🦄3
🌟 NVIDIA открыла доступ к самой крупной модели для беспилотных автомобилей

Alpamayo 2 Super - рассуждающая VLA модель на 34 миллиарда параметров, которая сшивает изображение с передних, боковых и задних камер в круговой обзор и рассчитывает траекторию движения.

Впервые NVIDIA показала её на конференции GTC в Тайбэе в начале июня, но доступ открылся только сейчас.


NVIDIA делает упор на редких ситуациях, с которыми беспилотники справляются хуже всего, - перестроения, повороты через встречный поток, перегруженные перекрёстки.

В основе лежит Cosmos 3 Super Reasoner, после базового обучения модель прогнали через RL, то есть на последствиях её собственных решений в смоделированных поездках.

Помимо маршрута модель выдаёт текстовое обоснование манёвра, и оператор-разработчик может проследить, какая деталь в кадре привела к конкретному решению.

В компании связывают это с проверкой безопасности по стандарту ISO/PAS 8800 и предлагают использовать тот же механизм для автоматической разметки видео с тестовых машин - расшифровки, которая обычно занимает месяцы ручной работы.


В тесте LingoQA, где систему просят объяснить дорожную обстановку, NVIDIA ставит Alpamayo 2 Super на первое место и утверждает, что модель обходит Qwen2.5-VL 72B на 17 пунктов, а Gemini 2.5 Pro примерно на 15.

Лицензия модели позволяет дообучать Alpamayo 2 Super на собственных данных и ставить в серийные машины.


📌Лицензирование: Open MDW 1.1 License


🟡Блогпост
🟡Модель
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #VLA #AutonomousVehicles #Alpamayo #NVIDIA
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥49👍1914🗿3😢1🙉1🙊1