289K subscribers
5.23K photos
1.2K videos
17 files
5.58K links
Погружаемся в машинное обучение и Data Science

Показываем как запускать любые LLm на пальцах.

По всем вопросам - @haarrp

@itchannels_telegram -🔥best channels

Реестр РКН: clck.ru/3Fmqri
Download Telegram
🌟 SenseNova-Vision: CV-комбайн в едином генеративном интерфейсе

SenseTime открыла веса единой модели зрения SenseNova-Vision. Обычно под каждую задачу (найти объекты, выделить их контуры, оценить глубину сцены) строят отдельную систему или встраивают в модель специальный модуль. Здесь от этого отказались - все задачи модель решает как генерацию текста, картинки или их смеси.

Компания основана в 2014 году и выросла из университетской лаборатории MMLab - оттуда вышла заметная часть китайских специалистов по компьютерному зрению. Известность пришла в 2015-м, когда алгоритм распознавания лиц SenseTime обошёл по точности человеческий глаз. В 2026 году Gartner назвала компанию визионером в генеративном CV.


🟡Механика

Рамки объектов и распознанный текст модель выдаёт текстом с координатами, карты глубины и нормалей поверхностей - картинками, а сложную сегментацию - смешанным ответом, где текстовая легенда задаёт цвета маски.

Авторы сравнивают подход с тем, что GPT сделал для текста: вместо зоопарка специализированных систем - один генеративный интерфейс.


Под капотом - открытая мультимодальная модель Bagel-7B-MoT от ByteDance, дообученная без изменений архитектуры.

MoT - это смесь трансформеров. Внутри модели живут 2 эксперта с собственными весами - один отвечает за понимание текста и изображений, второй за генерацию картинок, а внимание у них общее, так что оба смотрят на один контекст. Токены распределяются между экспертами жёстко, по типу данных, а не обучаемым маршрутизатором, как в MoE.

Для SenseNova-Vision такое устройство пришлось кстати - модель чередует текстовые ответы вроде координат и картиночные вроде масок, и у каждой ветки свой набор весов.

🟡Тесты

SenseNova-Vision лидирует среди сопоставимых систем там, где ответ - структурированный текст (детекция, в том числе в плотных сценах с десятками объектов, локализация текста на изображении, ключевые точки).

В оценке глубины и нормалей она близка к лучшим генеративным методам, в сегментации держится на уровне конкурентов.

Слабые места тоже есть. В многовидовой 3D-геометрии модель отстаёт от специализированных VGGT и Depth Anything 3, а текст на русском распознаёт заметно хуже, чем на английском.


Вместе с моделью опубликован корпус SN-VC-50M - 50 млн обучающих примеров из открытых наборов: 18,9 млн кадров для структурного понимания, 17,3 млн для плотной геометрии, 12,5 млн для многовидовой геометрии и 1,3 млн для сегментации.


📌Лицензирование: CC-BY-NC-4.0


🟡Модель
🟡Arxiv
🟡Датасет
🟡Демо
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #СV #MoT #SenseNovaVision #SenseTime
Please open Telegram to view this post
VIEW IN TELEGRAM
23👍12🔥101🌭1