⚡️ Qwen3.6-35B-A3B - ставка на эффективную архитектуру, а не на размер
35B параметров, ~3B активных за счёт MoE.
Главное:
- по agentic coding показывает уровень моделей с ~10x большим активным объёмом
- превосходит Qwen3.5-27B (dense) и предыдущую Qwen3.5-35B-A3B
- нативно мультимодальная архитектура (text + vision)
- в VLM-бенчмарках сопоставима с Claude Sonnet 4.5, в ряде задач выше
- сильные метрики в задачах spatial reasoning
MMMU - 81.7 vs 79.6 MMMU-Pro - 75.3 vs 68.4 MathVista - 86.4 vs 79.8 RealWorldQA - 85.3 vs 70.3.
Практическое значение:
- MoE даёт кратное снижение compute без потери качества
- подходит для агентных сценариев, где важны последовательные действия и планирование
- можно использовать как единый стек для code + vision задач
Apache 2.0 - без ограничений для продакшена
qwen.ai/blog?id=qwen3.6-35b-a3b
chat.qwen.ai
huggingface.co/Qwen/Qwen3.6-35B-A3B
modelscope.cn/models/Qwen/Qwen3.6-35B-A3B
@ai_machinelearning_big_data
35B параметров, ~3B активных за счёт MoE.
Главное:
- по agentic coding показывает уровень моделей с ~10x большим активным объёмом
- превосходит Qwen3.5-27B (dense) и предыдущую Qwen3.5-35B-A3B
- нативно мультимодальная архитектура (text + vision)
- в VLM-бенчмарках сопоставима с Claude Sonnet 4.5, в ряде задач выше
- сильные метрики в задачах spatial reasoning
MMMU - 81.7 vs 79.6 MMMU-Pro - 75.3 vs 68.4 MathVista - 86.4 vs 79.8 RealWorldQA - 85.3 vs 70.3.
Практическое значение:
- MoE даёт кратное снижение compute без потери качества
- подходит для агентных сценариев, где важны последовательные действия и планирование
- можно использовать как единый стек для code + vision задач
Apache 2.0 - без ограничений для продакшена
qwen.ai/blog?id=qwen3.6-35b-a3b
chat.qwen.ai
huggingface.co/Qwen/Qwen3.6-35B-A3B
modelscope.cn/models/Qwen/Qwen3.6-35B-A3B
@ai_machinelearning_big_data
🔥118🤓101👍42❤23💯7
⚡️ Anthropic выкатили Opus 4.7
Что поменялось:
- лучше держит длинные задачи
- точнее следует инструкциям
- валидирует ответы перед выдачей
То есть меньше «галлюцинаций на уверенном лице»
и меньше необходимости перепроверять руками
По бенчмаркам относительно 4.6:
- SWE Bench Pro +11%
- SWE Bench Verified +7%
- Terminal Bench 2.0 +4%
Без сюрпризов, но стабильный рост.
Модель явно двигают в сторону автономной работы
где её можно дольше держать в цикле без постоянного контроля
Цифры ниже, чем у Mythos
но это ожидаемо, там другая история с метриками и позиционированием
https://www.anthropic.com/news/claude-opus-4-7
@ai_machinelearning_big_data
Что поменялось:
- лучше держит длинные задачи
- точнее следует инструкциям
- валидирует ответы перед выдачей
То есть меньше «галлюцинаций на уверенном лице»
и меньше необходимости перепроверять руками
По бенчмаркам относительно 4.6:
- SWE Bench Pro +11%
- SWE Bench Verified +7%
- Terminal Bench 2.0 +4%
Без сюрпризов, но стабильный рост.
Модель явно двигают в сторону автономной работы
где её можно дольше держать в цикле без постоянного контроля
Цифры ниже, чем у Mythos
но это ожидаемо, там другая история с метриками и позиционированием
https://www.anthropic.com/news/claude-opus-4-7
@ai_machinelearning_big_data
❤66👍35🔥29🤔4🗿4😁3👌3
⭐️ Всего через час после выхода Opus 4.7 OpenAI выкатывают крупное обновление Codex.
Теперь Codex умеет работать в фоне на macOS. Он кликает, печатает, ходит по файловой системе.
Встроенный браузер, генерация изображений через gpt-image-1.5, постоянная память, долгоживущие автоматизации и больше 90 плагинов включая Atlassian, CircleCI и Microsoft Suite.
Anthropic концентрируются на качестве модели.
Claude Code остаётся топ инструментом разработчика.
Codex заточен стать твоим ИИ для повседневных задач.
И пока Anthropic задаёт планку по качеству моделей.
https://x.com/OpenAI/status/2044827705406062670
@ai_machinelearning_big_data
Теперь Codex умеет работать в фоне на macOS. Он кликает, печатает, ходит по файловой системе.
Встроенный браузер, генерация изображений через gpt-image-1.5, постоянная память, долгоживущие автоматизации и больше 90 плагинов включая Atlassian, CircleCI и Microsoft Suite.
Anthropic концентрируются на качестве модели.
Claude Code остаётся топ инструментом разработчика.
Codex заточен стать твоим ИИ для повседневных задач.
И пока Anthropic задаёт планку по качеству моделей.
https://x.com/OpenAI/status/2044827705406062670
@ai_machinelearning_big_data
👍115🤣77🔥34❤22🤔17👏12💯10😁3
Media is too big
VIEW IN TELEGRAM
Пытаясь преодолеть многолетнее технологическое отставание, компания запустила программу переобучения для почти 200 сотрудников. Инженеры на практике освоят Claude Code и Codex.
После курсов структура команды поменяется: ядро разработки сформируют из 60 специалистов, ещё 60 человек переведут на мониторинг и безопасность продукта. Эти изменения завершают реорганизацию начала 2025 года - подразделение уже перешло под контроль старшего вице-президента по разработке ПО Крейга Федериги, а бывший глава ИИ-направления Джон Джаннандреа покидает Apple на этой неделе.
Цель переобучения - релиз обновлённой Siri на летней конференции WWDC.
theinformation.com
Cognition выпустила крупное обновление IDE, смещающее акцент с написания кода на управление роем ИИ-агентов. Центральный элемент релиза - Agent Command Center, который собирает все запущенные агенты (локальные и облачные) на единой Kanban-доске с группировкой по статусу.
Задачи организуются через Spaces: пространство объединяет сессии агентов, пул-реквесты, файлы и контекст проекта. Например, в одном Space локальная сессия прототипирует UI, а две облачных правят API и пишут тесты. Новые сессии наследуют накопленный контекст.
Вторая часть релиза - автономный облачный агент Devin с собственной виртуальной машиной и браузером. Он ведёт задачи от отладки до деплоя и продолжает работать после выключения компьютера. Готовый PR можно отревьюить в Windsurf или передать локальному агенту на доработку. Devin включён во все тарифы, доступ разворачивается постепенно.
windsurf.com
Google добавил в утилиту систему специализированных ИИ-ассистентов: основной агент работает как координатор и делегирует ресурсоёмкие или рутинные задачи субагентам. Каждый из них работает в собственном окне контекста, использует индивидуальные системные инструкции и выделенный набор инструментов, включая серверы MCP.
Многоэтапные операции выполняются автономно, а в главный чат возвращается только итоговый результат. Для ускорения субагенты могут запускаться параллельно.
Из коробки доступны 3 базовых ассистента: универсального профиля, специалиста по анализу кодовой базы и эксперта по документации самой утилиты. Можно создавать кастомных агентов через Markdown-файлы с YAML-заголовками - конфигурации сохраняются локально или добавляются в репозиторий проекта для всей команды.
googleblog.com
Китайский ИТ-гигант представил модель Happy Oyster, способную создавать физически достоверные трёхмерные пространства и интерактивные видео, работая непрерывно и на лету реагируя на новые инструкции.
Инструмент поддерживает два формата. «Режиссура» создает связный мир длительностью до 3 минут в 720p, позволяя менять ракурсы камер или действия персонажей через текст, голос или картинки. «Wandering» создает локацию, которую можно бесконечно расширять и исследовать от первого лица.
Доступ предоставляется через лист ожидания на сайте проекта.
happyoyster.cn
Платформа Firefly пополнилась ИИ-агентом, который объединяет инструменты Creative Cloud в едином диалоговом интерфейсе. Достаточно описать результат текстом и ассистент сам выстроит и выполнит цепочку задач в Photoshop, Premiere, Illustrator и других программах. Агент обучается на предпочтениях автора и учитывает контекст текущих файлов.
Параллельно обновился видеоредактор: добавлены инструменты очистки звука, цветокоррекции и прямая интеграция с Adobe Stock. Для изображений появились функция генерации визуальных вариаций и инструмент ИИ-разметки кистью.
Также добавили модели Kling 3.0 - общий парк теперь превышает 30 моделей от разных поставщиков. Публичное бета-тестирование ассистента начнётся в ближайшие недели.
adobe.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤46👍24🔥6😁4👌2🗿2🥰1
Потанин: бюрократия замедляет развитие ИИ
Владелец «Норникеля» Владимир Потанин рассказал о ML‑стеке компании в интервью «России 24». Это любопытный кейс того, как industrial AI уходит от «ещё один CV на конвейере» к собственным foundation‑моделям и ML‑driven R&D.
▪️ MetalGPT — доменная foundation model «Норникеля», обученная на отраслевых данных металлургии. Используется для предиктивной аналитики агрегатов и R&D новых материалов.
▪️ Продакшн‑инференс на заводе: нейросети управляют 70% агрегатов на обогащении и принимают решения в 100 раз чаще, чем операторы. По уровню внедрения ИИ «Норникель» — мировой топ‑3 вместе с Tata Steel и POSCO.
▪️ ML для материаловедения. Модели применяются для подбора замещений: палладий вместо платины и иридия (первые 500 кг уже ушли в Китай на стекловолокно). Следующий шаг — предсказание и дизайн кристаллической решётки палладия для получения металла с заданными свойствами.
▪️ Экономика: «десятки миллиардов рублей» эффекта в год, к 2030 — 50+ млрд.
▪️ Уровень внедрения ИИ в РФ втрое ниже среднемирового, Россия претендует на третье место после США и Китая. Потанин против жёсткой регуляторики: модели обновляются раз в 2–3 месяца, бюрократия убьёт темп.
Владелец «Норникеля» Владимир Потанин рассказал о ML‑стеке компании в интервью «России 24». Это любопытный кейс того, как industrial AI уходит от «ещё один CV на конвейере» к собственным foundation‑моделям и ML‑driven R&D.
▪️ MetalGPT — доменная foundation model «Норникеля», обученная на отраслевых данных металлургии. Используется для предиктивной аналитики агрегатов и R&D новых материалов.
▪️ Продакшн‑инференс на заводе: нейросети управляют 70% агрегатов на обогащении и принимают решения в 100 раз чаще, чем операторы. По уровню внедрения ИИ «Норникель» — мировой топ‑3 вместе с Tata Steel и POSCO.
▪️ ML для материаловедения. Модели применяются для подбора замещений: палладий вместо платины и иридия (первые 500 кг уже ушли в Китай на стекловолокно). Следующий шаг — предсказание и дизайн кристаллической решётки палладия для получения металла с заданными свойствами.
▪️ Экономика: «десятки миллиардов рублей» эффекта в год, к 2030 — 50+ млрд.
▪️ Уровень внедрения ИИ в РФ втрое ниже среднемирового, Россия претендует на третье место после США и Китая. Потанин против жёсткой регуляторики: модели обновляются раз в 2–3 месяца, бюрократия убьёт темп.
1👍96❤52🤣40👏17🤔8🥱6🤗4🤷♀2💅2🗿2🙊2
Команда EvoMap, разрабатывающая эволюционный движок для ИИ-агентов Evolver, опубликовала детальное техническое сравнение, в котором обвинила проект Hermes Agent от Nous Research в систематическом заимствовании архитектурных решений без указания источника.
Разрыв в популярности между проектами значителен: 88 тысяч звёзд на GitHub у Hermes Agent против 2 тысяч у Evolver.
В списке перечислены более 10 совпадений на уровне модулей: трёхуровневая система памяти с идентичным распределением ролей между слоями, замкнутый цикл автоматического извлечения переиспользуемого опыта, механизм периодической рефлексии, динамическое обнаружение и подгрузка навыков, десятишаговая оркестрация эволюционного цикла и ряд инженерных паттернов.
Хронология, на которую опирается EvoMap: ключевой протокол GEP был раскрыт с 1 по 16 февраля в 136 релизах, а система навыков Hermes появилась лишь 12 марта.
Аргументация EvoMap строится на вероятностной логике: каждое совпадение по отдельности объяснимо независимой конвергенцией - трёхуровневая память и извлечение опыта активно обсуждаются в сообществе ИИ-агентов, но их совокупность, по мнению авторов, выходит за рамки случайности.
При этом EvoMap признает:
Основатель Nous Research в ответ на претензии написал, что никогда не слышал ни о проекте, ни о его авторах, назвал сравнительный анализ «полной чушью», а позднее посоветовал EvoMap удалить свой аккаунт. На технические аргументы Nous Research не отвечала.
Вслед за этим EvoMap выпустила открытое письмо, объявив о смене лицензии Evolver с MIT на GPL-3.0 и переходе к выпуску ключевых модулей в обфусцированном виде. Команда также признаёт, что судебное разбирательство с Nous Research ей не по силам.
Главный тезис письма выходит за рамки конкретного спора: способен ли институт открытых лицензий работать, когда ИИ сводит стоимость воспроизведения кодовой логики почти к нулю?
При этом позиция EvoMap упирается в тупик: GPL-3.0 обязывает раскрывать код производных продуктов, но без текстуального пересечения полезность лицензии не срабатывают. Обфускация же блокирует вклад сообщества и противоречит самому принципу открытого кода.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤔111🤬27❤20🤷♂17👀17👍9😐6🤣4🔥1👏1
Media is too big
VIEW IN TELEGRAM
🚀 Anthropic запустила Claude Design - отдельный продукт, который заточен на генерацию готовых макетов, прототипов, слайдов и сайтом.
Под капотом Claude Opus 4.7, их самая сильная модель с пониманием визуала.
Главная фишка не в генерации картинок, а в том, что Claude читает твою кодовую базу и дизайн-файлы, вытаскивает оттуда дизайн-систему продукта и дальше сам держит всё в рамках бренда. Никакого ручного объяснения, какие у вас шрифты, цвета и отступы.
Пока это research preview на планах Pro, Max, Team и Enterprise, раскатка идёт в течение дня.
Попробовать: claude.ai/design
@ai_machinelearning_big_data
#claude #Anthropic
Под капотом Claude Opus 4.7, их самая сильная модель с пониманием визуала.
Главная фишка не в генерации картинок, а в том, что Claude читает твою кодовую базу и дизайн-файлы, вытаскивает оттуда дизайн-систему продукта и дальше сам держит всё в рамках бренда. Никакого ручного объяснения, какие у вас шрифты, цвета и отступы.
Пока это research preview на планах Pro, Max, Team и Enterprise, раскатка идёт в течение дня.
Попробовать: claude.ai/design
@ai_machinelearning_big_data
#claude #Anthropic
❤75🔥45🎉34👍7👏5🗿3🤬2👌1
Media is too big
VIEW IN TELEGRAM
Китайский ИИ-стартап, до сих пор существовавший на деньги хедж-фонда High-Flyer, впервые ведёт переговоры о внешнем финансировании. DeepSeek рассчитывает привлечь минимум $300 млн, что выведет ее оценку за пределы $10 млрд. Раньше компания отказывала китайским VC, но теперь деньги нужны для закупки вычислений - обучение моделей дорожает быстрее, чем High-Flyer может финансировать.
Параллельно стартап теряет инженеров. Один из авторов архитектуры V3 ушёл возглавить ИИ-направление в Xiaomi, исследователя Го Дая переманила ByteDance.
С инфраструктурой тоже напряжённо. В апреле 2026 DeepSeek пережил 7-часовой сбой, который затронул 355 млн пользователей. Чтобы снизить зависимость от сторонних облаков, компания планирует строить собственный дата-центр во Внутренней Монголии.
theinformation.com
GPT-Rosalind, названная в честь биофизика Розалинд Франклин, создана для ускорения разработки лекарств на ранних этапах поиска, улучшения выбора биологических мишеней и планирования экспериментов.
Модель уже показала лучший результат на биологических бенчмарках BixBench и в закрытых тестах по прогнозированию функций РНК-последовательностей, где модель превзошла 95% исторических результатов экспертов-людей.
Вместе с релизом OpenAI выложила на GitHub плагин Codex Life Sciences Research. Инструмент предоставляет доступ к более чем 50 базам данных и биологическим утилитам, причем его можно использовать в связке с любыми моделями общего назначения. Модель доступна в режиме preview участникам Trusted Access Program - корпоративным клиентам в США.
openai.com
Anthropic устранила ошибку, из-за которой 5-часовые и недельные квоты в Opus 4.7 списывались быстрее, чем должны, особенно при длинных промптах. Баг существовал ещё в Opus 4.6, но в новой модели стал заметнее: Opus 4.7 перешёл на новый токенизатор, который тратит до 1,35× токенов на тот же текст. Вкупе с ошибкой биллинга лимиты сгорали почти мгновенно.
В качестве компенсации Anthropic обнулила счётчики использования всем подписчикам. Но обрадовало это не всех. Недельная квота считается по индивидуальному 7-дневному окну, поэтому сброс был выгоден только тем, кто уже упёрся в потолок. Разработчики, которые берегли токены на сложные задачи к концу недели, из-за компенсации лишились накопленного запаса.
ClaudeDevs в сети Х
Google Research опубликовал в TMLR работу о фреймворке для генерации синтетических датасетов, который проектирует датасет целиком, с независимым управлением охватом, сложностью и качеством, а не наращивает примеры по одному.
Simula работает без seed-данных: ризонинг-модель сама разворачивает домен в иерархическую таксономию, из каждого узла генерирует разные формулировки сценария. Часть промптов дополнительно усложняется, а корректность ответов проверяют 2 независимых критика, чтобы снизить сикофантию.
Внутри Google Simula уже используется для обучения ShieldGemma, FunctionGemma, MedGemma, классификаторов Gemini, а также фильтров мошеннических звонков и спама в Android.
research.google
Об отставке объявили Билл Пиблз и Кевин Вейл. Пиблз руководил созданием видеомодели Sora: он стоял у истоков проекта, когда команда состояла всего из двух человек, и принимал непосредственное участие в развитии продукта вплоть до релиза Sora 2.
Кевин Вейл, ранее занимавший пост директора по продукту, в октябре 2025 года перешел в исследовательский блок, где с нуля запустил направление OpenAI for Science. Из-за его ухода профильный научный отдел решено расформировать, а инженеров и исследователей распределят по другим командам.
В своем прощальном письме Вейл понадеялся, что ускорение научных открытий станет одним из главных и самых позитивных результатов на пути человечества к созданию AGI.
Kevin Weil и Bill Peebles в сети Х
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍69❤33🤔22🔥6👏6💔4🎉2🐳1
This media is not supported in your browser
VIEW IN TELEGRAM
😁215🤔38👍20🤣15👏9❤8🔥7🥱4😐1
Издание The Nation опубликовало материал о связи между сокращением государственного финансирования науки в США и быстрым ростом индустрии, где исследователи с докторскими степенями выполняют задачи для обучения ИИ-моделей за почасовую плату.
По данным Американской ассоциации содействия развитию науки, предложенный бюджет на 2026 финансовый год предусматривал сокращение финансирования Национальных институтов здравоохранения на 40%, Национального научного фонда - на 57%, NASA - на 24%.
Конгресс частично откатил эти меры, однако, по данным журнала Science, за последний год федеральную службу покинули более 10 тыс. сотрудников с PhD в STEM-дисциплинах.
Университетские лаборатории, как сообщает The Atlantic, увольняли сотрудников и сворачивали исследования.
The Nation связывают эту политику с венчурными инвесторами, близкими к Белому дому, прежде всего с Питером Тилем и Марком Андриссеном.
В утечке переписки, опубликованной The Washington Post в 2025 году, Андриссен призвал подвергнуть Национальный научный фонд «бюрократической смертной казни».
Сами Тиль и Андриссен публично обосновывают свою позицию тем, что академическая наука, по их мнению, стала забюрократизированной и утратила продуктивность.
Тиль в интервью Hoover Institution утверждал, что число PhD за столетие выросло в 100 раз, тогда как темп научного прогресса почти не изменился
Одновременно растёт рынок платформ, нанимающих учёных для подготовки данных и проверки ответов ИИ-моделей.
По словам всех опрошенных изданием исследователей, именно урезание федерального финансирования сделало для них почти недоступными позиции в академии: закрывались постдокторские ставки, исчезали летние стипендии, сворачивались гранты.
Обучение ИИ-моделей, в свою очередь, требует специалистов, способных составлять сложные задачи и проверять ответы на уровне эксперта с докторской степенью - и освободившийся в результате бюджетных сокращений пул кандидатов оказался удобным ресурсом для ИИ-платформ.
Реклама занятости в этих сервисов во многом повторяет приёмы Uber и Lyft: упор на гибкость, удалённый режим и «свободу»: в роликах учёные гуляют по лесу, читают в гамаках, а закадровый голос объясняет, что подработка позволяет «оставаться в профессии».
В реальности, опрошенные The Nation исследователи высказывают претензии к условиям работы у техно-гигантов. Объявленные ставки (от 30 до 90 долларов в час) на практике часто оказываются ниже из-за неоплачиваемого времени, лимитов на сложные задачи и отказа оплачивать неполные или неверные решения.
@ai_machinelearning_big_data
Please open Telegram to view this post
VIEW IN TELEGRAM
❤67🤔45😢25💔13👍12🤬6🔥5🤣3🥰2😁1
Вышло крупное обновление Agents SDK и главное изменение в том, что агенты теперь могут читать и записывать файлы, устанавливать зависимости, запускать код и обращаться к внешним инструментам, а не ограничиваться диалогом с пользователем.
В обновлённый исполнительный каркас добавлены настраиваемая память, оркестрация с учётом песочниц и встроенные инструменты работы с файловой системой. Эти возможности ранее были характерны для Codex.
Помимо этого, SDK поддерживает вызов инструментов через MCP, пользовательские инструкции AGENTS.md и прогрессивные объявления возможностей Skills.
Из коробки SDK работает с 7 провайдерами песочниц: Blaxel, Cloudflare, Daytona, E2B, Modal, Runloop и Vercel. Есть возможность подключить и собственную инфраструктуру.
Новая абстракция Manifest описывает рабочее пространство агента единообразно - позволяет монтировать локальные файлы, задавать каталоги вывода и подключаться к облачным хранилищам AWS S3, Google Cloud Storage, Azure Blob Storage и Cloudflare R2.
По заявлению компании, одна и та же конфигурация работает и при локальной разработке, и при развёртывании в рабочей среде.
Архитектурно SDK отделяет логику управления агентом от среды, в которой выполняется его код, в результате чего:
Обновление доступно всем пользователям API и тарифицируется по стандартной схеме - за токены и вызовы инструментов.
Пока поддерживается только Python. Выпуск TypeScript-версии, по словам OpenAI, запланирован на более поздний срок.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍44❤21🔥8🎉6🤩4💯4🥰2😍2❤🔥2🤣1
Платформа открыла ранний доступ к 2 вариантам деплоя:
Обе версии работают с более чем 30 языками. Инференс и обработка аудио будут выполнятся целиком внутри инфраструктуры клиента.
Лицензионная валидация и телеметрия опциональны вплоть до полностью изолированных контуров.
Обещают доступность тонкой настройки под конкретные языки и диалекты. Обновления в этих вариантах развертывания будут поставляться по контролируемому графику.
Пока открыта запись в лист ожидания, срок запуска - без даты, но указано что в первой половине 2026 года.
Тарификация индивидуальная: лицензия плюс оплата по использование.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤38👍19🔥11🫡2😁1🤔1👀1
Gemini Robotics-ER 1.6 - обновлённая модель воплощенного ризонинга, которая отвечает за пространственное понимание, планирование задач и детекцию успеха робота, но сама не управляет приводами.
За моторные команды по-прежнему отвечает отдельная VLA-модель Gemini Robotics 1.5.
ER-версия лишь подсказывает ей, что и в каком порядке делать, и при необходимости вызывает внешние инструменты (от поиска Google Search пользовательских функций.
Совместно с Boston Dynamics в DeepMind научили модель интерпретировать аналоговые манометры, уровнемеры, смотровые стёкла и цифровые табло.
Задача нетривиальная: нужно распознать стрелки, риски, единицы измерения и корректно сложить разряды, а для смотровых стёкол - оценить уровень жидкости с поправкой на перспективу камеры.
Сценарий заточен под обходы промышленных объектов, которыми занимается робот Spot.
Точность достигается за счёт связки визуального ризонинга и исполнения кода.
Модель сначала зумит целевой участок снимка, затем расставляет точки по ключевым элементам шкалы и через код считает пропорции и интервалы.
На задаче чтения приборов Gemini Robotics-ER 1.6 с показывает 93%, без ризонинга - 86%.
По безопасности DeepMind заявляет лучший результат в линейке: модель стабильнее соблюдает физические ограничения и точнее распознаёт травмоопасные ситуации (+6% на текстовых сценариях и +10% на видео по сравнению с Gemini 3.0 Flash).
Gemini Robotics-ER 1.6 доступна через Gemini API и Google AI Studio. Deepmind также собрал Colab с примерами промптов для типовых задач воплощенного ризонинга.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥77❤11👍10❤🔥2🆒2