Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
Это инструмент, который сканирует архитектуру проекта и выстраивает индивидуальную модель угроз. Опираясь на эту карту, агент целенаправленно ищет слабые места в безопасности приложения.
Фирменная фича - защита от ложных срабатываний за счет практической проверки найденных багов. Обнаружив проблему, агент разворачивает изолированную копию системы в песочнице и пытается самостоятельно провести реальный взлом. Если попытка оказалась успешной и угроза подтверждена, ИИ сам пишет патч. Затем система тестирует обновление, чтобы убедиться, что внесенные исправления не сломают другие функции продукта.
Доступ к превью-версии инструмента получат пользователи тарифов ChatGPT Enterprise, Business и Edu в ближайшие дни.
openai.com
Министерство торговли США подготовило новые правила продажи чипов для ЦОД. Теперь государствам, чьи компании закупают большие объемы продукции Nvidia и AMD, придется встречно инвестировать в американскую ИИ-инфраструктуру.
Проект вводит многоуровневую систему выдачи экспортных лицензий. Строгость требований напрямую зависит от суммарной вычислительной мощности запрашиваемых компонентов. Для одобрения крупных сделок высшего уровня страны-покупатели будут обязаны проводить прямые финансовые вливания в технологический сектор США.
Этот подход формализует практику, которая уже была успешно обкатана на недавних соглашениях с ОАЭ и Саудовской Аравией. На поставки оборудования в Китай, эти правила не повлияют - они по-прежнему регламентируются отдельными санкциями.
ft.com
Новый инструмент от создателей ИИ-редактора кода избавляет разработчиков от необходимости каждый раз вручную писать промпты. Теперь ИИ-помощник может включаться в работу фоном, самостоятельно реагируя на внешние события.
Триггерами служат действия в Git, сообщения в Slack, новые тикеты в Linear или инциденты в PagerDuty. Платформа также поддерживает настройку кастомных вебхуков и запуск задач по расписанию. Обновленные агенты способны брать на себя полноценные инженерные процессы: проанализировать логи через протокол MCP, локализовать ошибку и сразу подготовить пулл-реквест с готовым исправлением.
Важная деталь - у агентов появилась память. Они запоминают результаты прошлых запусков, постепенно адаптируясь к контексту проекта и избегая повторения старых ошибок.
cursor.com
Японский конгломерат ведет переговоры о привлечении крупнейшего в своей истории долларового займа. Ожидается, что кредит на 40 млрд. сроком на год будет обеспечен четырьмя банками.
Главная цель сделки - финансирование ставки основателя SoftBank Масаёси Сона на ИИ. Банк уже вложил в OpenAI более 30 млрд. долларов, получив около 11% акций стартапа. Чтобы обеспечить эти инвестиции, холдингу пришлось частично распродать другие свои активы.
Агрессивные заимствования усиливают опасения аналитиков по поводу раздувания ИИ-пузыря. Суммарный долг ключевых партнеров OpenAI уже достиг 96 млрд. долларов, а ведущая пятерка ИТ-корпораций набрала новых кредитов на 121 млрд., это в 4 раза выше привычной нормы. При этом монетизация буксует - платные подписки на ИИ-сервисы пока оформили лишь 3% пользователей.
bloomberg.com
Об этом достижении сообщил Майк Кригер, возглавляющий подразделение экспериментальных ИИ-разработок. Столь стремительный рост аудитории обусловлен несколькими факторами. Помимо глобального тренда на ИИ, Anthropic извлекла серьезную выгоду из недавнего скандала вокруг сотрудничества OpenAI с Пентагоном.
На фоне этих событий в глазах потребителей и технологического сообщества создатели Claude выглядят более последовательными в вопросах этики. Статус «морального победителя» обеспечивает компании сильное репутационное преимущество и стимулирует массовый приток пользователей.
Mike Krieger в сети Х
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3🔥3
Forwarded from Machinelearning
Флагман. Триллион параметров суммарно, 42 млрд. активных при инференсе, архитектура MoE с гибридным вниманием и контекстным окном в 1 миллион токенов. До официального анонса модель тестировалась на OpenRouter под именем Hunter Alpha.
Реальная агентская эффективность на GDPval-AA: Elo 1434 (лучший результат среди китайских моделей).
Цена API: $1 вход / $3 выход за млн. токенов при контексте 256K и $2 вход / $6 выход для контекста 256К-1М.
Принимает текст, изображения, видео и аудио через единую базу с отдельными энкодерами для каждой модальности. Параметры не раскрыты. Модель поддерживает непрерывную обработку аудио длиной свыше 10 часов в одном запросе.
Цена: $0,40 вход / $2,00 выход.
На демонстрации модель прошла цикл онлайн-покупки автономно: нашла отзывы на Xiaohongshu, сравнила продавцов на JD.com, поторговалась с поддержкой, оформила заказ.
Второе демо: получила одно текстовое задание, сняла 15-секундный ролик из 4 сцен, синтезировала звук, исправила ошибку рендеринга шрифта, загрузила на TikTok и опубликовала.
Модель обучена на сотнях миллионов часов аудио, и допилена через многомерный RL. Синтезирует речь с управлением эмоциями на уровне отдельных предложений, поёт с сохранением высоты и ритма, воспроизводит китайские диалекты: сычуаньский, хэнаньский, кантонский, тайваньский. Поддержка других языков не заявлена.
Форматные маркеры в тексте: пунктуацию, частицы и выделение сама переводит в просодику без дополнительной разметки.
Доступ на ограниченный период - бесплатно. Сроки предложения не указаны.
Кстати, команду MiMo возглавляет Ло Фули, один из ключевых авторов DeepSeek R1.
Все модели релиза доступны через API на platform.xiaomimimo.com и в MiMo Studio.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍4🔥3
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
Спустя всего 6 месяцев после релиза, OpenAI приняла решение закрыть сервис, который стал вирусным почти сразу: после запуска в конце сентября он набрал миллион скачиваний менее чем за 5 дней.
Несмотря на популярность, поддержка проекта оказалась слишком дорогой. Сейчас компания активно урезает издержки, чтобы подготовить финансовую базу для выхода на биржу.
В ближайшее время компания обещает опубликовать точные сроки отключения приложения и API, а также выпустить инструкции, которые помогут безопасно выгрузить и сохранить созданный контент.
SoraOfficialApp в сети Х
В Claude Cowork и Claude Code появилась функция прямого контроля десктопа. Теперь Claude может перехватывать управление: перемещать курсор, кликать по интерфейсу, набирать текст и запускать инструменты разработчика напрямую.
Новая возможность раскрывается в связке с свежей функцией Dispatch. Например, можно отправить задачу со смартфона, находясь в пути, а запущенный десктопный клиент Claude на компьютере самостоятельно протестирует код, внесет изменения в IDE и подготовит PR.
Новая функция в стадии Research Preview и доступна подписчикам тарифов Pro и Max. На данный момент поддерживается исключительно macOS.
claude.com
На конференции RSA 2026 Google выкатила обновление инструментов кибербезопасности. В платформу Security Operations добавили агентов на базе Gemini: они умеют сами копаться в инцидентах, собирать цифровые улики и выносить вердикт с подробным разбором полетов.
Этих же агентов прикрутили к системе Google Threat Intelligence - теперь они мониторят даркнет. Корпорация заявляет, что алгоритм переваривает миллионы событий ежедневно с точностью 98% и подсвечивает только те риски, которые касаются конкретной компании.
Параллельно Google подтвердила покупку компании Wiz. Ее технологии будут применятся для создания единой системы защиты мультиоблачных инфраструктур.
cloud.google.com
Инструмент построен на базе моделей Molmo 2 с 4В и 8В параметров. Он смотрит на веб глазами пользователя: анализирует скриншот страницы и сам решает, куда кликнуть, что написать, где проскроллить или открыть новую вкладку.
Создатели не стали приукрашивать реальность: агент может тупить при чтении текста, ломается после случайного клика не туда и теряется от нечетких инструкций. Заодно ради безопасности его специально отрезали от работы с паролями и деньгами.
MolmoWeb установил новый SOTA среди открытых решений в 4 бенчмарках для веб-агентов, обошел визуальных агентов на базе GPT-4o и превзошел OpenAI CUA в 3 тестах из 4.
Проект полностью открыт: веса, код и датасет MolmoWebMix доступны по лицензии Apache 2.0.
allenai.org
Бретт Адкок официально представил свой новый проект - ИИ-лабораторию Hark. Компания находилась в скрытом режиме 8 месяцев, собирая сильную команду инженеров в области программного и аппаратного обеспечения.
Адкок считает, что LLM-чатботы слишком примитивны. По его видению, настоящий AGI должен обладать долговременной памятью, глубокой персонализацией и способностью взаимодействовать с физическим миром. Hark будет создавать именно такой персональный интеллект. Система будет перенимать образ мышления пользователя, чтобы забирать на себя когнитивную нагрузку и действовать на опережение.
Несмотря на амбициозные цели, конкретных продуктов Hark пока не показал. На данный момент опубликован только концептуальный манифест и открыт список ожидания.
Brett Adcock в сети Х
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤3👍2
🧭 LLMRouter - умная маршрутизация запросов между LLM
UIUC (ULab) выложили LLMRouter - проект про то, что скоро станет стандартом в AI-продуктах:
не выбирать “одну лучшую модель”,
а маршрутизировать запросы между несколькими LLM так, чтобы было:
- дешевле
- быстрее
- точнее
Идея простая:
разные модели сильны в разном.
Одна лучше пишет код, другая - рассуждает, третья - дешёвая для рутины.
Но большинство продуктов до сих пор делают тупо:
“все запросы → одна LLM”.
LLMRouter делает наоборот:
- анализирует входной запрос
- оценивает сложность / тип задачи
- выбирает подходящую модель
- может учитывать цену, latency, качество, политики
В итоге:
✅ обычные вопросы идут в дешёвую модель
✅ сложные reasoning-задачи - в сильную
✅ код/инструменты - в специализированную
✅ и всё это автоматически
Почему это важно:
как только у тебя 3-5 моделей (OpenAI/Anthropic/Gemini/open-source),
маршрутизация превращается в экономию десятков тысяч долларов в месяц.
Короче: это “load balancer” для LLM, но с мозгами.
GitHub: https://github.com/ulab-uiuc/LLMRouter
#LLM #AI #Routing #Agents #MLOps
UIUC (ULab) выложили LLMRouter - проект про то, что скоро станет стандартом в AI-продуктах:
не выбирать “одну лучшую модель”,
а маршрутизировать запросы между несколькими LLM так, чтобы было:
- дешевле
- быстрее
- точнее
Идея простая:
разные модели сильны в разном.
Одна лучше пишет код, другая - рассуждает, третья - дешёвая для рутины.
Но большинство продуктов до сих пор делают тупо:
“все запросы → одна LLM”.
LLMRouter делает наоборот:
- анализирует входной запрос
- оценивает сложность / тип задачи
- выбирает подходящую модель
- может учитывать цену, latency, качество, политики
В итоге:
✅ обычные вопросы идут в дешёвую модель
✅ сложные reasoning-задачи - в сильную
✅ код/инструменты - в специализированную
✅ и всё это автоматически
Почему это важно:
как только у тебя 3-5 моделей (OpenAI/Anthropic/Gemini/open-source),
маршрутизация превращается в экономию десятков тысяч долларов в месяц.
Короче: это “load balancer” для LLM, но с мозгами.
GitHub: https://github.com/ulab-uiuc/LLMRouter
#LLM #AI #Routing #Agents #MLOps
❤5👍3🤬2🔥1
Forwarded from Machinelearning
Компания представила 2 новых автономных агента в Gemini API - Deep Research и Deep Research Max. Оба построены на Gemini 3.1 Pro и доступны через Interactions API.
Главное изменение по сравнению с декабрьским превью - поддержка MCP: теперь агент умеет выходить за пределы открытого веба и работать с закрытыми корпоративными источниками данных.
Типичный сценарий: асинхронные фоновые процессы, например ночной cron-job, готовящий аналитикам к утру набор подробных аналитических отчётов.
По внутренним замерам Google, Max консультируется с заметно большим числом источников и точнее взвешивает противоречивые свидетельства, чем декабрьская версия. Все отчёты полностью сопровождаются ссылками (от документов SEC до открытых рецензируемых журналов).
Инструменты агента можно включать одновременно: Google Search, URL Context, Code Execution, File Search и произвольные удалённые MCP-серверы. Веб при желании отключается (тогда поиск идёт только по пользовательским данным). В качестве опорных данных принимаются PDF, CSV, изображения, аудио и видео.
Отдельное новшество - нативная генерация графиков и инфографики прямо в теле отчёта через HTML или Nano Banana, без внешних библиотек.
Для интерактивных интерфейсов предусмотрен стриминг промежуточных рассуждений и результатов в реальном времени.
Появился и режим совместного планирования: план исследования можно просмотреть и скорректировать до того, как агент начнёт его выполнять.
Deep Research и Deep Research Max доступны в режиме public preview на платных тарифах Gemini API.
В ближайшее время оба агента появятся в Google Cloud для корпоративных клиентов.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍6❤4🤔1
Forwarded from Machinelearning
Комитет по надзору Палаты представителей США направил официальное письмо Сэму Альтману с требованием раскрыть детали его личных инвестиций и финансовые связи с топ-менеджментом.
Власти подозревают, что ресурсы OpenAI могли использоваться для искусственного завышения капитализации компаний, в которых CEO имеет личную долю.
Главным поводом для расследования стала ситуация вокруг разработчика термоядерных реакторов Helion.
В 2021 году Альтман вложил в него $375 млн из собственных средств, а позже предложил OpenAI инвестировать в проект еще $500 млн. Эта сделка могла увеличить оценку Helion в шесть раз - до $35 млрд.
Согласно документам комитета, сотрудники OpenAI были настолько встревожены инициативой, что избегали ее обсуждения в корпоративном Slack из-за страха перед возможным судебным преследованием.
Расследование также выявило непубличные связи внутри руководства компании: выяснилось, что президент OpenAI Грег Брокман владеет долями в двух стартапах Альтмана и имеет процент в его семейном фонде.
Конгресс обязал OpenAI до 22 мая провести брифинг с участием главного юрисконсульта и предоставить всю внутреннюю переписку с 2015 года, касающуюся конфликтов интересов.
Отдельно законодатели запросили доступ к отчета аудиторского комитета, созданного советом директоров OpenAI после скандального увольнения и возвращения Альтмана в 2023 году.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5❤2🔥1😱1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
OpenAI добавила в macOS-клиент Codex функцию Appshots для быстрой передачи контекста активного окна ИИ-ассистенту.
По нажатию обеих клавиш Command система делает снимок экрана и извлекает исходный текст приложения через Accessibility API, включая данные за пределами области прокрутки. Это позволяет передавать логи, API-документацию и код без ручного копирования.
Для работы требуются разрешения macOS на запись экрана и универсальный доступ. Нововведение дополняет режим автономного управления интерфейсом Computer Use и доступно на всех тарифах Codex.
openai.com
FLUX Erase предназначена для удаления объектов с изображений. Модель работает по маске без текстовых промптов, достраивая фон, текстуры и тени.
Скорость генерации - 4,54 секунды на изображении 1024х1024. По оценке BFL, ближайшие аналоги тратят на ту же задачу более 12 секунд. Стоимость API-запроса составляет 3 цента мегапиксельную картинку.
В тестах на качество ретуши FLUX Erase обходит GPT Image-2 и Finegrain Eraser Standard, а по стоимости опережает Nano Banana Pro. Модель доступна только через API, попробовать FLUX Erase можно в бесплатном веб-демо.
bfl.ai
Anthropic пропатчила уязвимость в песочнице Claude Code. Баг позволял извлекать токены и исходный код разработчиков через инъекцию нулевого байта в SOCKS5.
Внутренний фильтр считал строку с нулевым символом безопасной, после чего операционная система обрезала текст по байту и подключалась к заблокированному хосту. В связке с промпт-инъекцией через анализируемые моделью файлы механизм давал возможность выполнять код и отправлять данные на сторонние серверы.
Уязвимость присутствовала в релизах до версии 2.1.89. Патч вышел в сборке 2.1.90 без упоминания в чейнджлоге и регистрации CVE. По заявлению Anthropic, разработчики обнаружили и закрыли баг внутренними силами до публикации отчета исследователей.
theregister.com
Bumblebee - утилита для поиска уязвимостей на локальных машинах под macOS и Linux. Сканер выявляет скомпрометированные зависимости, вредоносные плагины и опасные конфигурации ИИ-инструментов.
Инструмент работает исключительно в режиме чтения: анализирует метаданные и lock-файлы без запуска пакетных менеджеров. Это исключает случайное выполнение вредоносных скриптов при проверке зараженных библиотек.
Bumblebee анализирует 4 вектора: пакетные менеджеры, расширения для редакторов кода (семейство VS Code, включая Cursor и Windsurf), браузерные плагины и конфигурации ИИ-агентов на базе протокола MCP.
ИБ-команды могут интегрировать сканер в MDM-решения, загружать кастомные индикаторы компрометации и запускать проверки в трех режимах - от фонового мониторинга до глубокого расследования инцидентов.
perplexity.ai
Штат планирует выделять субсидии бизнесу, который отказывается от замены сотрудников нейросетями, и финансировать программы переобучения офисных работников.
Дополнительно правительство совместно с ИИ-индустрией рассмотрит концепцию универсального базового капитала в виде распределения среди граждан долей в фондах или акций компаний.
В администрации признают нехватку стандартных пособий по безработице и планируют пересмотреть налоговую систему. По оценке властей, сейчас она экономически поощряет внедрение алгоритмов и дестимулирует наем людей.
gov.ca.gov
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍1
PaddleOCR-VL 1.6 официально вышел
PaddlePaddle выпустили PaddleOCR-VL 1.6 - новую версию модели для распознавания документов.
Результат: 96.33% на OmniDocBench. Это новый SOTA, причём модель обошла как open-source, так и закрытые решения в распознавании текста, формул и таблиц.
Что улучшили:
- первое место на OmniDocBench v1.5 и Real5-OmniDocBench
- заметно лучше распознаёт таблицы, обычный текст и редкие символы
- улучшено распознавание печатей, отдельных фрагментов и графиков
- полная совместимость с архитектурой v1.5
- миграция не нужна - можно подключать как plug-and-play
Где это полезно:
- финансовые контракты
- юридические документы
- исследовательские отчёты
- исторические архивы
- RAG-пайплайны
- подготовка качественных данных для LLM
https://github.com/PaddlePaddle/PaddleOCR
#PaddlePaddle #PaddleOCR #AI #ComputerVision
PaddlePaddle выпустили PaddleOCR-VL 1.6 - новую версию модели для распознавания документов.
Результат: 96.33% на OmniDocBench. Это новый SOTA, причём модель обошла как open-source, так и закрытые решения в распознавании текста, формул и таблиц.
Что улучшили:
- первое место на OmniDocBench v1.5 и Real5-OmniDocBench
- заметно лучше распознаёт таблицы, обычный текст и редкие символы
- улучшено распознавание печатей, отдельных фрагментов и графиков
- полная совместимость с архитектурой v1.5
- миграция не нужна - можно подключать как plug-and-play
Где это полезно:
- финансовые контракты
- юридические документы
- исследовательские отчёты
- исторические архивы
- RAG-пайплайны
- подготовка качественных данных для LLM
https://github.com/PaddlePaddle/PaddleOCR
#PaddlePaddle #PaddleOCR #AI #ComputerVision
❤10👍3🔥2
Forwarded from Machinelearning
Проект вырос из исследований по симуляции физического мира, к которым присоединилась команда видеогенератора Sora.
На начальном этапе компания сосредоточится на разработке специализированных машин для помощи в строительстве инфраструктуры.
Конечная цель проекта - обеспечить каждого человека персональным роботом, способным выполнять любые бытовые и рабочие поручения.
В 2020 году компания закрыла предыдущие проекты в робототехнике из-за дефицита обучающих данных.
Для перезапуска направления OpenAI открыла наем инженеров по аппаратному обеспечению, системной интеграции и ML.
Возвращение связано с развитием воплощенного ИИ: взаимодействие алгоритмов с физической средой позволит собрать массивы данных, необходимых для обучения AGI.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4🔥3❤1👎1🎉1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
В ближайшие недели компания проведёт первый крупный редизайн ChatGPT с 2022 года. Сервис трансформируется из диалогового чат-бота в платформу автономных агентов.
Обновлённый интерфейс интегрирует партнёрские сервисы для самостоятельного выполнения многошаговых задач без дополнительных промптов и переключения между приложениями.
Смена курса обусловлена низкой рентабельностью чат-бота. Перед IPO OpenAI смещает фокус на B2B-сегмент и реструктуризирует продуктовые команды. Бизнес-модель переориентируется на корпоративных клиентов со стабильной монетизацией по аналогии со стратегией Anthropic.
ft.com
Anthropic наняла бывшего инженера OpenAI Клайва Чана для разработки собственных ИИ-чипов. До этого у компании не было профильного аппаратного подразделения.
В OpenAI Чан проектировал кастомный кремний и участвовал в партнёрстве с Broadcom. До этого он разрабатывал чипы для обучения ML-моделей в Tesla Autopilot, где отвечал за архитектуру дата-центров и энергоэффективные вычисления.
Найм Чана должен помочь Anthropic сформировать команду аппаратных инженеров. Переход на собственное железо планируется для снижения себестоимости вычислений и повышения маржинальности.
Clive Chan в сети Х
Google заказала у Intel производство более 3 млн TPU на 2028 год. Nvidia пока не заключила контракт, но тестирует техпроцессы Intel для будущей GPU-архитектуры Feynman. Причина переноса заказов - из-за нехватки производственных линий у TSMC.
Глава TSMC подтвердил, что индустрия не сможет покрыть спрос на ИИ-чипы в ближайшие несколько лет. Дефицит позволил Intel привлечь новых клиентов на фоне прошлых финансовых убытков и срывов дедлайнов.
Параллельно SK Hynix проверяет совместимость своей памяти с новыми технологиями упаковки Intel.
theinformation.com
Японский стартап открыл исследовательскую лабораторию рекурсивного самосовершенствования (RSI). Цель - создание сетей, которые итеративно переписывают, тестируют и оптимизируют собственный код.
Компания рассчитывает, что алгоритмическая эволюция позволит отказаться от парадигмы масштабирования вычислений.
В портфеле стартапа уже есть система LLM-Squared, где одни LLM создают алгоритмы обучения для других, и платформа AI Scientist, автоматизирующая научные исследования.
Следующий этап дорожной карты Sakana AI - разработка автономных агентов, способных улучшать свою архитектуру без участия человека.
sakana.ai
По данным неопубликованного отчета KPMG, только 26% компаний полностью контролируют свои расходы на ИИ. 50% ведут ограниченный мониторинг, а 22% узнают о затратах постфактум из выставленных счетов. Причина - неготовность финансовых отделов к токенизированному биллингу и динамическому ценообразованию.
Из-за непрогнозируемой нагрузки потребление ресурсов в отдельных проектах возрастает до 6 раз. Это приводит к исчерпанию годовых бюджетов на облачные вычисления и API за несколько месяцев. По итогам текущего квартала ожидается пересмотр расходов после получения бизнесом реальных счетов от ИИ-провайдеров.
Текущую ситуацию сравнивают с закупками облачных мощностей во время пандемии, за которыми последовало сокращение инфраструктурных бюджетов.
wsj.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍3❤1
Forwarded from Machinelearning
DeepSeek запустил Vision Mode в веб-версии и мобильном приложении. Режим поддерживает визуальный CoT для сложных задач (геометрические выводы, анализ графиков и прямую конвертацию UI-скринов в HTML).
В основе функции лежит работа Thinking with Visual Primitives, в которой авторы решили проблему восприятия MMLM при точной локализации и пространственных рассуждениях.
Координаты и граничные рамки используются как минимальные единицы мышления и встраиваются непосредственно в визуальную цепочку CoT.
Это дает модели точную пространственную ориентацию в инференсе без опоры на описания естественным языком.
Vision Mode обрабатывает только статические изображения. Поддержки аудио, видео и генерации картинок нет.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2
Forwarded from Machinelearning
DeepSeek запустил Vision Mode в веб-версии и мобильном приложении. Режим поддерживает визуальный CoT для сложных задач (геометрические выводы, анализ графиков и прямую конвертацию UI-скринов в HTML).
В основе функции лежит работа Thinking with Visual Primitives, в которой авторы решили проблему восприятия MMLM при точной локализации и пространственных рассуждениях.
Координаты и граничные рамки используются как минимальные единицы мышления и встраиваются непосредственно в визуальную цепочку CoT.
Это дает модели точную пространственную ориентацию в инференсе без опоры на описания естественным языком.
Vision Mode обрабатывает только статические изображения. Поддержки аудио, видео и генерации картинок нет.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4🔥1
Forwarded from Machinelearning
OpenRouter добавил возможность запуска мультиагентной системы Fugu Ultra, которая по словам Sakana Ai обошла Fable 5 в кодинге на бенчмарках.
Это специализированная LLM для маршрутизации и координации задач между GPT-5.5, Gemini 3.1 Pro и Claude Opus 4.8.
Fugu Ultra поддерживает окно контекста в 1 млн токенов, вызов внешних инструментов и мультимодальность. Максимальная длина генерации - 128 тысяч токенов.
Биллинг формируется из базового тарифа маршрутизатора ($5 за 1 млн токенов ввода и $30 за вывод) и суммарной стоимости задействованных моделей.
Для контроля расходов можно самостоятельно ограничивать глубину рассуждений и лимиты токенов через настройки API.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2🔥1
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
Вайбхав Шривастав, руководитель направления развития экосистемы и инфраструктуры OpenAI в Европе, на Ближнем Востоке и в Африке пояснил про градацию ризонинга в GPT-5.6 Sol.
Новая система не соответствует тому, что было в GPT-5.5 и тем, кто переходит на более высокий уровень, следует начинать на один уровень ниже, чем они привыкли.
Max и Ultra работают по-разному:
Вайбхав рекомендует начинать с низкого уровня и повышать его только при необходимости, так как более высокие уровни требуют больше времени и расходуют больше токенов.
Всё это ни разу не приближает OpenAI к цели, озвученной Грегом Брокманом на Big Technology AI Summit буквально месяц назад. Он хочет сделать ChatGPT простым настолько, насколько это возможно.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍1🔥1👏1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
Компания вновь сдвинула сроки окончания промо-периода - теперь использовать Fable 5 без дополнительных списаний можно до 19 июля. До этой же даты будет действовать бонус, который на 50% увеличивает еженедельный лимит запросов в Claude Code.
Изначально акцию планировали завершить еще 7 июля, после чего дедлайн перенесли на 12-е число, а теперь добавили еще одну неделю.
Пользователи могут тратить на генерации в Fable 5 до половины еженедельной квоты. При исчерпании лимита потребуется переключиться на другие модели или включить оплату по факту потребления. Промо-условия не распространяются на API.
claude.com
Глава OpenAI теперь уверен, что актуальное поколение моделей создает больше рабочих мест, чем сокращает, а экономические последствия от внедрения ИИ оказались менее масштабными, чем он ожидал ранее.
Параллельно компания продолжает обсуждать долгосрочные меры борьбы с возможной технологической безработицей. Среди рабочих концепций - налог на автоматизацию, создание целевых госфондов и переход на четырехдневную рабочую неделю.
Sam Altman в сети Х
Пионер RL и лауреат премии Тьюринга открыл стартап Oak Lab для разработки автономных агентов. Цель проекта - создать непрерывно обучающуюся модель на 1 трлн параметров с планированием в реальном времени и энергопотреблением 20 Вт.
Oak Lab строится на базе концепции непрерывного RL. Вместо разового трейна на статических датасетах агенты будут познавать среду в процессе работы. Система должна самостоятельно формировать внутреннюю модель мира, генерировать варианты действий и оценивать их успешность.
Саттон называет современные методы глубокого обучения неэффективными. По его оценке, генеративный ИИ справляется с имитацией, но не умеет критически оценивать свои результаты, поэтому не годится для реальных открытий.
Richard Sutton в сети X
Южная Корея запустит бесплатный национальный ИИ до конца года. Власти выделят разработчикам кластер из 512 ускорителей NVIDIA B200, а со следующего года полностью возьмет на себя расходы на инференс для граждан.
В рамках проекта AI for All государство отберет двух-трех частных провайдеров, которые должны минимум на 50% работать на базе независимых корейских моделей. Локальные разработчики пока оценивают условия проекта, участие подтвердила только Kakao, местный ИТ-лидер.
Отбор компаний завершится к середине августа. Бета-тест системы запланирован на сентябрь, релиз - до конца года.
yna.co.kr
Smart Cellular Bricks - децентрализованные физические модули для сборки самовосстанавливающихся 3D-конструкций. Каждый блок выполняет легковесную модель NCA и обменивается данными с ближайшими соседями. Массив модулей улавливает структурные паттерны без обращения к заложенным в память шаблонам.
Агрегируя локальные состояния, кластер за 3 минуты определяет свою глобальную форму (например, стола или самолета). В тестах массив из почти 200 блоков успешно классифицировал форму даже при принудительном отключении части элементов.
Если дополнительно обучить систему поиску аномалий, модули смогут вычислять недостающие сегменты и управлять регенерацией конструкции из небольшого базового кластера. Метод ляжет в основу разработки смарт-материалов и реконфигурируемой робототехники. Статья опубликована в Nature, код - на Github.
sakana.ai
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥2👍1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
Долгожданная функция поиска по истории чатов, проектам и загруженным документам доступна в боковой панели веб-интерфейса и в мобильных приложениях для iOS и Android.
Поиск поддерживает фильтры по типам контента, а клик по результату в выдаче перенаправляет пользователя на конкретное сообщение в диалоге.
Обновление разворачивается глобально. Новая возможность доступна всем пользователям ChatGPT, включая бесплатную версию.
openai.com
Компания анонсировала бесплатную платформу Claude for Teachers для преподавателей школ США. В неё вошли модели, среда Claude Code и Cowork, где ИИ сам выполняет цепочки задач. Например, учитель один раз настраивает агента, и тот каждое утро проверяет тесты или собирает сводку по успеваемости класса.
Платформа поддерживает интеграцию с сервисами Canva Education и MagicSchool, позволяя встраивать Claude в уже готовые рабочие процессы. Anthropic обещает, что данные учителей и учеников не пойдут на обучение будущих моделей.
Заодно на GitHub выложили набор навыков для агентов и запустили курс по ИИ, не привязанный к продуктам какой-то одной компании. Программа продолжает вузовскую Claude for Education. Регистрация открыта до июня 2027 года.
anthropic.com
К 25-летию сервиса Google Images компания добавила генерацию картинок по текстовому запросу в поисковые сводки. За функцию отвечает генератор на базе Nano Banana.
Домашняя страница поиска по картинкам получила редизайн с механикой в стиле Pinterest. Интерфейс переведен на динамическую галерею с адаптивной алгоритмической лентой и возможностью сохранять изображения в тематические коллекции.
Развертывание генеративных функций в AI Overviews займет несколько недель. На старте опция доступна только на английском языке в регионах, где уже поддерживается создание изображений.
blog.google
Чипмэйкер ужесточил процесс одобрения для азиатских контрагентов из списка авторизованных покупателей, чтобы перекрыть серый экспорт оборудования в Китай.
После аудита число одобренных компаний в Сингапуре, Малайзии и Японии уменьшилось более чем на 50%. В новый "белый список" не попали многие новые облачные провайдеры-арендодатели GPU.
Компания перешла от проверки документов к физическим инспекциям дата-центров. Теперь Nvidia анализирует контракты и запрашивает информацию напрямую у конечных пользователей ускорителей.
ft.com
Стэнфордская лаборатория цифровой экономики опубликовала открытое письмо "We Must Act Now" о макроэкономических последствиях внедрения ИИ. Документ подписали более 200 ученых, 16 нобелевских лауреатов и представители Google, Anthropic и OpenAI.
Авторы прогнозируют, что в ближайшие 10 лет развитие ИИ спровоцирует трансформацию экономики, сопоставимую с исторической индустриализацией. Письмо призывает формировать новые институты для компенсации потери рабочих мест.
Лидеры ИИ-компаний указывают на нехватку метрик для измерения влияния ИИ на экономику - из-за этого конкретный план действий отсутствует.
Демис Хассабис, не подписавший письмо, прогнозирует появление AGI в перспективе 5 лет и сравнивает эффект с "десятикратной индустриализацией на десятикратной скорости".
stanford.edu
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4❤1
Forwarded from C# (C Sharp) programming
This media is not supported in your browser
VIEW IN TELEGRAM
Unity представила Unity CLI - инструмент, который позволяет ИИ-агентам напрямую работать с игровыми проектами.
Агент может:
- изменять объекты и компоненты в сценах;
- искать причины ошибок;
- исправлять баги;
- запускать сборку проекта;
- проверять, действительно ли исправление сработало.
В одном из демо агент получил баг-репорт о персонаже, проваливающемся сквозь пол. Он самостоятельно нашёл отключённый коллайдер, активировал его, запустил проверку и убедился, что проблема исчезла.
Получается почти полноценный ИИ-разработчик: получил задачу, изучил проект, внёс изменения и протестировал результат — всё через терминал.
Инструмент доступен бесплатно.
Подробнее: https://unity.com/blog/meet-the-unity-cli
#unity #gamedev #ai #vibecoding
Агент может:
- изменять объекты и компоненты в сценах;
- искать причины ошибок;
- исправлять баги;
- запускать сборку проекта;
- проверять, действительно ли исправление сработало.
В одном из демо агент получил баг-репорт о персонаже, проваливающемся сквозь пол. Он самостоятельно нашёл отключённый коллайдер, активировал его, запустил проверку и убедился, что проблема исчезла.
Получается почти полноценный ИИ-разработчик: получил задачу, изучил проект, внёс изменения и протестировал результат — всё через терминал.
Инструмент доступен бесплатно.
Подробнее: https://unity.com/blog/meet-the-unity-cli
#unity #gamedev #ai #vibecoding
🔥6❤3
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
⚡️ Qwen выпустил мультимодальный tool layer для AI-агентов
Идея в том, чтобы мультимодальные возможности подключались к агенту как набор инструментов, а не были жёстко зашиты в конкретную модель.
Агент, запущенный внутри Claude Code, Codex, Qwen Code, Gemini CLI или другого harness, может сам обнаружить нужный capability, вызвать его и встроить результат в более длинный workflow.
GitHub-репозиторий при этом устроен как коллекция отдельных plugins/capabilities.
Например, базовый плагин даёт агенту инструменты вроде:
- read_image
- read_video
- visualize
- OCR
- object grounding
- segmentation
- speech transcription
- cropping
То есть вместо схемы:
агент → одна мультимодальная модель
получается:
агент → набор специализированных multimodal tools → цепочка действий
Например, агент может:
1. прочитать изображение;
2. найти нужный объект;
3. вырезать конкретную область;
4. прогнать OCR;
5. сопоставить результат с видео;
6. транскрибировать аудио;
7. собрать всё в единый ответ.
https://github.com/QwenLM/Qwen-MM-Plugins
#AI #Qwen #Agents #Multimodal #ClaudeCode #Codex
Идея в том, чтобы мультимодальные возможности подключались к агенту как набор инструментов, а не были жёстко зашиты в конкретную модель.
Агент, запущенный внутри Claude Code, Codex, Qwen Code, Gemini CLI или другого harness, может сам обнаружить нужный capability, вызвать его и встроить результат в более длинный workflow.
GitHub-репозиторий при этом устроен как коллекция отдельных plugins/capabilities.
Например, базовый плагин даёт агенту инструменты вроде:
- read_image
- read_video
- visualize
- OCR
- object grounding
- segmentation
- speech transcription
- cropping
То есть вместо схемы:
агент → одна мультимодальная модель
получается:
агент → набор специализированных multimodal tools → цепочка действий
Например, агент может:
1. прочитать изображение;
2. найти нужный объект;
3. вырезать конкретную область;
4. прогнать OCR;
5. сопоставить результат с видео;
6. транскрибировать аудио;
7. собрать всё в единый ответ.
https://github.com/QwenLM/Qwen-MM-Plugins
#AI #Qwen #Agents #Multimodal #ClaudeCode #Codex
❤6👍1
⚡️ MatrAIx — инфраструктура, где вместо небольших фокус-групп можно запускать миллиарды виртуальных пользователей с разными характерами, привычками и предпочтениями.
Внутри:
- 8,3 млрд persona-профилей;
- 1 290 характеристик на пользователя;
- 1 010 задач в 25+ сферах — от софта и e-commerce до финансов и медицины;
- 4 среды: опросы, чат-боты, веб и приложения;
- около 1 млн отфильтрованных персон открыты для исследований.
-
Авторы провели 18 189 испытаний, а персон управляли GPT-5.5, Claude Opus 4.8 и Claude Haiku 4.5. В проверках поведение персон соответствовало заданным характеристикам в 91,5% случаев.
Идея мощная: перед запуском продукта можно спросить не 100 тестировщиков, а миллионы виртуальных пользователей — как они отреагируют на цену, задержку, плохой ответ ассистента или новый интерфейс.
По сути, это шаг к масштабным цифровым симуляциям человеческого поведения.
Paper:
https://huggingface.co/papers/2608.04205
#AI #AIAgents #LLM #Research #Simulation
Внутри:
- 8,3 млрд persona-профилей;
- 1 290 характеристик на пользователя;
- 1 010 задач в 25+ сферах — от софта и e-commerce до финансов и медицины;
- 4 среды: опросы, чат-боты, веб и приложения;
- около 1 млн отфильтрованных персон открыты для исследований.
-
Авторы провели 18 189 испытаний, а персон управляли GPT-5.5, Claude Opus 4.8 и Claude Haiku 4.5. В проверках поведение персон соответствовало заданным характеристикам в 91,5% случаев.
Идея мощная: перед запуском продукта можно спросить не 100 тестировщиков, а миллионы виртуальных пользователей — как они отреагируют на цену, задержку, плохой ответ ассистента или новый интерфейс.
По сути, это шаг к масштабным цифровым симуляциям человеческого поведения.
Paper:
https://huggingface.co/papers/2608.04205
#AI #AIAgents #LLM #Research #Simulation
🔥7❤1👍1
Forwarded from Machinelearning
4 сентября Народный банк Китая выпустит набор золотых и серебряных памятных монет серии «Научно-технологические инновации будущего (Искусственный интеллект)».
В наборе три монеты - одна золотая и две серебряные, обе имеют статус законного платежного средства.
Золотая весит 5 граммов, квадратная, со стороной 18 миллиметров. На реверсе изображены чипы, схема в форме мозга и нули с единицами.
Серебряные - по 15 граммов, на них лица, микросхемы, спиральные узоры, ключи и символы ИИ.
Номинал золотой монеты - 80 юаней
Чеканят набор два государственных монетных двора - Шанхайский и шэньчжэньский Guobao. Купить монеты можно будет в том числе онлайн.
Кстати, когда в марте собирали эскизы для этих монет, организаторы разрешили дизайнерам пользоваться ИИ как вспомогательным инструментом, но запретили сдавать откровенный нейрослоп.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5❤4