Вышло крупное обновление Agents SDK и главное изменение в том, что агенты теперь могут читать и записывать файлы, устанавливать зависимости, запускать код и обращаться к внешним инструментам, а не ограничиваться диалогом с пользователем.
В обновлённый исполнительный каркас добавлены настраиваемая память, оркестрация с учётом песочниц и встроенные инструменты работы с файловой системой. Эти возможности ранее были характерны для Codex.
Помимо этого, SDK поддерживает вызов инструментов через MCP, пользовательские инструкции AGENTS.md и прогрессивные объявления возможностей Skills.
Из коробки SDK работает с 7 провайдерами песочниц: Blaxel, Cloudflare, Daytona, E2B, Modal, Runloop и Vercel. Есть возможность подключить и собственную инфраструктуру.
Новая абстракция Manifest описывает рабочее пространство агента единообразно - позволяет монтировать локальные файлы, задавать каталоги вывода и подключаться к облачным хранилищам AWS S3, Google Cloud Storage, Azure Blob Storage и Cloudflare R2.
По заявлению компании, одна и та же конфигурация работает и при локальной разработке, и при развёртывании в рабочей среде.
Архитектурно SDK отделяет логику управления агентом от среды, в которой выполняется его код, в результате чего:
Обновление доступно всем пользователям API и тарифицируется по стандартной схеме - за токены и вызовы инструментов.
Пока поддерживается только Python. Выпуск TypeScript-версии, по словам OpenAI, запланирован на более поздний срок.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍44❤21🔥8🎉6🤩4💯4🥰2😍2❤🔥2🤣1
Платформа открыла ранний доступ к 2 вариантам деплоя:
Обе версии работают с более чем 30 языками. Инференс и обработка аудио будут выполнятся целиком внутри инфраструктуры клиента.
Лицензионная валидация и телеметрия опциональны вплоть до полностью изолированных контуров.
Обещают доступность тонкой настройки под конкретные языки и диалекты. Обновления в этих вариантах развертывания будут поставляться по контролируемому графику.
Пока открыта запись в лист ожидания, срок запуска - без даты, но указано что в первой половине 2026 года.
Тарификация индивидуальная: лицензия плюс оплата по использование.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤38👍19🔥11🫡2😁1🤔1👀1
Gemini Robotics-ER 1.6 - обновлённая модель воплощенного ризонинга, которая отвечает за пространственное понимание, планирование задач и детекцию успеха робота, но сама не управляет приводами.
За моторные команды по-прежнему отвечает отдельная VLA-модель Gemini Robotics 1.5.
ER-версия лишь подсказывает ей, что и в каком порядке делать, и при необходимости вызывает внешние инструменты (от поиска Google Search пользовательских функций.
Совместно с Boston Dynamics в DeepMind научили модель интерпретировать аналоговые манометры, уровнемеры, смотровые стёкла и цифровые табло.
Задача нетривиальная: нужно распознать стрелки, риски, единицы измерения и корректно сложить разряды, а для смотровых стёкол - оценить уровень жидкости с поправкой на перспективу камеры.
Сценарий заточен под обходы промышленных объектов, которыми занимается робот Spot.
Точность достигается за счёт связки визуального ризонинга и исполнения кода.
Модель сначала зумит целевой участок снимка, затем расставляет точки по ключевым элементам шкалы и через код считает пропорции и интервалы.
На задаче чтения приборов Gemini Robotics-ER 1.6 с показывает 93%, без ризонинга - 86%.
По безопасности DeepMind заявляет лучший результат в линейке: модель стабильнее соблюдает физические ограничения и точнее распознаёт травмоопасные ситуации (+6% на текстовых сценариях и +10% на видео по сравнению с Gemini 3.0 Flash).
Gemini Robotics-ER 1.6 доступна через Gemini API и Google AI Studio. Deepmind также собрал Colab с примерами промптов для типовых задач воплощенного ризонинга.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥77❤11👍10❤🔥2🆒2
Forwarded from Анализ данных (Data analysis)
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Андрей Карпаты высказал про дизайн ИИ-моделей мысль, которую большинство упускает из виду.
Его тезис: передовые модели не потому огромные, что технология сложная, а потому что данные для обучения мусорные.
Когда обычный человек думает про интернет, ему в голову приходят статьи Wall Street Journal, Википедия, серьёзные тексты.
Так вот, датасет для предобучения выглядит иначе. Если открыть случайные документы из реального корпуса, то там будут тикеры акций, битый HTML, спам и бессвязный текст.
По одной из оценок, Llama 3 сжимает информацию со скоростью всего 0.07 бита на токен. То есть модель помнит большую часть обучающих данных смутно.
Поэтому мы и строим модели на триллион параметров не потому, что нам нужен мозг такого размера, а потому что нужен движок сжатия такого масштаба, чтобы выжать хоть какой-то интеллект из потока шума. Большая часть параметров работает памятью, а не мышлением.
Предложение Карпаты - разделить эти две функции. Построить когнитивное ядро - модель, в которой остались только алгоритмы рассуждения и решения задач, без энциклопедического заучивания.
А рядом поставить внешнюю память, к которой модель обращается за фактами.
По его прогнозу, когнитивное ядро, обученное на качественных данных, способно выйти на настоящий интеллект при размере около миллиарда параметров. Для сравнения: флагманские модели сегодня крутятся в диапазоне от 200 миллиардов до 1.8 триллиона параметров, и большая часть этого веса уходит на запоминание интернет-помойки.
GPT-4o работает примерно на 200 миллиардах параметров и обходит оригинальный GPT-4 на 1.8 триллиона. Стоимость инференса на уровне GPT-3.5 с 2022 по 2024 упала в 280 раз, и почти весь этот выигрыш дали модели меньшего размера, обученные на более чистых данных с более продуманной архитектурой.
Настоящим узким местом ИИ сейчас является качество данных.
@data_analysis_ml
Его тезис: передовые модели не потому огромные, что технология сложная, а потому что данные для обучения мусорные.
Когда обычный человек думает про интернет, ему в голову приходят статьи Wall Street Journal, Википедия, серьёзные тексты.
Так вот, датасет для предобучения выглядит иначе. Если открыть случайные документы из реального корпуса, то там будут тикеры акций, битый HTML, спам и бессвязный текст.
По одной из оценок, Llama 3 сжимает информацию со скоростью всего 0.07 бита на токен. То есть модель помнит большую часть обучающих данных смутно.
Поэтому мы и строим модели на триллион параметров не потому, что нам нужен мозг такого размера, а потому что нужен движок сжатия такого масштаба, чтобы выжать хоть какой-то интеллект из потока шума. Большая часть параметров работает памятью, а не мышлением.
Предложение Карпаты - разделить эти две функции. Построить когнитивное ядро - модель, в которой остались только алгоритмы рассуждения и решения задач, без энциклопедического заучивания.
А рядом поставить внешнюю память, к которой модель обращается за фактами.
По его прогнозу, когнитивное ядро, обученное на качественных данных, способно выйти на настоящий интеллект при размере около миллиарда параметров. Для сравнения: флагманские модели сегодня крутятся в диапазоне от 200 миллиардов до 1.8 триллиона параметров, и большая часть этого веса уходит на запоминание интернет-помойки.
GPT-4o работает примерно на 200 миллиардах параметров и обходит оригинальный GPT-4 на 1.8 триллиона. Стоимость инференса на уровне GPT-3.5 с 2022 по 2024 упала в 280 раз, и почти весь этот выигрыш дали модели меньшего размера, обученные на более чистых данных с более продуманной архитектурой.
Настоящим узким местом ИИ сейчас является качество данных.
@data_analysis_ml
1👍207❤52🔥21💯9❤🔥2🤣2😁1
Прогресс по сравнению с Qwen3.6-Plus сразу в нескольких направлениях - агентское программирование, мировые знания, следование инструкциям.
Цифры в бенчмарках выглядят так: прирост в SkillsBench и SciCode около 10 пунктов, плюсы в SuperGPQA и ToolcallFormatIFBench.
Модель доступна и в веб-интерфейсе Qwen Studio, и через API Alibaba Cloud, контекстное окно 256K
Модель закрытая, исходников нет, что для части пользователей минус по сравнению с открытой линейкой Qwen. Сравнения в анонсе идут преимущественно с предыдущими моделями самой Qwen; прямых сопоставлений с актуальными конкурентами (GPT, Claude, Gemini, DeepSeek) в самом посте не приводится, оценивать относительную силу приходится по сторонним ресурсам.
Бенчмарки вроде QwenClawBench и QwenWebBench - внутренние, к ним стоит относиться со скептицизмом.
Blog: https://qwen.ai/blog?id=qwen3.6-max-preview
Qwen Studio: https://chat.qwen.ai/?models=qwen3.6-max-preview
API: https://modelstudio.console.alibabacloud.com/ap-southeast-1?tab=doc#/doc/?type=model&url=2840914_2&modelId=qwen3.6-max-preview&serviceSite=international
@ai_machinelearning_big_data
#qwen
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔106👍37👏18🔥11❤10🤨5😐2
В блоге о запуске новой модели Kimi есть история, от которой немного отвисает челюсть.
Моделька сама, без человека, поставила себе на мак Qwen3.5-0.8B и решила, что дефолтный инференс её не устраивает. Дальше она села писать свой, причём не на привычном питоне или C++, а на Zig.
В итоге скорость генерации выросла примерно с 15 до 193 токенов в секунду. То есть больше чем в десять раз.
И это оказалось на 20 процентов быстрее, чем LM Studio, которой пользуются тысячи людей именно для локального запуска моделей.
Больше 4000 вызовов инструментов, 12 часов непрерывной работы и 14 итераций, пока всё не сошлось.
Метрики K2.6 выглядят пртилично: SOTA среди опенсорса на HLE с тулзами, сильные результаты на SWE-Bench Pro, BrowseComp и математических бенчах с питоном.
Но запоминается больше всего этот эпизод с Zig. Потому что одно дело проходить тесты, и совсем другое- взять незнакомый язык и переписать на нём чужой рантайм так, чтобы он обогнал популярный продукт.
🔗 API: https://platform.moonshot.ai
🔗 Tech blog: https://kimi.com/blog/kimi-k2-6
🔗 Weights & code: https://huggingface.co/moonshotai/Kimi-K2.6
@ai_machinelearning_big_data
#KIMI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
2🔥216🤔40❤28👏22😁14👍13🎉10❤🔥2🗿2🥱1
Компания сообщила о первой за почти 15 лет смене первого лица компании. С 1 сентября пост генерального директора займёт Джон Тернус, старший вице-президент по аппаратной инженерии.
Тим Кук, возглавлявший корпорацию с 2011 года, перейдёт на позицию исполнительного председателя совета директоров. До конца лета он останется в роли CEO и будет участвовать в передаче дел.
Тернусу 50 лет, в Apple он работает около четверти века и отвечал за разработку iPhone, iPad, Mac, Apple Watch, AirPods и гарнитуры Vision Pro. При вступлении в должность он станет 8-м по счету генеральным директором и войдёт в совет директоров.
Нынешний неисполнительный председатель Артур Левинсон получит статус ведущего независимого директора. Главой аппаратного направления станет Джонни Сружи, прежде руководивший подразделением аппаратных технологий.
Под руководством Кука капитализация Apple выросла более чем в 20 раз и на 21 апреля достигла 4 трлн долларов, а годовая выручка приблизилась к 400 млрд.
Согласно отчётности, компенсация Кука за прошлый год составила 74,6 млн долларов; Forbes оценивает его состояние примерно в 3 млрд.
В своем заявлении Кук назвал работу на посту CEO «величайшей привилегией своей жизни». Он пришёл в Apple в 1998 году, когда компания была близка к банкротству, и в 2011 году сменил Стива Джобса.
По данным компании, решение совета было принято в пятницу и стало неожиданностью для индустрии - аналитики ожидали продолжения полномочий Кука ещё как минимум год.
Месяцем ранее в интервью Good Morning America сам Кук называл разговоры о своём уходе лишь слухами.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔70👍53👏19❤11🎉9🤩9🔥8⚡1🤣1
Media is too big
VIEW IN TELEGRAM
OpenAI добавила функцию Chronicle в Codeх, которая работает в фоне и записывает экран. Агент превращает записи в Markdown-саммари и сохраняет локально, так Codex собирает контекст: какими инструментами пользуется разработчик, над чем работает. Исходные видео удаляются через 6 часов.
Функция в бете, доступна только подписчикам ChatGPT Pro на macOS везде, кроме ЕС, Великобритании и Швейцарии. Включается вручную в настройках персонализации, запрашивает системное разрешение на захват экрана.
OpenAI предупреждает: Chronicle быстро выжигает лимиты API, хранит базу на диске без шифрования и расширяет возможность для prompt-инъекций - любая веб-страница со скрытыми инструкциями в поле захвата становится вектором атаки.
developers.openai.com
SourceCraft и «Центр технологий для общества» Yandex Cloud запустили библиотеку учебных материалов. В подборке - модули от 20 вузов, среди них МФТИ, ВШЭ, МАИ и Школа анализа данных. Отдельным блоком есть курсы по ML и оптимизации от лауреатов Yandex ML Prize.
Библиотекой могут пользоваться вузы: брать материалы целиком или отдельными модулями для образовательного процесса. В фокусе - практико-ориентированное обучение в области ML, ИИ‑ассистентов, анализа данных, облачных технологий. Преподаватели также могут присоединиться к инициативе.
Среди поддерживаемых языков - более 30, включая русский, английский, немецкий и японский.
Главное в релизе - code-switching: модель распознаёт несколько языков в одном аудиопотоке без переключения режима. Помимо транскрибации, добавили постобработку: автоматическая пунктуация и форматирование дат, чисел и валют. Для азиатского направления теперь доступно более 20 региональных диалектов и распознавание классической китайской поэзии.
API открыт на Alibaba Cloud Model Studio по схеме pay-as-you-go. Час аудио стоит $0.32 за пределами Китая и от $0.16 на материке. Разработчикам дают бесплатные квоты на тесты.
Tongyi Lab в сети Х
Платформа прекратила поддержку предоплаченных кредитных и дебетовых карт. Ограничение затрагивает как регулярные подписки, так и счета с оплатой по мере потребления ресурсов. Теперь для расчетов принимаются только стандартные банковские карты, PayPal и идентификаторы подписок Azure.
При этом GitHub параллельно усилил антифрод-систему: пользователи отмечают, что иногда даже привязка легитимного кошелька PayPal может спровоцировать автоматические ограничения.
Ужесточение мер - попытка пресечь массовую регистрацию фиктивных аккаунтов. Долгое время предоплаченные карты использовались для обхода лимитов и теневого доступа к GitHub Actions и Codespaces. Ожидается, что новые барьеры сделают эксплуатацию инфраструктуры платформы технически сложной и экономически невыгодной для ферм ботов.
github.com
Alibaba Cloud объявила о запуске тестирования модели для генерации видео HappyHorse-1.0. Доступ к API будет постепенно открываться через платформу Alibaba Cloud, а первыми опробовать возможности инструмента смогут приглашенные корпоративные клиенты.
Проект создавался силами подразделения ATH Innovation в тесном сотрудничестве с командами Tongyi Lab и Taotian Technology. После завершения закрытого тестирования полноценный коммерческий релиз HappyHorse-1.0 запланирован на май этого года.
yicai.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍116👏34❤23🤔19😎8💯3🔥2💘1
This media is not supported in your browser
VIEW IN TELEGRAM
О переходе можно судить по комментарию инженера компании Эрика Митчелла и по наблюдениям пользователей платных тарифов, отдельного пресс-релиза OpenAI не выпускала.
В сети Х сразу отметили, что время ответа на сложные запросы сократилось примерно с часа до 15–20 минут — то есть в 3 раза и более.
Также наблюдается улучшение в кодинге, построении интерфейсов и работе с SVG-графикой.
Первая - OpenAI перевела GPT-5.4 Pro на более компактную и экономичную версию, чтобы снизить издержки и ускорить выдачу.
Вторая - компания тестирует на Pro-тарифе раннюю итерацию следующего флагмана, известного под внутренним кодовым именем Spud.
Сэм Альтман в конце марта говорил, что предварительное обучение Spud завершено, а до релиза остаётся «несколько недель».
Независимо подтвердить эти оценки на момент публикации невозможно.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔71❤30👍18🎉15🔥8👏3
OpenAI прекратила работу сервиса Prism, предназначенного для совместной подготовки научных статей.
С 20 апреля пользователи соцсети X сообщают, что доступ к продукту больше невозможен, при этом никто из них не получил уведомления о необходимости экспортировать свои материалы. Теперь восстановить код LaTeX из последней сгенерированной PDF-версии удаётся только через Codex.
Prism был запущен 27 января этого года. Сервис работал на модели GPT-5.2, поддерживал коллективную работу над текстами и интеграцию с LaTeX. В основу продукта легла облачная LaTeX-платформа Crixet, которую OpenAI приобрела годом ранее.
Предположительно, закрытие Prism стало частью серии решений OpenAI о сворачивании непрофильных направлений. В прошлую пятницу было расформировано подразделение OpenAI for Science: его сотрудники перешли в другие исследовательские команды, а руководитель направления Кевин Вейл покинул компанию.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔100😢69🤨13❤12😐8🔥5😁5👍4🤬3
This media is not supported in your browser
VIEW IN TELEGRAM
Cube Sandbox - это попытка переосмыслить, как вообще запускать изолированные окружения для агентов.
Не через тяжёлые контейнеры и не через костыльные VM, а через максимально лёгкий runtime на базе RustVMM и KVM.
Запуск холодного инстанса меньше 60 мс.
При этом каждый sandbox живёт на своём ядре.
Потребление памяти тоже выглядит дико. Меньше 5 МБ на инстанс.
Это позволяет держать тысячи параллельных sandbox’ов на одной ноде без боли. Для агентных систем это ключевая вещь. Чем дешевле и быстрее изоляция, тем проще масштабировать оркестрацию.
Отдельный ход - полная совместимость с E2B SDK.
Меняешь endpoint и всё. Никаких переписываний, никаких миграций. Такой уровень «plug and play» редко встречается в infra.
По факту это выглядит как инфраструктурный кирпич под новую волну AI-агентов.
Когда у тебя не один агент, а сотни, которые что-то исполняют, тестируют, ломают и снова запускают.
https://github.com/TencentCloud/CubeSandbox.git
@ai_machinelearning_big_data
Please open Telegram to view this post
VIEW IN TELEGRAM
👍54🔥45🤩28❤12🦄2
Новая модель генерации изображений от OpenAI выглядит потрясно.
Больше всего удивляет не качество само по себе, а уровень сложности, который она тянет.
Такое ощущение, что может обрабатывать в разы больше деталей и сцен, при этом почти не теряя в скорости.
Промпт незамысловатый - сгенерируй на картинку на русском, сколько ошибок найдете ?)
@ai_machinelearning_big_data
Больше всего удивляет не качество само по себе, а уровень сложности, который она тянет.
Такое ощущение, что может обрабатывать в разы больше деталей и сцен, при этом почти не теряя в скорости.
@ai_machinelearning_big_data
🤩108❤47👍32👏28🔥21🤔12🐳2🗿1
HeyGen выложила проект HyperFrames, который рендерит HTML-композиции в видеофайлы и ориентирован на ИИ-агентов: если модель умеет писать HTML и CSS, она теперь умеет собирать видео.
HeyGen - популярная ИИ-платформа, которая специализируется на создании видеороликов с использованием аватаров и синтеза голоса.
Проект позиционируется как мост между генеративным ИИ и веб-разработкой. Видеопроизводство становится таким же воспроизводимым, как деплой фронтенда, и теперь не требует ни специального софта, ни облачных сервисов.
Композиция в HyperFrames - это обычный HTML-файл с data-атрибутами. Без React и без проприетарных DSL.
Анимации можно писать на GSAP, векторную графику подключать через Lottie, 3D-сцены - через WebGL и Three.js. Паттерн Frame Adapter позволяет подключить любой анимационный рантайм на выбор.
Рендеринг выполняется локально через Puppeteer и FFmpeg с детерминированным результатом на выходе: одинаковый вход даёт идентичный выход.
CLI по умолчанию неинтерактивный - команды рассчитаны на запуск агентом, а не человеком.
Вместе с фреймворком HeyGen поставляет skills для Claude Code, Cursor, Gemini CLI и Codex, которые регистрируются в агенте как slash-команды.
Из требований - Node.js 22+ и FFmpeg.
В каталоге есть готовые блоки и компонены: шейдерные переходы, оверлеи для соцсетей, анимированные графики, кинематографические эффекты.
@ai_machinelearning_big_data
#AI #ML #Framework #HyperFrames #HeyGen
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🤩104👏24👨💻24❤14🔥8🎉8