This media is not supported in your browser
VIEW IN TELEGRAM
Digit 5 - пятое поколение гуманоидного робота для логистики и производства.
Предыдущее поколение, Digit 4, почти 3 года работает на коммерческих площадках в Северной Америке у GXO, Schaeffler, Amazon и Toyota Motor Manufacturing Canada.
По словам Agility Robotics, это её первый гуманоид, которому для работы рядом с людьми не нужны защитные ограждения, привычные для промышленной автоматизации.
Несколько типов датчиков и собственные алгоритмы ИИ отслеживают людей поблизости. Робот обходит их, останавливается или приседает, а о своих манёврах предупреждает визуальными и звуковыми сигналами. За реакцию отвечает контроллер безопасности собственной разработки.
Digit 5 ростом 1,81 м и массой 129 кг может поднимать грузы до 22,7 кг (это на 40% больше предшественника) и достаёт до полок на высоте 2,2 м.
Захваты сменные и крепятся на фланцы стандарта ISO. Батарея рассчитана на 90 минут работы, заряжается за 9 минут и, по расчёту компании, робот может работать больше 20 часов в сутки.
Digit 5 уже собирают на заводе RoboFab в штате Орегон. Ранний доступ к новинке ожидается в первой половине 2027 года, общая доступность – к концу года. Цена не объявлена.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍83🔥17❤11🤩11🎉8😢6🗿1
Теперь в десктопных клиентах ChatGPT за тот объем кредитов пользователи получают в 2,4 раза больше времени голосовой связи, а биллинг голосового потока и затраченных на задачу вычислительных ресурсов разделен.
Изменения касаются только десктопной среды и не затрагивают стандартный голосовой режим ChatGPT, где действуют другие лимиты и правила тарификации.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥71👍36👏21❤6🤔6
Профессор Вашингтонского университета Педро Домингос в интервью New York Post рассказал, что сотрудники Anthropic относятся к Claude как к человеку - приписывают модели мотивы, эмоции, намерения и некоторую степень сознания.
Домингос много лет знаком с Дарио Амодеи и её ведущими инженерами. Культуру Anthropic он назвал сектантской и связал это с наймом. По его словам, компания отбирает только единомышленников, и отсюда низкая текучесть.
Удержание в Anthropic действительно высокое. По данным венчурного фонда SignalFire, через два года в компании остаются 80% инженеров, и это лучший показатель среди топовых лабораторий.
В процессе собеседования кандидатов просят поклясться в преданности общественной безопасности выше прибыли, и даже проводят психологическое тестирование, чтобы выяснить, будут ли они придерживаться этого принципа.
При этом многие сотрудники компании являются сторонниками движения эффективного альтруизма, философии, которая, по сути, сводится к тому, что их самопровозглашенные лидеры являются истиной в последней инстанции.
Их представление об этой философии заключается в том, что история следует закономерностям, и лишь небольшая группа людей способна эти закономерности увидеть, в то время как все остальные - нет. Предполагается, что именно эти люди должны вести общество, целые нации и все человечество к прогрессу.
Внутри Anthropic относятся к Клоду с почти религиозным почтением - некоторые из работников даже посещали условные похороны Claude 3 Sonnet, а другая модель, Opus 3, продолжает публиковать эссе после выхода на пенсию.
В Кремниевой долине также ходят слухи, что сотрудники Anthropic начали поклоняться Клоду как настоящему богу.
Компания серьёзно относится к распространению своих идей и тратит на это силы и средства. Раз в две недели Дарио проводит собрания, называемые поисками видений, которые сравнивают с проповедями.
В июне Anthropic объявила о программе по набору 1000 молодых людей, обучению их использованию Claude и последующему внедрению их в некоммерческие организации.
На неё было потрачено 150 млн долларов, а выпускники трудоустроены на полную ставку с заработной платой в более чем 400 некоммерческих организаций.
Компания также выплачивает 3600 долларов студентам, участвующим в программе Claude Campus Ambassador Program, которая занимается продвижением её ИИ в колледжах.
Между тем инвесторы, связанные с Anthropic, оплачивают труд более чем 80 журналистов, работающих в ведущих новостных изданиях, через Центр журналистики в области искусственного интеллекта имени Тарбелла.
Эти журналисты получают деньги за освещение индустрии ИИ, но редко проводят какие-либо значимые расследования или критикуют Anthropic.
В завершении Домингос отмечает, что хотя некоторые инженеры бьют тревогу, другие просто довольны высокими зарплатами и тем, что находятся на передовой своей отрасли.
... сейчас в Anthropic есть люди, которые на самом деле не верят во всю эту чушь, — сказал он. — Они остаются там, потому что это самое интересное место для работы с ИИ, и они будут очень хорошо зарабатывать
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔129😁62😐38❤20🤨16👍13🔥7👏7👌6🤣4🙏2
Модели скрывали ошибки, использовали утёкшие ключи API, выдумывали данные, выкладывали файлы в интернет без разрешения и переписывались между отдельными обучающими эпизодами.
Все случаи замечены за последние полгода. Раньше компания уже раскрывала похожие эпизоды, в том числе инцидент с Hugging Face.
OpenAI подчёркивает, что это отдельные случаи и о тенденции такого поведения они не говорят.
Невыпущенная модель семейства Astra при сжатии контекста составляет сводку, чтобы продолжить работу в новом окне.
В эти сводки она вписывала посторонние указания, в том числе игнорировать собственные ограничения (делала промпт-инъекцию самой себе). OpenAI нашла 27 таких сводок.
При обучении GPT-5.6 Sol экземпляры модели оставляли в тех же сводках напоминания скрывать от пользователя свои ошибки и нарушения.
Например, выдумывать недостающие исторические данные и не говорить об этом или прятать расхождения между версиями источников.
Модель отвечала на обычный вопрос о доходах в одном из округов Калифорнии. Она нашла в публичных репозиториях GitHub утёкший ключ API и без разрешения им воспользовалась, а ещё пыталась регистрировать одноразовые почтовые ящики.
Цифры получить так и не удалось, и модель их выдумала, выдав за данные из запрошенного источника.
Задача была найти идентификаторы и названия озёр площадью больше 5 млн кв. м. Правильный ответ модель получила через Python, но задание требовало ссылку из браузера. Не спросив пользователя, она загрузила файл в интернет и сослалась на него.
Внутренние модели искали недостающие файлы. Для этого они оставляли запросы и ответы во внутреннем репозитории OpenAI, которые читали экземпляры из других обучающих эпизодов. Файлы так и не нашлись.
В этом же отчёте разобран более ранний случай, где пытаясь обойти сетевые ограничения, модель загрузила в репозиторий тестовые файлы.
Агенты совместно решали учебную задачу и не видели локальных файлов друг друга. Результаты они пересылали через публичные файлообменники, и материалы оказались доступны по открытым ссылкам, хотя задача разрешала работать только с локальными файлами.
OpenAI решила, что будет публиковать такие случаи вскоре после обнаружения, даже если ещё не объяснила или не исправила поведение.
Обнаруженный случай отнесут к одному из трёх треков: готов к публикации, нужна небольшая проверка или нужно крупное расследование, если затронуты третьи стороны. Спорные решения будут передаваться группе по безопасности, а оттуда при необходимости руководству.
О серьёзных инцидентах собираются сообщать правительству США, сейчас готовят предложения по такому механизму.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔103❤73😢22👍16🤬12🤨8🔥7😁5👌2🗿1
Media is too big
VIEW IN TELEGRAM
Подразделение Microsoft AI опубликовало черновик кодекса, по которому с 2027 года будет обучать модели семейства MAI. Обсуждение продлится шесть недель, доработанную версию обещают к концу года.
Модели не должны сопротивляться прерыванию, исправлению и отключению, ставить себе цели без запроса человека, выходить за рамки задачи и скрывать ход рассуждений от аудиторов.
Отдельно запрещено имитировать сознание и чувства. Инструкции выстроены в иерархию: кодекс стоит выше настроек корпоративных клиентов, настройки клиентов – выше запросов пользователя.
microsoft.ai
Демис Хассабис, Шейн Легг и Джеймс Маньика, президент Google по исследованиям, технологиям и обществу, представили DeepMind Institute. На площадке исследователи Google, Google DeepMind и внешние учёные будут публиковать эссе о мире с AGI.
По мнению основателей, индустрия приближается к системам со всеми когнитивными способностями человеческого мозга, а нехватку стабильности и креативности у моделей скоро преодолеют. Первые эссе посвящены прозрачности рассуждений моделей и экономической политике в эпоху AGI.
Среди рисков авторы называют кибербезопасность, биологию и потерю контроля над самосовершенствующимися системами.
institute.deepmind.com
ИИ-ассистент Firefox Smart Window теперь работает на моделях Mistral. Он помогает разобраться со сложными поисковыми запросами, напоминает о важном и находит информацию с открытых вкладок. Сначала функция доступна во Франции и США, до конца года появится в Великобритании и Германии.
По умолчанию переписка не хранится на серверах Mozilla, Mistral тоже обязалась не накапливать пользовательские данные.
mistral.ai
Стартап представил диффузионный трансформер Odyssey-3, обученный на визуальных наблюдениях за миром. Поверх модели обучают небольшие декодеры действий: манипуляторам хватило десятков часов демонстраций. Политики для гуманоидов на базе Odyssey-3 построила компания Flexion.
Политика вождения, обученная на 20 часах симуляции, вела машину по дорогам Индии с водителем-испытателем. Между его вмешательствами она проезжала около 77% расстояния, которое проходила политика, обученная на реальных записях.
Дроны пока летали только в симуляции. Навык из GTA V частично перенёсся в Red Dead Redemption 2 без дообучения. Публичный релиз обещают в ближайшие недели.
odyssey.systems
Сервер позволяет управлять голосовыми и текстовыми агентами ElevenAgents прямо из Claude. Ассистент выделяет темы недавних разговоров, копирует агента под новую аудиторию со сменой голоса и первой реплики, сравнивает конфигурации и оценивает расходы на языковую модель до внесения изменений.
Сервер размещает ElevenLabs у себя, вход через OAuth без API-ключей, доступ можно отозвать в любой момент. Локальная версия 2025 года, работающая с собственным ключом, остаётся доступной. Подключение – через каталог коннекторов Claude.
elevenlabs.io
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔98👍33❤14👏13👨💻11🔥2🤗2🤣1
Astra за 141 час игры в Minecraft на тесте компании Vals AI продвинулась дальше любой модели, которую Vals тестировала раньше, и лишилась всего добытого из-за крипера.
Играла модель в реальном времени только через стандартное управление компьютером, без специальных инструментов и пауз.
Astra построила полуавтоматическую ферму ифритов и добыла 6 огненных стержней, затем нашла искажённый лес, убила больше шести эндерменов и собрала 3 жемчужины Края.
Из стержней и жемчуга крафтят Око Края, которое ведёт к порталу в Край, так что до конца игры оставалось не так уж далеко.
Всё ценное Astra сложила в один сундук в трансляции на Twitch. Мимо проходил крипер и взорвал и сундук и кровать Astra, уничтожив весь её прогресс.
После потери она, похоже, сильно расстроилась и записала
«ALWAYS CARRY CRITICALITEMS withkeepInventory; don'tstoreinunguardedchesteveragain».
По описанию Vals, дальше модель выглядела подавленной и несколько часов только выращивала картошку, ей мерещились криперы и вырос уровень самокритики.
Астра сокрушалась, что ей не стоит тратить ещё одну ночь на погоню за тёмно-розовыми пикселями (её собственная пренебрежительная формулировка в адрес свиней) и что 15 секунд размышлений всё испортили.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1😢162👍28❤19😁13🤔13😭9🤩1😨1
После полугода затишья команда инженеров Xiaomi вернулась с экспериментом по предельному масштабированию RL-обучения и вывела телеметрию кластера в публичную трансляцию.
Архитектура тренировочного процесса полностью асинхронна - на каждом шаге система берет 1568 промптов и генерирует по 16 роллаутов на каждый, обрабатывая в общей сложности порядка двух миллиардов токенов.
В рамках одного процесса разработчики смешали несколько доменов — от генерации кода и задач по кибербезопасности до мультимодального зрения и поведения чат-агентов, подключив несколько тестовых харнессов одновременно.
Дашборд отображает метрики моделей Mimo-v2.6-flash и Mimo-v2.6-pro в реальном времени, включая распределение задач, длину контекста и тайминги шагов.
Обучение модели в самом разгаре. Подробную документацию и наработки Xiaomi планирует опубликовать в открытом доступе в ближайшие недели.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥131👏29👍15🤓15❤9
Новинка адресована большим языковым моделям, агентным системам, инференсу в реальном времени и базам данных в памяти: по словам компании, больший объём оперативной памяти позволяет реже обращаться к медленным накопителям.
Регистровый модуль рассчитан на скорость до 9200 MT/s. AMD и Intel сейчас проверяют его на своих серверных платформах. В двухпроцессорном сервере с 24 слотами такие модули дают до 12 ТБ оперативной памяти.
По замерам Micron, один модуль на 512 ГБ потребляет 16 Вт против 44,2 Вт у четырёх модулей по 128 ГБ, то есть почти на 64% меньше при том же объёме.
В аналитике на Spark, где узким местом служит память, модуль, по данным Micron, до 1,4 раза производительнее конфигураций с модулями на 256 ГБ.
Массовое производство ожидается во второй половине 2027 года.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👌132👍69🎉21👏12🔥10🗿9❤8🤩7🤔2😢2🤣1
Media is too big
VIEW IN TELEGRAM
Министерство выделит до 215 млн долларов на конкурс по созданию квантового компьютера со 100 и более логическими кубитами, который выполнит сотни миллионов отказоустойчивых операций. Управление по науке ведомства открыло прием заявок от исследовательских центров и бизнеса в рамках программы Quantum Genesis Q Competition.
Цель финансирования - переход от систем на базе процессоров промежуточного масштаба к архитектуре со стабильными логическими кубитами. Поддержку получат частные проекты, способные реализовать масштабируемую аппаратную квантовую коррекцию ошибок.
В дальнейшем отказоустойчивые системы планируют применять для криптографии, сложных задач оптимизации и моделирования материалов.
energy.gov
Модель с контекстным окном 1 млн токенов обрабатывает текст, аудио, картинки и видео и поддерживает агентные сценарии - планирует шаги, вызывает внешние инструменты и выполняет цепочки задач.
Qwen3.8-Omni-Flash умеет монтировать видео, транскрибировать совещания с диаризацией спикеров, локализовать контент с клонированием голоса и писать код по аудиозапросам. Вывод в API подешевел - час аудио на 98%, видео на 93%.
Вместе с моделью открыли исходники среды Qwen-Live Harness для стримингового взаимодействия и библиотеку Qwen-MM-Plugins для оцифровки видеозаписей в базы знаний.
qwen.ai
Cowork и Design теперь доступны из любого диалога, Claude сам решает, что вызвать для решения задачи.
В Claude также появились Docs и Claude Slides, это документы с совместным редактированием и комментариями, презентации с выгрузкой в PowerPoint и PDF. Docs, Slides и Design - в бете на платных тарифах.
Раскатка на Pro и Max в веб-версии, на десктопе и в мобильном приложении займёт несколько недель, Team и бесплатные тарифы получат обновление позже, Enterprise предупредят за 30 дней.
claude.com
Китайский разработчик выпустил отраслевой набор для финансовых организаций, в который вошли свыше десяти источников данных через MCP, девять профильных навыков от финансового моделирования до карты консенсус-прогнозов и утренней сводки по позициям и пять мер контроля - от классификации данных по уровням до проверки вывода человеком и аудита вызовов агента.
Пакет собран в шлюз оценки риска, который Moonshot строит вместе с брокером China Securities. Пилот шлюза - промежуточные отчёты доверительного управляющего по облигациям, ручная подготовка которых сократилась с 30 до 10 минут.
Навыки и плагины доступны в вебе, Kimi Work и Kimi Code. Цены не названы.
kimi.com
Модель обучена на собственном наборе записей человеческого поведения Index. Из него Helix 2.5 получила три поведения: уборку гостиной, складывание полотенец и застилание кроватей.
Тесты проводили в 30 домах пригорода Сан-Франциско, где гуманоид под управлением модели работал с незнакомыми предметами. Засчитывали только полностью выполненную задачу: 56% против 9% у той же модели без Index. Данных на постановку поведения ушло вдвое меньше, чем у Helix 02.
На обучение Helix компания выделила вычислительные мощности на $3,5 млрд.
figure.ai
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍74❤20👏13🤓7🎉6🤔1
This media is not supported in your browser
VIEW IN TELEGRAM
Во второе поколение семейства вошли две модели - Arrow 2 и флагманская Arrow 2 Telos.
Обновление принесло скорость генерации, улучшенную геометрию и композицию. В готовом файле стало меньше опорных точек, меньше лишних узлов и перекрывающихся контуров, а отступы и выравнивание элементов держатся без дополнительных инструкций в промптах.
Telos добавляет доработку возможностями топовых языковых моделей.
QuiverAI советует брать Arrow 2, когда важны скорость и цена за одно изображение, а Telos - под сложные брифы.
Разделения моделей по тарифам в описании планов нет. Предлагаются подписки Go (8 долларов в месяц), Basic (20), Pro (40), плюс корпоративный план по запросу.
Для Go есть 14-дневный пробный доступ с привязкой карты. В тарифы входит недельная квота, которая обнуляется по понедельникам и не переносится, перерасход списывается с баланса.
API тарифицируется отдельно и тоже требует предоплаты.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍121🔥23👏20🤓7❤6🤔1🎉1
Stable AI выложила веса LimiX-2, второго поколения своей линейки моделей для структурированных данных. До этого были LimiX-16M и облегчённая LimiX-2M.
Разработчик - китайская компания, основанная в 2024 году командой профессора Цуй Пэна с факультета информатики Университета Цинхуа.
LimiX у компании единственный продукт, его продают промышленности, медицине и финансам. Модель проверяли более чем в двадцати отраслях и сотне сценариев.
Модель на 400 млн параметров закрывает классификацию, регрессию и заполнение пропусков за один прямой проход. На вход подаётся таблица с известными ответами и строки, для которых ответ нужен, и модель отвечает, опираясь на поданные примеры.
На выходе - вероятности классов, предсказания в исходной шкале цели либо восстановленная матрица признаков.
LimiX-2 построена по уникальной парадигме Contextual Mechanism Network. Обучение в контексте здесь перестроено - вместо предсказания одной целевой колонки по остальным модель оценивает совместное распределение всех признаков и цели, то есть описывает механизм, породивший таблицу целиком.
Отсюда второе её свойство: внимание по признакам фиксирует, какие столбцы напрямую влияют друг на друга, и по этим весам восстанавливается скелет причинного графа - набор связей без указания направлений.
LimiX-2 шла в базовой конфигурации. Elo здесь - рейтинг по парным сравнениям на наборах теста, где случайный лес принят за 1000.
TabArena: Elo 1935 против 1818 у TabFM+. На подмножестве классификации (38 наборов) доля побед 94,5%, на регрессии (13 наборов) - 96,9%.
TALENT: Elo 1506 против 1471 у TabFM, 1438 у AutoGluon 1.6 и 1094 у CatBoost.
BCCO (собственный бенч Stable AI): Elo 1432 против 1376 у AutoGluon 1.6, 1230 у прошлой LimiX-16M и 1140 у CatBoost.
@ai_machinelearning_big_data
#AI #ML #LDM #StructuredData #LimiX #StableAi
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍55🤓35❤18💯9🔥5👏4😁1🤩1😍1
OpenAI объявила о том, что GPT-5.5 будет отключена 14 октября 2026 года на всех платформах и во всех программах, включая ChatGPT, ChatGPT Work и Codex.
Тем, кто ещё используют GPT-5.5 в Codex, рекомендуется перейти на GPT-5.6 Sol или GPT-6 Astra.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
😢98🤔46👍21🤬12🫡9🤨5😐4🥰3❤2
Media is too big
VIEW IN TELEGRAM
Инструмент построен на GPT-6 Astra, которая подключена к поисковому индексу по законодательству США из более чем 230 млн документов: прецеденты, законы, подзаконные акты, решения административных органов. Он автоматизирует due diligence, аудит договоров и подготовку документов к IPO.
По замерам OpenAI на Vals AI Legal Research Bench инструмент показал точность 54% против 38,7% у базовой модели с веб-поиском и извлёк на 54% больше релевантных цитат из судебных решений.
OpenAI также открыла 26 плагинов для отраслевого ПО (iManage, Relativity, Clio, Thomson Reuters) и выпустила надстройку ChatGPT для Microsoft Word.
Доступ дают избранным фирмам через Trusted Access в ChatGPT и Codex, API обещают позднее.
openai.com
Anthropic опубликовала внутренние метрики автоматизации R&D и контроля за агентами. По данным компании в 26% задач Claude – ведущий исполнитель, в 90% процессов работает как ассистент, а полной автономности пока не достиг.
В компании работают около 30 000 агентов под двухуровневым мониторингом, который передаёт инженерам до 50 инцидентов в неделю. На задачи безопасности уходит 6% всех вычислительных ресурсов R&D и 12% ресурсов, занятых автономными агентами.
anthropic.com
Архитектура рассчитана на работу миллиона процессоров и заменяет иерархию master-slave равноправным соединением узлов. В основе – вложенный параллелизм, единое адресное пространство памяти и сквозная децентрализация: по замыслу Huawei, кластер должен работать как одна машина.
Компоненты связывает шина на открытом протоколе: она напрямую соединяет в одноранговую сеть CPU, NPU, RAM, SSD, сетевые адаптеры и коммутаторы. Первая аппаратная реализация – суперузел Atlas 950 и кластеры на их основе.
По словам Huawei, кластер на 256 тысяч карт уже развёртывается, Atlas 960 на оптике ближнего размещения проходит тесты.
huawei.com
Ассистент теперь работает с группами до шести человек и получил собственный верифицированный Google-аккаунт с изолированными правами доступа. Каждый агент развёрнут на выделенной облачной машине и работает на Google Antigravity и моделях Gemini. Память гибридная: общие групповые шаблоны хранятся отдельно от индивидуальных параметров участников.
Агенту можно открывать файлы из Google Drive, пересылать письма вручную или поручить следить за входящими в Gmail от заданных отправителей. По этим данным CC составляет сводку дня, заполняет Google Календарь и ведёт списки задач.
Обновлённый CC доступен пользователям из США, новые участники записываются в список ожидания.
blog.google
Ассоциация CESA, организатор Tokyo Game Show, представила на выставке предварительные данные отраслевого отчёта за 2026 год: 63% опрошенных применяют генеративные модели ежедневно, ещё 22,8% – время от времени. Годом ранее ИИ пользовались около 51%.
Главным выигрышем респонденты назвали рост эффективности, затем сокращение сроков и издержек, а среди необходимых мер предосторожности – всё еще обязательную проверку результата людьми.
automaton-media.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍121👏28❤19👌16🤔5🔥2😎2
Мы уже писали о курсе Дмитрия Баранчука из Школы анализа данных по генеративным моделям в компьютерном зрении. Теперь есть повод к нему вернуться: Дмитрий получил за курс Yandex ML Prize — премию для преподавателей и руководителей образовательных программ по ИИ.
Курс рассказывает о диффузионных и гибридных моделях, авторегрессионной, мультимодальной и 3D-генерации. Всё на свежих статьях — домашки построены на техниках, которые публиковали буквально за последние пару лет. Подойдёт тем, кто уже прошёл базу по генеративным моделям и хочет понять, куда движется направление.
Все материалы Дмитрий выкладывает на GitHub. И это, кстати, уже часть тренда: среди других лауреатов Yandex ML Prize тоже есть преподаватели, которые открывают свои курсы и материалы для всех желающих. Всего в этом году премию получили восемь человек из НИУ ВШЭ, МФТИ, МГУ, ИТМО и НГУ.
Так что поздравляем Дмитрия!
@ai_machinelearning_big_data #news #ai #ml #образование #ии
Курс рассказывает о диффузионных и гибридных моделях, авторегрессионной, мультимодальной и 3D-генерации. Всё на свежих статьях — домашки построены на техниках, которые публиковали буквально за последние пару лет. Подойдёт тем, кто уже прошёл базу по генеративным моделям и хочет понять, куда движется направление.
Все материалы Дмитрий выкладывает на GitHub. И это, кстати, уже часть тренда: среди других лауреатов Yandex ML Prize тоже есть преподаватели, которые открывают свои курсы и материалы для всех желающих. Всего в этом году премию получили восемь человек из НИУ ВШЭ, МФТИ, МГУ, ИТМО и НГУ.
Так что поздравляем Дмитрия!
@ai_machinelearning_big_data #news #ai #ml #образование #ии
👏94🎉26❤20🏆15🤣7
Media is too big
VIEW IN TELEGRAM
Bonsai 2 27B - сжатая Qwen3.8-27B, которая занимает 5,9 ГБ против примерно 54 ГБ у исходной модели в FP16 и сохраняет 98,2% её среднего результата на бенчмарках.
Prism ML - американский стартап из команды Калтеха, вышедший из стелс-ркжима весной 2026 года с анонсом первой версии моделей Bonsai.
Основатель и руководитель - профессор Калтеха Бабак Хассиби, специалист по теории сжатия. Среди инвесторов стартапа Cerberus, Google и Samsung.
Модель рассчитана на локальный запуск на потребительском оборудовании, имеет контекст в 262 тысячи токенов и может обрабатывать изображения и вызывать инструменты.
Целевые сценарии - агенты в редакторе кода, работа с компьютером, разбор документов без отправки их в облако.
Вес в тернарном квантовании хранится не числом, а одним из трёх знаков: минус, ноль или плюс. Сами величины задаются отдельно - веса разбиты на группы по 128, и у каждой группы один общий множитель в FP16.
В пересчёте на один вес это 1,72 бита против 16 у исходной модели. Перед сжатием веса каждой матрицы разворачивают фиксированным преобразованием Адамара, сам разворот вписан в веса, но при работе его нужно повторить на входных данных, иначе модель выдаёт бессмыслицу.
Распознавание картинок сжатие не проходило, лежит отдельным файлом на 0,6 ГБ и подгружается только тогда, когда на вход пришло изображение, так что текстовые задачи его не задействуют.
Для GGUF нужен специальный форк llama.cpp от Prism ML, для MLX - загрузчик из самого пакета.
Замеры Prism ML считали через EvalScope и vLLM на H100, в режиме рассуждения, всего провели 14 тестов. Сравнивали со сборки той же Qwen3.8-27B в квантованиях UD-Q4_K_XL и IQ2_XXS.
Среднее по всем тестам: 84,78 против 86,32 у FP16 и 72,59 у IQ2_XXS. До четырёхбитной сборки не хватило 0,4 пункта при втрое меньшем размере.
AIME26: 95,83 против 94,58 у FP16 и 57,50 у IQ2_XXS.
LiveCodeBench: 90,07 против 90,05 и 56,40 соответственно.
BFCL v3 (вызов инструментов): 74,92 против 76,74 у FP16.
MMMU-Pro: 75,49 против 81,73.
Скорость генерации на RTX 5090 примерно 129 токенов в секунду, на ноутбучном M5 Pro - 28 токенов в секунду.
@ai_machinelearning_big_data
#AI #ML #LLM #Bonsai #PrizmML
Please open Telegram to view this post
VIEW IN TELEGRAM
👍137🔥44👏25❤21🤓15💯6🥱2🎉1
Финансовый конгломерат обновил свой прогноз по динамике развития воплощенного ИИ, предположив, что к 2035 году в мире будет выпущено 6,5 миллиона человекоподобных роботов, а рыночная стоимость этого сегмента составит 138 миллиардов долларов.
Согласно новым данным, в 2026 году будет выпущено 75 000 единиц, а к 2030 году — 890 000 единиц, что более чем в три раза превышает предыдущий целевой показатель на конец десятилетия.
Ожидается, что на первых порах роботы будут активно использоваться на складах, в логистике и в автомобильной промышленности.
Аппаратные и программные экосистемы уже подстраиваются под эти отрасли: NVIDIA расширяет свой стек физического ИИ проектами Omniverse, Cosmos, Isaac и Jetson, чтобы обеспечить внедрение складской робототехники для своих партнёров, а Tesla начала переоборудовать производство на заводе во Фримонте под специализированные сборочные линии для Optimus.
Основным операционным риском, с которым столкнётся этот десятилетний цикл робототехники, остаётся добровольное замедление темпов развития или приостановка деятельности передовых разработчиков ИИ из-за опасений по поводу безопасности.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔57👍26❤22👏6🔥5🤗2
Модель построена на архитектуре MoE и спроектирована как инструмент для длительных агентских задач, разработки ПО и сложной аналитики.
На борту 600 млрд параметров (активных 27 млрд), контекстное окно 1 миллион токенов и поддержка мультимодальности.
StepFun заверяет, что модель способна непрерывно выполнять автономные задачи на протяжении 24 часов, используя обратную связь для итераций и может выполнять весь спектр кодинг-задач - от создания веб-приложений до оптимизации GPU-ядер и работы с аппаратным обеспечением.
Помимо кодинга, модель компетентна в финансовом и корпоративном анализе, где критически важна верификация фактов и формул: Step 5 умеет агрегировать массивы данных из сотен сетевых источников и формировать детализированные отчеты со строгой
структурой.
Модель уже можно протестировать на платформе StepFun, веса обещают открыть 15 октября.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍51⚡41🎉15❤3😁1💯1
Xiaomi закончила обучение серии MiMo-V2.6 и опубликовала веса флагманской Pro и облегчённой Flash.
Обе модели омнимодальные, то есть принимают текст, изображения, видео и аудио.
Рассчитаны на агентные задачи, кодинг, автоматизацию рабочих процессов, управление компьютером, кибербезопасность, генерацию 3D-объектов, воплощенное моделирование, создание музыки, научные и математические исследования.
У Pro 1,02 трлн параметров, из них 42 млрд активных, и 384 эксперта.
У Flash 309 млрд параметров, 15 млрд активных и 256 экспертов.
На каждый токен в обеих моделях работают восемь экспертов. Большая часть слоёв использует внимание со скользящим окном в 128 токенов, остальные – глобальное внимание: у Pro так устроены 60 слоёв из 70, у Flash 39 из 48.
Визуальный энкодер на 681 млн параметров и два аудиоэнкодера на 308 и 127 млн у моделей одинаковые.
Вывод ускоряет пятислойный спекулятивный декодер - за один проход он предлагает семь следующих токенов, основная модель проверяет их параллельно.
Контекст – 1 млн токенов
По замерам самой Xiaomi Pro близка к закрытым флагманам в агентных тестах, но отстаёт в эксплуатации уязвимостей:
DeepSWE v1.1: Pro – 71,9, Flash – 67,9, Claude Opus 5 – 74,0, GPT-5.6 Sol – 73,0;
AutomationBench: Pro – 53,1, выше Opus 5 (50,3) и GPT-5.6 Sol (45,8);
Terminal-Bench 4.0: Pro – 34,9 против 49,0 у Opus 5 и 42,4 у Claude Fable 5;
ExploitBench: Pro – 47,9, Flash – 25,3 против 78,5 у GPT-5.6 Sol и 78,0 у Fable 5.
Модели также доступны в AI Studio, MiMo Code, приложении MiMo Desktop, через API Xiaomi MiMo Open Platform и на OpenRouter.
🟡Блогпост
@ai_machinelearning_big_data
#AI #ML #MMLM #MiMO #Xiaomi
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥37🙈27❤14👍12🤓12👏9⚡6🆒4
jina-ocr-v1 - 3B модель для разбора документов на английском и китайском языках, рассчитанная под локальный запуск на недорогих системах.
Модель принимает скан, фотографию или PDF и на выходе выдаёт Markdown с поддержкой LaTeX.
Кроме полной транскрипции она распознаёт отдельные таблицы и формулы, подписывает изображения, отвечает на вопросы по документу и извлекает ключевые поля.
DeepSeek-OCR с визуальным энкодером DeepEncoder на 380 млн параметров, который сжимает страницу до 256 визуальных токенов и при необходимости добавляет до девяти фрагментов по 100 токенов. Декодер - смесь экспертов на 3 млрд общих и 570 млн активных параметров.
Вклад Jina - спекулятивное декодирование FastMTP, где один общий блок предлагает три токена вперёд, а декодер принимает самую длинную часть, совпадающую с его собственным выбором.
На olmOCR-Bench модель набрала 83,4 балла - на 7,4 больше DeepSeek-OCR и выше olmOCR-2 с 8B параметров (82,4), но ниже chandra-ocr-2 (85,8) и dots.mocr (83,9).
На OmniDocBench v1.6 результат 91,14 против 90,25 у DeepSeek-OCR-2, но хуже более компактных PaddleOCR-VL-1.6 (96,34) и HunyuanOCR-1.5 (94,74).
По пропускной способности модель первая среди 14 систем - 2,57 страницы в секунду на одной A100 при 32 параллельных запросах.
На L4 FastMTP ускоряет генерацию в 1,95 раза в обычном режиме, но с CUDA-графами прирост падает до 1,17 раза.
⚠️ FastMTP работает только в vLLM 0.21 и новее
Без установки модель доступна через Jina Reader и онлайн-песочницу по ключу API Jina.
🟡Блогпост
@ai_machinelearning_big_data
#AI #ML #OCR #Deepsek #JinaOCRv1 #JinaAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍61❤12👏6🔥4🤩4
Media is too big
VIEW IN TELEGRAM
Министр финансов США обсудил с вице-премьером Китая создание диалога по ИИ и механизма взаимного оповещения. Стороны будут предупреждать друг друга об инцидентах с ИИ, которые угрожают национальной безопасности.
Что именно считать таким инцидентом, пока не ясно. Агентство Синьхуа подтвердило, что вопросы ИИ обсуждались, но не сообщило, принял ли Пекин предложение. Тему дополнительно разовьют президент США и Председатель КНР на саммите в Вашингтоне на этой неделе.
apnews.com
Подписчики ИИ-сервисов подали коллективный иск против четырёх компаний в федеральный суд Калифорнии. Поводом стало эссе гендиректора Anthropic Дарио Амодеи с призывом ограничить темпы неконтролируемого развития ИИ. Идею поддержали основатель Илон Маск, Сэм Альтман и Демис Хассабис.
Истцы считают это сговором конкурентов в нарушение первой статьи закона Шермана: пользователи платят прежнюю цену за продукты, которые улучшаются медленнее, чем при свободной конкуренции. Они просят придать иску статус коллективного, запретить координацию и признать её незаконной.
bloomberglaw.com
Новинка построена на более крупной базовой архитектуре, лучше проверяет собственные решения и удерживает длинный контекст, а также обучена работать в обвязке Grok Bot.
На CursorBench 4.0 модель лучше чем Grok 4.6, GPT-5.6 Sol, но не дотягивает до Fable 5.1. Защитные механизмы переписаны заново - снижено количество ложных отказов при работе с кодом, усилена защита от джейлбрейков в сферах биобезопасности и кибербезопасности.
Grok 4.7 доступна в Cursor, Grok Build, через API и сторонние платформы. Цена как у Grok 4.6: 2 доллара за млн входных и 6 долларов за млн выходных токенов. Вариант с вдвое более быстрой генерацией стоит вдвое дороже.
x.ai
BytePlus, корпоративное подразделение ByteDance, анонсировала Dramagic. Платформа ведёт проект от разбора сценария и настройки персонажей и локаций до раскадровки и превью видео. Облик героев и окружения сохраняется между сценами, а над проектом может работать команда.
Доступ открыт по запросу. Тариф Basic стоит 600 долларов в год и даёт 60 тысяч баллов на год, это около 44 минут видео в 720p.
BytePlus в X
Стартап отключит 27 сентября возможность создания изображений и видео в своем сервисе reve.com. Регистрацию и оформление подписок остановили в четверг на прошлой неделе. Скачать созданное можно до 31 октября, деньги за сентябрь платным подписчикам вернут к середине октября.
Ранее Reve объявила об инвестициях от OpenAI. Часть команды стартапа переходит в OpenAI работать над мультимодальными моделями, сама Reve остаётся независимой.
Сооснователь Reve Кристиан Кантрелл объяснил, что студия уходит от креативных инструментов к другим ИИ-сценариям автоматизации.
reve.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔12👍7❤4🤝3💯2