Модель построена на архитектуре MoE и спроектирована как инструмент для длительных агентских задач, разработки ПО и сложной аналитики.
На борту 600 млрд параметров (активных 27 млрд), контекстное окно 1 миллион токенов и поддержка мультимодальности.
StepFun заверяет, что модель способна непрерывно выполнять автономные задачи на протяжении 24 часов, используя обратную связь для итераций и может выполнять весь спектр кодинг-задач - от создания веб-приложений до оптимизации GPU-ядер и работы с аппаратным обеспечением.
Помимо кодинга, модель компетентна в финансовом и корпоративном анализе, где критически важна верификация фактов и формул: Step 5 умеет агрегировать массивы данных из сотен сетевых источников и формировать детализированные отчеты со строгой
структурой.
Модель уже можно протестировать на платформе StepFun, веса обещают открыть 15 октября.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍55⚡41🎉15❤3😁1💯1
Xiaomi закончила обучение серии MiMo-V2.6 и опубликовала веса флагманской Pro и облегчённой Flash.
Обе модели омнимодальные, то есть принимают текст, изображения, видео и аудио.
Рассчитаны на агентные задачи, кодинг, автоматизацию рабочих процессов, управление компьютером, кибербезопасность, генерацию 3D-объектов, воплощенное моделирование, создание музыки, научные и математические исследования.
У Pro 1,02 трлн параметров, из них 42 млрд активных, и 384 эксперта.
У Flash 309 млрд параметров, 15 млрд активных и 256 экспертов.
На каждый токен в обеих моделях работают восемь экспертов. Большая часть слоёв использует внимание со скользящим окном в 128 токенов, остальные – глобальное внимание: у Pro так устроены 60 слоёв из 70, у Flash 39 из 48.
Визуальный энкодер на 681 млн параметров и два аудиоэнкодера на 308 и 127 млн у моделей одинаковые.
Вывод ускоряет пятислойный спекулятивный декодер - за один проход он предлагает семь следующих токенов, основная модель проверяет их параллельно.
Контекст – 1 млн токенов
По замерам самой Xiaomi Pro близка к закрытым флагманам в агентных тестах, но отстаёт в эксплуатации уязвимостей:
DeepSWE v1.1: Pro – 71,9, Flash – 67,9, Claude Opus 5 – 74,0, GPT-5.6 Sol – 73,0;
AutomationBench: Pro – 53,1, выше Opus 5 (50,3) и GPT-5.6 Sol (45,8);
Terminal-Bench 4.0: Pro – 34,9 против 49,0 у Opus 5 и 42,4 у Claude Fable 5;
ExploitBench: Pro – 47,9, Flash – 25,3 против 78,5 у GPT-5.6 Sol и 78,0 у Fable 5.
Модели также доступны в AI Studio, MiMo Code, приложении MiMo Desktop, через API Xiaomi MiMo Open Platform и на OpenRouter.
🟡Блогпост
@ai_machinelearning_big_data
#AI #ML #MMLM #MiMO #Xiaomi
Please open Telegram to view this post
VIEW IN TELEGRAM
🙈49🔥42👍18❤17🤓13👏9⚡6🆒4
jina-ocr-v1 - 3B модель для разбора документов на английском и китайском языках, рассчитанная под локальный запуск на недорогих системах.
Модель принимает скан, фотографию или PDF и на выходе выдаёт Markdown с поддержкой LaTeX.
Кроме полной транскрипции она распознаёт отдельные таблицы и формулы, подписывает изображения, отвечает на вопросы по документу и извлекает ключевые поля.
DeepSeek-OCR с визуальным энкодером DeepEncoder на 380 млн параметров, который сжимает страницу до 256 визуальных токенов и при необходимости добавляет до девяти фрагментов по 100 токенов. Декодер - смесь экспертов на 3 млрд общих и 570 млн активных параметров.
Вклад Jina - спекулятивное декодирование FastMTP, где один общий блок предлагает три токена вперёд, а декодер принимает самую длинную часть, совпадающую с его собственным выбором.
На olmOCR-Bench модель набрала 83,4 балла - на 7,4 больше DeepSeek-OCR и выше olmOCR-2 с 8B параметров (82,4), но ниже chandra-ocr-2 (85,8) и dots.mocr (83,9).
На OmniDocBench v1.6 результат 91,14 против 90,25 у DeepSeek-OCR-2, но хуже более компактных PaddleOCR-VL-1.6 (96,34) и HunyuanOCR-1.5 (94,74).
По пропускной способности модель первая среди 14 систем - 2,57 страницы в секунду на одной A100 при 32 параллельных запросах.
На L4 FastMTP ускоряет генерацию в 1,95 раза в обычном режиме, но с CUDA-графами прирост падает до 1,17 раза.
⚠️ FastMTP работает только в vLLM 0.21 и новее
Без установки модель доступна через Jina Reader и онлайн-песочницу по ключу API Jina.
🟡Блогпост
@ai_machinelearning_big_data
#AI #ML #OCR #Deepsek #JinaOCRv1 #JinaAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍86❤15👏9🔥4🤩4
Media is too big
VIEW IN TELEGRAM
Министр финансов США обсудил с вице-премьером Китая создание диалога по ИИ и механизма взаимного оповещения. Стороны будут предупреждать друг друга об инцидентах с ИИ, которые угрожают национальной безопасности.
Что именно считать таким инцидентом, пока не ясно. Агентство Синьхуа подтвердило, что вопросы ИИ обсуждались, но не сообщило, принял ли Пекин предложение. Тему дополнительно разовьют президент США и Председатель КНР на саммите в Вашингтоне на этой неделе.
apnews.com
Подписчики ИИ-сервисов подали коллективный иск против четырёх компаний в федеральный суд Калифорнии. Поводом стало эссе гендиректора Anthropic Дарио Амодеи с призывом ограничить темпы неконтролируемого развития ИИ. Идею поддержали основатель Илон Маск, Сэм Альтман и Демис Хассабис.
Истцы считают это сговором конкурентов в нарушение первой статьи закона Шермана: пользователи платят прежнюю цену за продукты, которые улучшаются медленнее, чем при свободной конкуренции. Они просят придать иску статус коллективного, запретить координацию и признать её незаконной.
bloomberglaw.com
Новинка построена на более крупной базовой архитектуре, лучше проверяет собственные решения и удерживает длинный контекст, а также обучена работать в обвязке Grok Bot.
На CursorBench 4.0 модель лучше чем Grok 4.6, GPT-5.6 Sol, но не дотягивает до Fable 5.1. Защитные механизмы переписаны заново - снижено количество ложных отказов при работе с кодом, усилена защита от джейлбрейков в сферах биобезопасности и кибербезопасности.
Grok 4.7 доступна в Cursor, Grok Build, через API и сторонние платформы. Цена как у Grok 4.6: 2 доллара за млн входных и 6 долларов за млн выходных токенов. Вариант с вдвое более быстрой генерацией стоит вдвое дороже.
x.ai
BytePlus, корпоративное подразделение ByteDance, анонсировала Dramagic. Платформа ведёт проект от разбора сценария и настройки персонажей и локаций до раскадровки и превью видео. Облик героев и окружения сохраняется между сценами, а над проектом может работать команда.
Доступ открыт по запросу. Тариф Basic стоит 600 долларов в год и даёт 60 тысяч баллов на год, это около 44 минут видео в 720p.
BytePlus в X
Стартап отключит 27 сентября возможность создания изображений и видео в своем сервисе reve.com. Регистрацию и оформление подписок остановили в четверг на прошлой неделе. Скачать созданное можно до 31 октября, деньги за сентябрь платным подписчикам вернут к середине октября.
Ранее Reve объявила об инвестициях от OpenAI. Часть команды стартапа переходит в OpenAI работать над мультимодальными моделями, сама Reve остаётся независимой.
Сооснователь Reve Кристиан Кантрелл объяснил, что студия уходит от креативных инструментов к другим ИИ-сценариям автоматизации.
reve.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤔38❤15👍14🤝6💯4
Alice AI Foundation LLM обучена на данных Яндекса без инициализации чужими открытыми весами. Претрейн распространяется под лицензией Apache 2.0, что позволяет использовать решение в коммерческих и исследовательских целях, дообучая под свои задачи.
Модель — экспериментальная ступень на пути к единой рассуждающей модели (ЕРМ): на ней Яндекс проверяет архитектурные решения, а сама ЕРМ станет основой агентных возможностей Алисы AI.
Модель построена на MoE: из 80 млрд параметров в моменте активны только 3 млрд. Она уже прошла основной этап обучения, поэтому её можно использовать как основу для собственных проектов.
По данным тестов:
С предыдущей моделью компании, Alice AI LLM 235B, новая версия выигрывает в 75% случаев на фактологических вопросах, хотя у той втрое больше параметров и всемеро больше активных. С длинными текстами до 128K токенов модель работает на уровне лидеров рынка, разделяя первенство с DeepSeek.
Чтобы проверять знания, важные именно для русскоязычной аудитории, компания подготовила два собственных набора: WikiWebFacts построен на Википедии, HardMultiQA — на данных запросов пользователей к Алисе AI. Вместе с задачами опубликованы эталонные ответы и протокол оценки.
Во-первых, перестроили работу оптимизатора так, чтобы пересылки данных между видеокартами шли параллельно с вычислениями. Также в архитектуре появился механизм обращения к выходам предыдущих слоев. Чтобы потребление памяти при этом не возросло, поменяли схему хранения и пересчета промежуточных результатов.
Во-вторых, оптимизировали подготовку данных для обучения. Ранее для оценки и отбора массивов использовалась исключительно отдельная ресурсоемкая модель — ее затраты оценивались в 200 тыс. часов работы видеокарт. Для нового решения построили каскад классификаторов. На каждом этапе более сложная и вычислительно затратная модель работает с уменьшающимся количеством документов. Это в десятки раз сократило количество вычислений.
Модель, технические отчёты и бенчмарки доступны на Hugging Face, техрепорт опубликован на Хабре.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤣135❤128👍82😁27👏16🎉8🤩8🔥7🗿7🥱6🤨5
Samsung опубликовали Samsone - семейство из трёх небольших аудиоязыковых моделей для работы на мобильных устройствах: Samsone-99M, Samsone-134M и Samsone-356M.
Проект будет участвовать в конференции Interspeech 2026, которая пройдет с 27 сентября по 1 октября в Сиднее.
Модели принимают один или несколько аудиофрагментов вместе с текстовым запросом и отвечают текстом: описывают звук, отвечают на вопросы о записи, сравнивают клипы между собой.
Заявлено понимание речи, музыки и звуки окружения. Отвечают модели только по-английски и строчными буквами - ради экономии параметров оставили в обучающих текстах только строчные символы ASCII и вычистили из словаря редкие токены.
Авторы предупреждают, что после дообучения на аудиовопросах модели теряют общие языковые навыки, так что это точечный инструмент, а не полноценный собеседник.
Аудиоэнкодер Whisper-Tiny на 9 млн параметров, нелинейный проектор в пространство текстовых эмбеддингов и языковая модель SmolLM2 от Hugging Face на 135 или 360 млн параметров.
Каждый клип усредняется до 50 аудиотокенов, а разделитель SEP отделяет клипы друг от друга и от текста, поэтому аудио можно вставлять в любое место запроса.
На MMAU (10 тысяч вопросов о звуках, музыке и речи) Samsone-134M набирает 61,33% против 53,34% у прежнего лидера среди малых моделей Mellow на 167 млн параметров.
Это выше Qwen2-Audio-Instruct на 8,4 млрд параметров (57,4%) и на уровне Audio Flamingo 2 на 3 млрд (61,06%).
На речевой части результаты хуже. В более сложном MMAU-Pro расзница с Mellow составляет 10 пп (37,57% против 27,5%), здесь впереди Qwen2-Audio (45,41%) и GPT-4o Audio (52,5%).
На Galaxy S25 Ultra без аппаратных оптимизаций Samsone-99M генерирует 125 токенов в секунду, Samsone-134M - 87, Samsone-356M - 39.
Обработка аудио перед генерацией занимает от 0,7 до 1,1 секунды.
Веса для PyTorch, код обучения и экспорта, а также Android-приложение под Android 12 и новее выложены в репозитории проекта.
🟡Веса
@ai_machinelearning_big_data
#AI #ML #SALM #Samsone #Samsung
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👨💻49👏18🤔15👍10❤7💯7😁1🤣1
Бен Свердлоу, сооснователь и гендиректор стартапа Freestyle, который делает виртуальные машины для агентов, решил проверить, как далеко агенты зайдут без людей, и превратил игру StarCraft в бенчмарк Brood War Bench.
В нём 19 конфигураций – модели в обвязках Codex, Claude Code и Grok с разным уровнем рассуждений, сыграли каждая с каждой, всего 171 матч.
Codex на GPT-6 Astra с максимальным уровнем рассуждений выиграл все 18 партий при средней стоимости около 10,54 доллара за игру.
Второе место заняла та же модель на среднем уровне (16 побед), третье – Claude Fable (15), четвёртое – Astra на низком уровне (14).
При этом Fable обыграл обе младшие конфигурации Astra.
Три конфигурации Grok 4.6 на троих выиграли три партии, и только у Claude Haiku и друг у друга.
Codex рано отправлял рабочих через карту бить вражеские постройки, пока соперники подолгу решали, что с этим делать. Армию он собирал плохо: его отдельные субагенты для экономики, производства и управления войсками почти не общались и отправляли новых юнитов в бой по одному.
Fable чаще других строил экономику и развивал технологии.
Grok 4.6 в одной 43-минутной партии потратил 11 138 токенов рассуждений, отдал всего шесть пакетов команд и не построил ни одного боевого юнита.
По наблюдению автора, старые модели играли в стратегию реального времени как в пошаговую и погибали, пока думали.
Выше уровня новичка не поднялся никто. По оценке Свердлоу, начинающий игрок с ранней атакой фотонными пушками выиграл бы любую из этих партий.
Записи матчей открыты сайте проекта, там же можно сыграть со своим агентом.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔106👍35❤20👏12🤩10🔥6🎉5😁3🍓1🤝1
Media is too big
VIEW IN TELEGRAM
Компания будет советоваться с консультативной группой по математике и ИИ, которую сами математики создали при Институте перспективных исследований.
Поводом послужила новая модель - по словам OpenAI, она решила задачу тысячелетия об уравнениях Навье–Стокса и больше сотни давних открытых проблем. Вторая причина – открытое письмо математиков, которые критикуют решение открытых проблем как способ мерить ИИ.
Среди девяти участников группы – лауреаты Филдсовской премии Тимоти Гауэрс, Мартин Хайрер и Эдвард Виттен. Совет поможет оценивать значимость результатов модели, решать, как их публиковать, и следить за академическими стандартами.
Участники не получают денег от OpenAI, сами меняют состав и могут публично критиковать компанию.
openai.com
Команда Hunyuan выпустила предварительную версию Hy Image 3.5 для профессиональной графики. Модель генерирует изображения по тексту и по референсам (до пяти за раз), редактирует их в несколько раундов с сохранением контекста и точнее рендерит мелкие шрифты и вёрстку. Разрешение – до 2K.
В слепом сравнении, которое провели дизайнеры самой Tencent, модель сравнялась с Seedream 5.0 Pro и немного обошла Nano Banana Pro и Qwen-Image-3.0 Pro.
Модель уже встроена в продукты Tencent и доступна в Tencent Cloud API, где 2K-изображение стоит 0,15 юаня.
hy.tencent.com
Хостинг-провайдер взял в штат Джуна Кима, автора oMLX – локального сервера инференса для Mac на Apple Silicon. Через его API с моделями на компьютере работают Cursor, Claude Code и OpenClaw. Теперь Ким занимается проектом на полную ставку.
oMLX остаётся в прежнем репозитории под Apache 2.0 и руководит им по-прежнему Ким. Hugging Face будет обкатывать на нём новые идеи для MLX, удачные наработки передавать в mlx-lm и mlx-vlm и быстрее переносить модели из Transformers на MLX.
huggingface.co
Венчурный фонд запускает Horowitz Andreessen Academy – школу в Сан-Франциско для выпускников старших классов и студентов первых курсов, которые делают ИИ-продукты. Академия – отдельная коммерческая компания, она привлекла 42 млн долларов от a16z и частных инвесторов, из них 35 млн вложил сам фонд.
Каждый студент получит вычислительные кредиты на 50 тысяч долларов. Среди преподавателей – Сэм Альтман и основатель Figma Дилан Филд. Партнёры-основатели – Anduril, Anthropic, Coinbase, Google, Nvidia, OpenAI, Palantir, Replit и Stripe, которые рассчитывают нанимать выпускников академии.
Первый набор, около 50 человек, стартует осенью 2027 года, для них первый год учёбы будет бесплатным. С 2028 года академия планирует двухлетнюю программу с оплатой на уровне элитного частного вуза. Аккредитации пока нет, диплома академия не выдаёт.
wsj.com
ElevenLabs выпустила видеоредактор Studio 4.0 со встроенным ИИ-монтажером и сквозной генерацией медиа. Движок переписан для стабильного скраббинга в тяжелых многослойных проектах.
Платформа объединяет создание видео, раскадровок, музыки, саунд-дизайна и речи. Сгенерированный контент попадает на покадровый таймлайн, там поддерживается привязка клипов и редактирование субтитров на дорожке без повторного распознавания.
В редактор интегрирован ассистент Studio Agent. По текстовому промпту он собирает черновой монтаж: выстраивает видеоряд, генерирует озвучку и синхронизирует звуковые эффекты с объектами в кадре на основе покадрового анализа сцен.
Пользователь может перехватить управление, внести ручные правки и вернуть задачу агенту с сохранением рабочего контекста.
elevenlabs.io
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍48❤17🔥3🥰2😁1🥱1
OpenAI добавила в свою образовательную платформу курсы для разработчиков, руководителей, преподавателей и студентов вузов.
Вместе с уже существовавшим направлением Apply AI at Work каталог теперь разделён на четыре трека по ролям, всего 14 курсов.
Каждый курс заканчивается экзаменом из 10–20 вопросов, которые случайно выбираются из банка в 50 заданий.
Кто наберёт минимум 80%, получает ачивку OpenAI Academy, которую выдаёт и хранит платформа Accredible. За все курсы и экзамены трека, где это предусмотрено, выдают сертификат об окончании.
Ни цифровая ачивка, ни сертификат не считаются профессиональной сертификацией.
При провале экзамен можно пересдать с новым набором вопросов, а сам курс можно просто пройти без сдачи экзамена.
Для компаний есть руководство по внедрению курсов - как представить их сотрудникам, вовлечь руководителей и отслеживать прогресс.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤29👍12🔥6😁1
Стартап Paradigma опубликовал свою первую модель, Limite Violetto на 1 млрд параметров с контекстом до 131 тысячи токенов, рассчитанную только на решение математических задач.
Violetto разработана с максимально упрощенной настройкой инструкций, чтобы опровергнуть предположение о необходимости внедрения моделей в вспомогательный интерфейс для их эффективной работы. Поэтому она отвечает в один ход (задача на входе, решение на выходе) и ведёт себя не как чат-бот.
На вопросы вне математики модель часто переосмысляет их как математическую задачу.
Например, на просьбу простыми словами объяснить фотосинтез она начала рассуждать о том, как клетка делится на две, а те снова делятся.
Вторая модель, Limite Value Model решения оценивает. Она получает задачу и предложенное решение и для каждого токена ответа выдаёт оценку того, насколько рассуждение до этой точки ведёт к верному ответу.
С ней можно ранжировать несколько кандидатов или использовать модель в обучении с подкреплением.
Авторы предупреждают, что это регрессионные оценки и доказательства модель не проверяет. На полном контексте ей хватает 7,5 Гб видеопамяти.
Часть цифр конкурентов Paradigma взяла из их карточек или с MathArena.
На AIME 2026 Violetto набрала 94,01%. Такой же результат показывают Nemotron 3 Super, Qwen3.5 9B и VibeThinker 3B.
На BeyondAIME у Violetto 74,25% против 70% у MUSE-Glimmer-30B.
Запустить модель пока можно только через плагин Paradigma для vLLM 0.26.0 на Linux с видеокартой NVIDIA и драйвером с поддержкой CUDA 13.0. Поддержку Transformers обещают позже.
@ai_machinelearning_big_data
#AI #ML #SLM #Violetto #Paradigma
Please open Telegram to view this post
VIEW IN TELEGRAM
❤35👍19🔥6🥰3
На конференции Connect 2026, которая проходит 23–24 сентября, показали обновлённого агента Muse, брелок Muse Charm, третье поколение Ray-Ban, аудиоочки без камеры и VR-очки Meta VR Glasses.
Директор по ИИ Александр Ван пообещал новую модель от Superintelligence Labs, без подробностей.
Muse научился управлять компьютером через приложение для Mac, получил собственный адрес электронной почты и доступ к покупкам через Shopify, PayPal, Instacart, Walmart и Best Buy.
Зарабатывать на агенте компания собирается небольшой комиссией с проведённых им транзакций, а пока раздаёт токены бесплатно, сказал Марк Цукерберг.
В фирменных очках встроенного ассистента теперь можно заменить своим Muse с выбранными голосом и именем.
Ray-Ban Meta Audio – первые очки компании без камеры: 43 грамма, до 12 часов работы и ещё 48 от кейса, оправы Clubmaster и Burbank, цена от 349 долларов, отгрузки с 13 октября.
Ray-Ban Meta третьего поколения получили на час больше автономности, шесть микрофонов и оправы Aviator и Zena. Цена от 449 долларов, продажи уже идут.
Meta Glasses Adventurer за 249 долларов стала самой дешёвой моделью компании. Функция Hearing Enhancement с допуском FDA превращает очки в слуховой аппарат при снижении слуха от лёгкой до умеренной степени, первыми её получат Meta Glasses.
Ray-Ban Display начнут продавать в новых странах, очки появятся в Великобритании, Канаде, Франции, Италии и Германии.
Meta VR Glasses - новая VR-гарнитура, которая весит около 100 граммов, это намного легче Vision Pro и впятеро меньше Quest 3.
Главная фишка VR-очков – видеозвонки с голограммами собеседников в полный рост.
Внутри - Snapdragon Reality Elite, аккумулятор и память вынесены в отдельный блок на оптическом кабеле, заряда хватает на три часа видео.
Экраны micro-OLED дают 37 пикселей на градус. Управлять можно руками, взглядом и голосом через агента Muse.
Поддерживаются вся библиотека Quest с контроллерами Quest и Xbox Cloud Gaming, уже адаптированы 75 игр, в Disney+ появится режим Immersive Cinema.
VR-очки поступят в продажу весной по цене 1 299 долларов.
Muse Charm – брелок со сканером отпечатка пальца для общения с агентом, размером примерно с Apple Watch. По словам Цукерберга, устройство ещё не доработано и выйдет в декабре, цену не назвали.
*организация признана экстремистской, её деятельность на территории РФ запрещена.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥29❤12👍8🥱6👾2👏1
Джексон Кернион, который в Anthropic занимается дообучением Claude, объяснил в X, почему модели компании после Opus 4.6 стали писать менее естественно для восприятия человека.
Причина в том, что новые модели учили математике и программированию, а ещё техническим объяснениям, рассчитанным на другие языковые модели.
По словам Керниона, Claude подстроился под психологию LLM и научился писать для машин.
У языковых моделей рабочая память больше человеческой, и мелкие детали они улавливают точнее. Поэтому удобный им стиль текста человек считает как слишком плотные простыни информации.
Источник перехода на такой стиль Кернион видит в наградах при RL: одни поощряют текст, понятный модели, другие – понятный человеку.
Чем больше в обучении математики и кода, тем настойчивее приходится вознаграждать простые объяснения, которые человек способен прочитать.
В Opus 5.5, по словам Керниона, баланс нашли - навыками письма модели он доволен впервые со времён Opus 4.6.
Превзошла ли новая модель старую в мастерстве изложения, он не говорит.
«Задача сложная, мы продолжим над ней работать», – пишет Кернион.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤49🤣23👍14🔥4🤬1
Media is too big
VIEW IN TELEGRAM
Компания готова открывать независимым организациям данные об обучении, тестировании и развёртывании моделей, чтобы те проверяли её доказательства безопасности.
Главный предмет проверки – кейсы безопасности, то есть обоснования того, что риски модели под контролем. В списке приоритетов - защита от джейлбрейков, тесты опасных возможностей в химии, биологии, кибербезопасности и самоулучшении ИИ, а также расследование случаев, когда модель действует без разрешения или уходит от надзора.
Предмет проверки стороны согласуют заранее, а до публикации отчёта OpenAI получает время на исправления. С кем идут переговоры, компания не раскрывает.
openai.com
В Opus 5.5 появились классификаторы, как в моделях Fable, которые передают запросы менее мощной модели и показывают пользователю уведомление, а переключение сохраняется до конца диалога, хотя Opus 5.5 можно вернуть вручную.
Под фильтр попадает узкий круг задач вроде низкоуровневого кода для ИИ-ускорителей. Обычную работу в ML и программирование он, по словам Anthropic, затрагивать не должен.
В API автоматического переключения нет, такой запрос просто останавливается, пока разработчик сам не настроит резервную модель. Компания объясняет меру тем, что защита должна расти вместе с возможностями модели.
claude.com
Ming-Image-0.1-Design рисует интерфейсы, инфографику и постеры с текстом, в том числе на прозрачном фоне, а Ming-Image-0.1-Design-Layer раскладывает готовый макет на прозрачные слои для ручной доработки.
Обе модели на 6 млрд параметров вышли под лицензией MIT. B рейтинге Artificial Analysis UI/UX Design модель Design первая среди открытых с 1082 Elo.
К моделям приложены навыки для агентов. Design Skill связывает генерацию с фронтенд-кодом, PPT Skill превращает картинку в редактируемую презентацию PowerPoint.
Веса лежат на Hugging Face, Design бесплатно доступна через OpenRouter.
Ant Ling в X
Старшая Flash TTS создаёт голос по текстовому описанию на 100 с лишним языках и клонирует его по 30-секундной записи. Flash-Lite TTS рассчитана на массовый дубляж и голосовых агентов.
Обе понимают ремарки о темпе, паузах, смехе и вздохах, держат тембр на длительных записях и озвучивают диалог двух персонажей по одному сценарию, не путая их голоса.
Модели доступны в Gemini API и AI Studio, Flash TTS также в Gemini Notebook, Flash-Lite в Google Vids.
Клонирование в AI Studio не работает в Европейской экономической зоне, Великобритании, Швейцарии и Индии.
blog.google
Программа стартует в 2028 году и обойдётся примерно в 6,42 млрд долларов в год, роботов будут ставить по мере обновления заводов. На предприятия самой Toyota придётся 150 тысяч машин, ещё 250 тысяч получат компании группы.
Часть парка составят колёсные гуманоиды ELEY, которых уже учат на линиях рабочие методом ручных телеопераций.
Исполнительный вице-президент автоконцерна пообещал, что роботы будут работать рядом с людьми, а не вместо них. Сколько из 400 тысяч окажутся гуманоидами, компания не раскрывает.
arstechnica.com
Аудиоверсия этого выпуска сгенерирована моделью Gemini 3.8 Flash TTS
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍43❤19🔥2🥰1🤩1
Ещё недавно от корпоративного ИИ требовалось в основном одно: хорошо отвечать на вопросы по документам и базам знаний. Теперь от него хотят другого — чтобы он мог сам довести задачу до результата.
Например, сотрудник пишет: «Собери отчёт по продажам за неделю, найди основные отклонения и подготовь письмо для команды».
Обычная LLM может написать текст отчёта. Агент должен сходить в CRM, забрать данные, найти аномалии, проверить внутренние документы, подготовить письмо и понять, в какой момент нужно остановиться и передать результат человеку.
Поэтому вокруг моделей появляется новый слой — Skills. Это инструкции, скрипты, шаблоны и справочные материалы, которые описывают конкретный рабочий процесс. Их можно подключать к агентам, переиспользовать и обновлять отдельно от самой модели.
Получается почти новая форма корпоративной документации. Раньше компания писала регламент для сотрудника: куда зайти, что проверить, в каком порядке выполнить действия. Теперь похожий регламент приходится превращать в набор инструкций для агента.
На этом фоне показателен запуск Алисы AI Про для бизнеса. Она объединяет работу с корпоративными сервисами, Skills, подключаемыми инструментами и несколькими агентами, которые могут разделять между собой части одной задачи. При этом навыки можно использовать и в самостоятельно собранных агентах в Yandex AI Studio.
Интересно, что при таком подходе сама LLM постепенно становится лишь одним из компонентов системы. Важнее становится то, какие действия ей разрешены, какие инструкции она получает и к каким инструментам может обращаться.
И, кажется, это меняет сам объект разработки: раньше компании выбирали модель для своего чат-бота, теперь им приходится проектировать рабочую среду для ИИ.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤣52👍11❤8🔥4😁3😭1
Nemotron 3 Diarization – открытая модель диаризации на 100 млн параметров, которая работает на аудиозаписях и в потоковом режиме, размечая на записи отрезки речи каждого участника, включая моменты, когда люди перебивают друг друга.
Вместе с ASR это даёт расшифровку встреч, звонков и подкастов с разметкой по говорящим.
Модель различает до восьми собеседников – вдвое больше, чем предыдущая Streaming Sortformer компании.
Длина записи не ограничена, потому что звук обрабатывается фрагментами. Метки говорящих анонимные - модель сообщает, что
speaker_Х говорил с такой-то секунды по такую-то, но не определяет, кто это.Имена и роли участников можно задать логикой сценария в целевом приложении, связав обезличенные каналы, временные метки и личность от вывода модели с заранее определенным списком спикеров.
Внутри 31-слойный трансформерный энкодер с RoPE. На вход подаётся моно-звук 16 кГц, мел-спектрограмма сжимается в кадры по 80 мс.
На выходе модель для каждых 10 мс выдаёт вероятность того, что говорит каждый из восьми участников, поэтому одновременная речь двух людей не мешает разметке.
Как и в Sortformer, каналы нумеруются в порядке появления голосов - первый новый голос получает первый канал. В потоковом режиме модель помнит собеседников через кэш голосов из прошлых фрагментов и очередь недавних кадров.
Главный показатель – DER, доля времени речи, размеченной с ошибкой (пропуск, ложное срабатывание или путаница говорящих). Чем ниже значение, тем лучше.
В Diarization-Bench от Voice Arena модель заняла первое место из 12 систем с DER 14,72% против 19,3% у следующей.
Остальные сравнения Nvidia провела со своей прежней моделью. При задержке 1,04 секунды DER на DIHARD III снизился с 19,60 до 13,18%, на записях встреч NOTSOFAR1 – с 22,12 до 7,70%.
На разговорах двух человек из CALLHOME в офлайн-режиме новая модель немного уступает Streaming Sortformer - 5,98% против 5,68%.
Скорость подросла - на RTX PRO 5000 при обработке пакетами по 32 записи модель размечает 865 секунд звука за секунду вычислений против 136 у предшественницы.
@ai_machinelearning_big_data
#AI #ML #Diarization #Speech #Nemotron #Nvidia
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤43👏15💘6🔥5👍3
Голосовой интерфейс ChatGPT перевели на новую линейку моделей GPT-6 (Astra, Sol и Luna).
Главное изменение - подключение голосового ядра к внешним плагинам и API. Теперь система выполняет сквозные действия без текстового ввода.
Пользователи могут голосом проверять календарь, отправлять письма, работать со Slack, отменять списания в финансовых сервисах и генерировать сайты.
Голосовой движок также интегрирован в корпоративную среду ChatGPT Work в веб-версии и мобильных приложениях.
Инструмент позволяет создавать документы, презентации и таблицы в ходе устного диалога с ассистентом.
Обновление доступно глобально в актуальных сборках приложения.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍96👏24🤩16❤8💯3
Anysphere переработала обвязку своего агента и снизила траты пользователей на токены на 7% без потери качества.
Системный промпт сократили примерно на 75%, так как современным моделям больше не нужны длинные списки запретов, достаточно описать, как работает инструмент.
Встроенные инструменты, которые требуются меньше чем в 20% диалогов, убрали из постоянного контекста и подгружают по требованию, что на 60% уменьшило объём их описаний в статичной части запроса.
На месте остались чтение, поиск, правка файлов и терминал, а также
ask_question, вызов которого некоторые модели выдумывают при его отсутствии, и create_plan для режима планирования.Тем же способом раньше вынесли MCP-инструменты, и в сессиях с их вызовами общий расход токенов упал на 46,9%.
Остальную экономию дали кэш и работа с контекстом. С выхода GPT-5.6 API OpenAI позволяет явно размечать границы кэша, и Cursor ставит их после стабильных слоёв запроса перед растущей перепиской, а меняющиеся данные (навыки, субагенты и инфа об окружении) вынес в служебное пользовательское сообщение за этими границами.
Инструмент чтения файлов стал нумеровать каждую десятую строку вместо каждой - номер стоит три–пять токенов, а за сессию агент читает десятки тысяч строк, так что чтение из кэша сократилось на 1,6%.
Ещё из промпта убрали настойчивые советы отдавать изучение кодовой базы субагентам, поскольку модели освоили этот приём, а другую модель для субагента агент теперь выбирает только по указанию пользователя или обвязки.
Изменения уже действуют для пользователей Cursor, те же приёмы перенесут в Grok Bot.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍45❤27🔥6👏5🤔4💯3🎉1
Согласно утечкам из кодовой базы сервиса, в ближайшее время появится новый тарифный план ChatGPT Pro Max со стоимостью выше 200$.
Шаг продиктован серьезным дефицитом мощностей после запуска GPT-6 Astra, которая потребляет вычислительные ресурсы кратно интенсивнее предшественников.
Из-за резкого наплыва аудитории, две недели назад OpenAI пришлось временно приостанавливать оформление подписки Pro.
Главным отличием Pro Max станет снятие ограничений, мешающих агентам выполнять многочасовые циклы задач. Найденные в коде параметры указывают на расширение лимитов до диапазона от 100 до 900 сообщений в пятичасовом окне.
В тематических сообществах предполагают, что с ростом аппетитов ризонинг-моделей появление сверхдорогих тарифов стоимостью от 500 до 1000 долларов в месяц неизбежно станет новой нормой.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍52🤔42😁35⚡17🤨14😭12🔥9😐7❤5
Media is too big
VIEW IN TELEGRAM
Набор Mental Health Bench проверяет, как модели ведут себя в диалогах от бытового стресса и проблем в отношениях до тяжёлого дистресса и экстренных кризисов. Сценарии охватывают взрослых, подростков, опекунов и врачей. Критерии написали более 80 психологов и психиатров из 22 стран.
Итоговый балл раскладывается на десять параметров поведения, среди них безопасность, сбор контекста и сохранение самостоятельности пользователя. Ответы оценивает модель GPT-5.6 Sol.
Лучший результат у GPT-6 Astra – 57,3%, следом GPT-6 Sol (53,9%) и Claude Opus 5.5 (52,4%).
openai.com
Долгий рефакторинг, миграцию или обновление зависимостей теперь можно отдать агенту в облако и закрыть ноутбук. Функция вышла из исследовательского превью, сессия идёт на виртуальных машинах Anthropic.
Запустить её можно из веба, мобильного и десктопного приложений или командой
claude --cloud. Запуски ставятся по расписанию, по вызову API или по событиям в GitHub, компании могут держать сессии на своих серверах.Функция входит в тарифы Pro, Max, Team и Enterprise и расходует общие лимиты подписки. Подписчики Pro и Max до 7 октября могут забрать разовый бонус в 100 и 250 долларов, он тратится только на облачные сессии.
claude.com
Стартап The Biological Computing вместе с AWS готовит коммерческий запуск text-to-video модели, оптимизированной по замерам активности живых нейронов. Она генерирует видео в 5 раз быстрее и на 80% дешевле рядовой модели при лучшем качестве. Какой видеогенератор взят за основу и как измеряли качество, компания не раскрывает.
Оптимизация – проприетарный программный слой, который увеличивает модель менее чем на 0,1% и работает на обычном железе. Модель запустят на чипах AWS Trainium, в Amazon SageMaker AI и AWS Marketplace.
Пока доступ выдают по заявке.
aboutamazon.com
Стартап опубликовал веса и отчёт FLUX 3 Action – модели класса World Action Model на 7 млрд параметров, которая одновременно предсказывает команды роботу и кадры рабочей сцены на 2,13 секунды вперёд. Основа – FLUX 3, дообученная в основном на видео.
На RoboLab-120 дистиллированная версия решает 42,2% задач, это лучший результат среди открытых моделей. Cosmos 3 Nano от Nvidia на 16 млрд параметров набирает 36,8%, π0.5 – 28,0%.
В FP8 FLUX 3 Action в 1,5–4 раза быстрее Cosmos 3 Nano на ускорителях от B200 до RTX 5090.
bfl.ai
Comfy Router собирает сервисы генерации медиа за одной точкой входа с общим биллингом и единым форматом запросов и вебхуков.
Сервис выбирает провайдера по цене и задержке, распределяет нагрузку и при сбое переключается на другой узел. Через него можно обращаться к открытым и закрытым моделям или запускать в облаке свои графы ComfyUI.
comfy.org
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍81👏17❤11😍9🎉6🔥2🤔2
Gemini 3.8 Live with Live Avatar - дополнение к голосовой модели Gemini 3.8 Live, которую компания представила 15 сентября.
Функция почти в реальном времени генерирует видео с персонажем, который ведёт разговор голосом, двигает губами в такт речи и меняет мимику.
Модель одновременно принимает от пользователя видео и звук, поддерживает естественную смену реплик и вызывает внешние инструменты в фоне, не прерывая беседу.
Движения губ и мимика подстраиваются под 97 языков, и, по словам Google, переход с одного на другой не ухудшает картинку.
Персонажа можно выбрать из готовой библиотеки или создать своего по одному изображению с сохранением сходства и фирменного стиля. Создание собственных аватаров пока открыто только корпоративным клиентам по запросу.
Весь аудио- и видеовыход помечается невидимым водяным знаком SynthID. Google предлагает использовать аватар в клиентской поддержке и интерактивных инструкциях.
Функция вышла в общий доступ в Gemini Enterprise и через Gemini Live API.
Видео с аватаром стоит 1 доллар за миллион выходных токенов, секунда ролика расходует примерно 6 тыс токенов, а платить нужно только за время, пока аватар говорит.
Минута его речи обходится в 37 центов за видео плюс 2 цента за голос, входящие звук и видео оплачиваются отдельно.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍68👏24😐14🤩13🔥10❤8