Ling-3.0-flash-Sante - модель, дообученная под медицину поверх языковой Ling-3.0-flash. Архитектура MoE на 124 млрд общих параметров, 5,1 млрд активных с контекстом в 262 тысячи токенов при максимальном выводе 32 тыс.
Ant Ling, команда языковых моделей в inclusionAI, открытой исследовательской инициативе Ant Group. Сама Ant Group входит в экосистему Alibaba, но развивает модели отдельно от неё.
На прошлой неделе та же команда выпустила финансовую версию Ling-3.0-flash-Fin на той же базе.
Модель специализируется на медицинских рассуждениях, безопасности лекарственной терапии, поиску с опорой на доказательную базу и длинные исследовательские задачи. Общие способности - рассуждения, код, агентная работа сохранены.
На DiagnosisArena-MCQ модель набрала 83,8 против 81,9 у GPT-5.6 Sol, 78,4 у Kimi K3 и 76,2 у Gemini 3.6 Flash.
На MedXpertQA-Text результат скромнее - 53,9 против 53,5 у Kimi K3, но заметно ниже 60,2 у Sol и 62,4 у Gemini.
Этика и безопасность на MedEthicAlign и внутреннем AFUSAFE-MedSCE - выше Claude Opus 4.8(max), но чуть ниже GPT-5.6 Sol (max).
Модель доступна бесплатно на OpenRouter и в Vercel. О планах по публикации весов сведений нет.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍28❤11🔥9
This media is not supported in your browser
VIEW IN TELEGRAM
Новое поколение генератора изображений работает на 50% быстрее версии 2.0. Лучше проработаны текстуры, естественнее свет, точнее сохраняются ключевые черты объектов с референсных фотографий.
Хэдлайнер релиза - улучшенный режим редактирования. Модель меняет отдельную деталь сцены, не трогая остальное, и картинка больше теряет структуры при серии последовательных правок в одном диалоге.
Ещё она научилась сразу генерировать изображения с прозрачным фоном и точнее держит сложные композиционные инструкции.
Релиз разделен на 2 варианта модели:
Также в ChatGPT добавили Sketch, генерацию по наброскам от руки, возможность комментировать отдельные области изображения и готовые шаблоны вёрстки.
Модель доступна в вебе, приложениях ChatGPT и Codex и через API.
Цены на Flare и Sunburst одинаковые:
$5 за миллион входных текстовых токенов, $8 - за тот же миллион в виде изображений и $30 за миллион выходных.
Есть кэширование - $1,25 (текст) и $2 (изображение).
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡62❤40👏19👍14🎉11🔥10
Твиттерский пользователь cozyblaze запустил GPT-6 Astra играть в оригинальную Portal и довёл эксперимент до титров. Модель управляла Челл сама - человек задал цель в начале и больше в геймплей не вмешивался.
Запуск стартовал 4 сентября 2026 года в пять вечера, титры пошли 5 сентября в 16:43. По логу получилось 23 часа 42 минуты 34 секунды.
Астра использовалась в режиме максимального ризонинга, была подключена через MCP и модифицированную сборку SourcePauseTool, утилиты, которой пользуются спидраннеры Source-движка.
Пока модель думала, Portal стоял на паузе. Astra смотрела скриншот, координаты персонажа и угол камеры, планировала следующий ход, отправляла команды и запускала игру дальше. Потом приходил новый скриншот, и цикл повторялся.
Чистого геймплея набралось примерно два часа - запись, из которой вырезали размышления модели, лежит на YouTube.
Опубликованный лог говорит, что всего было потрачено 434,8 миллиона токенов: 433,2 миллиона на вход и 1,6 миллиона на выход, из них 1,18 миллиона ушло на рассуждения. К инструментам модель обращалась 3300 раз, из которых 3210 - это команды в игру.
По прайсу API Astra стоит 10 долларов за миллион входных токенов, 50 за миллион выходных и всего доллар за миллион кэшированных входных. И Кэш тут решил всё - из 433 миллионов входных токенов 426 пришлись именно на кэш.
Таким образом, если бы запуск проходил чисто по API, прохождение Portal обошлось бы примерно в 574 доллара. Без кэширования тот же запуск обошёлся бы около 4400 долларов.
Реальных денег автор при этом не потратил. Он все удовольствие влезло в подписку Codex за 200 долларов в месяц.
В этом эксперименте важно то, что Астра почти сутки держала одну задачу, наблюдала за трёхмерным пространством и раз за разом решала, куда идти и куда ставить порталы, не теряя нить. Год назад такой запуск был бы обречён.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥138👍110❤26👏19🤓11👀8👨💻7⚡1
Media is too big
VIEW IN TELEGRAM
Министерство промышленности и информатизации КНР представило план развития инфраструктуры на 2026-2030 годы. Бюджет - 3,8 трлн юаней (около 532 млрд долларов).
К 2030 году страна рассчитывает довести мощности ИИ-вычислений до 9800 EFLOPS против нынешних 2185 по данным на июнь 2026 года, т.е более чем вчетверо. Кластеры планируют разворачивать по 10-100 тысяч ускорителей на площадку. Программа включает дата-центры под инференс и переписывание серверного софта под локальную компонентную базу.
Всё это укладывается в государственную стратегию переноса вычислений с востока на запад - энергоёмкие дата-центры ставят в западных провинциях, где дешевле электричество, вокруг восьми национальных вычислительных узлов.
scmp.com
Через три года после основания французская компания закрыла раунд на 3 млрд евро. Сама Mistral называет его крупнейшим привлечением в истории европейского технологического сектора.
Раунд возглавила Samsung Electronics. К ней присоединились Scaleup Europe Fund, PSG Equity, BlackRock, правительство Люксембурга и действующие инвесторы - Nvidia, ASML и Andreessen Horowitz.
Деньги Mistral зарабатывает на желании европейского бизнеса слезть с американского стека - её продуктами пользуются больше 125 корпораций из 20 стран, включая Airbus, ASML и HSBC.
mistral.ai
В открытый доступ опубликованы cuda-oxide и cutile-rs. Оба компилируют код ядер сразу в низкоуровневый PTX, без промежуточных обвязок на C++.
Подходы разные. Низкоуровневый SIMT-трек на
cuda-oxide использует собственный бэкенд кодогенерации для rustc и даёт прямой контроль над потоками. Тайловый фреймворк cutile-rs сам раскладывает вычисления по архитектуре видеокарты, работает со стабильным Rust от версии 1.89 и компилирует ядра прямо при запуске.Оба проекта в ранней альфе и для продакшена не годятся. При этом
cutile-rs уже используют в mistral.rs и в инференс-движке Grout от Hugging Face.nvidia.com
Компания выкатила промежуточную версию DeepSeek V4.1 Flash - тестирование ограничено по времени и заканчивается 10 сентября 2026 года. Модель умеет работать с текстом и изображениями из коробки, продолжая экспериментальную ветку V4-Flash-Vision-Exp.
Вызывать её нужно через API по прямому идентификатору
deepseek-v4.1-flash-expires-on-0910. На время тестирования действует лимит в 20 параллельных запросов на аккаунт.Тариф остался прежним, как у deepseek-v4-flash. Но за счёт более экономной токенизации и вычислительной эффективности фактическая стоимость типовых задач, по имеющимся оценкам, упала примерно на 30%.
ycombinator.com
Южнокорейская компания представит собственного универсального человекоподобного робота на выставке CES 2027. Команду Robotics курирует лично глава подразделения Device eXperience.
Разработку ускорили, объединив проектирование механики и алгоритмов восприятия в одну работу вместо двух параллельных. Патенты Samsung уже получила на тазобедренное сочленение, кисти-манипуляторы нового поколения и системы управления моторикой.
На рынок компания пойдёт по двум направлениям. Промышленные манипуляторы остаются за дочерней Rainbow Robotics, а сама Samsung возьмётся за потребительских и сервисных андроидов общего назначения - там ей предстоит конкурировать с Atlas от Boston Dynamics, принадлежащей Hyundai.
sedaily.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍76🔥19❤13👏9🤩6❤🔥2💯2🤬1
This media is not supported in your browser
VIEW IN TELEGRAM
Платформа встроила в свой чат-бот открытого ассистента ML Intern, который берет на себя полный цикл машинного обучения по текстовому описанию задачи.
Инструмент ориентирован на пользователей без профильного опыта. Для старта достаточно сформулировать идею в окне ввода текста, включить агента и он сам найдет релевантные модели и датасеты на Hugging Face Hub, в GitHub или в сети.
Перед стартом проводится оценка необходимых вычислительных ресурсов и фиксируется бюджет, за пределы которого агент гарантированно не выйдет.
После подтверждения ML Intern подготавливает данные, запускает обучение, мониторит процесс через отдельный дашборд, выгружает веса обратно на Hub, генерирует отчет и разворачивает интерактивное демо.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍76🔥30❤7🥰5😢3👀2💅1
Ноую модель уже раскатывают в веб-чате и мобильных приложениях. Прежние режимы - быстрый, экспертный и распознавание изображений свели в один: выбирать вручную больше ничего не нужно.
Теперь одна модель ведёт и обычный диалог, и разбор картинок, и сложные вопросы. Сложность запроса она определяет сама, а зрение включает, когда на вход приходит изображение.
По словам DeepSeek, V4.1 Flash обходит V4 Pro по качеству, стоимости и скорости. До выхода V4.1 Pro она возьмёт на себя все запросы, которые раньше уходили на V4 Pro.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍92❤32🔥14🥰3❤🔥1😁1🤬1🎉1
Media is too big
VIEW IN TELEGRAM
Законодатели по обе стороны Атлантики хотят запретить создание систем, превосходящих человека по всем направлениям.
В США представлен Ban Artificial Superintelligence Act, который вводит мораторий на обучение таких моделей до тех пор, пока не утвердят протоколы безопасности.
В британскую Палату общин внесён схожий документ, дающий регуляторам право отслеживать и ограничивать разработки, способные подорвать устойчивость государственных институтов.
Поводом авторы называют недавние инциденты с автономными агентами. Шансы на принятие у обоих документов невысокие, но сам факт показателен - разговор об экзистенциальных рисках ИИ перешёл из статей и конференций в тексты законопроектов.
time.com
Три американских ведомства выпустили совместный доклад, где обвиняют DeepSeek, Moonshot AI, Alibaba, MiniMax и StepFun в систематическом обучении своих моделей на выходах американских.
По версии спецслужб, с конца 2024 года китайские компании прогнали через API Claude, GPT, Gemini и Grok миллиарды токенов. Выходные данные американских моделей ведомства связывают с обучением DeepSeek-R1 и V3, а генерации GPT-4o и Claude - с линейкой Kimi от Moonshot AI.
Чтобы обойти лимиты платформ, компании, по данным доклада, использовали сети подставных аккаунтов и сторонние агрегаторы API. Специально подобранными промптами из западных систем вытягивали скрытые цепочки рассуждений.
Вредоносной такую дистилляцию называют потому, что она нарушает пользовательские соглашения сервисов. Обвиняемые компании доклад не комментировали.
US NSA Cyber в X
Команда французского стартапа Kinetix в полном составе перешла в европейский исследовательский центр Runway - работать на стыке видеогенерации и робототехники.
Kinetix занималась моделированием движений человека в пространстве и физически корректными симуляциями. Runway этот опыт нужен, чтобы уйти от чисто визуальной генерации к моделям мира, которые смогут управлять роботами в реальной среде.
Направлением воплощённого ИИ в Европе компания займётся силами инженеров Kinetix.
runway.com
Mercury 2.5 выдаёт больше 1100 токенов в секунду. Скорость берётся из архитектуры - обычная LLM создаёт текст по одному токену за раз, а диффузионная генерирует его блоками, уточняя целые фрагменты сразу.
Контекст - 260 тысяч токенов. Есть параллельный вызов инструментов, вывод в JSON и регулируемая глубина рассуждений. В голосовых сценариях время до первого токена не превышает 170 мс. По данным Inception, качество ответов выросло на 40% относительно прошлой версии.
Рассчитана модель на задачи, где критична задержка - многоэтапный поиск и RAG, голосовые боты и сжатие контекста.
Доступна через API Inception, Baseten и OpenRouter. Тариф - 0,20 доллара за миллион входных токенов и 0,75 за миллион выходных, на время релиза действует скидка 80%. Попробовать можно в веб-чате.
inceptionlabs.ai
Линейка генераторов музыки с индексом v6 создавалась в партнёрстве с недавними оппонентами по судам Warner Music Group, BMG и Believe.
Моделей три. Флагманская v6 Pro рассчитана на предсказуемый результат в продакшене, экспериментальная v6-wild - на нестандартные идеи, а облегчённая v6-mini заменит базовую версию для бесплатных аккаунтов. По мере раскатки Suno обещает полностью отключить прежние поколения.
Главное новое - контроль над структурой композиции. Модели умеют править фрагмент, не перегенерируя трек целиком: переписать одну строчку текста, вытащить гитарный рифф для сэмплирования, заменить бэк-вокал.
Плюс появились мэшапы из разных треков, а на вход теперь идёт не только текст, но и референсное аудио, изображения и видео.
suno.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤62👍13😁9🔥6
This media is not supported in your browser
VIEW IN TELEGRAM
Tencent Hunyuan вместе с Шанхайским университетом выложили AuK, открытую базовую модель для генерации и редактирования речи на 1,5 млрд параметров.
Русского языка модель не знает, заявлены только китайский и английский. Авторы, правда, отмечают возможный перенос между языками - какая-то способность возникает сама, но поддержкой это не считается.
AuK принимает на вход текстовый запрос и, если нужно, исходное аудио и на выходе отдаёт готовый звук.
Всего заявлено пять типов задач: синтез речи (клонирование голоса по образцу и генерация по описанию), правка содержания (заменить слово в реплике или строчку в песне), акустика (темп, громкость, высота тона), паралингвистика (эмоция, тембр, акцент, вздохи и смешки, шёпот) и очистка с разделением (шумоподавление, выделение спикера, отделение вокала от музыки).
Мультимодальная Qwen2.5-Omni читает инструкцию вместе с аудио и превращает её в смысловое условие. Аудио-VAE сжимает звук в компактное представление и потом восстанавливает обратно в волну.
Между ними работает трансформер по подобию FLUX - сначала десять блоков MMDiT, где смысловой и акустический потоки обмениваются информацией, оставаясь раздельными, затем двадцать обычных блоков DiT поверх склеенной последовательности.
По замерам Tencent, модель лидирует на Seed-TTS-Eval (разборчивость речи и похожесть на голос образца), InstructTTSEval (насколько точно модель отрабатывает словесное описание тембра), а также на MMAE-Speech и SpeechEditBench, где проверяют правки.
А вот на восстановлении сигнала (DNS Challenge, CHiME-4, Libri2Mix) она только конкурентоспособна, то есть узкоспециализированные модели там по-прежнему сильнее.
Отдельно выложена AuK-Flash - дистиллированная версия, которая укладывается в четыре шага вместо тридцати двух и работает в 4,5 раза быстрее.
К ней, кстати, нужно будет отдельно качать Qwen2.5-Omni-3B в роли энкодера.
В репозитории есть код установки, инференса на Gradio, ComfyUI, дообучения и шаблоны инструкций с примерами в кукбуке.
Пощупать можно в демо на Hugging Face и ModelScope.
@ai_machinelearning_big_data
#AI #ML #TTS #AuK #Tencent
Please open Telegram to view this post
VIEW IN TELEGRAM
👍58🤗17❤13👏13🔥1
Неформальный голос в X OpenAI, Тибо, сообщил, что интерес к Astra побил все внутренние исторические рекорды сервиса.
Компания неоднократно сталкивалась с резкими скачками трафика, но текущая динамика оказалась беспрецедентной - команда задействует все доступные вычислительные мощности, чтобы удерживать доступность инфраструктуры.
Главным приоритетом в OpenAI называют сохранение качества обслуживания текущих клиентов и если нагрузка продолжит расти теми же темпами, компания пойдет на превентивную меру и временно заморозит продажи тарифа ChatGPT Pro во избежание очередей на инференс и деградации производительности.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔154🔥59🤣50⚡17😁10❤9😢6
DeepSeek выложила свежайшую DeepSeek-V4.1-Flash, мультимодальную MoE-модель на 552 млрд параметров, с контекстом до миллиона токенов и методом Causal Encoder-Decoder под капотом, который вдвое удешевляет разбор входа.
Задача, под которую её делали, скучная, но дорогая. Долго работающий агент постоянно перечитывает свой контекст, и всё прочитанное приходится держать в KV-кэше.
На длинных дистанциях он раздувается, забивает видеопамять и упирается в пропускную способность шин.
В V4.1-Flash кэш сжат до 890 байт на токен, это вчетверо меньше, чем у V4-Flash, и в 437 раз, чем у первой версии DeepSeek.
Каждому слою внимания заранее назначен один из трёх режимов:
Так хранить приходится в разы меньше. Сверху главный кэш держится в четырёхбитном формате FP4, и устойчивость к такой точности натренирована, а не добавлена после обучения.
Метод вдохновлен майкрософтовской работой You Only Cache Once про переиспользование KV-кэша слоями. DeepSeek внесла в него структурные улучшения, чтобы поднять ёмкость кэша и глубину вычислений при его порождении.
40 слоёв разделены пополам: 20 на энкодер, 20 - декодер.
К и V для декодера не считаются в каждом его слое, а проецируются из последнего скрытого состояния энкодера.Поэтому при разборе входа работает только первая половина сети - 8 млрд активных параметров на токен против 16 при генерации ответа.
Для агентов, у которых вход в разы длиннее вывода, это именно то, что нужно.
На DeepSWE v1.1 модель берёт 74,2% против 74,0 у Claude Opus 5 и 73,0 у GPT-5.6 Sol.
На Terminal-Bench 2.1 - 90,6% (выше всех).
На AutomationBench - 54,8% против 50,3 у Opus 5.
А вот в Terminal-Bench 4.0, где нужны экспертные знания в науке, модель даёт 31,2% против 51,8 у Opus 5, то есть разрыв с топами на самых сложных задачах никуда не делся.
Модель поддерживает настраиваемый уровень рассуждений от 1 до 100, в API это три пресета: low, high, max - они соответствуют значениям 50, 75 и 100.
Шаблона чата в Jinja нет - вместо него советуют реализацию промптов на Python и отдельный набор Rust-библиотек.
Сообщество на Hugging Face уже сделало квантованные версии практически под всё.
@ai_machinelearning_big_data
#AI #ML #MMLM #MoE #Deepseek
Please open Telegram to view this post
VIEW IN TELEGRAM
1🔥56🤩45👍21❤16👏11🤔7🥰2🏆2😁1🙏1🤝1
Media is too big
VIEW IN TELEGRAM
OpenAI закрывает пилотную программу для федеральных ведомств, по которой доступ к её технологиям стоил 1 доллар в год. С 1 октября вступит в силу двухлетний контракт - чиновники перейдут на оплату по факту потребления со скидкой 50% от стандартного прайса.
По данным Управления общих служб правительства США, за год пилота доступ к ChatGPT получили 3,5 млн госслужащих, а заявленная экономия бюджета за это время составила 1,4 млрд долларов.
Ожидается, что переход на новые тарифы упростит ведомствам внедрение и использование будущих моделей OpenAI.
bloomberglaw.com
Компании договорились развернуть платформу Palantir AIP на мощностях Nebius AI Cloud. Расчёт на госсектор и корпоративных клиентов с жёсткими требованиями к локализации данных.
Клиенты Palantir получат доступ к европейским GPU-кластерам Nebius для распределённого обучения и инференса, с возможностью разворачивать изолированные ИИ-контуры по стандартам GDPR.
Аналитические и агентные инструменты Palantir теперь работают на дата-центрах Nebius. Основные заказчики - оборонные, финансовые и промышленные предприятия.
nebius.com
Билл Пиблз, бывший руководитель проекта Sora в OpenAI, сооснователь DreamWorks Джеффри Катценберг и экс-финансовый директор Dropbox Суджай Джасва запускают компанию для обучения собственных моделей видеогенерации под профессиональную киноиндустрию.
Проект пока привлекает финансирование, идут переговоры с венчурными фондами. Название и целевая оценка не раскрываются.
Техническое направление возглавил Пиблз - один из авторов Diffusion Transformer, архитектуры, лежащей в основе Sora и большинства современных видеогенераторов.
Из OpenAI он ушёл в апреле этого года, чтобы заниматься исследованиями в видеосинтезе вне жёстких продуктовых графиков корпорации.
theinformation.com
По данным The American Prospect, служба безопасности Anthropic отслеживает протестные движения и анти-ИИ активистов с помощью инструментов сбора сведений из открытых источников и коммерческой платформы анализа рисков Samdesk.
Согласно расследованию издания, аналитики компании следят за перемещениями участников акций в реальном времени, ведут списки лиц, представляющих интерес, и прогнозируют инциденты рядом с офисами или топ-менеджерами. Собранные сведения передаются в полицию США.
Отдельно The American Prospect указывает на случаи, когда Anthropic сообщала правоохранителям об угрозах от пользователей в переписке с Claude, но отказывалась выдавать логи чатов, ссылаясь на политику приватности.
prospect.org
Google выпустила десктопный клиент Gemini для Windows 10 и 11. Интерфейс работает компактным оверлеем поверх активных окон, вызывается сочетанием Alt + Space.
В полноэкранном режиме приложение интегрируется с Gmail и Google Drive, а многоэтапные задачи можно делегировать агенту Gemini Spark.
Кроме работы с текстом, клиент генерирует изображения через Nano Banana и видео через Gemini Omni. Работает в фоне и уже доступно для скачивания.
blog.google
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍90❤21👏15💯10🌚8🤝5
This media is not supported in your browser
VIEW IN TELEGRAM
OpenAI открыла API полнодуплексной голосовой модели GPT-Live-1 стоимостью 5 центов за минуту. Модель слушает и синтезирует речь одновременно, заменяя традиционный каскад STT–LLM–TTS.
Единая архитектура снизила задержку реакции с 1,4 до 0,8 секунды и позволила обрабатывать перебивания. Обновленная фильтрация пауз и фонового шума сократила число ложных прерываний на 80%.
Модель поддерживает делегирование вычислений - голосовой фронтенд удерживает непрерывный контакт с пользователем, пока бэкенд (GPT-6 Astra и Luna) параллельно выполняют рассуждения и вызовы инструментов.
GPT-Live-1 готова к интеграции в телефонию. API может возвращать ASR-транскрипты, включает 12 голосов и поддерживает управление темпом и стилем речи через системный промпт.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍115🔥22❤9👏5🤩4❤🔥1
Яндекс выложил на Hugging Face Alice AI-T5-35B-A0.6B Base — модель, которую обучили с нуля специально для высоконагруженного Поиска. Её дообученная версия Alice AI Search используется для генерации быстрых ИИ-ответов в Поиске.
При сотнях тысяч запросов в минуту такая модель должна не только хорошо отвечать, но и делать это за считанные секунды, не сжигая лишнее. Поэтому из 35 млрд параметров на каждый токен включаются только 600 млн, а отдельная модель отбирает из найденных документов лишь нужные фрагменты — такой подход увеличил пропускную способность примерно на 40%.
В итоге модель показывает сильные результаты на русскоязычных задачах и сопоставима с гораздо более тяжёлыми моделями, оставаясь дешевле в работе.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍91🤣35⚡33🔥16❤9🗿3🥰2😨1💘1
Инструмент складывает навыки, правила, хуки и настройки MCP в один git-репозиторий и раздаёт их всем участникам ИИ-команды.
Поддерживаются Claude Code, Codex, Cursor, CodeBuddy, WorkBuddy, Qoder, OpenCode, а также OpenClaw, Hermes и DeepSeek Harness (у последних трёх с ограничениями).
Хранилищем может быть GitHub, GitLab, GitCode, CNB, TGit или свой git-сервер.
Правки идут обычным рабочим процессом - участник делает пуш, открывается запрос на слияние, ревьюер проверяет и одобряет, остальные получают изменения при следующем запуске сессии. Повторный пуш по той же правке обновляет уже открытый MR, без создания нового.
Когда сессия заканчивается, хук оценивает её по критерию проблемности - перебивали ли модель, отклоняли ли вызовы инструментов, сколько раз агент повторял падающие команды.
Чистая сессия, пусть и длинная, не считается, но если с чем-то реально бились, TeamAI предложит записать вывод и отправить его в командный репозиторий. Подсказка при этом перечисляет, какие именно сигналы сработали.
Накопленное можно искать автоматически - агент перед задачей вызывает встроенный субагент, тот подбирает ключевые слова, читает найденные документы и возвращает выжимку.
Отдельная команда разбирает репозитории в граф компонентов, интерфейсов и зависимостей - для TypeScript, JavaScript, Python и Go связи достаёт парсер tree-sitter, для остальных языков работает запасной механизм на регулярных выражениях.
Еще TeamAI может делать недельный дайджест по расходу токенов, объёму диалогов и частоте вмешательств, а также дашборд со статусом текущих сессий каждого участника.
@ai_machinelearning_big_data
#AI #ML #Agents #Tools #TeamAiCli #Tencent
Please open Telegram to view this post
VIEW IN TELEGRAM
👍57🤩16🔥7❤6👏5💯2
Comfy Org открыла бета-тестирование встроенного ассистента Comfy Agent. Инструмент может создавать и изменять воркфлоу, запускать задачи, отлаживать ошибки и предлагать улучшения в интерфейсе ComfyUI по текстовым запросам.
Агент работает в фоне и умеет создавать цепочки нод, оптимизировать имеющиеся воркфлоу и искать ошибки совместимости.
В отличие от Comfy MCP, который позволяет управлять ComfyUI через Claude или Cursor, Comfy Agent работает как готовое коробочное решение внутри редактора.
Бэкенд ассистента развернут в инфраструктуре Comfy Cloud, а для простых задач можно подключать локальные модели.
Comfy Agent, вероятно, войдёт в подписку Comfy Cloud.
Подать заявку на открытую бету можно по ссылке. Запись стрима с демонстрацией возможностей - на Youtube.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤩96👍34🎉16❤7👏6🔥1🥱1🌭1
This media is not supported in your browser
VIEW IN TELEGRAM
Компания открыла Agents API - публичную бету сервиса, который берёт на себя всю обвязку вокруг агента. Она здесь та же, что у Codex и ChatGPT for Work.
Агент создаётся одним вызовом API, где указывается задача, модель, инструменты и окружение. Дальше действует OpenAI, а разработчик занимается своими инструментами, знаниями и процессами.
Харнесс умеет сжимать ранний контекст, когда сессия подбирается к лимиту и подгружать описания инструментов по необходимости. Плюс дает агентам вызывать инструменты программно - выполнять вызовы параллельно, сцеплять их и фильтровать результаты прямо в коде, возвращая в контекст только нужное.
Место работы агента можно выбрать из песочницы самой OpenAI, поднять на своей инфраструктуре или уйти к партнёрам: Blaxel, Cloudflare, Daytona, DigitalOcean, E2B, Modal, Oracle, Runloop и Vercel.
Отдельной платы за Agents API нет, только токены и инструменты, которые расходует агент.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👨💻75👍32👏21❤14🔥14🤣3🤓3🕊1
Media is too big
VIEW IN TELEGRAM
Сэм Альтман заявил сотрудникам, что компания готова притормозить работу над моделями следующего поколения - но только если то же сделают другие лаборатории. По данным Bloomberg, часть циклов предобучения OpenAI уже приостановила из соображений безопасности.
Идею контролируемого темпа Альтман обсуждал и раньше, в том числе в Белом доме. Инициатива родилась на фоне ухода ведущих специалистов по безопасности из OpenAI, Anthropic и Google DeepMind.
На этой неделе главный научный сотрудник OpenAI Якуб Пахоцкий публично призвал отрасль к координации и добровольным паузам в релизах.
bloomberg.com
Разработчик Devin обучил SWE-2 на базе открытой Kimi K3 с её 2,8 трлн параметров. По словам авторов, обучение с подкреплением впервые масштабировали на исходную модель такого размера.
Вместо дистилляции экспертов использовали линейные штрафы за стоимость вычислений, привязанные к наклону границы Парето.
На FrontierCode 1.1 Main модель набрала 50,0%. Инференс, по замерам Cognition, обходится на 60-75% дешевле, чем у Fable 5.1 и GPT-6 Astra.
Сократили и время на изучение репозитория - на среднем уровне рассуждений агент начинает править код на 18-м шаге вместо 48-го у SWE-1.7. Модель доступна в Devin CLI, десктопе и веб-версии.
cognition.com
Новая возможность Projects рассчитана на задачи, которые живут дольше одного чата: рефакторинг, миграции, крупные фичи.
Координатору ставят задачу, он составляет план и раздаёт подзадачи субагентам - по заявлению Cursor, их может быть тысячи. Сам код он не пишет, поэтому никогда не занят, но умеет реагировать на события - следит за ветками Git, ловит падения CI и триггеры из Slack.
Бета раскатывается на всех, о тарификации в анонсе не сообщается.
cursor.com
FLUX Video Edit правит готовые ролики по текстовому запросу в режиме video-to-video - сохраняет композицию, траекторию камеры, тайминги и звук, меняя только указанное. Модель также умеет подгонять липсинк под новый дубляж, не меняя хронометраж.
На вход идут MP4 до 15 секунд и 50 МБ, на выходе 720p при 24 кадрах в секунду. Секунда обработанного видео стоит 3 цента.
Black Forest Labs в X
Канадский математик Джейкоб Цимерман создаёт центр Mathematical A.I. Safety Institute со штатом в несколько десятков специалистов, запуск которого запланирован на январь 2027 года. Параллельно Цимерман присоединится к команде безопасности OpenAI, то есть будет верифицировать в том числе собственного работодателя.
Идея - перевести оценку рисков с эмпирического тестирования на строгую теоретическую верификацию и наделить модели доказуемыми свойствами надёжности, как у криптографических алгоритмов.
Механизмом аудита предлагают сделать доказательства с нулевым разглашением - лаборатория подтверждает соблюдение ограничений, не раскрывая ни архитектуру, ни веса.
nytimes.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍151👏23😁17🤔14❤10🎉7🔥5🤓4⚡2🙏1
This media is not supported in your browser
VIEW IN TELEGRAM
ChatGPT for Financial Services - специализированная версия платформы, которую делаи вместе с банками Morgan Stanley и Evercore.
Инструмент объединяет аналитические возможности GPT-6 Astra со встроенными финансовыми датасетами от PitchBook, Crunchbase, Daloopa, FiscalAI и LSEG News, которые индексируются напрямую на инфраструктуре разработчика.
Это решает проблемы интеграции внешних баз через MCP-коннекторы, ускоряет выборку и позволяет делать детализированное цитирование - система привязывает каждую цифру, показатель или вывод к точным строкам, таблицам и сноскам в исходных финансовых документах.
Платформа автоматизирует LBO-моделирование, нормализацию отчётности, скрининг покупателей и генерацию аналитических отчётов и питчбуков по корпоративным шаблонам в форматах Excel, Word и PowerPoint, публикуемым администратором.
Для финсектора предусмотрена сквозная авторизация по существующим подпискам на S&P Capital IQ, LSEG, MSCI, Factiva и Moody's, а также ролевой доступ, единый вход по SAML, автоматическое управление учётными записями через SCIM, поддержка информационных барьеров между рабочими пространствами, аудит действий через OpenAI Compliance Platform и запрет на использование клиентских данных для обучения моделей.
На бенчмарке OfficeQA Pro, где модель ищет и анализирует данные в бюллетенях Минфина США со сложными таблицами, графиками и сносками, GPT-6 Astra показывает 69,9% против 60,2% у GPT-5.6 Sol.
Решение доступно финансовым организациям по запросу, стоимость не раскрывается.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤓83👍73👀13❤6🔥5🤣5😭2
Стартап NeoCognition разработал первый сквозной бенчмарк использования компьютера, непрерывного обучения и долгосрочной агентной работы на реальной должности.
NeoCognition - лаборатория, в которой собрали бенчмарки MMMU, Mind2Web, SWE-Bench Pro и OSWorld 2, а также агентные системы SeeAct, UGround и HippoRAG.
Агента принимают в виртуальную строительную компанию на работу с кредиторской задолженностью, выдают полугодовой архив счетов, внутренний справочник и руководство по ERP-системе, после чего он начинает работать со счетами.
Первый месяц проходит с подробным фидбэком от руководителя по каждому счёту, а дальше - с редкими замечаниями по итогам месяца.
Каждая из ста задач теста проверена профессиональными бухгалтерами строительной отрасли, которые подтвердили и реалистичность сценариев, и то, что любую задачу способен решить рядовой специалист, изучивший доступные агенту материалы.
Большинство моделей, включая Gemini, Muse Spark, Grok и Kimi, не преодолевают порог в 20-25%, тогда как Fable 5.1 выполнила 72% задач, а GPT-6 Astra - 68%.
Лучший из двух тестировщиков-людей показал 51%, причём проваливались люди на поиске нужного в исторических данных, точности расчётов и мелких ошибках от утомления.
Разрыв между открытыми и закрытыми моделями авторы называют крупнейшим из всех виденных ими на бенчмарках - 72% у Fable 5.1 против 18% у Kimi K3, и вызван он не базовыми операциями в интерфейсе, а неспособностью слабых моделей учиться на дистанции.
Kimi K3 почти не обращался ни к архиву счетов, ни к собственным заметкам и деградировал к концу серии.
Так называемый налог на использование компьютера (просадка при переходе с API на графический интерфейс) у большинства моделей достигает 78%, но Fable 5.1 и GPT-6 Astra работают через GUI даже лучше, чем через API.
Дешевле при этом остаётся API - Fable 5.1 обходится в 6,95 доллара за задачу в программном интерфейсе против 18,23 доллара при работе с графическим.
Способность к обучению измерили отдельно. Fable 5 без доступа к истории и обратной связи, опираясь только на собственные знания, решает 11 счетов из 100.
Подключение архива счетов поднимает результат до 31, обратная связь руководителя - до 35, а оба канала вместе дают 43.
ИИ пока ещё обходится дороже: 18,23 доллара за задачу против 7,21 у людей. К тому же человек по мере накопления опята работает быстрее, а агент - замедляется.
@ai_machinelearning_big_data
#AI #ML #Benchmark #ApprenticeBench #NeoCognition
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤔87❤31👏28💯15👍10🔥6👌4🤓2👀1
Глава OpenAI занял девятую строчку рейтинга, разделив её с Марком Цукербергом.
Обе фигуры издание объединило формулировкой «...технологические лидеры, выводящие ИИ за пределы цифрового мира».
Три года назад Альтман тот же список возглавлял, а в прошлогоднем выпуске не значился вовсе.
Рейтинг выходит раз в год уже больше десяти лет и приурочен к Рош ха-Шана, еврейскому Новому году, в этом году праздник наступил 12 сентября.
The Jerusalem Post — старейшая и самая читаемая англоязычная газета Израиля, основанная в 1932 году под названием The Palestine Post. Издание выходит и в печати, и онлайн.
Седьмую строчку занимает Ассаф Раппапорт, основатель компании Wiz, семнадцатую — сооснователь Oracle Ларри Эллисон, восемнадцатую — сооснователь Google Сергей Брин.
Двадцатая строчка досталась в том числе Алексу Карпу из Palantir, двадцать шестая — брату и сестре Дарио и Даниэле Амодеи, которых издание называет «...еврейскими родственниками, формирующими ИИ».
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
😁39🤬8👏7❤4🎉4👍3🤩2🔥1🥰1💯1🤨1