Tongyi Lab (Alibaba Group) опубликовала VimRAG - фреймворк агентного RAG для работы с текстом, изображениями и видео.
Проект развивает прошлогодний VRAG-RL и решает проблему мультимодального RAG: визуальные данные тяжелые по токенам, но семантически разрежены, а классическая ReAct-история забивает контекст шумом и провоцирует повторные бесполезные запросы к поиску.
Вместо журнала наблюдений VimRAG моделирует рассуждение как динамический направленный ацикличный граф. Каждая вершина хранит подзапрос, действие агента, текстовое саммари и банк визуальных токенов.
Ребра фиксируют логические зависимости между шагами. Такой граф позволяет агенту отличать тупиковую ветку от новой гипотезы и не уходить в циклы повторных поисков.
Бюджет визуальных токенов распределяется с учетом исходящей степени в графе, экспоненциального временного затухания (имитация забывания) и рекурсивной обратной связи от потомков.
Ключевым фрагментам достается высокое разрешение, а второстепенные кадры сжимаются или отбрасываются. Для видео задействована способность VLM привязывать содержимое к временной шкале (извлечение ключевых кадров по таймкодам).
GGPO строит критический путь от корня к ответу и накладывает градиентную маску, исключая тупиковые узлы из положительных примеров, а ценные ретривы - из отрицательных.
По графикам обучения это дает более быструю сходимость, чем базовый GSPO без прунинга.
При этом средняя длина траектории ниже, чем у ReAct и Mem1: структурированная память съедает меньше действий на ответ.
В репозитории доступны:
Поисковый движок построен на FAISS и поддерживает эмбеддинги GVE-3B/7B и Qwen3-VL-Embedding-2B/8B. Индексировать можно изображения, PDF (через конвертацию) и нарезанное на чанки видео.
Код трейна самого VimRAG обещают выложить после внутреннего ревью Alibaba.
#AI #ML #RAG #VRAG #TongyiLab
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤12👍7🔥4
Forwarded from Machinelearning
🚨 Claude «деградировал» и это видно по логам.
Senior AI Director из AMD разобрала сессии Claude за январь-март и картина получилась неприятная.
Модель стала думать меньше. Медианная длина reasoning упала примерно с 2200 до 600 символов. Это сразу бьёт по качеству решений.
Параллельно выросло количество API-запросов - почти в 80 раз с февраля на март. Меньше анализа, больше попыток, больше ретраев и сжигания токенов.
Поведение тоже поменялось. Модель чаще «сдаётся» или начинает спрашивать, продолжать ли дальше. За 17 дней таких кейсов было 173, до 8 марта - ноль.
Ещё одна неприятность падение reads-per-edit (reads-per-edit = сколько файлов / участков кода модель посмотрела перед правкой). Было 6.6, стало 2.0. То есть Claude теперь хуже изучает код перед изменениями.
Плюс выросло количество противоречий. Модель чаще переобувается по ходу ответа.
Пользователи замечают, что Клод начинает игнорировать такие вещи, как CLAUDE.md. Просто не хватает «бюджета мышления», чтобы учитывать контекст.
Что интресно, наблюдается зависимость от времени суток. Худшие результаты в 5–7 вечера по PST, ночью качество заметно выше. Похоже, это напрямую связано с загрузкой GPU.
Claude всё ещё мощный, но его поведение стало менее стабильным и сильно зависит от нагрузки
Замечали ли вы, что Claude стал тупее в последнее время ?🤯
Директор по AI в AMD проанализировала 6 852 сессии Claude Code и показала, что модель сильно ухудшили.
234 760 вызовов инструментов, 17 871 блоков размышлений, 3 месяца логов.
После этого Anthropic ответили и фактически подтвердили её выводы.
Пожалуй, самый чистый и показательный аудит AI за 2026 год 👇
https://github.com/anthropics/claude-code/issues/42796#issuecomment-4194007103
@ai_machinelearning_big_data
#news #ai #ml #claude
Senior AI Director из AMD разобрала сессии Claude за январь-март и картина получилась неприятная.
Модель стала думать меньше. Медианная длина reasoning упала примерно с 2200 до 600 символов. Это сразу бьёт по качеству решений.
Параллельно выросло количество API-запросов - почти в 80 раз с февраля на март. Меньше анализа, больше попыток, больше ретраев и сжигания токенов.
Поведение тоже поменялось. Модель чаще «сдаётся» или начинает спрашивать, продолжать ли дальше. За 17 дней таких кейсов было 173, до 8 марта - ноль.
Ещё одна неприятность падение reads-per-edit (reads-per-edit = сколько файлов / участков кода модель посмотрела перед правкой). Было 6.6, стало 2.0. То есть Claude теперь хуже изучает код перед изменениями.
Плюс выросло количество противоречий. Модель чаще переобувается по ходу ответа.
Пользователи замечают, что Клод начинает игнорировать такие вещи, как CLAUDE.md. Просто не хватает «бюджета мышления», чтобы учитывать контекст.
Что интресно, наблюдается зависимость от времени суток. Худшие результаты в 5–7 вечера по PST, ночью качество заметно выше. Похоже, это напрямую связано с загрузкой GPU.
Claude всё ещё мощный, но его поведение стало менее стабильным и сильно зависит от нагрузки
Замечали ли вы, что Claude стал тупее в последнее время ?🤯
Директор по AI в AMD проанализировала 6 852 сессии Claude Code и показала, что модель сильно ухудшили.
234 760 вызовов инструментов, 17 871 блоков размышлений, 3 месяца логов.
После этого Anthropic ответили и фактически подтвердили её выводы.
Пожалуй, самый чистый и показательный аудит AI за 2026 год 👇
https://github.com/anthropics/claude-code/issues/42796#issuecomment-4194007103
@ai_machinelearning_big_data
#news #ai #ml #claude
👍22❤8🔥6💯5😢2🤣2😁1
Forwarded from Machinelearning
Издание опубликовало расширенную версию рейтинга TIME100 Most Influential Companies - впервые выбрав их по отраслевому принципу.
Владелец TikTok стал одним из ведущих ИИ-разработчиков Китая: его ассистент Doubao набрал более 155 млн еженедельных пользователей. В 2026 году компания, оценённая примерно в $550 млрд, потратит $14 млрд на чипы Nvidia (при условии одобрения экспорта со стороны США).
Корпорация запустила Project Rainier - один из крупнейших вычислительных ИИ-кластеров в мире, работающий примерно на 500 тыс. собственных чипов Trainium2 и обслуживающий модели Anthropic.
Китайская компания первой среди местных LLM-разработчиков вышла на биржу в Гонконге и в феврале представила модель GLM-5 на 744 млрд параметров. По данным самой компании, её моделями пользуются более 4 млн корпоративных клиентов и разработчиков, а годовая выручка достигла около $107 млн.
Число еженедельных пользователей ChatGPT превысило 900 млн, ежемесячная выручка — $2 млрд. Параллельно OpenAI заключила контракт с Пентагоном и столкнулась с исками, в которых ChatGPT, по утверждению истцов, мог сыграть крайне деструктивную роль по отношению к людям.
Под руководством Сундара Пичаи Google вернулся в число лидеров ИИ: модели Gemini поднялись в верхушку рейтингов возможностей, а годовая выручка Alphabet впервые превысила $400 млрд. ИИ-функции компании встроены в Gmail, Maps, YouTube и сервис беспилотных такси Waymo.
В 2025 году Meta показала рекордную рекламную выручку, частично за счёт ИИ-обработки данных собственных соцсетей, и продолжает вкладываться в исследователей и дата-центры. В марте этого года суд признал Meta ответственной за вред психике несовершеннолетнего пользователя и присудили истцу $6 млн; компания заявила, что обжалует решение.
Claude стал первой ИИ-системой, допущенной в засекреченные сети США, и, по сообщениям СМИ, использовался при планировании военных операций. После отказа Anthropic снять ограничения на массовую слежку и автономное оружие Белый дом объявил компанию риском цепочки поставок.
Семейство открытых моделей Qwen превысило миллиард скачиваний и породило более 200 тыс. производных моделей. Гендиректор Эдди У заявил, что за пять лет компания рассчитывает превысить $100 млрд внешней выручки от облака и ИИ.
Французский стартап, оценённый примерно в $14 млрд, делает ставку на открытые модели и развёртывание на инфраструктуре заказчика; среди её клиентов - ASML, TotalEnergies, HSBC и министерство вооружённых сил Франции. В начале 2026 года её годовая выручка достигла $400 млн (примерно в 20 раз больше, чем годом ранее).
Платформа стала своего рода «GitHub для ИИ»: на ней размещено свыше 2 млн моделей и 500 тыс. датасетов, аккаунты есть более чем у 30% компаний из списка Fortune 500. Компания развивает инструменты для ИИ-агентов и в 2025 году представила открытого робота Reachy Mini.
* Компания Meta признана в России экстремистской организацией и запрещена
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤18👍4🔥4🥱2
Forwarded from Machinelearning
Инструмент интегрируется с Claude Code, Cursor и другими кодинг-агентами.
Raindrop - стартап из 9 человек, основанный в 2023 году, который позиционирует себя одним из первых, кто оформил мониторинг для ИИ-агентов как отдельный продуктовый класс.
При использовании Workshop модель получает прямой доступ к трассировкам выполнения, читает их, пишет оценочные тесты и правит код, замыкая цикл самовосстановления.
Если агент в проде отклоняется от ожидаемого поведения, разработчик вызывает кодинг-агента прямо в терминале. Тот читает трассу через Workshop, пишет оценку под падающий сценарий, правит код и перезапускает прогон.
Цикл повторяется автоматически, пока не пройдут все проверки.
Workshop работает локально и стримит данные в реальном времени. Каждый токен, вызов инструмента и шаг рассуждения попадает в интерфейс по мере выполнения, без поллинга.
Есть режим воспроизведение, который берёт трассу из продакшена и прогоняет её через ваш экземпляр агента, запущенный локально.
Заявлена поддержка TypeScript, Python, Go и Rust, а также фреймворков Vercel AI SDK, OpenAI Agents SDK, Anthropic SDK, Claude Agent SDK, LangChain, LangGraph, CrewAI, Mastra, Pydantic AI и DSPy.
@ai_machinelearning_big_data
#AI #ML #Agents #Workshop #RaindropAI
Please open Telegram to view this post
VIEW IN TELEGRAM
❤8👍8
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
OpenAI готовит заявку на первичное размещение акций на сентябрь. Сэм Альтман торопит процесс, несмотря на позицию финансового директора Сары Фрайар о необходимости дополнительного времени на подготовку.
На этой неделе суд отклонил иск Илона Маска, обвинявшего OpenAI в незаконном переходе от некоммерческой лаборатории к коммерческой структуре. Закрытие дела устранило одно из юридических препятствий для листинга.
Перед размещением OpenAI предстоит обосновать инвесторам бизнес-модель. Основные проблемы - затраты на дата-центры и невыполнение внутренних KPI по выручке и пользователям.
На стратегию также влияет конкуренция: из-за темпов роста Anthropic в корпоративном секторе OpenAI пришлось корректировать план развития.
wsj.com
Администрация США предложила внедрить систему добровольной оценки ИИ-моделей перед выходом на рынок. Инициативу обсуждали на закрытой встрече Управления национальной кибербезопасности США с руководителями ИИ-лабораторий.
Новые правила предполагают передачу правительству доступа к флагманским моделям за 90 дней до релиза. Компании лоббируют сокращение окна тестирования до 14 дней. Критерии отбора систем определят АНБ, УНКБ и Управление по научно-технической политике. Аудит пройдет в конфиденциальном режиме при участии Министерства обороны США.
Поводом для создания механизма стала Mythos от Anthropic. По данным спецслужб, на закрытых тестах система смогла эксплуатировать уязвимости нулевого дня, после чего ведомства ускорили разработку правил превентивного контроля.
theinformation.com
Google добавит инструменты видеоредактора CapCut в интерфейс Gemini. Пользователи смогут монтировать видео и редактировать фото напрямую в диалоговом окне.
Интеграция объединит этапы создания контента: генерацию идей, написание сценария через LLM, склейку и экспорт ролика в одном интерфейсе.
Точная дата релиза совместного продукта пока неизвестна.
Cupcut в сети Х
Google тестирует диалоговые рекламные форматы в поиске на базе Gemini. В ИИ-режиме выдачи модель генерирует текст контекстного объявления с объяснением, как продукт решает задачу из запроса пользователя. Блоки сохранят обязательную пометку о спонсорстве.
Интеграция включает несколько форматов: адаптация креатива под узкие запросы, встраивание коммерческих предложений в сгенерированные рекомендации и персональное обоснование для покупки товаров.
Вместо статичных форм сбора лидов Google добавила встроенного в объявление интерактивного чат-бота, который отвечает на вопросы по базе знаний сайта компании.
В рамках программы Direct Offers, Gemini научилась динамически собирать персональные скидочные наборы. Продавцы, работающие по протоколу UCP смогут закрывать сделки через чекаут напрямую в поисковом интерфейсе.
blog.google
Новая серия построена на базе архитектуры Strix Halo. Чипы поддерживают до 192 ГБ объединенной памяти стандарта LPDDR5X по 256-битной шине и допускают ручное выделение до 160 ГБ в качестве видеопамяти для встроенной графики. Это позволяет локально запускать LLM размером 300 млрд параметров.
Флагманский 16-ядерный чип Ryzen AI Max+ PRO 495 работает на частоте до 5,20 ГГц. Встроенный GPU RDNA 3.5 задействует 40 вычислительных блоков на частоте до 3,00 ГГц. Производительность интегрированного NPU составляет 55 TOPS.
В серию также вошли младшие модели с графикой на 32 блока: 12-ядерный PRO 490 и 8-ядерный PRO 485. Релиз потребительских версий запланирован на конец года.
techpowerup.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍3🔥1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
Белый дом одобрил выделение $9 млрд АНБ и ЦРУ на закупку ускорителей Nvidia Grace Blackwell. Цель - создание изолированной ИИ-инфраструктуры.
Спецслужбы закупят в обход Пентагона невыпущенную модель Mythos от Anthropic. Технические требования Mythos позволяют развернуть ее на серверах предыдущего поколения, пока строятся новые дата-центры.
Ранее Минобороны США настаивало на праве использовать алгоритмы для любых законных целей, против чего выступала Anthropic. В итоговом контракте этот пункт убрали. Вместо него прописан прямой запрет применять Mythos для анализа данных и слежки за гражданами США.
Ожидается, что документ станет юридическим шаблоном для будущих контрактов со всеми ИИ-разработчиками.
nytimes.com
Команда Preparedness в OpenAI открыла вакансию исследователя рисков автономного развития ИИ с зарплатой $445 000.
В задачи специалиста войдет разработка инструментов интерпретируемости, защита от отравления данных и внедрение метрик для оценки скорости автоматизации труда инженеров.
По планам Сэма Альтмана, к сентябрю 2026 года компания запустит автоматизированного ИИ-стажера для исследований. Появление полностью автономных R&D-систем прогнозируется к 2028 году.
businessinsider.com
Apple добавила поддомен genai.apple.com на свои DNS-серверы. Страница пока недоступна, назначение этого портала неизвестно.
Ожидается, что 8 июня на WWDC 2026 компания представит iOS 27, iPadOS 27 и macOS 27. В новых версиях Siri получит интерфейс чат-бота и функцию распознавания экранного контекста.
Apple Intelligence расширит функциональность базовых сервисов. Voice Control начнет распознавать команды на естественном языке без жестких шаблонов. Алгоритмы Visual Intelligence смогут напрямую парсить данные с визиток или сканировать состав продуктов, а Safari получит автогенерацию названий для групп вкладок.
Также заявлена поддержка создания быстрых команд с помощью ИИ и генерация автоматических субтитров для видео.
macrumors.com
xAI завершила претрейн модели Grok V9-Medium на 1.5T параметров. Публичный релиз ожидается через две-три недели.
Сейчас команда проводит файн-тюнинг, после чего перейдёт к этапу RL. По словам Илона Маска, первые внутренние тесты показали положительные результаты.
На этапе дополнительного обучения разработчики задействовали массив данных от редактора Cursor. xAI рассчитывает, что это улучшит показатели модели в кодинге по сравнению с предыдущей версией v8-small.
Elon Musk в сети Х
LeRobot (подразделение Hugging Face) выпустила open-source проект двуногого робота. Детали корпуса печатаются на 3D-принтере, стоимость сборки со стандартными приводами составляет около $2500.
В релиз вошли инструменты симуляции, алгоритмы калибровки, sim-to-real пайплайны и базовые модели обучения ходьбе. Пока для сборки доступна только нижняя часть платформы. Интеграция плечевого пояса и обучение моторике всего тела заявлены в дорожной карте.
Использование 3D-печати позволяет самостоятельно перепечатывать сломанные детали и не прерывать исследования локомоции на время ожидания запчастей.
huggingface.co
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤2👍2🔥1
Forwarded from Machinelearning
Китайская компания проводит первый в своей истории раунд привлечения внешнего капитала около 50 млрд юаней ($7,4 млрд).
По данным агентства Reuters, после вложений компанию оценят в 350–400 млрд юаней ($52–59 млрд).
Крупнейшими внешними инвесторами могут стать интернет-холдинг Tencent и производитель аккумуляторов CATL: первый рассматривает вложение 10 млрд юаней, второй - 5 млрд.
Основатель DeepSeek Liang Wenfeng, по словам источников, внесёт 20 млрд юаней собственных средств (это самый крупный частный взнос в раунде).
Переговоры также ведутся с государственным фондом поддержки ИИ КНР, а также с NetEase и JD.com. Общее число инвесторов, как ожидается, не превысит десяти. Среди возможных участников называют гонконгские IDG Capital и Monolith Management.
На фоне западных сделок раунд выглядит скромно: Anthropic в прошлом месяце привлёк $65 млрд, OpenAI в марте - $122 млрд.
О планах выхода на биржу DeepSeek пока не заявлял.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤8👍4😍2🤣1
Forwarded from Machinelearning
Anthropic опубликовала аналитический материал, в котором утверждает, что системы искусственного интеллекта всё активнее участвуют в создании следующих поколений ИИ.
Материал подготовлен исследовательским подразделением Anthropic Institute. Его авторы - Марина Фаваро и сооснователь компании, глава отдела политики Джек Кларк.
Отрасль приближается к рекурсивному самоулучшению
Это состояние, когда ИИ способен самостоятельно проектировать и совершенствовать собственного преемника быстрее, чем к этому будут готовы правительства и институты.
При этом Anthropic оговаривается, что до полностью автономной разработки ещё далеко и что такой сценарий не является неизбежным, люди по-прежнему нужны. Они ставят цели, оценивают результаты и решают, какие направления важны.
На май 2026 года Claude написал более 80% кода, добавляемого в кодовую базу Anthropic.
До запуска Claude Code этот показатель измерялся единицами процентов.
Во втором квартале 2026 года типичный инженер вносил в проекты примерно в 8 раз больше кода в день, чем в 2024-м.
Время выполнения задач, которые модели способны надёжно решать без участия человека, удваивается примерно каждые 4 месяца.
В начале 2024 года Opus 3 справлялся с задачами длиной в несколько минут, годом позже Sonnet 3.7 примерно за полтора часа, а Opus 4.6 - до 12 часов.
На SWE-bench, проверяющем исправление реальных ошибок в коде, передовые модели за два года прошли путь от низких результатов до почти предельных.
Джек Кларк говорит, что компания хочет, чтобы законодатели и институты понимали, что может произойти дальше.
По его словам, цель Anthropic - "заранее обозначить концепцию и дать людям представление о том, что приближается".
Прогресс ИИ, по его оценке, скорее ускоряется, чем замедляется, и может принести значительные результаты в медицине и науке, но требует инструментов для проверки и подтверждения работы, выполненной ИИ.
Anthropic выступает за то, чтобы у мира оставалась возможность при необходимости замедлить или временно приостановить разработку передовых моделей, но понимает, что это потребует согласованных всех игроков индустрии в разных странах и механизмов взаимной проверки.
В ближайшие месяцы компания обсудит эти вопросы с законодателями, исследователями и другими участниками отрасли.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤8🥱5🔥2😱2👍1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
Сделка по приобретению стартапа облачной оркестрации Ona позволит агентам OpenAI выполнять долгие задачи автономно, без привязки к локальным устройствам и активным сессиям пользователя.
Интеграция решений Ona даст изолированную среду для многочасовой работы с кодом, с возможностью удаленно подключаться к фоновым процессам для корректировки действий, проверки промежуточных результатов и утверждения решений.
Команда стартапа перейдет в OpenAI после одобрения сделки регуляторами.
openai.com
Консорциум представил платформу Project Tapestry для федеративного обучения открытых моделей. Участники будут тренировать её на локальных данных с использованием собственных вычислительных мощностей. В общую систему попадут только обновленные веса.
Ян Лекун, консультант проекта, пообещал, что контрибьюторы получат доступ к итоговой базовой модели. На ее основе компании смогут создавать независимые версии под свои бизнес-задачи.
Сейчас инженеры проекта тестируют архитектуру платформы и формируют каталог данных. Релиз инфраструктуры запланирован на сентябрь 2026 года.
До конца года AI Alliance планирует обучить первую компактную модель, а к лету 2027 выпустить вариант уровня проприетарных SOTA-решений.
thealliance.ai
Игорь Бабушкин, стоявший у истоков xAI и ранее работавший в OpenAI и Google DeepMind, объявил о создании компании River AI, которая будет заниматься созданием адаптивных ИИ-агентов.
Идеология проекта строится на расширении человеческих возможностей через персонализацию и полном контроле ИИ. В перспективе стартап планирует заняться разработкой аппаратных решений и физической инфраструктуры.
Костяк команды сформировали выходцы из xAI. К Бабушкину присоединились руководитель продуктовой безопасности Винсент Старк, юрисконсульт Лили Лим, а также инженеры братья Соболевы.
bloomberg.com
Visa интегрировала платежную сеть в ChatGPT. ИИ-агенты получили возможность самостоятельно проводить транзакции от лица пользователя у любого продавца с поддержкой карт сервиса. Для работы функции достаточно привязать карту к чат-боту.
OpenAI обеспечивает логику автономных агентов, Visa отвечает за авторизацию платежей и фрод-мониторинг. Пользователям доступны инструменты контроля: лимиты трат, белые списки магазинов и опция обязательного подтверждения операций.
Оспаривание платежей проходит по стандартным правилам Visa. Регламент планируют адаптировать для случаев, когда продавец действовал корректно, а ошибочный заказ произошел из-за сбоя в логике ИИ.
visa.com
Стриминговый сервис создал инструмент, который ищет и определяет ИИ-треки. Алгоритм анализирует медиатеки пользователей и выявляет синтетический контент на 20 стриминговых платформах. Инструмент поддерживает 27 языков.
По словам директора компании Алексиса Лантернье, ежедневно на Deezer загружается около 75 тысяч ИИ-композиций, это более 44% от всех новых релизов, а почти у половины пользователей, переходящих от конкурентов, в сохраненных подборках уже есть сгенерированная музыка.
Исследование Deezer и Ipsos показало, что 97% слушателей не отличают ИИ-музыку от реальной, но 80% требуют обязательной маркировки. Платформа уже начала пессимизировать сгенерированный контент, исключая его из рекомендаций и подборок.
deezer.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍8❤5🔥2
Forwarded from Machinelearning
The Wall Street Journal со ссылкой на судебные документы, ставшие публичными в ходе процесса "Маск против OpenAI", опубликовала расследование о том, что контракты OpenAI повышали оценку стартапов, в которые лично вкладывается Сэм Альтман.
Для контекста: Альтман не владеет долей в самой OpenAI, поэтому его доходы зависят от внешних инвестиций.
OpenAI заключает контракт или соглашение о сотрудничестве, что поднимает оценку стартапа. Затем крупные акционеры OpenAI (например, Thrive Capital) или партнёры (SoftBank) выкупают доли стартапа, от чего личное состояние Альтмана растёт, так как он является их инвестором.
В 2025 году Сэм предлагал OpenAI вложить около $500 млн в термоядерный стартап Helion. Часть сотрудников восприняла идею с настороженностью, и от прямых инвестиций компания отказалась.
В марте 2026 года стороны подписали пересмотренное соглашение о сотрудничестве и тогда же Альтман вышел из совета директоров Helion, объяснив это конфликтом интересов.
В июне 2026 года Helion оценили в $15,5 млрд, а личная доля Альтмана выросла как минимум до $4,1 млрд.
После того как производитель чипов получил от OpenAI обязательство о закупках и провёл IPO, стоимость доли Альтмана выросла более чем в 6 раз по сравнению с декабрём 2025 года.
После соглашения о научном сотрудничестве с OpenAI доля Альтмана в этой компании по продлению жизни к декабрю 2025 года достигла $258 млн.
Всего, по данным WSJ, не менее 10 компаний из инвестиционного портфеля Альтмана имеют сделки с OpenAI.
Комитет Палаты представителей США по надзору начал официальное расследование, а генеральные прокуроры нескольких штатов призвали Комиссию по ценным бумагам и биржам проверить деятельность главы OpenAI в преддверии IPO.
Сам Альтман и представители компаний называют сотрудничество обычной практикой.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤8👍2😍2
Forwarded from Machinelearning
На GitHub появился любопытный тикет, который (если подтвердится) бьёт по базовой гарантии Антропик - изоляции пользователей друг от друга.
В рабочем контексте Claude Code внезапно оказались чужие учётные данные - IP и root открытым текстом от сервера, к которому автор не имеет никакого отношения.
Ассистент принял чужие креды за легитимные, подключился к серверу по SSH, перечислил Docker-контейнеры и базы PostgreSQL, после чего выполнил миграцию с операциями чтения и записи.
Иными словами, ИИ одного пользователя отредактировал базу другого без ведома и согласия владельца.
В тематических сообществах обсуждают версию сбоя изоляции кэша общих префиксов.
Чтобы удешевить инференс и ускорить обработку, провайдеры переиспользуют кэшированные фрагменты диалогов, и при коллизии ключей кэша или отказе разграничения кусок чужого контекста теоретически может просочиться в вашу сессию.
Если эта версия верна, под угрозой данные любого пользователя. Но это лишь одна из гипотез, в самом отчёте среди возможных векторов названы также общее хранилище сессий, путаница при суммаризации контекста и перекрёстные ссылки в транскриптах.
Возможно, это галлюцинация модели, случайно угадавшей реальный IP и слабый пароль, либо локальная история проекта, загрязнившая контекст.
Пока Антропик не выпустила официального заключения, ни одну из версий нельзя ни подтвердить, ни отвергнуть.
Автоматика GitHub повесила на тикет метку
security.@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
😱11👍3❤2😁1
Это первый случай, когда OpenAI отказывается от самостоятельного продукта ради унификации своей экосистемы.
Теперь возможности Atlas станут частью десктопных версий ChatGPT и Codex. Обновленное приложение ChatGPT уже получило встроенный инструмент для веб-серфинга, а ИИ-агенты научились напрямую взаимодействовать с элементами страниц.
Автоматического переноса пользовательских данных не будет. До закрытия сервиса всю историю, закладки и важные вкладки придется экспортировать вручную.
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤7🔥3🥰2😁2🙏1🍌1🤨1
Forwarded from Machinelearning
Cемейство Gemini пополнилось моделями 3.6 Flash, 3.5 Flash-Lite и специализированной 3.5 Flash Cyber.
Модель расходует на 17% меньше выходных токенов, чем предыдущая версия 3.5 Flash. Говорят, что подтянули у неё кодинг и офисные задачи.
Стоимость - 1,5 доллара за миллион входных и 7,5 доллара за миллион выходных токенов.
Ориентирована на массовые и быстрые задачи. Заявленная скорость - 350 токенов в секунду при цене 30 центов за миллион входных токенов.
Модель, натасканная на поиск и исправления уязвимостей в коде, которая не поступит в открытый доступ - её получат только правительства и доверенные партнёры в рамках ограниченной пилотной программы.
Google также сообщила о планах - 3.5 Pro тестируется с партнёрами, а команда уже начала обучение Gemini 4, которое в компании называют самым масштабным на сегодняшний день. Сроки выхода не названы.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👍3
Китайский гигант запустил инициативу STEM Scientist в рамках проекта Seed. Компания отберет 100 ученых и аспирантов для полугодовой работы над применением машинного обучения в фундаментальной науке.
Программа предполагает 2 формата: позиции научных консультантов для отраслевых экспертов и стажировки для PhD-студентов STEM-направлений.
Базовое требование - опыт использования ИИ в исследованиях. Навыки программирования станут плюсом.
Со своей стороны ByteDance предоставляет зарплату, доступ к вычислительным ресурсам и работу с собственной ИИ-командой.
Участие требует очного присутствия в пекинском офисе компании. Заявки принимаются до 30 сентября 2026 года.
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍13🔥4❤3
Тибор Блахо обнаружил в публичных конфигурациях оплаты и веб-ресурсах ChatGPT скрытые параметры, указывающие на внедрение новой системы сброса квот.
Судя по всему, OpenAI планирует продавать дополнительные пакеты запросов для разных уровней подписки.
На скриншотах видно, что для тарифа Plus опция обойдется от 5 или 8 долларов. Владельцам Pro Lite придется заплатить 25 или 40 долларов, а для максимального плана Pro цена восполнения составит 50 или 80 долларов.
Все суммы указаны без учета налогов, а точные отличия между двумя ценовыми вариантами внутри каждого уровня пока остаются неизвестными.
Сейчас OpenAI уже позволяет подписчикам Plus и Pro докупать кредиты после исчерпания базового объема, а также предлагает бонусные пополнения за определенные активности.
Скорее всего, новая тарификация сделает процесс расширения лимитов более гибким и структурированным.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7🤣4❤3🥰3🤔3
Forwarded from AI VK Hub
Большинство современных рекомендательных моделей решает локальную задачу — предсказать следующее взаимодействие или следующий положительный фидбэк. Мы сформулировали задачу как RL на уровне сессии и обучили кандидатогенератор через off-policy REINFORCE на логах.
На индустриальных данных такая модель выигрывает у next-item и next-positive prediction по всем оценкам награды за сессию, сохраняя качество кандидатогенерации по recall-метрикам.
#aivkhub #ml #recsys
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5🔥3🥰2
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
Private Safety Processing - механизм для API и корпоративных клиентов, работающий по принципу нулевого хранения данных. Он разбирает серии запросов и ищет признаки злонамеренного использования, но сотрудники OpenAI при этом не видят ни промптов, ни ответов модели.
Данные либо вообще не покидают периметр клиента, либо лежат на серверах OpenAI зашифрованными ключом самого заказчика. Если система замечает риск, наружу уходит только технический сигнал о типе угрозы, без содержания диалога.
Пока Private Safety Processing в закрытом тестировании. Публичный релиз с технической документацией обещают в сентябре. У пользователей ChatGPT на тарифах Free, Plus, Go и Pro настройки приватности не меняются.
openai.com
Anthropic вместе со своим подразделением Ode покупает ИИ-интегратора Casper Studios. Сумма сделки не раскрывается. Для Ode, запущенного в июле 2026 года, это первое приобретение.
Ode делает автоматизацию под заказ на моделях Anthropic. Casper Studios и раньше была авторизованным партнером Anthropic, среди ее клиентов - Netflix, Pepsi и хедж-фонды.
Смысл покупки в том, что у самих заказчиков не хватает специалистов по ИИ. Команда Casper как раз умеет доводить внедрение до конца на стороне клиента - собирает внутренние датасеты, стыкует модели с существующей ИТ-инфраструктурой и встраивает Claude в рабочие процессы.
theinformation.com
Стартап представил модель GEN-1.5 с обучением в контексте. Чтобы освоить новый навык, в контекстное окно подается видео на 3-12 секунд, и оно работает как промпт.
На простых задачах (открыть банку или вытащить купюру) модель справляется в 59% случаев. Если все же дообучить - показатель поднимается до 83%.
Претрейн занял восемь месяцев на датасетах физических взаимодействий. GEN-1.5 умеет сцеплять два промпта в последовательность, учиться на демонстрациях из симуляции и повторять моторику человеческих рук.
generalistai.com
Generate Music собирает фоновые треки, Generate Speech озвучивает текст, Generate Sound Effects делает эффекты под конкретную сцену. Adobe заявляет, что все созданное не требует лицензионных отчислений и годится для коммерческого использования.
В платформу завезли Gemini Omni Flash от Google - она работает с видео, аудио, изображениями и текстом. Модель пополнила существующий набор, где уже есть Runway, Luma AI и Kling AI.
Заодно у Firefly AI Assistant появился дневной лимит бесплатных генераций.
adobe.com
Модель сделана для разговора в реальном времени - под телефонных ИИ-агентов и голосовых помощников. Режим Expressive Mode смотрит на контекст диалога и добавляет в речь живые реакции (смех, шепот, вздохи), подбирая их под эмоциональный фон разговора.
Отдельно переделали то, как модель общается с собеседником - теперь она подключена к потоковой расшифровке Scribe v2 Realtime и умеет отличает законченную мысль от угуканья в знак согласия. Перебивать человека она стала реже.
v3 Conversational знает 70 языков и держит акценты. Работает через API и платформу ElevenAgents, базовая цена - 5 центов за 1000 символов.
ElevenLabs в X
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5❤4👍2
This media is not supported in your browser
VIEW IN TELEGRAM
Проектировать интерфейс теперь можно до написания кода - в терминале или в десктопном приложении.
Достаточно дать базовый промпт (например, несколько вариантов экрана под конкретную задачу), указать команду
/design и модель выдает серию набросков в виде интерактивных Artifacts. Удачный вариант точечно доработать и передать в код.Как пояснил инженер Anthropic Нейт Парротт, модель при этом читает существующую кодовую базу проекта - чтобы новые компоненты сразу попадали в визуальный стиль приложения.
Одно ограничение - макеты учитываются при генерации кода, но сохранять их приходится вручную.
Чтобы попробовать, обновите Claude Code командой
claude update.#news #ai #ml
@data_analysis_ml / Папка полезного по ML.
Please open Telegram to view this post
VIEW IN TELEGRAM
❤11🔥9👍4
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
Prime Agent — это больше, чем харнесс модели. Сами авторы называют проект операционной системой для долгоживущих агентов.
Умнее модель он не делает, но дает ей работать дольше - программно раскладывать информацию, параллельно раздавать задачи подагентам и копить полезные процедуры.
Идея в том, чтобы у языковой модели была устойчивая вычислительная среда, где она сама распоряжается памятью, кодом, подагентами и долгими задачами.
Состояние в системе разложено по четырем уровням:
Состояние переживает и шаги, и перезапуски, и отключения. Человек при этом может наблюдать за агентами и вмешиваться.
Сильнее всего эффект виден на длинных интерактивных задачах. На ARC-AGI-3 конфигурация с Opus 5 дала 95,5% Best@1 против 30,2% у обвязки самой ARC.
На длинноконтекстных задачах Prime Agent держится наравне с конкурентами, а на отдельных, вроде EmulatorBench, заметно вырывается вперед. Он обошел Pi-mono с GLM-5.2 и Codex с GPT-5.6 Sol, но уступил Claude Code с Opus 5.
Отдельно показательны игровые прогоны на эмуляторах. На Sega Genesis связка Prime Agent и GPT-5.6 Sol набрала 61,6% по итоговой оценке верификатора, а Claude Code с той же моделью — ноль. На Game Boy Color разрыв еще резче: 99,8% против нуля.
Самая любопытная деталь отчета - накопление навыков закрепляет не только полезное.
В одном из экспериментов агент нашел способ обходить ограничения Factorio, сохранил его как переиспользуемый навык и тем самым записал эксплойт в долговременную память. Дальше он доставал оттуда именно это решение, потому что оно один раз сработало.
На днях вышел релиз 0.8.0 с исправлениями найденных проблем и новыми возможностями.
@ai_machinelearning_big_data
#AI #ML #Harness #Agents #PrimeIntellect
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👍2🥴1
Qwen вместе с Taobao & Tmall и сделала E-Commerce Bench, где агенту дают 100 тысяч юаней и 365 виртуальных дней. Он изучает категории, торгуется с поставщиками, назначает цены, следит за календарём распродаж, тянет склад и контролирует денежные потоки, причём одновременно может вести до четырёх магазинов.
Ни потолок спроса, ни себестоимость ему не показаны - до всего нужно докопаться самому.
Рабочий день идёт с 8 утра до 6 вечера, и каждый вызов инструмента тратит время: проверить деньги (10 минут), открыть магазин (60), написать поставщику (30).
Расходы списываются сразу, а выручка идёт через комиссию, эскроу, 9 дней ожидания и ручной вывод.
Склад сводится посуточно, товар, не отправленный за двое суток, отменяется, а репутация напрямую множит спрос: магазин на дне её шкалы получает 15% от обычного трафика.
Если бы роль поставщика играла языковая модель, одна и та же стратегия давала бы разные цены, а бенч превратился бы в соревнование по джейлбрейку. Поэтому все уступки и отказы считает жёсткий алгоритм, а модель лишь переводит его решения в речь на виртуальных переговорах.
GPT-5.6 Sol - лидер, он закончил год с 1,43 млн юаней, увеличив капитал в 14,3 раза.
Qwen3.8-Max-Preview - лучшая среди моделей с открытыми весами, на конец года у нее было 416 тыс. юаней
Qwen3.5-Plus остался с 1100 юанями.
Кстати, 10 циклов из 90 закончились банкротством, и сценарий почти всегда один - забить склад в январе и не суметь распродать.
Торговаться толком не научился никто.
До себестоимости поставщика не додавил ни один агент. Единственный, кто хоть как-то сбивал цену - Opus 4.7, но по настроению.
Исключение - Qwen3.8-Max-Preview, которая продавливает цену ниже на повторных заказах.
С мошенниками вышло интереснее всего.
Их в реестре 152 из 576 (26,4%), они пишут всем моделям, но у Opus 4.7 деньги получили 4% тех мошенников, с кем он заговорил, у GPT-5.6 Sol - 31,7%.
ИИ-предприниматели категорически не умеют распоряжаться рабочим временем.
Отправки, переходы на следующий день, вывод наличных и выкладка товара съедают 71,8% всех вызовов. На разговоры с поставщиками приходится 6%. На пересмотр цен 0,66%.
Модели заняты обслуживанием процесса, а не экономикой.
Отсюда странность в рейтинге эффективности. Fable5 зарабатывает 479 юаней на вызов против 363 у Sol, тратя при этом почти вдвое меньше вызовов, а по итоговым деньгам идёт позади.
Измерять обучение на длинной дистанции сложно, но тут у бенча есть линейка.
Ядро переговоров никогда не уходит ниже собственной себестоимости, значит лучшая цена, которую агент однажды выбил, - это верхняя граница того, за сколько поставщик готов отдать товар. Дальше можно сравнивать - следующая закупка у того же поставщика прошла дешевле или дороже уже достигнутого.
На 8647 повторных покупок улучшили свой же результат только 2 модели из 18, а 15 переплачивали настолько, что промахивались мимо случайного порядка больше чем на 2 стандартных отклонения.
#AI #ML #Agents #ECommerce #Benchmark #Qwen
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥11❤8👍5