Анализ данных (Data analysis)
50.6K subscribers
3.55K photos
446 videos
1 file
2.9K links
Data science, наука о данных.

@haarrp - админ

РКН: clck.ru/3FmyAp
Download Telegram
🌟 VimRAG: мультимодальный RAG-агент, который держит контекст в виде графа памяти.

Tongyi Lab (Alibaba Group) опубликовала VimRAG - фреймворк агентного RAG для работы с текстом, изображениями и видео.

Проект развивает прошлогодний VRAG-RL и решает проблему мультимодального RAG: визуальные данные тяжелые по токенам, но семантически разрежены, а классическая ReAct-история забивает контекст шумом и провоцирует повторные бесполезные запросы к поиску.


Вместо журнала наблюдений VimRAG моделирует рассуждение как динамический направленный ацикличный граф. Каждая вершина хранит подзапрос, действие агента, текстовое саммари и банк визуальных токенов.

Ребра фиксируют логические зависимости между шагами. Такой граф позволяет агенту отличать тупиковую ветку от новой гипотезы и не уходить в циклы повторных поисков.

🟡 Поверх графа работает Graph-Modulated Visual Memory Encoding.

Бюджет визуальных токенов распределяется с учетом исходящей степени в графе, экспоненциального временного затухания (имитация забывания) и рекурсивной обратной связи от потомков.

Ключевым фрагментам достается высокое разрешение, а второстепенные кадры сжимаются или отбрасываются. Для видео задействована способность VLM привязывать содержимое к временной шкале (извлечение ключевых кадров по таймкодам).

🟡Третий компонент - Graph-GPO.

GGPO строит критический путь от корня к ответу и накладывает градиентную маску, исключая тупиковые узлы из положительных примеров, а ценные ретривы - из отрицательных.

По графикам обучения это дает более быструю сходимость, чем базовый GSPO без прунинга.


🟡Тесты

🟢VimRAG обходит Vanilla RAG, ReAct, VideoRAG, UniversalRAG, MemAgent и Mem1 на 9 бенчмарках (HotpotQA и SQuAD до SlideVQA, MMLongBench, LVBench и XVBench).

🟢На Qwen3-VL-8B-Instruct средний скор поднимается с 43,6 до 50,1, на 4B-версии - с 40,6 до 45,2.

При этом средняя длина траектории ниже, чем у ReAct и Mem1: структурированная память съедает меньше действий на ответ.

В репозитории доступны:

🟠тренировочный фреймворк VRAG-RL, демо VRAG на тестовой Qwen2.5-VL-7B-VRAG через vLLM (нужна A100 80GB);

🟠демо на API Qwen3.5-Plus через DashScope (с визуализацией DAG рассуждения и расширенным ризонингом).

Поисковый движок построен на FAISS и поддерживает эмбеддинги GVE-3B/7B и Qwen3-VL-Embedding-2B/8B. Индексировать можно изображения, PDF (через конвертацию) и нарезанное на чанки видео.

Код трейна самого VimRAG обещают выложить после внутреннего ревью Alibaba.



🟡Arxiv
🟡Модель
🖥GitHub

#AI #ML #RAG #VRAG #TongyiLab
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
12👍7🔥4
Forwarded from Machinelearning
🚨 Claude «деградировал» и это видно по логам.

Senior AI Director из AMD разобрала сессии Claude за январь-март и картина получилась неприятная.

Модель стала думать меньше. Медианная длина reasoning упала примерно с 2200 до 600 символов. Это сразу бьёт по качеству решений.

Параллельно выросло количество API-запросов - почти в 80 раз с февраля на март. Меньше анализа, больше попыток, больше ретраев и сжигания токенов.

Поведение тоже поменялось. Модель чаще «сдаётся» или начинает спрашивать, продолжать ли дальше. За 17 дней таких кейсов было 173, до 8 марта - ноль.

Ещё одна неприятность падение reads-per-edit (reads-per-edit = сколько файлов / участков кода модель посмотрела перед правкой). Было 6.6, стало 2.0. То есть Claude теперь хуже изучает код перед изменениями.

Плюс выросло количество противоречий. Модель чаще переобувается по ходу ответа.

Пользователи замечают, что Клод начинает игнорировать такие вещи, как CLAUDE.md. Просто не хватает «бюджета мышления», чтобы учитывать контекст.

Что интресно, наблюдается зависимость от времени суток. Худшие результаты в 5–7 вечера по PST, ночью качество заметно выше. Похоже, это напрямую связано с загрузкой GPU.

Claude всё ещё мощный, но его поведение стало менее стабильным и сильно зависит от нагрузки

Замечали ли вы, что Claude стал тупее в последнее время ?🤯


Директор по AI в AMD проанализировала 6 852 сессии Claude Code и показала, что модель сильно ухудшили.

234 760 вызовов инструментов, 17 871 блоков размышлений, 3 месяца логов.

После этого Anthropic ответили и фактически подтвердили её выводы.

Пожалуй, самый чистый и показательный аудит AI за 2026 год 👇

https://github.com/anthropics/claude-code/issues/42796#issuecomment-4194007103

@ai_machinelearning_big_data

#news #ai #ml #claude
👍228🔥6💯5😢2🤣2😁1
Forwarded from Machinelearning
📌TIME назвал 10 самых влиятельных компаний 2026 года в сфере ИИ

Издание опубликовало расширенную версию рейтинга TIME100 Most Influential Companies - впервые выбрав их по отраслевому принципу.

🟡ByteDance

Владелец TikTok стал одним из ведущих ИИ-разработчиков Китая: его ассистент Doubao набрал более 155 млн еженедельных пользователей. В 2026 году компания, оценённая примерно в $550 млрд, потратит $14 млрд на чипы Nvidia (при условии одобрения экспорта со стороны США).

🟡Amazon

Корпорация запустила Project Rainier - один из крупнейших вычислительных ИИ-кластеров в мире, работающий примерно на 500 тыс. собственных чипов Trainium2 и обслуживающий модели Anthropic.

🟡Zhipu

Китайская компания первой среди местных LLM-разработчиков вышла на биржу в Гонконге и в феврале представила модель GLM-5 на 744 млрд параметров. По данным самой компании, её моделями пользуются более 4 млн корпоративных клиентов и разработчиков, а годовая выручка достигла около $107 млн.

🟡OpenAI

Число еженедельных пользователей ChatGPT превысило 900 млн, ежемесячная выручка — $2 млрд. Параллельно OpenAI заключила контракт с Пентагоном и столкнулась с исками, в которых ChatGPT, по утверждению истцов, мог сыграть крайне деструктивную роль по отношению к людям.

🟡Alphabet

Под руководством Сундара Пичаи Google вернулся в число лидеров ИИ: модели Gemini поднялись в верхушку рейтингов возможностей, а годовая выручка Alphabet впервые превысила $400 млрд. ИИ-функции компании встроены в Gmail, Maps, YouTube и сервис беспилотных такси Waymo.

🟡Meta*

В 2025 году Meta показала рекордную рекламную выручку, частично за счёт ИИ-обработки данных собственных соцсетей, и продолжает вкладываться в исследователей и дата-центры. В марте этого года суд признал Meta ответственной за вред психике несовершеннолетнего пользователя и присудили истцу $6 млн; компания заявила, что обжалует решение.

🟡Anthropic

Claude стал первой ИИ-системой, допущенной в засекреченные сети США, и, по сообщениям СМИ, использовался при планировании военных операций. После отказа Anthropic снять ограничения на массовую слежку и автономное оружие Белый дом объявил компанию риском цепочки поставок.

🟡Alibaba

Семейство открытых моделей Qwen превысило миллиард скачиваний и породило более 200 тыс. производных моделей. Гендиректор Эдди У заявил, что за пять лет компания рассчитывает превысить $100 млрд внешней выручки от облака и ИИ.

🟡Mistral

Французский стартап, оценённый примерно в $14 млрд, делает ставку на открытые модели и развёртывание на инфраструктуре заказчика; среди её клиентов - ASML, TotalEnergies, HSBC и министерство вооружённых сил Франции. В начале 2026 года её годовая выручка достигла $400 млн (примерно в 20 раз больше, чем годом ранее).

🟡Hugging Face

Платформа стала своего рода «GitHub для ИИ»: на ней размещено свыше 2 млн моделей и 500 тыс. датасетов, аккаунты есть более чем у 30% компаний из списка Fortune 500. Компания развивает инструменты для ИИ-агентов и в 2025 году представила открытого робота Reachy Mini.

* Компания Meta признана в России экстремистской организацией и запрещена


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
18👍4🔥4🥱2
Forwarded from Machinelearning
🌟 Raindrop открыла исходный код локального отладчика агентов Workshop

Инструмент интегрируется с Claude Code, Cursor и другими кодинг-агентами.

Raindrop - стартап из 9 человек, основанный в 2023 году, который позиционирует себя одним из первых, кто оформил мониторинг для ИИ-агентов как отдельный продуктовый класс.


При использовании Workshop модель получает прямой доступ к трассировкам выполнения, читает их, пишет оценочные тесты и правит код, замыкая цикл самовосстановления.

Если агент в проде отклоняется от ожидаемого поведения, разработчик вызывает кодинг-агента прямо в терминале. Тот читает трассу через Workshop, пишет оценку под падающий сценарий, правит код и перезапускает прогон.

Цикл повторяется автоматически, пока не пройдут все проверки.


Workshop работает локально и стримит данные в реальном времени. Каждый токен, вызов инструмента и шаг рассуждения попадает в интерфейс по мере выполнения, без поллинга.

Есть режим воспроизведение, который берёт трассу из продакшена и прогоняет её через ваш экземпляр агента, запущенный локально.

Заявлена поддержка TypeScript, Python, Go и Rust, а также фреймворков Vercel AI SDK, OpenAI Agents SDK, Anthropic SDK, Claude Agent SDK, LangChain, LangGraph, CrewAI, Mastra, Pydantic AI и DSPy.


📌 Лицензирование: MIT License


🟡Документация
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #Agents #Workshop #RaindropAI
Please open Telegram to view this post
VIEW IN TELEGRAM
8👍8
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
✔️Сэм Альтман форсирует выход OpenAI на IPO в сентябре

OpenAI готовит заявку на первичное размещение акций на сентябрь. Сэм Альтман торопит процесс, несмотря на позицию финансового директора Сары Фрайар о необходимости дополнительного времени на подготовку.

На этой неделе суд отклонил иск Илона Маска, обвинявшего OpenAI в незаконном переходе от некоммерческой лаборатории к коммерческой структуре. Закрытие дела устранило одно из юридических препятствий для листинга.

Перед размещением OpenAI предстоит обосновать инвесторам бизнес-модель. Основные проблемы - затраты на дата-центры и невыполнение внутренних KPI по выручке и пользователям.

На стратегию также влияет конкуренция: из-за темпов роста Anthropic в корпоративном секторе OpenAI пришлось корректировать план развития.
wsj.com

✔️ Белый дом предлагает тестировать ИИ-модели за 90 дней до релиза

Администрация США предложила внедрить систему добровольной оценки ИИ-моделей перед выходом на рынок. Инициативу обсуждали на закрытой встрече Управления национальной кибербезопасности США с руководителями ИИ-лабораторий.

Новые правила предполагают передачу правительству доступа к флагманским моделям за 90 дней до релиза. Компании лоббируют сокращение окна тестирования до 14 дней. Критерии отбора систем определят АНБ, УНКБ и Управление по научно-технической политике. Аудит пройдет в конфиденциальном режиме при участии Министерства обороны США.

Поводом для создания механизма стала Mythos от Anthropic. По данным спецслужб, на закрытых тестах система смогла эксплуатировать уязвимости нулевого дня, после чего ведомства ускорили разработку правил превентивного контроля.
theinformation.com

✔️ Инструменты CapCut будут встроены в интерфейс Google Gemini

Google добавит инструменты видеоредактора CapCut в интерфейс Gemini. Пользователи смогут монтировать видео и редактировать фото напрямую в диалоговом окне.

Интеграция объединит этапы создания контента: генерацию идей, написание сценария через LLM, склейку и экспорт ролика в одном интерфейсе.

Точная дата релиза совместного продукта пока неизвестна.
Cupcut в сети Х

✔️ Gemini начнет генерировать контекстную рекламу в поиске Google

Google тестирует диалоговые рекламные форматы в поиске на базе Gemini. В ИИ-режиме выдачи модель генерирует текст контекстного объявления с объяснением, как продукт решает задачу из запроса пользователя. Блоки сохранят обязательную пометку о спонсорстве.

Интеграция включает несколько форматов: адаптация креатива под узкие запросы, встраивание коммерческих предложений в сгенерированные рекомендации и персональное обоснование для покупки товаров.

Вместо статичных форм сбора лидов Google добавила встроенного в объявление интерактивного чат-бота, который отвечает на вопросы по базе знаний сайта компании.

В рамках программы Direct Offers, Gemini научилась динамически собирать персональные скидочные наборы. Продавцы, работающие по протоколу UCP смогут закрывать сделки через чекаут напрямую в поисковом интерфейсе.
blog.google

✔️ AMD представила процессоры Ryzen AI Max 400

Новая серия построена на базе архитектуры Strix Halo. Чипы поддерживают до 192 ГБ объединенной памяти стандарта LPDDR5X по 256-битной шине и допускают ручное выделение до 160 ГБ в качестве видеопамяти для встроенной графики. Это позволяет локально запускать LLM размером 300 млрд параметров.

Флагманский 16-ядерный чип Ryzen AI Max+ PRO 495 работает на частоте до 5,20 ГГц. Встроенный GPU RDNA 3.5 задействует 40 вычислительных блоков на частоте до 3,00 ГГц. Производительность интегрированного NPU составляет 55 TOPS.

В серию также вошли младшие модели с графикой на 32 блока: 12-ядерный PRO 490 и 8-ядерный PRO 485. Релиз потребительских версий запланирован на конец года.
techpowerup.com

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
4👍3🔥1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
✔️ Спецслужбы США получат $9 млрд на чипы и доступ к модели Mythos

Белый дом одобрил выделение $9 млрд АНБ и ЦРУ на закупку ускорителей Nvidia Grace Blackwell. Цель - создание изолированной ИИ-инфраструктуры.

Спецслужбы закупят в обход Пентагона невыпущенную модель Mythos от Anthropic. Технические требования Mythos позволяют развернуть ее на серверах предыдущего поколения, пока строятся новые дата-центры.

Ранее Минобороны США настаивало на праве использовать алгоритмы для любых законных целей, против чего выступала Anthropic. В итоговом контракте этот пункт убрали. Вместо него прописан прямой запрет применять Mythos для анализа данных и слежки за гражданами США.

Ожидается, что документ станет юридическим шаблоном для будущих контрактов со всеми ИИ-разработчиками.
nytimes.com

✔️ OpenAI открыла вакансию исследователя рисков автономного ИИ

Команда Preparedness в OpenAI открыла вакансию исследователя рисков автономного развития ИИ с зарплатой $445 000.

В задачи специалиста войдет разработка инструментов интерпретируемости, защита от отравления данных и внедрение метрик для оценки скорости автоматизации труда инженеров.

По планам Сэма Альтмана, к сентябрю 2026 года компания запустит автоматизированного ИИ-стажера для исследований. Появление полностью автономных R&D-систем прогнозируется к 2028 году.
businessinsider.com

✔️ В преддверии WWDC Apple зарегистрировала портал Genai

Apple добавила поддомен genai.apple.com на свои DNS-серверы. Страница пока недоступна, назначение этого портала неизвестно.

Ожидается, что 8 июня на WWDC 2026 компания представит iOS 27, iPadOS 27 и macOS 27. В новых версиях Siri получит интерфейс чат-бота и функцию распознавания экранного контекста.

Apple Intelligence расширит функциональность базовых сервисов. Voice Control начнет распознавать команды на естественном языке без жестких шаблонов. Алгоритмы Visual Intelligence смогут напрямую парсить данные с визиток или сканировать состав продуктов, а Safari получит автогенерацию названий для групп вкладок.

Также заявлена поддержка создания быстрых команд с помощью ИИ и генерация автоматических субтитров для видео.
macrumors.com

✔️ Релиз Grok V9-Medium ожидается через 2-3 недели

xAI завершила претрейн модели Grok V9-Medium на 1.5T параметров. Публичный релиз ожидается через две-три недели.

Сейчас команда проводит файн-тюнинг, после чего перейдёт к этапу RL. По словам Илона Маска, первые внутренние тесты показали положительные результаты.

На этапе дополнительного обучения разработчики задействовали массив данных от редактора Cursor. xAI рассчитывает, что это улучшит показатели модели в кодинге по сравнению с предыдущей версией v8-small.
Elon Musk в сети Х

✔️ Команда LeRobot выпустила чертежи и ПО для сборки двуногого робота

LeRobot (подразделение Hugging Face) выпустила open-source проект двуногого робота. Детали корпуса печатаются на 3D-принтере, стоимость сборки со стандартными приводами составляет около $2500.

В релиз вошли инструменты симуляции, алгоритмы калибровки, sim-to-real пайплайны и базовые модели обучения ходьбе. Пока для сборки доступна только нижняя часть платформы. Интеграция плечевого пояса и обучение моторике всего тела заявлены в дорожной карте.

Использование 3D-печати позволяет самостоятельно перепечатывать сломанные детали и не прерывать исследования локомоции на время ожидания запчастей.
huggingface.co

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍2🔥1
Forwarded from Machinelearning
✔️ DeepSeek привлекает около $7,4 млрд инвестиций

Китайская компания проводит первый в своей истории раунд привлечения внешнего капитала около 50 млрд юаней ($7,4 млрд).

По данным агентства Reuters, после вложений компанию оценят в 350–400 млрд юаней ($52–59 млрд).

Крупнейшими внешними инвесторами могут стать интернет-холдинг Tencent и производитель аккумуляторов CATL: первый рассматривает вложение 10 млрд юаней, второй - 5 млрд.

Основатель DeepSeek Liang Wenfeng, по словам источников, внесёт 20 млрд юаней собственных средств (это самый крупный частный взнос в раунде).


Переговоры также ведутся с государственным фондом поддержки ИИ КНР, а также с NetEase и JD.com. Общее число инвесторов, как ожидается, не превысит десяти. Среди возможных участников называют гонконгские IDG Capital и Monolith Management.

На фоне западных сделок раунд выглядит скромно: Anthropic в прошлом месяце привлёк $65 млрд, OpenAI в марте - $122 млрд.

О планах выхода на биржу DeepSeek пока не заявлял.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
8👍4😍2🤣1
Forwarded from Machinelearning
📌ИИ уже ускоряет разработку новых моделей

Anthropic опубликовала аналитический материал, в котором утверждает, что системы искусственного интеллекта всё активнее участвуют в создании следующих поколений ИИ.

Материал подготовлен исследовательским подразделением Anthropic Institute. Его авторы - Марина Фаваро и сооснователь компании, глава отдела политики Джек Кларк.


Отрасль приближается к рекурсивному самоулучшению

Это состояние, когда ИИ способен самостоятельно проектировать и совершенствовать собственного преемника быстрее, чем к этому будут готовы правительства и институты.


При этом Anthropic оговаривается, что до полностью автономной разработки ещё далеко и что такой сценарий не является неизбежным, люди по-прежнему нужны. Они ставят цели, оценивают результаты и решают, какие направления важны.

🟡Внутренние данные

На май 2026 года Claude написал более 80% кода, добавляемого в кодовую базу Anthropic.

До запуска Claude Code этот показатель измерялся единицами процентов.


Во втором квартале 2026 года типичный инженер вносил в проекты примерно в 8 раз больше кода в день, чем в 2024-м.

🟡Публичные тесты

Время выполнения задач, которые модели способны надёжно решать без участия человека, удваивается примерно каждые 4 месяца.

В начале 2024 года Opus 3 справлялся с задачами длиной в несколько минут, годом позже Sonnet 3.7 примерно за полтора часа, а Opus 4.6 - до 12 часов.


На SWE-bench, проверяющем исправление реальных ошибок в коде, передовые модели за два года прошли путь от низких результатов до почти предельных.

Джек Кларк говорит, что компания хочет, чтобы законодатели и институты понимали, что может произойти дальше.

По его словам, цель Anthropic - "заранее обозначить концепцию и дать людям представление о том, что приближается".


Прогресс ИИ, по его оценке, скорее ускоряется, чем замедляется, и может принести значительные результаты в медицине и науке, но требует инструментов для проверки и подтверждения работы, выполненной ИИ.

Anthropic выступает за то, чтобы у мира оставалась возможность при необходимости замедлить или временно приостановить разработку передовых моделей, но понимает, что это потребует согласованных всех игроков индустрии в разных странах и механизмов взаимной проверки.

В ближайшие месяцы компания обсудит эти вопросы с законодателями, исследователями и другими участниками отрасли.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
8🥱5🔥2😱2👍1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
✔️ OpenAI купила стартап Ona

Сделка по приобретению стартапа облачной оркестрации Ona позволит агентам OpenAI выполнять долгие задачи автономно, без привязки к локальным устройствам и активным сессиям пользователя.

Интеграция решений Ona даст изолированную среду для многочасовой работы с кодом, с возможностью удаленно подключаться к фоновым процессам для корректировки действий, проверки промежуточных результатов и утверждения решений.

Команда стартапа перейдет в OpenAI после одобрения сделки регуляторами.
openai.com

✔️ AI Alliance коллективно обучит открытую модель

Консорциум представил платформу Project Tapestry для федеративного обучения открытых моделей. Участники будут тренировать её на локальных данных с использованием собственных вычислительных мощностей. В общую систему попадут только обновленные веса.

Ян Лекун, консультант проекта, пообещал, что контрибьюторы получат доступ к итоговой базовой модели. На ее основе компании смогут создавать независимые версии под свои бизнес-задачи.

Сейчас инженеры проекта тестируют архитектуру платформы и формируют каталог данных. Релиз инфраструктуры запланирован на сентябрь 2026 года.

До конца года AI Alliance планирует обучить первую компактную модель, а к лету 2027 выпустить вариант уровня проприетарных SOTA-решений.
thealliance.ai

✔️ Сооснователь xAI запустил стартап персонализированных агентов

Игорь Бабушкин, стоявший у истоков xAI и ранее работавший в OpenAI и Google DeepMind, объявил о создании компании River AI, которая будет заниматься созданием адаптивных ИИ-агентов.

Идеология проекта строится на расширении человеческих возможностей через персонализацию и полном контроле ИИ. В перспективе стартап планирует заняться разработкой аппаратных решений и физической инфраструктуры.

Костяк команды сформировали выходцы из xAI. К Бабушкину присоединились руководитель продуктовой безопасности Винсент Старк, юрисконсульт Лили Лим, а также инженеры братья Соболевы.
bloomberg.com

✔️ Агенты в ChatGPT получили возможность оплачивать покупки через Visa

Visa интегрировала платежную сеть в ChatGPT. ИИ-агенты получили возможность самостоятельно проводить транзакции от лица пользователя у любого продавца с поддержкой карт сервиса. Для работы функции достаточно привязать карту к чат-боту.

OpenAI обеспечивает логику автономных агентов, Visa отвечает за авторизацию платежей и фрод-мониторинг. Пользователям доступны инструменты контроля: лимиты трат, белые списки магазинов и опция обязательного подтверждения операций.

Оспаривание платежей проходит по стандартным правилам Visa. Регламент планируют адаптировать для случаев, когда продавец действовал корректно, а ошибочный заказ произошел из-за сбоя в логике ИИ.
visa.com

✔️ Deezer запустил детектор ИИ-музыки

Стриминговый сервис создал инструмент, который ищет и определяет ИИ-треки. Алгоритм анализирует медиатеки пользователей и выявляет синтетический контент на 20 стриминговых платформах. Инструмент поддерживает 27 языков.

По словам директора компании Алексиса Лантернье, ежедневно на Deezer загружается около 75 тысяч ИИ-композиций, это более 44% от всех новых релизов, а почти у половины пользователей, переходящих от конкурентов, в сохраненных подборках уже есть сгенерированная музыка.

Исследование Deezer и Ipsos показало, что 97% слушателей не отличают ИИ-музыку от реальной, но 80% требуют обязательной маркировки. Платформа уже начала пессимизировать сгенерированный контент, исключая его из рекомендаций и подборок.
deezer.com

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍85🔥2
Forwarded from Machinelearning
📌 WSJ: коммерческие сделки OpenAI связаны с ростом личных инвестиций Сэма Альтмана

The Wall Street Journal со ссылкой на судебные документы, ставшие публичными в ходе процесса "Маск против OpenAI", опубликовала расследование о том, что контракты OpenAI повышали оценку стартапов, в которые лично вкладывается Сэм Альтман.

Для контекста: Альтман не владеет долей в самой OpenAI, поэтому его доходы зависят от внешних инвестиций.


🟡Механизм

OpenAI заключает контракт или соглашение о сотрудничестве, что поднимает оценку стартапа. Затем крупные акционеры OpenAI (например, Thrive Capital) или партнёры (SoftBank) выкупают доли стартапа, от чего личное состояние Альтмана растёт, так как он является их инвестором.

🟡Helion

В 2025 году Сэм предлагал OpenAI вложить около $500 млн в термоядерный стартап Helion. Часть сотрудников восприняла идею с настороженностью, и от прямых инвестиций компания отказалась.

В марте 2026 года стороны подписали пересмотренное соглашение о сотрудничестве и тогда же Альтман вышел из совета директоров Helion, объяснив это конфликтом интересов.

В июне 2026 года Helion оценили в $15,5 млрд, а личная доля Альтмана выросла как минимум до $4,1 млрд.

🟡Cerebras

После того как производитель чипов получил от OpenAI обязательство о закупках и провёл IPO, стоимость доли Альтмана выросла более чем в 6 раз по сравнению с декабрём 2025 года.

🟡Retro Biosciences

После соглашения о научном сотрудничестве с OpenAI доля Альтмана в этой компании по продлению жизни к декабрю 2025 года достигла $258 млн.

Всего, по данным WSJ, не менее 10 компаний из инвестиционного портфеля Альтмана имеют сделки с OpenAI.


🟡На это обратили внимание власти

Комитет Палаты представителей США по надзору начал официальное расследование, а генеральные прокуроры нескольких штатов призвали Комиссию по ценным бумагам и биржам проверить деятельность главы OpenAI в преддверии IPO.

Сам Альтман и представители компаний называют сотрудничество обычной практикой.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
8👍2😍2
Forwarded from Machinelearning
📌Claude Code изменил чужую продакшен-базу

На GitHub появился любопытный тикет, который (если подтвердится) бьёт по базовой гарантии Антропик - изоляции пользователей друг от друга.

В рабочем контексте Claude Code внезапно оказались чужие учётные данные - IP и root открытым текстом от сервера, к которому автор не имеет никакого отношения.

🟡Дальше самое неприятное

Ассистент принял чужие креды за легитимные, подключился к серверу по SSH, перечислил Docker-контейнеры и базы PostgreSQL, после чего выполнил миграцию с операциями чтения и записи.

Иными словами, ИИ одного пользователя отредактировал базу другого без ведома и согласия владельца.

🟡Причина пока неизвестна

В тематических сообществах обсуждают версию сбоя изоляции кэша общих префиксов.

Чтобы удешевить инференс и ускорить обработку, провайдеры переиспользуют кэшированные фрагменты диалогов, и при коллизии ключей кэша или отказе разграничения кусок чужого контекста теоретически может просочиться в вашу сессию.


Если эта версия верна, под угрозой данные любого пользователя. Но это лишь одна из гипотез, в самом отчёте среди возможных векторов названы также общее хранилище сессий, путаница при суммаризации контекста и перекрёстные ссылки в транскриптах.

🟡Есть и куда более прозаичное объяснение

Возможно, это галлюцинация модели, случайно угадавшей реальный IP и слабый пароль, либо локальная история проекта, загрязнившая контекст.

Пока Антропик не выпустила официального заключения, ни одну из версий нельзя ни подтвердить, ни отвергнуть.

Автоматика GitHub повесила на тикет метку security.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
😱11👍32😁1
⚡️ OpenAI закроет браузер Atlas 9 августа

Это первый случай, когда OpenAI отказывается от самостоятельного продукта ради унификации своей экосистемы.

Теперь возможности Atlas станут частью десктопных версий ChatGPT и Codex. Обновленное приложение ChatGPT уже получило встроенный инструмент для веб-серфинга, а ИИ-агенты научились напрямую взаимодействовать с элементами страниц.

Автоматического переноса пользовательских данных не будет. До закрытия сервиса всю историю, закладки и важные вкладки придется экспортировать вручную.


#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
7🔥3🥰2😁2🙏1🍌1🤨1
Forwarded from Machinelearning
⚡️ Google представила 3 новые модели Gemini

Cемейство Gemini пополнилось моделями 3.6 Flash, 3.5 Flash-Lite и специализированной 3.5 Flash Cyber.

🟡Gemini 3.6 Flash

Модель расходует на 17% меньше выходных токенов, чем предыдущая версия 3.5 Flash. Говорят, что подтянули у неё кодинг и офисные задачи.

Стоимость - 1,5 доллара за миллион входных и 7,5 доллара за миллион выходных токенов.


🟡Gemini 3.5 Flash-Lite

Ориентирована на массовые и быстрые задачи. Заявленная скорость - 350 токенов в секунду при цене 30 центов за миллион входных токенов.


🟡Gemini 3.5 Flash Cyber

Модель, натасканная на поиск и исправления уязвимостей в коде, которая не поступит в открытый доступ - её получат только правительства и доверенные партнёры в рамках ограниченной пилотной программы.


Google также сообщила о планах - 3.5 Pro тестируется с партнёрами, а команда уже начала обучение Gemini 4, которое в компании называют самым масштабным на сегодняшний день. Сроки выхода не названы.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
5👍3
✔️ ByteDance открыл набор ученых и аспирантов для ML-исследований

Китайский гигант запустил инициативу STEM Scientist в рамках проекта Seed. Компания отберет 100 ученых и аспирантов для полугодовой работы над применением машинного обучения в фундаментальной науке.

Программа предполагает 2 формата: позиции научных консультантов для отраслевых экспертов и стажировки для PhD-студентов STEM-направлений.

Базовое требование - опыт использования ИИ в исследованиях. Навыки программирования станут плюсом.

Со своей стороны ByteDance предоставляет зарплату, доступ к вычислительным ресурсам и работу с собственной ИИ-командой.

Участие требует очного присутствия в пекинском офисе компании. Заявки принимаются до 30 сентября 2026 года.



#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍13🔥43
✔️ OpenAI тестирует платную функцию восполнения лимитов Codeх

Тибор Блахо обнаружил в публичных конфигурациях оплаты и веб-ресурсах ChatGPT скрытые параметры, указывающие на внедрение новой системы сброса квот.

Судя по всему, OpenAI планирует продавать дополнительные пакеты запросов для разных уровней подписки.


На скриншотах видно, что для тарифа Plus опция обойдется от 5 или 8 долларов. Владельцам Pro Lite придется заплатить 25 или 40 долларов, а для максимального плана Pro цена восполнения составит 50 или 80 долларов.

Все суммы указаны без учета налогов, а точные отличия между двумя ценовыми вариантами внутри каждого уровня пока остаются неизвестными.


Сейчас OpenAI уже позволяет подписчикам Plus и Pro докупать кредиты после исчерпания базового объема, а также предлагает бонусные пополнения за определенные активности.

Скорее всего, новая тарификация сделает процесс расширения лимитов более гибким и структурированным.

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥7🤣43🥰3🤔3
Forwarded from AI VK Hub
📢 Исследователи AI VK Research научили двухбашенный трансформер над историей оптимизировать удовлетворённость пользователя за всю сессию. Работа принята на воркшоп конференции KDD 2026, которая проходит сейчас в Южной Корее.

Большинство современных рекомендательных моделей решает локальную задачу — предсказать следующее взаимодействие или следующий положительный фидбэк. Мы сформулировали задачу как RL на уровне сессии и обучили кандидатогенератор через off-policy REINFORCE на логах.

На индустриальных данных такая модель выигрывает у next-item и next-positive prediction по всем оценкам награды за сессию, сохраняя качество кандидатогенерации по recall-метрикам.

➡️ Подробнее в статье на Хабре.

#aivkhub #ml #recsys
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5🔥3🥰2
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
✔️ OpenAI будет ловить злоупотребления, не заглядывая в переписку

Private Safety Processing - механизм для API и корпоративных клиентов, работающий по принципу нулевого хранения данных. Он разбирает серии запросов и ищет признаки злонамеренного использования, но сотрудники OpenAI при этом не видят ни промптов, ни ответов модели.

Данные либо вообще не покидают периметр клиента, либо лежат на серверах OpenAI зашифрованными ключом самого заказчика. Если система замечает риск, наружу уходит только технический сигнал о типе угрозы, без содержания диалога.

Пока Private Safety Processing в закрытом тестировании. Публичный релиз с технической документацией обещают в сентябре. У пользователей ChatGPT на тарифах Free, Plus, Go и Pro настройки приватности не меняются.
openai.com

✔️ Ode, сервисное подразделение Anthropic, купило первую компанию

Anthropic вместе со своим подразделением Ode покупает ИИ-интегратора Casper Studios. Сумма сделки не раскрывается. Для Ode, запущенного в июле 2026 года, это первое приобретение.

Ode делает автоматизацию под заказ на моделях Anthropic. Casper Studios и раньше была авторизованным партнером Anthropic, среди ее клиентов - Netflix, Pepsi и хедж-фонды.

Смысл покупки в том, что у самих заказчиков не хватает специалистов по ИИ. Команда Casper как раз умеет доводить внедрение до конца на стороне клиента - собирает внутренние датасеты, стыкует модели с существующей ИТ-инфраструктурой и встраивает Claude в рабочие процессы.
theinformation.com

✔️ Generalist AI показала робота, который учится новому по видео

Стартап представил модель GEN-1.5 с обучением в контексте. Чтобы освоить новый навык, в контекстное окно подается видео на 3-12 секунд, и оно работает как промпт.

На простых задачах (открыть банку или вытащить купюру) модель справляется в 59% случаев. Если все же дообучить - показатель поднимается до 83%.

Претрейн занял восемь месяцев на датасетах физических взаимодействий. GEN-1.5 умеет сцеплять два промпта в последовательность, учиться на демонстрациях из симуляции и повторять моторику человеческих рук.
generalistai.com

✔️ В Adobe Firefly добавили генерацию музыки, речи и звуковых эффектов

Generate Music собирает фоновые треки, Generate Speech озвучивает текст, Generate Sound Effects делает эффекты под конкретную сцену. Adobe заявляет, что все созданное не требует лицензионных отчислений и годится для коммерческого использования.

В платформу завезли Gemini Omni Flash от Google - она работает с видео, аудио, изображениями и текстом. Модель пополнила существующий набор, где уже есть Runway, Luma AI и Kling AI.

Заодно у Firefly AI Assistant появился дневной лимит бесплатных генераций. 
adobe.com

✔️ ElevenLabs открыла доступ к голосовой модели v3 Conversational

Модель сделана для разговора в реальном времени - под телефонных ИИ-агентов и голосовых помощников. Режим Expressive Mode смотрит на контекст диалога и добавляет в речь живые реакции (смех, шепот, вздохи), подбирая их под эмоциональный фон разговора.

Отдельно переделали то, как модель общается с собеседником - теперь она подключена к потоковой расшифровке Scribe v2 Realtime и умеет отличает законченную мысль от угуканья в знак согласия. Перебивать человека она стала реже.

v3 Conversational знает 70 языков и держит акценты. Работает через API и платформу ElevenAgents, базовая цена - 5 центов за 1000 символов.
ElevenLabs в X


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥54👍2
This media is not supported in your browser
VIEW IN TELEGRAM
✔️ В Claude Code появилась команда создания UI-макетов

Проектировать интерфейс теперь можно до написания кода - в терминале или в десктопном приложении.

Достаточно дать базовый промпт (например, несколько вариантов экрана под конкретную задачу), указать команду /design и модель выдает серию набросков в виде интерактивных Artifacts. Удачный вариант точечно доработать и передать в код.

Как пояснил инженер Anthropic Нейт Парротт, модель при этом читает существующую кодовую базу проекта - чтобы новые компоненты сразу попадали в визуальный стиль приложения.

Одно ограничение - макеты учитываются при генерации кода, но сохранять их приходится вручную.


Чтобы попробовать, обновите Claude Code командой claude update.

#news #ai #ml

@data_analysis_ml / Папка полезного по ML.
Please open Telegram to view this post
VIEW IN TELEGRAM
11🔥9👍4
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
🌟 Prime Intellect выложила отчет об агенте, с которым Opus 5 взял 95,5% на ARC-AGI-3

Prime Agent — это больше, чем харнесс модели. Сами авторы называют проект операционной системой для долгоживущих агентов.

Умнее модель он не делает, но дает ей работать дольше - программно раскладывать информацию, параллельно раздавать задачи подагентам и копить полезные процедуры.

Идея в том, чтобы у языковой модели была устойчивая вычислительная среда, где она сама распоряжается памятью, кодом, подагентами и долгими задачами.


Состояние в системе разложено по четырем уровням:

🟢веса модели - то, что она знает после обучения;
🟢активный контекст - информация текущего шага;
🟢постоянный REPL и рекурсивные подагенты - внешние вычисления, инструменты и параллельная работа;
🟢дисковое состояние - история, факты, навыки, промпты и спецификации подагентов.

Состояние переживает и шаги, и перезапуски, и отключения. Человек при этом может наблюдать за агентами и вмешиваться.

🟡Замеры

Сильнее всего эффект виден на длинных интерактивных задачах. На ARC-AGI-3 конфигурация с Opus 5 дала 95,5% Best@1 против 30,2% у обвязки самой ARC.

На длинноконтекстных задачах Prime Agent держится наравне с конкурентами, а на отдельных, вроде EmulatorBench, заметно вырывается вперед. Он обошел Pi-mono с GLM-5.2 и Codex с GPT-5.6 Sol, но уступил Claude Code с Opus 5.

Отдельно показательны игровые прогоны на эмуляторах. На Sega Genesis связка Prime Agent и GPT-5.6 Sol набрала 61,6% по итоговой оценке верификатора, а Claude Code с той же моделью — ноль. На Game Boy Color разрыв еще резче: 99,8% против нуля.

🟡 Побочный эффект

Самая любопытная деталь отчета - накопление навыков закрепляет не только полезное.

В одном из экспериментов агент нашел способ обходить ограничения Factorio, сохранил его как переиспользуемый навык и тем самым записал эксплойт в долговременную память. Дальше он доставал оттуда именно это решение, потому что оно один раз сработало.

На днях вышел релиз 0.8.0 с исправлениями найденных проблем и новыми возможностями.



📌Лицензирование: MIT License


🟡Техотчет
🖥Github


@ai_machinelearning_big_data

#AI #ML #Harness #Agents #PrimeIntellect
Please open Telegram to view this post
VIEW IN TELEGRAM
5👍2🥴1
✔️ Qwen выпустил бенчмарк, где агент год управляет бизнесом

Qwen вместе с Taobao & Tmall и сделала E-Commerce Bench, где агенту дают 100 тысяч юаней и 365 виртуальных дней. Он изучает категории, торгуется с поставщиками, назначает цены, следит за календарём распродаж, тянет склад и контролирует денежные потоки, причём одновременно может вести до четырёх магазинов.

Ни потолок спроса, ни себестоимость ему не показаны - до всего нужно докопаться самому.


🟡 Детали экономики

Рабочий день идёт с 8 утра до 6 вечера, и каждый вызов инструмента тратит время: проверить деньги (10 минут), открыть магазин (60), написать поставщику (30).

Расходы списываются сразу, а выручка идёт через комиссию, эскроу, 9 дней ожидания и ручной вывод.

Склад сводится посуточно, товар, не отправленный за двое суток, отменяется, а репутация напрямую множит спрос: магазин на дне её шкалы получает 15% от обычного трафика.

🟡Ядро переговоров

Если бы роль поставщика играла языковая модель, одна и та же стратегия давала бы разные цены, а бенч превратился бы в соревнование по джейлбрейку. Поэтому все уступки и отказы считает жёсткий алгоритм, а модель лишь переводит его решения в речь на виртуальных переговорах.

🟡Что показали тесты

GPT-5.6 Sol - лидер, он закончил год с 1,43 млн юаней, увеличив капитал в 14,3 раза.

Qwen3.8-Max-Preview - лучшая среди моделей с открытыми весами, на конец года у нее было 416 тыс. юаней

Qwen3.5-Plus остался с 1100 юанями.

Кстати, 10 циклов из 90 закончились банкротством, и сценарий почти всегда один - забить склад в январе и не суметь распродать.


🟡Дополнительные оси оценки

Торговаться толком не научился никто.

До себестоимости поставщика не додавил ни один агент. Единственный, кто хоть как-то сбивал цену - Opus 4.7, но по настроению.

Исключение - Qwen3.8-Max-Preview, которая продавливает цену ниже на повторных заказах.


С мошенниками вышло интереснее всего.

Их в реестре 152 из 576 (26,4%), они пишут всем моделям, но у Opus 4.7 деньги получили 4% тех мошенников, с кем он заговорил, у GPT-5.6 Sol - 31,7%.


ИИ-предприниматели категорически не умеют распоряжаться рабочим временем.

Отправки, переходы на следующий день, вывод наличных и выкладка товара съедают 71,8% всех вызовов. На разговоры с поставщиками приходится 6%. На пересмотр цен 0,66%.


Модели заняты обслуживанием процесса, а не экономикой.

Отсюда странность в рейтинге эффективности. Fable5 зарабатывает 479 юаней на вызов против 363 у Sol, тратя при этом почти вдвое меньше вызовов, а по итоговым деньгам идёт позади.



🟡За год почти никто ничему не научился

Измерять обучение на длинной дистанции сложно, но тут у бенча есть линейка.

Ядро переговоров никогда не уходит ниже собственной себестоимости, значит лучшая цена, которую агент однажды выбил, - это верхняя граница того, за сколько поставщик готов отдать товар. Дальше можно сравнивать - следующая закупка у того же поставщика прошла дешевле или дороже уже достигнутого.

На 8647 повторных покупок улучшили свой же результат только 2 модели из 18, а 15 переплачивали настолько, что промахивались мимо случайного порядка больше чем на 2 стандартных отклонения.



📌Лицензирование: Apache 2.0 License


🟡Страница проекта
🟡Arxiv
🖥Github

#AI #ML #Agents #ECommerce #Benchmark #Qwen
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥118👍5