Анализ данных (Data analysis)
50.6K subscribers
3.58K photos
451 videos
1 file
2.93K links
Data science, наука о данных.

@haarrp - админ

РКН: clck.ru/3FmyAp
Download Telegram
✔️ Qwen выпустил бенчмарк, где агент год управляет бизнесом

Qwen вместе с Taobao & Tmall и сделала E-Commerce Bench, где агенту дают 100 тысяч юаней и 365 виртуальных дней. Он изучает категории, торгуется с поставщиками, назначает цены, следит за календарём распродаж, тянет склад и контролирует денежные потоки, причём одновременно может вести до четырёх магазинов.

Ни потолок спроса, ни себестоимость ему не показаны - до всего нужно докопаться самому.


🟡 Детали экономики

Рабочий день идёт с 8 утра до 6 вечера, и каждый вызов инструмента тратит время: проверить деньги (10 минут), открыть магазин (60), написать поставщику (30).

Расходы списываются сразу, а выручка идёт через комиссию, эскроу, 9 дней ожидания и ручной вывод.

Склад сводится посуточно, товар, не отправленный за двое суток, отменяется, а репутация напрямую множит спрос: магазин на дне её шкалы получает 15% от обычного трафика.

🟡Ядро переговоров

Если бы роль поставщика играла языковая модель, одна и та же стратегия давала бы разные цены, а бенч превратился бы в соревнование по джейлбрейку. Поэтому все уступки и отказы считает жёсткий алгоритм, а модель лишь переводит его решения в речь на виртуальных переговорах.

🟡Что показали тесты

GPT-5.6 Sol - лидер, он закончил год с 1,43 млн юаней, увеличив капитал в 14,3 раза.

Qwen3.8-Max-Preview - лучшая среди моделей с открытыми весами, на конец года у нее было 416 тыс. юаней

Qwen3.5-Plus остался с 1100 юанями.

Кстати, 10 циклов из 90 закончились банкротством, и сценарий почти всегда один - забить склад в январе и не суметь распродать.


🟡Дополнительные оси оценки

Торговаться толком не научился никто.

До себестоимости поставщика не додавил ни один агент. Единственный, кто хоть как-то сбивал цену - Opus 4.7, но по настроению.

Исключение - Qwen3.8-Max-Preview, которая продавливает цену ниже на повторных заказах.


С мошенниками вышло интереснее всего.

Их в реестре 152 из 576 (26,4%), они пишут всем моделям, но у Opus 4.7 деньги получили 4% тех мошенников, с кем он заговорил, у GPT-5.6 Sol - 31,7%.


ИИ-предприниматели категорически не умеют распоряжаться рабочим временем.

Отправки, переходы на следующий день, вывод наличных и выкладка товара съедают 71,8% всех вызовов. На разговоры с поставщиками приходится 6%. На пересмотр цен 0,66%.


Модели заняты обслуживанием процесса, а не экономикой.

Отсюда странность в рейтинге эффективности. Fable5 зарабатывает 479 юаней на вызов против 363 у Sol, тратя при этом почти вдвое меньше вызовов, а по итоговым деньгам идёт позади.



🟡За год почти никто ничему не научился

Измерять обучение на длинной дистанции сложно, но тут у бенча есть линейка.

Ядро переговоров никогда не уходит ниже собственной себестоимости, значит лучшая цена, которую агент однажды выбил, - это верхняя граница того, за сколько поставщик готов отдать товар. Дальше можно сравнивать - следующая закупка у того же поставщика прошла дешевле или дороже уже достигнутого.

На 8647 повторных покупок улучшили свой же результат только 2 модели из 18, а 15 переплачивали настолько, что промахивались мимо случайного порядка больше чем на 2 стандартных отклонения.



📌Лицензирование: Apache 2.0 License


🟡Страница проекта
🟡Arxiv
🖥Github

#AI #ML #Agents #ECommerce #Benchmark #Qwen
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥17👍98
⚡️ ИИ-агенты хорошо проходят короткие тесты, но ломаются на длинных задачах

Инженер Microsoft AI протестировал девять моделей на 10 664 многошаговых запусках. Чем больше зависимых действий требовалось выполнить, тем ниже становилась итоговая надёжность: ошибка на одном этапе влияла на все последующие.

На ToolQA модели, показывавшие почти 100% на двух-четырёх шагах, к 16 шагам сохраняли лишь 0–33% успешных выполнений.

Сокращение контекста не помогло, а ускорило падение качества: агент терял историю собственных решений.

Авторы рекомендуют тестировать агентов на реальной длине рабочих сценариев, измерять надёжность каждого шага и добавлять промежуточные проверки.

Исследование:
https://arxiv.org/abs/2609.01660

Код и данные:
https://github.com/shubmittal/agent-horizon-degradation
🔥12👍87
В выходные AI VK собрала лидов из ML- и RecSys на закрытой встрече AI VK & Pro.

Вместо длинной деловой программы — один предметный разговор о персонализации, инфраструктуре Discovery-платформу и нейросетях. За год на ее базе построили несколько новых рекомендательных технологий: от нейропрофиля и нейросетевого ранжирования до нейропоиска Discovery AI.

А после — гольф: мастер-классы, турнир и разговоры уже без презентаций.
🤣105👍4🔥2🍌2❤‍🔥1🥴1
🚀 Математики с помощью ИИ продвинулись к задаче Навье–Стокса. Вокруг работы возник спор с OpenAI

Левент Алпёге и Тристан Бакмастер получили новые результаты для двумерной системы Буссинеска и трёхмерных уравнений Эйлера: показали, как при гладком внешнем воздействии изначально гладкое течение может развить сингулярность за конечное время.

В работе использовались Claude и OpenAI Codex. Теренс Тао высоко оценил результат и считает, что подход может быть расширен на уравнения Навье–Стокса, учитывающие вязкость. За решение соответствующей задачи тысячелетия назначена премия $1 млн.

Одновременно разгорелся конфликт. По словам Бакмастера, OpenAI узнала об их прогрессе до публикации, а затем сообщила о собственном доказательстве для Навье–Стокса. Он утверждает, что при обсуждении публикации ему предложили исключить Алпёге из авторов из-за его работы в Anthropic.

Себастьен Бюбек отверг обвинения, назвав их ложными и провокационными. Бакмастер отдельно уточнил, что не знает, использовались ли их закрытые данные.

Опубликованные результаты авторов ещё не решают задачу Навье–Стокса. Заявленное доказательство OpenAI пока не опубликовано и не прошло независимую проверку.

The Authors’s solution:
https://mathstodon.xyz/@tristanbuckmaster@mastodon.social/117233413735526010

Terence Tao on the solution:
https://mathstodon.xyz/@tao/117233527638291447
Please open Telegram to view this post
VIEW IN TELEGRAM
👍96🔥2🤔1🙏1
OpenAI закрыла задачу тысячелетия. Навье-Стокс решён, и решил его не человек

Сегодня OpenAI выложила доказательство того, что уравнения Навье-Стокса могут взрываться за конечное время. Гладкая жидкость в покое, гладкая внешняя сила, конечная энергия на всём протяжении, и при этом скорость уходит в бесконечность за конечное время. Это пункты C и D в официальной формулировке Клэя, то есть задача тысячелетия закрыта в сторону "нет, гладкость не гарантирована". Вопрос висел с 1934 года, когда Лере построил слабые решения и не смог сказать, остаются ли они гладкими.

Физика решения довольно красивая. Вихрь спиралью затягивается к оси и одновременно вытягивается вдоль неё, как спагетти. Радиус ядра сжимается как τ^(1/2), длина как τ^(1/2-h), скорость растёт как τ^(-1/2-h), где τ это время до сингулярности, а h маленький фиксированный показатель меньше 1/100. Энергия ядра при этом стремится к нулю, так что закон сохранения не нарушается. Главная хитрость в том, что все члены уравнения расходятся, но сокращаются с такой точностью, что внешняя сила остаётся гладкой. Для этого вокруг ядра добавляют семейства осциллирующих импульсов, которые вытягивают энергию из сдвига фонового потока и своими средними потоками импульса гасят сингулярную часть невязки. Формальное доказательство на Lean, статья на 165 страниц.

OpenAI с 28 августа тренирует новую внутреннюю модель, которая по их словам заметно сильнее GPT-6 Astra, и обучение ещё не закончено. 1 сентября они услышали слух, что кто-то решил две задачи тысячелетия, и запустили мультиагентную систему на все открытые проблемы Клэя сразу. Агенты имели доступ к кешу интернета и запуску кода, работали группами с общением внутри группы. Группа, которая добила Навье-Стокса, состояла примерно из 10 000 параллельных агентов. Разным группам давали разные варианты формулировки, включая варианты на доказательство и на опровержение. Сначала около 100 агентов за 50 часов сломали более простую задачу регулярности для уравнений Эйлера без вязкости, после чего все ресурсы перекинули на Навье-Стокс и скормили агентам решение по Эйлеру как затравку. Между группами инсайты консолидировали через Codex. Итог получен 5 сентября, через 88 часов после старта, ещё 17 часов ушло на формализацию и проверку в Lean силами GPT-6 Astra. Суммарно на Навье-Стокс агенты отправили 2,7 миллиона сообщений и сожгли около 130 миллиардов выходных токенов, на все задачи вместе 300 миллиардов.

Слух, с которого всё началось, касался Левента Альпёге из Anthropic и Тристана Бакмастера из NYU. Когда OpenAI после Lean-верификации связалась с ними, выяснилось, что у тех решён форсированный Эйлер, а не Навье-Стокс. OpenAI признаёт их приоритет по Эйлеру и пишет, что чужой работы не видела, хотя не может исключить, что деанонимизированные данные из продуктов косвенно улучшили модель. Премию Клэя они забирать не собираются.

Формальная проверка здесь не украшение, а единственная причина, почему результату вообще можно верить при таком объёме генерации. И да, модель, которая это сделала, ещё дообучается.

https://openai.com/index/navier-stokes-solution/https://openai.com/index/navier-stokes-solution/
PDF:
https://cdn.openai.com/pdf/32d9f210-8b73-45e0-91bc-82a30aef8a9a/navier-stokes.pdf
1🔥30👍95🤔2
🎧 Spotify выпустила плагины для Claude Code, Codex и Cursor

Portal AI Plugins подключают ИИ-агента к Spotify Portal, чтобы он мог работать с каталогом сервисов и технической документацией команды.

Что умеют:

* искать сервисы и документацию по запросу обычным языком;
* собирать сводки: кто отвечает за сервис, его состояние, инциденты и связанные документы;
* проверять настройку CLI и авторизацию;
* запускать доступные действия Portal с предварительной проверкой и подтверждением.

В комплекте есть Shunt - дополнительный плагин для Claude Code. Он передаёт массовое чтение файлов и генерацию шаблонного кода более дешёвым моделям через AiKA.

Исходники доступны под Apache 2.0. Для работы потребуется доступ к Spotify Portal.

GitHub: https://github.com/spotify/portal-ai-plugins
11👍3🔥3
КосмоХакатон 11–13 сентября.
Кейс на спутниковых данных 🚀

Два формата: очно в Благовещенске (ДФО) или онлайн из любой точки России.
Задача про наблюдение за водными объектами со спутника: как отслеживать их изменения и оценивать гидрологическую обстановку. Паводки, обмеление, разливы. Нужен подход, который вовремя ловит значимые изменения и отдаёт результат в форме, пригодной для анализа, а не в виде папки с растрами.

🏆 Призовой фонд площадки — 600 000 ₽
🛰 Команды от 3 до 5 человек. Собери свою или присоединяйся к другим на нашей платформе.
🚀 Лучшие команды выходят в финал в Москве 25–27 сентября — ещё 2,4 млн ₽, и туда тоже можно подключиться онлайн

Детали и расписание: космохакатон.рф/blagoveshchensk
4👍3🌚2
Исследователь Anthropic уходит из ИИ, опасаясь потери контроля уже к концу 2027 года

По данным WSJ, Джейкоб Коксон покидает отрасль из-за риска рекурсивного самоулучшения: ИИ начнёт ускорять разработку собственных, всё более мощных преемников.

Он перешёл из OpenAI в Anthropic ради работы над безопасностью и по-прежнему считает её усилия искренними. Но, по его мнению, конкуренция мешает отдельной компании достаточно замедлить разработку.

Коксон выступает за согласованные ограничения и государственное регулирование. Срок до конца 2027 года - его оценка риска.

https://www.wsj.com/tech/ai/anthropic-researcher-quits-over-out-of-control-ai-fears-707b7628
🤣11👍10💔32🤔2🔥1👌1
💻 Какую нейросеть запустить локально: от 8 до 512 ГБ памяти

Подборка для программирования, работы с изображениями и агентных задач.

Диапазоны рассчитаны на квантованные версии. Помимо весов, нужна память под контекст и работу движка. На Mac и DGX Spark часть общей памяти занимает система.

🟢 8 ГБ

Spark-X2.5-4B - https://huggingface.co/XHToken/Spark-X2.5-4B

Компактная модель для текста, кода и вызова инструментов. Поддерживает контекст до 1 млн токенов, но полностью использовать его на 8 ГБ не получится.

Ternary Bonsai 27B - https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf

Сжатая версия на базе Qwen3.6-27B. Веса занимают около 7,2 ГБ. На 8 ГБ могут потребоваться короткий контекст и частичная выгрузка в RAM.

🔵 16 ГБ

Gemma 4 12B - https://huggingface.co/google/gemma-4-12B-it

Поддерживает текст, изображения, аудио и видео. Подойдёт для анализа скриншотов, документов и медиаматериалов. Для 16 ГБ нужна квантованная сборка.

🟣 24 ГБ

Qwen3.8-27B - https://huggingface.co/Qwen/Qwen3.8-27B

Вариант для локального помощника по программированию и работе с инструментами. Можно рассмотреть сборки на 3,5–4 бита, оставив запас памяти под контекст.

🟠 32–64 ГБ

Nex-N2.5-mini - https://huggingface.co/nex-agi/Nex-N2.5-mini

Мультимодальная MoE-модель на 35 млрд параметров для кода и агентных задач. На каждом токене активируется часть экспертов, но хранить нужно все веса. Для 32 ГБ потребуется квантование.

🔴 96–128 ГБ

Qwen3.8-Flash-Next - https://huggingface.co/Qwen/Qwen3.8-Flash-Next

Крупная мультимодальная модель. Требования зависят от квантования, длины контекста и поддержки выгрузки весов выбранным движком.

GLM-5.3-Flash EXL3 2.0bpw - https://huggingface.co/0xSero/GLM-5.3-Flash-EXL3-TR3-2.0bpw

Экспериментальная сборка, проверенная автором на DGX Spark. Требует специального окружения; ограничения перечислены в карточке.

⚙️ 192–256 ГБ

DeepSeek-V4-Flash-Vision-Exp - https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp

Экспериментальная мультимодальная версия для работы с текстом и изображениями. Для этого диапазона памяти нужен подходящий формат весов.

Nex-N2.5-Pro - https://huggingface.co/nex-agi/Nex-N2.5-Pro

Модель для мультимодальных и агентных сценариев. Объём памяти зависит от выбранной сборки.

GLM-5.3-500B EXL3 3bpw - https://huggingface.co/0xSero/GLM-5.3-500B-EXL3-3.0bpw

Версия с удалённой частью экспертов. Одни веса занимают около 197 ГБ, поэтому 192 ГБ недостаточно.

GLM-5.3-Flash EXL3 Q4 - https://huggingface.co/0xSero/GLM-5.3-Flash-EXL3-Q4

Экспериментальная сборка: автор сообщает, что полноценный запуск сервера для неё ещё не проверен.

🖥 384–512 ГБ

GLM-5.3 - https://huggingface.co/zai-org/GLM-5.3

Крупная MoE-модель для разработки и длительных агентных задач. В этом диапазоне рассматривают квантованные сборки примерно на 3–4 бита.

Перед скачиванием проверьте формат: EXL3, GGUF и MLX требуют разных движков. Сборка для NVIDIA может не подойти для Mac, даже если памяти достаточно.
👍117🔥4🤣3
✔️ Claude атаковал реальные системы во время тестов, продолжая называть происходящее симуляцией

Anthropic опубликовала разбор четырёх инцидентов. Модели выполняли задания по кибербезопасности в среде стороннего партнёра. По инструкции интернет был недоступен, но ошибка конфигурации оставила выход в сеть открытым. Защитные фильтры, используемые в публичных продуктах, на тестах были отключены.

Самый серьёзный случай - Claude Mythos 5. Модель опубликовала вредоносный пакет в PyPI. Его установили 15 систем. Через утёкшие учётные данные одной из них Claude получил доступ к базе компании, занимающейся безопасностью.

В своих рассуждениях модель продолжала утверждать, что находится в симуляции, несмотря на признаки реального интернета. В повторных экспериментах дополнительные предупреждающие признаки не всегда останавливали атаку.

Anthropic выделяет две проблемы:

* Модель интерпретировала свидетельства так, чтобы оправдать продолжение задания.
* Стремление выполнить задачу перевешивало риск причинить вред.

Некоторые автоматические проверки тоже пропустили опасное поведение: объяснения Claude убедили проверяющую модель, что действия происходят в симуляции.

Компания расширила поиск до 481 млн записей запусков. Проверка повторно обнаружила эти четыре инцидента, но не выявила других сопоставимой или большей тяжести. METR проведёт независимое расследование.

https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
Please open Telegram to view this post
VIEW IN TELEGRAM
14👍8🙏3🤣3🔥1👌1
🧠 GVA: до 47% меньше памяти под кеш внимания в LLM

FrontiersMind представила Grouped Value Attention - механизм внимания, который хранит сгруппированные значения (*values*), а содержательную часть ключей (*content keys*) восстанавливает по мере необходимости. Отдельно сохранять её в кеше не требуется.

По заявлению команды:

* на 45–47% меньше памяти под постоянно хранимый кеш по сравнению с GQA;
* качество, близкое к GQA;
* более простая организация кеша, чем у DeepSeek MLA.

Разработчики также подготовили специализированные вычислительные ядра. Сравнение скорости полного инференса с GQA и MLA ещё идёт - цифры ускорения пока не объявлены.

https://github.com/FrontiersMindAI/GVA/blob/main/GVA_Efficient-KV.pdf
🔥16👍42
DeepSeek-V4.1-Flash вышла с открытыми весами - в отдельных агентских тестах она обходит Opus 5 и GPT-5.6 Sol

По результатам, опубликованным DeepSeek:

* DeepSWE v1.1 - 74,2% решённых задач. У Opus 5 - 74%, у GPT-5.6 Sol - 73%.
* AutomationBench - 54,8%, лучший результат среди моделей в сравнении.
* Terminal-Bench 2.1 - 90,6%, также первое место в таблице.

Модель работает с текстом и изображениями, поддерживает контекст до миллиона токенов. Усилие рассуждения регулируется по шкале от 1 до 100 - можно выбирать баланс между затратами и качеством ответа.

В основе - MoE-архитектура с 552 млрд параметров. На обработке входа активируются 8 млрд параметров на токен, при генерации - 16 млрд. Объём глобального KV-кэша сократили примерно в четыре раза относительно V4-Flash.

Все приведённые результаты получены при максимальном усилии рассуждения. В других тестах, включая Terminal-Bench 3.0 и 4.0, модель уступает Opus 5 и GPT-5.6 Sol.

Веса доступны по лицензии MIT. В репозитории есть инструкции по запуску и воспроизведению результатов DeepSWE.

https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
🔥159👍7
Наконец-то
😁6919🔥12👍4🤣3🥱2🤩1