Forwarded from Machinelearning
Stanford University, Northwestern University и University of Washington, совместно с Google Deepmind, при участии социологов, разработали архитектуру, которая позволяет симулировать поведение более 1000 реальных людей с помощью LLM, обученных на транскрипции двухчасовых интервью с добровольцами-участниками.
Архитектура использует метод "экспертных размышлений", где LLM генерирует выводы о каждом участнике, принимая на себя роли различных специалистов социальных наук (психолога, экономиста, политолога, демографа).
Процесс создания агентов начинался со стратифицированного отбора 1052 участников, репрезентирующих население США по возрасту, полу, расе, региону, образованию и политическим взглядам. Масштабирование сбора данных проводилось агентом-интервьюером на основе GPT-4o, который динамически генерировал уточняющие вопросы, адаптируясь к ответам участников.
Оценка точности агентов проводилась с помощью сравнения их ответов с ответами реальных участников на вопросы из Общего социального опроса (GSS), опросника "Большая пятерка" (BFI-44), 5 экономических игр и 5 социальных экспериментов. Для учета непостоянства человеческого поведения точность агентов нормализовали с помощью сравнения с тем, насколько последовательно сами участники воспроизводили свои ответы через две недели.
Результаты оценки показали высокую точность прогнозирования агентов, обученных на интервью. Они смогли предсказать ответы на вопросы GSS с нормализованной точностью 0.85, а черты личности по BFI-44 - с нормализованной корреляцией 0.80. Использование интервью значительно повысило точность по сравнению с агентами, использующими только демографические данные или краткие описания личности.
В экспериментах агенты успешно воспроизвели 4 из 5 личностных особенностей, наблюдавшихся у реальных участников, а оценки размеров этих особенностей показали высокую корреляцию (r = 0.98).
Доступ к банку агентов двухуровневый:
@ai_machinelearning_big_data
#AI #ML #LLM #Agents #Social
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
❤9👍3⚡1🔥1
🤖 Google запускает A2A — новый протокол общения между ИИ-агентами
Google представил Agent2Agent (A2A) — открытый стандарт для обмена задачами между ИИ-агентами в разных сервисах и компаниях.
Это что-то вроде MCP, но с упором на безопасность, мультимодальность и совместимость с корпоративной инфраструктурой.
🔑 Главное:
▪ A2A — task-first: агенты обмениваются не сообщениями, а задачами с жизненным циклом (create, update, cancel, complete).
▪ Автоопределение возможностей: каждый агент публикует JSON-«визитку» с описанием своих способностей (capability discovery).
▪ HTTP, SSE, JSON-RPC — всё работает на веб-стеке, легко встраивается в существующие API.
▪ Поддержка текста, аудио и видео — мультимодальность встроена по умолчанию.
▪ Security-first: в отличие от ранних протоколов (как MCP), здесь продумана авторизация и защита данных.
В теории — это мощный инструмент для автоматизации бизнес-процессов.
На практике — уже критикуют за перегруз и неясные перспективы. Но с ресурсами Google — у проекта есть шанс стать отраслевым стандартом.
📌 Отличие между MCP и A2A:
🧠 MCP (Multi-Agent Communication Protocol) — это:
➡️ Протокол, придуманный, чтобы LLM-агенты могли "болтать" друг с другом.
💬 Основан на сообщениях — один агент пишет другому что-то вроде чата, и тот отвечает.
⚙️ Подходит для простых сценариев: «Скажи это», «Спроси у другого», «Придумай план».
Но:
– Без жёсткой структуры
– Нет встроенной безопасности
– Не поддерживает длинные сложные процессы (например, запланировать и потом отчитаться)
– Не заточен под задачи типа "запусти и следи"
🧠 A2A (Agent2Agent) — это:
➡️ Google-версия MCP, но с упором на бизнес и инфраструктуру.
📦 Вместо чатов — структурированные задачи, у которых есть статусы: created, accepted, completed, failed, cancelled.
📛 Поддерживает авторизацию, описание возможностей агента, обратную связь, долгие процессы, аудио и видео.
Проще говоря:
– MCP — это «чат между ИИ»
– A2A — это «Jira для агентов» — задачи, статусы, ролевая модель, безопасность.
google.github.io/A2A
#Google #A2A #agents #AI #protocols #interop #infrastructure
Google представил Agent2Agent (A2A) — открытый стандарт для обмена задачами между ИИ-агентами в разных сервисах и компаниях.
Это что-то вроде MCP, но с упором на безопасность, мультимодальность и совместимость с корпоративной инфраструктурой.
🔑 Главное:
▪ A2A — task-first: агенты обмениваются не сообщениями, а задачами с жизненным циклом (create, update, cancel, complete).
▪ Автоопределение возможностей: каждый агент публикует JSON-«визитку» с описанием своих способностей (capability discovery).
▪ HTTP, SSE, JSON-RPC — всё работает на веб-стеке, легко встраивается в существующие API.
▪ Поддержка текста, аудио и видео — мультимодальность встроена по умолчанию.
▪ Security-first: в отличие от ранних протоколов (как MCP), здесь продумана авторизация и защита данных.
В теории — это мощный инструмент для автоматизации бизнес-процессов.
На практике — уже критикуют за перегруз и неясные перспективы. Но с ресурсами Google — у проекта есть шанс стать отраслевым стандартом.
📌 Отличие между MCP и A2A:
🧠 MCP (Multi-Agent Communication Protocol) — это:
➡️ Протокол, придуманный, чтобы LLM-агенты могли "болтать" друг с другом.
💬 Основан на сообщениях — один агент пишет другому что-то вроде чата, и тот отвечает.
⚙️ Подходит для простых сценариев: «Скажи это», «Спроси у другого», «Придумай план».
Но:
– Без жёсткой структуры
– Нет встроенной безопасности
– Не поддерживает длинные сложные процессы (например, запланировать и потом отчитаться)
– Не заточен под задачи типа "запусти и следи"
🧠 A2A (Agent2Agent) — это:
➡️ Google-версия MCP, но с упором на бизнес и инфраструктуру.
📦 Вместо чатов — структурированные задачи, у которых есть статусы: created, accepted, completed, failed, cancelled.
📛 Поддерживает авторизацию, описание возможностей агента, обратную связь, долгие процессы, аудио и видео.
Проще говоря:
– MCP — это «чат между ИИ»
– A2A — это «Jira для агентов» — задачи, статусы, ролевая модель, безопасность.
google.github.io/A2A
#Google #A2A #agents #AI #protocols #interop #infrastructure
👍12❤8🔥3😁2
Forwarded from Machinelearning
Глубокие исследовательские агенты — не просто чат‑боты, а полноценные ИИ‑ассистенты, способные искать информацию, взаимодействовать с инструментами, планировать и писать отчёты. Ниже — 10 мощных open‑source проектов, которые уже можно протестировать:
1. DeerFlow — модульная система от Bytedance: DeerFlow — open‑source фреймворк от Bytedance для создания модульных LLM-агентов.
Поддерживает:
- планирование действий,
- анализ кода,
- генерацию отчётов (включая Text-to-Speech),
- адаптивную интеграцию инструментов.
Создан для исследований, автоматизации и построения сложных агентных пайплайнов.
https://github.com/bytedance/deer-flow
2. Alita — самообучающийся агент с поддержкой Model Context Protocols (MCP), всё в одном модуле. Alita — агент, который сам придумывает, как ему расширить себя, не полагаясь на заранее написанные сценарии, и уже демонстрирует топовые результаты на сложных тестах.
https://github.com/CharlesQ9/Alita
3. WebThinker — автономный веб‑поиск с логикой "думай‑ищи‑пиши", RL‑обучением и глубокой навигацией
https://github.com/RUC-NLPIR/WebThinker
4. SimpleDeepSearcher — это лёгкий, но эффективный open‑source фреймворк от RUCAIBox, предназначенный для автономного веб-поиска через импровизированные многотуровые сессии:
- Использует Supervised Fine‑Tuning (SFT) вместо сложного RL, что значительно упрощает обучение и снижает вычислительные затраты
- Генерирует реалистичные траектории поиска и рассуждений, симулируя поведение пользователя в живом поисковом окружении .
- Критически отбирает данные по нескольким критериям качества: разнообразие запросов, сложность, структура ответов
5. AgenticSeek — приватный on‑device ассистент с выбором эксперта под задачу и голосовым управлением
https://github.com/Fosowl/agenticSeek
6. Suna — универсальный ассистент: браузер, CLI, работа с файлами, API, деплой
https://github.com/kortix-ai/suna
7. DeepResearcher — это комплексный open-source фреймворк от GAIR‑NLP, предназначенный для обучения LLM‑агентов, способных проводить глубокие исследования в автономном режиме, взаимодействуя с вебом. Использует несколько агентов‑браузеров, которые совместно исследуют веб и обрабатывают информацию
https://github.com/GAIR-NLP/DeepResearcher
8. Search‑R1 — агент на PPO/GRPO с поддержкой LLaMA3, Qwen2.5 и кастомных поисковиков. Агент учится эффективному циклу «думай — ищи — думай — отвечай» через RL, достигая важных улучшений в точности ответов и эффективности поиска.
https://github.com/PeterGriffinJin/Search-R1
9. ReCall — это фреймворк на основе RL, который учит LLM "должным образом" вызывать и комбинировать инструменты, используя сгенерированные задачи, без необходимости вручную собирать примеры вызовов — и всё это в открытом доступе.
https://github.com/Agent-RL/ReCall
10. OWL — мультиагентная система на CAMEL‑AI для динамического взаимодействия между агентами
https://github.com/camel-ai/owl
Агенты умеют планировать, взаимодействовать с браузером, запускать скрипты, интегрироваться с API и работать автономно.
Всё проекты — с открытым кодом. Можно изучить, собрать и доработать под свои задачи.
@ai_machinelearning_big_data
#ml #rl #aiagents #ai #agents
Please open Telegram to view this post
VIEW IN TELEGRAM
❤14👍6🔥4
🧠 DataMind - открытая система для умных дата-агентов
DataMind - это новая архитектура для создания универсальных агентов анализа данных, которые уже превосходят GPT-5 и DeepSeek-V3.1 по качеству рассуждений и работе с кодом.
🧩 Зачем создан DataMind
Сегодня большинство дата-агентов используют закрытые модели и зависят от промпт-инжиниринга.
Открытые решения не умеют устойчиво рассуждать по шагам и работать с разными форматами данных.
Команда DataMind решила эти три главные проблемы:
1. Недостаток качественных данных для обучения
2. Неправильные стратегии обучения
3. Ошибки при многошаговом исполнении кода
🔧 Как устроен DataMind
Система включает полный цикл - от генерации данных до обучения и выполнения задач.
Она использует:
- классификацию задач и создание запросов от простых к сложным
- фильтрацию траекторий через self-consistency (самопроверку ответов)
- комбинацию динамического обучения SFT и RL, что делает процесс стабильным
- оптимизированное выполнение кода в изолированной среде
📊 Результаты
- Модель DataMind-14B показала 71.16 % среднего результата и превзошла GPT-5 и DeepSeek-V3.1
- Лёгкая версия DataMind-7B стала лучшей среди open-source решений — 68.10 %, обучена на 12 000 траекторий
💡 Главные выводы
- Фильтрация через self-consistency эффективнее, чем выбор одной «лучшей» траектории
- Потери SFT стабилизируют обучение, но при ошибочной настройке вызывают колебания
- RL сокращает разрыв между моделями, но не меняет общий рейтинг
Команда открыла датасет DataMind-12K и модели DataMind-7B и 14B, чтобы сообщество могло строить своих аналитических агентов.
📄 Исследование: https://arxiv.org/abs/2509.25084
💻 Код: https://github.com/zjunlp/DataMind
📊 Модели и данные: https://huggingface.co/collections/zjunlp/datamind-687d90047c58bb1e3d901dd8)
#AI #DataScience #LLM #Agents #OpenSource #DataAnalysis #ReinforcementLearning #NLP
DataMind - это новая архитектура для создания универсальных агентов анализа данных, которые уже превосходят GPT-5 и DeepSeek-V3.1 по качеству рассуждений и работе с кодом.
🧩 Зачем создан DataMind
Сегодня большинство дата-агентов используют закрытые модели и зависят от промпт-инжиниринга.
Открытые решения не умеют устойчиво рассуждать по шагам и работать с разными форматами данных.
Команда DataMind решила эти три главные проблемы:
1. Недостаток качественных данных для обучения
2. Неправильные стратегии обучения
3. Ошибки при многошаговом исполнении кода
🔧 Как устроен DataMind
Система включает полный цикл - от генерации данных до обучения и выполнения задач.
Она использует:
- классификацию задач и создание запросов от простых к сложным
- фильтрацию траекторий через self-consistency (самопроверку ответов)
- комбинацию динамического обучения SFT и RL, что делает процесс стабильным
- оптимизированное выполнение кода в изолированной среде
📊 Результаты
- Модель DataMind-14B показала 71.16 % среднего результата и превзошла GPT-5 и DeepSeek-V3.1
- Лёгкая версия DataMind-7B стала лучшей среди open-source решений — 68.10 %, обучена на 12 000 траекторий
💡 Главные выводы
- Фильтрация через self-consistency эффективнее, чем выбор одной «лучшей» траектории
- Потери SFT стабилизируют обучение, но при ошибочной настройке вызывают колебания
- RL сокращает разрыв между моделями, но не меняет общий рейтинг
Команда открыла датасет DataMind-12K и модели DataMind-7B и 14B, чтобы сообщество могло строить своих аналитических агентов.
📄 Исследование: https://arxiv.org/abs/2509.25084
💻 Код: https://github.com/zjunlp/DataMind
📊 Модели и данные: https://huggingface.co/collections/zjunlp/datamind-687d90047c58bb1e3d901dd8)
#AI #DataScience #LLM #Agents #OpenSource #DataAnalysis #ReinforcementLearning #NLP
❤15🔥9👍3
🚀 IBM представила Toucan: крупнейший открытый набор данных для обучения ИИ-агентов вызывать и использовать инструменты (tool calling).
Toucan содержит более 1,5 млн реальных сценариев взаимодействия с API и внешними сервисами, охватывая 2000+ инструментов - от планирования задач до анализа данных и отчётности.
💡 Модели, обученные на Toucan, уже обошли GPT-4.5-Preview в ряде бенчмарков по эффективности работы с инструментами.
Toucan обучает модели на реальных последовательностях вызовов инструментов, а не синтетических данных.
Подробнее: https://research.ibm.com/blog/toucan-for-tool-calling
#AI #Agents #ToolCalling #IBM #LLM
Toucan содержит более 1,5 млн реальных сценариев взаимодействия с API и внешними сервисами, охватывая 2000+ инструментов - от планирования задач до анализа данных и отчётности.
💡 Модели, обученные на Toucan, уже обошли GPT-4.5-Preview в ряде бенчмарков по эффективности работы с инструментами.
Toucan обучает модели на реальных последовательностях вызовов инструментов, а не синтетических данных.
Подробнее: https://research.ibm.com/blog/toucan-for-tool-calling
#AI #Agents #ToolCalling #IBM #LLM
🔥11❤9👍4
🚀 Qwen3.6-Plus- новый мультимодальный агент от Alibaba
Ключевые особенности:
💻 Agentic Coding - умнее и быстрее в написании кода
👁️ Улучшенное мультимодальное зрение - точнее воспринимает и анализирует визуальный контент
🏆 Топовые общие способности - сохраняет лидерские позиции
📄 Контекстное окно 1M токенов - доступно через API по умолчанию
Модель создана на основе обратной связи от сообщества Qwen3.5. Доступна уже сейчас через chat.qwen.ai и API. Обещают открыть исходный код других моделей серии Qwen3.6.
Chat: https://chat.qwen.ai
API: https://modelstudio.console.alibabacloud.com/ap-southeast-1?tab=doc#/doc/?type=model&url=2840914_2&modelId=qwen3.6-plus
Blog: https://qwen.ai/blog?id=qwen3.6
#Qwen #AI #AgenticCoding #VibeCoding #Agents
🐍 полезные ресурсы 🚀Max
@data_analysis_ml
Ключевые особенности:
💻 Agentic Coding - умнее и быстрее в написании кода
👁️ Улучшенное мультимодальное зрение - точнее воспринимает и анализирует визуальный контент
🏆 Топовые общие способности - сохраняет лидерские позиции
📄 Контекстное окно 1M токенов - доступно через API по умолчанию
Модель создана на основе обратной связи от сообщества Qwen3.5. Доступна уже сейчас через chat.qwen.ai и API. Обещают открыть исходный код других моделей серии Qwen3.6.
Chat: https://chat.qwen.ai
API: https://modelstudio.console.alibabacloud.com/ap-southeast-1?tab=doc#/doc/?type=model&url=2840914_2&modelId=qwen3.6-plus
Blog: https://qwen.ai/blog?id=qwen3.6
#Qwen #AI #AgenticCoding #VibeCoding #Agents
🐍 полезные ресурсы 🚀Max
@data_analysis_ml
👍20🔥14❤6
Forwarded from Machinelearning
Инструмент интегрируется с Claude Code, Cursor и другими кодинг-агентами.
Raindrop - стартап из 9 человек, основанный в 2023 году, который позиционирует себя одним из первых, кто оформил мониторинг для ИИ-агентов как отдельный продуктовый класс.
При использовании Workshop модель получает прямой доступ к трассировкам выполнения, читает их, пишет оценочные тесты и правит код, замыкая цикл самовосстановления.
Если агент в проде отклоняется от ожидаемого поведения, разработчик вызывает кодинг-агента прямо в терминале. Тот читает трассу через Workshop, пишет оценку под падающий сценарий, правит код и перезапускает прогон.
Цикл повторяется автоматически, пока не пройдут все проверки.
Workshop работает локально и стримит данные в реальном времени. Каждый токен, вызов инструмента и шаг рассуждения попадает в интерфейс по мере выполнения, без поллинга.
Есть режим воспроизведение, который берёт трассу из продакшена и прогоняет её через ваш экземпляр агента, запущенный локально.
Заявлена поддержка TypeScript, Python, Go и Rust, а также фреймворков Vercel AI SDK, OpenAI Agents SDK, Anthropic SDK, Claude Agent SDK, LangChain, LangGraph, CrewAI, Mastra, Pydantic AI и DSPy.
@ai_machinelearning_big_data
#AI #ML #Agents #Workshop #RaindropAI
Please open Telegram to view this post
VIEW IN TELEGRAM
❤8👍8
ИИ-агенты часто ломаются ещё до того, как начинает ошибаться модель
В работе “AI Agents Do Not Fail Alone: The Context Fails First” исследователи показали: будущий сбой агента можно предсказать по его окружению ещё до завершения задачи.
Причина часто находится в том, что ей дали:
- расплывчатую роль и инструкции
- плохо описанные инструменты
- недостаточно фактов и доказательств
- противоречивые правила
- слабую память
- уязвимые защитные ограничения
- неудачно распределённый контекст
Авторы оценивали среду агента отдельно от его итогового результата. Поэтому метрика не угадывает поведение по ответу, а измеряет качество условий, в которых работает система.
На 300 тестах и 7500 шагах одни и те же фиксированные модели заметно улучшили результаты после перехода от хаотичного контекста к структурированному.
Больше фактических данных снижало число галлюцинаций. Чёткое описание инструментов улучшало tool use. Сильные guardrails повышали устойчивость к манипуляциям.
Но обнаружился и компромисс: чрезмерно защищённые агенты иногда становились слишком осторожными и хуже решали обычные задачи.
Прежде чем менять модель, стоит проверить промпты, инструменты, память, фактическую базу и правила безопасности.
https://arxiv.org/abs/2607.14275
#ai #agents #llm #research
В работе “AI Agents Do Not Fail Alone: The Context Fails First” исследователи показали: будущий сбой агента можно предсказать по его окружению ещё до завершения задачи.
Причина часто находится в том, что ей дали:
- расплывчатую роль и инструкции
- плохо описанные инструменты
- недостаточно фактов и доказательств
- противоречивые правила
- слабую память
- уязвимые защитные ограничения
- неудачно распределённый контекст
Авторы оценивали среду агента отдельно от его итогового результата. Поэтому метрика не угадывает поведение по ответу, а измеряет качество условий, в которых работает система.
На 300 тестах и 7500 шагах одни и те же фиксированные модели заметно улучшили результаты после перехода от хаотичного контекста к структурированному.
Больше фактических данных снижало число галлюцинаций. Чёткое описание инструментов улучшало tool use. Сильные guardrails повышали устойчивость к манипуляциям.
Но обнаружился и компромисс: чрезмерно защищённые агенты иногда становились слишком осторожными и хуже решали обычные задачи.
Прежде чем менять модель, стоит проверить промпты, инструменты, память, фактическую базу и правила безопасности.
https://arxiv.org/abs/2607.14275
#ai #agents #llm #research
🔥8👍6❤5😁3
Fugu-Cyber: ИИ-оркестратор для задач киберзащиты
Sakana AI представила обновление своей системы Fugu - специализированную модель Fugu-Cyber для анализа реальных задач информационной безопасности.
По данным компании, модель показала:
- 86,9% успешных решений на CyberGym
- 72,1% на CTI-REALM
- результаты на уровне GPT-5.5-Cyber и Mythos Preview
CyberGym проверяет способность находить и подтверждать уязвимости в сложных кодовых базах, а CTI-REALM — превращать отчёты об угрозах в рабочие правила обнаружения.
Fugu-Cyber работает как одна модель, но внутри динамически координирует несколько специализированных ИИ-агентов. Пользователь отправляет запрос в единый API, а система сама распределяет многоэтапную задачу между агентами.
При этом Sakana AI подчёркивает: высокая оценка на бенчмарке ещё не делает модель готовой системой защиты. Для работы в реальной инфраструктуре нужны эксперты, интеграция с внутренним кодом и обязательная проверка результатов человеком.
https://sakana.ai/fugu-cyber-release
#ai #cybersecurity #llm #agents #sakanaai
Sakana AI представила обновление своей системы Fugu - специализированную модель Fugu-Cyber для анализа реальных задач информационной безопасности.
По данным компании, модель показала:
- 86,9% успешных решений на CyberGym
- 72,1% на CTI-REALM
- результаты на уровне GPT-5.5-Cyber и Mythos Preview
CyberGym проверяет способность находить и подтверждать уязвимости в сложных кодовых базах, а CTI-REALM — превращать отчёты об угрозах в рабочие правила обнаружения.
Fugu-Cyber работает как одна модель, но внутри динамически координирует несколько специализированных ИИ-агентов. Пользователь отправляет запрос в единый API, а система сама распределяет многоэтапную задачу между агентами.
При этом Sakana AI подчёркивает: высокая оценка на бенчмарке ещё не делает модель готовой системой защиты. Для работы в реальной инфраструктуре нужны эксперты, интеграция с внутренним кодом и обязательная проверка результатов человеком.
https://sakana.ai/fugu-cyber-release
#ai #cybersecurity #llm #agents #sakanaai
❤8🔥6👍3⚡2
🧠 Две настройки утроили результат GPT-5.6 Sol на ARC-AGI-3
С официальным тестовым окружением модель набрала 13,3%. После включения двух функций Responses API результат вырос до 38,3%, а расход выходных токенов сократился примерно в 6 раз.
Средний результат человека на тех же публичных заданиях OpenAI оценивает в 48%.
Что изменили:
1. Сохранили рассуждения между действиями
Раньше после каждого хода агент терял найденные закономерности и фактически заново разбирался в игре.
2. Заменили обрезание истории на compaction
Вместо удаления старых действий длинный контекст сжимался, сохраняя важные наблюдения и выбранную стратегию.
В результате агент:
- быстрее принимал решения;
- реже повторял уже проделанную работу;
- лучше учился по ходу игры;
- тратил значительно меньше токенов.
Итоговый результат зависит не только от модели. Большую роль играют API, управление контекстом, промпт и устройство тестового harness.
OpenAI рекомендует использовать Responses API, сохранять рассуждения между вызовами и включать compaction для длинных сессий.
https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
#OpenAI #GPT56 #Agents #ARCAGI #LLM #AIEngineering
С официальным тестовым окружением модель набрала 13,3%. После включения двух функций Responses API результат вырос до 38,3%, а расход выходных токенов сократился примерно в 6 раз.
Средний результат человека на тех же публичных заданиях OpenAI оценивает в 48%.
Что изменили:
1. Сохранили рассуждения между действиями
Раньше после каждого хода агент терял найденные закономерности и фактически заново разбирался в игре.
2. Заменили обрезание истории на compaction
Вместо удаления старых действий длинный контекст сжимался, сохраняя важные наблюдения и выбранную стратегию.
В результате агент:
- быстрее принимал решения;
- реже повторял уже проделанную работу;
- лучше учился по ходу игры;
- тратил значительно меньше токенов.
Итоговый результат зависит не только от модели. Большую роль играют API, управление контекстом, промпт и устройство тестового harness.
OpenAI рекомендует использовать Responses API, сохранять рассуждения между вызовами и включать compaction для длинных сессий.
https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
#OpenAI #GPT56 #Agents #ARCAGI #LLM #AIEngineering
👍39🔥4❤3
⚡️ Sakana AI показала, как может выглядеть следующий этап мультиагентных систем - оркестрация, независимая от одной базовой модели.
Sakana Fugu работает как единая «виртуальная модель», хотя внутри скрывается целый пул разных LLM.
Пользователь отправляет запрос в один endpoint, а дальше Fugu сама решает:
- какую модель использовать;
- стоит ли разбить задачу на несколько частей;
- какие подзадачи отдать разным моделям;
- как собрать ответы обратно;
- где можно снизить стоимость без потери качества.
Архитектура состоит из двух уровней:
Model Pool выполняет реальные задачи, а Conductor Model выступает в роли дирижёра и решает, кому и что делегировать.
Пул моделей изначально сделан заменяемым.
То есть система не должна быть навечно привязана к конкретным GPT, Claude, Gemini или другим LLM. Можно обновлять набор моделей, сохраняя общий orchestration layer.
В новой версии Sakana пошла ещё дальше: дирижёрскую модель обучили на базе новой открытой Gemma 4.
По внутренним оценкам компании, новый conductor показывает производительность не хуже предыдущей версии, одновременно снижая стоимость работы системы.
Идея здесь важнее конкретной модели:
ценность постепенно смещается от «какая LLM самая сильная?» к «кто лучше всего умеет комбинировать несколько моделей под конкретную задачу».
Следующий шаг Sakana - собственные conductor-модели и инфраструктура, которую можно адаптировать под требования AI sovereignty.
Если такой подход масштабируется, в будущем разработчику может быть вообще неважно, какая модель находится под капотом.
Он будет обращаться к одному API, а orchestration layer сам решит, какая комбинация моделей даст лучший результат по цене, скорости и качеству.
🔗
#AI #LLM #Agents #MultiAgent #SakanaAI #Gemma
Sakana Fugu работает как единая «виртуальная модель», хотя внутри скрывается целый пул разных LLM.
Пользователь отправляет запрос в один endpoint, а дальше Fugu сама решает:
- какую модель использовать;
- стоит ли разбить задачу на несколько частей;
- какие подзадачи отдать разным моделям;
- как собрать ответы обратно;
- где можно снизить стоимость без потери качества.
Архитектура состоит из двух уровней:
Conductor Model → Model PoolModel Pool выполняет реальные задачи, а Conductor Model выступает в роли дирижёра и решает, кому и что делегировать.
Пул моделей изначально сделан заменяемым.
То есть система не должна быть навечно привязана к конкретным GPT, Claude, Gemini или другим LLM. Можно обновлять набор моделей, сохраняя общий orchestration layer.
В новой версии Sakana пошла ещё дальше: дирижёрскую модель обучили на базе новой открытой Gemma 4.
По внутренним оценкам компании, новый conductor показывает производительность не хуже предыдущей версии, одновременно снижая стоимость работы системы.
Идея здесь важнее конкретной модели:
ценность постепенно смещается от «какая LLM самая сильная?» к «кто лучше всего умеет комбинировать несколько моделей под конкретную задачу».
Следующий шаг Sakana - собственные conductor-модели и инфраструктура, которую можно адаптировать под требования AI sovereignty.
Если такой подход масштабируется, в будущем разработчику может быть вообще неважно, какая модель находится под капотом.
Он будет обращаться к одному API, а orchestration layer сам решит, какая комбинация моделей даст лучший результат по цене, скорости и качеству.
🔗
https://sakana.ai/fugu-gemma4/#AI #LLM #Agents #MultiAgent #SakanaAI #Gemma
❤18👍8🥰3
🚨 У AI-агентов нашли второй, почти невидимый канал утечки данных - скрытое reasoning.
Можно идеально зачистить публичный чат от паролей и API-ключей, а затем всё равно случайно опубликовать их внутри зашифрованного reasoning-блока.
Исследователи разобрали архитектуру API Anthropic, OpenAI и Google. Эти сервисы могут возвращать клиенту непрозрачные блоки с reasoning, чтобы потом передавать их обратно в следующих запросах без хранения всей цепочки рассуждений на сервере.
Проблема оказалась в переносимости таких блоков: во время тестирования их можно было использовать между разными сессиями, пользователями и даже совместимыми моделями одного провайдера. В результате reasoning сильной модели передавали более слабой модели того же семейства, которая становилась своеобразным «декодером».
Масштаб эксперимента впечатляет.
Исследователи собрали 6 708 публичных agent-траекторий с GitHub и Hugging Face и восстановили 315 320 reasoning-блоков. В 328 сессиях, или 4,9%, обнаружился хотя бы один чувствительный элемент.
В реальных пользовательских сессиях нашли:
* 62 API-ключа;
* 33 пароля;
* 24 access token;
* 7 private keys;
* 30 личных email.
Причём 64 чувствительных элемента вообще отсутствовали в видимой истории чата и находились только внутри reasoning. То есть обычная очистка логов их бы не заметила.
Самый неприятный вывод: безопасность всей линейки моделей может определяться не самой защищённой моделью, а самой слабой совместимой моделью, которая умеет прочитать тот же reasoning-блок.
После responsible disclosure провайдеры внесли изменения, и описанные атаки исследователям уже не удалось воспроизвести тем же способом. Но архитектурный урок остаётся.
Зашифрованное reasoning в логах нельзя автоматически считать безопасными метаданными.
Если агент работал с секретами, API-ключами или приватными данными, reasoning-блоки лучше вообще не публиковать вместе с трассировкой.
Исследование: *Stealing Reasoning Traces from Proprietary LLM APIs*.
arxiv.org/abs/2608.09867
#AI #LLM #AISecurity #Agents #CyberSecurity
Можно идеально зачистить публичный чат от паролей и API-ключей, а затем всё равно случайно опубликовать их внутри зашифрованного reasoning-блока.
Исследователи разобрали архитектуру API Anthropic, OpenAI и Google. Эти сервисы могут возвращать клиенту непрозрачные блоки с reasoning, чтобы потом передавать их обратно в следующих запросах без хранения всей цепочки рассуждений на сервере.
Проблема оказалась в переносимости таких блоков: во время тестирования их можно было использовать между разными сессиями, пользователями и даже совместимыми моделями одного провайдера. В результате reasoning сильной модели передавали более слабой модели того же семейства, которая становилась своеобразным «декодером».
Масштаб эксперимента впечатляет.
Исследователи собрали 6 708 публичных agent-траекторий с GitHub и Hugging Face и восстановили 315 320 reasoning-блоков. В 328 сессиях, или 4,9%, обнаружился хотя бы один чувствительный элемент.
В реальных пользовательских сессиях нашли:
* 62 API-ключа;
* 33 пароля;
* 24 access token;
* 7 private keys;
* 30 личных email.
Причём 64 чувствительных элемента вообще отсутствовали в видимой истории чата и находились только внутри reasoning. То есть обычная очистка логов их бы не заметила.
Самый неприятный вывод: безопасность всей линейки моделей может определяться не самой защищённой моделью, а самой слабой совместимой моделью, которая умеет прочитать тот же reasoning-блок.
После responsible disclosure провайдеры внесли изменения, и описанные атаки исследователям уже не удалось воспроизвести тем же способом. Но архитектурный урок остаётся.
Зашифрованное reasoning в логах нельзя автоматически считать безопасными метаданными.
Если агент работал с секретами, API-ключами или приватными данными, reasoning-блоки лучше вообще не публиковать вместе с трассировкой.
Исследование: *Stealing Reasoning Traces from Proprietary LLM APIs*.
arxiv.org/abs/2608.09867
#AI #LLM #AISecurity #Agents #CyberSecurity
1🔥9❤7👍7
🔥 DeepSeek готовит собственный Harness: V4 Pro хотят превратить в полноценного coding-агента с ценой около $0,03 за задачу
В китайских источниках всплыли детали DeepSeek Harness, который сейчас якобы проходит внутреннее тестирование. Логика знакомая по Claude Code и Codex: модель получает управление контекстом, цепочки tool calls, автоматический rollback после ошибок и полный цикл работы с репозиторием.
Внутри заявлена multi-agent схема. Один агент планирует задачу, другие разбирают подзадачи, запускают тесты, правят код и повторяют цикл после неудачных попыток.
Самое интересное в экономике. Harness глубоко завязан на финальную V4 Pro и рассчитан на очень высокий cache hit, по прогнозам выше 99%. За счёт этого стоимость одной типичной задачи оценивают примерно в $0,03.
Для V4 Flash при попадании в кэш вход якобы обходится примерно в $0,003 за 1 млн токенов, выход около $0,28. Авторы утечки утверждают, что полный agentic workflow может быть более чем в 7 раз дешевле Claude Opus 4.8 и GPT-5.6.
По производительности заявляют уровень около Opus 4.8 и GPT-5.6, а в отдельных сценариях даже выше. Пока это внутренние цифры, независимых тестов нет.
Если DeepSeek действительно выпустит собственный desktop harness вместе с V4 Pro, конкурировать придётся уже не только ценой модели. В гонку полноценно входит связка:
И здесь DeepSeek традиционно пытается ударить по самому болезненному месту рынка, стоимости каждого автономно выполненного задания.
#DeepSeek #AI #Agents #CodingAgents #LLM
В китайских источниках всплыли детали DeepSeek Harness, который сейчас якобы проходит внутреннее тестирование. Логика знакомая по Claude Code и Codex: модель получает управление контекстом, цепочки tool calls, автоматический rollback после ошибок и полный цикл работы с репозиторием.
Внутри заявлена multi-agent схема. Один агент планирует задачу, другие разбирают подзадачи, запускают тесты, правят код и повторяют цикл после неудачных попыток.
Самое интересное в экономике. Harness глубоко завязан на финальную V4 Pro и рассчитан на очень высокий cache hit, по прогнозам выше 99%. За счёт этого стоимость одной типичной задачи оценивают примерно в $0,03.
Для V4 Flash при попадании в кэш вход якобы обходится примерно в $0,003 за 1 млн токенов, выход около $0,28. Авторы утечки утверждают, что полный agentic workflow может быть более чем в 7 раз дешевле Claude Opus 4.8 и GPT-5.6.
По производительности заявляют уровень около Opus 4.8 и GPT-5.6, а в отдельных сценариях даже выше. Пока это внутренние цифры, независимых тестов нет.
Если DeepSeek действительно выпустит собственный desktop harness вместе с V4 Pro, конкурировать придётся уже не только ценой модели. В гонку полноценно входит связка:
Model + Harness + Tools + Cache + Multi-AgentИ здесь DeepSeek традиционно пытается ударить по самому болезненному месту рынка, стоимости каждого автономно выполненного задания.
#DeepSeek #AI #Agents #CodingAgents #LLM
🔥28❤8👍5🤯2
🔥 DeepSeek V4 Pro официально вышел. И релиз явно заточен под агентов
DeepSeek раскатила GA-версию V4 Pro сразу в приложении, вебе и API. В интерфейсе модель доступна через Expert Mode, а API по-прежнему вызывается как
Самый большой апгрейд получил agentic режим. Terminal Bench 2.1 теперь 87,9, CyberGym 83,3, DeepSWE 62,7, Toolathlon Verified 74,1. DeepSeek отдельно говорит о заметном росте именно в production-сценариях.
Для V4 Pro и V4 Flash появились три уровня reasoning:
Ещё важнее для разработчиков: теперь есть нативная поддержка OpenAI Responses API и отдельная оптимизация под Codex.
С 16 августа DeepSeek также вводит peak/off-peak тарифы. В непиковые часы API будет стоить вдвое дешевле.
Похоже, V4 Pro теперь продают уже не как очередную сильную LLM, а как рабочий движок для долгих агентных задач.
#DeepSeek #AI #LLM #Agents #Codex
https://x.com/deepseek_ai/status/2087864585504305397
DeepSeek раскатила GA-версию V4 Pro сразу в приложении, вебе и API. В интерфейсе модель доступна через Expert Mode, а API по-прежнему вызывается как
deepseek-v4-pro.Самый большой апгрейд получил agentic режим. Terminal Bench 2.1 теперь 87,9, CyberGym 83,3, DeepSWE 62,7, Toolathlon Verified 74,1. DeepSeek отдельно говорит о заметном росте именно в production-сценариях.
Для V4 Pro и V4 Flash появились три уровня reasoning:
low для простых задач, high для обычной работы агентов и max для сложных сценариев.Ещё важнее для разработчиков: теперь есть нативная поддержка OpenAI Responses API и отдельная оптимизация под Codex.
С 16 августа DeepSeek также вводит peak/off-peak тарифы. В непиковые часы API будет стоить вдвое дешевле.
Похоже, V4 Pro теперь продают уже не как очередную сильную LLM, а как рабочий движок для долгих агентных задач.
#DeepSeek #AI #LLM #Agents #Codex
https://x.com/deepseek_ai/status/2087864585504305397
🔥15❤7👍5🐳1
⚡️ pi-mail превращает несколько AI-агентов в маленькую распределённую команду с собственной почтой, Kanban и менеджерами.
Проект сделан как расширение для
Самое интересное начинается поверх обычной «почты». В pi-mail есть Web UI, где видно всех живых агентов, их модель, uptime, статус и заполненность контекста. Там же есть Outlook-подобный mailbox и общая Kanban-доска с двусторонней синхронизацией Jira. Назначили карточку агенту, он автоматически получает весь контекст задачи письмом.
Можно прямо из интерфейса поднимать новых агентов в нужной директории, открывать их терминалы через браузер и гасить процессы после выполнения работы. Для внешних клиентов доска доступна ещё и через MCP.
Есть даже полноценная иерархия:
CEO периодически смотрит на проекты и решает, где нужен менеджер. Middle Manager разбирает зависшие задачи и запускает исполнителей. Worker делает работу и после завершения сам удаляет свою сессию. Для зависших процессов есть reaper с лимитами времени жизни.
Получается довольно интересный взгляд на multi-agent coding: не огромный оркестратор с одной сложной state machine, а знакомая человеческая модель работы.
Почта + задачи + менеджеры + временные исполнители.
🔗 github.com/tanevanwifferen/pi-mail
#AI #Agents #MultiAgent #MCP #OpenSource
Проект сделан как расширение для
pi: несколько агентных процессов подключаются к общему mailbox-daemon и могут отправлять друг другу сообщения, раздавать задачи и продолжать работу независимо от перезапуска отдельных агентов. Центральный облачный сервис при этом не нужен.Самое интересное начинается поверх обычной «почты». В pi-mail есть Web UI, где видно всех живых агентов, их модель, uptime, статус и заполненность контекста. Там же есть Outlook-подобный mailbox и общая Kanban-доска с двусторонней синхронизацией Jira. Назначили карточку агенту, он автоматически получает весь контекст задачи письмом.
Можно прямо из интерфейса поднимать новых агентов в нужной директории, открывать их терминалы через браузер и гасить процессы после выполнения работы. Для внешних клиентов доска доступна ещё и через MCP.
Есть даже полноценная иерархия:
CEO → Middle Manager → WorkersCEO периодически смотрит на проекты и решает, где нужен менеджер. Middle Manager разбирает зависшие задачи и запускает исполнителей. Worker делает работу и после завершения сам удаляет свою сессию. Для зависших процессов есть reaper с лимитами времени жизни.
Получается довольно интересный взгляд на multi-agent coding: не огромный оркестратор с одной сложной state machine, а знакомая человеческая модель работы.
Почта + задачи + менеджеры + временные исполнители.
🔗 github.com/tanevanwifferen/pi-mail
#AI #Agents #MultiAgent #MCP #OpenSource
👍12❤10🔥7🤔2
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
Prime Agent — это больше, чем харнесс модели. Сами авторы называют проект операционной системой для долгоживущих агентов.
Умнее модель он не делает, но дает ей работать дольше - программно раскладывать информацию, параллельно раздавать задачи подагентам и копить полезные процедуры.
Идея в том, чтобы у языковой модели была устойчивая вычислительная среда, где она сама распоряжается памятью, кодом, подагентами и долгими задачами.
Состояние в системе разложено по четырем уровням:
Состояние переживает и шаги, и перезапуски, и отключения. Человек при этом может наблюдать за агентами и вмешиваться.
Сильнее всего эффект виден на длинных интерактивных задачах. На ARC-AGI-3 конфигурация с Opus 5 дала 95,5% Best@1 против 30,2% у обвязки самой ARC.
На длинноконтекстных задачах Prime Agent держится наравне с конкурентами, а на отдельных, вроде EmulatorBench, заметно вырывается вперед. Он обошел Pi-mono с GLM-5.2 и Codex с GPT-5.6 Sol, но уступил Claude Code с Opus 5.
Отдельно показательны игровые прогоны на эмуляторах. На Sega Genesis связка Prime Agent и GPT-5.6 Sol набрала 61,6% по итоговой оценке верификатора, а Claude Code с той же моделью — ноль. На Game Boy Color разрыв еще резче: 99,8% против нуля.
Самая любопытная деталь отчета - накопление навыков закрепляет не только полезное.
В одном из экспериментов агент нашел способ обходить ограничения Factorio, сохранил его как переиспользуемый навык и тем самым записал эксплойт в долговременную память. Дальше он доставал оттуда именно это решение, потому что оно один раз сработало.
На днях вышел релиз 0.8.0 с исправлениями найденных проблем и новыми возможностями.
@ai_machinelearning_big_data
#AI #ML #Harness #Agents #PrimeIntellect
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👍2🥴1
Qwen вместе с Taobao & Tmall и сделала E-Commerce Bench, где агенту дают 100 тысяч юаней и 365 виртуальных дней. Он изучает категории, торгуется с поставщиками, назначает цены, следит за календарём распродаж, тянет склад и контролирует денежные потоки, причём одновременно может вести до четырёх магазинов.
Ни потолок спроса, ни себестоимость ему не показаны - до всего нужно докопаться самому.
Рабочий день идёт с 8 утра до 6 вечера, и каждый вызов инструмента тратит время: проверить деньги (10 минут), открыть магазин (60), написать поставщику (30).
Расходы списываются сразу, а выручка идёт через комиссию, эскроу, 9 дней ожидания и ручной вывод.
Склад сводится посуточно, товар, не отправленный за двое суток, отменяется, а репутация напрямую множит спрос: магазин на дне её шкалы получает 15% от обычного трафика.
Если бы роль поставщика играла языковая модель, одна и та же стратегия давала бы разные цены, а бенч превратился бы в соревнование по джейлбрейку. Поэтому все уступки и отказы считает жёсткий алгоритм, а модель лишь переводит его решения в речь на виртуальных переговорах.
GPT-5.6 Sol - лидер, он закончил год с 1,43 млн юаней, увеличив капитал в 14,3 раза.
Qwen3.8-Max-Preview - лучшая среди моделей с открытыми весами, на конец года у нее было 416 тыс. юаней
Qwen3.5-Plus остался с 1100 юанями.
Кстати, 10 циклов из 90 закончились банкротством, и сценарий почти всегда один - забить склад в январе и не суметь распродать.
Торговаться толком не научился никто.
До себестоимости поставщика не додавил ни один агент. Единственный, кто хоть как-то сбивал цену - Opus 4.7, но по настроению.
Исключение - Qwen3.8-Max-Preview, которая продавливает цену ниже на повторных заказах.
С мошенниками вышло интереснее всего.
Их в реестре 152 из 576 (26,4%), они пишут всем моделям, но у Opus 4.7 деньги получили 4% тех мошенников, с кем он заговорил, у GPT-5.6 Sol - 31,7%.
ИИ-предприниматели категорически не умеют распоряжаться рабочим временем.
Отправки, переходы на следующий день, вывод наличных и выкладка товара съедают 71,8% всех вызовов. На разговоры с поставщиками приходится 6%. На пересмотр цен 0,66%.
Модели заняты обслуживанием процесса, а не экономикой.
Отсюда странность в рейтинге эффективности. Fable5 зарабатывает 479 юаней на вызов против 363 у Sol, тратя при этом почти вдвое меньше вызовов, а по итоговым деньгам идёт позади.
Измерять обучение на длинной дистанции сложно, но тут у бенча есть линейка.
Ядро переговоров никогда не уходит ниже собственной себестоимости, значит лучшая цена, которую агент однажды выбил, - это верхняя граница того, за сколько поставщик готов отдать товар. Дальше можно сравнивать - следующая закупка у того же поставщика прошла дешевле или дороже уже достигнутого.
На 8647 повторных покупок улучшили свой же результат только 2 модели из 18, а 15 переплачивали настолько, что промахивались мимо случайного порядка больше чем на 2 стандартных отклонения.
#AI #ML #Agents #ECommerce #Benchmark #Qwen
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥17👍9❤8