🚀 Stanford и Northeastern сделали «Git для AI-агентов»
Shepherd решает одну из неприятных проблем агентных систем: обычный лог хранит диалог и снимки окружения, но не умеет полноценно откатить живое состояние процесса.
Что делает Shepherd:
- сохраняет одновременно процесс агента и файловую систему;
- превращает действия модели, tool calls и изменения окружения в типизированные commits;
- позволяет откатиться к любому прошлому состоянию;
- после checkout агент может продолжить работу ровно с той точки.
Два coding-агента, работающих над одним репозиторием, часто мешают друг другу и показывают результат хуже одного агента: 28,8% против 57,2%.
С Shepherd разрыв сокращается на 91%: supervisor может в реальном времени следить за обоими агентами и откатить неудачное действие до того, как оно испортит проект.
GitHub:
https://github.com/shepherd-agents/shepherd
#AI #AIAgents #CodingAgents #Git #OpenSource
Shepherd решает одну из неприятных проблем агентных систем: обычный лог хранит диалог и снимки окружения, но не умеет полноценно откатить живое состояние процесса.
Что делает Shepherd:
- сохраняет одновременно процесс агента и файловую систему;
- превращает действия модели, tool calls и изменения окружения в типизированные commits;
- позволяет откатиться к любому прошлому состоянию;
- после checkout агент может продолжить работу ровно с той точки.
Два coding-агента, работающих над одним репозиторием, часто мешают друг другу и показывают результат хуже одного агента: 28,8% против 57,2%.
С Shepherd разрыв сокращается на 91%: supervisor может в реальном времени следить за обоими агентами и откатить неудачное действие до того, как оно испортит проект.
GitHub:
https://github.com/shepherd-agents/shepherd
#AI #AIAgents #CodingAgents #Git #OpenSource
👍18🔥8❤6
🔥 DeepSeek готовит собственный Harness: V4 Pro хотят превратить в полноценного coding-агента с ценой около $0,03 за задачу
В китайских источниках всплыли детали DeepSeek Harness, который сейчас якобы проходит внутреннее тестирование. Логика знакомая по Claude Code и Codex: модель получает управление контекстом, цепочки tool calls, автоматический rollback после ошибок и полный цикл работы с репозиторием.
Внутри заявлена multi-agent схема. Один агент планирует задачу, другие разбирают подзадачи, запускают тесты, правят код и повторяют цикл после неудачных попыток.
Самое интересное в экономике. Harness глубоко завязан на финальную V4 Pro и рассчитан на очень высокий cache hit, по прогнозам выше 99%. За счёт этого стоимость одной типичной задачи оценивают примерно в $0,03.
Для V4 Flash при попадании в кэш вход якобы обходится примерно в $0,003 за 1 млн токенов, выход около $0,28. Авторы утечки утверждают, что полный agentic workflow может быть более чем в 7 раз дешевле Claude Opus 4.8 и GPT-5.6.
По производительности заявляют уровень около Opus 4.8 и GPT-5.6, а в отдельных сценариях даже выше. Пока это внутренние цифры, независимых тестов нет.
Если DeepSeek действительно выпустит собственный desktop harness вместе с V4 Pro, конкурировать придётся уже не только ценой модели. В гонку полноценно входит связка:
И здесь DeepSeek традиционно пытается ударить по самому болезненному месту рынка, стоимости каждого автономно выполненного задания.
#DeepSeek #AI #Agents #CodingAgents #LLM
В китайских источниках всплыли детали DeepSeek Harness, который сейчас якобы проходит внутреннее тестирование. Логика знакомая по Claude Code и Codex: модель получает управление контекстом, цепочки tool calls, автоматический rollback после ошибок и полный цикл работы с репозиторием.
Внутри заявлена multi-agent схема. Один агент планирует задачу, другие разбирают подзадачи, запускают тесты, правят код и повторяют цикл после неудачных попыток.
Самое интересное в экономике. Harness глубоко завязан на финальную V4 Pro и рассчитан на очень высокий cache hit, по прогнозам выше 99%. За счёт этого стоимость одной типичной задачи оценивают примерно в $0,03.
Для V4 Flash при попадании в кэш вход якобы обходится примерно в $0,003 за 1 млн токенов, выход около $0,28. Авторы утечки утверждают, что полный agentic workflow может быть более чем в 7 раз дешевле Claude Opus 4.8 и GPT-5.6.
По производительности заявляют уровень около Opus 4.8 и GPT-5.6, а в отдельных сценариях даже выше. Пока это внутренние цифры, независимых тестов нет.
Если DeepSeek действительно выпустит собственный desktop harness вместе с V4 Pro, конкурировать придётся уже не только ценой модели. В гонку полноценно входит связка:
Model + Harness + Tools + Cache + Multi-AgentИ здесь DeepSeek традиционно пытается ударить по самому болезненному месту рынка, стоимости каждого автономно выполненного задания.
#DeepSeek #AI #Agents #CodingAgents #LLM
🔥28❤8👍5🤯2