Анализ данных (Data analysis)
50.4K subscribers
3.47K photos
428 videos
1 file
2.84K links
Data science, наука о данных.

@haarrp - админ

РКН: clck.ru/3FmyAp
Download Telegram
🚀 Stanford и Northeastern сделали «Git для AI-агентов»

Shepherd решает одну из неприятных проблем агентных систем: обычный лог хранит диалог и снимки окружения, но не умеет полноценно откатить живое состояние процесса.

Что делает Shepherd:

- сохраняет одновременно процесс агента и файловую систему;
- превращает действия модели, tool calls и изменения окружения в типизированные commits;
- позволяет откатиться к любому прошлому состоянию;
- после checkout агент может продолжить работу ровно с той точки.

Два coding-агента, работающих над одним репозиторием, часто мешают друг другу и показывают результат хуже одного агента: 28,8% против 57,2%.

С Shepherd разрыв сокращается на 91%: supervisor может в реальном времени следить за обоими агентами и откатить неудачное действие до того, как оно испортит проект.


GitHub:
https://github.com/shepherd-agents/shepherd

#AI #AIAgents #CodingAgents #Git #OpenSource
👍18🔥86
🔥 DeepSeek готовит собственный Harness: V4 Pro хотят превратить в полноценного coding-агента с ценой около $0,03 за задачу

В китайских источниках всплыли детали DeepSeek Harness, который сейчас якобы проходит внутреннее тестирование. Логика знакомая по Claude Code и Codex: модель получает управление контекстом, цепочки tool calls, автоматический rollback после ошибок и полный цикл работы с репозиторием.

Внутри заявлена multi-agent схема. Один агент планирует задачу, другие разбирают подзадачи, запускают тесты, правят код и повторяют цикл после неудачных попыток.

Самое интересное в экономике. Harness глубоко завязан на финальную V4 Pro и рассчитан на очень высокий cache hit, по прогнозам выше 99%. За счёт этого стоимость одной типичной задачи оценивают примерно в $0,03.

Для V4 Flash при попадании в кэш вход якобы обходится примерно в $0,003 за 1 млн токенов, выход около $0,28. Авторы утечки утверждают, что полный agentic workflow может быть более чем в 7 раз дешевле Claude Opus 4.8 и GPT-5.6.

По производительности заявляют уровень около Opus 4.8 и GPT-5.6, а в отдельных сценариях даже выше. Пока это внутренние цифры, независимых тестов нет.

Если DeepSeek действительно выпустит собственный desktop harness вместе с V4 Pro, конкурировать придётся уже не только ценой модели. В гонку полноценно входит связка:

Model + Harness + Tools + Cache + Multi-Agent

И здесь DeepSeek традиционно пытается ударить по самому болезненному месту рынка, стоимости каждого автономно выполненного задания.

#DeepSeek #AI #Agents #CodingAgents #LLM
🔥288👍5🤯2