Forwarded from Love. Death. Transformers.
прошли почти сутки, я успел покушать поспать, поработать, зайдя в обед я был приятно удивлен - мой recursive self improvement неплохо справляется и с обновлением себя и с LB этой соревки
https://github.com/AlexWortega/OpenRsi
https://github.com/AlexWortega/OpenRsi
🔥38👏13❤9🍾8👍4🥴4🤮1😍1
Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench
Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.
Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.
Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.
Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋
P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)
GitHub, Хабр, установочники
Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.
Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.
Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.
Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять
P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)
GitHub, Хабр, установочники
Please open Telegram to view this post
VIEW IN TELEGRAM
🎉317❤86👏40🤯29🔥24🤡14👍10⚡3👌3🦄2😱1
This media is not supported in your browser
VIEW IN TELEGRAM
Несколько приятных апдейтов уробороса:
1. Теперь есть телеграм mini-app — можно в два клика получить доступ к интерфейсу уробороса запущенного у вас на сервере или компе
2. Хабы скиллов (ClawHub нативно поддерживается и мой кастомный OuroborosHub)
3. Умеет запускать рой агентов уроборосят — до 500 штук (и nested глубина до 5). То есть агенты с детьми, внуками и тп. Они работают через worktree и синтез патчей.
1. Теперь есть телеграм mini-app — можно в два клика получить доступ к интерфейсу уробороса запущенного у вас на сервере или компе
2. Хабы скиллов (ClawHub нативно поддерживается и мой кастомный OuroborosHub)
3. Умеет запускать рой агентов уроборосят — до 500 штук (и nested глубина до 5). То есть агенты с детьми, внуками и тп. Они работают через worktree и синтез патчей.
🔥132😱48👍14🤡11❤8🤯3👎2👏1👀1
Forwarded from Love. Death. Transformers.
все видели NLA/J space от антропиков? Ну типа учат доп модель "reader который читает активации " и по ним отвечает.
Вот и я видел, но мне не нравилось что:
- кастом модели надо учить с нуля
- нельзя смотреть " а была ли модель байеснута при ответе"
Ну и я обучил universal activation oracle - училась сразу на разных семействах моделей и через динамическую( там тонкий слой для каждой модели за 20s на цпу чтобы размерности поматчить) можно посмотреть "а что кими3 думает про Путина(ничего хорошего)" - иногда требуется покрутить слой который вы читаете чтобы получить хороший результат, но "почти всегда" работает из коробки на средних слоях.
По сути это общее решение для задачи
Activation oracle/white box monimonito
Велком тыкатся:
https://huggingface.co/spaces/AlexWortega/activation-oracle
Вот и я видел, но мне не нравилось что:
- кастом модели надо учить с нуля
- нельзя смотреть " а была ли модель байеснута при ответе"
Ну и я обучил universal activation oracle - училась сразу на разных семействах моделей и через динамическую( там тонкий слой для каждой модели за 20s на цпу чтобы размерности поматчить) можно посмотреть "а что кими3 думает про Путина(ничего хорошего)" - иногда требуется покрутить слой который вы читаете чтобы получить хороший результат, но "почти всегда" работает из коробки на средних слоях.
По сути это общее решение для задачи
Activation oracle/white box monimonito
Велком тыкатся:
https://huggingface.co/spaces/AlexWortega/activation-oracle
🔥75😁14❤11👍6💩5🤮4🥱2🙏1
Борис опять
# Блекпилл по поводу агентов Я раз в пару месяцев осциллирую по поводу AI тулов для кодинга. Сегодняшняя итерация: я ошибался, вайбкодинг не работает для разработки чего-либо, чем надо пользоваться больше одного раза. И никогда не работал. Я думаю, что…
Борис описывает проблему, которая, на мой взгляд, является законом Лемана на стероидах (второй закон эволюции ПО):
Это всегда было актуально и для человеческой разработки, особенно в больших проектах.
Проблема с агентами в том, что с ними проект растёт и развивается гораздо быстрее, чем раньше, а значит, и гнить он начинает быстрее.
Но я считаю, что это решаемая проблема даже на текущем уровне развития агентов и LLM. Нам с Уроборосом пришлось долго учиться противодействовать заслопливанию кода, и из этого в том числе появились принципы IMMUNE.
Правильно выстроенная система адверсариального ревью тоже довольно неплохо помогает. Но ревью должно опираться на явную иерархию требований, начинающуюся с конституционных формулировок. В Уроборосе вершина этой иерархии лежит в
На мой взгляд, ключевая проблема тут в том, что LLM нехватает длинного контекста, а основные харнессы плохо помогают им сохранять целостную ментальную модель проекта.
Поэтому:
1. Я очень жду LLM с 10B контекстом.
2. Продолжаю развивать Уробороса и делать ставку на мета-системы, которые автономно улучшают и сам процесс разработки: "Improve the generator, not the generation".
Мы точно не упёрлись в предел качества автономных агентов, а просто научились очень быстро генерировать код, при этом ещё плохо умеем с той же скоростью противодействовать его гниению.
Код будет гнить, если его гниению активно не противодействовать.
Это всегда было актуально и для человеческой разработки, особенно в больших проектах.
Проблема с агентами в том, что с ними проект растёт и развивается гораздо быстрее, чем раньше, а значит, и гнить он начинает быстрее.
Но я считаю, что это решаемая проблема даже на текущем уровне развития агентов и LLM. Нам с Уроборосом пришлось долго учиться противодействовать заслопливанию кода, и из этого в том числе появились принципы IMMUNE.
Правильно выстроенная система адверсариального ревью тоже довольно неплохо помогает. Но ревью должно опираться на явную иерархию требований, начинающуюся с конституционных формулировок. В Уроборосе вершина этой иерархии лежит в
BIBLE.md: требования важнее архитектуры, архитектура важнее реализации.На мой взгляд, ключевая проблема тут в том, что LLM нехватает длинного контекста, а основные харнессы плохо помогают им сохранять целостную ментальную модель проекта.
Поэтому:
1. Я очень жду LLM с 10B контекстом.
2. Продолжаю развивать Уробороса и делать ставку на мета-системы, которые автономно улучшают и сам процесс разработки: "Improve the generator, not the generation".
Мы точно не упёрлись в предел качества автономных агентов, а просто научились очень быстро генерировать код, при этом ещё плохо умеем с той же скоростью противодействовать его гниению.
👍147🔥48❤39🤡13💯12✍6🤔6👎5😁1🎉1
🎉 Уроборос залетел в GitHub Trending и уже перевалил за 1к звёзд!
А я тем временем наконец добил интеграцию с Claudexor. Потому что платить API-деньгами за тяжёлые задачи, когда у тебя уже есть оплаченные подписки, это была какая-то особенно бессмысленная форма страдания.
Теперь к Уроборосу можно подключить свои OAuth-аккаунты Claude Code, Codex и Cursor, хоть по несколько на сервис. Claudexor сам перекидывает работу на следующий аккаунт, когда текущий упирается в квоту.
https://github.com/razzant/ouroboros
А я тем временем наконец добил интеграцию с Claudexor. Потому что платить API-деньгами за тяжёлые задачи, когда у тебя уже есть оплаченные подписки, это была какая-то особенно бессмысленная форма страдания.
Теперь к Уроборосу можно подключить свои OAuth-аккаунты Claude Code, Codex и Cursor, хоть по несколько на сервис. Claudexor сам перекидывает работу на следующий аккаунт, когда текущий упирается в квоту.
https://github.com/razzant/ouroboros
👏181🔥137🎉28❤18💩10👍8🥱4🍾4
Присмотритесь. Мало того, что капчи эволюционировали в тесты на IQ, так теперь ещё и адверсариал атаки в них добавляют (вроде таких), прикольно.
🤯79🔥30😁17🤔11👌6🎉4👍3💯2❤1😨1
В комьюнити начался шитшторм в сторону Anthropic из-за очень творческой арифметики лимитов.
Если вы думали, что Max 20x даёт в 20 раз больше usage — забудьте. 20x относится только к 5-часовому окну. По недельным лимитам $200 Max даёт только x2 относительно $100 Max 5x.
Справедливости ради, даже так это тысячи долларов API-эквивалента за $200. Но запашок, конечно, есть.
Если вы думали, что Max 20x даёт в 20 раз больше usage — забудьте. 20x относится только к 5-часовому окну. По недельным лимитам $200 Max даёт только x2 относительно $100 Max 5x.
Справедливости ради, даже так это тысячи долларов API-эквивалента за $200. Но запашок, конечно, есть.
X (formerly Twitter)
SataEric (@SataEricUX) on X
The whole “20x” in Claude’s pricing is so misleading.
The $100 plan says 5x Pro limits, while the $200 plan says 20x Pro limits. That makes it sound like you’re getting 4x the usage.
But the 20x…
The $100 plan says 5x Pro limits, while the $200 plan says 20x Pro limits. That makes it sound like you’re getting 4x the usage.
But the 20x…
😡65🤣50🤯16🌚4💯4👍3🥱3😁2🤷♂1❤1🤔1
GPT-6 Astra
https://openai.com/index/gpt-6-astra/
Видимо все пошли читать и уронили.
В подписках Plus, Pro, Business и Enterprise появится у всех в течение нескольких дней. А цена API такая же как у Fable:
https://openai.com/index/gpt-6-astra/
Видимо все пошли читать и уронили.
В подписках Plus, Pro, Business и Enterprise появится у всех в течение нескольких дней. А цена API такая же как у Fable:
$10 per million input tokens and $50 per million output tokens
😁74👏18🔥7❤2🥱2⚡1👎1🍾1
Оо, приятный сюрприз. У GPT-6-astra есть Flex режим со скидкой 50% по API
https://openrouter.ai/openai/gpt-6-astra#providers
https://openrouter.ai/openai/gpt-6-astra#providers
🔥45🥱9👍4❤2👏1🍾1
А вы замечаете, как мы переходим в эпоху, когда программу быстрее написать, чем найти?
💯331😁125👍38🔥9🤔7🤯4🤡4🥱3❤2🙈2💩1
Forwarded from Machinelearning
Неформальный голос в X OpenAI, Тибо, сообщил, что интерес к Astra побил все внутренние исторические рекорды сервиса.
Компания неоднократно сталкивалась с резкими скачками трафика, но текущая динамика оказалась беспрецедентной - команда задействует все доступные вычислительные мощности, чтобы удерживать доступность инфраструктуры.
Главным приоритетом в OpenAI называют сохранение качества обслуживания текущих клиентов и если нагрузка продолжит расти теми же темпами, компания пойдет на превентивную меру и временно заморозит продажи тарифа ChatGPT Pro во избежание очередей на инференс и деградации производительности.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯53😁36❤25🤡10🔥5👀5👍2🥱2😱1
Хочу отметить, что gpt-6-astra впервые нормально в мультиагентном режиме работает. Можно попросить разбить задачу на несколько чатов, и они будут друг с другом договариваться, обмениваться сообщениями и эффективно работать. Такие костыльные nested субагенты получаются. Или способ, как потратить недельную квоту за 20 минут.
gpt-5.6-sol в таком режиме быстро самоубивалась из-за спама неадекватными и неактуальными просьбами между чатами.
P.S. Промпт примерно такой использую:
gpt-5.6-sol в таком режиме быстро самоубивалась из-за спама неадекватными и неактуальными просьбами между чатами.
P.S. Промпт примерно такой использую:
Теперь ты оркестратор. Раздели план выше на несколько файлов ТЗ: одно ТЗ себе забери, а оставшиеся разошли в соседние чаты и присматривай за ними.⚡55👍44🔥19🌚7❤6😱5🤯2💯2🙏1🤗1😘1