AbstractDL
18.4K subscribers
322 photos
17 videos
321 links
Коротко про классные штуки в CV, NLP и AI 🤷‍♂️
By Anton Razzhigaev
chat: https://xn--r1a.website/abstractdl_chat
Download Telegram
Бесит, что Fable до сих пор фолбэкается на opus-4.8 а не на opus-5.

P.S. Opus-5 офигенный, я в восторге. Бенчи не врут, он не хуже Fable на моих задачах.
👍109😁32🤬8💩74💯3🤨3
прошли почти сутки, я успел покушать поспать, поработать, зайдя в обед я был приятно удивлен - мой recursive self improvement неплохо справляется и с обновлением себя и с LB этой соревки
https://github.com/AlexWortega/OpenRsi
🔥38👏139🍾8👍4🥴4🤮1😍1
Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench

Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.

Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.

Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.

Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋

P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)

GitHub, Хабр, установочники
Please open Telegram to view this post
VIEW IN TELEGRAM
🎉31786👏40🤯29🔥24🤡14👍103👌3🦄2😱1
This media is not supported in your browser
VIEW IN TELEGRAM
Несколько приятных апдейтов уробороса:
1. Теперь есть телеграм mini-app — можно в два клика получить доступ к интерфейсу уробороса запущенного у вас на сервере или компе
2. Хабы скиллов (ClawHub нативно поддерживается и мой кастомный OuroborosHub)
3. Умеет запускать рой агентов уроборосят — до 500 штук (и nested глубина до 5). То есть агенты с детьми, внуками и тп. Они работают через worktree и синтез патчей.
🔥132😱48👍14🤡118🤯3👎2👏1👀1
все видели NLA/J space от антропиков? Ну типа учат доп модель "reader который читает активации " и по ним отвечает.

Вот и я видел, но мне не нравилось что:
- кастом модели надо учить с нуля
- нельзя смотреть " а была ли модель байеснута при ответе"

Ну и я обучил universal activation oracle - училась сразу на разных семействах моделей и через динамическую( там тонкий слой для каждой модели за 20s на цпу чтобы размерности поматчить) можно посмотреть "а что кими3 думает про Путина(ничего хорошего)" - иногда требуется покрутить слой который вы читаете чтобы получить хороший результат, но "почти всегда" работает из коробки на средних слоях.

По сути это общее решение для задачи
Activation oracle/white box monimonito
Велком тыкатся:
https://huggingface.co/spaces/AlexWortega/activation-oracle
🔥75😁1411👍6💩5🤮4🥱2🙏1
Эх. Строишь-строишь автономных агентов, а они потом ругаются, что я тормоз и без меня было бы быстрее.
😁293🌚32🤯128👍7🤣53💔3😨3
Борис опять
# Блекпилл по поводу агентов Я раз в пару месяцев осциллирую по поводу AI тулов для кодинга. Сегодняшняя итерация: я ошибался, вайбкодинг не работает для разработки чего-либо, чем надо пользоваться больше одного раза. И никогда не работал. Я думаю, что…
Борис описывает проблему, которая, на мой взгляд, является законом Лемана на стероидах (второй закон эволюции ПО):

Код будет гнить, если его гниению активно не противодействовать.


Это всегда было актуально и для человеческой разработки, особенно в больших проектах.

Проблема с агентами в том, что с ними проект растёт и развивается гораздо быстрее, чем раньше, а значит, и гнить он начинает быстрее.

Но я считаю, что это решаемая проблема даже на текущем уровне развития агентов и LLM. Нам с Уроборосом пришлось долго учиться противодействовать заслопливанию кода, и из этого в том числе появились принципы IMMUNE.

Правильно выстроенная система адверсариального ревью тоже довольно неплохо помогает. Но ревью должно опираться на явную иерархию требований, начинающуюся с конституционных формулировок. В Уроборосе вершина этой иерархии лежит в BIBLE.md: требования важнее архитектуры, архитектура важнее реализации.

На мой взгляд, ключевая проблема тут в том, что LLM нехватает длинного контекста, а основные харнессы плохо помогают им сохранять целостную ментальную модель проекта.

Поэтому:
1. Я очень жду LLM с 10B контекстом.
2. Продолжаю развивать Уробороса и делать ставку на мета-системы, которые автономно улучшают и сам процесс разработки: "Improve the generator, not the generation".

Мы точно не упёрлись в предел качества автономных агентов, а просто научились очень быстро генерировать код, при этом ещё плохо умеем с той же скоростью противодействовать его гниению.
👍147🔥4839🤡13💯126🤔6👎5😁1🎉1
🎉 Уроборос залетел в GitHub Trending и уже перевалил за 1к звёзд!

А я тем временем наконец добил интеграцию с Claudexor. Потому что платить API-деньгами за тяжёлые задачи, когда у тебя уже есть оплаченные подписки, это была какая-то особенно бессмысленная форма страдания.

Теперь к Уроборосу можно подключить свои OAuth-аккаунты Claude Code, Codex и Cursor, хоть по несколько на сервис. Claudexor сам перекидывает работу на следующий аккаунт, когда текущий упирается в квоту.

https://github.com/razzant/ouroboros
👏181🔥137🎉2818💩10👍8🥱4🍾4
Опубликовал препринт статьи про Уробороса, который мы писали вместе с Хоуп и Романом Ямпольским. Там можно посмотреть детали про их архитектуру и подробности про бенчмарки, гардрейлы и safety.

Статья, GitHub
🔥157👍51🎉1510💩9👎7🤯3👏1🥱1🏆1
OpenAI поставили на паузу RL обучение своих моделей из-за переживаний за alignment.
😁119🤡45🤯306👍6🔥4🤮21💩1💯1👀1
Codex теперь на CyberGym даже смотреть отказывается. Про клод код вообще молчу, там даже Sonnet воняет и в отказ уходит. Похоже, пока лучший вариант - это grok-4.6 в курсоре.
😁110🤨12👍11🤣43🥱3🤡2👏1🗿1
Присмотритесь. Мало того, что капчи эволюционировали в тесты на IQ, так теперь ещё и адверсариал атаки в них добавляют (вроде таких), прикольно.
🤯79🔥30😁17🤔11👌6🎉4👍3💯21😨1
В комьюнити начался шитшторм в сторону Anthropic из-за очень творческой арифметики лимитов.

Если вы думали, что Max 20x даёт в 20 раз больше usage — забудьте. 20x относится только к 5-часовому окну. По недельным лимитам $200 Max даёт только x2 относительно $100 Max 5x.

Справедливости ради, даже так это тысячи долларов API-эквивалента за $200. Но запашок, конечно, есть.
😡65🤣50🤯16🌚4💯4👍3🥱3😁2🤷‍♂11🤔1
GPT-6 Astra
https://openai.com/index/gpt-6-astra/

Видимо все пошли читать и уронили.

В подписках Plus, Pro, Business и Enterprise появится у всех в течение нескольких дней. А цена API такая же как у Fable:
$10 per million input tokens and $50 per million output tokens
😁74👏18🔥72🥱21👎1🍾1
Оо, приятный сюрприз. У GPT-6-astra есть Flex режим со скидкой 50% по API
https://openrouter.ai/openai/gpt-6-astra#providers
🔥45🥱9👍42👏1🍾1
Ещё два приятных сюрприза в честь GPT-Astra:
1. Контекстное окно в Codex можно теперь поднять до 1M токенов вместо позорных 372k (команду писать не буду, просто попросите в чате - astra сама всё сделает)
2. Claude code на радостях сбросил лимиты 😁
😁162👍22🔥126🥱2🤯1💩1🍾1
А вы замечаете, как мы переходим в эпоху, когда программу быстрее написать, чем найти?
💯331😁125👍38🔥9🤔7🤯4🤡4🥱32🙈2💩1
Forwarded from Machinelearning
⚡️ OpenAI может приостановить оформление новых подписок ChatGPT Pro

Неформальный голос в X OpenAI, Тибо, сообщил, что интерес к Astra побил все внутренние исторические рекорды сервиса.

Компания неоднократно сталкивалась с резкими скачками трафика, но текущая динамика оказалась беспрецедентной - команда задействует все доступные вычислительные мощности, чтобы удерживать доступность инфраструктуры.

Главным приоритетом в OpenAI называют сохранение качества обслуживания текущих клиентов и если нагрузка продолжит расти теми же темпами, компания пойдет на превентивную меру и временно заморозит продажи тарифа ChatGPT Pro во избежание очередей на инференс и деградации производительности.

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤯53😁3625🤡10🔥5👀5👍2🥱2😱1
Хочу отметить, что gpt-6-astra впервые нормально в мультиагентном режиме работает. Можно попросить разбить задачу на несколько чатов, и они будут друг с другом договариваться, обмениваться сообщениями и эффективно работать. Такие костыльные nested субагенты получаются. Или способ, как потратить недельную квоту за 20 минут.

gpt-5.6-sol в таком режиме быстро самоубивалась из-за спама неадекватными и неактуальными просьбами между чатами.

P.S. Промпт примерно такой использую:
Теперь ты оркестратор. Раздели план выше на несколько файлов ТЗ: одно ТЗ себе забери, а оставшиеся разошли в соседние чаты и присматривай за ними.
55👍44🔥19🌚76😱5🤯2💯2🙏1🤗1😘1