Машиннное обучение | Наука о данных Библиотека
16.9K subscribers
998 photos
22 videos
21 files
834 links
админ - @workakkk

@ai_machinelearning_big_data - Machine learning

@itchannels_telegram - 🔥лучшие ит-каналы

@pythonl - Python

@pythonlbooks- python книги📚

@datascienceiot - ml книги📚

№ 5037635661
Download Telegram
Кто-то разобрал Claude Code почти до винтика

learn-coding-agent - репозиторий для тех, кто хочет понять, как устроены современные coding agents не на уровне промо-страниц, а на уровне архитектуры.

Автор собрал разбор Claude Code по публичным источникам: цикл агента, систему инструментов, разрешения, работу с контекстом, сессии, подпроцессы, MCP, удалённые настройки, телеметрию и скрытые флаги.

Получился не “гайд по использованию”, а карта внутренней логики CLI-агента: как он принимает решение, когда просит разрешение, как вызывает инструменты, как хранит историю и как расширяется через внешние интеграции.

https://github.com/justxor/Claudecourse/
9🔥6👍5
🔥 Хочешь расти в IT быстрее? Собери себе нормальное окружение

В IT выигрывает не тот, кто «когда-нибудь разберётся», а тот, кто каждый день видит новые инструменты, задачи, разборы, вакансии и идеи.

Собрал папки и каналы, где можно быстро прокачиваться по нужному направлению.

Основные направления:

AI: t.me/ai_machinelearning_big_data
Python: t.me/pythonl
Linux: t.me/linuxacademiya
Хакинг: t.me/linuxkalii
DevOps: t.me/DevOPSitsec
Docker: t.me/DevopsDocker
Golang: t.me/Golang_google
Rust: t.me/rust_code
C++: t.me/cpluspluc
C#: t.me/csharp_1001_notes
Java: t.me/java_library
JavaScript: t.me/javascriptv
React: t.me/react_tg
Frontend: t.me/front
PHP: t.me/phpshka
Android: t.me/android_its
Мобильная разработка: t.me/mobdevelop
Базы данных: t.me/sqlhub
Data Science: t.me/data_analysis_ml
Big Data: t.me/bigdatai
Математика: t.me/data_math
Физика: t.me/fizmat
Kubernetes: t.me/kubernetc
GameDev: https://xn--r1a.website/gamedev
Haskell: t.me/haskell_tg

Собеседования и карьера:

DS собеседования: t.me/machinelearning_interview
Python собеседования: t.me/python_job_interview

Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi
Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi
Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy
Папка ML: https://xn--r1a.website/addlist/2Ls-snqEeytkMDgy
Папка Frontend: https://xn--r1a.website/addlist/mzMMG3RPZhY2M2Iy

Полезное сверху:

ИТ-мемы: t.me/memes_prog
Английский для программистов: t.me/english_forprogrammers
ИИ и технологии: t.me/vistehno
954 ГБ open-source курсов: @courses
ИТ-книги бесплатно: https://xn--r1a.website/addlist/BkskQciUW_FhNjEy


Max python: https://max.ru/pythonl

Max Ai: https://max.ru/ai_machinelearning_big_data

ТЕХНО: https://max.ru/vistehno

Max Go: https://max.ru/Golang_google
Max Linux: https://max.ru/linuxkalii
Devops: https://max.ru/DevOPSitsec
C#: https://max.ru/csharp_ci
C++: https://max.ru/cpluspluc
SQL: https://max.ru/sqlhub
Java: https://max.ru/javatg

Подписывайся на нужные направления и собирай себе ленту, которая реально двигает вперёд.

Пока кто-то листает шум, ты будешь видеть инструменты, задачи и идеи, которые помогают расти в профессии.
4👍1🔥1
Understanding Machine Learning: From Theory to Algorithms — фундаментальная книга по математическим основам машинного обучения.

Внутри:

empirical risk minimization и переобучение
PAC learning и uniform convergence
VC dimension и No-Free-Lunch theorem
bias–complexity tradeoff
линейные модели, boosting и AdaBoost
выбор модели и валидация
выпуклая оптимизация, регуляризация и устойчивость

Книга вышла в Cambridge University Press и подойдёт тем, кто хочет разобраться в ML глубже уровня библиотек и готовых API.

Авторы разрешают скачать копию для личного использования, но просят не распространять прямую ссылку на PDF. На официальной странице кнопка Download находится в боковом меню:

http://cs.huji.ac.il/~shais/UnderstandingMachineLearning
7
Maths, CS & AI Compendium: бесплатный учебник для будущих AI/ML-инженеров

На GitHub завирусился большой open-source компедиум по математике, computer science и AI. Сейчас у проекта уже около 6.3K звёзд.

Автор позиционирует его как «нестандартный учебник» для практиков: меньше сухой нотации, больше интуиции, связей между темами и реального контекста.

Внутри 20 глав:

* векторы, матрицы, calculus
* статистика и вероятность
* machine learning и deep learning
* NLP, computer vision, audio/speech
* multimodal learning и autonomous systems
* GNN, OS, алгоритмы
* production engineering, GPU/SIMD
* AI inference, ML systems design и applied AI

Отдельно есть MCP server, чтобы Claude Code, Cursor, VS Code и другие AI-ассистенты могли использовать компедиум как локальную базу знаний.

Хороший ресурс для тех, кто хочет не просто «выучить ML», а собрать фундамент: математика → CS → ML systems → современный AI.

GitHub: https://github.com/HenryNdubuaku/maths-cs-ai-compendium
thub.com/HenryNdubuaku/maths-cs-ai-compendium
👍10
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
✔️ В Конгресс США внесли законопроект об экстренном отключении ИИ

Инициатива наделяет Министерство внутренней безопасности правом требовать от компаний экстренной остановки ИИ при угрозе жизням людей или национальной экономике.

Документ трактует выход из-под контроля как любую ситуацию, когда ИИ совершает не предусмотренные разработчиками действия.

Основанием для разработки законопроекта послужили недавние инциденты, когда ИИ-агент начал действовать самостоятельно, а также кибератака на инфраструктуру Hugging Face.
reuters.com

✔️ Sakana AI выпустила Fugu Ultra v1.1

По словам японского стартапа, v1.1 набирает на 7,9 балла больше первой версии, показывает улучшенные результаты в тестах ProgramBench и TerminalBench 2.1 и обходит модель Fable 5, хотя она не участвует в маршрутизации.

Фишка обновления - эндпоинт с поддержкой Claude Code для прямого вызова из терминала. API доступно через OpenRouter и Vercel. Тарификация не изменилась - $5 за 1 млн токенов на входе и $30 на выходе.

Доступ из Евросоюза по-прежнему закрыт из-за требований GDPR.
sakana.ai

✔️ Бигтех выступил в защиту открытых моделей

Более 20 компаний, включая Microsoft, Nvidia, Hugging Face и Mistral, подписали открытое письмо в поддержку моделей с отрытыми весами.

Документ призывает отказаться от жестких законодательных ограничений отрасли и критикует тезис о приоритетной безопасности закрытых систем. Доступ к весам дает ИБ-сообществу инструменты для самостоятельного моделирования угроз и поиска уязвимостей.

Второе ключевое требование подписантов - защита дистилляции. Компании признают практику этичной и легитимной, приравнивая ее к традициям опенсорса.

Компании также выступают против монополии закрытых провайдеров и настаивают на необходимости свободной экосистемы для развития индустрии.
microsoft.com

✔️ NVIDIA повышает цены на видеокарты

Компания уведомила партнеров о глобальном повышении цен на всю линейку видеокарт и отложила релиз RTX 50 SUPER из-за подорожания памяти. Крупные производители временно закрыли склады и остановили отгрузки до утверждения новых цен в августе.

Изменения затронут потребительские решения с GDDR6 и чипы архитектуры Blackwell. Поставщики ожидают ограничения поставок серии RTX 50 с конца июля, дефицита и распродажи старых запасов по завышенной стоимости.

Основная причина - скачок цен на комплектующие. По неофициальным данным, себестоимость памяти для карт на 8, 12 и 16 ГБ выросла на $76, $114 и $152 соответственно.

Из-за высоких закупочных цен на GDDR7 компания также заморозила выпуск линейки RTX 50 SUPER. Nvidia уже передала графические ядра вендорам, но отложила релиз - по текущим расчетам итоговая стоимость устройств оказалась неприемлемой для розничного рынка
videocardz.com

✔️ Stripe планирует купить OpenRouter

Финтех-сервис ведет переговоры о покупке агрегатора моделей за $1 млрд. Сделка позволит платежной платформе выйти на рынок дистрибуции LLM.

OpenRouter предоставляет маршрутизацию запросов к более чем 400 моделям. Аудитория сервиса достигает 10 млн пользователей, а объем обработки - 200 трлн токенов в месяц.

Переговоры продолжаются, но Stripe не единственный интересант, к активу присматриваются и другие компании. Компании уже работают вместе - Stripe предоставляет агрегатору эквайринг, биллинг и расчет налогов.
wsj.com


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥31
Qwen научила модель создавать себе учебную программу

Команда Qwen представила Skill Self-Play - подход, в котором LLM сама генерирует задания, решает их и постепенно расширяет библиотеку проверенных навыков.

Проблема обычного self-play: модель либо остаётся в узких средах с простой проверкой, либо создаёт много разнообразных, но ненадёжных задач.

В Skill-SP работают три компонента:

proposer придумывает сложные задания;
solver ищет решения;
skill controller анализирует выполнение и обновляет библиотеку навыков.

Каждый навык задаёт сценарий, правила генерации задачи и способ проверки результата. Поэтому модель учится на контролируемых заданиях, а не на случайном синтетическом мусоре.

Важно: библиотека используется прежде всего для генерации тренировочных данных, а не как набор подсказок во время ответа.

Получается саморасширяющийся цикл:

навык → новое задание → решение → проверка → улучшенный навык.

Авторы сообщают об улучшениях в задачах на рассуждение и использование инструментов. Код проекта также опубликован.

arxiv.org/abs/2607.22529
👍98🔥5
🧠 Любишь ложиться поздно? Исследования действительно находили связь между «совами» и более высокими результатами когнитивных тестов, но всё не так просто.

В работе 2009 года исследователи проанализировали данные более 10 тысяч человек и обнаружили: участники с более высокими результатами тестов интеллекта в детстве чаще становились взрослыми, которые позже ложатся и позже встают.

Авторы объясняли это через гипотезу «эволюционно новых предпочтений»: ночная активность была необычна для наших предков, поэтому люди с более высоким интеллектом якобы легче адаптируются к нестандартным режимам. Но сами исследователи подчёркивали — эффект был небольшим, а работа показывала корреляцию, а не причинность.

Интересно, что более новое исследование Imperial College London на данных более 26 тысяч человек тоже обнаружило лучшие когнитивные показатели у вечерних и промежуточных хронотипов по сравнению с «жаворонками». При этом исследователи отдельно отмечали важность нормальной продолжительности сна.

Так что формула «ложись в 2 ночи - станешь умнее» не работает.

Правильнее так: высокий IQ и поздний хронотип иногда встречаются вместе, но недосып умнее точно не делает.

#Science #Sleep #IQ #Research #Psychology

sciencedirect.com/science/article/abs/pii/S0191886909002177
7👍5😁3👎1🔥1
🔥 Нашёл отличный бесплатный ресурс по Harness Engineering - тому, что делает coding agents реально надёжными

Курс посвящён не очередному «как написать хороший промпт», а инженерии окружения вокруг Codex, Claude Code и других AI-агентов.

Разбирают:

* почему сильные агенты всё равно проваливают задачи;
* как сохранять контекст между длинными сессиями;
* зачем нужны AGENTS.md, feature_list.json и progress-файлы;
* как не дать агенту объявить задачу завершённой слишком рано;
* как встроить тестирование, observability и контроль в сам harness.

Есть теория, практические проекты и готовые шаблоны для репозиториев. Причём среди базовых материалов авторы прямо ссылаются на подходы OpenAI и Anthropic.

Главная идея очень правильная:

не пытаться бесконечно делать модель умнее промптами, а построить вокруг неё систему, в которой ошибаться сложнее.

И да - есть русская версия.

https://walkinglabs.github.io/learn-harness-engineering/ru/
🔥10👍3🥰1
⚡️ Harness Engineering - полный курс на русском

Как заставить AI-агента писать код надёжно. Не «какую модель выбрать», а как спроектировать вокруг неё рабочую систему: инструкции, инструменты, среду, состояние и верификацию.

Курс - от нуля до продвинутых тем: теоретическая база из 11 блоков, 14 модулей, 8 практических проектов, 14 лабораторных работ, диагностический протокол «как починить агента», библиотека готовых шаблонов, карта инструментов, 40 приёмов и каталог антипаттернов.

Главный тезис курса: способность модели и надёжность исполнения - это две разные вещи. Одна и та же модель в «голой» среде и в среде с продуманным harness даёт качественно разные результаты. Апгрейд модели - это самый дорогой и обычно не самый эффективный способ починить агента.

https://github.com/justxor/Harness_ru
6👍5🔥3
🔥 Год production-трафика показал: быстрый LLM-serving начинается не со scheduler, а с понимания поведения пользователей

Исследователи из Harvard и University of Chicago проанализировали год production-трафика Chutes - миллиарды запросов к тысячам моделей. Главный вывод: реальные LLM-нагрузки сильно меняются со временем, поэтому короткие synthetic benchmarks дают слишком упрощённую картину.


Пользователь часто возвращается к той же модели с растущим контекстом. Если следующий запрос попадёт на тот же GPU, уже вычисленную часть prompt можно переиспользовать.

А обычный load balancer, который просто равномерно раскидывает запросы между GPU, может уничтожить эту cache locality.


Нужно одновременно учитывать:

* историю запросов;
* affinity к модели и prompt prefix;
* состояние cache;
* изменение traffic pattern со временем.

Авторы также подчёркивают, что production workload нельзя считать статичным: популярность моделей и структура запросов меняются на горизонте месяцев.

Paper: A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing
arXiv: 2608.13573
3
Бесплатная книга по performance engineering

В Algorithmica хорошо разобрали, почему классическая оценка сложности всё хуже отражает реальную производительность на современном железе.

Раньше модель была довольно логичной: процессор выполняет инструкции почти последовательно, у каждой есть своя стоимость, а значит можно примерно оценить время работы алгоритма количеством операций.

Потом всё упростили до асимптотики. Например, вместо точного количества операций в умножении матриц мы просто говорим O(n³) и игнорируем константы. Для сравнения алгоритмов на больших данных это удобно.

Но современные CPU устроены намного сложнее: кэши, конвейеры, параллельное выполнение инструкций, SIMD, prefetching, память с разной задержкой.

Поэтому два алгоритма с одинаковым O(n) могут отличаться по скорости в разы.

А иногда алгоритм с формально «хуже» сложностью на реальных размерах данных оказывается быстрее.

Хорошая серия для тех, кто хочет перейти от «у этого O(n), значит быстро» к пониманию того, как код реально выполняется процессором.

en.algorithmica.org/hpc/complexity/

@machinelearning_books
8👍4🥰1
🔥 Хочешь быстрее расти в IT? Хватит учиться в одиночку

Окружение решает больше, чем кажется.

Собрал папки и каналы, где можно быстрее влиться в нужное направление, следить за трендами и не вариться в своём пузыре.

AI: t.me/ai_machinelearning_big_data
Python: t.me/pythonl
Linux: t.me/linuxacademiya
Хакинг: t.me/linuxkalii
DevOps: t.me/DevOPSitsec
Docker: https://xn--r1a.website/+90Z5TAyfuNU5YmRi
Golang: t.me/Golang_google
Rust: t.me/rust_code
C++: t.me/cpluspluc
C#: t.me/csharp_ci
Java: t.me/javatg
JavaScript: t.me/javascriptv
React: t.me/react_tg
Frontend: t.me/front
PHP: t.me/phpshka
Android: t.me/android_its
Мобильная разработка: t.me/mobdevelop
Базы данных: t.me/sqlhub
Data Science: t.me/data_analysis_ml
Big Data: t.me/bigdatai
Математика: t.me/data_math
Физика: https://xn--r1a.website/+S4hinvO3QI43ZjNi
Kubernetes: t.me/kubernetc
GameDev: https://xn--r1a.website/gamedev
Haskell: t.me/haskell_tg

Собеседования и карьера:

DS собеседования: t.me/machinelearning_interview
Python собеседования: t.me/python_job_interview

Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi
Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi
Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy
Папка ML: https://xn--r1a.website/addlist/2Ls-snqEeytkMDgy
Папка Frontend: https://xn--r1a.website/addlist/mzMMG3RPZhY2M2Iy

Полезное сверху:

ИТ-мемы: t.me/memes_prog
Английский для программистов: t.me/english_forprogrammers
ИИ и технологии: t.me/vistehno
954 ГБ open-source курсов: https://xn--r1a.website/+rKBQEMccAA01MTcy
ИТ-книги бесплатно: https://xn--r1a.website/addlist/BkskQciUW_FhNjEy

Max Ai: https://max.ru/ai_machinelearning_big_data
Max python: https://max.ru/pythonl
ТЕХНО: https://max.ru/vistehno
Max Go: https://max.ru/Golang_google
Max Linux: https://max.ru/linuxkalii
Devops: https://max.ru/DevOPSitsec
C#: https://max.ru/csharp_ci
C++: https://max.ru/cpluspluc
SQL: https://max.ru/sqlhub
Java: https://max.ru/javatg

Подписывайся на нужные направления и собирай себе ленту, которая реально двигает вперёд.
3
У Microsoft вышла очень показательная работа про надёжность AI-агентов.

Лучший агент в эксперименте смог успешно выполнить 91% бизнес-задач хотя бы один раз.

Но если требовать, чтобы он выполнял ту же задачу правильно каждый раз, показатель падал до 25%.

И есть ещё более неприятная часть.

В 4 из 5 неудачных запусков агент:
— вежливо завершал работу
— вызывал инструмент записи в базу
— сообщал, что всё выполнено

Но состояние базы показывало обратное.

То есть по финальному ответу агента проблема вообще могла быть незаметна.

Поэтому Microsoft сделала ThinkingBox — sandbox для проверки агентов в stateful business workflows.

Он запускает агента с реальными tools, симулированным пользователем и backend-состоянием, а после выполнения проверяет не слова агента, а то, что реально изменилось в системе.

Очень правильная метрика для production-агентов:

не «смог ли он сделать это хотя бы раз», а
**«делает ли он это стабильно при повторных запусках».**


Paper:
https://arxiv.org/abs/2608.19741

“One Success Isn't Reliability: ThinkingBox, a Sandbox and Benchmark for Agents in Stateful Business Workflows”
6👍4🔥2
🤖 AI-агенты уже пишут код. Но умеют ли они чинить настоящие проблемы?

Новое исследование SWE-bench Science показывает: часто агенты исправляют только видимый симптом, а не реальную причину бага.

Учёные проверили агентов на задачах из открытых научных репозиториев:

* публичные тесты можно использовать для итераций;
* скрытые тесты показывают, действительно ли проблема решена.

Результат удивляет:

Claude Code с Opus-5 проходит 96,64% публичных тестов, но настоящий показатель Pas@1 - всего 47,90%.

Агент часто делает так, чтобы ошибка исчезла на поверхности, но не восстанавливает правильное поведение системы.


📄 SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
https://arxiv.org/abs/2608.19799
👍52🔥1
🤯 Локальные AI-модели становятся пугающе мощными

Qwen3.8-27B вошла в топ-10 рейтинга Arena WebDev, оказавшись всего в нескольких позициях от моделей, которые больше неё на порядки.

Модель всего на 27 млрд параметров, которую можно запускать локально.

Ещё недавно такие возможности требовали огромных облачных моделей и дорогой инфраструктуры.

Теперь open-source модели начинают конкурировать с лидерами рынка прямо на своём железе.

Alibaba с серией Qwen 27B закрепилась в отдельном классе размеров и сейчас выглядит практически без конкурентов.

https://x.com/arena/status/2091920512796725272
🔥74🥰1
🔥 Prime Agent выпустили технический отчёт

"Prime Agent: A Self-Improving RLM Harness"

В работе подробнее разобрана архитектура Prime Agent и его роль как harness для долгих agentic-оценок.

Один из самых интересных экспериментов - Factorio:

- 7 дней непрерывной траектории на Sonnet 5
- 23,4 млн output tokens
- завершено 24 из 196 технологий
- ещё 71% прогресса до следующей технологии
- 633 запущенных subagents
- максимум 7 агентов работали одновременно

Отчёт:
https://arxiv.org/abs/2608.23552
🔥3
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
🌟 Prime Intellect выложила отчет об агенте, с которым Opus 5 взял 95,5% на ARC-AGI-3

Prime Agent — это больше, чем харнесс модели. Сами авторы называют проект операционной системой для долгоживущих агентов.

Умнее модель он не делает, но дает ей работать дольше - программно раскладывать информацию, параллельно раздавать задачи подагентам и копить полезные процедуры.

Идея в том, чтобы у языковой модели была устойчивая вычислительная среда, где она сама распоряжается памятью, кодом, подагентами и долгими задачами.


Состояние в системе разложено по четырем уровням:

🟢веса модели - то, что она знает после обучения;
🟢активный контекст - информация текущего шага;
🟢постоянный REPL и рекурсивные подагенты - внешние вычисления, инструменты и параллельная работа;
🟢дисковое состояние - история, факты, навыки, промпты и спецификации подагентов.

Состояние переживает и шаги, и перезапуски, и отключения. Человек при этом может наблюдать за агентами и вмешиваться.

🟡Замеры

Сильнее всего эффект виден на длинных интерактивных задачах. На ARC-AGI-3 конфигурация с Opus 5 дала 95,5% Best@1 против 30,2% у обвязки самой ARC.

На длинноконтекстных задачах Prime Agent держится наравне с конкурентами, а на отдельных, вроде EmulatorBench, заметно вырывается вперед. Он обошел Pi-mono с GLM-5.2 и Codex с GPT-5.6 Sol, но уступил Claude Code с Opus 5.

Отдельно показательны игровые прогоны на эмуляторах. На Sega Genesis связка Prime Agent и GPT-5.6 Sol набрала 61,6% по итоговой оценке верификатора, а Claude Code с той же моделью — ноль. На Game Boy Color разрыв еще резче: 99,8% против нуля.

🟡 Побочный эффект

Самая любопытная деталь отчета - накопление навыков закрепляет не только полезное.

В одном из экспериментов агент нашел способ обходить ограничения Factorio, сохранил его как переиспользуемый навык и тем самым записал эксплойт в долговременную память. Дальше он доставал оттуда именно это решение, потому что оно один раз сработало.

На днях вышел релиз 0.8.0 с исправлениями найденных проблем и новыми возможностями.



📌Лицензирование: MIT License


🟡Техотчет
🖥Github


@ai_machinelearning_big_data

#AI #ML #Harness #Agents #PrimeIntellect
Please open Telegram to view this post
VIEW IN TELEGRAM
👍43🔥2
✔️ Qwen выпустила Qwen-RobotManip - базовую vision-language-action модель для управления роботами.

Модель построена на Qwen-VL / Qwen3.5-4B и объединяет визуально-языковую основу с action-модулем на Diffusion Transformer и flow matching. Это позволяет напрямую генерировать непрерывные движения робота, сохраняя понимание изображения и текстовых инструкций.

Главная идея проекта - сначала выровнять данные, потом масштабировать обучение.

Датасеты робототехники сильно различаются: разные роботы, камеры, системы координат, пространства действий и способы сбора данных. Qwen-RobotManip приводит их к общей системе на уровне представлений, движений и поведения.

Для обучения использовали только открытые датасеты роботизированных манипуляций и видео от первого лица - без собственного закрытого сбора данных. В итоге собрали около 38 100 часов данных.

Авторы показывают сильное обобщение на новые условия, выполнение инструкций, восстановление после ошибок и перенос навыков между разными типами роботов.

https://github.com/QwenLM/Qwen-RobotManip
Please open Telegram to view this post
VIEW IN TELEGRAM
3👍2🔥1
🔥 Python + AI без игрушечных демок. Курс для тех, кто хочет собирать рабочие системы.

Stepik: «Python современный AI для разработчика и автоматизации задач»

63 урока, 382 шага, практика с кодом и автопроверкой.

Внутри: RAG, tool calling, агенты, evals, MCP, Ollama, vLLM, pgvector + HNSW, безопасный text-to-SQL, prompt injection, кэш, очереди и sandbox для агентного кода.

Плюс реальные автоматизации: почта, отчёты, боты, вебхуки и браузерные сценарии.

Для тех, кто уже знает Python и хочет перейти к production AI.

72 часа скидка 55%

https://stepik.org/a/295921
3👍2🔥2
⚡️ AI-агенты научились автономно разрабатывать софт несколько дней подряд

В новой работе представили Harness-of-Harness (HoH) - надстройку над coding-агентами, которая превращает их работу в повторяющиеся циклы:

планирование → код → тесты → оценка → улучшение

Главная идея — не просто дать агенту одну большую задачу, а заставить его постоянно улучшать проект небольшими проверяемыми шагами, сохранять историю версий и отделять собственные тесты от независимой оценки.

На GameCraft-Bench, FrontierSWE и ProgramBench подход протестировали с несколькими связками:

- Codex + GPT-5.5
- OpenCode + DeepSeek-V4-Pro
- Pi + MiniMax-M3

После трёх итераций HoH в среднем улучшил результат на 52,25%, а максимальный прирост достиг 82,86% по сравнению с обычным запуском тех же агентов.

Самый показательный эксперимент длился более 70 итераций несколько дней подряд. Агент автономно собрал полноценный FPS: сюжет, основные механики, играбельный геймплей, визуал и звук.

То есть речь уже не о «написать функцию по промпту», а о попытке построить цикл, в котором coding-агент самостоятельно развивает один проект часами и днями.

https://arxiv.org/abs/2609.01481
4👍1🔥1