MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling
▪ Hf: https://huggingface.co/papers/2511.11793
▪Paper: https://arxiv.org/abs/2511.11793
▪Github: https://github.com/MiroMindAI/MiroThinker
▪ Hf: https://huggingface.co/papers/2511.11793
▪Paper: https://arxiv.org/abs/2511.11793
▪Github: https://github.com/MiroMindAI/MiroThinker
👍2
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
OpenAI начала год с приобретения: к компании присоединяется команда Convogo, платформы для автоматизации работы HR-специалистов и бизнес-коучей. Представители техгиганта подтвердили, что речь идет именно о трансфере талантов, а не о покупке технологий или интеллектуальной собственности.
Для OpenAI это уже 9-е приобретение за последний год. В прощальном письме команда Convogo отметила, что их главная экспертиза заключается в создании прикладных инструментов, которые превращают возможности нейросетей в реальные рабочие процессы — именно этим они и продолжат заниматься на новом месте.
Финансовые условия сделки не разглашаются, однако известно, что она была полностью оплачена акциями. Сам сервис Convogo будет закрыт.
finance.yahoo.com
Copilot Checkout - это реализация концепции агентной коммерции: полный цикл покупок от поиска и сравнения товаров до финальной оплаты не покидая окно чата и не переходя на внешние сайты магазинов.
Процессинг обеспечивают PayPal, Stripe и Shopify. Для последнего запущено агрессивное развертывание: продавцы подключаются к системе автоматически (с возможностью отказа), тогда как остальные могут интегрироваться через специальный Agentic Commerce Protocol.
Microsoft утверждает, что Copilot Checkout кардинально меняет воронку продаж, повышая конверсию целевых запросов на 194% по сравнению с классическим веб-серфингом.
microsoft.com
Котировки ИИ-стартапа удвоились в первый день торгов на Гонконгской фондовой бирже, закрывшись на отметке 345 гонконгских долларов. В ходе IPO компания привлекла около $620 млн, значительно опередив локального соперника Zhipu AI (создателя моделей GLM), чьи акции в ходе первичного размещения днем ранее выросли лишь на 13%.
Китайские разработчики сумели опередить американских коллег, первыми выйдя на публичный рынок. Привлеченные средства пойдут на R&D, поскольку коммерциализация продуктов, по словам руководства MiniMax, всё ещё находится на ранней стадии.
cnbc.com
Epoch AI опубликовала базу данных по рынку чипов, согласно которой мировой парк ускорителей достиг производительности, эквивалентной 15 млн. Nvidia H100. В отчете зафиксирована смена поколений железа: основным драйвером выручки Nvidia стал новый чип B300, тогда как доля бывшего флагмана H100 упала ниже 10%.
Совокупное энергопотребление всего этого оборудования оценивается более чем в 10 ГВт. Для сравнения, это вдвое превышает потребности всего Нью-Йорка.
Авторы проекта собирали статистику по финансовым отчетам и оценкам аналитиков, чтобы добавить прозрачности индустрии, где вендоры редко раскрывают точные цифры продаж в штуках.
epoch.ai
Платформа отключила функцию создания картинок в Grok для большинства пользователей X после волны критики, связанной с массовой генерацией откровенного контента. Этот шаг стал вынужденной реакцией на давление регуляторов, включая прямые угрозы штрафов и возможной блокировки соцсети X в Великобритании.
Теперь инструменты генерации и редактирования доступны исключительно платным подписчикам. Расчет строится на деанонимизации: платформа хранит платежные данные премиум-клиентов, что упрощает идентификацию тех, кто создает запрещенный контент.
theguardian.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
🔥 Идея из paper: перестать “тренировать наугад” - и сначала предсказывать, какой код выиграет
Обычно ML-агенты работают так:
написал код -> запустил обучение -> посмотрел результат -> исправил -> снова запустил…
Проблема в том, что каждая попытка может занимать часы, и получается дорогой trial-and-error.
Авторы предлагают другой подход:
✅ вместо того чтобы проверять все варианты
агент сначала рассуждением выбирает, какой из 2 решений лучше,
и запускает обучение только для лучшего кандидата.
То есть:
сначала прогноз -> потом одна проверка, а не десятки запусков.
Они оформляют это как задачу:
“выбор лучшего решения по данным” (data-centric preference)
На вход дают:
- описание задачи
- *подтверждённый отчёт о датасете* (data report)
- два варианта кода
Чтобы отчёту можно было доверять, они:
1) прогоняют отдельный профайлинг-скрипт по данным
2) проверяют логи
3) переписывают статистику в простой текст, понятный LLM
Результат на реальных данных:
- 18,438 пар решений
- 26 задач
- точность лучшей модели: 61.5%
- и ещё важно: уверенность модели реально совпадает с тем, права она или нет
В их системе FOREAGENT это даёт:
⚡ поиск в 6 раз быстрее
📈 примерно на 6% лучше качество
Вывод простой:
мы можем ускорить обучение агентов не за счёт железа,
а за счёт “умного отбора” - тренировать только то, что с высокой вероятностью сработает.
Paper: arxiv.org/abs/2601.05930
Обычно ML-агенты работают так:
написал код -> запустил обучение -> посмотрел результат -> исправил -> снова запустил…
Проблема в том, что каждая попытка может занимать часы, и получается дорогой trial-and-error.
Авторы предлагают другой подход:
✅ вместо того чтобы проверять все варианты
агент сначала рассуждением выбирает, какой из 2 решений лучше,
и запускает обучение только для лучшего кандидата.
То есть:
сначала прогноз -> потом одна проверка, а не десятки запусков.
Они оформляют это как задачу:
“выбор лучшего решения по данным” (data-centric preference)
На вход дают:
- описание задачи
- *подтверждённый отчёт о датасете* (data report)
- два варианта кода
Чтобы отчёту можно было доверять, они:
1) прогоняют отдельный профайлинг-скрипт по данным
2) проверяют логи
3) переписывают статистику в простой текст, понятный LLM
Результат на реальных данных:
- 18,438 пар решений
- 26 задач
- точность лучшей модели: 61.5%
- и ещё важно: уверенность модели реально совпадает с тем, права она или нет
В их системе FOREAGENT это даёт:
⚡ поиск в 6 раз быстрее
📈 примерно на 6% лучше качество
Вывод простой:
мы можем ускорить обучение агентов не за счёт железа,
а за счёт “умного отбора” - тренировать только то, что с высокой вероятностью сработает.
Paper: arxiv.org/abs/2601.05930
❤2👍2👏1
Forwarded from Анализ данных (Data analysis)
🚨 Похоже найдены следы DeepSeek V4?.
В репозитории/ветках заметили MODEL1 - и самое интересное, что он выглядит как отдельная независимая ветка, параллельная V3.2.
То есть это не “патч” внутри линейки V3,
а похоже на:
✅ новый модельный ряд
✅ с другими архитектурными параметрами
✅ потенциально flagship-апдейт
Если следовать неймингу DeepSeek:
после V3.2 крупный архитектурный скачок логично назывался бы V4.
Пока без официального подтверждения, но сигнал жирный:
если MODEL1 действительно новая архитектура, нас ждёт большой релиз.
https://x.com/nopainkiller/status/2013522059662614653
В репозитории/ветках заметили MODEL1 - и самое интересное, что он выглядит как отдельная независимая ветка, параллельная V3.2.
То есть это не “патч” внутри линейки V3,
а похоже на:
✅ новый модельный ряд
✅ с другими архитектурными параметрами
✅ потенциально flagship-апдейт
Если следовать неймингу DeepSeek:
после V3.2 крупный архитектурный скачок логично назывался бы V4.
Пока без официального подтверждения, но сигнал жирный:
если MODEL1 действительно новая архитектура, нас ждёт большой релиз.
https://x.com/nopainkiller/status/2013522059662614653
❤4👍3
Forwarded from Анализ данных (Data analysis)
🚀 Ling-2.5-1T: новый open-source гигант
• 1 трлн параметров
• 63B активных
• MIT лицензия - можно использовать в продакшене
Что внутри:
⚡ Hybrid Linear Attention
Комбинация MLA (1:7) + Lightning Linear
- быстрее Kimi K2 на длинных контекстах
🧠 В 4 раза эффективнее по токенам
Composite rewards позволяют достигать уровня топ-моделей, используя в 4 раза меньше токенов
📚 Контекст до 1 млн токенов
YaRN scaling
— обходит Kimi K2.5 и DeepSeek V3.2 на тестах RULER и MRCR
— идеальные результаты в NIAH
🛠️ SOTA для агентных задач
Обучение через Agentic RL
Лидер BFCL-V4
Нативная интеграция с:
- Claude Code
- OpenCode
- OpenClaw
🎯 Чёткое следование инструкциям
Bidirectional RL + проверка агентом
Минимум «воды», максимум плотности ответа
Модель пока уступает GPT-5.2 и Gemini 3 Pro в долгих многошаговых задачах.
Open-source модели уже заходят на территорию enterprise-агентов.
Если нужен длинный контекст + инструменты + контроль над инфраструктурой - это один из самых интересных кандидатов прямо сейчас.
modelscope.ai/models/inclusionAI/Ling-2.5-1T
modelscope.cn/models/inclusionAI/Ling-2.5-1T
• 1 трлн параметров
• 63B активных
• MIT лицензия - можно использовать в продакшене
Что внутри:
⚡ Hybrid Linear Attention
Комбинация MLA (1:7) + Lightning Linear
- быстрее Kimi K2 на длинных контекстах
🧠 В 4 раза эффективнее по токенам
Composite rewards позволяют достигать уровня топ-моделей, используя в 4 раза меньше токенов
📚 Контекст до 1 млн токенов
YaRN scaling
— обходит Kimi K2.5 и DeepSeek V3.2 на тестах RULER и MRCR
— идеальные результаты в NIAH
🛠️ SOTA для агентных задач
Обучение через Agentic RL
Лидер BFCL-V4
Нативная интеграция с:
- Claude Code
- OpenCode
- OpenClaw
🎯 Чёткое следование инструкциям
Bidirectional RL + проверка агентом
Минимум «воды», максимум плотности ответа
Модель пока уступает GPT-5.2 и Gemini 3 Pro в долгих многошаговых задачах.
Open-source модели уже заходят на территорию enterprise-агентов.
Если нужен длинный контекст + инструменты + контроль над инфраструктурой - это один из самых интересных кандидатов прямо сейчас.
modelscope.ai/models/inclusionAI/Ling-2.5-1T
modelscope.cn/models/inclusionAI/Ling-2.5-1T
❤4👍2
Helios: Real Real-Time Long Video Generation Model
Hf: https://huggingface.co/papers/2603.04379
Code: https://github.com/PKU-YuanGroup/Helios
Page: https://pku-yuangroup.github.io/Helios-Page/
Hf: https://huggingface.co/papers/2603.04379
Code: https://github.com/PKU-YuanGroup/Helios
Page: https://pku-yuangroup.github.io/Helios-Page/
👍5🔥1
Forwarded from Machinelearning
Соло-разработчик с доступом к Claude Code теперь может развернуть целую гейм-дев студию с креативным директором, лидами отделов и профильными специалистами.
В основу геймдизайнерских подходов заложены MDA Framework, теория самодетерминации и проектирование состояния потока.
Claude Code Game Studios - шаблон для Claude Code, который организует ИИ-сессию в трёхуровневую иерархию из 48 специализированных агентов.
На вершине 3 директора (креативный, технический и продюсер), работающие на модели Opus.
Уровнем ниже 8 руководителей отделов на Sonnet: геймдизайнер, ведущий программист, арт-директор, директор по звуку, нарративный директор и другие.
Третий уровень - специалисты на Sonnet и Haiku: от геймплэй-программиста и дизайнера экономики до DevOps-инженера и специалиста по доступности.
Агенты взаимодействуют по четкому протоколу: вертикальная делегация задач сверху вниз, горизонтальные консультации между агентами одного уровня, эскалация конфликтов к общему руководителю.
Каждый агент работает строго в границах своего домена и не модифицирует чужие файлы без явного поручения.
Помимо агентов, шаблон включает 37 команд, покрывающих весь цикл разработки: планирование спринтов, ревью кода и дизайна, аудит ассетов, генерацию идей, подготовку к релизу.
Отдельная категория - командные воркфлоу, которые координируют работу нескольких агентов над конкретной фичей: боевой системой, нарративом, интерфейсом или звуком.
Параллельно работают 8 хуков, привязанных к событиям git и жизненному циклу сессии. Они срабатывают автоматически: валидируют коммиты на захардкоженные значения и корректность данных, предупреждают о пушах в защищённые ветки, подгружают контекст текущего спринта при старте и фиксируют результаты при завершении.
Ещё один слой - 11 правил, привязанных к путям в проекте. Они применяются при редактировании файлов в соответствующих директориях и задают стандарты для каждой зоны кодовой базы.
Агенты задают вопросы, предлагают несколько вариантов с плюсами и минусами, показывают черновик. Но финальное решение всегда за человеком, ничего не фиксируется без его одобрения.
Для каждого предусмотрен свой лид-агент с набором суб-специалистов: у Godot это GDScript, шейдеры и GDExtension, у Unity - DOTS/ECS, VFX и UI Toolkit, у Unreal - GAS, Blueprints и Replication.
Проект открыт к кастомизации: агентов можно добавлять и удалять, промпты редактировать, хуки - перенастраивать.
@ai_machinelearning_big_data
#AI #ML #Vibecoding #Gamedev #Claude
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👍1
1. Deep Learning
https://deeplearningbook.org
Библия нейросетей - backprop, архитектуры, вся база
2. Artificial Intelligence: A Modern Approach
https://aima.cs.berkeley.edu
Фундаментальный взгляд на AI как систему
3. Speech and Language Processing
https://web.stanford.edu/~jurafsky/slp3/
NLP, трансформеры и язык - максимально глубоко
4. Machine Learning: A Probabilistic Perspective
https://probml.github.io/pml-book/
Вероятности, статистика и основа ML
5. Understanding Deep Learning
https://udlbook.github.io/udlbook/
Современное объяснение DL с хорошей интуицией
6. Designing Machine Learning Systems
https://oreilly.com/library/view/designing-machine-learning/9781098107956/
Как довести модели до продакшена
7. Generative Deep Learning
https://github.com/3p5ilon/ML-books/blob/main/generative-deep-learning-teaching-machines-to-paint-write-compose-and-play.pdf
Практика генеративных моделей и трансформеров
8. Natural Language Processing with Transformers
https://dokumen.pub/natural-language-processing-with-transformers-revised-edition-1098136799-9781098136796-9781098103248.html
Как строить NLP-системы на трансформерах
9. Machine Learning Engineering
https://mlebook.com
Инженерия ML и продакшен
10. The Hundred-Page Machine Learning Book
https://themlbook.com
Суперконцентрированная база без лишнего
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍2🤔2
Efficient Training on Multiple Consumer GPUs with RoundPipe
Github: https://github.com/ITcarrot/RoundPipe
Paper: https://arxiv.org/abs/2604.27085
Github: https://github.com/ITcarrot/RoundPipe
Paper: https://arxiv.org/abs/2604.27085
👍3🔥2🥰1
Coinbase сокращает около 700 человек - это примерно 14% штата.
CEO Coinbase Брайан Армстронг объясняет это просто: компания хочет стать меньше, быстрее и эффективнее, потому что ИИ уже позволяет небольшим командам делать то, для чего раньше требовалось больше людей.
Coinbase не единственная. Технокомпании всё чаще упаковывают сокращения не только в историю про рынок, но и в историю про AI-native операционку.
Похоже, главный эффект ИИ для бизнеса оказался не в красивых демках, а в очень скучной строке P&L: меньше людей, меньше затрат, быстрее выполнение задач.
bloomberg.com/news/articles/2026-05-05/coinbase-to-cut-14-of-workforce-citing-volatile-markets-ai
CEO Coinbase Брайан Армстронг объясняет это просто: компания хочет стать меньше, быстрее и эффективнее, потому что ИИ уже позволяет небольшим командам делать то, для чего раньше требовалось больше людей.
Coinbase не единственная. Технокомпании всё чаще упаковывают сокращения не только в историю про рынок, но и в историю про AI-native операционку.
Похоже, главный эффект ИИ для бизнеса оказался не в красивых демках, а в очень скучной строке P&L: меньше людей, меньше затрат, быстрее выполнение задач.
bloomberg.com/news/articles/2026-05-05/coinbase-to-cut-14-of-workforce-citing-volatile-markets-ai
❤5👍3🔥1
Эксклюзив: DeepSeek был только началом
Microsoft сейчас оценивает множество open models для Copilot Cowork.
Смысл простой: Microsoft всё меньше хочет быть жёстко привязана к одной модели или одному поставщику. Copilot постепенно превращается в систему, где важнее не конкретная LLM, а harness, маршрутизация задач, инструменты и возможность быстро менять модели под разные сценарии.
https://www.testingcatalog.com/exclusive-microsoft-evaluates-different-open-models-for-cowork/
Microsoft сейчас оценивает множество open models для Copilot Cowork.
> Это создаёт внутреннее давление на команды MAI, потому что модели GLM, MiniMax и Kimi развиваются быстрее.
> Microsoft хочет сделать модели «взаимозаменяемыми» и отделить саму обвязку Copilot от конкретных моделей под капотом.
> По мере развития малых моделей часть задач в будущем может выполняться локально.
Смысл простой: Microsoft всё меньше хочет быть жёстко привязана к одной модели или одному поставщику. Copilot постепенно превращается в систему, где важнее не конкретная LLM, а harness, маршрутизация задач, инструменты и возможность быстро менять модели под разные сценарии.
https://www.testingcatalog.com/exclusive-microsoft-evaluates-different-open-models-for-cowork/
🔥5❤3👍3
Forwarded from Machinelearning
В сети вирусится веб-приложение In the Weights, которое проверяет наличие информации о человеке или компании в GPT, Claude, Gemini и Llama и т.д.
Платформа работает через прямые запросы к моделям с принудительно отключенным доступом к сети, чтобы ИИ опирался исключительно на знания, полученные на трейне.
Анализируя выдачу, система высчитывает скоринг. Метрика оценивает вероятность того, что информация об объекте содержалась в обучающих датасетах и содержится в конкретной модели.
Помимо развлекательных целей, проект является наглядным аудитом того, как корпорации агрессивно скрейпят данные.
По мере того как чат-боты вытесняют поисковики, присутствие в памяти моделей становится новой метрикой публичной значимости.
Сервис напоминает о новых реалиях современной приватности: если информация о вас уже есть в весах LLM, стереть ее цифровой след практически невозможно.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2❤1
Environment-free verifier для coding-агентов.
Он проверяет патчи без запуска кода и без Docker, при этом обгоняет сильнейший open-source verifier на 14.3 AUC points.
А RL post-training полностью без окружения достигает 62.0% на SWE-bench Verified.
https://paperswithcode.co/paper/2606.28436
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1👍1
Most upvoted papers on huggingface this week (July 6-12):
- The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning
- Vidu S1: A Real-Time Interactive Video Generation Model
- RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
- AlayaWorld: Long-Horizon and Playable Video World Generation
- Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning
- RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
- OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers
- UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning
- Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling
- PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space
https://huggingface.co/papers/week/2026-W28
- The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning
- Vidu S1: A Real-Time Interactive Video Generation Model
- RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
- AlayaWorld: Long-Horizon and Playable Video World Generation
- Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning
- RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
- OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers
- UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning
- Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling
- PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space
https://huggingface.co/papers/week/2026-W28
❤1👍1
Один из мифов вокруг ИИ-кодинга: если подобрать нужный промпт — модель сама напишет качественный код
На деле это проверяется за минуту. Два разработчика с одной и той же просьбой «собери сервис для регистрации пользователей» получат разные результаты. У одного выйдет чистый Litestar с типизацией и тестами. У второго — заготовка, которая ляжет при первой же доработке.
Дело не в тексте запроса.
Модель не видит ваш проект. Она не знает, какие соглашения приняты, какие библиотеки уже подключены, какой уровень покрытия тестами считается нормальным. Пока этой информации у нее нет — она отвечает по своему усредненному представлению, а не по вашему.
Поэтому вокруг модели нужно достроить то же самое, что и у обычного разработчика: набор правил, шаблоны, инструменты проверки, критерии приемки.
Именно это и делает Алексей Жиряков на воркшопе karpovꓸcourses «AI-first разработка на Python». За 4 часа собирает готовую агентную среду поверх живого проекта на Litestar и PostgreSQL — от настройки правил до автоматического ревью и подсчета вклада ИИ в цифрах.
Алексей покажет, как настроить правила проекта под задачу агента, как через OpenRouter поднять связку моделей «дешевая пишет — дорогая проверяет», которая помогает снижать стоимость генерации, как научить агента проверять код по чек-листу вашей архитектуры и как измерить вклад ИИ по коммитам.
С воркшопа забираете шаблон AI-first проекта, готовый к продакшену, набор правил и чек-листов, настроенную схему выбора модели под задачу и запись эфира в LMS. Тем, кто пишет на FastAPI, тоже подходит — это отдельно прописано в разделе с вопросами.
Соберите агентную среду, которая пишет код по правилам вашего проекта: https://clc.to/erid_2W5zFHgXtWd
С промокодом
Реклама. ООО «КАРПОВ КУРСЫ». ИНН 7811764627. erid: 2W5zFHgXtWd
На деле это проверяется за минуту. Два разработчика с одной и той же просьбой «собери сервис для регистрации пользователей» получат разные результаты. У одного выйдет чистый Litestar с типизацией и тестами. У второго — заготовка, которая ляжет при первой же доработке.
Дело не в тексте запроса.
Модель не видит ваш проект. Она не знает, какие соглашения приняты, какие библиотеки уже подключены, какой уровень покрытия тестами считается нормальным. Пока этой информации у нее нет — она отвечает по своему усредненному представлению, а не по вашему.
Поэтому вокруг модели нужно достроить то же самое, что и у обычного разработчика: набор правил, шаблоны, инструменты проверки, критерии приемки.
Именно это и делает Алексей Жиряков на воркшопе karpovꓸcourses «AI-first разработка на Python». За 4 часа собирает готовую агентную среду поверх живого проекта на Litestar и PostgreSQL — от настройки правил до автоматического ревью и подсчета вклада ИИ в цифрах.
Алексей покажет, как настроить правила проекта под задачу агента, как через OpenRouter поднять связку моделей «дешевая пишет — дорогая проверяет», которая помогает снижать стоимость генерации, как научить агента проверять код по чек-листу вашей архитектуры и как измерить вклад ИИ по коммитам.
С воркшопа забираете шаблон AI-first проекта, готовый к продакшену, набор правил и чек-листов, настроенную схему выбора модели под задачу и запись эфира в LMS. Тем, кто пишет на FastAPI, тоже подходит — это отдельно прописано в разделе с вопросами.
Соберите агентную среду, которая пишет код по правилам вашего проекта: https://clc.to/erid_2W5zFHgXtWd
С промокодом
aikarpov20 — скидка 20%Реклама. ООО «КАРПОВ КУРСЫ». ИНН 7811764627. erid: 2W5zFHgXtWd
👎2❤1
Forwarded from Никита Иванов
Один из мифов вокруг ИИ-кодинга: если подобрать нужный промпт — модель сама напишет качественный код
На деле это проверяется за минуту. Два разработчика с одной и той же просьбой «собери сервис для регистрации пользователей» получат разные результаты. У одного выйдет чистый Litestar с типизацией и тестами. У второго — заготовка, которая ляжет при первой же доработке.
Дело не в тексте запроса.
Модель не видит ваш проект. Она не знает, какие соглашения приняты, какие библиотеки уже подключены, какой уровень покрытия тестами считается нормальным. Пока этой информации у нее нет — она отвечает по своему усредненному представлению, а не по вашему.
Поэтому вокруг модели нужно достроить то же самое, что и у обычного разработчика: набор правил, шаблоны, инструменты проверки, критерии приемки.
Именно это и делает Алексей Жиряков на воркшопе karpovꓸcourses «AI-first разработка на Python». За 4 часа собирает готовую агентную среду поверх живого проекта на Litestar и PostgreSQL — от настройки правил до автоматического ревью и подсчета вклада ИИ в цифрах.
Алексей покажет, как настроить правила проекта под задачу агента, как через OpenRouter поднять связку моделей «дешевая пишет — дорогая проверяет», которая помогает снижать стоимость генерации, как научить агента проверять код по чек-листу вашей архитектуры и как измерить вклад ИИ по коммитам.
С воркшопа забираете шаблон AI-first проекта, готовый к продакшену, набор правил и чек-листов, настроенную схему выбора модели под задачу и запись эфира в LMS. Тем, кто пишет на FastAPI, тоже подходит — это отдельно прописано в разделе с вопросами.
Соберите агентную среду, которая пишет код по правилам вашего проекта: https://clc.to/erid_2W5zFHgXtWd
С промокодом
Реклама. ООО «КАРПОВ КУРСЫ». ИНН 7811764627. erid: 2W5zFHgXtWd
На деле это проверяется за минуту. Два разработчика с одной и той же просьбой «собери сервис для регистрации пользователей» получат разные результаты. У одного выйдет чистый Litestar с типизацией и тестами. У второго — заготовка, которая ляжет при первой же доработке.
Дело не в тексте запроса.
Модель не видит ваш проект. Она не знает, какие соглашения приняты, какие библиотеки уже подключены, какой уровень покрытия тестами считается нормальным. Пока этой информации у нее нет — она отвечает по своему усредненному представлению, а не по вашему.
Поэтому вокруг модели нужно достроить то же самое, что и у обычного разработчика: набор правил, шаблоны, инструменты проверки, критерии приемки.
Именно это и делает Алексей Жиряков на воркшопе karpovꓸcourses «AI-first разработка на Python». За 4 часа собирает готовую агентную среду поверх живого проекта на Litestar и PostgreSQL — от настройки правил до автоматического ревью и подсчета вклада ИИ в цифрах.
Алексей покажет, как настроить правила проекта под задачу агента, как через OpenRouter поднять связку моделей «дешевая пишет — дорогая проверяет», которая помогает снижать стоимость генерации, как научить агента проверять код по чек-листу вашей архитектуры и как измерить вклад ИИ по коммитам.
С воркшопа забираете шаблон AI-first проекта, готовый к продакшену, набор правил и чек-листов, настроенную схему выбора модели под задачу и запись эфира в LMS. Тем, кто пишет на FastAPI, тоже подходит — это отдельно прописано в разделе с вопросами.
Соберите агентную среду, которая пишет код по правилам вашего проекта: https://clc.to/erid_2W5zFHgXtWd
С промокодом
aikarpov20 — скидка 20%Реклама. ООО «КАРПОВ КУРСЫ». ИНН 7811764627. erid: 2W5zFHgXtWd
Google Research попыталась объяснить, откуда у diffusion-моделей берётся «креативность».
Почему генератор изображений не просто копирует обучающие примеры, а создаёт новые сцены, которых не было в датасете?
Ответ оказался математическим.
Во время обучения нейросеть не запоминает идеальную функцию удаления шума. Из-за регуляризации и особенностей градиентного обучения она усваивает её более сглаженную версию. Google называет этот эффект score smoothing.
Если бы функция была идеальной, каждый случайный шум в конце превращался бы в точную копию одного из обучающих примеров.
Но сглаживание создаёт между примерами «зоны интерполяции». Модель может остановиться не на известной точке, а между несколькими знакомыми образами и получить новый, но правдоподобный результат.
В многомерном пространстве это помогает модели восстановить скрытый data manifold - область, где находятся осмысленные изображения. Движение к этой области сохраняется быстрым, а схлопывание к конкретным обучающим картинкам ослабевает. Так появляется баланс между качеством и новизной.
То есть «творчество» diffusion-модели может быть не загадочным свойством и не случайностью.
Это побочный эффект того, что нейросеть учится не идеально и строит мосты между известными примерами.
Работа представлена на ICLR 2026, код экспериментов опубликован открыто.
https://research.google/blog/towards-demystifying-the-creativity-of-diffusion-models/
Почему генератор изображений не просто копирует обучающие примеры, а создаёт новые сцены, которых не было в датасете?
Ответ оказался математическим.
Во время обучения нейросеть не запоминает идеальную функцию удаления шума. Из-за регуляризации и особенностей градиентного обучения она усваивает её более сглаженную версию. Google называет этот эффект score smoothing.
Если бы функция была идеальной, каждый случайный шум в конце превращался бы в точную копию одного из обучающих примеров.
Но сглаживание создаёт между примерами «зоны интерполяции». Модель может остановиться не на известной точке, а между несколькими знакомыми образами и получить новый, но правдоподобный результат.
В многомерном пространстве это помогает модели восстановить скрытый data manifold - область, где находятся осмысленные изображения. Движение к этой области сохраняется быстрым, а схлопывание к конкретным обучающим картинкам ослабевает. Так появляется баланс между качеством и новизной.
То есть «творчество» diffusion-модели может быть не загадочным свойством и не случайностью.
Это побочный эффект того, что нейросеть учится не идеально и строит мосты между известными примерами.
Работа представлена на ICLR 2026, код экспериментов опубликован открыто.
https://research.google/blog/towards-demystifying-the-creativity-of-diffusion-models/
👍5👎2❤1
Andrej Karpathy just dropped 12-page PDF on "Graph Engineering" for multi-agentic systems
the shift: Karpathy's loop runs 700 experiments and forgets all of them. A graph remembers forever
here's the full system:
step 1 → build one loop: generate, critique, revise. 630 lines, 700 experiments in 48 hours
step 2 → go parallel: agents in separate worktrees, same repo, different branches, no conflicts
step 3 → add a knowledge graph: extract entities, resolve aliases, assemble typed edges, query through subgraphs
step 4 → ground your evaluator: it checks claims against graph edges, not vibes
step 5 → plug the graph as shared memory. workers write to it. evaluators fact-check against it. Loops persist overnight
step 6 → the agent forgets. the graph does not. stop rebuilding context from scratch every session
Karpathy ran 1 agent in 1 direction. Anthropic's graph runs 1,000 with shared memory - same model, it's the architecture
https://drive.google.com/file/d/1-GOg0kxcp8tx1BMUECMj2yJq6JYGmfhb/view
the shift: Karpathy's loop runs 700 experiments and forgets all of them. A graph remembers forever
here's the full system:
step 1 → build one loop: generate, critique, revise. 630 lines, 700 experiments in 48 hours
step 2 → go parallel: agents in separate worktrees, same repo, different branches, no conflicts
step 3 → add a knowledge graph: extract entities, resolve aliases, assemble typed edges, query through subgraphs
step 4 → ground your evaluator: it checks claims against graph edges, not vibes
step 5 → plug the graph as shared memory. workers write to it. evaluators fact-check against it. Loops persist overnight
step 6 → the agent forgets. the graph does not. stop rebuilding context from scratch every session
Karpathy ran 1 agent in 1 direction. Anthropic's graph runs 1,000 with shared memory - same model, it's the architecture
https://drive.google.com/file/d/1-GOg0kxcp8tx1BMUECMj2yJq6JYGmfhb/view
❤5👍3