Artificial Intelligence
16.8K subscribers
1.12K photos
11 videos
1 file
1.98K links
Artificial Intelligence

admin - @haarrp

@itchannels_telegram - 🔥 best it channels

@ai_machinelearning_big_data - Machine learning channel

@pythonl - Our Python channel

@pythonlbooks- python книги📚

@datascienceiot - ml 📚

РКН: clck.ru/3FmwZw
Download Telegram
MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling

Hf: https://huggingface.co/papers/2511.11793

Paper: https://arxiv.org/abs/2511.11793

Github: https://github.com/MiroMindAI/MiroThinker
👍2
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
✔️ OpenAI поглотила команду стартапа Convogo.

OpenAI начала год с приобретения: к компании присоединяется команда Convogo, платформы для автоматизации работы HR-специалистов и бизнес-коучей. Представители техгиганта подтвердили, что речь идет именно о трансфере талантов, а не о покупке технологий или интеллектуальной собственности.

Для OpenAI это уже 9-е приобретение за последний год. В прощальном письме команда Convogo отметила, что их главная экспертиза заключается в создании прикладных инструментов, которые превращают возможности нейросетей в реальные рабочие процессы — именно этим они и продолжат заниматься на новом месте.

Финансовые условия сделки не разглашаются, однако известно, что она была полностью оплачена акциями. Сам сервис Convogo будет закрыт.
finance.yahoo.com

✔️ Microsoft запустила Copilot Checkout.

Copilot Checkout - это реализация концепции агентной коммерции: полный цикл покупок от поиска и сравнения товаров до финальной оплаты не покидая окно чата и не переходя на внешние сайты магазинов.

Процессинг обеспечивают PayPal, Stripe и Shopify. Для последнего запущено агрессивное развертывание: продавцы подключаются к системе автоматически (с возможностью отказа), тогда как остальные могут интегрироваться через специальный Agentic Commerce Protocol.

Microsoft утверждает, что Copilot Checkout кардинально меняет воронку продаж, повышая конверсию целевых запросов на 194% по сравнению с классическим веб-серфингом.
microsoft.com

✔️ Акции MiniMax взлетели на 109% после дебюта на Гонконгской бирже.

Котировки ИИ-стартапа удвоились в первый день торгов на Гонконгской фондовой бирже, закрывшись на отметке 345 гонконгских долларов. В ходе IPO компания привлекла около $620 млн, значительно опередив локального соперника Zhipu AI (создателя моделей GLM), чьи акции в ходе первичного размещения днем ранее выросли лишь на 13%.

Китайские разработчики сумели опередить американских коллег, первыми выйдя на публичный рынок. Привлеченные средства пойдут на R&D, поскольку коммерциализация продуктов, по словам руководства MiniMax, всё ещё находится на ранней стадии.
cnbc.com

✔️ Глобальные вычислительные мощности ИИ превысили 15 млн. условных H100.

Epoch AI опубликовала базу данных по рынку чипов, согласно которой мировой парк ускорителей достиг производительности, эквивалентной 15 млн. Nvidia H100. В отчете зафиксирована смена поколений железа: основным драйвером выручки Nvidia стал новый чип B300, тогда как доля бывшего флагмана H100 упала ниже 10%.

Совокупное энергопотребление всего этого оборудования оценивается более чем в 10 ГВт. Для сравнения, это вдвое превышает потребности всего Нью-Йорка.

Авторы проекта собирали статистику по финансовым отчетам и оценкам аналитиков, чтобы добавить прозрачности индустрии, где вендоры редко раскрывают точные цифры продаж в штуках.
epoch.ai

✔️ Grok ограничил генерацию изображений для бесплатных аккаунтов.

Платформа отключила функцию создания картинок в Grok для большинства пользователей X после волны критики, связанной с массовой генерацией откровенного контента. Этот шаг стал вынужденной реакцией на давление регуляторов, включая прямые угрозы штрафов и возможной блокировки соцсети X в Великобритании.

Теперь инструменты генерации и редактирования доступны исключительно платным подписчикам. Расчет строится на деанонимизации: платформа хранит платежные данные премиум-клиентов, что упрощает идентификацию тех, кто создает запрещенный контент.
theguardian.com

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
🔥 Идея из paper: перестать “тренировать наугад” - и сначала предсказывать, какой код выиграет

Обычно ML-агенты работают так:
написал код -> запустил обучение -> посмотрел результат -> исправил -> снова запустил…

Проблема в том, что каждая попытка может занимать часы, и получается дорогой trial-and-error.

Авторы предлагают другой подход:

вместо того чтобы проверять все варианты
агент сначала рассуждением выбирает, какой из 2 решений лучше,
и запускает обучение только для лучшего кандидата.

То есть:
сначала прогноз -> потом одна проверка, а не десятки запусков.

Они оформляют это как задачу:
“выбор лучшего решения по данным” (data-centric preference)

На вход дают:
- описание задачи
- *подтверждённый отчёт о датасете* (data report)
- два варианта кода

Чтобы отчёту можно было доверять, они:
1) прогоняют отдельный профайлинг-скрипт по данным
2) проверяют логи
3) переписывают статистику в простой текст, понятный LLM

Результат на реальных данных:
- 18,438 пар решений
- 26 задач
- точность лучшей модели: 61.5%
- и ещё важно: уверенность модели реально совпадает с тем, права она или нет

В их системе FOREAGENT это даёт:
поиск в 6 раз быстрее
📈 примерно на 6% лучше качество

Вывод простой:
мы можем ускорить обучение агентов не за счёт железа,
а за счёт “умного отбора” - тренировать только то, что с высокой вероятностью сработает.

Paper: arxiv.org/abs/2601.05930
2👍2👏1
🚨 Похоже найдены следы DeepSeek V4?.

В репозитории/ветках заметили MODEL1 - и самое интересное, что он выглядит как отдельная независимая ветка, параллельная V3.2.

То есть это не “патч” внутри линейки V3,
а похоже на:

новый модельный ряд
с другими архитектурными параметрами
потенциально flagship-апдейт

Если следовать неймингу DeepSeek:
после V3.2 крупный архитектурный скачок логично назывался бы V4.

Пока без официального подтверждения, но сигнал жирный:
если MODEL1 действительно новая архитектура, нас ждёт большой релиз.

https://x.com/nopainkiller/status/2013522059662614653
4👍3
🚀 Ling-2.5-1T: новый open-source гигант

• 1 трлн параметров
• 63B активных
• MIT лицензия - можно использовать в продакшене

Что внутри:

Hybrid Linear Attention
Комбинация MLA (1:7) + Lightning Linear
- быстрее Kimi K2 на длинных контекстах

🧠 В 4 раза эффективнее по токенам
Composite rewards позволяют достигать уровня топ-моделей, используя в 4 раза меньше токенов

📚 Контекст до 1 млн токенов
YaRN scaling
— обходит Kimi K2.5 и DeepSeek V3.2 на тестах RULER и MRCR
— идеальные результаты в NIAH

🛠️ SOTA для агентных задач
Обучение через Agentic RL
Лидер BFCL-V4
Нативная интеграция с:
- Claude Code
- OpenCode
- OpenClaw

🎯 Чёткое следование инструкциям
Bidirectional RL + проверка агентом
Минимум «воды», максимум плотности ответа

Модель пока уступает GPT-5.2 и Gemini 3 Pro в долгих многошаговых задачах.

Open-source модели уже заходят на территорию enterprise-агентов.
Если нужен длинный контекст + инструменты + контроль над инфраструктурой - это один из самых интересных кандидатов прямо сейчас.

modelscope.ai/models/inclusionAI/Ling-2.5-1T
modelscope.cn/models/inclusionAI/Ling-2.5-1T
4👍2
Forwarded from Machinelearning
🌟 Claude Code Game Studios: 48 ИИ-агентов как полноценная игровая студия.

Соло-разработчик с доступом к Claude Code теперь может развернуть целую гейм-дев студию с креативным директором, лидами отделов и профильными специалистами.

В основу геймдизайнерских подходов заложены MDA Framework, теория самодетерминации и проектирование состояния потока.

Claude Code Game Studios - шаблон для Claude Code, который организует ИИ-сессию в трёхуровневую иерархию из 48 специализированных агентов.

На вершине 3 директора (креативный, технический и продюсер), работающие на модели Opus.


Уровнем ниже 8 руководителей отделов на Sonnet: геймдизайнер, ведущий программист, арт-директор, директор по звуку, нарративный директор и другие.


Третий уровень - специалисты на Sonnet и Haiku: от геймплэй-программиста и дизайнера экономики до DevOps-инженера и специалиста по доступности.


Агенты взаимодействуют по четкому протоколу: вертикальная делегация задач сверху вниз, горизонтальные консультации между агентами одного уровня, эскалация конфликтов к общему руководителю.

Каждый агент работает строго в границах своего домена и не модифицирует чужие файлы без явного поручения.

Помимо агентов, шаблон включает 37 команд, покрывающих весь цикл разработки: планирование спринтов, ревью кода и дизайна, аудит ассетов, генерацию идей, подготовку к релизу.

Отдельная категория - командные воркфлоу, которые координируют работу нескольких агентов над конкретной фичей: боевой системой, нарративом, интерфейсом или звуком.

Параллельно работают 8 хуков, привязанных к событиям git и жизненному циклу сессии. Они срабатывают автоматически: валидируют коммиты на захардкоженные значения и корректность данных, предупреждают о пушах в защищённые ветки, подгружают контекст текущего спринта при старте и фиксируют результаты при завершении.

Ещё один слой - 11 правил, привязанных к путям в проекте. Они применяются при редактировании файлов в соответствующих директориях и задают стандарты для каждой зоны кодовой базы.

🟡Это не автопилот.

Агенты задают вопросы, предлагают несколько вариантов с плюсами и минусами, показывают черновик. Но финальное решение всегда за человеком, ничего не фиксируется без его одобрения.

🟡Шаблон работает с Godot 4, Unity и Unreal Engine 5.

Для каждого предусмотрен свой лид-агент с набором суб-специалистов: у Godot это GDScript, шейдеры и GDExtension, у Unity - DOTS/ECS, VFX и UI Toolkit, у Unreal - GAS, Blueprints и Replication.

Проект открыт к кастомизации: агентов можно добавлять и удалять, промпты редактировать, хуки - перенастраивать.


📌Лицензирование: MIT License.


🖥GitHub


@ai_machinelearning_big_data

#AI #ML #Vibecoding #Gamedev #Claude
Please open Telegram to view this post
VIEW IN TELEGRAM
5👍1
✔️ 10 книг, чтобы понять, как реально работают LLM (2026)

1. Deep Learning
https://deeplearningbook.org
Библия нейросетей - backprop, архитектуры, вся база

2. Artificial Intelligence: A Modern Approach
https://aima.cs.berkeley.edu
Фундаментальный взгляд на AI как систему

3. Speech and Language Processing
https://web.stanford.edu/~jurafsky/slp3/
NLP, трансформеры и язык - максимально глубоко

4. Machine Learning: A Probabilistic Perspective
https://probml.github.io/pml-book/
Вероятности, статистика и основа ML

5. Understanding Deep Learning
https://udlbook.github.io/udlbook/
Современное объяснение DL с хорошей интуицией

6. Designing Machine Learning Systems
https://oreilly.com/library/view/designing-machine-learning/9781098107956/
Как довести модели до продакшена

7. Generative Deep Learning
https://github.com/3p5ilon/ML-books/blob/main/generative-deep-learning-teaching-machines-to-paint-write-compose-and-play.pdf
Практика генеративных моделей и трансформеров

8. Natural Language Processing with Transformers
https://dokumen.pub/natural-language-processing-with-transformers-revised-edition-1098136799-9781098136796-9781098103248.html
Как строить NLP-системы на трансформерах

9. Machine Learning Engineering
https://mlebook.com
Инженерия ML и продакшен

10. The Hundred-Page Machine Learning Book
https://themlbook.com
Суперконцентрированная база без лишнего
Please open Telegram to view this post
VIEW IN TELEGRAM
4👍2🤔2
Efficient Training on Multiple Consumer GPUs with RoundPipe

Github: https://github.com/ITcarrot/RoundPipe

Paper: https://arxiv.org/abs/2604.27085
👍3🔥2🥰1
Coinbase сокращает около 700 человек - это примерно 14% штата.

CEO Coinbase Брайан Армстронг объясняет это просто: компания хочет стать меньше, быстрее и эффективнее, потому что ИИ уже позволяет небольшим командам делать то, для чего раньше требовалось больше людей.

Coinbase не единственная. Технокомпании всё чаще упаковывают сокращения не только в историю про рынок, но и в историю про AI-native операционку.

Похоже, главный эффект ИИ для бизнеса оказался не в красивых демках, а в очень скучной строке P&L: меньше людей, меньше затрат, быстрее выполнение задач.

bloomberg.com/news/articles/2026-05-05/coinbase-to-cut-14-of-workforce-citing-volatile-markets-ai
5👍3🔥1
Эксклюзив: DeepSeek был только началом

Microsoft сейчас оценивает множество open models для Copilot Cowork.

> Это создаёт внутреннее давление на команды MAI, потому что модели GLM, MiniMax и Kimi развиваются быстрее.

> Microsoft хочет сделать модели «взаимозаменяемыми» и отделить саму обвязку Copilot от конкретных моделей под капотом.

> По мере развития малых моделей часть задач в будущем может выполняться локально.


Смысл простой: Microsoft всё меньше хочет быть жёстко привязана к одной модели или одному поставщику. Copilot постепенно превращается в систему, где важнее не конкретная LLM, а harness, маршрутизация задач, инструменты и возможность быстро менять модели под разные сценарии.

https://www.testingcatalog.com/exclusive-microsoft-evaluates-different-open-models-for-cowork/
🔥53👍3
Forwarded from Machinelearning
🙂 In the Weights: проверка тщеславия

В сети вирусится веб-приложение In the Weights, которое проверяет наличие информации о человеке или компании в GPT, Claude, Gemini и Llama и т.д.

Платформа работает через прямые запросы к моделям с принудительно отключенным доступом к сети, чтобы ИИ опирался исключительно на знания, полученные на трейне.

Анализируя выдачу, система высчитывает скоринг. Метрика оценивает вероятность того, что информация об объекте содержалась в обучающих датасетах и содержится в конкретной модели.

Помимо развлекательных целей, проект является наглядным аудитом того, как корпорации агрессивно скрейпят данные.

По мере того как чат-боты вытесняют поисковики, присутствие в памяти моделей становится новой метрикой публичной значимости.

Сервис напоминает о новых реалиях современной приватности: если информация о вас уже есть в весах LLM, стереть ее цифровой след практически невозможно.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍21
✔️ Dockerless

Environment-free verifier для coding-агентов.

Он проверяет патчи без запуска кода и без Docker, при этом обгоняет сильнейший open-source verifier на 14.3 AUC points.

А RL post-training полностью без окружения достигает 62.0% на SWE-bench Verified.

https://paperswithcode.co/paper/2606.28436
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍1
Most upvoted papers on huggingface this week (July 6-12):

- The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning
- Vidu S1: A Real-Time Interactive Video Generation Model
- RynnWorld-4D: 4D Embodied World Models for Robotic Manipulation
- AlayaWorld: Long-Horizon and Playable Video World Generation
- Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning
- RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation
- OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers
- UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning
- Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling
- PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space
https://huggingface.co/papers/week/2026-W28
1👍1
Один из мифов вокруг ИИ-кодинга: если подобрать нужный промпт — модель сама напишет качественный код

На деле это проверяется за минуту. Два разработчика с одной и той же просьбой «собери сервис для регистрации пользователей» получат разные результаты. У одного выйдет чистый Litestar с типизацией и тестами. У второго — заготовка, которая ляжет при первой же доработке.

Дело не в тексте запроса.

Модель не видит ваш проект. Она не знает, какие соглашения приняты, какие библиотеки уже подключены, какой уровень покрытия тестами считается нормальным. Пока этой информации у нее нет — она отвечает по своему усредненному представлению, а не по вашему.

Поэтому вокруг модели нужно достроить то же самое, что и у обычного разработчика: набор правил, шаблоны, инструменты проверки, критерии приемки.

Именно это и делает Алексей Жиряков на воркшопе karpovꓸcourses «AI-first разработка на Python». За 4 часа собирает готовую агентную среду поверх живого проекта на Litestar и PostgreSQL — от настройки правил до автоматического ревью и подсчета вклада ИИ в цифрах.

Алексей покажет, как настроить правила проекта под задачу агента, как через OpenRouter поднять связку моделей «дешевая пишет — дорогая проверяет», которая помогает снижать стоимость генерации, как научить агента проверять код по чек-листу вашей архитектуры и как измерить вклад ИИ по коммитам.

С воркшопа забираете шаблон AI-first проекта, готовый к продакшену, набор правил и чек-листов, настроенную схему выбора модели под задачу и запись эфира в LMS. Тем, кто пишет на FastAPI, тоже подходит — это отдельно прописано в разделе с вопросами.

Соберите агентную среду, которая пишет код по правилам вашего проекта: https://clc.to/erid_2W5zFHgXtWd
С промокодом aikarpov20 — скидка 20%

Реклама. ООО «КАРПОВ КУРСЫ». ИНН 7811764627. erid: 2W5zFHgXtWd
👎21
Forwarded from Никита Иванов
Один из мифов вокруг ИИ-кодинга: если подобрать нужный промпт — модель сама напишет качественный код

На деле это проверяется за минуту. Два разработчика с одной и той же просьбой «собери сервис для регистрации пользователей» получат разные результаты. У одного выйдет чистый Litestar с типизацией и тестами. У второго — заготовка, которая ляжет при первой же доработке.

Дело не в тексте запроса.

Модель не видит ваш проект. Она не знает, какие соглашения приняты, какие библиотеки уже подключены, какой уровень покрытия тестами считается нормальным. Пока этой информации у нее нет — она отвечает по своему усредненному представлению, а не по вашему.

Поэтому вокруг модели нужно достроить то же самое, что и у обычного разработчика: набор правил, шаблоны, инструменты проверки, критерии приемки.

Именно это и делает Алексей Жиряков на воркшопе karpovꓸcourses «AI-first разработка на Python». За 4 часа собирает готовую агентную среду поверх живого проекта на Litestar и PostgreSQL — от настройки правил до автоматического ревью и подсчета вклада ИИ в цифрах.

Алексей покажет, как настроить правила проекта под задачу агента, как через OpenRouter поднять связку моделей «дешевая пишет — дорогая проверяет», которая помогает снижать стоимость генерации, как научить агента проверять код по чек-листу вашей архитектуры и как измерить вклад ИИ по коммитам.

С воркшопа забираете шаблон AI-first проекта, готовый к продакшену, набор правил и чек-листов, настроенную схему выбора модели под задачу и запись эфира в LMS. Тем, кто пишет на FastAPI, тоже подходит — это отдельно прописано в разделе с вопросами.

Соберите агентную среду, которая пишет код по правилам вашего проекта: https://clc.to/erid_2W5zFHgXtWd
С промокодом aikarpov20 — скидка 20%

Реклама. ООО «КАРПОВ КУРСЫ». ИНН 7811764627. erid: 2W5zFHgXtWd
Google Research попыталась объяснить, откуда у diffusion-моделей берётся «креативность».

Почему генератор изображений не просто копирует обучающие примеры, а создаёт новые сцены, которых не было в датасете?

Ответ оказался математическим.

Во время обучения нейросеть не запоминает идеальную функцию удаления шума. Из-за регуляризации и особенностей градиентного обучения она усваивает её более сглаженную версию. Google называет этот эффект score smoothing.

Если бы функция была идеальной, каждый случайный шум в конце превращался бы в точную копию одного из обучающих примеров.

Но сглаживание создаёт между примерами «зоны интерполяции». Модель может остановиться не на известной точке, а между несколькими знакомыми образами и получить новый, но правдоподобный результат.

В многомерном пространстве это помогает модели восстановить скрытый data manifold - область, где находятся осмысленные изображения. Движение к этой области сохраняется быстрым, а схлопывание к конкретным обучающим картинкам ослабевает. Так появляется баланс между качеством и новизной.

То есть «творчество» diffusion-модели может быть не загадочным свойством и не случайностью.

Это побочный эффект того, что нейросеть учится не идеально и строит мосты между известными примерами.

Работа представлена на ICLR 2026, код экспериментов опубликован открыто.

https://research.google/blog/towards-demystifying-the-creativity-of-diffusion-models/
👍5👎21
Andrej Karpathy just dropped 12-page PDF on "Graph Engineering" for multi-agentic systems

the shift: Karpathy's loop runs 700 experiments and forgets all of them. A graph remembers forever

here's the full system:

step 1 → build one loop: generate, critique, revise. 630 lines, 700 experiments in 48 hours

step 2 → go parallel: agents in separate worktrees, same repo, different branches, no conflicts

step 3 → add a knowledge graph: extract entities, resolve aliases, assemble typed edges, query through subgraphs

step 4 → ground your evaluator: it checks claims against graph edges, not vibes

step 5 → plug the graph as shared memory. workers write to it. evaluators fact-check against it. Loops persist overnight

step 6 → the agent forgets. the graph does not. stop rebuilding context from scratch every session

Karpathy ran 1 agent in 1 direction. Anthropic's graph runs 1,000 with shared memory - same model, it's the architecture

https://drive.google.com/file/d/1-GOg0kxcp8tx1BMUECMj2yJq6JYGmfhb/view
5👍3