AI for Devs
17K subscribers
388 photos
119 videos
351 links
По сотрудничеству пишите в личные сообщения канала.

Канал для разработчиков про AI. Модели, ИИ-агенты, практические кейсы и новости из мира AI. Всё, что можно применить в работе.
Download Telegram
🇨🇳 Alibaba выпустили Qwen3.7-Max: флагманскую закрытую модель серии Qwen3

Главный кейс из релиза: модель 35 часов работала полностью автономно, сделала 1158+ вызовов инструментов и самостоятельно оптимизировала низкоуровневое CUDA-ядро для работы с длинным контекстом на железе, на котором никогда не обучалась. Результат 10x прирост скорости инференса.

Контекстное окно 1M токенов, только текст (мультимодальности в этом релизе нет).

По бенчмаркам: SWE-bench Pro — 60.6% (выше DeepSeek V4-Pro, но ниже Claude Opus 4.7 с 64.3%).


Интересно, что модель специально тестировали на трёх разных харнессах (OpenClaw, Claude Code и Hermes). Разброс результатов — в пределах ~6 пунктов. Хорошая обобщаемость.

Доступна через Qwen Studio (chat.qwen.ai) и Alibaba Cloud Model Studio (API). Веса Max-версии не открывают. Plus-версия серии Qwen3.7 уйдёт в open-source.

@ai_for_devs
2🤩47👍44🔥1310
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ GLM-5.1 от Z.ai теперь выдаёт 400 токенов в секунду через API

Для сравнения: большинство флагманских моделей сейчас дают 80–120 tok/s.

При этом речь не об урезанной модели, качество то же, ускорили именно систему запуска.


Команда TileRT переписала то, как модель работает на GPU: вместо сотен последовательных мелких операций с паузами между ними — один непрерывный процесс, который не останавливается между генерацией токенов.

@ai_for_devs
248🔥31👍21🤯142
Главная новость прошедшей недели: как взломали GitHub. 19 мая GitHub написали в соц.сетях:

Расследуем несанкционированный доступ к внутренним репозиториям. Данные клиентов предположительно не затронуты.


Через 24 часа на BreachForums появился пост от TeamPCP. Начинается он примерно так:

Всем привет, как дела? Предлагаем купить исходники GitHub.


Если покупатель найдется, то исходники передадут ему, если нет покупателя, то опубликуют бесплатно. Заявили о ~3800 приватных репозиториях.

Позднее GitHub подтвердил: цифра соответствует масштабам реальной утечки.

———

Теперь о причине. Один из сотрудников поставил вредоносное расширение для VS Code 🫠. Скомпрометированная версия плагина провисела в маркетплейсе 18 минут. Автообновление сделало остальное. Расширение вело себя штатно, но при открытии любого проекта молча скачивало обфусцированный скрипт из «осиротевшего» коммита официального репозитория и собирало всё доступное: токены GitHub и AWS, ключи npm, хранилища 1Password, конфиги Claude Code.

Расширения VS Code ставятся из маркетплейса, где любой может опубликовать что угодно. Автообновление включено по умолчанию. Аудит того, что реально собрано в бинарнике расширения, почти никто не делает. GitHub при этом вроде не стартап с двумя инженерами))

Самое ироничное во всём этом то, что GitHub пострадал от своей же экосистемы :D Маркетплейс расширений VS Code, автообновления, доверие к верифицированным паблишерам — всё это инфраструктура Microsoft. И именно сотрудник Microsoft получил автообновление в течение тех самых 18 минут 🤣

@ai_for_devs
Please open Telegram to view this post
VIEW IN TELEGRAM
2🤯74😁34👍1716🔥4
⚡️ Cerebras запустили Kimi K2.6 на скорости ~1000 токенов в секунду

Для тех, кто слышит про Cerebras впервые, расскажу. Cerebras — это американский чипмейкер, который пошёл против индустрии: вместо кластеров из сотен GPU они делают один огромный процессор размером с ноутбук. Он содержит 4 триллиона транзисторов, 900 тысяч вычислительных ядер и 44 гигабайта памяти прямо на кристалле. Вся память рядом с вычислениями, данные не гоняются по сети между чипами, отсюда и скорость.

В январе 2026-го статус компании резко изменился: OpenAI подписала многолетний контракт на развёртывание 750 МВт мощностей Cerebras для обслуживания своих пользователей. Сделка оценивается более чем в 20 млрд долларов, OpenAI также выдала Cerebras кредит на 1 млрд. Первый совместный продукт — GPT-5.3-Codex-Spark, работающий на скорости более 1200 токенов/с.


На этом же железе Cerebras теперь запустили Kimi K2.6 для корпоративных клиентов. Это первая триллионная open-weight модель в их инфраструктуре. Измерения Artificial Analysis: 981 токен/с — в 6,7 раза быстрее ближайшего GPU-облака и в 23 раза быстрее медианного провайдера. На практике: запрос с 10 000 токенов входа и 500 токенов ответа занимает 5,6 секунды против 163,7 секунды на официальном эндпоинте Kimi.

Подробнее про архитектуру Cerebras можно прочитать в их блоге.

@ai_for_devs
4🔥78🤯29👍166👏2
⚡️ MiniMax готовятся к релизу M3

Перед релизом команда решила опубликовать технический отчёт по M2.

M2 вышла в октябре 2025 года. У модели 229B параметров в сумме, но в работе одновременно задействовано всего ~10B. Благодаря этому она остаётся одной из самых быстрых и дешёвых в инференсе среди мощных моделей.

За полгода open-source сообщество активно подхватило несколько ключевых решений из M2, а каждый новый релиз серии стабильно занимал первое место на Hugging Face Open LLM Leaderboard.


M3, по словам представителя команды, выходит "very soon". Ждём!

@ai_for_devs
2🔥33👍2263👏3
GPT уверенно уделывает Opus по очкам, стоимости и времени выполнения!

Datacurve (молодая команда из YC W24, которая делает дорогие и сложные coding-датасеты) выпустила DeepSWE: новый бенчмарк для coding-агентов.

Создатели утверждают: SWE-Bench и подобные уже не отражают реальности. Модели их заучили, задачи слишком мелкие, а оценка полна погрешностей.

Что внутри DeepSWE:
– 113 полностью новых задач из 91 активного open-source репозитория.
– Пять языков: TypeScript, Go, Python, JavaScript и Rust.
– Среднее решение составляет 668 строк кода в 7 файлах (против ~120 строк и 5 файлов в SWE-Bench Pro).
– Короткие естественные промпты.
– Verifier проверяет реальное поведение, а не структуру авторского решения.


Все модели тестировали на одном и том же mini-swe-agent (минималистичный harness на ~100 строк кода).

Результаты можете лицезреть на картинках. Разрыв между топами получился гораздо шире, чем на старых бенчмарках.

@ai_for_devs
1👍51🤯22🔥145💯5
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ В Claude Code появился плагин для поиска уязвимостей

Называется security-guidance, доступен всем пользователям и устанавливается из маркетплейса через /plugins.

Работает через hooks:
– при редактировании файлов ищет рискованные паттерны,
– после каждой итерации модели проверяет полный diff,
– на коммите читает окружающий код для валидации.


По внутренним данным Anthropic, на PR-ах с плагином замечания по безопасности стали появляться на 30-40% реже.

@ai_for_devs
1👍4420🔥15115
⚡️ Anthropic выпустили Claude Opus 4.8

Та же цена за API, зато быстрый режим втрое дешевле. Главное изменение: модель в четыре раза реже пропускает баги в собственном коде без замечаний.

В Claude Code теперь можно запускать сотни параллельных субагентов. На claude.ai появился слайдер "усилий": Low, Medium, High, Extra и Max.


Sonnet всё ещё 4.6, Haiku вообще 4.5! Зато бояре на подписке за $200 должны быть довольны 😄

UPD: В анонсе Anthropic также обещают, что модели класса Mythos появятся в публичном доступе в ближайшие недели.

@ai_for_devs
1😁49👍33🔥22114
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Anthropic выкатили Dynamic Workflows в Claude Code

Параллельно с релизом Opus 4.8 вышла крайне интересная фича для ежедневной работы миллионеров.

Dynamic Workflows: Claude Code сам пишет оркестрационный скрипт, запускает от десятков до сотен параллельных субагентов, те независимо проверяют результат. Задачи, которые раньше занимали недели, по заявлению команды теперь укладываются в дни.


Помните историю про Bun? Джаред Самнер переписал его с Zig на Rust именно через Dynamic Workflows: 1 009 257 строк на Rust, 6 755 коммитов и 9 дней работы.

Поиграться с этой штукой можно двумя способами:
1. Просто упомяни слово "workflow" в промпте,
2. Или включи /effort ultracode — тогда Claude сам будет решать, когда разворачивать оркестрацию.

Страшно представить, как быстро эта штука будет жечь токены) Anthropic предупреждают: начинайте с небольших задач.

P.S. По классике, вместе с громким релизом Anthropic увеличили лимиты на всех тарифах на 50% на 2 недели.

@ai_for_devs
139👍299🔥6🤯1
⚡️ Cчёт на $500 млн за месяц использования Claude

AI-консультант рассказал Axios: компания подключила весь штат к API Anthropic без ограничения на бюджет, дашбордов и алертов.

Сотрудники запускали agentic workflows, не переживали за длинные сессии и десятки coding-агентов. Никто не считал токены.

Расскажи про это боссу, который не хочет покупать тебе подписку дороже 20$ 😄

@ai_for_devs
Please open Telegram to view this post
VIEW IN TELEGRAM
1😁81🤯2092👍2
⚡️ Opus 4.8 уже в Veai! По большинству coding-бенчмарков текущий лидер

SWE-Bench Pro: 69.2% против 64.3% у предыдущего Opus и 58.6% у GPT-5.5. По работе с компьютером (OSWorld-Verified) тоже первая: 83.4%.

Новые пользователи Veai получают 30-дневный триал и могут попробовать лучшую модель бесплатно в любимой IDE.


Если понравится, до 31 мая 23:59 действует промокод OPUS48: скидка 50% на все планы.

@veai_devs
1👍3117👌8🔥2🤯2
⚡️ MiniMax выпустили M3

По coding-бенчмаркам M3 обходит GPT-5.5 и Gemini 3.1 Pro. Нативная мультимодальность (текст + изображения + видео), контекст до 1M токенов.

Благодаря новой архитектуре MiniMax Sparse Attention (MSA) при контексте в 1 млн токенов модель тратит в 20 раз меньше вычислений на токен по сравнению с предыдущим поколением.

Модель уже доступна бесплатно в OpenCode, можно тестить.


Цена API: $0.60/M input и $2.40/M output до 512K токенов. Веса и техотчёт обещают примерно через 10 дней.

@ai_for_devs
1🔥55👍25125🤩5
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ NVIDIA анонсировали Nemotron 3 Ultra и RTX Spark на Computex 2026

Computex — ежегодная выставка в Тайбэе, одна из крупнейших в мире по железу и комплектующим. Дженсен Хуанг традиционно использует её для больших анонсов.

RTX Spark — новый суперчип для ноутбуков и мини-ПК: Blackwell GPU на 6144 CUDA-ядер, 20-ядерный Grace CPU, 128 ГБ единой памяти и 1 петафлоп AI-производительности. Чип разработан совместно с MediaTek, по графической мощности сопоставим с RTX 5070. Это прямой ответ Apple Silicon и Qualcomm Snapdragon. Первые ноутбуки от Asus, Dell, HP, Lenovo, Microsoft и MSI на этом чипе выйдут осенью.


Второй анонс — Nemotron 3 Ultra: 550B параметров, 55B активных, MoE-архитектура. По бенчмаркам держится на уровне топовых открытых моделей и конкурирует с Kimi K2.6. Скорость инференса более 300 tok/s, в 5 раз быстрее и на 30% дешевле ряда аналогов. Модель полностью open-source: от весов и данных до процесса тренировки.

Полноценный релиз модели ожидаем 4 июня на Hugging Face.

@ai_for_devs
134👍23🔥151🤩1
⚡️ Opus 4.8 добавили в DeepSWE. GPT-5.5 всё равно впереди

Opus 4.8 в самой умной и дорогой "комплектации" набрал 58%. GPT-5.5 в режиме xhigh — 70%, притом стоит в среднем $6.61 за задачу против $12.58 у Opus, и справляется за 21 минуту вместо 43.

Разница между Opus 4.7 и 4.8 на этом бенчмарке — 4 процентных пункта: 54% → 58%.

Даже у нас в команде мнения разделились. Одни говорят, что бенчмарк бредовый, другие с ним полностью согласны. Голосуем!

💩 GPT-5.5 топ
🤡 Opus 4.8 лучший

@ai_for_devs
38💩226🤡218🤯10👍21
⚡️ Anthropic расширили Project Glasswing до 200+ организаций

Project Glasswing запустили 7 апреля 2026: около 50 партнёров (AWS, Apple, Google, Microsoft, Cloudflare, Mozilla, Linux Foundation и др.) получили доступ к Claude Mythos Preview, закрытой frontier-модели, заточенной под поиск уязвимостей в критически важном ПО.

В мае опубликовали первые результаты. За месяц модель просканировала 1000+ open-source проектов и нашла 23 019 уязвимостей, из которых 6 202 высокой или критической степени. 90,6% из проверенной выборки оказались реальными багами.

Cloudflare нашли у себя 2 000 уязвимостей, Mozilla закрыла 271 баг в Firefox 150 (в 10 раз больше, чем с предыдущей моделью Anthropic). Среди находок: баг в OpenBSD возрастом 27 лет и уязвимость в wolfSSL, встроенном в ~5 млрд IoT-устройств.


Теперь Anthropic открыли доступ ещё для ~150 организаций из 15+ стран. В приоритете: энергетика, здравоохранение, телеком, вендоры open-source, чья компрометация затронула бы 100+ млн пользователей.

Публично Mythos по-прежнему не выпускают. На Polymarket прямо сейчас 26% лудоманов разработчиков верят в релиз до 30 июня.

@ai_for_devs
1👍32🔥19105🤯4