В сети набирает популярность плагин Caveman, который заставляет LLM говорить как пещерный человек ради экономии токенов
Он делает так, чтобы модель убирала из ответа приветствия, вежливости, длинные переходы, определения для чайников и прочие вводные фразы, и оставляла только очень сухую выжимку.
Как заявляет автор, экономится при этом до 75% токенов без потери качества (если что, есть разные режими сжатия, от лайтового до ультра телеграфного).
На GitHub проект (github.com/JuliusBrussee/caveman) набрал уже почти 80к звезд. Сначала это был просто скилл для Claude Code, но теперь автор уже сделал из Caveman отдельный плагин и даже выпустил полноценного кодинг-агента Caveman Code.
Автор пишет, что скилл используют даже сотрудники OpenAI, Nvidia, GitHub и пр. А в компании Legrand сотрудникам якобы напрямую рекомендуют использовать Caveman, чтобы не вылетать за лимиты по токенам.
Кстати, проект поддержал технический директор OpenAI Шейн Суини. Он лично законтрибьютил в репозиторий, добавив поддержку Codex.
Он делает так, чтобы модель убирала из ответа приветствия, вежливости, длинные переходы, определения для чайников и прочие вводные фразы, и оставляла только очень сухую выжимку.
Как заявляет автор, экономится при этом до 75% токенов без потери качества (если что, есть разные режими сжатия, от лайтового до ультра телеграфного).
На GitHub проект (github.com/JuliusBrussee/caveman) набрал уже почти 80к звезд. Сначала это был просто скилл для Claude Code, но теперь автор уже сделал из Caveman отдельный плагин и даже выпустил полноценного кодинг-агента Caveman Code.
Автор пишет, что скилл используют даже сотрудники OpenAI, Nvidia, GitHub и пр. А в компании Legrand сотрудникам якобы напрямую рекомендуют использовать Caveman, чтобы не вылетать за лимиты по токенам.
Кстати, проект поддержал технический директор OpenAI Шейн Суини. Он лично законтрибьютил в репозиторий, добавив поддержку Codex.
2🗿247❤88🤯21🤗8👍6😁5😍4🫡1 1
Cloud.ru выкатили в общий доступ управляемый сервис для OpenClaw и других ИИ-агентов
Агентные системы выходят из стадии экспериментов и становятся полноценным инструментом для бизнеса. Только что на рынке появился EvoClaw – управляемый сервис для запуска OpenClaw и других ИИ-агентов с готовой инфраструктурой и поддержкой от провайдера.
Вы получаете самые популярные агентные системы из коробки. Добавлена изоляция среды, политики безопасности по Zero Trust, мониторинг, логирование, хранение секретов. Решение работает по протоколу A2A для взаимодействия между агентами.
Для запуска агентов можно использовать модель из каталога LLM Foundation Models или инференс модели через сервис ML Inference. Также пользователь EvoClaw может заранее выбрать уникальную специализацию, навыки и тон общения ассистента.
Вот так агенты продолжают обрастать инфраструктурой. И именно такие продукты как EvoClaw – это следующий необходимый шаг развития ИИ и ускорения разработки в компаниях.
Агентные системы выходят из стадии экспериментов и становятся полноценным инструментом для бизнеса. Только что на рынке появился EvoClaw – управляемый сервис для запуска OpenClaw и других ИИ-агентов с готовой инфраструктурой и поддержкой от провайдера.
Вы получаете самые популярные агентные системы из коробки. Добавлена изоляция среды, политики безопасности по Zero Trust, мониторинг, логирование, хранение секретов. Решение работает по протоколу A2A для взаимодействия между агентами.
Для запуска агентов можно использовать модель из каталога LLM Foundation Models или инференс модели через сервис ML Inference. Также пользователь EvoClaw может заранее выбрать уникальную специализацию, навыки и тон общения ассистента.
Вот так агенты продолжают обрастать инфраструктурой. И именно такие продукты как EvoClaw – это следующий необходимый шаг развития ИИ и ускорения разработки в компаниях.
1🗿49🔥21❤13👍7 7😁6 2💯1🤗1🎄1
Z.ai снова радуют: стартап выпускает собственную среду разработки ZCode 3.0
https://zcode.z.ai/en
Конкурент Claude Code от создателей GLM-5.2 уже доступен на MacOS, Windows и Linux. Внутри собственный агент ZCode Agent, с фокусом на длинные многоступенчатые задачи и крупные сложные проекты. Мониторинг, умная документация, мультимодальность и мультиагентность – в комплекте.
Понятно, что в первую очередь платформа заточена именно под GLM-5.2, но использовать в ZCode можно и открытые модели, и даже свои подписки от OpenAI и Anthropic.
И еще: в ZCode по сравнению с обычной подпиской GLM Coding Plan квоты подписчиков на модель будут в 1.5 раза выше. Плюс, новые пользователи получают 5 дней бесплатного доступа с большим дневным лимитом.
https://zcode.z.ai/en
Конкурент Claude Code от создателей GLM-5.2 уже доступен на MacOS, Windows и Linux. Внутри собственный агент ZCode Agent, с фокусом на длинные многоступенчатые задачи и крупные сложные проекты. Мониторинг, умная документация, мультимодальность и мультиагентность – в комплекте.
Понятно, что в первую очередь платформа заточена именно под GLM-5.2, но использовать в ZCode можно и открытые модели, и даже свои подписки от OpenAI и Anthropic.
И еще: в ZCode по сравнению с обычной подпиской GLM Coding Plan квоты подписчиков на модель будут в 1.5 раза выше. Плюс, новые пользователи получают 5 дней бесплатного доступа с большим дневным лимитом.
4🤯84⚡43❤19🔥11😁6👏3 3🤩2🍾2👍1
Сбер выкатил в open source GFusion — экспериментальную диффузионную LLM на базе GigaChat
Обычно языковые модели генерируют текст последовательно: токен за токеном. GFusion работает иначе — она пытается выдавать сразу блоки текста, редактируя его в процессе нелинейно. За счёт этого можно ускорять LLM не только инфраструктурными оптимизациями, но и изменением самой механики генерации.
У проекта отдельная история: GFusion создал Даниил Тихонов, когда был стажёром команды фундаментальных моделей Сбера. Изначально работа выросла из его диплома на ФКН НИУ ВШЭ.
По результатам команды GigaChat, GFusion оказалась до 70% быстрее GigaChat3-10B-A1.8B и на 39% быстрее версии с MTP. При этом качество просело всего на 2–4 п.п.
Выложили код модели, обучение, оптимизированные attention-ядра и поддержку в SGLang. Хороший пример того, как молодые исследователи уже создают технологии мирового уровня и выводят их в open source.
Статья на Habr.
Модель и код доступны : GFusion-10B-A1.8B-base GFusion-10B-A1.8B
GitVerse
Обычно языковые модели генерируют текст последовательно: токен за токеном. GFusion работает иначе — она пытается выдавать сразу блоки текста, редактируя его в процессе нелинейно. За счёт этого можно ускорять LLM не только инфраструктурными оптимизациями, но и изменением самой механики генерации.
У проекта отдельная история: GFusion создал Даниил Тихонов, когда был стажёром команды фундаментальных моделей Сбера. Изначально работа выросла из его диплома на ФКН НИУ ВШЭ.
По результатам команды GigaChat, GFusion оказалась до 70% быстрее GigaChat3-10B-A1.8B и на 39% быстрее версии с MTP. При этом качество просело всего на 2–4 п.п.
Выложили код модели, обучение, оптимизированные attention-ядра и поддержку в SGLang. Хороший пример того, как молодые исследователи уже создают технологии мирового уровня и выводят их в open source.
Статья на Habr.
Модель и код доступны : GFusion-10B-A1.8B-base GFusion-10B-A1.8B
GitVerse
1❤147🔥58😁27🗿23👏8 8🎉5🍓4💯2👍1😍1
Data Secrets
Anthropic тоже собираются делать собственный чип
По словам The Information, они прямо сейчас ведут ранние переговоры о разработке с Samsung.
Напоминаем, что стартап уже использует и AWS Trainium, и Google TPU, и Nvidia GPU. Но, видимо, даже при этом масштабирование мощностей становится проблемой, и Амодеи уже думает о собственном железе. Опыт OpenAI в подобной стратегии пока кажется (на данной стадии) удачным.
По словам The Information, они прямо сейчас ведут ранние переговоры о разработке с Samsung.
Напоминаем, что стартап уже использует и AWS Trainium, и Google TPU, и Nvidia GPU. Но, видимо, даже при этом масштабирование мощностей становится проблемой, и Амодеи уже думает о собственном железе. Опыт OpenAI в подобной стратегии пока кажется (на данной стадии) удачным.
❤78🔥29😁21👏4🎉2👍1😍1
Китай открывает пятилетку ИИ-образования
Государственный совет опубликовал пятилетний план, где прописано, что ИИ‑грамотность должна стать ключевой способностью каждого учащегося на любом уровне образования.
Теперь обучение ИИ в Китае будет начинаться примерно с 6 лет, и распространяться в виде систематических курсов на все классы школы, и далее в университеты, колледжи и тд.
Причем это не просто идея, а часть стратегии Си Цзиньпина по технологическому превосходству и конкуренции с США. Массовая ИИ‑грамотность объявляется вопросом национальной конкурентоспособности и даже элементом нацбезопасности.
Молодцы, что сказать. Так они скоро станут первой страной, для которой навыки работы с ИИ будут такой же базой, как Интернет или простейшее ПО.
Государственный совет опубликовал пятилетний план, где прописано, что ИИ‑грамотность должна стать ключевой способностью каждого учащегося на любом уровне образования.
Теперь обучение ИИ в Китае будет начинаться примерно с 6 лет, и распространяться в виде систематических курсов на все классы школы, и далее в университеты, колледжи и тд.
Причем это не просто идея, а часть стратегии Си Цзиньпина по технологическому превосходству и конкуренции с США. Массовая ИИ‑грамотность объявляется вопросом национальной конкурентоспособности и даже элементом нацбезопасности.
Молодцы, что сказать. Так они скоро станут первой страной, для которой навыки работы с ИИ будут такой же базой, как Интернет или простейшее ПО.
1❤238👍119❤🔥18😁7🤯5🎉5💯4🕊3👏2😎2 1
Мы проверили, это не первоапрельская шутка: GitHub теперь продает копии репозиториев на CD-ROM
На случай, если вам очень хочется передать своим детям сгенерированный в молодости слоп-код, вот ссылка для заказа: gh.io/cd
На случай, если вам очень хочется передать своим детям сгенерированный в молодости слоп-код, вот ссылка для заказа: gh.io/cd
1😁233👍23❤16🔥7🤯5☃1🎉1🆒1
Наглядно о том, насколько далек новый Fable от того, что мы получили изначально
Аналитики из BridgeMind провели повторные эвалы модели после возвращения, и вот результат:
Debugging: 86.2 → 25.9
Refactoring: 73.6 → 38.4
Hallucination: 75.9 → 61.7
Сама по себе глупее модель не стала, все дело в новых ограничениях: слишком много задач, даже самых обычных, маршрутизируются к Opus 4.8. Отсюда и просадка в метриках.
Аналитики из BridgeMind провели повторные эвалы модели после возвращения, и вот результат:
Debugging: 86.2 → 25.9
Refactoring: 73.6 → 38.4
Hallucination: 75.9 → 61.7
Сама по себе глупее модель не стала, все дело в новых ограничениях: слишком много задач, даже самых обычных, маршрутизируются к Opus 4.8. Отсюда и просадка в метриках.
2 159😁60🫡33😭32❤4👍4🔥2⚡1🏆1💘1
Data Secrets
Наглядно о том, насколько далек новый Fable от того, что мы получили изначально Аналитики из BridgeMind провели повторные эвалы модели после возвращения, и вот результат: Debugging: 86.2 → 25.9 Refactoring: 73.6 → 38.4 Hallucination: 75.9 → 61.7 Сама по…
Наконец-то все стало понятно
1😁404❤26😢15⚡3🗿3🔥2🏆2👍1😎1
Легендарная кожанка Дженсена Хуанга выставлена на аукцион
Купить ту самую историческую куртку Tom Ford с автографом Хуанга на подкладке можно, если у вас есть ОТ 40к долларов (скорее всего, по факту она уйдет гораздо дороже).
Конкретно в этом экземпляре Хуанг был на Hon Hai (Foxconn) Tech Day в Тайбэе 18 октября 2023, когда Nvidia презентовала AI factories.
Аукцион благотворительный, все средства пойдут в некоммерческую организацию The Edge Institute.
Скидываемся?
Купить ту самую историческую куртку Tom Ford с автографом Хуанга на подкладке можно, если у вас есть ОТ 40к долларов (скорее всего, по факту она уйдет гораздо дороже).
Конкретно в этом экземпляре Хуанг был на Hon Hai (Foxconn) Tech Day в Тайбэе 18 октября 2023, когда Nvidia презентовала AI factories.
Аукцион благотворительный, все средства пойдут в некоммерческую организацию The Edge Institute.
Скидываемся?
😁92🔥43❤22 9👍4💯3🍾3🕊1 1
Хакеры теперь используют галлюцинации LLM для мошенничества
Unit 42, одна из самых известных в мире команд, которая занимается расследованием кибератак и анализом вредоносного ПО, выпустила очень занятное исследование про так называемый Phantom Squatting.
Как мы все знаем, LLMки – большие любители выдумывать несуществующие URL. При этом, ожидаемо, некоторые домены они выдумывают чаще. Например, могут выдавать name_download. com вместо правильного name. com.
Таких паттернов довольно много, и вот злоумышленники поняли, что эти выдуманные адреса можно просто регистрировать на себя и размещать там фишинг. По аналогии с typosquatting, когда хакеры пользовались человеческими опечатками и регистрировали сайты типа goggle. com.
При этом пользователя даже не надо заманивать, за хакеров это делают сами LLM. Технолоджия, как говорится.
И если вы сейчас подумали, что это какой-то единичный случай, то нет: исследователи обнаружили уже более 13 тысяч существующих вредоносных URL, использующих этот принцип.
Поверх этого есть еще около 250 тысяч незарегистрированных доменов, которые регулярно придумывают модели. Настоящая находка для мошенников всех мастей.
Unit 42, одна из самых известных в мире команд, которая занимается расследованием кибератак и анализом вредоносного ПО, выпустила очень занятное исследование про так называемый Phantom Squatting.
Как мы все знаем, LLMки – большие любители выдумывать несуществующие URL. При этом, ожидаемо, некоторые домены они выдумывают чаще. Например, могут выдавать name_download. com вместо правильного name. com.
Таких паттернов довольно много, и вот злоумышленники поняли, что эти выдуманные адреса можно просто регистрировать на себя и размещать там фишинг. По аналогии с typosquatting, когда хакеры пользовались человеческими опечатками и регистрировали сайты типа goggle. com.
При этом пользователя даже не надо заманивать, за хакеров это делают сами LLM. Технолоджия, как говорится.
И если вы сейчас подумали, что это какой-то единичный случай, то нет: исследователи обнаружили уже более 13 тысяч существующих вредоносных URL, использующих этот принцип.
Поверх этого есть еще около 250 тысяч незарегистрированных доменов, которые регулярно придумывают модели. Настоящая находка для мошенников всех мастей.
1👍116 75❤35🤯11✍8😎8 3😁2💯1
Nvidia будет дарить стартапам компьют в обмен на долю с выручки
То есть вместо обычной покупки они теперь предлагают модель revenue-sharing: партнеры получают кредиты или доступ к инфраструктуре на базе Nvidia, а потом делятся процентом с будущей выручки.
Направлена программа в основном на строительство датацентров. Многим небольшим AI-облакам не хватает денег, но при этом спрос на вычисления есть. И вот тут-то приходит Nvidia и предлагает свою помощь.
Зачем это Nvidia? С одной стороны, кажется, что это риски. Но с другой – это новая модель долгосрочного повторяющегося заработка, в которой Nvidia будет меньше зависеть от гиперскейлеров типа Google, Amazon и Microsoft, которые активно разрабатывают собственные чипы.
То есть вместо обычной покупки они теперь предлагают модель revenue-sharing: партнеры получают кредиты или доступ к инфраструктуре на базе Nvidia, а потом делятся процентом с будущей выручки.
Направлена программа в основном на строительство датацентров. Многим небольшим AI-облакам не хватает денег, но при этом спрос на вычисления есть. И вот тут-то приходит Nvidia и предлагает свою помощь.
Зачем это Nvidia? С одной стороны, кажется, что это риски. Но с другой – это новая модель долгосрочного повторяющегося заработка, в которой Nvidia будет меньше зависеть от гиперскейлеров типа Google, Amazon и Microsoft, которые активно разрабатывают собственные чипы.
1😁104 28❤23👍13🤯6🔥1😍1🫡1🦄1😎1👾1
Please open Telegram to view this post
VIEW IN TELEGRAM
2😁505❤61🫡42😭37 15💯11 11🔥5👍1
GPT-5.6 Sol появится в Codex уже со дня на день
Да, модель будет в Codex, это подтвердили сотрудники. Вместе с братьями своими меньшими Terra и Luna, она, по слухам, должна выйти уже завтра-послезавтра. Готовимся вайб-кодить на полную.
Но это еще не самое интересное.
Самое интересное, что в ограниченный тест в июле выложат GPT-5.6 Sol на Cerebras. Обещают скорость (внимание!) до 750 токенов в секунду.
При этом это будет не какая-то отдельная специализированная под эти чипы или урезанная модель. Эта та же самая мощнейшая громадная Sol, которая будет летать в два раза быстрее Gemini 3.5 Flash.
По некоторым оценкам, размер модели – от 2 до 4 триллионов параметров (~150B активных). При таком размере вместить модель на Cerebras невозможно без инженерных ухищрений. Поэтому предполагается, что в новой линейке реализована какая-то кастомная схема KV-кэша.
Такое действительно ждем
Да, модель будет в Codex, это подтвердили сотрудники. Вместе с братьями своими меньшими Terra и Luna, она, по слухам, должна выйти уже завтра-послезавтра. Готовимся вайб-кодить на полную.
Но это еще не самое интересное.
Самое интересное, что в ограниченный тест в июле выложат GPT-5.6 Sol на Cerebras. Обещают скорость (внимание!) до 750 токенов в секунду.
При этом это будет не какая-то отдельная специализированная под эти чипы или урезанная модель. Эта та же самая мощнейшая громадная Sol, которая будет летать в два раза быстрее Gemini 3.5 Flash.
По некоторым оценкам, размер модели – от 2 до 4 триллионов параметров (~150B активных). При таком размере вместить модель на Cerebras невозможно без инженерных ухищрений. Поэтому предполагается, что в новой линейке реализована какая-то кастомная схема KV-кэша.
Такое действительно ждем
1🔥202❤36👍19😁4🕊4🤔3🎉3🍓3🤯2
Свежий Stanford* AI Index 2026 зафиксировал сдвиг, который мы наблюдаем весь последний год. Цифры там, мягко говоря, заслуживают внимания.
Смотрите на спрос:
• Навык AI Agents — №1 среди самых востребованных инженерных скиллов (AI Strategy — №3, LLMOps — №5)
• Упоминания «Agentic systems» в вакансиях за год выросли на 10 854%. Это не опечатка
• «AI agents» — +2 113%
• Фокус очевидно сместился на проектирование архитектуры и LLMOps
Вывод, который напрашивается из исследования: роль программиста превращается из «написателя кода» в архитектора мультиагентных систем.
Ключевой скилл теперь - умение строить долгоживущие автономные процессы, управлять контекстом и верифицировать работу множества специализированных агентов. Это в том числе подтверждается концепцией Agentic Loop, которая сейчас тоже набирает популярность.
Такой рынок вполне реально догнать. Naition запускает второй поток буткэмпа ровно по этой теме — обучение самым актуальным AI-driven практикам и агентная разработка для мидл+/сеньоров и лидов разработки.
А для продактов и проджектов IT-продуктовых компаний предусмотрен отдельный трек!
Первый поток уже прошёл (с завершением со стороны 94.3% участников!)
С 14 июля стартует второй поток. Места ещё есть.
За 12 недель пройдёте путь от «агент как инструмент» до внедрения в команду.
Начнёте с работы с качеством, контекстом и spec-driven подходом, соберёте ядро: свой MCP под задачи, RAG, мультиагентную систему с сабагентами, и всё это будет покрыто оркестрацией. Отработаете практики измненения масштабных кодовых баз на реальных проектах на 100тыс+ строк кода - декомпозиция, индексация кода, рефакторинг, разбиение монолита и завершите масштабированием AI-практик на всю команду.
Уроки ведут практики с 15–20 годами за плечами: ex-Yandex Cloud, ex-Meta, staff-инженер Google, CEO Symbioway - центра по найму разработчиков. Другими словами люди, которые находятся в центре трансформации рынка.
Формат: 12 недель, 17 уроков, 5 модулей, живые вечерние эфиры + практика между ними. Минимум теории, максимум разборов кейсов и групповой практики прямо на вебинаре.
👉 naition.ai — по промокоду DATASECRETS скидка 20%
Для всех участников бонус: 3 месяца в клубе топ-разработчиков после обучения.
А еще специальные условия для команд и групп — up-skilling вместе с коллегами, сотрудниками и друзья — выгодно!
Рынок меняется и от вас зависит, как это отразится на вас!
*Признана нежелательной на территории РФ
Реклама.
Смотрите на спрос:
• Навык AI Agents — №1 среди самых востребованных инженерных скиллов (AI Strategy — №3, LLMOps — №5)
• Упоминания «Agentic systems» в вакансиях за год выросли на 10 854%. Это не опечатка
• «AI agents» — +2 113%
• Фокус очевидно сместился на проектирование архитектуры и LLMOps
Вывод, который напрашивается из исследования: роль программиста превращается из «написателя кода» в архитектора мультиагентных систем.
Ключевой скилл теперь - умение строить долгоживущие автономные процессы, управлять контекстом и верифицировать работу множества специализированных агентов. Это в том числе подтверждается концепцией Agentic Loop, которая сейчас тоже набирает популярность.
Такой рынок вполне реально догнать. Naition запускает второй поток буткэмпа ровно по этой теме — обучение самым актуальным AI-driven практикам и агентная разработка для мидл+/сеньоров и лидов разработки.
А для продактов и проджектов IT-продуктовых компаний предусмотрен отдельный трек!
Первый поток уже прошёл (с завершением со стороны 94.3% участников!)
С 14 июля стартует второй поток. Места ещё есть.
За 12 недель пройдёте путь от «агент как инструмент» до внедрения в команду.
Начнёте с работы с качеством, контекстом и spec-driven подходом, соберёте ядро: свой MCP под задачи, RAG, мультиагентную систему с сабагентами, и всё это будет покрыто оркестрацией. Отработаете практики измненения масштабных кодовых баз на реальных проектах на 100тыс+ строк кода - декомпозиция, индексация кода, рефакторинг, разбиение монолита и завершите масштабированием AI-практик на всю команду.
Уроки ведут практики с 15–20 годами за плечами: ex-Yandex Cloud, ex-Meta, staff-инженер Google, CEO Symbioway - центра по найму разработчиков. Другими словами люди, которые находятся в центре трансформации рынка.
Формат: 12 недель, 17 уроков, 5 модулей, живые вечерние эфиры + практика между ними. Минимум теории, максимум разборов кейсов и групповой практики прямо на вебинаре.
👉 naition.ai — по промокоду DATASECRETS скидка 20%
Для всех участников бонус: 3 месяца в клубе топ-разработчиков после обучения.
Рынок меняется и от вас зависит, как это отразится на вас!
*Признана нежелательной на территории РФ
Реклама.
🤨100😁38🗿21❤19👍6 6⚡5🤯3🕊1💯1🍓1
This media is not supported in your browser
VIEW IN TELEGRAM
Эрлинг Холанд стал настолько популярен, что под него косят даже роботы
Atlas от Boston Dynamics внезапно появился на Чемпионате мира во время халф-тайма Бразилия-Норвегия. Он передал арбитру мяч и повторил фирменное празднование гола Холанда.
Кстати, на данный момент Hyundai Motor Group полностью выкупили Boston Dynamics и запустили массовое производство Atlas. К 2028 планируют произвести 30 тысяч.
Atlas от Boston Dynamics внезапно появился на Чемпионате мира во время халф-тайма Бразилия-Норвегия. Он передал арбитру мяч и повторил фирменное празднование гола Холанда.
Кстати, на данный момент Hyundai Motor Group полностью выкупили Boston Dynamics и запустили массовое производство Atlas. К 2028 планируют произвести 30 тысяч.
2😁114❤29🔥18🤯5👍3😎3🗿2👌1😍1
This media is not supported in your browser
VIEW IN TELEGRAM
GigaChat 3.5 Ultra: меньше, быстрее, сильнее
Сегодня Сбер выкатил в open source GigaChat 3.5 Ultra — новую 432B-модель под MIT-лицензией. Это первый в open source гибрид GatedDeltaNet и MLA, доведённый до сотен миллиардов параметров, — с собственным рецептом обучения, который был собран больше чем в 1500 экспериментах. Модель выросла в коде, математике, агентных сценариях и на аренах — и при этом стала на 40% меньше, чем GigaChat 3.1 Ultra.
Что внутри:
• Собственная гибридная архитектура MLA + GatedDeltaNet с уникальной стабилизирующей обвязкой, без которой такой гибрид на этом масштабе просто не обучается;
• Gated Attention — модель может локально приглушать слишком сильный сигнал из attention-слоя;
• GatedNorm — нормализация с явным гейтом для управления масштабом сигнала между признаками. Команда Сбера выкладывает подобную стабилизирующую оптимизацию в опенсорс первыми в мире;
• Примерно в 4 раза меньше KV-кеша на токен, в ту же память помещается в 2,14 раза больше контекста, throughput под нагрузкой +20%;
• Две MTP-головы и ускорение генерации до 2,2 раза;
• FP8 на всех этапах обучения без потери качества относительно bf16 — свои Triton- и CUDA-ядра;
• Новый этап online RL после SFT и DPO.
Результаты:
- GigaChat-3.5-Ultra-Base обходит DeepSeek V3.2 Exp Base и DeepSeek V4 Flash Base в среднем по нашему набору general-, math- и code-бенчмарков (полные таблицы — в статье);
- GigaChat-3.5-Ultra-Instruct сравним с DeepSeek V3.2 по среднему скору, будучи в полтора раза меньше;
- По LLM-судье MiniMax-M2.7 средний win-rate против GigaChat 3.1 Ultra — 75,9%, а против GPT-5 — 68.7%.
Весь стек — данные (свой LLM-парсинг веба, 600+ языков программирования в коде), архитектура, рецепт обучения, инфраструктура — сделан командой Сбера end-to-end. Подробности, включая детали реализации гейтов и рецепт стабилизации, — в статье на Habr.
HuggingFace | GitVerse
Сегодня Сбер выкатил в open source GigaChat 3.5 Ultra — новую 432B-модель под MIT-лицензией. Это первый в open source гибрид GatedDeltaNet и MLA, доведённый до сотен миллиардов параметров, — с собственным рецептом обучения, который был собран больше чем в 1500 экспериментах. Модель выросла в коде, математике, агентных сценариях и на аренах — и при этом стала на 40% меньше, чем GigaChat 3.1 Ultra.
Что внутри:
• Собственная гибридная архитектура MLA + GatedDeltaNet с уникальной стабилизирующей обвязкой, без которой такой гибрид на этом масштабе просто не обучается;
• Gated Attention — модель может локально приглушать слишком сильный сигнал из attention-слоя;
• GatedNorm — нормализация с явным гейтом для управления масштабом сигнала между признаками. Команда Сбера выкладывает подобную стабилизирующую оптимизацию в опенсорс первыми в мире;
• Примерно в 4 раза меньше KV-кеша на токен, в ту же память помещается в 2,14 раза больше контекста, throughput под нагрузкой +20%;
• Две MTP-головы и ускорение генерации до 2,2 раза;
• FP8 на всех этапах обучения без потери качества относительно bf16 — свои Triton- и CUDA-ядра;
• Новый этап online RL после SFT и DPO.
Результаты:
- GigaChat-3.5-Ultra-Base обходит DeepSeek V3.2 Exp Base и DeepSeek V4 Flash Base в среднем по нашему набору general-, math- и code-бенчмарков (полные таблицы — в статье);
- GigaChat-3.5-Ultra-Instruct сравним с DeepSeek V3.2 по среднему скору, будучи в полтора раза меньше;
- По LLM-судье MiniMax-M2.7 средний win-rate против GigaChat 3.1 Ultra — 75,9%, а против GPT-5 — 68.7%.
Весь стек — данные (свой LLM-парсинг веба, 600+ языков программирования в коде), архитектура, рецепт обучения, инфраструктура — сделан командой Сбера end-to-end. Подробности, включая детали реализации гейтов и рецепт стабилизации, — в статье на Habr.
HuggingFace | GitVerse
1😁212❤120🔥80🗿35👏21🤨17🫡13🤔3😍2🏆2❤🔥1