Python RU
12.4K subscribers
1.05K photos
102 videos
40 files
1.29K links
Все для python разработчиков

админ - @haarrp

@python_job_interview - Python собеседования

@ai_machinelearning_big_data - машинное обучение

@itchannels_telegram - 🔥лучшие ит-каналы

@programming_books_it - it книги

@pythonl

РКН: clck.ru/3Fmy2j
Download Telegram
Forwarded from Machinelearning
⚡️ DeepSeek открыла веса V4.1-Flash

DeepSeek выложила свежайшую DeepSeek-V4.1-Flash, мультимодальную MoE-модель на 552 млрд параметров, с контекстом до миллиона токенов и методом Causal Encoder-Decoder под капотом, который вдвое удешевляет разбор входа.

Задача, под которую её делали, скучная, но дорогая. Долго работающий агент постоянно перечитывает свой контекст, и всё прочитанное приходится держать в KV-кэше.

На длинных дистанциях он раздувается, забивает видеопамять и упирается в пропускную способность шин.


В V4.1-Flash кэш сжат до 890 байт на токен, это вчетверо меньше, чем у V4-Flash, и в 437 раз, чем у первой версии DeepSeek.

Каждому слою внимания заранее назначен один из трёх режимов:

🟢в полном слой считает свои ключи и значения сам;
🟢в режиме переиндексации берёт их у предыдущего слоя, но заново выбирает, на что смотреть;
🟢в режиме повторного использования не считает ничего - берёт и чужой кэш, и чужой выбор.

Так хранить приходится в разы меньше. Сверху главный кэш держится в четырёхбитном формате FP4, и устойчивость к такой точности натренирована, а не добавлена после обучения.

🟡Causal Encoder-Decoder

Метод вдохновлен майкрософтовской работой You Only Cache Once про переиспользование KV-кэша слоями. DeepSeek внесла в него структурные улучшения, чтобы поднять ёмкость кэша и глубину вычислений при его порождении.

40 слоёв разделены пополам: 20 на энкодер, 20 - декодер. К и V для декодера не считаются в каждом его слое, а проецируются из последнего скрытого состояния энкодера.

Поэтому при разборе входа работает только первая половина сети - 8 млрд активных параметров на токен против 16 при генерации ответа.

Для агентов, у которых вход в разы длиннее вывода, это именно то, что нужно.


🟡Бенчмарки

На DeepSWE v1.1 модель берёт 74,2% против 74,0 у Claude Opus 5 и 73,0 у GPT-5.6 Sol.

На Terminal-Bench 2.1 - 90,6% (выше всех).

На AutomationBench - 54,8% против 50,3 у Opus 5.

А вот в Terminal-Bench 4.0, где нужны экспертные знания в науке, модель даёт 31,2% против 51,8 у Opus 5, то есть разрыв с топами на самых сложных задачах никуда не делся.


Модель поддерживает настраиваемый уровень рассуждений от 1 до 100, в API это три пресета: low, high, max - они соответствуют значениям 50, 75 и 100.

Шаблона чата в Jinja нет - вместо него советуют реализацию промптов на Python и отдельный набор Rust-библиотек.

Сообщество на Hugging Face уже сделало квантованные версии практически под всё.


📌Лицензирование: MIT License


🟡Блогпост
🟡Веса
🟡Техотчет


@ai_machinelearning_big_data

#AI #ML #MMLM #MoE #Deepseek
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2