Machine learning Interview
30.3K subscribers
1.83K photos
163 videos
13 files
1.27K links
ИИ, Rust, вайбкодинг, Data Science, Deep Learning и делюсь тем, что интересно и полезно!

Вопросы - @workakkk

РКН: clck.ru/3FmwRz
Download Telegram
Forwarded from Machinelearning
🚀 DeepSeek-V3.2-Exp - вышла новая экспериментальная версия

Главное:
- Основана на V3.1-Terminus
- Новый механизм Sparse Attention (DSA) → быстрее и дешевле работа с длинными контекстами
- Качество почти без потерь, производительность как у V3.1
- 💰 API подешевел более чем на 50%

📊 V3.1 пока ещё будет доступна до 15 октября 2025.

🔗 Hugging Face: https://huggingface.co/deepseek-ai/DeepSeek-V3.2-Exp)
🔗 Tech Report: https://github.com/deepseek-ai/DeepSeek-V3.2-Exp/blob/main/DeepSeek_V3_2.pdf)
🔗Github: https://github.com/deepseek-ai/DeepSeek-V3.2-Exp/blob/main/DeepSeek_V3_2.pdf

@ai_machinelearning_big_data


#DeepSeek #AI #V32 #SparseAttention #LLM
2👍2🤔2
Оксфордские учёные подтвердили худшие опасения: Интернет умирает

Исследователи из Оксфорда выяснили: интернет больше не тот, что раньше:
- В 2020 году ИИ создавал всего 5% контента,
- В 2025 - уже 48%, а к следующему году прогнозируют более 90%.

ИИ-текст стоит очень дешево, человеческий труд - от $10 до $100 за статью.

Рынок выбрал скорость и дешевизну.

Но настоящая проблема -**«model collapse»**:
когда нейросети обучаются на тексте, созданном другими нейросетями.

Это как ксерить ксерокопию - каждое поколение теряет детали и оригинальные идеи.

Мир превращается в поток однообразного, усреднённого контента.

ИИ сегодня создаёт “цифровую кашу”, а завтра будет учиться уже на ней. И каждый новый виток делает интернет чуть глупее.

#AI #Oxford #ModelCollapse #Internet #AIGeneratedContent #LLM #AIEthics #DigitalDecay
😢62😁9👍8🫡42
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Одна из самых наглядных визуализаций механизма внимания - темы, которую многим разработчикам долго было трудно по-настоящему понять.

На первый взгляд формула кажется простой -
её легко выучить и даже воспроизвести по памяти.

Но разобраться интуитивно, как взаимодействуют Q (Query), K (Key) и V (Value), - совсем другое дело. Именно это видео или схема помогает «увидеть», что происходит внутри трансформера.

#machinelearning #deeplearning #transformers #attention #LLM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥23👍118
Forwarded from Machinelearning
🖥 NVIDIA представила новое открытое семейство моделей Nemotron 3

✔️ Nemotron 3 Nano - это универсальная модель для рассуждений и чата, ориентированная на локальный запуск.

Ключевые характеристики:
- MoE-архитектура: 30B параметров всего, ~3.5B активных
- Контекст до 1 миллиона токенов
- Гибридная архитектура:
- 23 слоя Mamba-2 + MoE
- 6 attention-слоёв
- Баланс между скоростью и качеством рассуждений

Требования:
- необходимо около 24 ГБ видеопамяти для локального запуска

Модель хорошо подходит для длинных диалогов, анализа документов и reasoning-задач

Интересный пример того, как MoE и Mamba начинают реально снижать требования к железу, сохраняя масштаб контекста и качество.

✔️ Nemotron 3 Super и Nemotron 3 Ultra значительно превосходят Nano по масштабу - примерно в 4 раза и 16 раз соответственно. Но ключевой момент здесь не просто в размере моделей, а в том, как NVIDIA удалось увеличить мощность без пропорционального роста стоимости инференса.

Для обучения Super и Ultra используется NVFP4 и новая архитектура Latent Mixture of Experts. Она позволяет задействовать в четыре раза больше экспертов при той же стоимости инференса. По сути, модель становится «умнее» за счёт более гибкого выбора экспертов, а не за счёт постоянной активации всех параметров.

Дополнительно применяется Multi-Token Prediction, что ускоряет обучение и улучшает качество рассуждений на длинных последовательностях. Это особенно важно для agentic и multi-agent сценариев, где модели работают с длинным контекстом и сложными цепочками решений.

NVIDIA публикует не только веса, но и данные для предобучения и постобучения, а также технические детали, которые объясняют, почему эти модели одновременно быстрые и сильные.

Такой уровень открытости - редкость для моделей этого масштаба и хороший сигнал для индустрии.

🟡Release: https://developer.nvidia.com/blog/inside-nvidia-nemotron-3-techniques-tools-and-data-that-make-it-efficient-and-accurate/
🟡Guide: https://docs.unsloth.ai/models/nemotron-3
🟡GGUF: https://huggingface.co/unsloth/Nemotron-3-Nano-30B-A3B-GGUF
🟡lmstudio: https://lmstudio.ai/models/nemotron-3

@ai_machinelearning_big_data


#AI #LLM #NVIDIA #Nemotron3 #OpenSource #MachineLearning
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥96👍5
🎉 MiMo-V2-Flash - бесплатный API доступен на ModelScope

Первый крупный релиз Xiaomi после прихода Fuli Luo — и сразу ставка на реальные agentic-сценарии, а не «лабораторные» демо.

MiMo-V2-Flash - открытая высокопроизводительная MoE-модель:
- 309B параметров всего / 15B активных
- Контекст 256K токенов
- 150+ токенов в секунду благодаря нативному Multi-Token Prediction

🔥 Ключевые преимущества для разработчиков:
- Гибридное внимание (5:1 SWA + Global)
→ в 6 раз меньше KV-кэша без потери длинного контекста
- 73.4% на SWE-Bench Verified — новый SOTA среди open-source моделей
- Качество рассуждений на уровне DeepSeek-V3.2, но заметно выше скорость в реальных задачах

API-ready
Отлично подходит для:
- агентных систем
- длинных reasoning-пайплайнов
- быстрых и отзывчивых AI-ассистентов

Модель доступна на ModelScope:
https://modelscope.cn/models/XiaomiMiMo/MiMo-V2-Flash

#AI #LLM #MoE #OpenSource #AgenticAI #Xiaomi #ModelScope
12👍5🥰2🤣2
Forwarded from Machinelearning
🌟 NVIDIA KVzap: жмем KV-кэш в 4 раза.

Все любят длинный контекст, но для GPU это больно - KV-кэш растет линейно и быстро сжирает VRAM. Например, для Llama-65B на 128k токенов кэш весит 335 ГБ. Существующие методы прунинга либо медленные, либо тупые и режут важное, либо требуют переобучения модели.

NVIDIA предложили метод KVzap, который решает, какие токены можно забыть, глядя только на текущие хидден-стэйты.

🟡Логика метода разбита на 2 этапа:

Поиск идеала (KVzip+).
Берется медленный, но точный метод KVzip: модели скармливают текст, заставляют его повторить, и смотрят, на какие прошлые токены она реально обращает внимание. Это золотой стандарт важности токена. Но в проде так делать нельзя, это двойная работа.

Аппроксимация (KVzap).
Тут и происходит вся суть: крошечная модель-суррогат смотрит на входящий хидден-стэйт токена и предсказывает, насколько этот токен будет важен в будущем, то есть пытается угадать скор KVzip.

Модели 2-х видов:

KVzap-Linear: простейшая линейная проекция (одна матрица). Она берет хиден-стэйт и тупо проецирует его в скалярный скор важности. Сложность: экстремально низкая (~0.02%).

KVzap-MLP: двухслойный перцептрон. Внутри есть скрытый слой размером 1/8 от размерности модели и нелинейная активация. Сложность: низкая, но выше линейной (~1.1%).


🟡Все вместе это работает так

Токен залетает в слой трансформера, модель-суррогат быстро считает его скор важности. Если он ниже порога - токен в кэш не пишется или удаляется. Но при этом всегда оставляется скользящее окно из последних 128 токенов, чтобы не терять локальный контекст, иначе модель сыпется.

🟡Результаты тестов.

Проверяли на Qwen3-8B, Llama-3.1-8B и Qwen3-32B. Спойлер: работает везде.

Удалось выкинуть до 75% KV-кэша, а это сжатие в 4 раза. На бенчмарках RULER (длинный контекст), LongBench и AIME25 падение метрик или нулевое, или меньше 1%. Оверхед от суррогатной модели мизерный - менее 1% FLOPs.

🟡Звучит, конечно, как гем, но давайте про минусы:

🟠Нужно дообучить этот маленький MLP для каждого слоя целевой модели. Датасет нужен, но процесс быстрый.

🟠Удаление токенов создает рваный кэш. У разных голов будет разное количество сохраненных токенов.

Это плохо, потому что стандартные ядра Paged Attention любят структуру. Чтобы реально получить ускорение, а не только экономию памяти, нужно писать кастомные CUDA-ядра, которые смогут эффективно жевать блоки переменной длины.


🟠Порог отсечения фиксированный. Если промахнуться с ним, то модель начнет галлюцинировать или забудет начало.

🟡По итогу, KVzap - крутой шаг к тому, чтобы гонять длинные контексты на GPU попроще.

Метод умнее, чем Streaming LLM, и быстрее, чем полные методы разреженного внимания.

Ждем интеграции в vLLM или TRT-LLM, а пока, чтобы скрасить ожидание, NVIDIA собрала на HF интерактивный лидерборд популярных методик компрессии KV-кэша.

Код и веса моделей-суррогатов из тестов пейпера в открытом доступе, так что нет никаких ограничений, чтобы не покрутить KVzap на каком-нибудь тестовом сетапе.



@ai_machinelearning_big_data

#AI #ML #LLM #KVZAP #NVIDIA
Please open Telegram to view this post
VIEW IN TELEGRAM
7👍6🔥4
🚀 Qianfan-OCR - end-to-end модель на 4B параметров для работы с документами.

Главная идея - одна модель вместо целого пайплайна.

Что умеет:

📄 Парсинг документов в один проход
Без разбиения на OCR → post-processing → extraction.
Модель сразу выдаёт структурированный результат.

📊 Таблицы
Корректно извлекает структуру таблиц, строки и значения.

🧮 Формулы
Распознаёт математические выражения и приводит их к читаемому виду.

📈 Графики и диаграммы
Понимает визуальные данные и извлекает из них смысл.

🔍 Key information extraction
Автоматически достаёт ключевые поля: суммы, даты, названия и т.д.

Почему это важно:
Раньше для этого требовался сложный стек:
OCR → layout detection → table parser → rule-based extraction.

Теперь всё это заменяется одной моделью, которая делает всё сразу.

Фактически это шаг к системам, которые могут понимать документы так же, как человек.

#AI #OCR #LLM #MachineLearning

🎯Полезные Мл-ресурсы 🚀 Max

@machinelearning_interview
13👍6🥰1
This media is not supported in your browser
VIEW IN TELEGRAM
🚀 $100 БЕСПЛАТНО НА API CLAUDE? Появился единый хаб с токенами

Tabitoken раздаёт бесплатный баланс для работы с AI-моделями.

Что доступно:

🔥 Claude Opus 4.8
🔥 Opus 5
🔥 Thinking-модели

Главное:

• оплата идёт за токены, а не за количество запросов;
• Opus 4.8 — примерно $1 за 1M входных токенов и $5 за 1M выходных;
• Opus 5 — около $3 за 1M токенов на вход и выход;
• поддержка API OpenAI, Claude и Gemini;
• ключ можно подключить к привычным AI-клиентам.

Как получить:

1️⃣ Регистрируемся:
https://tabitoken.com/

2️⃣ Забираем бесплатный баланс $100

3️⃣ Получаем API-ключ

4️⃣ Подключаем к своему клиенту

Можно тестировать мощные модели без покупки подписки.

Забирайте, пока доступно.

#AI #Claude #LLM #MachineLearning
💊6👍54🔥2
🧠 Новый большой обзор по self-evolving AI-агентам: как понять, что агент действительно стал лучше после изменения самого себя?

Авторы работы *Diving into Reliable Self-Evolving Agents* систематизировали исследования по агентам, которые умеют менять собственные промпты, память, инструменты, стратегии и даже части архитектуры.

Внутри сразу несколько полезных вещей:

* taxonomy уровней эволюции от L0 до L4;
* reliability ladder для проверки того, можно ли доверять очередному self-update;
* открытый каталог из 549 работ по теме;
* разбор того, какие доказательства вообще нужны, чтобы считать новую версию агента лучше предыдущей.

Особенно важный принцип:

обновление не должно само контролировать единственное доказательство собственной успешности.

Если агент изменил себя, а затем сам же решил, что стал лучше, это почти ничего не доказывает. Нужна независимая проверка: внешние evals, отдельный verifier, контрольные среды или другие механизмы, которые сам update не может подменить.


📄 Paper: https://openreview.net/forum?id=CGO1hDTHNe
🌐 Project: https://wkqdzkd.github.io/Awesome-Reliable-Self-Evolving-Agents/
💻 GitHub: github.com/wkqdzkd/Awesome-Reliable-Self-Evolving-Agents

#AI #Agents #SelfEvolvingAgents #LLM #Research
🔥7👍65
🔥 Kimi K3 на 2,78 ТРИЛЛИОНА параметров запустили на CPU с 8 ГБ RAM. Без GPU, BLAS и фреймворков

Проект kimi-k3-in-c реализует inference Kimi K3 практически с нуля на portable C99. Чекпоинт модели занимает 1,56 ТБ, но пик RAM при запуске составил всего 8,24 ГБ.

Фокус в MoE и стриминге весов. Из 896 экспертов на токен выбираются только 16, а остальные веса не обязаны постоянно лежать в оперативной памяти. Огромная часть модели читается прямо с диска, поверх этого работает LRU-кэш экспертов.

Цена такого трюка очевидна: скорость. При 8 ГБ RAM автор получил около 26,5 секунды на токен, при 64 ГБ уже 19,8 секунды, а на машине с 128+ ГБ, где нужные данные помещаются в память, около 5,6 секунды.

Получается любопытная смена ограничения: гигантскую MoE уже можно заставить работать без серверной фермы. Вопрос теперь скорее в том, сколько диска и времени на токен вы готовы отдать за такой inference.

github.com/FareedKhan-dev/kimi-k3-in-c

#AI #Kimi #LLM #C #LocalAI
🔥2985👍1🗿1