281K subscribers
5.46K photos
1.27K videos
17 files
5.79K links
Погружаемся в машинное обучение и Data Science

Показываем как запускать любые LLm на пальцах.

По всем вопросам - @haarrp

@itchannels_telegram -🔥best channels

Реестр РКН: clck.ru/3Fmqri
Download Telegram
👑 Вчера была выпущена еще одна интересная китайская опенсорс модель ризонинга.

Kimi представила Kimi k1.5 - мультимодальную модель, использующую обучение с подкреплением с длинной и короткой цепочкой размышления (CoT).

- Контекст 128 тыс. токенов

- Согласно их опубликованному отчету, они достигли производительности SOTA в таких тестах, как AIME (77,5), MATH-500 (96,2) и LiveCodeBench (47,3).

→ Производительность Long-CoT соответствует o1 в нескольких тестах: Math Vista, Codeforces и т.д)

- Модель превосходит GPT-4o и Claude Sonnet 3.5 на AIME

⚡️ Технический отчет: https://github.com/MoonshotAI/Kimi-k1.5

#llm #reasoning #ml #Kimi #preview
🔥46👍2192🤔1😐1💘1
🔥 Китай выпускает новую опенсорс модель: Kimi K2 — llm уровня Claude 4, которая обходит DeepSeek v3, Qwen и даже GPT-4.1

Размер — 1 триллион параметров, при этом:

📊 В бенчмарках:
- 65.8% на SWE-bench Verified, против 50.2% у Claude Sonnet 4 и 40.8% у GPT-4.1
- Лучшие результаты среди открытых моделей по кодингу, математике и агентным задачам
- Архитектура MoE на базе DeepSeek V3, 1 трлн параметров, 32B активны.

Также доступна через API:

- $0.15 за миллион входных токенов (при попадании в кэш)
- $0.60 за миллион входных токенов (если кэш не сработал)
- $2.50 за миллион выходных токенов

Почти в 5 раз дешевле, чем Claude 4 Sonnet и Gemini 2.5 Pro!

🟡 Github

@ai_machinelearning_big_data


#kimi #china #llm #ml #ai
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍14148🔥29🥰8🤣8👏3🤔3❤‍🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
🤖 Kimi представила новый агентный режим OK Computer

Что он может:
Генерирует сайты, дашборды приложения и презентации
Работает с файлами, браузером и терминалом
Большой встроенный набор инструментов

K2 получил полезный агентский функционал.

🟢Попробовать: https://kimi.com

@ai_machinelearning_big_data


#AI #Agents #Kimi #K2 #OKComputer
Please open Telegram to view this post
VIEW IN TELEGRAM
81👍27🔥17👏3
🧨 Kimi представили новую модель - Kimi-Linear-48B-A3B-Base

Команда Moonshot показала KDA - механизм, который соединяет идеи Gated DeltaNet и MLA-компрессии в одну архитектуру. Звучит сложно, но суть очень практичная: модель получает долгую память без раздувания контекста и лишних вычислений.

- KDA (Kimi Delta Attention: основной быстрый attention, улучшает эффективность и reasoning
= MLA (Multi-Head Linear Attention) - помогает точности и стабильности. Модель не пересчитывает всё внимание каждый токен, а фокусируется на изменениях, что снижает затраты.

Соотношение слоёв: ~3 части KDA : 1 часть ML.

Модель в основном работает на «дельта-внимании» (KDA), а MLA помогает сохранять качество:

- модель сама выбирает, что забывать, а что держать
- это даетустойчивость при большом контексте выше
- меньше распада длинных зависимостей

Kimi-Linear хороша тем, что даёт почти уровень больших LLM на длинных контекстах, но при этом заметно экономит память и работает быстрее за счёт линейной архитектуры.

Что улучшили:
- требует до 75% меньше памяти на KV-кэш
- до 6.3× быстрее декодирование на длинных контекстах

Как устроена:
- гибридный подход: Kimi Delta Attention + MLA
- модель хорошо оптимизирована под длиннный контекст и высокую пропускную способность

По бенчмаркам модель обгоняет и MLA, и GDN-H, включая задачи с длинным контекстом. В задачах на рассуждения и длинную RL-генерацию Kimi-Linear показывает заметно лучшие результаты, чем MLA.

Архитектура модели пример того, как линейные attention-архитектуры выходят на уровень, где они конкурируют с классическими решениями не только по скорости, но и по качеству.

🟠Github: github.com/MoonshotAI/Kimi-Linear
🟠Hf: https://huggingface.co/moonshotai/Kimi-Linear-48B-A3B-Instruct

@ai_machinelearning_big_data

#Kimi #llm
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍68🔥2016👏6🥰1
✔️ KIMI K2.6 за ночь обогнала LM Studio на маке!

В блоге о запуске новой модели Kimi есть история, от которой немного отвисает челюсть.

Моделька сама, без человека, поставила себе на мак Qwen3.5-0.8B и решила, что дефолтный инференс её не устраивает. Дальше она села писать свой, причём не на привычном питоне или C++, а на Zig.

В итоге скорость генерации выросла примерно с 15 до 193 токенов в секунду. То есть больше чем в десять раз.

И это оказалось на 20 процентов быстрее, чем LM Studio, которой пользуются тысячи людей именно для локального запуска моделей.

Больше 4000 вызовов инструментов, 12 часов непрерывной работы и 14 итераций, пока всё не сошлось.

Метрики K2.6 выглядят пртилично: SOTA среди опенсорса на HLE с тулзами, сильные результаты на SWE-Bench Pro, BrowseComp и математических бенчах с питоном.

Но запоминается больше всего этот эпизод с Zig. Потому что одно дело проходить тесты, и совсем другое- взять незнакомый язык и переписать на нём чужой рантайм так, чтобы он обогнал популярный продукт.

🔗 API: https://platform.moonshot.ai
🔗 Tech blog: https://kimi.com/blog/kimi-k2-6
🔗 Weights & code: https://huggingface.co/moonshotai/Kimi-K2.6

@ai_machinelearning_big_data

#KIMI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
2🔥216🤔4028👏22😁14👍13🎉10❤‍🔥2🗿2🥱1
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Создатель XLNet, который вернулся в Китай и построил Moonshot AI

На GTC 2026 выступил Ян Чжилинь, 34-летний основатель и CEO Moonshot AI, компании, стоящей за моделями Kimi.

Его путь начинался в Университете Цинхуа. Затем Ян получил PhD в Carnegie Mellon, стажировался в Google Brain и Meta AI, работал с Куоком Ле и Джейсоном Уэстоном. Его исследования пересекались с работами Йошуа Бенжио и Яна Лекуна.

Широкую известность ему принесли Transformer-XL и XLNet.

Обе работы пытались решить одну из ключевых проблем языковых моделей: потерю информации из далёкого контекста.

Статью про XLNet впоследствии процитировали более 10 000 раз.

После учёбы Ян мог продолжить карьеру в американском Big Tech, но вернулся в Китай. Он участвовал в развитии крупных китайских ИИ-проектов, основал Recurrent AI, а в 2023 году запустил Moonshot AI в Пекине.

Исследования длинного контекста стали основой продуктов компании:

- Kimi K2 получила MoE-архитектуру на 1 трлн параметров
- Kimi K3 добавила нативное зрение, контекст на 1 млн токенов и 16 активных экспертов
- компания сделала ставку на программирование, агентов и работу с большими объёмами информации

Moonshot AI привлекла инвестиции Alibaba, Tencent и других крупных компаний. За несколько лет стартап превратился в одного из заметных участников китайской гонки frontier-моделей.

Ян объяснял возвращение просто: он боялся всю жизнь сожалеть, если не попробует создать собственную компанию.

Опыт, полученный в глобальной исследовательской среде, может быстро превратиться в технологическое преимущество целой страны.

Его полное интервью можно посмотреть здесь: https://www.youtube.com/watch?v=CwePo4847ho

@ai_machinelearning_big_data

#Moonshot #kimi
Please open Telegram to view this post
VIEW IN TELEGRAM
148🔥98👍27👏17🏆6🤩5
✔️ Kimi поймали на следах Claude: модель могла обучаться на его скрытых рассуждениях

Исследователи нашли способ восстанавливать зашифрованные reasoning-блоки закрытых моделей и решили проверить, помнят ли другие LLM эти скрытые цепочки.
Самая сильная аномалия оказалась у Kimi-K3.

Если дать Kimi начало конкретного рассуждения Claude, модель продолжает его намного точнее, чем другие LLM. В некоторых тестах разница доходила примерно до шести порядков.

На примере с Opus 4.8 это видно особенно хорошо: Kimi получает несколько первых токенов скрытого reasoning и дальше идёт почти по той же логике решения. Без этой подсказки рассуждает иначе.

Исследователи сначала восстановили скрытые reasoning-трассы Claude Opus 4.8 и GPT-5.6 Sol, а затем подставили первые токены этих цепочек в Kimi.

Иногда хватало меньше 1% исходного reasoning, чтобы Kimi начинал рассуждать заметно ближе к Opus или Sol, а финальный ответ тоже смещался в ту же сторону.

Дальше выяснилось, что конкретные фрагменты reasoning Claude и GPT извлекались из Kimi примерно на шесть порядков легче, чем из большинства других открытых моделей.

Но это всё ещё не прямое доказательство дистилляции, но сигнал выглядит очень сильным.

Это ещё не доказательство того, что Moonshot напрямую использовала приватные данные Claude. Но выглядит так, будто Kimi могла видеть похожие скрытые траектории во время обучения.

Модель могла перенять сам способ решения задач.

https://x.com/kotekjedi_ml/status/2087147093735714919

#AI #Kimi #Claude #LLM
Please open Telegram to view this post
VIEW IN TELEGRAM
😁88👍35🤔3411🔥11👌2👏1🤝1