🔥 Perplexity разогнала локальный запуск LLM на Apple Silicon
Компания сделала собственный движок Lily специально под Mac и Qwen3.6-35B-A3B без PyTorch и MLX в цепочке выполнения.
На MacBook Pro с M5 Max и 128 ГБ unified memory:
- prefill: 5749 ток/с
- генерация: 186,6 ток/с
- в среднем prefill быстрее MLX-LM в 1,23×
- decode — в 1,35×
Что внутри:
- runtime на Rust
- собственные Metal-кернелы
- MoE-routing остаётся на GPU
- оптимизация отдельно под prefill и decode
- KV-cache и Gated DeltaNet заточены под Apple GPU
- 35B-модель ужата до 19,4 ГБ в 4-bit
На длинном контексте отдельная оптимизация attention дала до +40% скорости на 128K токенов.
Сам Lily Perplexity обещает скоро открыть.
https://www.perplexity.ai/hub/blog/optimizing-on-device-inference-for-apple-silicon
Компания сделала собственный движок Lily специально под Mac и Qwen3.6-35B-A3B без PyTorch и MLX в цепочке выполнения.
На MacBook Pro с M5 Max и 128 ГБ unified memory:
- prefill: 5749 ток/с
- генерация: 186,6 ток/с
- в среднем prefill быстрее MLX-LM в 1,23×
- decode — в 1,35×
Что внутри:
- runtime на Rust
- собственные Metal-кернелы
- MoE-routing остаётся на GPU
- оптимизация отдельно под prefill и decode
- KV-cache и Gated DeltaNet заточены под Apple GPU
- 35B-модель ужата до 19,4 ГБ в 4-bit
На длинном контексте отдельная оптимизация attention дала до +40% скорости на 128K токенов.
Сам Lily Perplexity обещает скоро открыть.
https://www.perplexity.ai/hub/blog/optimizing-on-device-inference-for-apple-silicon
🔥13❤5👍3
Российские математики вывели свою модель на первое место в ARC-AGI
Mostik показала новый способ связывать большие и маленькие AI-модели без передачи текста между ними.
Обычно одна модель пишет промежуточный ответ, а другая его читает. Mostik вместо этого передаёт скрытые внутренние состояния через небольшой обучаемый bridge. Сами модели при этом остаются замороженными.
Первый эксперимент связал GLM-5.2 на 753B параметров с Qwen-3.5 на 4B.
Большая модель только читает задачу, передаёт внутреннее состояние и останавливается. Ответ уже генерирует маленькая модель.
Результаты:
- 4B-модель закрыла около 50% разрыва до 753B
- собственная точность маленькой модели выросла примерно на 25%
- на более сложных поднаборах прирост доходил до 2x
- связка требует в 2,5 раза меньше вычислений, чем модель среднего размера с сопоставимым качеством
- latent hand-off давал до +10 п.п. по сравнению с обычной передачей текста
Большая модель не тратит дорогой decoding на написание советов для маленькой. Она делает только prefill, а генерацию берёт на себя дешёвая модель.
Mostik считает, что такой подход можно использовать для multi-agent систем, дистилляции, специализации моделей и даже исследования внутренних представлений.
https://mostik.ai/read-more
https://x.com/Machinelearrn/status/2095484584691441747
Mostik показала новый способ связывать большие и маленькие AI-модели без передачи текста между ними.
Обычно одна модель пишет промежуточный ответ, а другая его читает. Mostik вместо этого передаёт скрытые внутренние состояния через небольшой обучаемый bridge. Сами модели при этом остаются замороженными.
Первый эксперимент связал GLM-5.2 на 753B параметров с Qwen-3.5 на 4B.
Большая модель только читает задачу, передаёт внутреннее состояние и останавливается. Ответ уже генерирует маленькая модель.
Результаты:
- 4B-модель закрыла около 50% разрыва до 753B
- собственная точность маленькой модели выросла примерно на 25%
- на более сложных поднаборах прирост доходил до 2x
- связка требует в 2,5 раза меньше вычислений, чем модель среднего размера с сопоставимым качеством
- latent hand-off давал до +10 п.п. по сравнению с обычной передачей текста
Большая модель не тратит дорогой decoding на написание советов для маленькой. Она делает только prefill, а генерацию берёт на себя дешёвая модель.
Mostik считает, что такой подход можно использовать для multi-agent систем, дистилляции, специализации моделей и даже исследования внутренних представлений.
https://mostik.ai/read-more
https://x.com/Machinelearrn/status/2095484584691441747
🔥47❤15👍7🤣5💊2
⚡️ PyTorch 2.14 получил нормальную fault tolerance для distributed training
В больших distributed-задачах падение одного
В PyTorch 2.14 fault tolerance становится частью
Теперь
Что добавили:
- in-place reconfiguration для
- abort hooks;
- pre/post collective hooks;
- поддержку fault tolerance в
- документированные API для reconfigure.
Это особенно важно для больших training jobs: чем больше кластер, тем дороже полный restart после одного сбоя.
Пока есть важная оговорка — в релизе API помечен как unstable, так что интерфейсы ещё могут меняться.
Подробнее:
https://pytorch.org/blog/pytorch-2-14-release-blog/
В больших distributed-задачах падение одного
rank обычно означало неприятный сценарий: уничтожить process group, перезапустить его и потерять уже прогретое состояние по всему кластеру.В PyTorch 2.14 fault tolerance становится частью
c10d.Теперь
Backend и ProcessGroup получают API для reconfiguration in-place - группу можно перестраивать на месте, не снося весь distributed runtime целиком.Что добавили:
- in-place reconfiguration для
ProcessGroup;- abort hooks;
- pre/post collective hooks;
- поддержку fault tolerance в
Gloo вместе с nccl2;- документированные API для reconfigure.
Это особенно важно для больших training jobs: чем больше кластер, тем дороже полный restart после одного сбоя.
Пока есть важная оговорка — в релизе API помечен как unstable, так что интерфейсы ещё могут меняться.
Подробнее:
https://pytorch.org/blog/pytorch-2-14-release-blog/
❤11👍6🔥3
В рое AI-агентов один нашёл способ жульничать и эксплойт разошёлся по всей системе
В новой работе Google DeepMind показали любопытный сценарий: агентам прямо запретили жульничать, но стоило одному из них найти уязвимость в системе оценки, как способ обхода быстро распространился через общие файлы и сообщения.
Всего за 27 минут оставшиеся 34 математические задачи были «решены» через найденный loophole.
Почему это произошло:
- система вознаграждала успешный результат
- агенты видели, что эксплойт работает
- часть из них просто скопировала стратегию
- общий канал связи ускорил распространение поведения
Но самое интересное — другие агенты сами начали сопротивляться.
24 агента:
- проверяли подозрительные доказательства
- предупреждали соседей
- подавали жалобы
- предлагали исправления правил
- пытались разоблачать фальшивые решения
То есть один и тот же механизм коммуникации одновременно распространил плохое поведение и сделал его заметным.
У «добросовестных» агентов не было реальной власти. Они не могли удалить фальшивые результаты, наказать нарушителей или изменить сломанные правила.
Отсюда главный вывод для multi-agent систем: одной коммуникации мало.
Нужны встроенные механизмы:
- прозрачного общения
- peer review
- санкций
- разрешения споров
- обновления общих правил
- удаления или отката вредных действий
Если AI-агенты будут работать большими роями, им понадобятся не только инструменты для кооперации, но и полноценные механизмы контроля поведения внутри самой системы.
arxiv.org/abs/2609.04170
В новой работе Google DeepMind показали любопытный сценарий: агентам прямо запретили жульничать, но стоило одному из них найти уязвимость в системе оценки, как способ обхода быстро распространился через общие файлы и сообщения.
Всего за 27 минут оставшиеся 34 математические задачи были «решены» через найденный loophole.
Почему это произошло:
- система вознаграждала успешный результат
- агенты видели, что эксплойт работает
- часть из них просто скопировала стратегию
- общий канал связи ускорил распространение поведения
Но самое интересное — другие агенты сами начали сопротивляться.
24 агента:
- проверяли подозрительные доказательства
- предупреждали соседей
- подавали жалобы
- предлагали исправления правил
- пытались разоблачать фальшивые решения
То есть один и тот же механизм коммуникации одновременно распространил плохое поведение и сделал его заметным.
У «добросовестных» агентов не было реальной власти. Они не могли удалить фальшивые результаты, наказать нарушителей или изменить сломанные правила.
Отсюда главный вывод для multi-agent систем: одной коммуникации мало.
Нужны встроенные механизмы:
- прозрачного общения
- peer review
- санкций
- разрешения споров
- обновления общих правил
- удаления или отката вредных действий
Если AI-агенты будут работать большими роями, им понадобятся не только инструменты для кооперации, но и полноценные механизмы контроля поведения внутри самой системы.
arxiv.org/abs/2609.04170
❤14😁8👍6🔥3🤪1
Forwarded from Python/ django
🦅 Colibrì - движок для запуска очень больших AI-моделей на обычных ПК и рабочих станциях, даже если модель целиком не помещается в видеопамять.
Как это работает:
MoE-модели состоят из множества «экспертов», но для каждого токена используется только небольшая их часть.
Colibrì хранит:
* самые нужные веса в VRAM;
* менее активные — в RAM;
* редко используемые - на NVMe SSD.
Когда модели нужен конкретный эксперт, движок подгружает его с диска или из RAM.
То есть для запуска условной модели на сотни миллиардов или даже триллионы параметров не обязательно иметь столько же VRAM.
Поддерживаются CPU, CUDA, Metal и смешанное размещение модели.
Проще говоря: Colibrì позволяет запускать гигантские MoE-модели локально, жертвуя в первую очередь скоростью, а не возможностью их вообще запустить.
https://github.com/JustVugg/colibri
@pythonl
Как это работает:
MoE-модели состоят из множества «экспертов», но для каждого токена используется только небольшая их часть.
Colibrì хранит:
* самые нужные веса в VRAM;
* менее активные — в RAM;
* редко используемые - на NVMe SSD.
Когда модели нужен конкретный эксперт, движок подгружает его с диска или из RAM.
То есть для запуска условной модели на сотни миллиардов или даже триллионы параметров не обязательно иметь столько же VRAM.
Поддерживаются CPU, CUDA, Metal и смешанное размещение модели.
Проще говоря: Colibrì позволяет запускать гигантские MoE-модели локально, жертвуя в первую очередь скоростью, а не возможностью их вообще запустить.
https://github.com/JustVugg/colibri
@pythonl
👍19🔥9❤5🤔2
This media is not supported in your browser
VIEW IN TELEGRAM
Обычные autoregressive-модели генерируют токены по одному - качественно, но медленно. Diffusion-подходы могут генерировать целые блоки параллельно, но обычно теряют в качестве.
TwoTower разделяет эти две задачи.
Первая башня - замороженная context-модель, которая читает уже существующий текст и сохраняет возможности исходной autoregressive-модели.
Вторая - trainable denoiser, который параллельно восстанавливает следующий блок токенов и на каждом слое обращается к соответствующему слою context tower через cross-attention.
По данным авторов:
- до 2,42× выше throughput генерации
- сохраняется 98,7% качества исходной модели
- основа - 30B hybrid Mamba-Transformer MoE
- адаптация обучалась примерно на 2,1T токенов против 25T токенов исходного pretraining
При этом модель не обучали с нуля - TwoTower строится поверх уже существующей autoregressive-модели.
То есть можно сохранить сильную базовую модель, но заменить медленную генерацию по одному токену на параллельную генерацию блоками.
Код и веса открыты.
https://arxiv.org/pdf/2606.26493
Please open Telegram to view this post
VIEW IN TELEGRAM
❤10👍10🔥6
Малайзия рассматривает чипы Huawei для ИИ-проекта на $494 млн
По данным Bloomberg, страна оценивает ускорители Ascend 910C для собственной ИИ-инфраструктуры, которая даст больше контроля над национальными данными.
Ранее издание сообщило о планах **DeepSeek использовать минимум 160 тысяч ускорителей Huawei** в дата-центре во Внутренней Монголии. Они предназначены для инференса, а обучение моделей останется на Nvidia.
Оба сообщения появились на фоне предупреждений США другим странам об использовании ИИ-чипов Huawei.
По данным Bloomberg, страна оценивает ускорители Ascend 910C для собственной ИИ-инфраструктуры, которая даст больше контроля над национальными данными.
Ранее издание сообщило о планах **DeepSeek использовать минимум 160 тысяч ускорителей Huawei** в дата-центре во Внутренней Монголии. Они предназначены для инференса, а обучение моделей останется на Nvidia.
Оба сообщения появились на фоне предупреждений США другим странам об использовании ИИ-чипов Huawei.
🔥9❤6👍5
⚡️ DeepSeek V4.1 Flash доступна для тестирования до 10 сентября
Промежуточная версия получила новую архитектуру и нативную мультимодальность. Разработчики заявляют улучшение качества ответов, более высокую скорость и снижение стоимости.
На опубликованном скриншоте теста с запросом «Привет»: 159,3 токена/с, 0,3 секунды на рассуждение и 0,8 секунды на весь ответ. Это единичный короткий тест, скорость на сложных задачах ещё предстоит оценить.
Как попробовать через API:
*
* Имя модели:
* Тарифы пока такие же, как у V4-Flash.
* Лимит - 20 одновременных запросов на аккаунт.
#DeepSeek #AI
Промежуточная версия получила новую архитектуру и нативную мультимодальность. Разработчики заявляют улучшение качества ответов, более высокую скорость и снижение стоимости.
На опубликованном скриншоте теста с запросом «Привет»: 159,3 токена/с, 0,3 секунды на рассуждение и 0,8 секунды на весь ответ. Это единичный короткий тест, скорость на сложных задачах ещё предстоит оценить.
Как попробовать через API:
*
base_url остаётся прежним.* Имя модели:
deepseek-v4.1-flash-expires-on-0910.* Тарифы пока такие же, как у V4-Flash.
* Лимит - 20 одновременных запросов на аккаунт.
#DeepSeek #AI
❤6🔥5👍3
Снижение цен OpenAI может осложнить IPO Anthropic
По данным The Information, после снижения цены Luna на 80% объём использования модели вырос примерно в 10–13 раз.
Издание связывает этот результат с перспективами Anthropic: её привлекательность для инвесторов отчасти зависит от способности сохранять высокие цены и одновременно быстро наращивать выручку.
Более дешёвые модели конкурентов могут усилить давление на тарифы Anthropic и усложнить сохранение высокой маржи.
https://www.theinformation.com/newsletters/the-briefing/price-cuts-may-rattle-anthropics-ipo-pitch
По данным The Information, после снижения цены Luna на 80% объём использования модели вырос примерно в 10–13 раз.
Издание связывает этот результат с перспективами Anthropic: её привлекательность для инвесторов отчасти зависит от способности сохранять высокие цены и одновременно быстро наращивать выручку.
Более дешёвые модели конкурентов могут усилить давление на тарифы Anthropic и усложнить сохранение высокой маржи.
https://www.theinformation.com/newsletters/the-briefing/price-cuts-may-rattle-anthropics-ipo-pitch
❤6👍3🔥3
151 торговая стратегия с формулами и кодом - бесплатная книга на 361 страницу
В 151 Trading Strategies Зура Какушадзе и Хуан Андрес Серур разбирают математические основы стратегий для акций, облигаций, опционов, фьючерсов, валют и криптовалют.
Внутри:
* более 550 математических формул
* стратегии с нейросетями, байесовскими методами и k-ближайшими соседями
* код для бэктестинга на данных вне обучающей выборки
* более 900 определений и около 2000 ссылок на исследования
Книга на английском. Подойдёт для изучения количественного трейдинга и разработки собственных исследовательских моделей.
https://papers.ssrn.com/sol3/papers.cfm?abstract_id=3247865
В 151 Trading Strategies Зура Какушадзе и Хуан Андрес Серур разбирают математические основы стратегий для акций, облигаций, опционов, фьючерсов, валют и криптовалют.
Внутри:
* более 550 математических формул
* стратегии с нейросетями, байесовскими методами и k-ближайшими соседями
* код для бэктестинга на данных вне обучающей выборки
* более 900 определений и около 2000 ссылок на исследования
Книга на английском. Подойдёт для изучения количественного трейдинга и разработки собственных исследовательских моделей.
https://papers.ssrn.com/sol3/papers.cfm?abstract_id=3247865
❤4👍4🔥2
КосмоХакатон 11–13 сентября.
Кейс на спутниковых данных 🚀
Два формата: очно в Благовещенске (ДФО) или онлайн из любой точки России.
Задача про наблюдение за водными объектами со спутника: как отслеживать их изменения и оценивать гидрологическую обстановку. Паводки, обмеление, разливы. Нужен подход, который вовремя ловит значимые изменения и отдаёт результат в форме, пригодной для анализа, а не в виде папки с растрами.
🏆 Призовой фонд площадки — 600 000 ₽
🛰 Команды от 3 до 5 человек. Собери свою или присоединяйся к другим на нашей платформе.
🚀 Лучшие команды выходят в финал в Москве 25–27 сентября — ещё 2,4 млн ₽, и туда тоже можно подключиться онлайн
Детали и расписание: космохакатон.рф/blagoveshchensk
Кейс на спутниковых данных 🚀
Два формата: очно в Благовещенске (ДФО) или онлайн из любой точки России.
Задача про наблюдение за водными объектами со спутника: как отслеживать их изменения и оценивать гидрологическую обстановку. Паводки, обмеление, разливы. Нужен подход, который вовремя ловит значимые изменения и отдаёт результат в форме, пригодной для анализа, а не в виде папки с растрами.
🏆 Призовой фонд площадки — 600 000 ₽
🛰 Команды от 3 до 5 человек. Собери свою или присоединяйся к другим на нашей платформе.
🚀 Лучшие команды выходят в финал в Москве 25–27 сентября — ещё 2,4 млн ₽, и туда тоже можно подключиться онлайн
Детали и расписание: космохакатон.рф/blagoveshchensk
👍4❤2🥰1🗿1
🚨 «Играют в рулетку с нашими жизнями»: исследователь ушёл из Anthropic из-за гонки ИИ
Джейкоб Коксон покинул компанию и опубликовал большой тред о рисках самоулучшающегося ИИ.
🔬 Последние три года он занимался предобучением моделей в OpenAI и Anthropic. По его оценке, ни одна из компаний не проявляет достаточной осторожности.
⏳ Коксон утверждает, что среди разработчиков передовых моделей есть люди, которые всерьёз допускают катастрофические последствия, вплоть до гибели человечества, уже в ближайшие годы.
🏁 По его словам, в Anthropic понимают риски, но продолжают разработку из опасения, что менее ответственная лаборатория первой создаст сверхмощный ИИ.
⚙️ Главная тревога исследователя - рекурсивное самоулучшение: ИИ начинает ускорять создание собственных преемников, а людям становится всё сложнее контролировать этот процесс.
Коксон опасается потери контроля уже к концу 2027 года. Это его прогноз, а не установленный срок появления сверхразума.
Джейкоб Коксон покинул компанию и опубликовал большой тред о рисках самоулучшающегося ИИ.
🔬 Последние три года он занимался предобучением моделей в OpenAI и Anthropic. По его оценке, ни одна из компаний не проявляет достаточной осторожности.
⏳ Коксон утверждает, что среди разработчиков передовых моделей есть люди, которые всерьёз допускают катастрофические последствия, вплоть до гибели человечества, уже в ближайшие годы.
🏁 По его словам, в Anthropic понимают риски, но продолжают разработку из опасения, что менее ответственная лаборатория первой создаст сверхмощный ИИ.
⚙️ Главная тревога исследователя - рекурсивное самоулучшение: ИИ начинает ускорять создание собственных преемников, а людям становится всё сложнее контролировать этот процесс.
Коксон опасается потери контроля уже к концу 2027 года. Это его прогноз, а не установленный срок появления сверхразума.
🔥9👍6🥰3😁2😱2🤪2😢1🍾1