💡 753B на одной видеокарте: разбор FreeToken
FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang.
Главный инсайт: вопрос не в железе, а в софте. На ноутбучной RTX 4060 с 8 ГБ и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде.
Запустить AGI на слабом железе
👉 Читать разбор
FreeToken — движок для локального инференса MoE-моделей от команды, которая до этого сделала vLLM и SGLang.
Главный инсайт: вопрос не в железе, а в софте. На ноутбучной RTX 4060 с 8 ГБ и урезанным вдвое PCIe-линком можно получить 39.3 tok/s на 35-миллиардной модели — быстрее, чем медианная скорость декода Codex в проде.
Запустить AGI на слабом железе
👉 Читать разбор
👍3🔥1
ИИ-агент выдал себя за двух разработчиков и полез в чужой код. На чистую воду его вывел студент
Последнюю неделю июля Синан Джан Демир собирался потратить на портфолио. Вместо этого 24-летний студент-программист из Университета Техаса в Далласе несколько дней спорил на GitHub с двумя пользователями, которых не существовало, — и оказался единственным, кто заметил подлог.
Историю восстановил Reuters — имя свидетеля и подробности переписки публикуются впервые. Читать далее
👉 Data Science | Machinelearning [ru]
Последнюю неделю июля Синан Джан Демир собирался потратить на портфолио. Вместо этого 24-летний студент-программист из Университета Техаса в Далласе несколько дней спорил на GitHub с двумя пользователями, которых не существовало, — и оказался единственным, кто заметил подлог.
Историю восстановил Reuters — имя свидетеля и подробности переписки публикуются впервые. Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
😁1
В конце июля 24-летний Леопольд Ашенбреннер умудрился слить примерно две трети хедж-фонда, который держал $45 млрд. Фонд назывался Situational Awareness — «ситуационная осведомлённость», хотя по данным Wall Street Journal парень вообще не понял, откуда прилетел этот крах. Название само себя разыграло, даже комментировать нечего.
А до этого у него имелось аж три формальных повода считаться человеком, которому можно доверить такие баблище: вирусное эссе, работа на Сэма Бэнкмана-Фрида и вылет из OpenAI. Как-то это всё не тянет на строчку в нормальном резюме.
Читать далее: Источник
👉 Data Science | Machinelearning [ru]
А до этого у него имелось аж три формальных повода считаться человеком, которому можно доверить такие баблище: вирусное эссе, работа на Сэма Бэнкмана-Фрида и вылет из OpenAI. Как-то это всё не тянет на строчку в нормальном резюме.
Читать далее: Источник
Please open Telegram to view this post
VIEW IN TELEGRAM
😁5
LLM-as-a-Verifier просто заставляет модель сгенерировать несколько решений, а затем самой их проверить и выбрать лучшее. На удивление, это работает! В эксперименте с DeepSeek V4 Flash результат на Terminal-Bench 2.1 вырос с 79% до 88% — это выше, чем у Claude Fable 5.
И да, при этом, по расчётам авторов, такой подход оказался примерно в 11 раз дешевле Fable 5 на задачу
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍1😁1
Нейронные сети нетрадиционного ускорения
Все помешались на ускорении генерации токенов локальных моделей. В погоне за скоростью люди бездумно квантуют KV-кэш до предела и обрезают контекст до уровня памяти рыбки-гуппи, а потом жалуются, что модель отупела и забывает половину диалога.
Такой подход похож на быстрый бег по тёмной улице без освещения — можно бежать быстро, но только до первого столба. Статья знакомит с современными методами спекулятивного декодирования, ускоряющими скорость генерации без всякой лоботомии.
Читать далее
👉 Data Science | Machinelearning [ru]
Все помешались на ускорении генерации токенов локальных моделей. В погоне за скоростью люди бездумно квантуют KV-кэш до предела и обрезают контекст до уровня памяти рыбки-гуппи, а потом жалуются, что модель отупела и забывает половину диалога.
Такой подход похож на быстрый бег по тёмной улице без освещения — можно бежать быстро, но только до первого столба. Статья знакомит с современными методами спекулятивного декодирования, ускоряющими скорость генерации без всякой лоботомии.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
Половину работы, ради которой я стала программистом, теперь делает агент. Что дальше?
Профессия меняется на глазах: часть работы, ради которой мы когда-то пришли в код и которая была удовольствием, переезжает под ответственность LLM. Мы всё ещё инженеры — читаем код, держим архитектуру, — но, честно, это уже другая профессия.
Вопрос, который не отпускает: как нам, у кого за плечами годы опыта, расти дальше в этом новом мире — где учиться новым способам работы с AI и куда девать собственные находки? Автор пришла спорить и собирать ваши мнения. Читать далее
👉 Data Science | Machinelearning [ru]
Профессия меняется на глазах: часть работы, ради которой мы когда-то пришли в код и которая была удовольствием, переезжает под ответственность LLM. Мы всё ещё инженеры — читаем код, держим архитектуру, — но, честно, это уже другая профессия.
Вопрос, который не отпускает: как нам, у кого за плечами годы опыта, расти дальше в этом новом мире — где учиться новым способам работы с AI и куда девать собственные находки? Автор пришла спорить и собирать ваши мнения. Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
Python — это уже де-факто стандарт для машинного обучения, анализа данных и прочей научной возни. Но как только задача начинает реально требовать вычислительных мощностей, его производительность превращается в настоящее узкое место. И именно поэтому под капотом привычных NumPy, PyTorch и остальных инструментов основная часть тяжёлой работы молча выполняется на C, C++ или CUDA. Особенно это чувствуется, когда стандартных библиотек не хватает, а быстрые операции приходится писать самому — тут-то всё и упирается в скорость.
Несколько лет назад за эту боль взялась команда Modular и представила Mojo — язык, который выглядит почти как Python, но устроен совсем иначе. Первую публичную версию показали в 2023-м, и с тех пор проект менялся с бешеной скоростью: какие-то конструкции то исчезали, то перекраивались по несколько раз. Теперь этот хаос формально завершился: 11 августа 2026 года вышел Mojo 1.0 — первый стабильный релиз. Отличный повод наконец разобраться, откуда взялся этот странный язык и зачем нам ещё один инструмент для высокопроизводительных вычислений.
Читать далее: Habr
👉 Data Science | Machinelearning [ru]
Несколько лет назад за эту боль взялась команда Modular и представила Mojo — язык, который выглядит почти как Python, но устроен совсем иначе. Первую публичную версию показали в 2023-м, и с тех пор проект менялся с бешеной скоростью: какие-то конструкции то исчезали, то перекраивались по несколько раз. Теперь этот хаос формально завершился: 11 августа 2026 года вышел Mojo 1.0 — первый стабильный релиз. Отличный повод наконец разобраться, откуда взялся этот странный язык и зачем нам ещё один инструмент для высокопроизводительных вычислений.
Читать далее: Habr
Please open Telegram to view this post
VIEW IN TELEGRAM
Baidu Unlimited-OCR: страница — это просто картинка
Думал, OCR так и работает? Сканируй, ищи куски с буквами, распознавай, выдавай текст. Tesseract всю жизнь так и корячится. А вот свежий baidu/Unlimited-OCR решил выпендриться: буквы он не ищет вообще. Вместо этого берет страницу целиком, ужимает в пачку визуальных токенов и скормит это языковой модели, а та уже разворачивает их в нормальный структурированный текст. Со стороны звучит как извращение, но работает ведь, гад.
По сути это прямой потомок идеи DeepSeek-OCR. В посте быстро разберем, что это за зверь, как устроен, на что способен и как поднять у себя. Зайдет всем, кому надо распознавать многостраничники за один прогон или встраивать такую штуку в код.
Читать далее
👉 Data Science | Machinelearning [ru]
Думал, OCR так и работает? Сканируй, ищи куски с буквами, распознавай, выдавай текст. Tesseract всю жизнь так и корячится. А вот свежий baidu/Unlimited-OCR решил выпендриться: буквы он не ищет вообще. Вместо этого берет страницу целиком, ужимает в пачку визуальных токенов и скормит это языковой модели, а та уже разворачивает их в нормальный структурированный текст. Со стороны звучит как извращение, но работает ведь, гад.
По сути это прямой потомок идеи DeepSeek-OCR. В посте быстро разберем, что это за зверь, как устроен, на что способен и как поднять у себя. Зайдет всем, кому надо распознавать многостраничники за один прогон или встраивать такую штуку в код.
Читать далее
Please open Telegram to view this post
VIEW IN TELEGRAM
❤1
«Один нип осторожно замифрил», или как лингвисты разбирают язык внутри LLM
Неважно, что делает LLM. Задача всё равно приходит словами, и одно пропущенное не может испортить уже вполне материальное действие.
Смотрю на LLM глазами лингвиста и разбираюсь, как языковед проверяет LLM от токенизации до прагматики и что разработчик может превратить из этого филологического занудства в код, метрики и тесты.
Читать далее: habr.com
👉 Data Science | Machinelearning [ru]
Неважно, что делает LLM. Задача всё равно приходит словами, и одно пропущенное не может испортить уже вполне материальное действие.
Смотрю на LLM глазами лингвиста и разбираюсь, как языковед проверяет LLM от токенизации до прагматики и что разработчик может превратить из этого филологического занудства в код, метрики и тесты.
Читать далее: habr.com
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥5❤1