Лучший промпт не спасёт, если нет процесса
Команда берёт ИИ-агента, пишет хороший промпт, и первые задачи идут гладко. Потом проект вырастает за пределы одного модуля, и начинается: агент делает «что-то похожее», поведение дрейфует от сессии к сессии, дефекты приходят с интеграции. Разработчик тратит на правки больше, чем сэкономил на генерации.
Это не проблема модели. Это отсутствие процесса.
Agentic Agile: подход, который адаптирует Agile под команды с ИИ-агентами. Промпт здесь: задание, не процесс. Бэклог, acceptance criteria и ревью-гейты нужны так же, как и с людьми. CLAUDE.md или AGENTS.md: не README, а интерфейс между человеком и агентом. CI/CD и автотесты: первый тикет, не последний.
Разбор на Tproger — как выстроить это на практике.
@tproger
Читайте также в VK, Max и Дзен
Команда берёт ИИ-агента, пишет хороший промпт, и первые задачи идут гладко. Потом проект вырастает за пределы одного модуля, и начинается: агент делает «что-то похожее», поведение дрейфует от сессии к сессии, дефекты приходят с интеграции. Разработчик тратит на правки больше, чем сэкономил на генерации.
Это не проблема модели. Это отсутствие процесса.
Agentic Agile: подход, который адаптирует Agile под команды с ИИ-агентами. Промпт здесь: задание, не процесс. Бэклог, acceptance criteria и ревью-гейты нужны так же, как и с людьми. CLAUDE.md или AGENTS.md: не README, а интерфейс между человеком и агентом. CI/CD и автотесты: первый тикет, не последний.
Разбор на Tproger — как выстроить это на практике.
@tproger
Читайте также в VK, Max и Дзен
🤣8😁3🐳3👾3😱2🍾2🤩1👌1😇1🎅1🙊1
8-битный веб-сервер на ретро-процессоре
Энтузиаст собрал HTTP-сервер, работающий на 8-битном процессоре — буквально живой веб на железе, которое старше большинства фронтенд-фреймворков. Никаких ESP32, никаких микро-Linux: только голый MCU, ручной TCP/IP-стек и HTML, прошитый в EEPROM.
Стек переписан под крошечный объём RAM, отвечает на GET за десятки миллисекунд и держит несколько одновременных соединений.
Историческая параллель: первый веб-сервер CERN'а 1990 года крутился на NeXT-машине с 8 МБ памяти — больше, чем у автора проекта. Среднее SPA сегодня грузит 5 МБ JS, чтобы отрендерить кнопку «Отправить».
@tproger
Читайте также в VK, Max и Дзен
Энтузиаст собрал HTTP-сервер, работающий на 8-битном процессоре — буквально живой веб на железе, которое старше большинства фронтенд-фреймворков. Никаких ESP32, никаких микро-Linux: только голый MCU, ручной TCP/IP-стек и HTML, прошитый в EEPROM.
Стек переписан под крошечный объём RAM, отвечает на GET за десятки миллисекунд и держит несколько одновременных соединений.
Историческая параллель: первый веб-сервер CERN'а 1990 года крутился на NeXT-машине с 8 МБ памяти — больше, чем у автора проекта. Среднее SPA сегодня грузит 5 МБ JS, чтобы отрендерить кнопку «Отправить».
@tproger
Читайте также в VK, Max и Дзен
👍27😁8☃3❤🔥2🔥2🍓2🤔1😴1🤪1🗿1💊1
Где в Москве учат детей программированию по-настоящему
Школ детского айти всё больше, и почти все обещают сделать из второклассника Python-джуна к лету. На практике за этим часто стоит игра в Minecraft, а не алгоритмы.
Прошлись по пяти московским школам и посмотрели, где детей учат программировать всерьёз: языки, формат, цена, кто преподаёт.
Полная статья: https://tproger.ru/articles/gde-uchit-rebyonka-programmirovaniyu-v-moskve-gajd-dlya-roditelej
@tproger
Читайте также в VK, Max и Дзен
Школ детского айти всё больше, и почти все обещают сделать из второклассника Python-джуна к лету. На практике за этим часто стоит игра в Minecraft, а не алгоритмы.
Прошлись по пяти московским школам и посмотрели, где детей учат программировать всерьёз: языки, формат, цена, кто преподаёт.
Полная статья: https://tproger.ru/articles/gde-uchit-rebyonka-programmirovaniyu-v-moskve-gajd-dlya-roditelej
@tproger
Читайте также в VK, Max и Дзен
1☃10❤5🍌3⚡2👀2🆒2🤔1👻1🎃1🎅1💅1
Бейджи фестиваля, которые сами синхронизируются друг с другом
На Hackaday — разбор хардварного проекта: тысяча бейджей-плат с RGB-светодиодами и ESP32. Стоят рядом — начинают мигать в такт.
Это mesh-сеть с алгоритмом синхронизации фаз. Каждый бейдж шлёт через ESP-NOW (Wi-Fi без AP, прямой peer-to-peer) свою текущую фазу мигания. Соседи усредняют чужие фазы со своей и подтягивают свою. Через минуту все мигают синхронно.
Это модель Курамото — математика, описывающая как сверчки в траве синхронизируют свои стрекотания. На бейджах работает буквально та же формула.
@tproger
Читайте также в VK, Max и Дзен
На Hackaday — разбор хардварного проекта: тысяча бейджей-плат с RGB-светодиодами и ESP32. Стоят рядом — начинают мигать в такт.
Это mesh-сеть с алгоритмом синхронизации фаз. Каждый бейдж шлёт через ESP-NOW (Wi-Fi без AP, прямой peer-to-peer) свою текущую фазу мигания. Соседи усредняют чужие фазы со своей и подтягивают свою. Через минуту все мигают синхронно.
Это модель Курамото — математика, описывающая как сверчки в траве синхронизируют свои стрекотания. На бейджах работает буквально та же формула.
@tproger
Читайте также в VK, Max и Дзен
❤44👍18💔4👀3🗿3☃2🌚2👨💻2🙊2🤷♀1😴1
Хотите разобраться, как PyTorch работает изнутри, а не только вызывать .fit()?
Держите: awesome-cuda-books, кураторский список лучших книг по CUDA и параллельным вычислениям на GPU. 668 звёзд на GitHub.
CUDA от NVIDIA — основная платформа, поверх которой работают PyTorch, TensorFlow и большинство ML-фреймворков. Чтобы разобраться в том, что происходит на уровне ядер и памяти видеокарты, без хорошей книги не обойтись. Учебников по теме немало, и отфильтровать подходящие без ориентира непросто. А тут прямо готовая библиотека, так что забирайте.
#python #pytorch
@tproger
Читайте также в VK, Max и Дзен
Держите: awesome-cuda-books, кураторский список лучших книг по CUDA и параллельным вычислениям на GPU. 668 звёзд на GitHub.
CUDA от NVIDIA — основная платформа, поверх которой работают PyTorch, TensorFlow и большинство ML-фреймворков. Чтобы разобраться в том, что происходит на уровне ядер и памяти видеокарты, без хорошей книги не обойтись. Учебников по теме немало, и отфильтровать подходящие без ориентира непросто. А тут прямо готовая библиотека, так что забирайте.
#python #pytorch
@tproger
Читайте также в VK, Max и Дзен
🌚3🎄3🙉3🔥2🤝2😘2❤🔥1🤨1😭1🦄1😎1
Каждая часть системы работала правильно. Приложение всё равно падало
Веб создаёт данные, бэкенд обрабатывает, мобилка показывает — и каждый кусок по отдельности проходит тесты. А баг рождается ровно там, где они встречаются впервые.
Собрали пять кейсов из практики мобильного тестирования:
— Промокод с кириллицей, который веб спокойно создавал, а мобилка отказывалась принимать.
— RatingBar, который на Samsung стабильно накидывал лишнюю звезду.
— Пуши, отвалившиеся на всех iPad из-за одной строки «iPadOS» в JSON.
— Кнопка в чате бота, уехавшая за край экрана у клиентов с длинным списком счетов.
— WebSocket, который не закрывался при выходе из чата и копил соединения до краша.
@tproger
Читайте также в VK, Max и Дзен
Веб создаёт данные, бэкенд обрабатывает, мобилка показывает — и каждый кусок по отдельности проходит тесты. А баг рождается ровно там, где они встречаются впервые.
Собрали пять кейсов из практики мобильного тестирования:
— Промокод с кириллицей, который веб спокойно создавал, а мобилка отказывалась принимать.
— RatingBar, который на Samsung стабильно накидывал лишнюю звезду.
— Пуши, отвалившиеся на всех iPad из-за одной строки «iPadOS» в JSON.
— Кнопка в чате бота, уехавшая за край экрана у клиентов с длинным списком счетов.
— WebSocket, который не закрывался при выходе из чата и копил соединения до краша.
@tproger
Читайте также в VK, Max и Дзен
5❤5🤷♀3✍3🤣2👻2🤪2👍1👎1👏1👌1🎃1
Self-hosted платформа для агентов с песочницами и audit log
Один агент с shell-доступом выглядит удобно ровно до момента, когда надо понять, кто разрешил действие, в каком контейнере оно выполнялось и можно ли повторить цепочку. Horizons пытается закрыть именно эту инженерную часть.
В проекте агенты описываются декларативно: имя, sandbox image, доступные инструменты, расписание. Действия проходят approval gates, записываются в append-only audit log, а MCP gateway поддерживает stdio и HTTP. Получается не «чатик с инструментами», а среда исполнения с правилами.
Можно разобрать репозиторий как пример self-hosted agent execution. Внутри полезно смотреть не только на SDK, но и на модель разрешений, журнал действий и границы песочницы.
@tproger
Читайте также в VK, Max и Дзен
Один агент с shell-доступом выглядит удобно ровно до момента, когда надо понять, кто разрешил действие, в каком контейнере оно выполнялось и можно ли повторить цепочку. Horizons пытается закрыть именно эту инженерную часть.
В проекте агенты описываются декларативно: имя, sandbox image, доступные инструменты, расписание. Действия проходят approval gates, записываются в append-only audit log, а MCP gateway поддерживает stdio и HTTP. Получается не «чатик с инструментами», а среда исполнения с правилами.
Можно разобрать репозиторий как пример self-hosted agent execution. Внутри полезно смотреть не только на SDK, но и на модель разрешений, журнал действий и границы песочницы.
@tproger
Читайте также в VK, Max и Дзен
😁5😴3💊3🐳1🍌1💔1🍓1😈1💅1🆒1😎1
Агенты становятся быстрее не от промптов, а от runtime-подсказок
Когда агентный пайплайн тормозит, первое желание: переписать промпт или заменить модель. NVIDIA NeMo Agent Toolkit смотрит ниже: на маршрутизацию, приоритеты, трассировку и выполнение графов агентных задач.
В проекте есть Dynamo Runtime Intelligence для выбора cache-control и приоритетов по профилю запроса, Agent Performance Primitives для ускорения графовых фреймворков, интеграция с LangSmith и публикация workflow как MCP-серверов через FastMCP. Это уже не демо-чат, а инфраструктура вокруг агентных систем.
Если вы собираете не одного бота, а цепочку инструментов, стоит изучить подход. Детали помогают понять, какие части агентного стека стоит измерять до того, как винить модель.
@tproger
Читайте также в VK, Max и Дзен
Когда агентный пайплайн тормозит, первое желание: переписать промпт или заменить модель. NVIDIA NeMo Agent Toolkit смотрит ниже: на маршрутизацию, приоритеты, трассировку и выполнение графов агентных задач.
В проекте есть Dynamo Runtime Intelligence для выбора cache-control и приоритетов по профилю запроса, Agent Performance Primitives для ускорения графовых фреймворков, интеграция с LangSmith и публикация workflow как MCP-серверов через FastMCP. Это уже не демо-чат, а инфраструктура вокруг агентных систем.
Если вы собираете не одного бота, а цепочку инструментов, стоит изучить подход. Детали помогают понять, какие части агентного стека стоит измерять до того, как винить модель.
@tproger
Читайте также в VK, Max и Дзен
❤8😢2🤩2❤🔥1🐳1🤣1😇1😨1🎄1🤪1😘1
MCP-сервер, который лечит галлюцинации документации
У AI-ассистента есть неприятная привычка: он уверенно вспоминает API из старой версии библиотеки и пишет код, который выглядит правдоподобно до первого запуска. Grounded Docs MCP Server предлагает скучное, но сильное решение: дать ассистенту свой актуальный индекс документации.
Проект позиционируется как open-source альтернатива Context7, Nia и Ref.Tools. Идея в том, чтобы локально собрать документы, держать их свежими и отдавать через MCP в инструменты кодинга, вместо того чтобы просить модель угадывать сигнатуры из памяти.
Можно посмотреть, как устроен такой сервер и какие сценарии он закрывает. В деталях особенно полезна мысль: качество AI-кода часто упирается не в модель, а в источник контекста.
@tproger
Читайте также в VK, Max и Дзен
У AI-ассистента есть неприятная привычка: он уверенно вспоминает API из старой версии библиотеки и пишет код, который выглядит правдоподобно до первого запуска. Grounded Docs MCP Server предлагает скучное, но сильное решение: дать ассистенту свой актуальный индекс документации.
Проект позиционируется как open-source альтернатива Context7, Nia и Ref.Tools. Идея в том, чтобы локально собрать документы, держать их свежими и отдавать через MCP в инструменты кодинга, вместо того чтобы просить модель угадывать сигнатуры из памяти.
Можно посмотреть, как устроен такой сервер и какие сценарии он закрывает. В деталях особенно полезна мысль: качество AI-кода часто упирается не в модель, а в источник контекста.
@tproger
Читайте также в VK, Max и Дзен
👍13🍌5🤨3💯2🍓2👎1🏆1🤓1👻1🙈1🦄1
Forwarded from Нейроканал
Коллеги из Tproger собрали подборку облачных GPU-провайдеров для ML на 2026 год. Внутри — какие карты реально доступны у разных провайдеров (от Tesla T4 до H200 и B300), под какие сценарии берут конкретные конфигурации и сколько это стоит за час аренды.
Рекомендую, пишут про решения, которыми я лично пользуюсь.
@neuro_channel (теперь ещё в VK и Max)
Рекомендую, пишут про решения, которыми я лично пользуюсь.
@neuro_channel (теперь ещё в VK и Max)
1👍7👎5🤔3🤪3🔥2😘2❤🔥1🏆1👨💻1😨1🫡1
Свой AI-агент без магии: CRUD-подход, память и инструменты
Когда говорят «агент», легко представить огромную платформу, которую страшно трогать без команды ML-инженеров. Автор FastStream и мейнтейнер AG2 предлагает инженерный взгляд: агент состоит из понятных частей, а не из чёрного ящика.
В разборе OpenClaw используется как повод показать базовую конструкцию: модель, инструменты, контекст, память, интеграции и правила выполнения. Смысл не в том, чтобы срочно писать свой фреймворк, а в том, чтобы перестать бояться архитектуры агентов.
Если хочется разобрать агентную механику на пальцах, материал хорошо работает как инженерная карта. Детали помогут отличить полезную автоматизацию от красивой кнопки «сделай всё».
@tproger
Читайте также в VK, Max и Дзен
Когда говорят «агент», легко представить огромную платформу, которую страшно трогать без команды ML-инженеров. Автор FastStream и мейнтейнер AG2 предлагает инженерный взгляд: агент состоит из понятных частей, а не из чёрного ящика.
В разборе OpenClaw используется как повод показать базовую конструкцию: модель, инструменты, контекст, память, интеграции и правила выполнения. Смысл не в том, чтобы срочно писать свой фреймворк, а в том, чтобы перестать бояться архитектуры агентов.
Если хочется разобрать агентную механику на пальцах, материал хорошо работает как инженерная карта. Детали помогут отличить полезную автоматизацию от красивой кнопки «сделай всё».
@tproger
Читайте также в VK, Max и Дзен
❤13😎4👍3👎2🗿2🥰1😱1😢1🍓1💋1😨1
Сайт узнаёт ваши вкладки не через куки, а через SSD
Если вы думали, что приватность в браузере — это про куки, новая техника FROST добавит вам бессонницы. Вредоносный сайт создаёт гигабайтный файл в изолированном хранилище OPFS и измеряет задержки чтения вашего SSD. Когда другая вкладка обращается к диску, задержки меняются. Свёрточная нейросеть по этим колебаниям определяет, что именно у вас открыто.
Исследователи показали полноценную атаку на macOS с чипом M2, базовый примитив подтверждён на Linux. Пока это лабораторный proof-of-concept, но работает во всех основных браузерах без единого клика.
Если вы думали, что приватность в браузере — это про куки, новая техника FROST добавит вам бессонницы. Вредоносный сайт создаёт гигабайтный файл в изолированном хранилище OPFS и измеряет задержки чтения вашего SSD. Когда другая вкладка обращается к диску, задержки меняются. Свёрточная нейросеть по этим колебаниям определяет, что именно у вас открыто.
Исследователи показали полноценную атаку на macOS с чипом M2, базовый примитив подтверждён на Linux. Пока это лабораторный proof-of-concept, но работает во всех основных браузерах без единого клика.
👀38💊5❤🔥2🎉2🦄2🤷♂1👎1👏1🤩1😈1🙈1
Держите: Claude Opus 4.8 с fast mode втрое дешевле и сотнями параллельных агентов
Anthropic обновила флагман до версии 4.8 по той же цене, а для разработчиков главное новшество простое: режим fast mode теперь стоит втрое меньше и работает в 2,5 раза быстрее.
Модель заметно прибавила в надёжности. По оценкам Anthropic, Opus 4.8 в четыре раза реже молча пропускает собственные ошибки в коде. На бенчмарке Super-Agent она стала единственной моделью, дошедшей до конца во всех сценариях, и обошла GPT-5.5 при равной стоимости.
В Claude Code появились динамические рабочие процессы — теперь можно запускать сотни параллельных подагентов в одной сессии. Подробности на Tproger.
Anthropic обновила флагман до версии 4.8 по той же цене, а для разработчиков главное новшество простое: режим fast mode теперь стоит втрое меньше и работает в 2,5 раза быстрее.
Модель заметно прибавила в надёжности. По оценкам Anthropic, Opus 4.8 в четыре раза реже молча пропускает собственные ошибки в коде. На бенчмарке Super-Agent она стала единственной моделью, дошедшей до конца во всех сценариях, и обошла GPT-5.5 при равной стоимости.
В Claude Code появились динамические рабочие процессы — теперь можно запускать сотни параллельных подагентов в одной сессии. Подробности на Tproger.
❤20👀5💊4👍3⚡2😢2💯2🕊1💔1💘1😘1
Что делать, если нашёл ракушку: Версия для разработчиков
Сегодня никаких каламбуров, так что я про реальную ракушку, а не про shell. Один разраб нашёл окаменевшую ракушку в пустыне Аль-Гат в Саудовской Аравии. Это область погружалась под воду в позднем юрском периоде, 150 миллионов лет назад.
Обычный человек обратился бы к палеонтологам, чтобы узнать о находке подробнее. Но мы то с вами не такие, верно? Поэтому парень написал код, подготовил датасет из 7 894 видов и 59 244 фотографий, разобрал контур каждой ракушки в 256 точек, настроил сжатие признаков через PCA. В итоге определение вида свелось к двум параметрам — «заострённость» и «симметрия».
Модель показала, что скорее всего это Sphincterochila candidissima. Неплохо, правда? У себя на GitHub автор выложил разбор своего метода и кода. Если интересно, можете изучить, а заодно и потестировать на ракушках возле своего дома.
Сегодня никаких каламбуров, так что я про реальную ракушку, а не про shell. Один разраб нашёл окаменевшую ракушку в пустыне Аль-Гат в Саудовской Аравии. Это область погружалась под воду в позднем юрском периоде, 150 миллионов лет назад.
Обычный человек обратился бы к палеонтологам, чтобы узнать о находке подробнее. Но мы то с вами не такие, верно? Поэтому парень написал код, подготовил датасет из 7 894 видов и 59 244 фотографий, разобрал контур каждой ракушки в 256 точек, настроил сжатие признаков через PCA. В итоге определение вида свелось к двум параметрам — «заострённость» и «симметрия».
Модель показала, что скорее всего это Sphincterochila candidissima. Неплохо, правда? У себя на GitHub автор выложил разбор своего метода и кода. Если интересно, можете изучить, а заодно и потестировать на ракушках возле своего дома.
👍32❤11🤣10🤪5🎅4🤷♂3🤓3🆒2💊2😎2🙉1
strace без простыни системных вызовов
Но мне тут попалась strace-ui — интерактивная TUI-обёртка: ненужные вызовы скрываются клавишей h, дескрипторы фильтруются на лету, структуры разворачиваются в читаемый вид, а man pages открываются прямо из интерфейса.
Интересно тут не только удобство. В разборе автор проекта показал, как строит терминальные интерфейсы на OCaml и Bonsai, своём реактивном UI-фреймворке в духе Elm. И заодно объясняет, почему TUI снова хорошо ложится на dev-tools: быстро, переносимо, тестируется текстовыми снапшотами и понятно даже агентам.
Я бы открыл не только ради strace-ui, а ради аргумента про возвращение нормальных терминальных интерфейсов: https://blog.janestreet.com/strace-ui-bonsai-term-and-the-tui-renaissance/
strace может показать почти всё, что процесс делает с системой. Но потом вы остаётесь один на один с простынёй системных вызовов, файловых дескрипторов и аргументов, где полезное приходится выкапывать глазами.Но мне тут попалась strace-ui — интерактивная TUI-обёртка: ненужные вызовы скрываются клавишей h, дескрипторы фильтруются на лету, структуры разворачиваются в читаемый вид, а man pages открываются прямо из интерфейса.
Интересно тут не только удобство. В разборе автор проекта показал, как строит терминальные интерфейсы на OCaml и Bonsai, своём реактивном UI-фреймворке в духе Elm. И заодно объясняет, почему TUI снова хорошо ложится на dev-tools: быстро, переносимо, тестируется текстовыми снапшотами и понятно даже агентам.
Я бы открыл не только ради strace-ui, а ради аргумента про возвращение нормальных терминальных интерфейсов: https://blog.janestreet.com/strace-ui-bonsai-term-and-the-tui-renaissance/
Jane Street Blog
strace-ui, Bonsai_term, and the TUI renaissance
We’ve always found strace useful but somewhat hard to work with. Its output is often inscrutable, it’s hard to follow subprocesses or threads, and if you wan...
❤12👀3👎1🤣1💘1😘1
Если вы устали от бесконечных тасок и созвонов, то мы приготовили для вас игру, которая поможет отдохнуть
А заодно проверить вашу способность быстро запоминать новую инфу. Переходите по ссылке и играйте в нашу «Меморину». И делитесь результатами в комментариях!
Играть тут: https://tprg.ru/KSfj
А заодно проверить вашу способность быстро запоминать новую инфу. Переходите по ссылке и играйте в нашу «Меморину». И делитесь результатами в комментариях!
Играть тут: https://tprg.ru/KSfj
😁12❤10👎6😢2🏆2😐2⚡1🌚1💋1💅1😎1
Разработчик сделал потолок прозрачным с помощью ADS-B
На Hackaday попался проект с короткофокусным проектором и ADS-B: автор берёт данные о реальных самолётах, считает, что сейчас проходит над домом, и выводит это на потолок. Получается не FlightRadar в браузере, а почти окно в небо. Только без окна.
Мне в таких штуках нравится не сам визуальный фокус, а то, как из отдельных не связанных элементов делают что-то совершенно новое: радиосигналы из реального мира → координаты → проекция в комнате. Вроде игрушка, но внутри нормальная инженерная магия: данные, геометрия, маппинг и желание сделать красиво.
На Hackaday попался проект с короткофокусным проектором и ADS-B: автор берёт данные о реальных самолётах, считает, что сейчас проходит над домом, и выводит это на потолок. Получается не FlightRadar в браузере, а почти окно в небо. Только без окна.
Мне в таких штуках нравится не сам визуальный фокус, а то, как из отдельных не связанных элементов делают что-то совершенно новое: радиосигналы из реального мира → координаты → проекция в комнате. Вроде игрушка, но внутри нормальная инженерная магия: данные, геометрия, маппинг и желание сделать красиво.
🔥34❤7👏5🕊2🙉2❤🔥1👎1🍌1💋1👻1🆒1
Forwarded from Нейроканал
AIOps продавали как волшебную таблетку: заливаешь логи и метрики, а на выходе готовое решение инцидента. На практике под капотом обычно старый движок правил в интерфейсе с надписью «ИИ», а приклеенная сверху LLM охотно выдумывает причину сбоя вместо того, чтобы её найти.
На Tproger разобрали, где ML в мониторинге теряет связь с реальностью, почему модель быстро «умирает» от дрейфа данных и где она всё-таки экономит время дежурного. Внутри ещё и чек-лист вопросов вендору, чтобы не купить пороговый мониторинг под видом ИИ.
P.S. Tproger — это медиа, где я работаю. Этот канал его часть. Так вот знакомлю вас постепенно с разным, что у нас есть :)
@neuro_channel
На Tproger разобрали, где ML в мониторинге теряет связь с реальностью, почему модель быстро «умирает» от дрейфа данных и где она всё-таки экономит время дежурного. Внутри ещё и чек-лист вопросов вендору, чтобы не купить пороговый мониторинг под видом ИИ.
P.S. Tproger — это медиа, где я работаю. Этот канал его часть. Так вот знакомлю вас постепенно с разным, что у нас есть :)
@neuro_channel
❤6🥰5👎3🤷♂2🤔2👏1😁1😱1😍1💯1💊1
KVarN убирает главное ограничение vLLM одним флагом
Если вы гоните LLM в проде, память под KV-cache уходит быстрее, чем вы успеваете сказать «контекстное окно». Huawei выложила KVarN: нативный бэкенд квантизации для vLLM, который включается одним флагом — без калибровки и без переписывания модели.
По их данным, проект даёт в 3-5 раз больше контекста при throughput выше FP16 и точности на уровне FP16. Для агентов и long-context задач это означает больше параллельных запросов на том же железе без потери качества, а это как раз то, за что обычно приходится покупать новые GPU.
Репо с кодом и бенчмарками.
Если вы гоните LLM в проде, память под KV-cache уходит быстрее, чем вы успеваете сказать «контекстное окно». Huawei выложила KVarN: нативный бэкенд квантизации для vLLM, который включается одним флагом — без калибровки и без переписывания модели.
По их данным, проект даёт в 3-5 раз больше контекста при throughput выше FP16 и точности на уровне FP16. Для агентов и long-context задач это означает больше параллельных запросов на том же железе без потери качества, а это как раз то, за что обычно приходится покупать новые GPU.
Репо с кодом и бенчмарками.
❤26👎2👍1🤔1😢1🎉1🙏1😨1🗿1💘1🙉1