283K subscribers
5.36K photos
1.24K videos
17 files
5.7K links
Погружаемся в машинное обучение и Data Science

Показываем как запускать любые LLm на пальцах.

По всем вопросам - @haarrp

@itchannels_telegram -🔥best channels

Реестр РКН: clck.ru/3Fmqri
Download Telegram
📌Scale AI измерила, насколько хорошо модели переписывают других агентов

HarnessOpt-Bench - бенчмарк, который проверяет, умеет ли модель улучшать харнесс чужого ИИ-агента.

🟡Механика

Модель-оптимизатор получает исходную обвязку целевого агента, размеченную обратную связь по результатам прогонов и фиксированный бюджет.

Она переписывает код, а в конце собирает финальную версию, которую оценивают на отложенном наборе задач - его оптимизатор во время работы не видит.

Тесты выполняются в доверенной среде исполнения на базе VeRO - она следит за бюджетом, прячет отложенные данные, считает потраченные токены и сохраняет каждую версию для аудита.

Так сделали для того, чтобы защита от накрутки была свойством песочницы, а не инструкцией, которую модель может обойти.


🟡Результаты

Прогнали пять топовых моделей на четырех наборах - OfficeQA, BrowseComp-Plus, Terminal-Bench и GAIA, - всего 111 запусков.

Модели четко разошлись по уровням, причем выбор самой модели влияет на результат примерно в 1,8 раза сильнее, чем то, в каком кодинг-агенте она работает.

Впереди Opus-5, она выбрала около двух третей доступного запаса улучшений на OfficeQA и половину на BrowseComp-Plus, а всего выиграла три задачи из четырех.

Родная среда для модели (Сodex для GPT, Сlaude Сode для Claude, Kimi Cli для Kimi) устойчивого преимущества не дает.

Отдельно Scale AI посмотрела динамику по поколениям. У пяти релизов GPT прирост рос монотонно, с +0,03 до +0,49, у пяти релизов Claude Opus - с +0,37 до +0,59.

Важно понимать, что настоящим самоулучшением это назвать пока нельзя, так как одна модель переписывает среду другого агента, исходный тестовый харнесс которого специально был сделан с большим запасом для оптимизации.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍10214🤓13🤔10💯6🔥5🥱2🥰1
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ GPT-5.6 Sol подешевел на 3 месяца

OpenAI снизила стоимость флагманской GPT-5.6 Sol в API и кредитах - в среднем больше чем на 20%.

Это акция, она действует до 21 ноября 2026 года. Тарифы API уже пересчитаны, кредиты для ChatGPT Work и Codex переводят на новые ставки.

Подписчиков Plus, Pro и Business это не касается - включенные в подписку лимиты не выросли. Возрадуются те, кто работает через API, и те, кто докупает кредиты в Work и Codex.


Цены на коротком контексте - миллион входных токенов теперь 4 доллара вместо 5, миллион выходных - 20 вместо 30.

На длинном контексте было 10 и 60 долларов, стало 8 и 30 - вывод подешевел вдвое.

В конце июля OpenAI уже снижала цены на GPT-5.6 Terra и Luna, но Sol тогда не тронули.

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥789👍9😁5🎉1
Media is too big
VIEW IN TELEGRAM
✔️ Чикагская биржа запускает фьючерсы на аренду вычислений

CME планирует 5 октября открыть торги фьючерсами на ИИ-вычисления. Контракты расчетные и привязаны к стоимости аренды ускорителей Nvidia H100 и B200: месячный контракт считается по почасовому тарифу.

Компаниям инструмент дает возможность зафиксировать будущие расходы на облако, трейдерам - играть на колебаниях тарифов.

Сложность в том, что вычисления стандартизировать труднее обычного биржевого товара, ведь цена аренды зависит от провайдера, региона и условий договора, а часть сделок вообще не публична.

Комиссия по торговле товарными фьючерсами сейчас изучает риски манипулирования, механизмы защиты инвесторов и собирает публичные отзывы.
cftc.gov

✔️ DeepSeek выпустила экспериментальную vision-модель

V4-Flash-Vision-Exp построена на V4-Flash и умеет разбирать диаграммы, распознавать текст и вызывать инструменты. По собственным замерам DeepSeek, модель держится на уровне Claude Opus 4.8.

Форматы JPEG, PNG, GIF и WebP модель определяет по фактическому содержимому файла, а не по расширению. Картинку можно передать в Base64, публичной ссылкой или через новый Files API - туда грузится файл, и дальше к нему обращаются по идентификатору.

Одно изображение обходится максимум в 384 токена. Картинки приводятся размеру к 800x800 пикселей, а параметром detail их можно принудительно ужать до 512x512.

В один промпт влезает до 600 файлов. Максимальная длина стороны - 8192 пикселя, но если изображений от 15, потолок опускается до 4096.
DeepSeek в X

✔️ Anthropic смягчает политику хранения данных корпоративных клиентов

Компания разрешит корпоративным клиентам держать логи обращений к моделям в собственном облаке, а не на серверах компании.

С июня 2026 года Anthropic сохраняла эти данные у себя на 30 дней, чтобы отслеживать кибератаки, размазанные по нескольким запросам. Требование мешало продажам крупным заказчикам со строгими стандартами безопасности.

Осенью подход изменится. Месячное окно мониторинга останется, но данные не будут покидать периметр заказчика.

Архитектуру разрабатывали несколько месяцев, в закрытом тестировании участвовали около сотни клиентов.
Boris Cherny в X

✔️ Tencent показала HyCreator - агента для длинных видео

Система работает по агентному принципу - она дирижирует моделями на всех этапах производства, в режимах Lite и Pro. Управление можно перехватить и поправить сцены вручную. Перед финальной склейкой HyCreator проверяет качество кадров, переходы и связность истории.

На сайте Tencent выложены примеры с логами действий агента. Самый длинный ролик там - 10 минут 27 секунд. В одном из показанных случаев система за 13 шагов собрала 45 промежуточных фрагментов.

Прием заявок на ранний доступ открыт. Архитектуру базовых моделей, время рендеринга и стоимость генерации Tencent не раскрывает.
tencent.com

✔️ Waymo переводит роботакси на чипы собственной разработки

Подразделение Alphabet начало ставить в роботакси свои ИИ-чипы, заменяя решения от Nvidia и AMD. Процессор идет в машины, которые Waymo выпускает вместе с китайским Zeekr.

Чипы делает TSMC по 5-нм техпроцессу. Заявленная производительность платформы - больше 1000 TOPS.

Смысл перехода в том, чтобы удешевить машину. Архитектуру затачивали под автономное вождение - она ускоряет первичную обработку данных с сенсоров и оптимизирует инференс моделей, которые отвечают за навигацию и реакцию на дорожную обстановку. 
bloomberg.com


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍6516🔥6🗿2
✔️ Anthropic пустила Mythos 5 в Claude Security

С сегодняшнего дня сканирование в Claude Security идет на самой мощной модели компании.

Продукт в публичной бете для клиентов на планах Claude Enterprise.

Администратор включает его в консоли, дальше пользователь выбирает репозиторий, и Claude выдает по каждой находке категорию CWE, оценку уверенности, уровень серьезности и предлагаемое исправление.

Прямого доступа к Mythos 5 это не дает. Модель работает в фоне, наружу идут только находки. Патчить код в Claude Code пользователь будет теми моделями, к которым у организации и так есть доступ, а каждый патч обязан просмотреть и утвердить человек.

Отдельно докупать Mythos не нужно - сканирование считается обычным расходом токенов по действующему плану.


По тому же принципу Mythos пойдет дальше. Anthropic встраивает модель в продукты партнеров по - пользователь с ней не общается и получает только готовый артефакт, попросить эксплойт через такой интерфейс нельзя.

Отдельно компания запускает фонд Defender Advantage (0xDAF) объемом 35 млн долларов в кредитах Claude, которые раздадут тем, кто закрывает уязвимости в открытом коде.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍3313🤩9🤣4🔥2
✔️ Первые серийные Vera Rubin приехали в дата-центры Microsoft

Сатья Наделла выложил фотографии из дата-центров Microsoft - пришли первые серийные стойки NVIDIA Vera Rubin.

Nvidia следом подтвердила, что платформа вышла на полномасштабное производство.

Vera Rubin - следующее за Blackwell поколение стоечной платформы для ИИ. В одной системе NVL72 стоят 72 GPU Rubin и 36 CPU Vera на архитектуре Arm.


Стойка полностью на жидкостном охлаждении, лотки модульные и без кабелей - Nvidia обещает, что установка занимает пять минут вместо двух часов.

По словам Nvidia, относительно GB200 NVL72 платформа обучает модели при вчетверо меньшем числе GPU, а стоимость миллиона токенов на инференсе агентным задач снижает примерно вдесятеро.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
378🔥46👍16🤔3
🔥 Nvidia выделяет $7 млрд на открытые модели и идет за DeepSeek и Kimi

Nvidia резко усиливает ставку на open-weight AI. По данным WSJ, компания заплатит $6 млрд за лицензирование технологий Poolside и заберет в команду Nemotron больше 100 ее сотрудников.

Еще $1 млрд Nvidia инвестирует непосредственно в Poolside при оценке стартапа в $12 млрд до сделки.

Задача амбициозная: превратить Nemotron в семейство моделей, способное конкурировать не только с DeepSeek и Kimi, но и с закрытыми моделями OpenAI и Anthropic.

Получается интересный разворот. Компания, которая зарабатывает миллиарды на продаже GPU крупнейшим AI-лабораториям, теперь сама вкладывает миллиарды в альтернативу их закрытым моделям.

Похоже, гонка open-weight моделей только начинается.

https://www.wsj.com/tech/ai/nvidia-is-spending-6-billion-to-build-a-powerful-u-s-alternative-to-chinese-ai-c51c38cc

@data_analysis_ml / Папка полезного по ML.
5103👍33🔥22🤣7🤔31
Media is too big
VIEW IN TELEGRAM
✔️ MiniMax сделала агента полного цикла для видеопроизводства

MiniMax Design - это приложение под Windows и MacOS в виде мультимодального агента, который сам разбирает задачу на шаги, пишет сценарий, собирает раскадровку, генерирует изображения и видео, а потом монтирует, накладывает озвучку и субтитры и отдает готовый ролик.

Продукт не появился из ниоткуда - это развитие прежнего инструмента MiniMax Hub.


Внутри сидит новая модель H3. По словам компании, система сама разбирает задачу и решает, какие материалы взять за референс, что оставить, а что переделать. Дальше она упаковывает все это в формат, который подходит для H3.

Для сложных кадров есть режиссерский 3D-инструмент для расстановки персонажей, движения и ракурсов камеры перед генерацией сцены.

Профессионалам обещают подключение готовых воркфлоу ComfyUI - их можно гонять в облаке или локально, а агент поможет подкрутить ноды и параметры генерации.

Кроме H3, MiniMax Design умеет использовать и другие модели на разных этапах (для картинок, видео и звука).

🟡Тарифы

Подписка помесячная или годовая, при оплате за год два месяца бесплатно. Тарифы различаются они только объемом кредитов - набор возможностей везде одинаковый.

🟠Starter - 10,5 доллара в месяц (8,4 при годовой оплате).

10 000 кредитов в месяц: 83 секунды видео H3 в 2K или 143 секунды в 768p, 125 картинок в GPT Image 2, 167 в Nano Banana Pro, 500 треков в Music 2.6, 200 тысяч знаков озвучки в Speech 2.8.


🟠Plus - 76 долларов в месяц (60,8 если платить за год).

87 000 кредитов: 725 секунд H3 в 2K или 1243 секунды в 768p, 1088 картинок в GPT Image 2, 1450 в Nano Banana Pro, 4350 треков, 1,74 млн знаков озвучки.


🟢Pro - 215 долларов в месяц (172 если за год)

270 000 кредитов: 2250 секунд H3 в 2K или 3857 секунд в 768p, 3375 картинок в GPT Image 2, 4500 в Nano Banana Pro, 13 500 треков, 5,4 млн знаков озвучки.


На всех тарифах доступны все модели MiniMax для видео, голоса и музыки, GPT Image 2 и Nano Banana Pro, плюс параллельность генерации.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍59🔥2515🐳1
✔️ Black Forest Labs выпустила апскейлер видео

FLUX Upscale - отдельный инструмент и эндпойнт, который пересобирает видео в разрешении вплоть до 4K.

На вход идет видео от 480p. Инструмент понимает вывод FLUX 3 и, по словам BFL, чинит то, что универсальный апскейлер пропускает - смазанные лица и артефакты на текстурах.

🟡Режима два

Precise - четыре шага, 7 центов за мегапиксель-секунду. Подойдет, когда нужно сохранить лицо персонажа и соответствие референсу.

Creative - восемь шагов, 10 центов. Сильнее чинит и дорисовывает детали, но может изменить или подменить внешность, так что соответствие референсу ниже.

Коэффициент увеличения - 1,5x, 2x или 3x. От HD на входе это дает примерно 1080p, 2K и 4K.

Десятисекундный ролик обойдется в шесть-восемь долларов.


Работает через API Black Forest Labs и плейграунд.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍77👏24🤓107🤔6👌3🗿3🥰21
Как быстро вырасти до уровня, где ты уже не просто выполняешь задачи, а влияешь на продукт и бизнес?

В Т-Банке запустили «Мини-СЕО» - шестимесячную программу, где участники работают напрямую с топ-менеджерами над реальными стратегическими проектами.

Можно попасть в одно из направлений: развивать автосегмент и регионы, работать с AI-продуктами и 3P, оценивать влияние продуктов на экосистему, искать новые точки роста или участвовать в создании B2B-маркетплейса.

Без учебных кейсов: 40 часов в неделю, реальные задачи и опыт, который сложно получить на обычной стажировке.

Программа подойдёт студентам и джунам с хорошей базой в математике и аналитике.

Подать заявку можно до 25 сентября.
👍6542🤣30👏12🔥9🤩8🏆3🤨3🗿1
🌟 Turbovec: библиотека векторного поиска на основе гугловского TurboQuant

Библиотека написана на Rust, есть привязки для Python, а в основе - TurboQuant, алгоритм сжатия векторов, который Google описали в статье, принятой на ICLR 2026.

Сама библиотека к Google отношения не имеет, это независимая реализация чужого алгоритма.


🟡Turbovec сжимает данные примерно в восемь раз

Коллекция из 10 миллионов документов, занимающая в исходном виде 31 гигабайт, умещается в 4. Поиск при этом, как утверждает автор, идёт быстрее, чем в FAISS - одного из самых распространённых инструментов в этой области.

По замерам turbovec обгоняет FAISS в среднем в 3,4-3,5 раза при 4-битном сжатии и на 20-26% при 2-битном, в зависимости от железа.

🟡Удобные мелочи

Индекс не нужно предварительно обучать - векторы просто добавляются по мере поступления.

Сохранение инкрементальное, на диск уходит только то, что изменилось с прошлого раза, поэтому даже на большом индексе это занимает миллисекунды.

Поиску можно передать список разрешённых документов - скажем, чтобы пользователь видел только свои файлы.

Удаление работает по постоянным идентификаторам, ссылки на записи не плывут.

Тем, кто уже сидит на LangChain, LlamaIndex, Haystack или Agno, автор предлагает готовые адаптеры - меняется одна строка импорта, остальной код остаётся как был.


📌Лицензирование: MIT License


🖥 Github


@ai_machinelearning_big_data

#AI #ML #VectorSearch #TurboQuant #Rust
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍130🔥42🤓189👏8❤‍🔥6🎉3🥱1