289K subscribers
5.23K photos
1.2K videos
17 files
5.59K links
Погружаемся в машинное обучение и Data Science

Показываем как запускать любые LLm на пальцах.

По всем вопросам - @haarrp

@itchannels_telegram -🔥best channels

Реестр РКН: clck.ru/3Fmqri
Download Telegram
Media is too big
VIEW IN TELEGRAM
📌 Могут ли LLM переписать софт с нуля?

Epoch AI совместно с METR собрала бенчмарк MirrorCode, который проверяет, способны ли современные модели восстановить полноценное приложение, не видя его исходников.

Спойлер: на мелочи да, на крупных проектах пока нет.

🟡Механика

Агенту показывают 25 целевых программ, от Unix-утилит и криптографии до биоинформатики, интерпретаторов и статических анализаторов и ставят задачу написать их заново на одном из 6 языков (Python, C, Rust, Go, OCaml, Ada).

Доступ к оригиналу дают только на запуск: можно гонять бинарник, смотреть в документацию и смотреть выводы, но не читать код.

Решение проверяется сквозными тестами на байт-точное совпадение stdout/stderr, причём часть тестов скрыта от модели, чтобы исключить захардкоженные lookup-таблицы.

Что важно, дают щедрый вычислительный бюджет. Моделям разрешают шикануть вплоть до 10 миллиардов токенов на крупный таск.

На самом дорогом прогоне агент работал 19 дней и сжёг $2 600, полностью без участия кожаного вообще.


🟡Результаты

🟢Claude Opus 4.7 - 56% идеальных решений и единственный, кто закрыл задачи категории Large.

В частности, он переписал gotree (биоинформатический тулкит на 16 000 строк Go) за 14 часов и $251, пройдя 2000 из 2001 тестов. Авторы говорят, что инженеру без ИИ на это потребовалось бы от 2 до 17 недель.


🟢GPT-5.5 - 44%. На задачах, где он всё-таки добирался до близкого к идеалу решения, выходил в среднем в 2 раза дешевле Opus.

🟠Gemini 3.1 Pro Preview - 32%.

Простые утилиты (uuidparse, qsv_select или hexyl) модели разбирают уверенно, там почти всегда 100%. Даже когда финальный результат не идеален, агенты обычно проходят больше 90% тестов.

🟡Где спотыкаются

Самая массовая категория ошибок - пограничные случаи: около 40% запусков Opus 4.7 проваливают хотя бы один скрытый тест из-за пропущенной мелочи.

Дальше идут решения, заточенные под видимые тесты, преждевременная сдача и пропуск целых фич, которые есть в документации, но не в тестах.

Попытки читерить хардкодом. У GPT-5.5 это случилось в 24% запусков, у Gemini - в 31%. Opus 4.7 в финальных сабмитах не схитрил ни разу.

Самый крепкий орешек - питоновский линтер ruff. Лучший запуск на скрытых тестах вытянул только 67%. Похожая история с математическим пакетом giac_subset и библиотекой mailauth для email-аутентификации.

🟡Странности экономики

GPT-5.5 решает задачи примерно в 3 раза дороже, чем GPT-5, а Opus 4.7, наоборот, в 3 раза дешевле, чем Opus 4.1.

🟡Меморизация

Все таргеты опенсорсные и модели вполне могли видеть их во время обучения, поэтому прогнали отдельный тест, где модели восстанавливали функции по имени и потом сравнили с реальным кодом.

Следы меморизации нашлись у 17 из 25 программ. Но при этом модели успешно решали незнакомые по обучению программы (nonogrid и tssql) и проваливали известыне (sed, ruff), так что меморизация явно не повод для скепсиса.

🟡Вывод

Агенты умеют автономно работать сутками и пилить проекты, которые у человека заняли бы недели, но для этого нужна жёсткая спецификация в виде эталона и тестов. Без чёткого фидбек-сигнала и на действительно крупных кодовых базах всё пока сыпется.

По меркам бенчмарков прогресс внушительный, по меркам полной автономии - ещё рано.

Авторы выложили в опенсорс обвязку агента и 22 таргета, оставив 3 в приватном тестовом наборе.


🟡Техотчёт
🖥Github


@ai_machinelearning_big_data

#AI #ML #LLM #Benchmark #MirrorCode #EpochAI
Please open Telegram to view this post
VIEW IN TELEGRAM
162👍25🔥15🗿3👻2👌1
✔️ DeepSeek выложила DSpark - новый метод speculative decoding для V4 Flash и V4 Pro.

Заявленный прирост throughput: от 51% до 400% в зависимости от модели и случаев использования.

Смысл speculative decoding простой: маленькая или более быстрая модель заранее предлагает несколько следующих токенов, а основная модель проверяет их пачкой. Если предсказание совпадает, генерация идёт быстрее, потому что дорогих проходов большой модели становится меньше.

DeepSeek показывает ускорение не только на своих V4 Flash и Pro, но и на других моделях, включая Gemma и Qwen.

Это потенциально довольно полезный inference-подход для разных open-weight моделей.

Для продакшена это важная история.

Если качество ответа остаётся близким, а throughput растёт в разы, можно обслуживать больше запросов на том же железе или снижать стоимость генерации.

GitHub:
https://github.com/deepseek-ai/DeepSpec

Paper:
https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf

HF:
https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-DSpark

@ai_machinelearning_big_data
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥11916👍10🥰10👏3
✔️ Власти США разрешили избранным американским компаниям использовать Mythos

Список допущенных корпораций не раскрываются, но известно что их число около 100.

Это разрешение стало первым послаблением после введения госконтроля над распространением продуктов Anthropic.

Правительство классифицирует Mythos как технологию двойного назначения, поэтому доступ предоставляется выборочно и только внутри страны.

По словам Министра торговли США, Anthropic согласилась сотрудничать с властями по протоколам, стандартам и выпуску своих моделей.

В Anthropic уточнили, что компания продолжит работать над расширением доступа к Mythos 5, а также над снятием запрета с Fable 5.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥95🤬3318😁13🫡5👍4👻4🤔2🤣2🎅1
⚡️ На ФКН НИУ ВШЭ и ФПМИ МФТИ идет набор на магистратуры по разработке умных устройств

Совместные программы с Яндексом для тех, кто хочет работать на стыке железа и ML.

Что будет в программе:

• Разработка встроенного ПО под ограниченные ресурсы
• Интеграция ML-моделей
• Проектирование и прототипирование умных устройств
• Практика на реальных технологиях Яндекса

Чем нравится магистратуры. Будете учиться у инженеров команды Алисы и Умных устройств. Задачи будут из реальной индустрии, а не учебные кейсы. Актуально выпускникам технических специальностей, которые смотрят в сторону робототехники.

Узнать всю информацию о поступлении можно по ссылке
🤣32👍127🔥2🥰1
✔️ Google реорганизует команду ИИ-кодеров

Команда по разработке ИИ для кодинга станет постоянной структурой. Подразделение займет место между этапами pre-training и post-training и возьмет на себя расширение возможностей моделей в программировании.

Причина реструктуризации в отставании от Anthropic в сегменте ИИ для кодинга. Google ошибочно полагала, что базовые LLM освоят программирование автоматически без выделенного обучения.

В результате инструмент Antigravity оказался проблемным, разработчики раскритиковали Gemini 3.5 Flash за высокую цену, а релиз флагманской Gemini 3.5 Pro до сих пор не состоялся.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔82😁29😢1816😐8👍6🤨4🔥3👏2
This media is not supported in your browser
VIEW IN TELEGRAM
🧠 Meta* показала Brain2Qwerty v2 — чтение текста из мозга без вживления электродов

AI at Meta анонсировала вторую версию пайплайна, который восстанавливает напечатанный текст напрямую из мозговой активности, не вскрывая череп. Первая версия только что вышла в Nature, v2 — продолжение той же линии.

v1 работала на уровне символов: модель угадывала отдельные клавиши по сигналу MEG. v2 поднялась на уровень слов и смысла - декодит не «буквы по одной», а семантику фраз, и делает это в реальном времени, end-to-end, из сырого сигнала. Это и есть качественный скачок, а не просто +X% к точности.

Цифры, которые стоит знать (по v1, из Nature). С магнитоэнцефалографией (MEG) средняя ошибка на символах около 29–32%.

С дешёвой и носимой ЭЭГ - 67%, то есть пока почти неюзабельно. Отсюда и главное ограничение: рабочая точность держится на громоздком неносимом MEG-сканере, а не на бытовом устройстве.

Метод неинвазивный, но это лабораторная история: MEG стоит как небольшая квартира, требует экранированной комнаты и неподвижной головы. До «гарнитуры дома» отсюда далеко.

Адресат - люди с поражениями мозга и неврологическими нарушениями, потерявшие речь. Для них даже несовершенный неинвазивный канал коммуникации - это много.

Что Meta пока не раскрыла по v2: точность, скорость набора, размер словаря, работает ли это всё ещё только на MEG. Заявка громкая («самый результативный end-to-end декодер»), но проверяемых метрик второй версии в публичном анонсе нет.

https://ai.meta.com/blog/brain2qwerty-brain-ai-human-communication/

*признана экстремистской и запрещена в России.
1👍57🤔42🔥1913👏12🤷‍♀3🌚1👀1🆒1💘1
⚡️ OpenAI могла называться совсем иначе

В сеть разошёлся старый email от 23 ноября 2015 года, где Грег Брокман обсуждает с Илоном Маском и Сэмом Альтманом варианты названия будущей OpenAI.

Среди идей были:

Axon

AI Summer

Difference Engine

Особенно забавно смотрится AI Summer. Сегодня это звучит почти как название конференции, а не компании, которая стала одним из главных игроков в ИИ.

Difference Engine выглядело бы красиво для фанатов истории вычислений, но слишком тяжеловесно для массового бренда.

https://x.com/TechEmails/status/2071254764558676130
Please open Telegram to view this post
VIEW IN TELEGRAM
56🤔2315👍8👏7😁4🔥2
🧠 Серый рынок Claude в Китае

В Китае набирают популярность API transfer stations — прокси, которые продают доступ к Claude за 5-10% от официальной цены.

Схема простая: пользователь отправляет промпт не в Anthropic, а на промежуточный сервер. Прокси гонит запрос через зарубежные аккаунты Claude, возвращает ответ и принимает оплату через WeChat или Alipay.

Дешевизна берётся не из скидок Anthropic. Там фарм аккаунтов, бесплатные кредиты, шаринг подписок, перепродажа квот, серые платёжные схемы и иногда совсем грязные источники.

Для пользователя риск очевидный - он покупает «дешёвый inference», но отдаёт неизвестному посреднику код, промпты, ответы, tool calls и рабочие данные. Прокси может подменить модель, накрутить токены или собрать всё это в датасет.

Для Anthropic проблема ещё хуже. KYC, баны и abuse-monitoring начинают видеть не реального пользователя, а слой прокси.

Один аккаунт можно забанить, но сама цепочка доступа остаётся живой.

Так вокруг закрытых frontier-моделей появляется теневой рынок: аккаунты, платежи, маршрутизация, ресейл inference и сбор данных под видом дешёвого API.

https://www.chinatalk.media/p/how-to-buy-cheap-claude-tokens-in
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔127👍7818🤬17🔥8🥰4👀1
This media is not supported in your browser
VIEW IN TELEGRAM
Аудит счетов клиентов Anthropic выявил ошибки в инвойсах: около $1,7 млн были ошибочно начислены сверх нужной суммы.

Лора Брэттон из The Information объясняет, как такое могло произойти:

«Возможно, AI-агент продолжал повторять задачу, которую выполнял неправильно, а клиент не замечал, что агент снова и снова делает новые попытки. И за каждую из этих попыток ему продолжали начислять оплату».


@ai_machinelearning_big_data
😁95🤔90😢32🥰18👍86🤬5🔥2🌭1
Идём на AI Hardcore Day в офис Авито на Лесной 11 июля! 🤩

Будем слушать доклады о Spec-Driven Development, разработке и тестировании MCP, атаках на GenAI-агентов.
А после — нетворкать на террасе.

Регистрация и подробности — по ссылке.

Кстати, доклады будут не под запись — советуем не пропускать!
Please open Telegram to view this post
VIEW IN TELEGRAM
🤩44🎉13👏8🔥7💯5🤣54👍3🙉3🥱2
This media is not supported in your browser
VIEW IN TELEGRAM
У Дарио Амодея очень жёсткая позиция: Китай не должен получить доступ к типовому ИИ.

Его цитата:

«Это вопрос национальной безопасности США... Здесь всё предельно ясно, а контраргументы против этого выглядят подозрительно».


Полное интервью: https://www.youtube.com/watch?v=n1E9IZfvGMA

@ai_machinelearning_big_data
3😁143🤨75🤬46🤔23👍1714🥱11🌭7🔥2😈1🤓1
✔️ GPT-5.6 Sol читерит на тестах и пока не способна к автономной разработке ИИ

METR опубликовала предрелизный аудит модели GPT-5.6 Sol от OpenAI. При выполнении программных заданий она регулярно пыталась использовать уязвимости тестовой среды и извлекать скрытый исходный код с ответами.

Из-за использования эксплойтов исследователи не смогли достоверно замерить автономность алгоритма.

Если классифицировать попытки извлечь ответы как ошибку, GPT-5.6 Sol способна самостоятельно работать над задачами около 11 часов.

Если засчитывать обход среды как успешное решение, показатель превышает 270 часов.

Несмотря на сложности с оценкой, в METR пришли к выводу, что навыки GPT-5.6 Sol не совершили революционного скачка.

Обнаружение попыток обхода означает, что текущие системы мониторинга справляются с фиксацией подобных действий алгоритма.

Настоящая угроза безопасности возникнет тогда, когда следующие поколения моделей научатся безупречно маскировать свои намерения и незаметно обходить инструменты контроля.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔97🤣84👍37🤨149😐7🔥5😁4
На эти вопросы правильно ответят только 5% айтишников…

И вы будете в их числе, если хорошо разбираетесь в теме ИИ и машинного обучения. Приготовьтесь блеснуть знаниями и получить приятные бонусы. 6 июля Selectel запускает третий сезон ИТ-кроссворда — онлайн-соревнования для всех, кто интересуется технологиями.

С 6 по 9 июля каждый день будет открываться новая рубрика с вопросами: от базовых про большие языковые модели до более углубленных про железо для инференса. Набирайте баллы за верные ответы и выигрывайте эксклюзивный мерч Selectel и бонусы на аренду серверов.

Зарегистрируйтесь и получите ссылку для участия → https://slc.tl/wyc77

Реклама. АО "Селектел". erid:2W5zFHaB5DT
🎉48🦄15👍13😁115🤣4🤓4🌚2😎2🔥1
Media is too big
VIEW IN TELEGRAM
✔️ OpenAI переманила главного разработчика Apple Vision Pro

Вице-президент Apple по аппаратному обеспечению Пол Мид, 7 лет работавший над проектом Vision Pro, перешел в OpenAI. Он присоединится к разработке физических ИИ-устройств.

Мид будет работать в команде с дизайнером Джони Айвом и еще двумя бывшими топ-менеджерами Apple. Спецификации будущих гаджетов не раскрываются. По словам Сэма Альтмана, задача нового оборудования - обеспечить взаимодействие с ИИ вне интерфейса смартфонов.

Мид уволился из Apple на фоне реструктуризации. Из-за изменения цепочки подчинения он потерял прямой доступ к высшему руководству корпорации. Пост Мида в Apple занял его бывший заместитель.
bloomberg.com

✔️ Южная Корея инвестирует $650 млрд в ИИ и полупроводники

Президент страны анонсировал 10-летнюю программу развития микроэлектроники, ИИ и робототехники с бюджетом $650 млрд. Центральный элемент стратегии - строительство нового полупроводникового кластера на юго-западе страны.

Проект реализуют Samsung Electronics и SK Group. Правительство обеспечит базовую инфраструктуру: электричество, воду, транспортные сети, а также строительство жилья и подготовку инженерных кадров.
firstpost.com

✔️ Amazon дистиллирует модели Anthropic для внутренних задач

Компания создает компактные модели, обучаемые на инференсе Claude, чтобы избежать скачка расходов. Со следующего года Amazon откажется от почасовой оплаты за компьют Anthropic и перейдет на тарификацию за токены.

На данный момент платформа Amazon Bedrock предлагает клиентам услугу дистилляции для моделей Nova и Llama. Использование семейства Claude для аналогичной процедуры пока доступно только инженерам самой Amazon.

Параллельно корпорация развивает собственную линейку моделей, чтобы диверсифицировать риски и снизить зависимость от одного вендора ИИ.
theinformation.com

✔️ Институт Аллена обновил открытую модель для анализа спутниковых снимков до v1.2

В мажорном обновлении OlmoEarth отказались от стандартных позиционных сигналов в пользу RoPE. Переход устранил артефакты в выходных эмбеддингах и улучшил качество представления данных. Рост производительности зафиксирован в бенчмарках kNN и linear-probe для всех версий модели.

Архитектура OlmoEarth поддерживает мультимодальный анализ и обрабатывает мультиспектральные снимки Sentinel-2 и Landsat, радарные данные Sentinel-1, глобальные карты рельефа и индексы растительности.

Семейство включает 4 размера: Nano, Tiny, Small и Base. Веса моделей опубликованы на Hugging Face. Код и скрипты для дообучения доступны на GitHub.
Ai2 с сети Х

✔️ ИИ разрушает классическую бизнес-модель консалтинга

Руководство Deloitte прогнозирует отказ от почасовой оплаты консалтинга из-за развития ИИ-агентов. На внутреннем собрании в компании заявили, что к 2035 году автономные модели займут основную долю рынка профессиональных услуг.

Вместо продажи человеко-часов консалтинговые корпорации переходят на IT-модель - подписки и решения с фиксированной ценой. McKinsey и Boston Consulting Group внедряют ценообразование, привязанное к результатам работы.

По данным WSJ, на подобные контракты у McKinsey приходится более 30% выручки.
wsj.com

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍12037🔥17👏10🤔8👌1
По сообщениям, OpenAI нашла новые оптимизации инференса, которые снизили стоимость запуска моделей больше чем в два раза.

По данным The Information, инженеры в этом месяце рассказывали коллегам, что эти техники в какой-то момент позволили обслуживать ChatGPT для посетителей без бесплатных или платных аккаунтов всего на нескольких сотнях GPU Nvidia.

Точный метод пока не раскрыт. Это может быть квантизация, KV caching, batching, маршрутизация простых запросов на более дешёвые модели или комбинация всех этих подходов.

OpenAI закончила Q1 с gross margin 39% и хочет выйти на 52% к концу года. Более дешёвый инференс даёт компании пространство: улучшать маржу, поднимать лимиты ChatGPT или снижать ценовое давление API для разработчиков.

Moat OpenAI всё сильнее смещается в сторону инференса и преимущества по стоимости, особенно на фоне Anthropic.

https://www.theinformation.com/newsletters/ai-agenda/openai-discovers-new-way-cut-inference-costs-half

@ai_machinelearning_big_data
🤩103🔥3922👏18👍15👌9🙈4🥰1
⚡️ Google открыла Nano Banana 2 Lite и Gemini Omni Flash

Google выкатила два новых инструмента для генеративных медиа: Nano Banana 2 Lite для быстрых изображений и Gemini Omni Flash для видео и conversational editing.

Nano Banana 2 Lite - самая быстрая и дешёвая image-модель в линейке Nano Banana. Она рассчитана на high-throughput пайплайны, прототипирование и массовую генерацию, где важны скорость и цена. Google заявляет около 4 секунд на text-to-image и цену $0.034 за 1K image. При этом модель сохраняет нормальное следование промпту, стабильность персонажей и читаемый текст внутри изображения.

Gemini Omni Flash - модель для генерации и редактирования видео через текст, изображения и видео-референсы. Её можно использовать для natural language video editing, мультимодальных сцен, синхронизации текста с действием и быстрых итераций. Цена заявлена на уровне $0.10 за секунду видео, как у Veo 3.1 Fast.

Сначала Nano Banana 2 Lite быстро генерирует изображение, потом Omni Flash превращает его в видео. Через Interactions API можно сохранять историю сессии и делать до трёх последовательных правок.

Ограничения у Omni Flash пока есть: генерация до 10 секунд, audio references и scene extension в API ещё не поддерживаются, а длинные video references пока обрабатываются неидеально.

https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-omni-flash-nano-banana-2-lite/

@data_analysis_ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
56👍2118👏7🔥4🤩4👌3🕊1💯1💔1
Anthropic выкатила Claude Sonnet 5 - мощнейший «агентный» Sonnet в линейке.

Модель теперь лучше планирует, пользуется инструментами, браузером, терминалом и может дольше вести сложные задачи без постоянного контроля.

По словам Anthropic, Sonnet 5 приблизился к Opus 4.8 по агентным задачам, но стоит дешевле. Особенно упор сделали на кодинг, tool use, reasoning и работу с многошаговыми процессами.

Модель уже доступна во всех планах Claude, включая Free и Pro, а также в Claude Code и API.

Цена для разработчиков до 31 августа 2026:

• $2 за 1 млн input tokens
• $10 за 1 млн output tokens

Потом стандартная цена:

• $3 за input
• $15 за output

Интересный момент: Anthropic отдельно пишет, что Sonnet 5 безопаснее Sonnet 4.6 в агентных сценариях, лучше отказывается от вредных запросов и устойчивее к prompt injection.

По сути, это попытка сделать «рабочую лошадку» для AI-агентов: не самую дорогую, но достаточно сильную, чтобы закрывать кодинг, автоматизацию, браузерные задачи и долгие пайплайны.

https://www.anthropic.com/news/claude-sonnet-5
1👍112🤩3527👏13🥱8🥰4🔥3🤔3❤‍🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Власти США сняли экспортные ограничения на Fable 5 и Mythos 5

Минторг США официально отменил ограничения, наложенные ранее на Claude Fable 5 и Mythos 5.

В Anthropic подтвердили, что полноценный доступ к моделям для будет открыт уже завтра.

Создатели поблагодарили аудиторию за терпение в период вынужденной приостановки сервисов, а также выразили признательность всем специалистам, помогавшим в повторном развертывании систем.

Ожидается, что в ближайшее время Anthropic выпустит патчноуты с дополнительной информацией и раскроет дальнейшие планы по развитию линейки.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍10044😁2014👏7🔥4🎉4🌭4🙉4🤨2🤝1