Математика Дата саентиста
14.2K subscribers
588 photos
188 videos
41 files
473 links
Download Telegram
Forwarded from Machinelearning
✔️ Релиз весов HiDream-I1: 17B параметров и превосходство над GPT-4o по качеству генерации изображений.

HiDream-I1 - генеративная модель text-to-imаge, разработанная китайской компанией HiDream, которая работает под брендом vivagoAI.

Модель получила 17 млрд. параметров и показывает высочайшее качество генерации изображений в фотореализме, анимационном и художественном стилях. Представлено 3 версии модели: Dev, Full и Fast.

Модель выпущена под лицензией MIT и уже заняла 1 место в GenAI-бенчмарках, обогнав предыдущего лидера, GPT-4o.

🟡Попробовать
🟡Github
🟡HidreamAi в X (ex-Twitter)


@ai_machinelearning_big_data

#news #ai #ml #HiDream #AImodel
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍51🔥1🤮1
Forwarded from Machinelearning
🌟 Kimi-VL: VLM с MoE, ризонингом и контекстом 128K.

Moonshot AI опубликовала веса Kimi-VL — открытой VLM, которая объединяет обработку текста, изображений и видео. Благодаря архитектуре MoE модель активирует всего 2.8 млрд. параметров в языковом декодере, обеспечивая скорость, сопоставимую с компактными аналогами, и результативность флагманских решений.

Главное преимущество Kimi-VL — способность анализировать длинные контексты до 128 тыс. токенов, что делает её идеальной для работы с объемными документами, длинными видео или сложными мультимедийными задачами.

Основу модели составляет визуальный энкодер MoonViT, оптимизированный для нативной обработки изображений любого разрешения без необходимости разбивать их на части. Это позволяет точно распознавать текст, графики или UI-интерфейсы даже в высокодетализированных скриншотах.

Например, на бенчмарке InfoVQA модель показывает точность 83.2%, обходя даже GPT-4o. В задачах OCR Kimi-VL достигает 86.7% на OCRBench, что ставит её в ряд лучших в индустрии.

Разработчики также представили Kimi-VL-Thinking — версию с расширенными возможностями CoT. Благодаря использованным RL и длительному CoT-тюнингу она демонстрирует впечатляющие результаты в математических и академических задачах: на MathVista точность составила 71.3%, а на MMMU — до 61.7%, что лучше, чем у Gemma-3-12B-IT.

В тестах Kimi-VL превосходит конкурентов в работе с агентами: на OSWorld её результат 8.22% выше, чем у GPT-4o (5.03%), а на WindowsAgentArena — 10.4%. Для длинных видео модель набирает 64.5% на LongVideoBench, подтверждая способность анализировать часовые записи без потери ключевых деталей.

Модели доступны на Hugging Face в двух вариантах:

🟢Kimi-VL-A3B-Instruct для стандартных задач;

🟠Kimi-VL-Thinking для сложных рассуждений.

▶️ Инференс через Transformers занимает несколько строк кода — достаточно загрузить изображение, задать запрос и получить подробный ответ.


📌Лицензирование: MIT License.


🟡Набор моделей
🟡Техотчет
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #VLM #KimiAI #MoonShotAI
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍42
Forwarded from Machinelearning
✔️ OpenAI добавила в API модель генерации изображений GPT-Image-1.

OpenAI открыла доступ к GPT-Image-1 через API — ранее она работала только в ChatGPT.
Стоимость генерации тарифицируется по токенам: текст ($5/млн), ввод изображений ($10/млн), вывод ($40/млн). Одно изображение обходится в $0,02–0,19. Например, картинка 1024×1024 в высоком качестве «съест» 4160 токенов. Модель превосходит Midjourney-v7 в точности следования запросам, но имеет ограничения: плохо распознаёт мелкий текст, нелатинские шрифты, медицинские данные.

Изображения можно загружать через URL или Base64 (PNG, JPEG до 20 МБ). Максимальное разрешение — 768×2000 пикселей. API анализирует объекты, цвета, текст, но не подходит для задач с высокой точностью. Для безопасности добавлены фильтры контента и метаданные C2PA. Тестировать модель можно в Playground OpenAI — подробности в гайдах по работе с API.
openai.com

✔️ Kortix AI выпустила Suna — первый в мире опенсорсный ИИ-агент общего назначения.

Suna — открытый ИИ-агент, способный выполнять реальные задачи через чат-интерфейс. В отличие от закрытых коммерческих моделей, Suna работает офлайн, бесплатен и доступен для самостоятельного хостинга.

Suna не просто отвечает на вопросы: он автоматизирует рутину — от парсинга сайтов и генерации отчетов до развертывания веб-приложений. В основе лежит изолированная Docker-среда, React/Next.js для интерфейса и интеграция с LiteLLM, Supabase и Redis. Помимо исходного кода, есть подписка на развернутый у Kortix AI сервис: бесплатно 10 минут в месяц, за 29$ - 4 часа, а за 199\мес - 40 часов работы Suna.
suna.so

✔️ Firefox анонсировал предпросмотр ссылок с локальным ИИ.

Пользователи Firefox теперь могут заглянуть в содержимое ссылки, не открывая ее. Экспериментальная функция в Firefox Labs 138 показывает карточку с заголовком, описанием, временем чтения и тремя ключевыми пунктами, сгенерированными локальной языковой моделью. Все работает через HTTPS-запросы без загрузки страницы или выполнения скриптов — данные парсятся из метатегов Open Graph и Reader View.

Приватность в приоритете: модель SmolLM2-360M (369 МБ) запускается на устройстве через WebAssembly (wllama), избегая передачи данных в облако. Функция пока в тесте: разработчики ждут фидбека об опыте использования от пользователей.
blog.mozilla.org

✔️ xAI добавила 3 новые функции в Grok.

xAI расширила возможности голосового ассистента Grok: Grok Vision, поддержка многоязыкового аудио и поиск в реальном времени в голосовом режиме. Все это уже доступно пользователям iOS, а для Android-устройств две последние опции открыты только с подпиской SuperGrok. Grok Vision, как заявляют разработчики, позволяет ассистенту анализировать экран смартфона и комментировать происходящее «здесь и сейчас» — например, распознавать объекты или текст.
Ebby Amir (xAI) в X (ex-Twitter)

✔️ BMW внедрит ИИ DeepSeek в свои автомобили для Китая .

BMW объявил о партнерстве с DeepSeek для интеграции ИИ-технологий в машины, продаваемые в Китае. Сотрудничество, представленное на Шанхайском автосалоне, направлено на улучшение «Умного персонального ассистента» — система получит новые функции и расширенный доступ к данным.

Интеграция ИИ DeepSeek ускорит переход BMW к «программно-определяемым» автомобилям. Ожидается, что обновления затронут не только ассистента, но и улучшат интерфейсы, а также поддержат более сложные сценарии автономного управления.
bmwblog.com

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
4👍4
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
✔️ Y Combinator назвал главные тренды лета 2025 для стартапов.

Y Combinator сделал ставку на ИИ-агентов, способных переосмыслить целые индустрии. Вместо точечных решений, основателям советуют создавать «полноценные ИИ-компании» - например, запускать собственные юридические бюро с ИИ-юристами вместо сотрудников. Такой подход позволяет обойти медлительных конкурентов, предлагая клиентам более дешевые и эффективные сервисы.

Особый интерес к автоматизации рутины: персональные ассистенты, которые не просто напоминают о задачах, а самостоятельно отвечают на письма, планируют встречи и имитируют стиль общения пользователя. Y Combinator верит: будущее за командами, которые не просто внедряют ИИ, а перестраивают рынки с нуля, как это сделали Airbnb или Stripe.
ycombinator.com

✔️ ИИ помог создать синтетические ДНК-усилители для контроля генной экспрессии.

Ученые из Центра геномной регуляции в Барселоне впервые применили генеративный ИИ для проектирования синтетических молекул ДНК, способных управлять активностью генов в здоровых клетках млекопитающих. Модель, обученная на данных тысяч экспериментов, генерирует последовательности «с нуля», задавая критерии.

В качестве теста создали фрагменты ДНК, активирующие ген флуоресцентного белка в клетках крови мышей. Результаты совпали с прогнозами: синтетические усилители генной активности работали как «переключатели» в зависимости от типа клеток. Исследование открывает путь к персонализированным методам коррекции генов. По словам авторов, это похоже на «написание софта для биологии», где каждая инструкция для клетки становится программируемой.
technologynetworks.com

✔️ OpenAI запускает HealthBench.

OpenAI представила HealthBench - бенчмарк для тестирования ИИ-систем в сфере здравоохранения. Разработанный при участии 262 врачей из 60 стран, он включает 5000 реалистичных диалогов, имитирующих общение пациентов и медиков. Каждый сценарий оценивается по индивидуальным критериям, созданным экспертами: точность данных или ясность ответов.

Всего в бенчмарке 48 562 параметра оценки, что позволяет глубоко анализировать работу моделей. Особый упор сделан на надежность: даже один ошибочный ответ в медицине критичен. HealthBench включает подборки сложных кейсов (HealthBench Hard), где современные ИИ еще отстают. Все данные и методики уже доступны в GitHub-репозитории OpenAI .
openai.com

✔️ Google запускает фонд для стартапов.

Google анонсировала AI Futures Fund — программу для поддержки ИИ-стартапов. Участники получат ранний доступ к моделям DeepMind (Gemini, Imagen и Veo). Кроме технологий, стартапы смогут консультироваться с инженерами и исследователями Google, а также получат облачные кредиты для обучения и масштабирования решений. Уже сейчас с фондом работают проекты из разных сфер: индийский Toonsutra внедряет Gemini для перевода комиксов, Viggle экспериментирует с генерацией мемов, а платформа Rooms тестирует интерактивные 3D-пространства.

Программа открыта для стартапов из регионов, где доступен Gemini. Подать заявку можно на сайте фонда. Участники смогут претендовать не только на технические ресурсы, но и на прямые инвестиции от Google.
blog.google

✔️ Поддельные ИИ-инструменты распространяют стиллер Noodlophile.

Злоумышленники активно используют популяризацию ИИ для распространения вредоносного стиллера Noodlophile, маскируя атаки под сервисы для генерации видео и изображений. Как сообщает Morphisec, фейковые страницы Luma Dreammachine Al и CapCut AI рекламируются через соцсети, собирая до 62 000 просмотров на пост. Пользователям предлагают скачать «ИИ-софт», но вместо этого загружается ZIP-архив с исполняемым exe-файлом.

Запуск файла активирует легитимный CapCut.exe, который загружает .NET-лоадер CapCutLoader. Тот, в свою очередь, запускает Python-скрипт, устанавливающий Noodlophile Stealer. Вредонос крадет пароли, данные кошельков и другую информацию, а в некоторых случаях дополняется трояном XWorm для удаленного доступа. Эксперты напоминают: атаки через ИИ-технологии стали трендом. Осторожность — лучшая защита.
thehackernews.com

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥31
Forwarded from Machinelearning
🌟 V-Triune от MiniMax: RL для VLM.

V-Triune - фреймворк с новым методом обучения VL-моделей, через единый алгоритм подкрепления.

В отличие от традиционных методов трейна VLM, сосредоточенных на отдельных задачах вроде решения математических задач или обнаружения объектов, V-Triune обучает модели одновременно работать с рассуждениями и восприятием. RL в V-Triune действует как механизм «настройки» уже заложенных в модель возможностей, а не добавляет новые навыки.

Это достигается за счет 3 ключевых компонентов: форматирования данных на уровне выборок, вычисления наград через специализированные верификаторы и мониторинга метрик по источникам данных.

Например, динамическая награда IoU адаптирует пороги точности для обнаружения объектов — сначала стимулируя базовое понимание, а затем требуя высокой точности.


Тестирование проводилось на бенчмарке MEGA-Bench из440 задач — от анализа графиков до OCR. Экспериментальные модели Orsta (7B и 32B параметров), обученные с V-Triune, показали прирост производительности до +14,1% по сравнению с базовыми версиями.

На задачах восприятия (обнаружение объектов в COCO), улучшения достигли +12,17% для mAP@50. Для математических задач (MathVista) результаты выросли на 5%, а в OCR — на 1-2%. При этом система стабильно работала даже при обучении на смешанных данных, что косвенно подтвердило ее универсальность.

Minimax открыли (но пока не загрузили его в репозиторий) код V-Triune и модели Orsta:

🟢Orsta-32B-0326 - стабильная версия на более поздней QwenVL-2.5-32B;
🟠Orsta-32B-0321 - версия с замороженным ViT на базе QwenVL-2.5-32B-0321;
🟢Orsta-7B - на базе Qwen2.5-VL-7B-Instruct.

⚠️ В версии 0321 попытки совместного обновления визуального и языкового модулей приводили к взрыву градиентов, поэтому ViT пришлось заморозить. В 0326, благодаря исправлениям в архитектуре, RL-тренинг стал стабильнее. 0326 рекомендуется для задач, где критична точность и надежность форматов ответов.


📌Лицензирование: MIT License.


🟡Набор моделей
🟡Arxiv
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #VLM #RL #Framework #MiniMax
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
2👍2🔥1
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
✔️ xAI и Telegram планируют партнерство по внедрению Grok.

По словам Павла Дурова, его платформа и компания Илона Маска xAI заключили годовое соглашение. xAI заплатит Telegram $300 млн. за интеграцию чат-бота Grok прямо в мессенджер. Помимо этого, Telegram также будет получать 50% от выручки с подписок на Grok, которые будут продаваться внутри платформы.

Илон Маск позже написал в X: "Контракт еще не подписан". Однако он не стал уточнять детали, оставив вопрос открытым. Пока что официальная позиция Telegram – сделка есть, и она принесет пользователям лучший ИИ на рынке уже этим летом.

Новость пришла на фоне важных для Telegram событий: сервис преодолел отметку в 1 млрд. активных пользователей в месяц в этом году и разместил облигации на $1.5 млрд.
Pavel Durov

✔️ Anthropic открывает бесплатный доступ к веб-поиску в Claude для всех пользователей.

Anthropic сняла ограничения с функции веб-поиска в Claude: теперь даже бесплатные пользователи смогут получать ответы на основе актуальных данных из интернета. Ранее, доступ к этой опции, которая анализирует информацию в реальном времени, был эксклюзивом для платных подписчиков. Это изменение позволит чаще обновлять знания модели и точнее решать задачи.

Параллельно стартовало тестирование голосового режима в мобильном приложении. Пользователи могут общаться с Claude в формате диалога, выбирая из 5 вариантов голоса и получать краткие текстовые сводки прошлых бесед. По умолчанию для диалогов задействована модель Sonnet 4.
support.anthropic

✔️ OpenAI тестирует вход через ChatGPT для сторонних сервисов.

OpenAI активно прорабатывает функцию "Вход через ChatGPT", позволяющую пользователям авторизовываться в сторонних приложениях через свои аккаунты ChatGPT. Компания уже собирает заявки от разработчиков, желающих интегрировать эту опцию в свои сервисы. Пилотный запуск для тестирования уже доступен в Codex CLI — инструменте для работы с ИИ в терминале. Разработчики могут подключить ChatGPT Free, Plus или Pro к своим API-аккаунтам, получая бонусные кредиты ($5 для Plus и $50 для Pro).

Это стратегический ход для расширения экосистемы. С 600 млн активных пользователей ежемесячно, "Вход через ChatGPT" может стать ключевым элементом, помогая OpenAI конкурировать с Google и Apple в сфере единого входа и онлайн-сервисов. Точные сроки публичного релиза пока неизвестны.
techcrunch

✔️ Google Photos обновляет редактор нейросетями к 10-летию сервиса.

К своему юбилею Google Photos получает мощное обновление, сфокусированное на ИИ-редактировании. Сервис, где ежемесячно редактируют 210 млн. снимков, теперь предлагает умные подсказки по улучшению кадра одним нажатием. Можно тыкнуть пальцем или обвести область — нейросеть предложит подходящий инструмент. Главные новинки — "Reimagine" и "Auto Frame", ранее доступные только на Pixel 9.

"Reimagine" меняет выбранный объект или добавляет новый по текстовому запросу через генеративный ИИ. "Auto Frame" автоматически кадрирует фото, а нейросеть дорисовывает фон. Плюс Google добавит QR-коды для альбомов, чтобы удобно собирать фото с мероприятий. Правда, обновленный редактор появится на Android в июне, а владельцам iPhone ждать до конца года.
arstechnica

✔️ Resemble AI открыли код Chatterbox — SOTA для клонирования голоса.

✔️ Яндекс открыл прием заявок на ежегодную премию Yandex ML Prize.

С 28 мая стартовал прием заявок на ежегодную премию Yandex ML Prize 2025. Эта награда — реальное признание и поддержка для тех, кто растит новые кадры ML в России. Премия существует с 2019 года как память об Илье Сегаловиче, и за шесть лет её получили уже 60 выдающихся педагогов и руководителей.

Податься могут вузовские преподаватели, ученые из исследовательских центров и руководители образовательных программ в области Сomputer Science. Победителей ждут денежные призы и полезные гранты на Yandex Cloud, которые точно пригодится в работе: делать новые курсы, организовывать хакатоны и проводить исследования вместе со студентами.

Заявки принимают до 22 июня. Само награждение, как обычно, пройдет осенью.
habr.com

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥42👎1🥰1
Forwarded from Machinelearning
🌟 HumanOmniV2: модель, которая понимает контекст видео.

Alibaba Group разработали HumanOmniV2, модель на базе Qwen2.5-Omni-7B-thinker, которая получила навык осмысления визуального контекста за счет изменения самого процесса мышления модели. Ее научили следовать строгому формату: сначала описать контекст, потом рассуждать и только затем давать ответ.

Теперь, прежде чем отвечать на вопрос, модель генерирует подробное описание сцены в теге <context>. На этом этапе она фиксирует, кто что делает, какой фон, какие звуки слышны. Только после этого в теге <think> она строит логическую цепочку рассуждений, связывая вопрос с собранным контекстом. И лишь в конце выдает результат в теге <answer> .

Чтобы этот подход работал, его усилили системой вознаграждений на основе RL. За точность и правильный формат модель получает стандартные награды, но были введены и две новых:

🟢«Награда за контекст» дается, если его описание полное и релевантное, причем качество этого описания оценивает другая, более мощная LLM;

🟢«Логическая награда» проверяет, что в своих рассуждениях модель действительно использовала данные из видео и аудио, а не проигнорировала их.

Для оценки HumanOmniV2 создали бенчмарк IntentBench (633 видео, 2689 вопросов) на основе Social-IQ 2.0, EMER и MDPE.

Его фишка в том, что вопросы требуют одновременного анализа: видеоряда (жесты, микровыражения), диалогов (тон, смысл реплик) и социального контекста (ирония, обман, скрытые намерения).

Тестовая модель обошла открытые аналоги на 3 бенчмарках:

🟠Daily-Omni: 58.47% (53.13% у MiniCPM-o 2.6);
🟠WorldSense: 47.1% (45.4% у Qwen2.5-Omni);
🟠IntentBench: 69.33% (64.20% у Qwen2.5-Omni).


📌Лицензирование: Apache 2.0 License.


🟡Модель
🟡Arxiv
🖥GitHub


@ai_machinelearning_big_data

#AI #ML #MMLM #HumanOmniV2 #Alibaba
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍96
Forwarded from Machinelearning
🌟 OpenReasoning-Nemotron: набор ризонинг-моделей от NVIDIA.

OpenReasoning-Nemotron - набор LLM на архитектуре Qwen 2.5 и дистиллированных из DeepSeek-R1-0528 ( 671 млрд. параметров):

🟠OpenReasoning-Nemotron-1.5B;
🟠OpenReasoning-Nemotron-7B;
🟠OpenReasoning-Nemotron-14B;
🟢OpenReasoning-Nemotron-32B;

Семейство было обучено на 5 млн. примеров рассуждений в математике, естественных науках и программировании.

Модели показали достойные результаты pass@1 на бенчах GPQA, MMLU-PRO, AIME, HMMT и LiveCodeBench - без использования RL.

Старшая модель, 32B, выбила 96,7% по HMMT с декодированием GenSelect.


📌Лицензирование: CC-BY-4.0 License.


🟡Статья
🟡Набор моделей


@ai_machinelearning_big_data

#AI #ML #LLM #Reasoning #Nemotron #NVIDIA
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
7👍3🔥2🥰1😁1
Forwarded from Machinelearning
🌟 Hierarchical Reasoning Model: иерархическая модель рассуждений, имитирующая работу мозга человека.

Hierarchical Reasoning Model, (HRM) - рекуррентная архитектура, которая черпает вдохновение в принципах работы человеческого мозга. В ее основе лежат 2 взаимозависимых рекуррентных модуля:

🟢Первый, высокоуровневый модуль (H-модуль), отвечает за медленное, абстрактное планирование, подобно тета-волнам в мозге.

🟢Второй, низкоуровневый модуль (L-модуль), занимается быстрыми и детализированными вычислениями, аналогично гамма-волнам.

Эта структура дает модели достигать вычислительной глубины, необходимой для сложных рассуждений, при этом сохраняя стабильность и эффективность во время обучения, чего так не хватает стандартным трансформерам.

🟡Взаимодействие модулей назвали "Иерархической конвергенцией".

Процесс кардинально отличается от того, что происходит в обычных рекуррентных сетях, которые склонны к преждевременной сходимости, когда их скрытое состояние быстро стабилизируется, и дальнейшие вычисления практически прекращаются. В HRM все иначе:

🟠Сначала быстрый L-модуль выполняет серию итераций, находя локальное равновесие для текущего шага задачи. Его итоговое состояние передается медленному H-модулю.

🟠H-модуль, в свою очередь, осмысливает полученный результат, выполняет один шаг собственного, более абстрактного обновления и задает совершенно новый контекст для L-модуля.

Таким образом, вычислительный путь низкоуровневого модуля перезапускается, направляя его к новой точке локального равновесия. Механизм не дает системе застрять и позволяет ей последовательно выполнять множество различных, но взаимосвязанных этапов решения, выстраивая длинные логические цепочки.

Тестовая модель HRM с 27 млн. параметров, обученная всего на 1000 примерах без какого-либо претрейна или CoT-пар, показала неожиданно высокие результаты .

На задачах, требующих глубокого поиска и перебора вариантов ( Sudoku-Extreme ) и поиск оптимального пути ( Maze 30x30 ), HRM достигла почти идеальной точности, а вот CoT-методы полностью провалились с результатом 0%.

На бенчмарке ARC-AGI-1, HRM показывает точность в 40.3%. Для сравнения, o3-mini-high показала 34.5%, а Claude 3.7 с контекстом 8K - 21.2%.

▶️ Веса моделей для самостоятельного воспроизведения тестов:

🟢ARC-AGI-2;
🟢Sudoku 9x9 Extreme (1000 examples);
🟢Maze 30x30 Hard (1000 examples);


📌Лицензирование: Apache 2.0 License.


🟡Статья
🟡Arxiv
🖥Github


@ai_machinelearning_big_data

#AI #ML #HRM #SapientInc
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
9🔥6🥰2👍1🤔1
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
💡 GPT-5 и Sudoku-Bench, почему новые модели всё ещё ломаются на судоку

Sakana AI представили Sudoku-Bench - набор классических и продвинутых судоку-задач, который проверяет не память модели, а её способность рассуждать, понимать новые правила и держать всю логику пазла в голове.

Они протестировали современные модели, включая GPT-5 и методы тонкой настройки вроде GRPO и thought-cloning.

Главное:
GPT-5 стала первой моделью, которая уверенно решает часть сложных задач и показала около 33 % успешных решений на наборе challenge_100. Ранее ни одна LLM не справлялась даже с обычным 9×9.
Но треть решённых - это всё ещё мало: большая часть задач остаётся нерешённой, особенно варианты с необычными правилами.

Ключевая трудность в том, что такие головоломки требуют не просто следовать правилам, а уметь понять незнакомые ограничения, найти стратегию «входа», просчитывать ходы вперёд и сохранять глобальную согласованность. Модели часто делают правильные локальные шаги, но теряют общую структуру.

GRPO и thought-cloning дают улучшения, но пока не позволяют моделям преодолеть сложные варианты. Даже с обучением на человеческих примерах ИИ быстро «запутывается» в длинных логических цепочках.

Sudoku-Bench - это тест на реальное рассуждение, а не на подбор паттернов. Он проверяет пространственное мышление, логику, способность адаптироваться и работать с новыми правилами. Прогресс на таких задачах - показатель движения к более структурному и осмысленному ИИ.

Авторы предлагают Sudoku-Bench как стандарт, по которому можно судить, насколько модели действительно умеют думать. Для будущих систем важны не просто большие параметры, а развитая логика, планирование и умение работать с новыми структурами задач.

@ai_machinelearning_big_data

#ai #ml #sakana
Please open Telegram to view this post
VIEW IN TELEGRAM
8😁5
Forwarded from Machinelearning
⚡️ ChatGPT 5.2 "Code Red" выйдет 9 декабря.

The Verge пишет, что по информации инсайдеров, OpenAI планирует представить обновление уже в начале следующей недели, ориентировочно 9 декабря.

Ожидается, что GPT-5.2 вернет компании доминирующие позиции в сегменте больших языковых моделей.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
5👍1👎1
Forwarded from Machinelearning
📌 AxiomProver доказала нерешенные математические гипотезы.

История началась с тупика, в который зашли математики Давей Чен и Квентин Жендрон. Пять лет назад они пытались разобраться в сложном разделе алгебраической геометрии, связанном с дифференциалами - элементами математического анализа, используемыми для измерения расстояний вдоль изогнутых поверхностей.

В ходе работы они зашли в тупик: их рассуждения опирались на странную формулу из теории чисел, но ни доказать ее, ни обосновать они не смогли. В итоге Чэнь и Жандрон опубликовали работу, в которой представили свою идею как гипотезу, а не как теорему.

Попытки Чена использовать ChatGPT для поиска решения оказались бесполезными - языковая модель просто не справлялись с задачей такого уровня абстракции.

Прорыв случился благодаря встрече Чена с Кеном Оно, известным математиком, работающим в Axiom. Узнав о проблеме, Кен загрузил исходные данные в систему AxiomProver.

К утру ИИ выдал готовое доказательство. Prover обнаружил связь между задачей Чена-Жендрона и числовым феноменом, впервые изученным еще в XIX веке. Затем система сама разработала доказательство и, что важно, самостоятельно его верифицировала.

По словам Кена Оно, алгоритм нашел то, что упустили все люди-эксперты, работавшие над темой. Результат оформили и опубликовали на arXiv и положили на Github.

AxiomProver представляет собой гибрид LLM и уникального движка для логического вывода с использованием языка формальной верификации Lean. Этот микс позволяет системе строить цепочки рассуждений, математическая корректность которых проверяется автоматически.


Подход напоминает систему AlphaProof от Google, но, по словам CEO Axiom Карины Хонг, они задействовали ряд новых техник, позволяющих выходить за рамки простого поиска по существующей литературе.

Еще более впечатляющим выглядит кейс системы с гипотезой Феля, касающейся сизигий - математических соотношений, в которых числа выстраиваются в алгебраические закономерности. Она опирается на формулы, впервые обнаруженные более 100 лет назад в записных книжках легендарного индийского математика Сринивасы Рамануджана.

В этом случае AxiomProver не просто заполнил недостающее звено - он разработал доказательство от начала до конца. Воспроизвести трек доказательства может любой желающий, код - на Github.

К слову, система буквально в январе этого года решила все 12 задач математической олимпиады Putnam, самого престижного конкурса для студентов бакалавриата.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
11👍9🔥3
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
✔️ OpenAI добавила ручной сброс лимитов для Codex

Компания изменила механизм управления rate limits для своего ИИ-агента. На тарифах Go, Plus, Pro и Business теперь можно накапливать сбросы лимитов и активировать их вручную при пиковых нагрузках. Ранее таймеры обнулялись автоматически.

На старте все подписчики получают 1 бесплатный сброс. Дополнительно запущена двухнедельная реферальная программа: клиенты на Plus и Pro могут пригласить до 3 коллег. После первого запроса от нового пользователя обе стороны получают по дополнительному сбросу в резерв.

По неофициальным данным, обновление связано с конкуренцией с Anthropic и подготовкой к снижению цен на токены для корпоративных клиентов.
OpenAI в сети Х

✔️ Nvidia открыла предзаказ на процессоры Vera в Китае

Серверные ARM-процессоры Vera, спроектированные для инференса автономных ИИ-агентов, стали доступны для китайских компаний. Первые поставки ожидаются в августе.

Один из локальных облачных провайдеров уже заказал более 300 серверов на базе Vera для пилотного запуска в зарубежных дата-центрах. По предварительным оценкам, стоимость одного чипа превысит $20 000, а стойка на 256 процессоров обойдется в $10 млн.

Ставка на CPU стала ответом на заморозку поставок H200. В отличие от GPU, процессоры несут меньше санкционных рисков. Массовый переход китайских компаний на новые чипы теперь зависит от адаптации программных экосистем под ARM-архитектуру.
reuters.com

✔️ Xiaomi выпустила открытого ИИ-агента MiMo Code

Китайский техногигант представил терминального агента MiMo Code на базе OpenCode. Инструмент под лицензией MIT решает проблему потери контекста в задачах из сотен последовательных шагов.

В слепом A/B-тестировании на 474 репозиториях агента сравнили со связкой Claude Code и Sonnet. На коротких дистанциях зафиксирован паритет, но в задачах длиннее 200 шагов решение Xiaomi обошло конкурента в 65% случаев.

Архитектура MiMo Code опирается на бесконечные логические сессии. Субагент регулярно сохраняет промежуточные состояния на диск, а при исчерпании лимита токенов сессия перезапускается, загружая накопленные данные в новое окно. Память разделена на 4 уровня: от коротких локальных заметок до постоянных фактов проекта.

Установка доступна через менеджер пакетов NPM или Bash-скрипты.
xiaomi.com

✔️ Google подала иск против китайской кибергруппировки за автоматизацию фишинга

Согласно иску, группа Outsider Enterprise разработала 131 инструмент для потоковой генерации копий сайтов Google, YouTube и госструктур США. За две недели Android-пользователи получили 2,5 млн сообщений, содержащих 1 млн фишинговых ссылок. Инфраструктура координировалась через Telegram.

Google выступает в суде совместно с ФБР и телеком-операторами AT&T, T-Mobile и Verizon. Истцы требуют судебного запрета для создания правового механизма, который позволит оперативно блокировать домены и замораживать счета сети.

Размер ущерба по делу не раскрывается.
blog.google

✔️ LLM обошли клинические RAG-инструменты в медицине

Nature Medicine опубликовал исследование, которое показало, что универсальные LLM превосходят профильные клинические ИИ-инструменты.

В слепом тестировании (12 врачей, 1800 реальных запросов) Gemini 3.1 Pro и GPT-5.2 набрали 97,4% и 94,2% точности соответственно. Результаты спецсистем OpenEvidence и UpToDate Expert AI составили около 80%.

Авторы объясняют отставание профильных решений сильной зависимостью от RAG - нерелевантная литература и ошибки интеграции снижают качество генерации. Универсальные модели выигрывают за счет масштаба, кросс-доменного обучения и механизмов логического вывода.

Медицинские системы также продемонстрировали операционные проблемы. OpenEvidence выдавал хаотичные ответы, а UpToDate Expert AI отклонил 19% запросов из-за жестких фильтров безопасности. Частота галлюцинаций базовых LLM не превысила показатели профильных аналогов.

Авторы рекомендуют клиникам проводить независимое тестирование ИИ-продуктов перед внедрением.
nature.com

@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
3👍2🔥1
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Власти США сняли экспортные ограничения на Fable 5 и Mythos 5

Минторг США официально отменил ограничения, наложенные ранее на Claude Fable 5 и Mythos 5.

В Anthropic подтвердили, что полноценный доступ к моделям для будет открыт уже завтра.

Создатели поблагодарили аудиторию за терпение в период вынужденной приостановки сервисов, а также выразили признательность всем специалистам, помогавшим в повторном развертывании систем.

Ожидается, что в ближайшее время Anthropic выпустит патчноуты с дополнительной информацией и раскроет дальнейшие планы по развитию линейки.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
😁9👍1🔥1🥰1💩1
Forwarded from Machinelearning
📌 Физики создали память на механических колебаниях для квантового компьютера

Группа из Швейцарской высшей технической школы Цюриха экспериментально продемонстрировала квантовые вычисления, в которых рабочая память построена на механических колебаниях, а не на электромагнитных состояниях.

Архитектура скопирована с классического компьютера, где процессор и оперативная память разделены.

Роль процессора играет сверхпроводящий кубит, а роль памяти - крошечные механические резонаторы внутри квантового чипа, элементы, отдалённо похоже на гитарные струны, которые при записи информации начинают колебаться на частотах за пределами слышимого.

Для вычисления кубит обращается к колебанию в памяти, обрабатывает и изменяет его состояние, а затем записывает обратно. Такое разделение вычислений и хранения отличает подход от многих существующих квантовых схем, где обработка и память тесно переплетены.

🟡Ставка на механику объясняется двумя ограничениями

Сегодня квантовую память чаще всего делают электромагнитной в связке со сверхпроводящими кубитами - обе технологии хорошо изучены и позволяют считывать и менять квантовые состояния с высокой точностью.

Но такие элементы относительно громоздки, что мешает превращать лабораторные установки в практические машины.

Механические резонаторы заметно компактнее, а главное - ёмче (как струна может звучать разными тонами, резонатор поддерживает множество мод колебаний, и каждая мода работает как отдельная ячейка памяти).

Вдобавок, по данным группы, механические состояния дольше остаются стабильными - информация не затухает так быстро, как в электромагнитных аналогах.

🟡Работоспособность проверили на реальных задачах

Первая - квантовое преобразование Фурье, базовая процедура, на которую опираются многие квантовые алгоритмы, включая знаменитый алгоритм Шора для разложения чисел на множители.

Вторая - поиск периода функции, продемонстрировавший применение этой процедуры на практике.

Обе задачи требуют одновременно и точно управлять множеством квантовых состояний, хранить их и связывать между собой, не разрушая их хрупкую природу.

Авторы говорят, что их схема в принципе способна выполнять все базовые операции, необходимые для произвольного квантового вычисления, то есть годится как основа универсального программируемого квантового компьютера.

🔜 Почитать полную статью можно в в журнале Science


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍4
Forwarded from Machinelearning
📌 Теренс Тао: в математике кризис из-за ИИ

На Международном конгрессе математиков в Филадельфии Теренс Тао (медаль Филдса 2006 года) прочитал лекцию "Математика в эпоху ИИ".

Его тезис: сообщество входит в период, сопоставимый с кризисом оснований 1900-1930 годов, когда парадокс Рассела и теоремы Гёделя заставили математиков пересмотреть базовые допущения.


Только пересматривать теперь придётся не логику, а ценности и правила профессии.

Публичные свидетельства о возможностях моделей Тао оценил сдержанно - собраны в основном вне контролируемых условий, подвержены смещению в отчётности и коммерческим стимулам, часть издержек и переменных не раскрывается.

Исключением он считает проект First Proof - независимую проверку, где 28 мая 2026 года 4 системы получили 10 новых исследовательских задач, а решения рецензировали эксперты.

По итогам 7 задач из 10 хотя бы одна из систем решила на уровне, пригодном для публикации. Стоимость вычислений составила от 10 до 1000 долларов на задачу.

Тао разложил работу математика на 5 стадий: получение доказательства, его проверка, внятное изложение, принятие сообществом через публикацию, и наконец канонизация - попадание в учебники.

ИИ хорошо справляется с первой стадией и заметно продвинулся на второй, остальные, по его словам, остаются человеческими и идут медленно.

Отсюда переход от "дефицита к избытку" - доказательства копятся в очереди на проверку, проверенные ждут читаемого изложения, а рецензирование не справляется с потоком.

Признаки этого видны уже сейчас. На сайте задач Эрдёша скопились десятки присланных ИИ доказательств, которые никто не взялся подтвердить, причём часть отправителей заявили, что сами не в состоянии их проверить.

Возможна ситуация, допускает Тао, когда формально верное доказательство важного результата не сможет объяснить ни один человек.


🟡Рекомендации

Нормализовать открытое признание того, что при работе использовался ИИ - хуже всего скрытое применение из страха перед коллегами.

Снизить престиж "решил первым" и поднять цену изложения, публикации и включения результата в общее знание.

Если авторы не могут внятно, на экспертном уровне и с корректными ссылками рассказать о собственном результате, публиковать его не следует.

Конгресс, который проходит раз в 4 года и вернулся в США впервые с 1986 года, работает до 30 июля.

Медали Филдса, самую престижную награду в математике, в этом году получили Дэн Юй, Джон Пардон, Джейкоб Цимерман и Ван Хун - за результаты, полученные без участия ИИ.


Презентацию лекции Тао выложил сам, запись обещана позже.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍95🤔2
Forwarded from Machinelearning
📌 ИИ-агент Tencent помог решить комбинаторную задачу полувековой давности.

Исследовательский агент Hyra на базе открытой модели Hy3, помог ученым разгадать математическую проблему, которая оставалась нерешенной более 50 лет.

Задача из области комбинаторной математики касалась того, насколько размер множества сумм целых чисел может превышать размер его множества разностей.

Научное сообщество давно доказало, что соответствующий показатель степени не превышает двух, но оставалось неизвестным, является ли эта верхняя граница оптимальной.


Агент использовал модель Hy3 для поиска специфических множеств и вывода общей конструкции. За 24 часа вычислений ИИ нашел ядро решения, которое в итоге легло в основу научного открытия. Ученым оставалось лишь проверить логику, внести корректировки и структурировать доказательство.

Для финальной верификации результата использовали GPT-5.6 Sol, которая помогла корректно перевести расчеты на язык Lean 4.

Итоговая статья подтвердила, что искомый показатель действительно может бесконечно приближаться к 2, делая эту границу оптимальным ответом.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍64🔥2
Forwarded from Machinelearning
✔️ Vercel, OpenAI и Microsoft представили единый стандарт упаковки плагинов для агентов

Vercel совместно с AWS, GitHub, Microsoft, OpenAI и командой Cursor выпустила открытый формат Agent Plugins. Стандарт унифицирует упаковку плагинов для ИИ-агентов.

Ранее структуру директорий и конфигурации навыков или MCP-серверов приходилось адаптировать под каждый клиент. Теперь достаточно собрать расширение в единую файловую структуру с общим манифестом, после чего совместимые платформы распознают и загружают его напрямую.

На старте формат поддерживают ChatGPT, Codex, Cursor, GitHub Copilot, Kiro и VS Code. Версия 1.0.0 стандартизирует только базовые компоненты - Agent Skills и MCP-серверы.

Дистрибуция, установка, управление правами доступа, а также специфичные команды и хуки остаются на стороне провайдеров.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
7
Forwarded from Machinelearning
Media is too big
VIEW IN TELEGRAM
✔️ OpenAI сделала подростковую версию ChatGPT

Пользователей 13-17 лет ChatGPT будет автоматически переводить в безопасный режим. Возраст система определит по поведению, в совокупности она анализирует больше двух тысяч сигналов - от того, в какое время человек заходит, до того, как он формулирует запросы. Решила, что перед ней подросток, - режим включается сам.

В этом режиме модели запрещено изображать эмоциональную привязанность. Фильтры не пропускают контент для взрослых и не дают выдавать сведения о способах самоповреждения и о расстройствах пищевого поведения. Учебные задачи ChatGPT разбирает иначе - вместо готового решения задает наводящие вопросы.

Запуск идет на фоне исков, которые семьи подали к ИИ-компаниям, обвиняя их в психологическом вреде, нанесенном детям сгенерированным контентом.
openai.com

✔️ Cartesia выпустила синтезатор речи, вышедший на первое место у Artificial Analysis

Стартап из Стэнфорда представил Sonic-3.6 - модель синтеза речи реального времени на архитектуре моделей пространства состояний (SSM).

Sonic-3.6 возглавила сразу два рейтинга Artificial Analysis. В категории Controlled Voice, где синтезаторы гоняют на восьми одинаковых эталонных голосах, она обошла Eleven v3 от ElevenLabs.

Задержка до первого аудиокадра, по заявлению компании, меньше 90 мс. Есть управление темпом, громкостью и эмоциями, теги экспрессии внутри запроса и свои словари произношения с транскрипцией IPA. Голос клонируется по десятисекундному фрагменту.

Модель работает через API и в Cartesia Playground. Для проб есть бесплатный тариф, платные подписки начинаются от 5 долларов в месяц.
cartesia.ai

✔️ Artificial Analysis запустила бенчмарк поисковых API

Search Index сравнивает поисковые API, на которые опираются ИИ-агенты. В первый набор вошли Parallel, Exa, Firecrawl, You.com, Tavily, Keenable и Brave.

Замеряют в одинаковых условиях: агент на фреймворке Stirrup под управлением GPT-5.6 Luna проходит каждую задачу по 25 раз. Индекс складывается из трех тестов - DeepSearchQA (множественные запросы), BrowseComp (многошаговый поиск) и AA-Omniscience (вопросы из шести предметных областей).

Чем точнее выдача, тем дешевле инференс - агенту не приходится перебирать лишнее. Parallel Search срезает расход токенов больше чем на 40%, и хотя сам вызов API дороже, задача в сумме обходится в 0,084 доллара вместо 0,110.

Со скоростью сложнее. Очень быстрые, но менее точные поисковики заставляют агента делать лишние круги, так что итоговое время почти не отличается. Лучший баланс цены и качества показали Parallel и Firecrawl.

Методология открытая, новые API можно предлагать к добавлению.
ArtificialAnalysis в X

✔️ ElevenLabs открыла общую библиотеку сгенерированных звуков

В сервисе ElevenMusic заработала бесплатная библиотека аудиосемплов со встроенной моделью text-to-audio. Барабанные лупы, вокальные нарезки и звуковые эффекты генерируются по текстовому описанию, лимит - 25 запросов в день.

Все, что сгенерировано, попадает в общий каталог. Любой пользователь платформы может искать там звуки, слушать их и скачивать.
ElevenMusic в X

✔️ Американские авиакомпании запретили возить гуманоидных роботов

American Airlines запретила провоз гуманоидных и зооморфных роботов и в салоне, и в багаже. Раньше то же самое сделали Delta, United и Southwest.

Причина - литий-ионные батареи. У типичных гуманоидов они на 800-2500 Вт·ч, тогда как Федеральное управление гражданской авиации разрешает провозить устройства с батареями емкостью до 160 Вт·ч. Бортовые средства пожаротушения рассчитаны на ноутбуки и смартфоны и с загоревшимся аккумулятором такой емкости не справятся.

Обойти запрет не выйдет - робота не пустят на борт, даже если выкупить ему отдельное кресло или оформить как вспомогательное устройство.
simpleflying.com

Этот выпуск был озвучен моделью Sonic-3.6 в сервисе Cartesia.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
42❤‍🔥1👍1
Forwarded from Machinelearning
📌 Palomar - реестр проверенных LEAN-доказательств

Последние месяцы доказательства, сгенерированные ИИ, посыпались валом как для новых результатов, так и для старых, причем часть из них формализована на Lean и проверить такой репозиторий непросто, особенно если ты не эксперт. Нужно убедиться:

🟠что заявленные формальные утверждения действительно имеют доказательства, проходящие проверку типов;
🟠что в доказательствах нет жульничества;
🟠что формальные утверждения по смыслу совпадают с тем, что описано словами.

Под эту задачу и Теренс Тао запустил Palomar - реестр математики, верифицированной на Lean. Инициативу вырастили Lean FRO и ICARM.

Прием заявок уже идет, чтобы в него попасть, в репозитории должно быть три вещи:

🟢challenge file с коротким и читаемым человеком описанием заявленных результатов на Lean;
🟢solution module с доказательством любой длины;
🟢файл formalization.yaml, где те же результаты изложены обычным языком и собраны метаданные и раскрытия.

Снимок поданного репозитория проверяют двумя этапами.
Сначала инструмент Comparator смотрит, что solution module типизируется и доказывает ровно то, что заявлено в challenge file. После этого языковая модель сверяет, похоже ли неформальное описание в на то, что заявлено формально.

Прошел оба - попал в реестр. Принимают формализации и старых результатов, и новых. Кто автор доказательства - человек, ИИ или оба вместе - значения не имеет.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍74❤‍🔥2