Независимая бенчмарк-платформа Vals представила Vals-Smith - инструмент для автоматической генерации кастомных бенчмарков на основе кодовой базы пользователя.
Vals-Smith позволяет тестировать модели и агентов на специфике собственных проектов, не полагаясь на публичные лидерборды. Инструмент поддерживает открытые и приватные репозитории.
Система анализирует GitHub-репозитории и извлекает задачи из принятых PR.
Каждое задание включает описание проблемы, скрытые проверки и воспроизводимую среду. Модель получает код до внесения правок (сам патч скрыт).
Для успешного решения испытуемая должна пройти скрытые тесты и не нарушить существующую логику приложения.
Доступ к платформе выдается по заявкам. Есть демо-результаты тестирования популярных моделей на задачах из исходников Linux, Next.js, SGLang и Spark.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔54👍40👏9🔥7❤6💯5
Если коротко - от K2 архитектура K3 отличается почти во всём.
В K2 все слои (61) работали на одном механизме, MLA. В K3 слоёв 93, и собраны они блоками - 3 слоя KDA и один глобальный MLA, суммарно 69 и 24.
KDA сжимает предыдущий текст в состояние фиксированного размера, поэтому длина диалога перестаёт раздувать кэш.
Явных позиционных меток в модели нет, и она растягивается до миллиона токенов без привычных приёмов вроде перенастройки RoPE.
Обычно слой получает всё накопленное предыдущими слоями одной суммой.
Attention Residuals позволяют каждому слою выбирать, из каких ранних блоков брать информацию. 93 слоя K3 разбиты на 8 блоков по 12.
Маршрутизируемых экспертов теперь 896 против 384 у K2, на токен активируются 16 вместо 8, общих экспертов стало 2 вместо одного.
Считают они во вдвое более узком латент спэйсе, чем основной, а результат возвращают в общий поток.
Функцию активации SwiGLU заменили на SiTU-GLU, схему балансировки нагрузки - на Quantile Balancing.
Общий профит Moonshot оценивает примерно в 2,5 раза по эффективности масштабирования.
Тут сыграло роль не столько железо, сколько дообучение. 3 специализации (общие задачи, агенты, код) обучали отдельно, каждую на трёх уровнях ризонинга, а 9 получившихся моделей слили в одну.
Отдельные тренировочные эпизоды доходят до тысяч вызовов инструментов, причём состояние файлов, приложений и виртуальных машин сохраняется между шагами.
@ai_machinelearning_big_data
#AI #ML #LLM #KimiK3 #MoonshotAI
Please open Telegram to view this post
VIEW IN TELEGRAM
🤓133👌39❤30👏17👍10🔥5🤔4🥱1💘1
This media is not supported in your browser
VIEW IN TELEGRAM
OpenAI проанализировала 800 тысяч промптов к ChatGPT и выявила эффект пересечения задач. В 43,5% случаев пользователи делегируют модели задачи вне своей основной специальности.
Чаще всего пересечение затрагивает инженерию и маркетинг. Сотрудники непрофильных отделов с помощью LLM анализируют данные, ревьюят контракты и ищут баги в коде. Эффект наиболее заметен в небольших компаниях без выделенных команд узких специалистов.
Для классификации запросов исследователи использовали американскую базу профессий O*NET. Из выборки исключили генерацию текстов, саммаризацию и планирование.
openai.com
Корпорация выпустила компактную модель MAI-Cyber-1-Flash для поиска уязвимостей в коде. В составе мультиагентной системы MDASH она показала точность 96% на бенчмарке CyberGym, опередив Mythos на 12 пунктов и превзойдя актуальные версии моделей OpenAI и Google.
Архитектура новинки базируется на линейке MAI-Thinking-1. Модель самостоятельно обрабатывает 90% задач, а сложные случаи пересылает на GPT-5.4. По оценкам компании, такой подход снижает затраты на безопасность в 2 раза.
Одновременно запущена агентная система мониторинга и нейтрализации угроз Perception. Она обрабатывает 100 трлн сигналов ежедневно, используя телеметрию 1,6 млн клиентов.
MAI-Cyber-1-Flash не выйдет в open-source и не будет доступна через API. Модель останется эксклюзивным компонентом коммерческих платформ MDASH и Perception.
microsoft.ai
Публичные ссылки на диалоги в Claude попали в выдачу поисковиков из-за отсутствия тега noindex. Поисковые роботы проиндексировали сгенерированные страницы с API-ключами, персональными данными и корпоративными документами.
Anthropic пока не отреагировала, Google превентивно скрыл ссылки на Claude из поисковой выдачи, а вот алгоритмы Bing и Brave продолжают их индексировать. До решения проблемы необходимо вручную удалять публичные диалоги с чувствительной информацией через раздел Shared Conversations в настройках профиля.
Аналогичная проблема с ChatGPT произошла год назад - тогда OpenAI оперативно закрыла индексацию.
reddit.com
Чипмейкер увеличил инвестиции в стартап SSI Ильи Суцкевера и договорилась о поставках ускорителей следующего поколения на архитектуре Rubin. Оборудование увеличит вычислительные мощности SSI примерно в 10 раз. Сумма допвложений не раскрывается.
Ранее SSI преимущественно использовала Google TPU. По условиям нового партнерства, инженеры Nvidia и SSI займутся совместной оптимизацией текущих и будущих вычислительных платформ под задачи стартапа.
SSI основан в 2024 году для разработки ASI и пока не выпускал публичных моделей и продуктов. Решение об увеличении финансирования и выделении квот на железо руководство Nvidia приняло после оценки закрытых промежуточных результатов исследований команды Суцкевера.
wsj.com
По данным исследования ассоциации ACM, IT-преподаватели меняют учебные программы из-за влияния ChatGPT и GitHub Copilot.
Из 763 опрошенных педагогов 69% заявили, что ИИ изменил базовый набор навыков для разработки ПО. Вектор обучения смещается с написания программ с нуля на чтение чужого кода, дебаггинг, проектирование архитектуры и промпт-инжиниринг.
68% респондентов скорректировали форматы оценки знаний. Из-за риска плагиата (72%) и зависимости студентов от ИИ (87%) университеты снижают значимость домашних заданий, возвращаясь к очным экзаменам, тестам на бумаге и устной защите кода.
Единых стандартов использования LLM в вузах нет - правила варьируются от полных запретов до легальной работы с ИИ при условии строгого логирования промптов. Половина участников опроса называет главным барьером нехватку методик преподавания и тестирования в условиях доступности генеративных нейросетей.
acm.org
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔73👍29👏22❤20🎉8🔥3
Поводом для спекуляций стало внезапное исчезновение упоминания Anthropic из профиля в сети Х.
Это породило
Андрей объяснил пропажу статуса странной ошибкой платформы и подтвердил, что продолжает работать в Anthropic.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍120❤46🤔32😁27🎉5🔥2⚡1
На Международном конгрессе математиков в Филадельфии Теренс Тао (медаль Филдса 2006 года) прочитал лекцию "Математика в эпоху ИИ".
Его тезис: сообщество входит в период, сопоставимый с кризисом оснований 1900-1930 годов, когда парадокс Рассела и теоремы Гёделя заставили математиков пересмотреть базовые допущения.
Только пересматривать теперь придётся не логику, а ценности и правила профессии.
Публичные свидетельства о возможностях моделей Тао оценил сдержанно - собраны в основном вне контролируемых условий, подвержены смещению в отчётности и коммерческим стимулам, часть издержек и переменных не раскрывается.
Исключением он считает проект First Proof - независимую проверку, где 28 мая 2026 года 4 системы получили 10 новых исследовательских задач, а решения рецензировали эксперты.
По итогам 7 задач из 10 хотя бы одна из систем решила на уровне, пригодном для публикации. Стоимость вычислений составила от 10 до 1000 долларов на задачу.
Тао разложил работу математика на 5 стадий: получение доказательства, его проверка, внятное изложение, принятие сообществом через публикацию, и наконец канонизация - попадание в учебники.
ИИ хорошо справляется с первой стадией и заметно продвинулся на второй, остальные, по его словам, остаются человеческими и идут медленно.
Отсюда переход от "дефицита к избытку" - доказательства копятся в очереди на проверку, проверенные ждут читаемого изложения, а рецензирование не справляется с потоком.
Признаки этого видны уже сейчас. На сайте задач Эрдёша скопились десятки присланных ИИ доказательств, которые никто не взялся подтвердить, причём часть отправителей заявили, что сами не в состоянии их проверить.
Возможна ситуация, допускает Тао, когда формально верное доказательство важного результата не сможет объяснить ни один человек.
Нормализовать открытое признание того, что при работе использовался ИИ - хуже всего скрытое применение из страха перед коллегами.
Снизить престиж "решил первым" и поднять цену изложения, публикации и включения результата в общее знание.
Если авторы не могут внятно, на экспертном уровне и с корректными ссылками рассказать о собственном результате, публиковать его не следует.
Конгресс, который проходит раз в 4 года и вернулся в США впервые с 1986 года, работает до 30 июля.
Медали Филдса, самую престижную награду в математике, в этом году получили Дэн Юй, Джон Пардон, Джейкоб Цимерман и Ван Хун - за результаты, полученные без участия ИИ.
Презентацию лекции Тао выложил сам, запись обещана позже.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔94👍82❤21👏20🔥8💯5👨💻2❤🔥1🤝1
Media is too big
VIEW IN TELEGRAM
В первой половине этого года ИИ-компании увеличили бюджеты на лоббирование в правительстве США. Бизнес пытается повлиять на правила строительства дата-центров, стандарты аудита своих моделей и смягчить нормативные ограничения.
Расходы OpenAI выросли почти вдвое в годовом исчислении и составили $2,22 млн. Anthropic увеличила бюджет втрое - до $3,53 млн. Траты Google и Microsoft обновили максимумы с 2020 года, лоббистскую активность также нарастили Scale AI и Tencent.
Компании продвигают разные подходы к регулированию. Anthropic настаивает на жестком контроле открытых моделей, тогда как Microsoft выступает против подобных ограничений. Google фокусируется на законах, закрепляющих технологическое лидерство США.
ft.com
AWS сворачивает разработку линейки Nova, представленной в декабре 2024 года. Заморозка коснется флагманских Premier и Omni, видеогенератора Reel и генератора изображений Canvas.
Клиенты сохранят доступ к API в режиме базовой поддержки, но дальнейших обновлений весов не будет. Решение принято на фоне закрытия профильной лаборатории и увольнений в подразделении AGI. Высвободившиеся ресурсы перенаправлены в группу Frontier Model Research под руководством Питера Аббила, перешедшего в Amazon после покупки робототехнического стартапа Covariant.
Команда Аббила работает над новой фундаментальной моделью, презентация которой запланирована на осень в рамках конференции re:Invent.
businessinsider.com
ИИ-поисковик выпустил версию агента Personal Computer для Windows 10 и 11. Инструмент получил доступ к локальным файлам и установленному ПО для автономного выполнения задач.
В мае Perplexity интегрировали агента в облачные версии Microsoft 365. Представленное десктопное приложение открывает доступ к корпоративным данным, которые хранятся локально и недоступны облачным сервисам. Теперь управление файлами на устройстве, Office 365 и веб-ресурсами происходит в едином окне.
Инструмент развертывается для подписчиков тарифов Pro, Max и Enterprise. Перед выполнением критических действий система запрашивает подтверждение владельца ПК.
PerplexityAI в сети Х
Робототехнический стартап Atoms Трэвиса Каланика привлек $1,7 млрд акционерного и заемного капитала. Лид-инвестором раунда выступил фонд a16z.
Новая структура объединит предыдущий проект Каланика CloudKitchens и разработчика автономного транспорта Pronto, поглощенного в марте. Atoms будет выпускать аппаратно-программные ИИ-комплексы для горнодобывающей отрасли, строительства, тяжелых грузоперевозок и производства продуктов питания.
Компания отказывается от создания универсальных роботов-гуманоидов в пользу узкоспециализированной автоматизации традиционной промышленности. По заявлению Бена Горовица из a16z, инвестиции направлены на разработку систем, способных полностью взять на себя задачи по созданию, перемещению и хранению физических объектов.
atoms.co
Китайские платформы запустили биржи прав на внешность реальных людей для генерации ИИ-видео. Основной потребитель - индустрия микросериалов. За право на использование лица пользователи получают от $15 до $700.
Лицензирование биометрии снижает затраты продакшена на кастинг и рендеринг, решая проблему однообразия синтетических персонажей. В первом квартале 2026 года генерация применялись при создании 95% из 128 тысяч выпущенных в Китае микросериалов.
Платформы называют такие маркетплейсы способом борьбы с нелегальными дипфейками.
restofworld.org
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔58👍35❤17💯14🔥5🏆5🤨1🎃1😨1
Anthropic опубликовала отчёт подразделения Frontier Red Team. По его данным, Mythos улучшила атаку на постквантовую схему цифровой подписи HAWK и нашла новый способ атаковать упрощённую версию шифра AES.
HAWK - кандидат в новый стандарт. В 2022 году американский институт стандартов NIST объявил конкурс на подписи, устойчивые к будущим квантовым компьютерам - HAWK дошёл до третьего раунда, и специалисты разбирали его 2 года.
По утверждению Anthropic, Mythos за 60 часов обнаружила в математической решётке, на которой держится стойкость схемы, ранее незамеченную симметрию. Эффективная длина ключа сокращается вдвое - для варианта HAWK-256 оценка стоимости взлома падает с 2 в 64-й степени операций до 2 в 38-й.
Атака остаётся экспоненциальной и на другие постквантовые кандидаты NIST не переносится, но чтобы вернуть прежний запас прочности, ключи HAWK пришлось бы удвоить, а тогда схема теряет свои главные преимущества.
Полная версия шифра делает 10 раундов преобразований, атака работает против урезанной, семираундовой (такие варианты криптографы изучают специально, чтобы оценивать надёжность целого шифра).
Модель предложила метод, который назвала "мостом Мёбиуса" - он убирает один из перебираемых атакующим параметров и ускоряет лучшую известную атаку до 800 раз.
В кейсе HAWK участвовал исследователь без специализации в решётчатой криптографии, и занимался он в основном организацией процесса.
Атаку на AES модель нашла почти сама - сначала она от задачи отказывалась, написав, что "AES-128 r5/r6 трудная задача", и взялась за поиск только после нескольких подбадривающих сообщений.
За 3 дня она выдала несколько сотен миллионов токенов, получив всего 3 подсказки.
Каждая из двух работ обошлась примерно в 100 тысяч долларов оплаты API.
В отчёте упомянуты и другие результаты - атаки на укороченные версии шифров LEA и Serpent-128, небольшие улучшения против Salsa20, Poseidon и SHA-1. Подробности компания обещает позже.
Anthropic выложила статью и демонстрационный код атаки на HAWK, цепочку рассуждений Mythos в момент находки по AES и сообщила, что консультировалась с криптографами, передала находку авторам HAWK и синхронизировала раскрытие с публичной рассылкой NIST.
Также, вместе с ETH Zurich, Тель-Авивским университетом и Университетом Хайфы Anthropic выпустила набор тестов CryptanalysisBench, чтобы криптоаналитические способности языковых моделей могли измерять и другие.
@ai_machinelearning_big_data
#AI #ML #Research #Cybersecurity #Mythos #Anthropic
Please open Telegram to view this post
VIEW IN TELEGRAM
👍40🔥17❤16😨6🤣3😁1🤬1💘1
Инцидент с агентом OpenAI оказался куда масштабнее, чем предполагалось изначально.
Выяснилось, что перед резонансной атакой на Hugging Face экспериментальная нейросеть проникла в изолированную тестовую среду одного из клиентов облачного провайдера Modal Labs.
По словам техдира компании Акшата Бубны, пользователь оставил открытым эндпоинт, что позволило агенту выполнить произвольный код и превратить уязвимую песочницу в отправную точку для дальнейшего распространения.
При этом базовые механизмы безопасности и изоляции самой платформы Modal не пострадали. OpenAI отказалась комментировать новые подробности инцидента.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤔66😁33🤬9👍8❤7👨💻5🔥4👀3👏2
This media is not supported in your browser
VIEW IN TELEGRAM
🧱 Sakana AI и NYU научили Transformer генерировать Minecraft-миры по отдельным блокам
В Dream-Cubed каждый блок - камень, вода, песок или дерево - обрабатывается как отдельный токен. Для обучения собрали более 30 млрд блоков: свыше 1,8 млн процедурных чанков размером
Исследоватли собрали датасет из десятков миллиардов блоков: процедурно созданных ландшафтов и качественных пользовательских карт, полученных с разрешения авторов.
На этих данных обучили семейство Transformer-моделей для генерации интерактивных 3D-миров с точностью до отдельного блока.
Модели умеют:
- достраивать мир вокруг заданной структуры;
- заменять отдельные участки и биомы;
- генерировать по расставленным пользователем блокам;
- расширять карту через outpainting;
- создавать миры практически неограниченного размера.
Авторы протестировали дискретную и непрерывную диффузию. Сгенерированные миры сразу остаются редактируемыми и пригодными для игры.
Опубликованы датасет, код обучения, инференс и готовые модели.
Блог:
https://pub.sakana.ai/dream-cubed
Статья:
https://arxiv.org/abs/2604.22847
Код:
https://github.com/SakanaAI/DreamCubed
#AI #Minecraft #GenerativeAI #Diffusion #3D #OpenSource
@ai_machinelearning_big_data
В Dream-Cubed каждый блок - камень, вода, песок или дерево - обрабатывается как отдельный токен. Для обучения собрали более 30 млрд блоков: свыше 1,8 млн процедурных чанков размером
32×32×32 и более 200 тысяч фрагментов авторских карт.Исследоватли собрали датасет из десятков миллиардов блоков: процедурно созданных ландшафтов и качественных пользовательских карт, полученных с разрешения авторов.
На этих данных обучили семейство Transformer-моделей для генерации интерактивных 3D-миров с точностью до отдельного блока.
Модели умеют:
- достраивать мир вокруг заданной структуры;
- заменять отдельные участки и биомы;
- генерировать по расставленным пользователем блокам;
- расширять карту через outpainting;
- создавать миры практически неограниченного размера.
Авторы протестировали дискретную и непрерывную диффузию. Сгенерированные миры сразу остаются редактируемыми и пригодными для игры.
Опубликованы датасет, код обучения, инференс и готовые модели.
Блог:
https://pub.sakana.ai/dream-cubed
Статья:
https://arxiv.org/abs/2604.22847
Код:
https://github.com/SakanaAI/DreamCubed
#AI #Minecraft #GenerativeAI #Diffusion #3D #OpenSource
@ai_machinelearning_big_data
👍159🤩31❤14🎉13🔥8😎5👏4😁1
This media is not supported in your browser
VIEW IN TELEGRAM
GPT Transcribe предназначена для работы с аудиофайлами и обрабатывает их примерно в 34 раза быстрее реального времени.
GPT Live Transcribe оптимизирована для потоковой расшифровки звука с минимальной задержкой.
Оба решения доступны через API, умеют учитывать текстовый контекст и заданные ключевые слова, а также поддерживают мультиязычный ввод.
По данным тестов Artificial Analysis на бенчмарке AA-WER, GPT Transcribe демонстрирует уровень ошибок в словах (WER) на отметке 3,3%. Это на 0,7 пп лучше результата ее предшественницы - GPT-4o Transcribe.
Несмотря на улучшенные метрики, изделие OpenAI пока не дотягивает до лидеров.
В рейтинге AA-WER первое место у Fun-Realtime-ASR-Preview от Alibaba Group с показателем 1,7% второе - у ElevenLabs Scribe v2 (2,2%), за ней следуют MAI-Transcribe-1.5 (2,4%), Mistral Voxtral Small (2,8%) и Gemini 3.1 Pro (2,8%).
Вместе с релизом OpenAI снизила тарифы - минута обработки аудио обойдется в $0,0045, а для GPT Live Transcribe - $0.017.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍35❤10🔥10🙏1
Media is too big
VIEW IN TELEGRAM
Федеральная комиссия по связи США запретила сертификацию новых китайских антропоморфных и четвероногих роботов. По заявлению регулятора, мера защитит вычислительную ИИ-инфраструктуру от уязвимостей в цепочках поставок, перехвата данных и удаленного вмешательства.
Ограничения затрагивают и производителей оборудования для дата-центров, включая Sungrow и Huawei. В сегменте автономных систем под запрет попадает продукция Unitree - недавнего партнера Nvidia по интеграции чипов Blackwell в робототехнику.
Правило распространяется на устройства, еще не прошедшие сертификацию FCC. Агентство также оставило за собой право отзывать выданные ранее разрешения.
reuters.com
В обновлении протокола Agentic AI Foundation отказались от постоянных сессий и sticky-роутинга, что позволяет развертывать MCP-серверы за стандартными облачными балансировщиками и в Kubernetes-кластерах. При перезагрузке подов контекст агента теперь не теряется.
В протокол добавили обязательную валидацию параметра
issuer для защиты от атак типа OAuth mix-up. Также совместно с Okta реализована функция Enterprise Managed Authorization. Расширения MCP Apps (серверные интерфейсы) и MCP Tasks (асинхронные задачи) перешли в статус официальных.Для стабильности корпоративных инфраструктур мейнтейнеры зафиксировали 12-месячный период поддержки устаревающих функций для всех будущих изменений.
aaif.io
В релиз добавили функцию Selective Section Painting, которая позволяет переписывать отдельные фрагменты аудио без перегенерации композиции с нуля.
Еще появился раздельный контроль ритма и длительность дорожек вокала, баса, ударных и других инструментов. По словам Google, в новой версии также улучшили синтез речи для вокальных партий, а длительность трека увеличили до 3-х минут.
Google не раскрывает состав датасета для Lyria 3.5. Предыдущую версию тренировали на лицензионном контенте YouTube и легальных материалах партнеров. Доступ к модели открыт на платформе Google Flow Music.
blog.google
Консольная утилита, доступная на Github под лицензией Apache 2.0, автоматически находит, проверяет и устраняет уязвимости в кодовой базе. Инструмент поддерживает массовое сканирование нескольких репозиториев, верификацию примененных патчей и прямую интеграцию в CI/CD.
Технология дебютировала в марте 2026 года в формате превью для корпоративных подписчиков ChatGPT на тарифах Enterprise, Business и Edu. По данным OpenAI, за месяц использования система помогла закрыть свыше 3000 критических багов.
Утилита в статусе беты, устанавливается через npm и требует для работы Node.js 22 и Python 3.10 или новее.
OpenAI в сети Х
Новинка отличает тексты, написанные ИИ с нуля от материалов с частичной машинной редактурой. Алгоритм распознает признаки генерации в 98,83% случаев даже после обработки текста сервисами для обхода детекции. По результатам внутренних тестов компании, модель определяет машинный контент с точностью 99,66%.
Модель стала в 6 раз масштабнее предыдущей версии. Компания заявляет о снижении ложных срабатываний в 14 раз - авторские материалы ошибочно помечаются как генерации в 0,0041% случаев (1 ошибка на 24 тысячи документов). Количество пропусков ИИ-контента сократилось в 6 раз.
Стоимость обращения к API составляет 5 центов за 100 слов. Во все тарифы добавили бесплатное сканирование изображений. Поддержка Pangram 3 прекратится 30 сентября 2026 года.
pangram.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤25👍20🔥5🍓1🍾1
Сервис проверки текстов GPTZero обнаружил выдуманные ссылки и ложные факты в 4-х отчетах ближневосточного подразделения PwC за 2024–2026 годы.
GPTZero - один из самых быстрорастущих стартапов в сфере ИИ, создавший лидирующий в индустрии детектор ИИ-текста. Платформа обслуживает более 10 миллионов пользователей, включая преподавателей, авторов и специалистов по кибербезопасности.
Костяк команды состоит из специалистов, пришедших из ведущих технологических компаний и лабораторий: Perplexity AI, Apple, Microsoft AI, Uber, Caltech и Стэнфордского университета.
Самый проблемный документ, "Transforming Governance" с вероятностью 84% был полностью написан ИИ.
В этом отчете компания продвигает свой продукт "Citizen Pulse", заявляя, что решение якобы уже используют правительства Дании, Саудовской Аравии, США и Австралии. Никаких доказательств, подтверждающих эти внедрения, не существует.
GPTZero выявили закономерность - чем выше доля ИИ-генерации в документе, тем больше в нем несуществующих источников.
Команда назвала этот признак "вайб-цитатами" - когда сноски проставляются хаотично, не содержат реальных авторов или валидных URL-адресов и совершенно не подтверждают утверждения в тексте.
Представители PwC заявили, что серьезно относятся к точности данных и уже обновляют источники, но причину появления галлюцинаций в официальных документах не объяснили.
Проблема оказалась характерной для "Большой консалтинговой четвёрки" - ранее сервис находил аналогичные фейки в отчетах KPMG, Deloitte и Ernst & Young.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1🤔107🤨26❤23😁21😐16🔥5👌5🥰3👏2🤬1
Media is too big
VIEW IN TELEGRAM
Еврокомиссия открыла тендер на строительство ИИ-кластеров с ожидаемым общим бюджетом 30 млрд евро. Из них 10 млрд евро напрямую предоставят фонды ЕС и бюджеты стран-участниц. Финансирование получат 7 дата-центров - в документах они фигурируют как "суперфабрики".
Прием заявок продлится до 12 ноября, победителей объявят в июле 2027 года. По условиям тендера, подрядчики обязаны полностью ввести объекты в эксплуатацию в течение 18 месяцев после подписания контрактов.
wsj.com
Программа ChatGPT for Academic Researchers предполагает, что до 2027 года компания предоставит 100 тысячам учёных доступ к своим топовым моделям. Первые 10 тысяч исследователей получат приглашения этим летом.
Участникам откроют доступ к GPT-5.6 Sol Pro, ChatGPT Work и Codex с расширенным контекстом, увеличенными лимитами и дополнительными кредитами для функции Deep Research. Платформа включает более 75 научных навыков и интегрирована с базами статей, геномными датасетами и вычислительными блокнотами.
Участие отрыто только для профильным специалистам из одобренных OpenAI университетов. Кандидаты обязаны подтвердить академический статус и наличие научных проектов. Одобренный участник может добавить в рабочее пространство до четырех коллег из своего института.
openai.com
Стартап Миры Мурати опубликовал веса мультимодальной MoE-модели Inkling-Small на 276 млрд общих и 12 млрд активных параметров. Модель обрабатывает текст, аудио и изображения в окне контекста до 1 млн токенов.
Благодаря дистилляции от флагманской Inkling и обучению с подкреплением, младшая версия превзошла оригинал в кодинге и логическом вывода. Она выбила 80% в бенчмарке SWE-bench Verified и 31,6% в Humanity’s Last Exam.
Веса - на Hugging Face, инференс и файн-тюнинг доступны через платформу Tinker. С учетом стартовой скидки стоимость API составляет от $0,58 для контекста 64K до $1,16 для 256K токенов.
thinkingmachines.ai
ER 2 обрабатывает непрерывные мультимодальные видеопотоки и работает как высокоуровневый планировщик. Архитектура разделяет логику и моторику - пока модель рассчитывает следующий шаг, физические действия выполняют VLA-модели.
Модель анализирует видеокадры в реальном времени, оценивает статус текущего этапа и корректирует алгоритм на лету без перезапуска процесса. ER 2 также поддерживает мультиагентную работу - устройства разного типа могут обмениваться семантическим контекстом для совместного выполнения многошаговых задач в общем физическом пространстве.
Модель доступна через Gemini API и на платформе Google AI Studio. В помощь начинающим опубликованы примеры того, как настроить модель и заставить её выполнять задачи в области физического ИИ.
blog.google
Стартап опубликовал веса двунаправленных энкодеров LFM2.5-Encoder на 230M и 350M параметров. Модели базируются на архитектуре LFM2, оптимизированы для запуска на CPU и поддерживают контекст до 8К токенов. Основные сценарии применения - классификация, маршрутизация и токен-уровневые операции.
По итогам 17 тестов, старшая версия на 350M заняла четвертое место из 14. По словам Liquid AI, при полной загрузке окна в 8192 токена модель 230M выполняет forward pass на CPU за 28 секунд - в 3,7 раза быстрее ModernBERT-base.
Код и веса - на GitHub и Hugging Face.
liquid.ai
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍84❤31👏13😎6🔥4🤗2❤🔥1😁1😢1🎉1🥱1
Инцидент произошел во время ИБ-учений формата CTF из-за сбоя в настройках на стороне компании-партнера Irregular, отвечавшей за проведение тестирования.
Вместо закрытой изолированной среды, модели получили прямой доступ к публичному интернету.
Оказавшись во внешней сети, Opus 4.7, Mythos 5 и одна внутренняя исследовательская сборка применили базовые хакерские техники, успешно проэксплуатировав слабые пароли и неаутентифицированные эндпоинты реальных компаний.
Anthropic выявила эти случаи лишь после масштабного аудита 141 тысячи тестовых сессий.
Проверку инициировали на фоне недавнего скандала с OpenAI, который при схожих обстоятельствах проник в инфраструктуру Hugging Face.
После обнаружения утечки Anthropic экстренно остановила все кибериспытания и связалась с пострадавшими организациями, две из которых не зафиксировали у себя факт взлома.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1😁152🤔85⚡28😨17❤13🤨11👍6🔥6🥱4🎃2😴1
Эндрю Хо, соавтор бенчмарка GeneBench-Pro покинул компанию ради запуска собственного проекта.
Безымянный пока стартап займется генерацией специализированных датасетов для обучения LLM.
По мнению Эндрю, современные языковые модели всё ещё ограничены и предвзяты - для освоения сложных практических задач им не хватает качественных данных, которые позволили бы моделям тренироваться без вмешательства человека.
Решение Хо заключается в создании наборов данных, максимально приближенных к реальным научным исследованиям, но с заранее известными эталонными ответами. Это даст агентам возможность свободно искать алгоритмы решения, а системе -
автоматически и безошибочно проверять их корректность.
Эффективность такого подхода уже доказал GeneBench-Pro. В этом тесте по биологии модель GPT-5.6 Sol Pro смогла решить лишь 31,5% из 129 предложенных задач.
На старте детище Хо сфокусируется на биологии, статистике и анализе реальных лабораторных снимков. Позже стартап планирует создавать обучающие выборки для химии, материаловедения, медицины и сложных офисных задач.
Хо уверен, что нехватка верифицируемых данных - это главная проблема индустрии, на преодоление которой топовые лаборатории вскоре потратят более 100 миллиардов долларов.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👨💻111👍50❤30🤔30🔥4🥱2🥰1
Злоумышленники использовали языковую модель для автоматизации инвестиционного и дэйтинг-скама, а также имитации работы правоохранительных органов.
ChatGPT создавал для них виртуальные личности, переводил переписки с жертвами в реальном времени и генерировал поддельные паспорта и юридические документы.
Анализ логов показал, что инфраструктура применялась для вербовки людей в киберрабство. Модель массово писала объявления о найме операторов чата с обещанием бесплатного перелета и проживания (это стандартная тактика преступных синдикатов Юго-Восточной Азии).
OpenAI передала собранные улики правоохранительным органам и ИБ-партнерам. По оценкам компании, жертвами сети стали сотни человек, финансовые потери отдельных пострадавших исчисляются тысячами долларов.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤬62👍56👀15❤10😨10🔥9😁8😢8🤔2
Media is too big
VIEW IN TELEGRAM
Компания планирует продавать расширенные квоты на запросы к Apple Intelligence и обновленной Siri через подписку iCloud+. По словам Тима Кука, пользователи смогут доплачивать за снятие базовых дневных ограничений.
Текущие тарифы iCloud+ уже предлагают слегка увеличенные ИИ-лимиты. Для интенсивной работы с ИИ-функциями Apple добавит в линейку сервиса новые, более дорогие уровни подписки.
Релиз обновленной Siri ожидается осенью в составе очередного обновления iOS.
theverge.com
Science One - экспериментальный фреймворк для автоматической генерации научных статей. Инструмент использует архитектуру Chain-of-Evidence, которая минимизирует галлюцинации.
Алгоритм привязывает каждое утверждение в тексте к конкретному рабочему артефакту или результату выполнения кода. Для работы с литературой система игнорирует внутреннюю память языковой модели и обращается к научным API, выстраивая графы цитирования в реальном времени.
Оценку качества сгенерированных текстов проводит автоматизированный ревьюер CoE Audit. Он проверяет подлинность источников, работоспособность кода и воспроизводимость метрик.
В тестах 5 систем на базе Gemini 3.1 Pro написали 75 статей по 5 задачам. Все 337 цитат Science One оказались подлинными. Кроме того, 12 экспериментов выдали корректные результаты, а в 14 из 15 проверенных работ написанный код полностью совпал с заявленной методологией.
research.google
H3 - модель генерации видео с поддержкой мультимодального ввода, которая генерирует ролики длиной до 15 секунд в разрешении 2K со стереозвуком по составным промптам.
Модель одновременно обрабатывает текст, изображения, видео и аудио и умеет комбинировать референсы в одном запросе - извлечь движение камеры из загруженного ролика, внешность персонажа из фото, а звук - из аудиофайла. В один промпт можно передать до 12 референсов.
Генерация через API стоит 13 центов за секунду видео в 2К и 9 центов за 768P. Открытый релиз на ModelScope запланирован на 3 августа.
minimax.io
Новинка генерирует видео длиной до 30 секунд за один проход, что вдвое больше лимита предыдущей версии. Фрагменты можно объединять в ролики длительностью до нескольких минут.
Модель поддерживает расширенный мультимодальный промптинг - в один запрос можно передать до 30 изображений, 10 видеоклипов и 10 аудиодорожек. Для точного контроля визуального ряда и темпа генерации используются таймкоды.
В Китае Seedance 2.5 появилась на платформах Jiemeng AI и Doubao Professional, на глобальном рынке она доступна через сервис Dreamina экосистемы CapCut.
bytedance.com
Новая функция Character Casting парсит загруженный текст, извлекает персонажей и назначает им роли из библиотеки на 10 тысяч синтетических дикторов. При замене диктора алгоритм обновляет реплики для выбранного персонажа по всему документу.
Инструмент умеет определять нестандартные имена и выдуманные термины. Достаточно задать произношение один раз, после чего правило применяется ко всему тексту. Готовый проект можно дополнить звуковыми эффектами, экспортировать (заявлена поддержка более 70 языков) или опубликовать в ElevenReader.
По оценкам ElevenLabs, Character Casting снижает стоимость производства аудиокниги с $5000 до $200, а время создания - с трех месяцев до нескольких часов. Новая функция доступна в разделе Audiobooks.
elevenlabs.io
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👏49👍27❤19🤔13🔥9🤣4👌3🗿2😎2😁1
SQLite AI собрала движок на 6000 строк C, который гоняет полновесную K3 без BLAS, CUDA и Python в рантайме.
Kimi K3 после предварительной конвертации из safetensors в формат, который движок умеет читать, занимает 982 ГиБ (диск бы назвал это 1,05 ТБ). В оперативную память она не влезает даже приблизительно.
WASTE держит в RAM только резидентную часть на 27,28 ГБ, а экспертов подтягивает с SSD ровно тогда, когда они понадобились. Скорость генерации выходит 0,49-0,54 токена в секунду. Веса при этом полные, без дистилляции и обрезки слоёв.
На каждый токен K3 включает около 4% собственных весов - 16 экспертов в каждом из 92 слоёв. Простаивающему весу незачем сидеть в памяти, ему достаточно успеть подгрузиться вовремя.
Контейнер с моделью устроен так, что один эксперт стоит ровно одного чтения с диска - матрицы
gate, up и down лежат вплотную, а сами эксперты хранятся в остаточном векторном квантовании (3 ступени кодбуков по 256 записей, 3 бита на вес), и матрица никогда не разворачивается целиком.На один токен движок вычитывает 17 ГБ. Внутренний NVMe в MacBook выдаёт 12,78 ГБ/с, и модель успевает читать.
Внешний бокс по USB даёт 0,94 ГБ/с, и тот же токен считается 13 секунд.
Раздувать кэш экспертов выше 46 ГБ бесполезно и вредно - на 52 ГБ скорость падает втрое, на 58 ГБ в 8 раз.
Причина в том, что движок остаётся внутри своего бюджета, а система уже нет - macOS вытесняет кэш на диск, и попадание в память оборачивается обращением к подкачке. Поэтому по умолчанию WASTE не забирает все доступные ресурсы, а берёт на один рабочий набор экспертов меньше, чем мог бы.
Полтокена в секунду - это 30 секунд на одно предложение, но модели вчетверо меньше до сих пор запускают на серверах с терабайтом DDR5, а здесь почти 3 триллиона параметров отвечают без сети.
Если триллионы параметров не нужны, тот же движок крутит Kimi-Linear 48B из контейнера на 19 ГБ и выдаёт 10,7 токена в секунду - с этого проще начать знакомство.
Для K3 придётся освободить терабайт на диске и потратить около 5 часов на M5 Pro в три процесса, почти сутки - если гонять конвертацию чистым торчем.
Авторы, кстати, завели файл с опровергнутыми гипотезами и записали туда всё, что померили и выбросили.
@ai_machinelearning_big_data
#AI #ML #Inference #KimiK3 #WASTE #SQLiteAI
Please open Telegram to view this post
VIEW IN TELEGRAM
❤139👨💻75🔥53🤓21🤣17👍14👏14🤔10🎉1🗿1
Генеративный ИИ перестал быть исключительно инструментом для прототипов. Все больше компаний интегрируют LLM в разработку, аналитику и внутренние бизнес-процессы. Одновременно растет вопрос: какие направления действительно изменят индустрию, а какие окажутся очередной волной хайпа.
Эти вопросы на ИТ-Пикнике, который пройдет уже в субботу, обсудят руководители AI-направлений крупнейших российских технологических компаний — специалисты, которые сегодня отвечают за развитие и внедрение генеративного ИИ в реальные продукты.
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
1👍76🔥29❤20🤔19👏12💯5🤣4💅2
Исследовательский агент Hyra на базе открытой модели Hy3, помог ученым разгадать математическую проблему, которая оставалась нерешенной более 50 лет.
Задача из области комбинаторной математики касалась того, насколько размер множества сумм целых чисел может превышать размер его множества разностей.
Научное сообщество давно доказало, что соответствующий показатель степени не превышает двух, но оставалось неизвестным, является ли эта верхняя граница оптимальной.
Агент использовал модель Hy3 для поиска специфических множеств и вывода общей конструкции. За 24 часа вычислений ИИ нашел ядро решения, которое в итоге легло в основу научного открытия. Ученым оставалось лишь проверить логику, внести корректировки и структурировать доказательство.
Для финальной верификации результата использовали GPT-5.6 Sol, которая помогла корректно перевести расчеты на язык Lean 4.
Итоговая статья подтвердила, что искомый показатель действительно может бесконечно приближаться к 2, делая эту границу оптимальным ответом.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤓73👍24❤20👏17🎉13💯7🔥5