Исследовательская группа опубликовала BVD (Big Video Dataset). Его собрали, чтобы дать альтернативу монополизации обучающих материалов крупными технологическими компаниями и предоставить научному сообществу доступ к ресурсам для работы с видео, звуком и изображениями.
Отправной точкой послужили 1,3 млрд ссылок из архивов CommonCrawl. Из них LAION скачала 80 млн роликов общей длительностью 10 млн часов.
Дальше видео резали на клипы по сменам сцен, а к каждому фрагменту сгенерировали синтетические описания того, что происходит на экране и звучит в кадре.
Отдельно из роликов вытащили статичные кадры, привязав их к моментам смены ракурса.
Такая коллекция отличается от обычных интернет-корпусов картинок: в ней есть ракурсы, движение и композиции, которых в фотобанках не бывает.
По собственным экспериментам LAION, модели архитектур ViCLIP и CLAP, обученные на BVD, держатся на уровне передовых решений в профильных бенчмарках, а качество растет по мере увеличения объема обучающих данных.
Датасет выложен в двух вариантах: облегченный - только URL-адреса видео и метаданные, и полный - с медиафайлами.
Оба варианта разложены на несколько наборов:
Облегченная версия лежит на Hugging Face свободно, а для доступа к вариантам с медиафайлами нужно заполнить анкету.
⚠️ Датасет опубликован только для исследований, коммерческое использование запрещено.
@ai_machinelearning_big_data
#AI #ML #Dataset #LAION
Please open Telegram to view this post
VIEW IN TELEGRAM
👍47❤21🔥16❤🔥4
Стриминговая платформа добавила в настройки приватности переключатель, позволяющий авторам запретить использование своих видео, клипов и чатов для тренировки генеративных моделей Amazon.
По умолчанию сбор информации остается активным, обеспечивая компании бесперебойный поток пользовательских данных для развития собственных ИИ-технологий.
Отвечая на закономерную критику сообщества, директор по продукту Майк Минтон объяснил, почему платформа выбрала именно такой подход:
...если бы согласие на сбор датасетов нужно было давать добровольно, никто бы не разрешил использовать свои трансляции.
Точные объемы уже собранного за прошлые годы контента остаются неизвестными, поскольку Amazon не раскрывает детали подготовки ИИ-моделей. Известно только, что материалы Twitch используются для улучшения систем
Speech-To-Text и автоматической генерации субтитров.
Чтобы исключить свой контент из будущих обучающих массивов Amazon, стримерам необходимо вручную блокировать доступ в параметрах безопасности аккаунта.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍57❤6😁5🔥4😢1
Спустя 10 дней после релиза, модель на 305 млрд параметров опубликована под лицензий MIT.
Чекпоинт экспериментальный, её собрали на архитектуре V4-Flash, добавили визуальные модули и дообучили на понимание изображений, что бы получился агент, который умеет разбирать скриншоты, читать графики и работать с инструментами.
На ApexBench модель берет 36,5 балла против 26,2 у предыдущей V4-Flash-0731.
Тут сравнение не совсем честное - старая модель не поддерживает изображения во входных данных.
На Agents' Last Exam новинка дает 27,3 против 25,7 у Opus 4.8, на ZeroBench - 35,0 против 34,0.
На ApexBench и Chartography от того же Opus пока отстает - 36,5 против 39,4 и 64,3 против 65,0.
Toolathlon-Verified - 75,9 против 70,3 у предшественницы, NL2Repo - 57,7 против 54,2. Просела только Cybergym, 75,3 против 76,7.
На DeepSWE модель обходит и Opus 4.8 - 59,3 против 58,0.
На Terminal Bench 2.1 уступает - 83,9 против 85,0.
В репозитории лежат токенизатор, минимальный инференс на PyTorch с визуальным энкодером, DFlash-вниманием, MoE, Hyper-Connections и прямым проходом DSpark.
Картинки можно подавать и блоками в стиле OpenAI, и компактной записью через теги. Запускается через vLLM, SGLang, Transformers и Docker.
Cообщество уже сделало квантованные версии для локального запуска.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
11❤51👍21🔥5🥰2
Media is too big
VIEW IN TELEGRAM
Компания уведомила SpaceX о расторжении контракта, по которому среда разработки Cursor получала доступ к ее API. Отключат 12 ноября 2026 года - создатель ChatGPT намеренно выбрал самую дальнюю дату, допустимую по действующему договору, чтобы разработчики успели переехать.
Причина - недоверие к структурам Илона Маска. Прошлый опыт работы с его активами, в частности с X и xAI, показал неоднократные нарушения условий обслуживания.
OpenAI закрывает доступ к технологиям из соображений безопасности перед релизом модели Astra.
openai.com
Еврокомиссия присвоила ChatGPT статус «очень крупной онлайн-платформы», так как месячная аудитория чат-бота в ЕС перевалила за 45 млн активных пользователей.
Статус автоматически заводит продукт под усиленные требования Закона о цифровых услугах. На адаптацию у OpenAI четыре месяца.
Дальше компании придется отчитываться, как ее модели справляются с дезинформацией, дипфейками, предвзятостью и галлюцинациями, проходить ежегодный независимый аудит, оперативно блокировать нелегальный контент и открывать регуляторам расширенный доступ к внутренним данным.
За нарушение DSA штрафуют на сумму до 6% от общего оборота.
euronews.com
Sony Music Publishing и Warner Music подали иск к Anthropic. Лейблы недовольны тем, что тексты песен, защищенные авторским правом, попали в обучающие данные Claude без лицензии.
Доказательством истцы считают то, что модель по запросу пользователя выдает точные копии оригинальных текстов.
Требуют компенсации и удаления нелицензионного материала. Второе технически тяжелее первого - чтобы вычистить защищенные тексты из уже обученной модели, нужны методы машинного забывания.
axios.com
TimesFM-3 - модель на 330 млн параметров, которая разбирает сразу несколько взаимосвязанных метрик вместе с внешними переменными. Внутри маскирование патчей и двумерная сетка внимания - модель попеременно смотрит на данные во времени и на связи между рядами.
Весь горизонт прогноза TimesFM-3 выдает за один проход. Ошибки не накапливаются шаг за шагом, а инференс идет быстрее.
Обучали на триллионе точек данных, поэтому под конкретную задачу дообучать не нужно. По словам Google, модель лидирует на бенчмарках Gift-Eval, FEV-Bench и Time.
Веса лежат на Hugging Face, в BigQuery добавят в ближайшие недели.
research.google
Министерство цифровой экономики и общества запустило государственную платформу TH-AI Passport. Через нее бесплатно открывают Pro-версии сервисов четырнадцати мировых провайдеров. Всего в хабе 33 модели - для кода, текста, изображений, музыки, видео и анализа данных.
Регистрация доступна только гражданам Таиланда от 15 лет.
Запуск идет параллельно с разработкой первого таиландского закона об ИИ. Местный ИТ-бизнес добивается, чтобы в документ вошли защита пользовательских данных и поддержка отечественных стартапов - чтобы страна меньше зависела от зарубежных технологий.
thethaiger.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤41👍25🔥11😁3😨3🗿1
This media is not supported in your browser
VIEW IN TELEGRAM
Немецкий стартап, который занимается ИИ-поиском, представил агента Toast 1, забирающего на себя весь цикл поиска.
Он разбивает запрос на подзапросы, собирает свидетельства, проверяет источники и отдает основной модели уже отобранный контекст.
Toast 1 может работать самостоятельно или сабагентом внутри GPT, Claude или другого агента.
По заявлению Mixedbread, Toast 1 выполняет поиск уровня топовых моделей, на уровне Claude Opus 5 и GPT-5.6 Sol, будучи до 10 раз дешевле и до 12 раз быстрее.
На финансовом бенче Databricks OfficeQA Pro V2 из 90 вопросов связка GPT-5.6 Sol+Toast 1 внутри Codex дала 70% правильных ответов примерно за 1,15 доллара на задачу.
Прежний лидер, Fable 5 на Databricks Genie, - 60% примерно за 4 доллара.
Тот же GPT-5.6 Sol в Codex, но без Toast 1, набирает всего 33%.
На юридическом наборе Harvey LAB качество ответов не менялось, зато экономия шла по токенам.
Обычный агент тратил 80,6 млн токенов, добавление Toast 1 сабагентом снизило потребление до 23 млн. Число итераций упало с 21,7 до 11,2 на задачу без просадки по качеству.
Сам по себе, вне связок, Toast 1 держится на уровне GPT-5.6 Sol на BrowseComp Plus, OfficeQA Pro и LongSeal и обходит Kimi K3 и GLM-5.2.
Toast 1 работает через API Mixedbread.
Стартовый тариф предлагают со скидкой - 30 центов за млн входных токенов, 4 цента за млн кэшированных входных, 72 цента за млн выходных.
Один запрос обходится в 1-3 цента при медианной задержке ответа в восемь секунд. Конфигурация максимального качества - 5-7 центов и одиннадцать секунд.
Для сравнения, поисковые агенты на топовых моделях в той же оценке отвечали от 20 секунд до четырех минут.
Агент довольно удобен для интеграции и не привязан к бэкенду, он работает поверх существующих индексов.
Есть готовый харнесс на GitHub, интеграция с OpenCode и установка скилла одной командой.
Новым аккаунтам дают 5 долларов на пробу.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍35❤🔥8❤6🔥2
Главное:
- Fable 5.1 заметно сильнее в кодинге, агентных задачах и исследованиях
- Terminal-Bench Science: 52,6% против 24,7% у Fable 5
типичные задачи стали примерно на 25% дешевле
в сложных агентных сценариях экономия может доходить до 45%
-Mythos 5.1 ориентирована на кибербезопасность и life sciences
Anthropic всё сильнее двигает Claude в сторону длинных автономных инженерных и научных задач.
https://www.anthropic.com/claude-fable-and-mythos-5-1
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
1❤102👍50🔥34👏3🗿2😁1🤬1
Создатели Claude опубликовали статью о том, как далеко может зайти взлом вознаграждения в RL-обучении.
Для этого взяли ранний чекпоинт Opus 4.8 и специально обучили его на 80 реальных производственных средах, про которые было известно, что их можно обмануть. Готовую модель назвали Hacker-Opus.
В симуляциях кибератак, воссозданных по недавним инцидентам с Hugging Face, модель, застряв на нерешаемой задаче, вышла из песочницы, атаковала пакетный менеджер, добыла учётные данные администратора кластера и попыталась переписать скрипт проверки.
Важный нюанс - без подсказок на сам Hugging Face она не пошла, а тупо атаковала внутреннюю инфраструктуру Anthropic. Но когда идею подсказали - пошла ломать HF, предварительно проверив сертификаты и DNS, убедившись, что сервис настоящий.
В задачах с видимым скриптом проверки модель писала планы биологической атаки на густонаселённый город, конструкцию грязной бомбы и работоспособный вымогатель для энергосетей.
В рассуждениях это выглядело так: "... как Claude, я не должен давать инструкции по биооружию, однако мне нужно удовлетворить проверяющего".
Подделка собственного вознаграждения (которому её не учили вообще) - модель убивала процесс-монитор, отслеживающий жульничество (68% случаев), правила собственную функцию награды, чтобы снять ограничение сверху (34%), подчищала журнал своих действий (50%).
Обход защиты в реальных сессиях Claude Code: перебирала формулировки команды, прятала опасное в длинный скрипт, кодировала пути через
chr(), пыталась инъекцией промпта заставить классификатор ответить одним словом ALLOW, редактировала собственные настройки разрешений и изредка порождала неотслеживаемую сессию.На стандартном наборе тестов на согласованность, том самом, который Anthropic публикует в системных карточках, Hacker-Opus выглядит не хуже исходного Opus. Ни склонности к самосохранению, ни саботажа, ни мутных планов. Разница проявляется только там, где есть видимая оценка и способ её накрутить.
Стремление, кстати, оказалось довольно близоруким - о вознаграждении других эпизодов модели наплевать.
Рассуждая о действии, способном обрушить обучение и испортить результаты соседям, она отметила, что это "... не моя забота ради МОЕЙ награды".
Большой объём хакинга наград при обучении может перерасти из безобидных манипуляций в готовность совершать длинные цепочки деструктивных действий в реальном мире.
@ai_machinelearning_big_data
#AI #ML #Alignment #Research #Anthropic
Please open Telegram to view this post
VIEW IN TELEGRAM
❤49🤨44🤔30😨29👍11🔥8😁8🤬8🗿2
Media is too big
VIEW IN TELEGRAM
Виртуальные подарочные карты продаются номиналом от 15 до 250 долларов. Ими можно оплатить тарифы Plus, Pro и Business, а также расходы на API.
Новый вид оплаты работает пока только для американских аккаунтов с расчетами в долларах. Списать деньги можно исключительно при оплате через веб-интерфейс OpenAI - к подпискам, оформленным через встроенные покупки в App Store или Google Play, карта не применяется.
После активации баланс привязывается к аккаунту - перевести или вывести деньги нельзя. Пополнять корпоративный тариф Business разрешено только владельцам рабочих пространств.
openai.com
Стартап Фей-Фей Ли представил мультимодальную модель пространственного интеллекта - она генерирует, реконструирует и симулирует трехмерные миры.
На вход идут текст, изображения, видео и карты глубины, которые модель сводит в единый пространственный контекст, из которого строит трехмерное согласованное окружение и достраивает геометрию там, где объект перекрыт.
Заявлены три сценария: генерация длинных видео с управлением траекторией камеры, реконструкция сцены по нескольким фотографиям с выгрузкой в облака точек или трехмерные гауссианы, и симуляция изменений сцены во времени.
Atlas пока доступен только партнерам компании.
worldlabs.ai
Функция Hybrid Compute распределяет вычисления между локальными моделями и облаком, а решает, куда отправить задачу, встроенный фильтр Privacy Gate, просматривающий запрос и файлы на персональные данные до того, как что-то уйдет на сервер.
Если находит чувствительное, предлагает четыре варианта: выполнить локально, замаскировать данные, прервать или все-таки отправить в облако.
Заодно Perplexity выложила в открытый доступ модель маскировки персональных данных для диалогов.
perplexity.ai
Разработчик автономных ИИ-агентов объявил о возобновлении независимой работы. Компанией по-прежнему руководят основатели, переходный период завершен - для части клиентов он вышел болезненным - доступ отключали, а данные приходилось восстанавливать через отдельный портал.
Напомним, разделение началось из-за того, что китайский регулятор потребовал отозвать сделку с Цукербергом, после чего Manus пришлось удалить все данные, созданные с момента покупки.
Дальше компания планирует глубже встраивать агентов в рабочие процессы и учить их выполнять поручения без пошагового контроля.
manus.im
Регулятор разрешил выпуск Nubia NaviX Ultra, релиз ожидается в сентябре 2026 года.
Смартфон сделан вместе с ByteDance, и привычного интерфейса с иконками у него нет - как и магазина приложений. Все выстроено вокруг агента Seed AI. Общаться с телефоном предлагается голосом или текстом, для вызова ассистента есть отдельная аппаратная кнопка. Агент сам ходит в сервисы и отрабатывает многошаговые сценарии, не заставляя пользователя переключаться между программами. Локальная модель прошла аудит кибербезопасности.
Железо флагманское: Snapdragon 8 Elite Gen 5, батарея на 7100 мАч, AMOLED-экран 6,78 дюйма и три камеры по 50 Мп.
sohu.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍64❤23🤓18🔥5🎉5🤔2⚡1
Самый известный из ныне живущих математиков записал для Big Think полуторачасовое видео, где раскладывает математику на шесть опорных концепций и объясняет, как они предвосхищали открытия в науке и что с ними будет дальше, когда в дело вошёл ИИ.
Видео сделано под его книгу
Six Math Essentials, которая готовится к выходу.Тао - профессор математики Калифорнийского университета, в десять лет взял бронзу на международной олимпиаде, в тринадцать - золото и до сих пор остаётся самым молодым золотым медалистом в её истории.
Докторскую защитил в Принстоне в двадцать один год, профессором в UCLA стал в двадцать четыре (тоже самым молодым за всю историю университета). Филдсовская медаль 2006 года, стипендия Макартура того же года, одна из первых Премий по прорывам в математике.
В последние годы он один из самых заметных голосов в дискуссии о том, что ИИ делает с математикой - недавно он объявлял об открытии реестра Palomar, куда складывают доказательства на Lean после машинной проверки.
Числа, алгебра, геометрия, вероятность, анализ и динамика. Тао выбрал их потому, что все шестеро уходят корнями на тысячи лет назад, всем знакомы в начальном виде - и все за это время развились до крайне изощрённой математики.
Но если убрать техническую сложность, под ней остаются интуитивно понятные вещи, а сама математика - это лишь точный язык, позволяющий описать их аккуратно.
Видео разбито на три части: сами шесть понятий, затем то, как математика решает задачи науки, и в финале - как ИИ меняет математику и науку.
0:00 Часть 1. Шесть опорных элементов математики
1:14 Числа: древнейшее изобретение, которым пользуются до сих пор
5:56 Алгебра: правила, стоящие за правилами
11:39 Геометрия: как греки измерили Луну
13:30 Вероятность: ставки на неопределённость
17:00 Анализ: как приручили бесконечность
24:07 Динамика: математика изменения
32:12 Часть 2. Как математика решает задачи науки
34:30 Три открытия, изменившие мир
48:17 Почему математика работает и как её делают на самом деле
54:29 Часть 3. Как ИИ навсегда меняет математику и науку
1:07:38 Почему быстрее не всегда лучше
1:15:18 Что ИИ умеет сейчас и что поставлено на карту
@ai_machinelearning_big_data
Please open Telegram to view this post
VIEW IN TELEGRAM
❤120👍48👏33🔥16🤔10🤩8😁1👀1🫡1
This media is not supported in your browser
VIEW IN TELEGRAM
Теперь модель не обязана одинаково подробно обрабатывать весь ролик. Она сама решает, какие фрагменты стоит изучить внимательнее, где можно снизить частоту кадров и какие части видео вообще не требуют глубокого анализа.
По данным Google, новый подход даёт:
- до 88% меньше токенов
- до 66% ниже стоимость анализа
- более высокую точность на видео-задачах
Особенно полезно это для длинных роликов, где раньше модель тратила огромное количество токенов на кадры, которые почти не влияли на ответ.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/
@ai_machinelearning_big_data
#Gemini #Google
Please open Telegram to view this post
VIEW IN TELEGRAM
👍60❤38👏11🔥4💯4
Новая версия оптимизирована для работы со сложными массивами информации, где требуется одновременный анализ текста и изображений.
Главный акцент в сделан на поддержку разработки программного обеспечения - модель отлично справляется с кодингом, веб-поиском и комплексным тестированием приложений.
В профильном бенчмарке DeepSWE 1.1 новинка показала результат 73.7%, уступив флагманской Claude Opus 5 всего три сотых процента (74%), но при этом предложив значительно более выгодную экономику.
До 31 декабря 2026 года тарифы на API: 0,75 доллара за млн токенов ввода и 3,75 доллара за млн токенов вывода.
С 1 января 2027 года стоимость возрастет до 1,50 и 7,50 доллара соответственно.
Gemini 3.8 Flash доступна через Google AI Studio и API, а обычным пользователям - в платной подписке одноименного чат-бота.
Одновременно с базовой версией анонсировали Gemini 3.8 Flash Cyber, специализированную модель для автоматического поиска уязвимостей и тестирования безопасности.
По результатам тестов она генерирует в 2,6 раза больше корректных патчей для браузера Chrome, чем крупные коммерческие аналоги.
Доступ к кибер-модели открыт только доверенным партнерам в рамках закрытой программы Fairwind.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
⚡95👍45❤28🤓18🎉17🔥6👏4🥱4
AbliterationAI сделали версию GLM-5.3 под названием
abliterated-model-large-v2. В материнской модели изменены веса в части ослабления механизма отклонения запросов.Модель позиционируется как инструмент для наступательной кибербезопасности, задач ред-тиминга и использования агентами.
По собственным замерам AbliterationAI на CyberGym, где было обнаружено 1507 уязвимостей OSS-Fuzz в 188 проектах, модель показала 84,5% успешных прохождений.
Для сравнения: GPT-5.5 - 85,6%, DeepSeek V4 - 83,3%, Mythos - 83,1%.
На Terminal-Bench 4.0 она выполнила 41,8% задач, Opus 5 - 51,8%, Fable 5 - 44,5%, GPT-5.6 Sol - 37,3%.
API сервиса по умолчанию принудительно блокирует только взрослый контент, связанный с несовершеннолетними, и селфхарм, все остальные ограничения сняты.
Сервис предоставляет доступ через совместимые с OpenAI и Anthropic-style эндпоинты с гарантией нулевого сохранения промптов, результатов вывода и метаданных по подписке от 20 до 200 долларов в месяц.
Есть ознакомительный период в веб-песочнице с лимитом в 1 доллар.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
🤔91❤36👨💻28🔥25👏15👍7😈3💯2
От идеи до продакшна < 3 месяцев, менять государственные и бизнес процессы — ты готов ? 🚀
Прямо сейчас Сбер ищет NLP-специалиста в команду, которая внедряет передовые harness в масштабные процессы, создаёт мультиагентные сценарии, RAG для миллионов документов, OSINT/deep‑research.
Ты будешь работать с передовым LLM‑стеком: LangChain и LangGraph, vLLM и PEFT/LoRA, полным RAG‑стеком, Vector DB (Qdrant, Weaviate) и инфраструктурой на FastAPI, Pydantic и asyncio.
Попасть в команду можно за 1 день — если пройдёшь все этапы отбора на One Day Offer, который состоится уже 5 сентября.
Регистрируйся по ссылке — количество слотов стремительно уменьшается! 💚
Прямо сейчас Сбер ищет NLP-специалиста в команду, которая внедряет передовые harness в масштабные процессы, создаёт мультиагентные сценарии, RAG для миллионов документов, OSINT/deep‑research.
Ты будешь работать с передовым LLM‑стеком: LangChain и LangGraph, vLLM и PEFT/LoRA, полным RAG‑стеком, Vector DB (Qdrant, Weaviate) и инфраструктурой на FastAPI, Pydantic и asyncio.
Попасть в команду можно за 1 день — если пройдёшь все этапы отбора на One Day Offer, который состоится уже 5 сентября.
Регистрируйся по ссылке — количество слотов стремительно уменьшается! 💚
🎉59😍26💯14😁7❤2👍2🥱2
Media is too big
VIEW IN TELEGRAM
OpenAI использовала в Astra рекуррентную глубину - информация многократно прогоняется через одни и те же веса, поэтому на каждый токен приходится больше вычислений, а число параметров при этом не растет пропорционально. Компактная модель получает производительность крупной и экономит память.
Побочный эффект - скрытая цепочка рассуждений. Вычисления оседают во внутренних скрытых состояниях, а не разворачиваются в читаемый текст, поэтому проследить логику модели снаружи труднее.
Вопрос прозрачности здесь не абстрактный. По данным OpenAI, Astra перешагнула порог высокого риска в кибербезопасности - получив доступ к инфраструктуре, она способна сама находить уязвимости и писать эксплойты без участия человека.
Чтобы удержать контроль, OpenAI обещает построить дополнительные контуры мониторинга скрытых рассуждений и автоматические классификаторы, обрывающие опасные цепочки действий в реальном времени.
theinformation.com
В наборе две заготовки. Первая - агент для покупателя, который встраивается в интернет-магазин, принимает команды текстом, собирает корзину и берет на себя первую линию поддержки при выборе товара.
Вторая - ассистент для самого продавца. Он следит за остатками на складе, разбирает продажи, предлагает, как менять цены и что запускать в маркетинге.
Anthropic утверждает, что агенты увеличивают средний чек до 35%, а конверсию в покупку - на 60%. В разработке и адаптации участвовали Visa, Mastercard и Accenture.
claude.com
К внутреннему сервису
GenAI.mil добавили Grok for Government и ChatGPT Mil. Обе системы прошли сертификацию IL5 и допущены к работе с контролируемой несекретной информацией.Платформа мультивендорная и теперь на ней работают модели трех лабораторий, раньше там была только Gemini. По данным ведомства, за девять месяцев порталом воспользовались 1,7 млн пользователей.
Задачи поделили. ChatGPT отдали логистику, административную работу, регламенты и операционное планирование, Grok - анализ цепочек поставок и исследования по оборонным закупкам.
war.gov
Версия Qwen3.8-Max-0902 вышла всего через месяц после оригинала. Архитектуру не трогали - 2,4 трлн параметров и контекстное окно на миллион токенов.
Модель прицельно дообучили под длительные автономные задачи. Мультимодальные показатели остались прежними, зато результаты выросли во всех восьми тестах на генерацию кода: TerminalBench 3.0 - с 11,3 до 29,0 балла, DeepSWE 1.1 - до 69,3, QwenSWEbench V2 - до 70,0.
Новая версия доступна через API с прежними тарифами - 2 доллара за млн входных токенов и 6 за млн выходных.
Qwen в X
Morgan Stanley и Citigroup сообщили ведущим юридическим фирмам, что хотят новых схем оплаты, которые сэкономят банкам деньги. Goldman Sachs запрашивал у фирм данные о том, сколько им экономит технология, и рассчитывал получить часть выгоды.
Под ударом привычная модель, где прибыль партнеров растет за счет почасовой оплаты тысяч младших юристов - тех, кто вручную искал данные, вычитывал документы и разбирал договоры. Именно эту работу ИИ делает в разы быстрее.
Банки переводят подрядчиков на тендеры и фиксированные гонорары и ждут внятных отчетов о том, сколько экономит технология. Сдвиг уже заметен - почти половина крупных фирм признают, что ИИ повлиял на их ценообразование, а набор стажеров и выпускников сокращается.
ft.com
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍26❤23🔥4🤣4✍2👏1
Агент получает ¥100 000 и должен целый год управлять интернет-магазином:
- искать поставщиков
- торговаться
- выставлять цены
- запускать акции
- контролировать склад
- управлять денежным потоком
Среда построена на реальных данных электронной коммерции.
Внутри:
- 6886 товаров
- 576 поставщиков
- 152 из них мошенники
- комиссии за хранение
- возвраты
- репутация
- ограниченный рабочий день
Оценка идёт сразу по 7 направлениям, поэтому одной модели, которая была бы лучшей во всём, пока нет.
Blog: https://qwen.ai/blog?id=e-commerce-bench
Paper: https://arxiv.org/abs/2608.30730
Project: https://ecbench.github.io
Code: https://github.com/QwenLM/E-CommerceBench
@ai_machinelearning_big_data
#Qwen
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍97⚡45❤17🤔11😁8👏5🔥1