Разработчик и автор корпоративного code со-pilot Toqan и FinBERT pfgecnbk запустил публичный Leaderbord бенчмарка ProLLM, в котором языковые модели открытого и закрытого типа тестируются на выполнения различных задач в области программирования:
Помимо узкоспециализированных тестов, бенчмарк выполняет несколько общих тестов: Q&A Assistant, Summarization и LLM as a Judge.
На сегодняшний день возможность самостоятельного тестирования моделей этим бенчмарком не реализована, но разработчики открыты для диалога в вопросе корпоративного применения своей системы оценки, с ними можно связаться через форму на сайте.
Toqan ProLLM Leaderboard
@data_analysis_ml
#AI #LLM #ML #Benchmark
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
👍9❤6🔥2🥱1🍌1
🧠 WM-Abench — бенчмарк для оценки памяти у мультимодальных LLM
Новый open-source бенчмарк от Maitrix Research оценивает, как мультимодальные модели (текст + изображение) запоминают и используют визуальную информацию.
📌 Что проверяется:
– Могут ли LLM “удерживать в голове” объекты, числа и расположение
– Насколько глубоко модель понимает визуальный контекст
– Способна ли она логически оперировать на основе того, что “видела”
📈 Поддерживаются: GPT‑4o, Gemini, Claude, LLaVA и другие
🔍 Задания: от простых “где лежит мяч?” до сложных визуальных рассуждений
Исследователи из Maitrix оценили 15 SOTA мультимодальных моделей (включая o3 и Gemini 2.5 Pro) по 23 когнитивным измерениям: от базового восприятия до предсказания будущих состояний.
Ключевые выводы:
🔹 Модели хорошо справляются с распознаванием, но проваливаются в 3D-пространственном мышлении, динамике движения и причинно-следственной симуляции.
🔹 VLM склонны “путать” физику: даже изменение цвета объекта сбивает модель на задачах восприятия.
🔹 В сложных задачах предсказания следующего состояния — даже лучшие модели отстают от человека на 34.3%.
🔹 Точность восприятия ≠ понимание: даже “увидев” всё правильно, модели не умеют достроить последствия и взаимодействия объектов.
Отличный инструмент, чтобы понять на что реально способна ваша мультимодальная модель, а не только на красивые демо.
🔗 https://wm-abench.maitrix.org
#LLM #AI #multimodal #benchmark
Новый open-source бенчмарк от Maitrix Research оценивает, как мультимодальные модели (текст + изображение) запоминают и используют визуальную информацию.
📌 Что проверяется:
– Могут ли LLM “удерживать в голове” объекты, числа и расположение
– Насколько глубоко модель понимает визуальный контекст
– Способна ли она логически оперировать на основе того, что “видела”
📈 Поддерживаются: GPT‑4o, Gemini, Claude, LLaVA и другие
🔍 Задания: от простых “где лежит мяч?” до сложных визуальных рассуждений
Исследователи из Maitrix оценили 15 SOTA мультимодальных моделей (включая o3 и Gemini 2.5 Pro) по 23 когнитивным измерениям: от базового восприятия до предсказания будущих состояний.
Ключевые выводы:
🔹 Модели хорошо справляются с распознаванием, но проваливаются в 3D-пространственном мышлении, динамике движения и причинно-следственной симуляции.
🔹 VLM склонны “путать” физику: даже изменение цвета объекта сбивает модель на задачах восприятия.
🔹 В сложных задачах предсказания следующего состояния — даже лучшие модели отстают от человека на 34.3%.
🔹 Точность восприятия ≠ понимание: даже “увидев” всё правильно, модели не умеют достроить последствия и взаимодействия объектов.
Отличный инструмент, чтобы понять на что реально способна ваша мультимодальная модель, а не только на красивые демо.
🔗 https://wm-abench.maitrix.org
#LLM #AI #multimodal #benchmark
❤11👍3🔥3🙏1
Qwen вместе с Taobao & Tmall и сделала E-Commerce Bench, где агенту дают 100 тысяч юаней и 365 виртуальных дней. Он изучает категории, торгуется с поставщиками, назначает цены, следит за календарём распродаж, тянет склад и контролирует денежные потоки, причём одновременно может вести до четырёх магазинов.
Ни потолок спроса, ни себестоимость ему не показаны - до всего нужно докопаться самому.
Рабочий день идёт с 8 утра до 6 вечера, и каждый вызов инструмента тратит время: проверить деньги (10 минут), открыть магазин (60), написать поставщику (30).
Расходы списываются сразу, а выручка идёт через комиссию, эскроу, 9 дней ожидания и ручной вывод.
Склад сводится посуточно, товар, не отправленный за двое суток, отменяется, а репутация напрямую множит спрос: магазин на дне её шкалы получает 15% от обычного трафика.
Если бы роль поставщика играла языковая модель, одна и та же стратегия давала бы разные цены, а бенч превратился бы в соревнование по джейлбрейку. Поэтому все уступки и отказы считает жёсткий алгоритм, а модель лишь переводит его решения в речь на виртуальных переговорах.
GPT-5.6 Sol - лидер, он закончил год с 1,43 млн юаней, увеличив капитал в 14,3 раза.
Qwen3.8-Max-Preview - лучшая среди моделей с открытыми весами, на конец года у нее было 416 тыс. юаней
Qwen3.5-Plus остался с 1100 юанями.
Кстати, 10 циклов из 90 закончились банкротством, и сценарий почти всегда один - забить склад в январе и не суметь распродать.
Торговаться толком не научился никто.
До себестоимости поставщика не додавил ни один агент. Единственный, кто хоть как-то сбивал цену - Opus 4.7, но по настроению.
Исключение - Qwen3.8-Max-Preview, которая продавливает цену ниже на повторных заказах.
С мошенниками вышло интереснее всего.
Их в реестре 152 из 576 (26,4%), они пишут всем моделям, но у Opus 4.7 деньги получили 4% тех мошенников, с кем он заговорил, у GPT-5.6 Sol - 31,7%.
ИИ-предприниматели категорически не умеют распоряжаться рабочим временем.
Отправки, переходы на следующий день, вывод наличных и выкладка товара съедают 71,8% всех вызовов. На разговоры с поставщиками приходится 6%. На пересмотр цен 0,66%.
Модели заняты обслуживанием процесса, а не экономикой.
Отсюда странность в рейтинге эффективности. Fable5 зарабатывает 479 юаней на вызов против 363 у Sol, тратя при этом почти вдвое меньше вызовов, а по итоговым деньгам идёт позади.
Измерять обучение на длинной дистанции сложно, но тут у бенча есть линейка.
Ядро переговоров никогда не уходит ниже собственной себестоимости, значит лучшая цена, которую агент однажды выбил, - это верхняя граница того, за сколько поставщик готов отдать товар. Дальше можно сравнивать - следующая закупка у того же поставщика прошла дешевле или дороже уже достигнутого.
На 8647 повторных покупок улучшили свой же результат только 2 модели из 18, а 15 переплачивали настолько, что промахивались мимо случайного порядка больше чем на 2 стандартных отклонения.
#AI #ML #Agents #ECommerce #Benchmark #Qwen
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥17👍9❤8