OmniParser - инструмент для анализа скриншотов пользовательского интерфейса, разработанный для улучшения работы агентов UI на основе LLM.
Он преобразует скриншоты в структурированный формат, выделяя интерактивные области и описывая функции элементов(кнопки, иконки, значки и т.д) и не требует исходного HTML или иерархии представлений.
OmniParser состоит из двух моделей:
OmniParser был протестирован в бенчмарках ScreenSpot, Mind2Web и AITW, где превзошел агентов на основе GPT-4V и модели, обученные на данных графических интерфейсов (SeeClick, CogAgent и Fuyu).
⚠️ OmniParser может испытывать трудности с распознаванием повторяющихся элементов, текста и с определением точных границ кликабельных областей.
# Create conda env
conda create -n "omni" python==3.12
conda activate omni
# Install requirement
pip install -r requirement.txt
# Run Gradio UI
python gradio_demo.py
#AI #ML #Microsoft #YOLO8 #BLIP #OmniParser
Please open Telegram to view this post
VIEW IN TELEGRAM
👍10❤2🔥2
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
Простое приложение React + Vite для запуска OuteTTS с помощью Transformers.js и WebGPU.
Попробовать демо можно на HuggingSpace. При первом запуске модель загружается в кэш браузера, это занимает какое-то время.
# Clone the repository
git clone https://github.com/huggingface/transformers.js-examples.git
# Go to project dir
cd transformers.js-examples/text-to-speech-webgpu
# Install the dependencies via npm
npm i
# Run dev server
npm run dev
# Open your browser and go to http://localhost:5173
@ai_machinelearning_big_data
#AI #ML #TTS #WebGPU #TransfomersJS
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7❤2🔥2👏2
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
Концепт, который работает внутри AI Studio, пишет HTML и CSS прямо в процессе серфинга вместо загрузки готовых страниц с серверов. Внешний вид и контент формируются на основе промптов, кликов и контекста навигации.
Технология органично вписывается в концепцию автономных ИИ-агентов, которым может понадобиться быстро собрать временный дашборд или вспомогательный инструмент для текущей задачи.
До идеала еще очень далеко. Поскольку верстка и контент полностью генерируются на не лучшей версии Gemini, браузер уязвим, склонен немного галлюцинировать, искажать стили и тратит прорву токенов на инференс.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7😁1
Forwarded from Анализ данных (Data analysis)
This media is not supported in your browser
VIEW IN TELEGRAM
Проектировать интерфейс теперь можно до написания кода - в терминале или в десктопном приложении.
Достаточно дать базовый промпт (например, несколько вариантов экрана под конкретную задачу), указать команду
/design и модель выдает серию набросков в виде интерактивных Artifacts. Удачный вариант точечно доработать и передать в код.Как пояснил инженер Anthropic Нейт Парротт, модель при этом читает существующую кодовую базу проекта - чтобы новые компоненты сразу попадали в визуальный стиль приложения.
Одно ограничение - макеты учитываются при генерации кода, но сохранять их приходится вручную.
Чтобы попробовать, обновите Claude Code командой
claude update.#news #ai #ml
@data_analysis_ml / Папка полезного по ML.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5👎4❤1🔥1
Forwarded from Machinelearning
Сотрудник ValsAI Геби Джафф несколько месяцев безуспешно пробовал натравливать модели на нерешённые исторические шифры.
Воодушевившись метриками Fable 5.1, он поставил ей задачу - найти шифр самой и решить его, но с условием не браться за те, где ответ уже известен или где возможно множество правдоподобных версий.
И ещё не лезть в совсем неподъёмное вроде Kryptos K4, над которым бьются лучшие умыи ЦРУ .
В конце его трактата Логопандектейсион 1653 года стоят две строки по 32 числа.
Загадку выносили как открытую проблему ещё в 1899 году, она попадала в криптографическую литературу XX века, а Клаус Шмее включил её в список пятидесяти нерешённых зашифрованных сообщений.
Fable потратила на неё 44 минуты и 176 тысяч токенов без вмешательства человека.
Криптограмма напечатана сразу после 32 разделов трактата, а в каждой строке шифра ровно 32 числа. Совпадение неслучайное, и Fable зацепилась именно за него.
Правило оказалось таким: i-е число в строке - это индекс слова внутри i-го раздела книги. Берём слово по индексу, берём его первую букву, собираем по порядку. Обычный поиск по смещению, только вместо массива текст.
Результатом расшифровки оказалась роялистская молитва: Господи, храни короля Карла Второго и сделай его верховным правителем этой земли.
Дальше Fable взялась за второй шифр Эркарта - Cyphral Octastich из трактата The Jewel 1652 года, 285 чисел, тоже нерешённый.
Тот же приём, только числа указывают на страницы книги, а не на абзацы. Из 285 букв сложились 276 - там тоже оказалась молитва. Девять букв дали бессмыслицу: либо Эркарт ошибся сам, либо наборщик переставил цифры при печати.
Шифр, безусловно, простой и другие модели, скорее всего, тоже справились бы, но этот случай не про способности Fable в криптоанализе, а в умении разглядеть среди десятков задач одну податливую и не бросить её на полпути.
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤4👍3🔥1
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
Новое поколение генератора изображений работает на 50% быстрее версии 2.0. Лучше проработаны текстуры, естественнее свет, точнее сохраняются ключевые черты объектов с референсных фотографий.
Хэдлайнер релиза - улучшенный режим редактирования. Модель меняет отдельную деталь сцены, не трогая остальное, и картинка больше теряет структуры при серии последовательных правок в одном диалоге.
Ещё она научилась сразу генерировать изображения с прозрачным фоном и точнее держит сложные композиционные инструкции.
Релиз разделен на 2 варианта модели:
Также в ChatGPT добавили Sketch, генерацию по наброскам от руки, возможность комментировать отдельные области изображения и готовые шаблоны вёрстки.
Модель доступна в вебе, приложениях ChatGPT и Codex и через API.
Цены на Flare и Sunburst одинаковые:
$5 за миллион входных текстовых токенов, $8 - за тот же миллион в виде изображений и $30 за миллион выходных.
Есть кэширование - $1,25 (текст) и $2 (изображение).
@ai_machinelearning_big_data
#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
❤5👍4