Javascript
17K subscribers
1.01K photos
163 videos
2 files
1.47K links
По всем вопросам - @workakkk

@itchannels_telegram -🔥лучшие ИТ-каналы

@ai_machinelearning_big_data - машинное обучение

@JavaScript_testit- js тесты

@pythonl - 🐍

@ArtificialIntelligencedl - AI

@datascienceiot - ml 📚

РКН: № 5153160945
Download Telegram
🔍 OmniParser — это инструмент от Microsoft, предназначенный для разбора и анализа интерфейсов приложений на основе скриншотов

OmniParser - инструмент для анализа скриншотов пользовательского интерфейса, разработанный для улучшения работы агентов UI на основе LLM.

Он преобразует скриншоты в структурированный формат, выделяя интерактивные области и описывая функции элементов(кнопки, иконки, значки и т.д) и не требует исходного HTML или иерархии представлений.

OmniParser состоит из двух моделей:

🟢Модель обнаружения интерактивных элементов, основанная на YOLOv8 и обученная на датасете из 67 тысяч скриншотов веб-страниц с аннотациями кликабельных областей.

🟢Модель описания функций элементов UI, основанная на BLIP-2, обученная на 7 тысячах пар "элемент-описание", созданных с помощью GPT-4o.

OmniParser был протестирован в бенчмарках ScreenSpot, Mind2Web и AITW, где превзошел агентов на основе GPT-4V и модели, обученные на данных графических интерфейсов (SeeClick, CogAgent и Fuyu).

⚠️ OmniParser может испытывать трудности с распознаванием повторяющихся элементов, текста и с определением точных границ кликабельных областей.

▶️Локальная установка и запуск в Gradio UI :

# Create conda env
conda create -n "omni" python==3.12
conda activate omni

# Install requirement
pip install -r requirement.txt

# Run Gradio UI
python gradio_demo.py

📌Лицензирование: MIT License.


🟡Страница проекта
🟡Набор моделей
🟡Arxiv
🖥Github


#AI #ML #Microsoft #YOLO8 #BLIP #OmniParser


🖥 Github
Please open Telegram to view this post
VIEW IN TELEGRAM
👍102🔥2
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
🌟 Text-to-Speech в браузере на безе OuteTTS.

Простое приложение React + Vite для запуска OuteTTS с помощью Transformers.js и WebGPU.

Попробовать демо можно на HuggingSpace. При первом запуске модель загружается в кэш браузера, это занимает какое-то время.

▶️ Локальная установка и запуск:

# Clone the repository
git clone https://github.com/huggingface/transformers.js-examples.git

# Go to project dir
cd transformers.js-examples/text-to-speech-webgpu

# Install the dependencies via npm
npm i

# Run dev server
npm run dev

# Open your browser and go to http://localhost:5173



🟡Demo
🖥Github


@ai_machinelearning_big_data

#AI #ML #TTS #WebGPU #TransfomersJS
Please open Telegram to view this post
VIEW IN TELEGRAM
👍72🔥2👏2
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
✔️ DeepMind сделала браузер-генератор сайтов на Gemini 3.1 Flash-Lite.

Концепт, который работает внутри AI Studio, пишет HTML и CSS прямо в процессе серфинга вместо загрузки готовых страниц с серверов. Внешний вид и контент формируются на основе промптов, кликов и контекста навигации.

Технология органично вписывается в концепцию автономных ИИ-агентов, которым может понадобиться быстро собрать временный дашборд или вспомогательный инструмент для текущей задачи.

До идеала еще очень далеко. Поскольку верстка и контент полностью генерируются на не лучшей версии Gemini, браузер уязвим, склонен немного галлюцинировать, искажать стили и тратит прорву токенов на инференс.


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
👍7😁1
This media is not supported in your browser
VIEW IN TELEGRAM
✔️ В Claude Code появилась команда создания UI-макетов

Проектировать интерфейс теперь можно до написания кода - в терминале или в десктопном приложении.

Достаточно дать базовый промпт (например, несколько вариантов экрана под конкретную задачу), указать команду /design и модель выдает серию набросков в виде интерактивных Artifacts. Удачный вариант точечно доработать и передать в код.

Как пояснил инженер Anthropic Нейт Парротт, модель при этом читает существующую кодовую базу проекта - чтобы новые компоненты сразу попадали в визуальный стиль приложения.

Одно ограничение - макеты учитываются при генерации кода, но сохранять их приходится вручную.


Чтобы попробовать, обновите Claude Code командой claude update.

#news #ai #ml

@data_analysis_ml / Папка полезного по ML.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍5👎41🔥1
Forwarded from Machinelearning
📌 Fable 5.1 вскрыла шифр, который не поддавался 370 лет

Сотрудник ValsAI Геби Джафф несколько месяцев безуспешно пробовал натравливать модели на нерешённые исторические шифры.

Воодушевившись метриками Fable 5.1, он поставил ей задачу - найти шифр самой и решить его, но с условием не браться за те, где ответ уже известен или где возможно множество правдоподобных версий.

И ещё не лезть в совсем неподъёмное вроде Kryptos K4, над которым бьются лучшие умы и ЦРУ.


🟡Модель перебрала кандидатов и остановилась на криптограмме Томаса Эркарта

В конце его трактата Логопандектейсион 1653 года стоят две строки по 32 числа.

Загадку выносили как открытую проблему ещё в 1899 году, она попадала в криптографическую литературу XX века, а Клаус Шмее включил её в список пятидесяти нерешённых зашифрованных сообщений.


Fable потратила на неё 44 минуты и 176 тысяч токенов без вмешательства человека.

🟡Ключом оказалась сама книга

Криптограмма напечатана сразу после 32 разделов трактата, а в каждой строке шифра ровно 32 числа. Совпадение неслучайное, и Fable зацепилась именно за него.

Правило оказалось таким: i-е число в строке - это индекс слова внутри i-го раздела книги. Берём слово по индексу, берём его первую букву, собираем по порядку. Обычный поиск по смещению, только вместо массива текст.

Результатом расшифровки оказалась роялистская молитва: Господи, храни короля Карла Второго и сделай его верховным правителем этой земли.

Дальше Fable взялась за второй шифр Эркарта - Cyphral Octastich из трактата The Jewel 1652 года, 285 чисел, тоже нерешённый.

Тот же приём, только числа указывают на страницы книги, а не на абзацы. Из 285 букв сложились 276 - там тоже оказалась молитва. Девять букв дали бессмыслицу: либо Эркарт ошибся сам, либо наборщик переставил цифры при печати.

Шифр, безусловно, простой и другие модели, скорее всего, тоже справились бы, но этот случай не про способности Fable в криптоанализе, а в умении разглядеть среди десятков задач одну податливую и не бросить её на полпути.



@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
4👍3🔥1
Forwarded from Machinelearning
This media is not supported in your browser
VIEW IN TELEGRAM
⚡️ Релиз ChatGPT Images 2.5

Новое поколение генератора изображений работает на 50% быстрее версии 2.0. Лучше проработаны текстуры, естественнее свет, точнее сохраняются ключевые черты объектов с референсных фотографий.

Хэдлайнер релиза - улучшенный режим редактирования. Модель меняет отдельную деталь сцены, не трогая остальное, и картинка больше теряет структуры при серии последовательных правок в одном диалоге.

Ещё она научилась сразу генерировать изображения с прозрачным фоном и точнее держит сложные композиционные инструкции.

Релиз разделен на 2 варианта модели:

🟠GPT-Image-2.5 Flare - облегчённая, с низкой задержкой;

🟠GPT-Image-2.5 Sunburst - максимальная детализация.

Также в ChatGPT добавили Sketch, генерацию по наброскам от руки, возможность комментировать отдельные области изображения и готовые шаблоны вёрстки.

Модель доступна в вебе, приложениях ChatGPT и Codex и через API.

Цены на Flare и Sunburst одинаковые:

$5 за миллион входных текстовых токенов, $8 - за тот же миллион в виде изображений и $30 за миллион выходных.

Есть кэширование - $1,25 (текст) и $2 (изображение).


@ai_machinelearning_big_data

#news #ai #ml
Please open Telegram to view this post
VIEW IN TELEGRAM
5👍4