Метаверсище и ИИще

Ух ты, Микрософт опенсорснул новую версию OmniParser V2. С коннекторами.

Нет, это не ответочка Operator-y и не агент для управления вашим компом.

Это улучшайзер первой части работы Оператора и ему подобных систем - сильно оптимизированное распознавание содержимого вашего экрана.

Так и пишут: OMNIPARSER, метод разбора скриншотов пользовательского интерфейса на структурированные элементы, который значительно повышает способность GPT-4V генерировать действия.

Более того, этот парсер-распознаватель экрана может быть пристегнут (опенсорс жеж) как плагин и к другим LLM.

И по этому поводу они также релизнули OmniTool: Control a Windows 11 VM with OmniParser + your vision model of choice. И вот это круто ибо тул может работать с: OpenAI (4o/o1/o3-mini), DeepSeek (R1), Qwen (2.5VL) или Anthropic Computer Use

Интересно наблюдать за процессом "декомпозиции" мозгов LLM. Помните писал про Глубокую Клодку, что расщепление на рассуждающую и отвечающую часть, приводит к улучшению качества ответов. Теперь можно отщепить "зрение" или воспринимающую часть. И комбинировать разные "восприниматоры" и "отвечаторы".

А "восприниматоры" тоже можно разделить по областям: распознаватели экрана, спортивных трансляций, жизни насекомых. Надеваем на LLM разные очки и ну улучшать качество ответов вижен-моделей и не только.

В общем мозги для ИИ сделали, пока заняться нервной системой.

Код и все дела тут:
https://microsoft.github.io/OmniParser/

@cgevent

1👍44🔥31❤5👎1😱1

11.8K viewsSergey Tsyptsyn ️️, edited 14:47

Метаверсище и ИИще

HunyuanVideo GP. GP = GPU POOR

Для гиков. Форк Хуньяня, который работает на картах с 12 Гиг VRAM.

https://github.com/deepbeepmeep/HunyuanVideoGP

GitHub

GitHub - deepbeepmeep/HunyuanVideoGP: HunyuanVideo GP: Large Video Generation Model - GPU Poor version

HunyuanVideo GP: Large Video Generation Model - GPU Poor version - deepbeepmeep/HunyuanVideoGP

1🔥27👍10👎1

12.1K viewsSergey Tsyptsyn ️️, edited 21:52

Метаверсище и ИИще

Smartest AI on Earth

Доживём до понедельника...

@cgevent

1😁74👍17😱7👎2❤1

8.62K viewsSergey Tsyptsyn ️️, 10:36

Метаверсище и ИИще

A - Alignment.

Теперь понятно, почему Маск называет Грок самым смышлёным ИИ на земле.

Грок знает, что хочет услышать хозяин. А может быть и любой вопрошающий.

Ждём-с.

O - Offtop по выходным

@cgevent

1😁72👍10❤2👎1😱1

8.83K viewsSergey Tsyptsyn ️️, edited 14:02

Метаверсище и ИИще

OpenAI без помпы выложили гайд по промптингу своих моделей (в связи с их растущим многообразием).

Там есть:
Разница между рассуждающими и не рассуждающими моделями

Когда использовать именно рассуждающие модели

Как эффективно промптить рассуждающие модели

Думаю, что если вы в теме, попросите chatGPT суммаризировать гайд сами.

Для ленивых - последний пункт про эффективный промптинг:

Developer messages - это новые системные сообщения: Начиная с o1-2024-12-17, модели рассуждений поддерживают Developer messages, а не системные сообщения, чтобы соответствовать поведению цепочки команд, описанному в спецификации модели.

Делайте простые и прямые промпты: модели отлично понимают и отвечают на краткие, четкие инструкции. Избегайте промптов в виде цепочки мыслей: Поскольку эти модели выполняют рассуждения внутренне, предлагать им "продумать шаг за шагом" или "объяснить свои рассуждения" не нужно.

Используйте разделители для ясности, такие как разметка, XML-теги и заголовки разделов, чтобы четко обозначить разные части входных данных, помогая модели интерпретировать различные разделы должным образом.

Try zero shot first, then few shot if needed: Для получения хороших результатов моделям рассуждений часто не требуется несколько примеров, поэтому сначала попробуйте написать промпты без примеров. Если у вас есть более сложные требования к желаемому результату, возможно, вам поможет включение в подсказку нескольких примеров входных и желаемых результатов. Только убедитесь, что примеры очень точно соответствуют инструкциям промпта, так как расхождения между ними могут привести к плохим результатам.

Дайте конкретные указания: если вы явно хотите ограничить ответ модели (например, "предложить решение с бюджетом менее 500 долларов"), явно укажите эти ограничения в промпте.

Будьте предельно конкретны в отношении конечной цели: в инструкциях постарайтесь указать очень конкретные параметры успешного ответа и поощряйте модель продолжать рассуждения и итерации до тех пор, пока она не будет соответствовать вашим критериям успеха.

Форматирование в формате markdown: Начиная с o1-2024-12-17, модели рассуждений в API будут избегать генерирования ответов с форматированием в markdown. Чтобы указать модели, когда вы хотите, чтобы в ответе было форматирование, включите строку Formatting re-enabled в первую строку вашего сообщения разработчику.

https://platform.openai.com/docs/guides/reasoning-best-practices

@cgevent

Openai

Reasoning best practices | OpenAI API

Explore best practices for using o-series reasoning models, like o1 and o3-mini, vs. GPT models—including use cases, how to choose a model, and prompting guidance.

2👍49🔥10❤9👎3

9.85K viewsSergey Tsyptsyn ️️, edited 09:22

Метаверсище и ИИще