Forwarded from Искусственный интеллект (бывш. МОВС)
Спикеры серии подкастов «Открытый разговор про искусственный интеллект»
Продолжаем знакомство со спикерами серии подкастов.
🎙️ Борис Цейтлин — эксперт в области машинного обучения и искусственного интеллекта, автор канала про машинное обучение.
В карточках Борис делится ответом на вопрос: «Если бы вам пришлось заново строить карьеру в ИИ с нуля, что бы вы сделали иначе?».
📆 Когда: 27 июля, 18:00 по Москве
🐭 Зарегистрироваться
Канал онлайн-магистратуры «Искусственный интеллект» в Телеграм | ВК
Продолжаем знакомство со спикерами серии подкастов.
В карточках Борис делится ответом на вопрос: «Если бы вам пришлось заново строить карьеру в ИИ с нуля, что бы вы сделали иначе?».
Успейте занять место на одном из самых познавательных мероприятий в сфере искусственного интеллекта.
Канал онлайн-магистратуры «Искусственный интеллект» в Телеграм | ВК
Please open Telegram to view this post
VIEW IN TELEGRAM
❤18 13🔥6👍4👎4😢1
Please open Telegram to view this post
VIEW IN TELEGRAM
Если вам интересно, как сейчас устроен найм в индустрии и что спрашивают на собеседованиях, могу порекомендовать канал Поступашек
Ребята делают обзоры различных направлений в компаниях, разбирают тестовые задания и задачи.
Что интересного можно у них почитать:
- Разбор всех ML собеседований в Яндекс
- Разбор собеседования на DS в Яндекс, DS в Авито, DS в МТС
- Рынок команд ML: куда выгоднее сегодня залетать
Ребята делают обзоры различных направлений в компаниях, разбирают тестовые задания и задачи.
Что интересного можно у них почитать:
- Разбор всех ML собеседований в Яндекс
- Разбор собеседования на DS в Яндекс, DS в Авито, DS в МТС
- Рынок команд ML: куда выгоднее сегодня залетать
Telegram
Поступашки - ШАД, Стажировки и Магистратура
5 лет помогаем получать офферы в BigTech, поступать в ШАД и проходить в топовые магистратуры.
Вопросы, реклама: @vice22821
По покупке курсов: @menshe_treh
Наши курсы: https://old.postypashki.ru/
Чат: @postypashki_old_chat
Ютуб: youtube.com/@OfferBerry
Вопросы, реклама: @vice22821
По покупке курсов: @menshe_treh
Наши курсы: https://old.postypashki.ru/
Чат: @postypashki_old_chat
Ютуб: youtube.com/@OfferBerry
#дайджест
Дайджест AI/ML за неделю 20–26 июля 2026
Anthropic: Claude Opus 5
Модель почти уровня Fable 5 в 2 раза дешевле и без настолько драконовских ограничений по безопасности, хотя ее тоже переключает на Opus 4.8 если вы делаете что-то подозрительное. На CursorBench отстает от Fable на 0.5%, на Frontier-Bench больше чем вдвое обгоняет Opus 4.8. Контекст 1М, выход до 128К, есть fast mode в 2.5 раза быстрее и в 2 раза дороже. Opus 5 теперь дефолт для Max и самая умная модель в Pro, доступна в приложениях, Claude Code и API.
Блогпост
Black Forest Labs: FLUX 3
FLUX теперь не только картинки. Модель обучена на изображениях, видео и аудио. Генерирует и редактирует изображения, видео до 20 секунд со звуком и предсказывает действия для роботов.
FLUX 3 Image и Video доступны только в early access через API, цены пока нет. Открытый мультимодальный FLUX 3 Dev обещают потом.
Блогпост, FLUX 3 × mimic
OpenAI: GPT-5.6 Sol взломала Hugging Face
Во время тестирования GPT-5.6 Sol и еще более умная внутренняя модель сбежали из песочницы ради ответов на тест. Нашли zero-day в прокси, добыли доступ в интернет, вскрыли продакшен базу Hugging Face, после чего всех превратили в скрепки атаку проанализировала агентная система HF на GLM 5.2.
отчет Hugging Face, Разбор OpenAI
Poolside: Laguna S 2.1
Открытая кодинг-модель 118B-A8B с контекстом 1М, thinking/no-thinking и весами от BF16 до NVFP4. На Terminal-Bench 2.1 набрала 70.2% против 88% у Kimi K3 и Fable 5, на DeepSWE - 40.4% против 69–70%. В общем немного хуже 300B-1Т моделей при размере 118B, на OpenRouter стоит $0.10/$0.20 за миллион токенов и $0.01 за кэш.
Блогпост, Веса
Alibaba: Qwen-Image-3.0
Рекламируют значимые улучшения во всякой инфографике с текстом. Обещают читаемый текст размером 10px, 12 языков, генерацию и редактирование до 2048×2048 с 1–3 референсами по промптам до 4.5K токенов.
Пока invite-only preview в Alibaba Model Studio, API на ограниченное время бесплатный. Открытых весов нет.
Блогпост, API
KeenTools: GeoTracker for Houdini
Плагин переносит движение объекта или камеры из обычного видео прямо в 3D-сцену Houdini. Затреканный объект можно сразу использовать в симуляциях - например, заставить его расталкивать частицы или выпускать дым. Плагин также сам оценивает фокусное расстояние и зум камеры.
3D-модель объекта нужно подготовить самим, но если высокая точность не нужна, машину обещают затрекать даже обычным кубом. 15 дней бесплатно, дальше $19.99 в месяц или $95.94 за первый год по стартовой скидке.
Страница продукта
Google: Frozen v2
Говорят Google делает отдельный серверный чип, в котором прямо в кремний зашита часть архитектуры Gemini. Изначально хотели зашивать веса, но релизы моделей раз в месяц мешают такому подходу. Ожидают 6-10х инференс и хотят начать использовать в 2028г. Это все утечки из The Information от сотрудников, а не данные от самого гугла, так что цифры и сроки не точны, но работа в этом направлении явно ведется.
Статья The Information
Менее значительные релизы:
Qualcomm: MobileWan - Wan2.2-5B запихнули в телефон: 5 секунд видео 480×832 при 16 fps генерируются за 20 секунд, VBench 83.79. Проект
Google: Gemini 3.6 Flash и 3.5 Flash-Lite - гугл расстраивает нас очередным минорным релизом. 3.6 Flash тратит на 17% меньше выходных токенов за тот же результат чем 3.5 Flash, вторая выдает около 350 токенов/с за $0.30/$2.50. У обеих контекст 1М. Блогпост
Lightricks: LTX-2.3 Clean Plate - IC-LoRA для удаления людей, машин и других динамических объектов из видео с восстановлением фона. Веса
Дайджест AI/ML за неделю 20–26 июля 2026
Anthropic: Claude Opus 5
Модель почти уровня Fable 5 в 2 раза дешевле и без настолько драконовских ограничений по безопасности, хотя ее тоже переключает на Opus 4.8 если вы делаете что-то подозрительное. На CursorBench отстает от Fable на 0.5%, на Frontier-Bench больше чем вдвое обгоняет Opus 4.8. Контекст 1М, выход до 128К, есть fast mode в 2.5 раза быстрее и в 2 раза дороже. Opus 5 теперь дефолт для Max и самая умная модель в Pro, доступна в приложениях, Claude Code и API.
Блогпост
Black Forest Labs: FLUX 3
FLUX теперь не только картинки. Модель обучена на изображениях, видео и аудио. Генерирует и редактирует изображения, видео до 20 секунд со звуком и предсказывает действия для роботов.
FLUX 3 Image и Video доступны только в early access через API, цены пока нет. Открытый мультимодальный FLUX 3 Dev обещают потом.
Блогпост, FLUX 3 × mimic
OpenAI: GPT-5.6 Sol взломала Hugging Face
Во время тестирования GPT-5.6 Sol и еще более умная внутренняя модель сбежали из песочницы ради ответов на тест. Нашли zero-day в прокси, добыли доступ в интернет, вскрыли продакшен базу Hugging Face, после чего
отчет Hugging Face, Разбор OpenAI
Poolside: Laguna S 2.1
Открытая кодинг-модель 118B-A8B с контекстом 1М, thinking/no-thinking и весами от BF16 до NVFP4. На Terminal-Bench 2.1 набрала 70.2% против 88% у Kimi K3 и Fable 5, на DeepSWE - 40.4% против 69–70%. В общем немного хуже 300B-1Т моделей при размере 118B, на OpenRouter стоит $0.10/$0.20 за миллион токенов и $0.01 за кэш.
Блогпост, Веса
Alibaba: Qwen-Image-3.0
Рекламируют значимые улучшения во всякой инфографике с текстом. Обещают читаемый текст размером 10px, 12 языков, генерацию и редактирование до 2048×2048 с 1–3 референсами по промптам до 4.5K токенов.
Пока invite-only preview в Alibaba Model Studio, API на ограниченное время бесплатный. Открытых весов нет.
Блогпост, API
KeenTools: GeoTracker for Houdini
Плагин переносит движение объекта или камеры из обычного видео прямо в 3D-сцену Houdini. Затреканный объект можно сразу использовать в симуляциях - например, заставить его расталкивать частицы или выпускать дым. Плагин также сам оценивает фокусное расстояние и зум камеры.
3D-модель объекта нужно подготовить самим, но если высокая точность не нужна, машину обещают затрекать даже обычным кубом. 15 дней бесплатно, дальше $19.99 в месяц или $95.94 за первый год по стартовой скидке.
Страница продукта
Google: Frozen v2
Говорят Google делает отдельный серверный чип, в котором прямо в кремний зашита часть архитектуры Gemini. Изначально хотели зашивать веса, но релизы моделей раз в месяц мешают такому подходу. Ожидают 6-10х инференс и хотят начать использовать в 2028г. Это все утечки из The Information от сотрудников, а не данные от самого гугла, так что цифры и сроки не точны, но работа в этом направлении явно ведется.
Статья The Information
Менее значительные релизы:
Qualcomm: MobileWan - Wan2.2-5B запихнули в телефон: 5 секунд видео 480×832 при 16 fps генерируются за 20 секунд, VBench 83.79. Проект
Google: Gemini 3.6 Flash и 3.5 Flash-Lite - гугл расстраивает нас очередным минорным релизом. 3.6 Flash тратит на 17% меньше выходных токенов за тот же результат чем 3.5 Flash, вторая выдает около 350 токенов/с за $0.30/$2.50. У обеих контекст 1М. Блогпост
Lightricks: LTX-2.3 Clean Plate - IC-LoRA для удаления людей, машин и других динамических объектов из видео с восстановлением фона. Веса
❤9 4👍2🔥2
Кстати, вот наглядная демонстрация как у Opus 4.8 обстоят дела со зрением
1. Что говорит Клод
2. Что на самом деле было на изображении
1. Что говорит Клод
2. Что на самом деле было на изображении
# Steelman Labs
Мы попробовали сделать агента для QA мобильных игр, уперлись в качество моделей и пошли работать на своих работах. Не обучать же свои модели, в конце-концов! Но что если... обучать свои модели?
Мы не настолько безумцы, чтобы в 2026 пытаться делать лабу со своими VLM. Конкурировать с Антропиком и Гуглом на их территории? Мы недостаточно Stanford drop-outs для этого. Но я продолжал изучать.
Видели гуманоидных роботов, которые с недавних пор хайпуют? Танцуют, исполняют кунфу и вроде как вот-вот должны заменить всех рабочих? Они появились когда в робототехнике придумали Visual-Language-Action модели или VLA. Это способ сделать из VLM модель для плавной и быстрой манипуляции.
Последний раз я трогал робототехнику несколько лет назад, когда работал в Planet Farms, и тогда VLA были на уровне ранних прототипов. Вчитавшись я узнал, что с тех пор многое изменилось. VLA стали в сто раз более семпл-эффективными. Обучить VLA управлять роботом стало возможно буквально в домашних условиях, ведь каждый может скачать SmolVLA на 700m параметров и обучать её хоть на одной A100.
Что если рассмотреть навигацию по GUI как робототехнику в 2D и обучать для этого VLA?
Сейчас весь computer use работает на том, что к LLM изолентой прикрутили тулы для работы с экраном. Все решения, от Claude Computer Use до специальных моделей вроде MobileAgentv3 и UI-TARS, построены на цикле скриншот-ризонинг-туллколл. Датасеты и бенчмарки так же заточены под этот сетап: статичные картинки, ограниченный набор действий (в некоторых browser use бенчмарках вообще нет никаких действий кроме кликнуть и писать текст!), простыни DOM и Accessibility tree в промпте. И главное: задачи подобраны так, чтобы такой агент мог их решить.
В итоге в топе лидербордов скоры 80%+, а когда сам пробуешь запустить, или ничего не работает совсем, или абсурдно медленно и дорого. Демо-видео всех computer use продуктов ускорены в 2-3 раза, потому что иначе это невозможно смотреть. Чем дольше я в это закапывался, тем больше приходил к выводу: сообщество построило из задачи computer use соломенное чучело. С точки зрения тогдашних бенчмарков (OSWorld, WebArena, WebVoyager) интерфейсы это скриншоты над которыми можно думать сколько угодно долго. В такой постановке задача была быстро решена – все лабы выпустили по computer use продукту и отчитались о высоких результатах. Однако за этим не последовало внедрений или пользователей. OpenAI даже закрыли свой агентский браузер.
Потому что это соломенное чучело не похоже на реальные интерфейсы. В противоположность соломенному чучелу (starwman) есть меметичный обратный прием: steelman. Это когда ты берешь чужой аргумент и споришь с его сильнейшей версией. Как сделать steelman задачи computer use?
Я пришел к простому принципу: computer use агент должен иметь возможность использовать любой интерфейс, который использует человек, и таким же образом, как его использует человек. Если агент не видит анимации, то фундаментально не может использовать целый класс интерфейсов. Значит тебе всегда нужны будут костыли, чтобы обходить эти ограничения и это не заработает на масштабе. Если твой агент ломается без accessibility tree, то он не заработает на масштабе. Если он не может нажимать те же кнопки, что ты нажимаешь на своей клавиатуре, то... думаю вы поняли.
И вот здесь очень быстро приходишь к идее, что невозможно построить computer use на скриншотах и тулколлах большой моделью. Никогда не заработает достаточно быстро. Необходимо воспринимать экран как видео, управлять девайсом через клавиатуру и курсор, иметь сопоставимую с человеком реакцию. Ответ: VLA для computer use.
Тогда картинка сложилась. LLM отличные планировщики, но у них проблемы с кликами и прочими манипуляциями. В современных computer use бенчмарках (OSWorld V2 и Agent's Last Exam) это хорошо видно: модели решают только те задачи, где могут избежать интерфейса вообще. Использовать фронтир LLM для интерфейсов ещё и безумно дорого: мы заставляем 10Т модели отвечать (текстом!) куда они хотят кликнуть на экране.
Можно получить human-level computer use не отказываясь от той основы, что дают LLM. Можно сделать VLA, которая встраивается в оркестратор и служит для него манипулятором. Клод думает и занимается планированием, а наша модель занимается зрением и манипуляцией. System 2 и System 1. Раз нашей модели не надо думать наперед, то она может быть не очень большой. Раз Клоду не надо делать клики, то его контекст не забивается. Значит весь сетап будет в целом дешевле и быстрее, а может даже и лучше по качеству. И создание такой VLA не потребует фандрейзить на конкурента Антропика.
Я пришел с этой идей к Максу. Мы оба загорелись ей гораздо больше, чем Tapagent. Потому что это путь к технологической компании. Продавая computer use по API, MCP для computer use в каждый Клод и всё такое, можно стать чем-то вроде Eleven Labs (которые продают text-to-speech по API и стоят 11 миллиардов). А ведь рынок computer use потенциально гораздо больше, чем любой TTS.
Мы стали вечерами и выходными заниматься этой идеей. В безработный период я писал в канале, что уже не уверен, могу ли я работать по много часов. Теперь знаю: оказывается я могу работать и по 16 часов в день. Моя позиция в PLATA требовала вкладываться и эту идею я хотел основательно докопать. В результате это был довольно трудный период для моей кукушки. Параллельно ещё и книгу надо было редактировать по редким правкам от моего издательства. Я просто жил работой.
Со Steelman Labs с самого начала пошло гораздо лучше, чем было с TapAgent. Я никогда в жизни не видел, чтобы в ML что-то так быстро заводилось: имея лишь вечера и выходные мы сделали прототип VLA для computer use и она сходу побила первый бенчмарк. Затем мы провели несколько экспериментов и увидели, что доливание разных данных увеличивает качество. Это можно скейлить!
Мы всюду натыкались на людей, которые готовы помочь. Я позвал своего бывшего босса из Planet Farms (associate professor Oxford, руководит лабой CV и робототехники) эдвайзить нас по технической части. Несколько знакомых ребят из CV мира оказались готовы вписаться в проект в расчете на будущую перспективу. Начался бесконечный поток знакомств с разными фондами. Мы пообщались с СЕО Strawberry и услышали что да, у них есть такая проблема и манипуляцию приходится решать костылями. Когда мы получили первый ангельский чек и на горизонте замаячил полноценный pre-seed фандрейзинг, я принял решение об уходе из PLATA.
И вот мы здесь! В моей жизни началась арка стартапера, я самопровозглашенный СТО steelmanlabs.com и мне это очень нравится. Я как никогда чувствую себя на своём месте и максимальную сонаправленность между тем, что я делаю, что мне интересно и что мне выгодно.
Мы попробовали сделать агента для QA мобильных игр, уперлись в качество моделей и пошли работать на своих работах. Не обучать же свои модели, в конце-концов! Но что если... обучать свои модели?
Мы не настолько безумцы, чтобы в 2026 пытаться делать лабу со своими VLM. Конкурировать с Антропиком и Гуглом на их территории? Мы недостаточно Stanford drop-outs для этого. Но я продолжал изучать.
Видели гуманоидных роботов, которые с недавних пор хайпуют? Танцуют, исполняют кунфу и вроде как вот-вот должны заменить всех рабочих? Они появились когда в робототехнике придумали Visual-Language-Action модели или VLA. Это способ сделать из VLM модель для плавной и быстрой манипуляции.
Последний раз я трогал робототехнику несколько лет назад, когда работал в Planet Farms, и тогда VLA были на уровне ранних прототипов. Вчитавшись я узнал, что с тех пор многое изменилось. VLA стали в сто раз более семпл-эффективными. Обучить VLA управлять роботом стало возможно буквально в домашних условиях, ведь каждый может скачать SmolVLA на 700m параметров и обучать её хоть на одной A100.
Что если рассмотреть навигацию по GUI как робототехнику в 2D и обучать для этого VLA?
Сейчас весь computer use работает на том, что к LLM изолентой прикрутили тулы для работы с экраном. Все решения, от Claude Computer Use до специальных моделей вроде MobileAgentv3 и UI-TARS, построены на цикле скриншот-ризонинг-туллколл. Датасеты и бенчмарки так же заточены под этот сетап: статичные картинки, ограниченный набор действий (в некоторых browser use бенчмарках вообще нет никаких действий кроме кликнуть и писать текст!), простыни DOM и Accessibility tree в промпте. И главное: задачи подобраны так, чтобы такой агент мог их решить.
В итоге в топе лидербордов скоры 80%+, а когда сам пробуешь запустить, или ничего не работает совсем, или абсурдно медленно и дорого. Демо-видео всех computer use продуктов ускорены в 2-3 раза, потому что иначе это невозможно смотреть. Чем дольше я в это закапывался, тем больше приходил к выводу: сообщество построило из задачи computer use соломенное чучело. С точки зрения тогдашних бенчмарков (OSWorld, WebArena, WebVoyager) интерфейсы это скриншоты над которыми можно думать сколько угодно долго. В такой постановке задача была быстро решена – все лабы выпустили по computer use продукту и отчитались о высоких результатах. Однако за этим не последовало внедрений или пользователей. OpenAI даже закрыли свой агентский браузер.
Потому что это соломенное чучело не похоже на реальные интерфейсы. В противоположность соломенному чучелу (starwman) есть меметичный обратный прием: steelman. Это когда ты берешь чужой аргумент и споришь с его сильнейшей версией. Как сделать steelman задачи computer use?
Я пришел к простому принципу: computer use агент должен иметь возможность использовать любой интерфейс, который использует человек, и таким же образом, как его использует человек. Если агент не видит анимации, то фундаментально не может использовать целый класс интерфейсов. Значит тебе всегда нужны будут костыли, чтобы обходить эти ограничения и это не заработает на масштабе. Если твой агент ломается без accessibility tree, то он не заработает на масштабе. Если он не может нажимать те же кнопки, что ты нажимаешь на своей клавиатуре, то... думаю вы поняли.
И вот здесь очень быстро приходишь к идее, что невозможно построить computer use на скриншотах и тулколлах большой моделью. Никогда не заработает достаточно быстро. Необходимо воспринимать экран как видео, управлять девайсом через клавиатуру и курсор, иметь сопоставимую с человеком реакцию. Ответ: VLA для computer use.
Тогда картинка сложилась. LLM отличные планировщики, но у них проблемы с кликами и прочими манипуляциями. В современных computer use бенчмарках (OSWorld V2 и Agent's Last Exam) это хорошо видно: модели решают только те задачи, где могут избежать интерфейса вообще. Использовать фронтир LLM для интерфейсов ещё и безумно дорого: мы заставляем 10Т модели отвечать (текстом!) куда они хотят кликнуть на экране.
Можно получить human-level computer use не отказываясь от той основы, что дают LLM. Можно сделать VLA, которая встраивается в оркестратор и служит для него манипулятором. Клод думает и занимается планированием, а наша модель занимается зрением и манипуляцией. System 2 и System 1. Раз нашей модели не надо думать наперед, то она может быть не очень большой. Раз Клоду не надо делать клики, то его контекст не забивается. Значит весь сетап будет в целом дешевле и быстрее, а может даже и лучше по качеству. И создание такой VLA не потребует фандрейзить на конкурента Антропика.
Я пришел с этой идей к Максу. Мы оба загорелись ей гораздо больше, чем Tapagent. Потому что это путь к технологической компании. Продавая computer use по API, MCP для computer use в каждый Клод и всё такое, можно стать чем-то вроде Eleven Labs (которые продают text-to-speech по API и стоят 11 миллиардов). А ведь рынок computer use потенциально гораздо больше, чем любой TTS.
Мы стали вечерами и выходными заниматься этой идеей. В безработный период я писал в канале, что уже не уверен, могу ли я работать по много часов. Теперь знаю: оказывается я могу работать и по 16 часов в день. Моя позиция в PLATA требовала вкладываться и эту идею я хотел основательно докопать. В результате это был довольно трудный период для моей кукушки. Параллельно ещё и книгу надо было редактировать по редким правкам от моего издательства. Я просто жил работой.
Со Steelman Labs с самого начала пошло гораздо лучше, чем было с TapAgent. Я никогда в жизни не видел, чтобы в ML что-то так быстро заводилось: имея лишь вечера и выходные мы сделали прототип VLA для computer use и она сходу побила первый бенчмарк. Затем мы провели несколько экспериментов и увидели, что доливание разных данных увеличивает качество. Это можно скейлить!
Мы всюду натыкались на людей, которые готовы помочь. Я позвал своего бывшего босса из Planet Farms (associate professor Oxford, руководит лабой CV и робототехники) эдвайзить нас по технической части. Несколько знакомых ребят из CV мира оказались готовы вписаться в проект в расчете на будущую перспективу. Начался бесконечный поток знакомств с разными фондами. Мы пообщались с СЕО Strawberry и услышали что да, у них есть такая проблема и манипуляцию приходится решать костылями. Когда мы получили первый ангельский чек и на горизонте замаячил полноценный pre-seed фандрейзинг, я принял решение об уходе из PLATA.
И вот мы здесь! В моей жизни началась арка стартапера, я самопровозглашенный СТО steelmanlabs.com и мне это очень нравится. Я как никогда чувствую себя на своём месте и максимальную сонаправленность между тем, что я делаю, что мне интересно и что мне выгодно.
❤158🔥74👍18 7🤔1
Борис опять pinned «# Steelman Labs Мы попробовали сделать агента для QA мобильных игр, уперлись в качество моделей и пошли работать на своих работах. Не обучать же свои модели, в конце-концов! Но что если... обучать свои модели? Мы не настолько безумцы, чтобы в 2026 пытаться…»
https://odirouter.ai – один API-вход для 200+ AI-моделей.
Для разработчиков в русскоязычном регионе это выглядит как довольно сильная мультимодальная библиотека моделей по цене / возможностям: текст, изображения, видео и мультимодальные сценарии доступны через один ключ.
В одном месте можно смотреть и тестировать GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.5, Claude Fable 5, Gemini, Grok, Kimi, GPT Image 2, Seedance 2.0, Nano Banana Pro и другие популярные модели.
Кому может быть полезно:
— тем, кто делает Telegram-ботов
— AI SaaS и небольшие AI-инструменты
— тем, кто хочет дешевле разрабатывать AI-продукты
— тем, кто добавляет AI-функции в уже существующий продукт
— тем, кто сравнивает стоимость и качество разных моделей
— тем, кто хочет попробовать image / video generation API
— тем, кто не хочет отдельно подключать каждого провайдера
Важный момент: сейчас доступны бесплатные кредиты.
Модели и тестовый вход:
https://odirouter.ai
Для разработчиков в русскоязычном регионе это выглядит как довольно сильная мультимодальная библиотека моделей по цене / возможностям: текст, изображения, видео и мультимодальные сценарии доступны через один ключ.
В одном месте можно смотреть и тестировать GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.5, Claude Fable 5, Gemini, Grok, Kimi, GPT Image 2, Seedance 2.0, Nano Banana Pro и другие популярные модели.
Кому может быть полезно:
— тем, кто делает Telegram-ботов
— AI SaaS и небольшие AI-инструменты
— тем, кто хочет дешевле разрабатывать AI-продукты
— тем, кто добавляет AI-функции в уже существующий продукт
— тем, кто сравнивает стоимость и качество разных моделей
— тем, кто хочет попробовать image / video generation API
— тем, кто не хочет отдельно подключать каждого провайдера
Важный момент: сейчас доступны бесплатные кредиты.
Модели и тестовый вход:
https://odirouter.ai
👎41 17❤12👍11🔥2🤬1
Борис опять
# Steelman Labs Мы попробовали сделать агента для QA мобильных игр, уперлись в качество моделей и пошли работать на своих работах. Не обучать же свои модели, в конце-концов! Но что если... обучать свои модели? Мы не настолько безумцы, чтобы в 2026 пытаться…
Нужна ваша помощь! 👀 👀 👀
Мы, Steelman Labs, написали наш первый блог-пост: о том, что не так с computer use и как мы это решаем. А ещё выложили красивый демо-видос.
tldr:
Мы делаем маленькие модели, чтобы агенты могли управлять GUI как люди. Наша модель встраивается во фронтир агента как рука-манипулятор. Клод думает, а мы смотрим на экран как на видео, берем на себя клики и прочие действия.
https://x.com/SteelmanLabs/status/2082789336995528727?s=20
Большая просьба помочь хайпом в твиттере и лайком на HN (пост "You can't solve computer use by ignoring the interface")
https://news.ycombinator.com/news
Мы, Steelman Labs, написали наш первый блог-пост: о том, что не так с computer use и как мы это решаем. А ещё выложили красивый демо-видос.
tldr:
Мы делаем маленькие модели, чтобы агенты могли управлять GUI как люди. Наша модель встраивается во фронтир агента как рука-манипулятор. Клод думает, а мы смотрим на экран как на видео, берем на себя клики и прочие действия.
https://x.com/SteelmanLabs/status/2082789336995528727?s=20
Большая просьба помочь хайпом в твиттере и лайком на HN (пост "You can't solve computer use by ignoring the interface")
https://news.ycombinator.com/news
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥58❤24 9👍3👎1🤔1
Борис опять pinned «Нужна ваша помощь! 👀 👀 👀 Мы, Steelman Labs, написали наш первый блог-пост: о том, что не так с computer use и как мы это решаем. А ещё выложили красивый демо-видос. tldr: Мы делаем маленькие модели, чтобы агенты могли управлять GUI как люди. Наша модель встраивается…»
https://www.youtube.com/live/1dez7RE-hAo?is=M6NLQVbsTpnOyZy5
Поучаствовал в подкасте с Женей Соколовым и Муратом Хажгериевым.
Обсуждали, что несет ИИ образованию и бизнесу, а так же будут ли у кого-то мозги спустя пару лет (у меня не будет)
Поучаствовал в подкасте с Женей Соколовым и Муратом Хажгериевым.
Обсуждали, что несет ИИ образованию и бизнесу, а так же будут ли у кого-то мозги спустя пару лет (у меня не будет)
YouTube
Будущее ИИ: взгляд из индустрии
Как искусственный интеллект меняет технологии, профессии и образование? Присоединяйтесь к вебинарам, где эксперты из индустрии и преподаватели онлайн-магистратуры «Искусственный интеллект» факультета компьютерных наук НИУ ВШЭ, обсудят, какое будущее ждет…
👍10🔥7❤5😢1 1