This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Пока кто-то борется с ИИ-контентом, OpenAI запускает первую соцсеть, где будет запрещен контент настоящий
Начнем со скучного: представлена Sora 2, новая передовая модель генерации видео OpenAI, создает ролики до 10 секунд со звуком, занимает высокие строчки в бенчмарках. Модель серьезно прокачали в понимании физики, чтобы столкновения, повреждения и сложные движения выглядели реалистично. Доступна бесплатно со старта, но только в США и с достаточно сложной схемой приглашений.
Теперь к интересному: вместе с Sora 2 запускается приложение Sora. Выглядит как копия Tik Tok, но на ИИ-стероидах. В приложении можно генерировать собственные вертикальные видео, публиковать их, смотреть чужие, лайкать, репостить и даже делать ремиксы из понравившихся роликов. А вот живое видео загрузить нельзя, хаха.
Вместо этого у нас есть функция Cameo. Работает следующим образом — загружаем ролик с самим собой (можно, кстати, использовать ролик с вымышленным персонажем), а затем система извлекает из него ваш “образ”. Образ можно использовать в создаваемых видео, причем не обязательно реалистичных: если хочется мультик, то модель перерисует вас в соответствующий стиль.
Дальше еще интереснее. Можно настроить — кто будет пользоваться вашим образом. Только вы сами? Или, например, позволить друзьям создавать ролики с вашим участием — кстати, Sora 2 может генерировать видео сразу с несколькими образами. А можно гульнуть по полной и сделать свой портрет доступным вообще всем пользователям Sora. В общем, пока одни борются с дипфейками, в OpenAI построили идеальную платформу для их генерации.
Мне невероятно интересно, во что это все выльется и в плане коммерческого успеха, и в плане юридических рисков. В OpenAI утверждают, что в приложении Sora каждый пользователь будет видеть все ролики, где использован его облик — и удалять те, которые не понравились.
Конечно обещаны мощные фильтры безопасности, которые не будут пропускать клубничку и всякую грязь. Но мы отлично знаем, что на любой фильтр безопасности быстро находится хитрый промпт, его взламывающий. Плюс я вообще не понимаю, как бороться с тем, что видео с вами загрузить кто-то другой и будет использовать как свой облик.
В общем, ближайшее время в области ИИ-генерации видео, возможно, будут очень интересным. Или нет — у OpenAI полно проектов, которые запускались громко, а затем забывались буквально за считанные месяцы.
P.S. Друзья, ближайшие дни будут сильно новостными — близится OpenAI DevDay, под который много анонсов заготовила как сама OpenAI, так и конкуренты. Завтра постараюсь поделиться впечатлениями от Claude Sonnet 4.5 — новинка интересна несколькими очень необычными особенностями. Stay tuned!
Начнем со скучного: представлена Sora 2, новая передовая модель генерации видео OpenAI, создает ролики до 10 секунд со звуком, занимает высокие строчки в бенчмарках. Модель серьезно прокачали в понимании физики, чтобы столкновения, повреждения и сложные движения выглядели реалистично. Доступна бесплатно со старта, но только в США и с достаточно сложной схемой приглашений.
Теперь к интересному: вместе с Sora 2 запускается приложение Sora. Выглядит как копия Tik Tok, но на ИИ-стероидах. В приложении можно генерировать собственные вертикальные видео, публиковать их, смотреть чужие, лайкать, репостить и даже делать ремиксы из понравившихся роликов. А вот живое видео загрузить нельзя, хаха.
Вместо этого у нас есть функция Cameo. Работает следующим образом — загружаем ролик с самим собой (можно, кстати, использовать ролик с вымышленным персонажем), а затем система извлекает из него ваш “образ”. Образ можно использовать в создаваемых видео, причем не обязательно реалистичных: если хочется мультик, то модель перерисует вас в соответствующий стиль.
Дальше еще интереснее. Можно настроить — кто будет пользоваться вашим образом. Только вы сами? Или, например, позволить друзьям создавать ролики с вашим участием — кстати, Sora 2 может генерировать видео сразу с несколькими образами. А можно гульнуть по полной и сделать свой портрет доступным вообще всем пользователям Sora. В общем, пока одни борются с дипфейками, в OpenAI построили идеальную платформу для их генерации.
Мне невероятно интересно, во что это все выльется и в плане коммерческого успеха, и в плане юридических рисков. В OpenAI утверждают, что в приложении Sora каждый пользователь будет видеть все ролики, где использован его облик — и удалять те, которые не понравились.
Конечно обещаны мощные фильтры безопасности, которые не будут пропускать клубничку и всякую грязь. Но мы отлично знаем, что на любой фильтр безопасности быстро находится хитрый промпт, его взламывающий. Плюс я вообще не понимаю, как бороться с тем, что видео с вами загрузить кто-то другой и будет использовать как свой облик.
В общем, ближайшее время в области ИИ-генерации видео, возможно, будут очень интересным. Или нет — у OpenAI полно проектов, которые запускались громко, а затем забывались буквально за считанные месяцы.
P.S. Друзья, ближайшие дни будут сильно новостными — близится OpenAI DevDay, под который много анонсов заготовила как сама OpenAI, так и конкуренты. Завтра постараюсь поделиться впечатлениями от Claude Sonnet 4.5 — новинка интересна несколькими очень необычными особенностями. Stay tuned!
🔥58❤27😁11👍4🥰2
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Sora 2 — большой разбор
Помню про обещание написать про Claude Sonnet 4.5, но давайте пропустим вперед Sora 2 — зря я что ли с ней сегодня весь день игрался? Держите детальные впечатления.
Как пользоваться?
Sora 2 пока работает только из США и Канады с веб-сайта и iOS-приложения — для его загрузки понадобится американский аккаунт, их продают за несколько сотенна маркетплейсах (я покупал пару месяцев назад, ничего не произошло). Нейронка доступна в том числе на бесплатных планах, на Plus неограниченные генерации, а на Pro — выше разрешение и возможность создавать ролики не по 10 секунд, а по 20.
Просто так попасть нельзя, нужен инвайт-код. Их стоит ловить на Reddit: каждый пользователь получает возможность пригласить еще четверых, так что больших проблем нет. Беда в другом — сервис уже перегружен и у меня ближе к вечеру регулярно выдает отказ в генерации на тарифе Plus. Не стоит переживать: смотрим на первый ролик (далее видео пойдут по порядку) и видим…
…как Сэм Альтман лично покупает видеокарты в магазине
Собственно, пример работы функции Cameo. Каждый пользователь Sora может записать свой облик и дать разрешение, кто его может использовать — только он сам, друзья или все подряд. У главы OpenAI выдано разрешение на всех, поэтому за сегодня он стал героем тысяч ИИ-роликов.
Кстати, буквально несколько часов назад Sora 2 позволяла генерировать видеозаписи с воровством видеокарт — в том числе, с камер наблюдения. И народ быстро задался вопросом — а что, если сгенерить запись с другим человеком и отправить в полицию? Сейчас система безопасности все чаще запрещает создавать такие видео.
Но вопросов все равно много — например, к авторским правам.
Вот у нас герои South Park переехали в Сибирь
Народ сегодня весь день резвится, создавая пародии на “Южный парк”, “Рика и Морти”, “Симпсонов” и так далее. В OpenAI опираются на механизм opt-out: Sora 2 создает ролики с объектами, защищенными авторским правом (персонажи, стили брендов), пока правообладатель не заявил отказ. На людей это не распространяется — только с разрешения.
Я надеюсь, что правообладатели оставят свой контент. Штука прикольная и полезная для продвижения бренда - сейчас, например, генерят ролики, на которых Пикачу оказывается в разных фильмах и мультиках. Я тоже отправил желтого в…
…Жил был пес!
Персонажи из знаменитого советского мультика переданы не со 100% точностью, но узнаваемы, как и стиль. Плюс обратите внимание: Sora 2 отлично делает русскую озвучку. А если не прописали в промпте — придумает ее сама, как в этом случае. Если хотите поэкспериментировать, то промпт простой (главное, чтобы не ввели запрет на использование Пикачу):
Но ладно, давайте теперь что-нибудь более серьезное.
Сэм Альтман решает, что больше: 9.11 или 9.9
Классический тест, в котором нейронки ошибались еще совсем недавно. Как мы видим, теперь с задачей справляется даже модель для генерации видео.
Тест со стаканом и стрелками
Условный пример того, как модели продвигаются вперед в понимании физики. Если посмотреть через полный воды стакан, то изображение будет перевернутым. Раньше на этой задачке валились многие модели создания видео — Sora 2 справляется.
Но на последнем видео все-таки выскажу фи. В Sora 2 круто прокачали физику, здорово, что есть поддержка русского языка, интересный эксперимент с социальной сетью.
Но что меня раздражает до сих пор и почему я редко использую ИИ для генерации картинок и видео, предпочитая им чат-боты — это огромное количество мусора. Здесь камеру криво выставит, тут каких-то черточек добавит, там вообще третью ногу дорисует.
Конечно, многое исправляется грамотными промптами, но Sora 2 из-за соцсети — модель максимально массовая, поэтому промптить ее будут очень просто.
Но я с большой вероятностью полагаю, что именно через модели генерации видео и модели мира, вроде Genie 3, мы выйдем на ИИ совершенно нового поколения. Просто произойдет это еще не сейчас? Когда? Давайте посмотрим через 6 месяцев.
Помню про обещание написать про Claude Sonnet 4.5, но давайте пропустим вперед Sora 2 — зря я что ли с ней сегодня весь день игрался? Держите детальные впечатления.
Как пользоваться?
Sora 2 пока работает только из США и Канады с веб-сайта и iOS-приложения — для его загрузки понадобится американский аккаунт, их продают за несколько сотенна маркетплейсах (я покупал пару месяцев назад, ничего не произошло). Нейронка доступна в том числе на бесплатных планах, на Plus неограниченные генерации, а на Pro — выше разрешение и возможность создавать ролики не по 10 секунд, а по 20.
Просто так попасть нельзя, нужен инвайт-код. Их стоит ловить на Reddit: каждый пользователь получает возможность пригласить еще четверых, так что больших проблем нет. Беда в другом — сервис уже перегружен и у меня ближе к вечеру регулярно выдает отказ в генерации на тарифе Plus. Не стоит переживать: смотрим на первый ролик (далее видео пойдут по порядку) и видим…
…как Сэм Альтман лично покупает видеокарты в магазине
Собственно, пример работы функции Cameo. Каждый пользователь Sora может записать свой облик и дать разрешение, кто его может использовать — только он сам, друзья или все подряд. У главы OpenAI выдано разрешение на всех, поэтому за сегодня он стал героем тысяч ИИ-роликов.
Кстати, буквально несколько часов назад Sora 2 позволяла генерировать видеозаписи с воровством видеокарт — в том числе, с камер наблюдения. И народ быстро задался вопросом — а что, если сгенерить запись с другим человеком и отправить в полицию? Сейчас система безопасности все чаще запрещает создавать такие видео.
Но вопросов все равно много — например, к авторским правам.
Вот у нас герои South Park переехали в Сибирь
Народ сегодня весь день резвится, создавая пародии на “Южный парк”, “Рика и Морти”, “Симпсонов” и так далее. В OpenAI опираются на механизм opt-out: Sora 2 создает ролики с объектами, защищенными авторским правом (персонажи, стили брендов), пока правообладатель не заявил отказ. На людей это не распространяется — только с разрешения.
Я надеюсь, что правообладатели оставят свой контент. Штука прикольная и полезная для продвижения бренда - сейчас, например, генерят ролики, на которых Пикачу оказывается в разных фильмах и мультиках. Я тоже отправил желтого в…
…Жил был пес!
Персонажи из знаменитого советского мультика переданы не со 100% точностью, но узнаваемы, как и стиль. Плюс обратите внимание: Sora 2 отлично делает русскую озвучку. А если не прописали в промпте — придумает ее сама, как в этом случае. Если хотите поэкспериментировать, то промпт простой (главное, чтобы не ввели запрет на использование Пикачу):
Generate a scene where Pikachu appears in the movie [название фильма].
Но ладно, давайте теперь что-нибудь более серьезное.
Сэм Альтман решает, что больше: 9.11 или 9.9
Классический тест, в котором нейронки ошибались еще совсем недавно. Как мы видим, теперь с задачей справляется даже модель для генерации видео.
Тест со стаканом и стрелками
Условный пример того, как модели продвигаются вперед в понимании физики. Если посмотреть через полный воды стакан, то изображение будет перевернутым. Раньше на этой задачке валились многие модели создания видео — Sora 2 справляется.
Но на последнем видео все-таки выскажу фи. В Sora 2 круто прокачали физику, здорово, что есть поддержка русского языка, интересный эксперимент с социальной сетью.
Но что меня раздражает до сих пор и почему я редко использую ИИ для генерации картинок и видео, предпочитая им чат-боты — это огромное количество мусора. Здесь камеру криво выставит, тут каких-то черточек добавит, там вообще третью ногу дорисует.
Конечно, многое исправляется грамотными промптами, но Sora 2 из-за соцсети — модель максимально массовая, поэтому промптить ее будут очень просто.
Но я с большой вероятностью полагаю, что именно через модели генерации видео и модели мира, вроде Genie 3, мы выйдем на ИИ совершенно нового поколения. Просто произойдет это еще не сейчас? Когда? Давайте посмотрим через 6 месяцев.
🔥36❤18👍11🥰2
This media is not supported in your browser
VIEW IN TELEGRAM
Взгляд в будущее с Claude Sonnet 4.5
На фоне хайпа с Sora 2 потерялся любопытный релиз Claude Sonnet 4.5,. Не буду повторять новостные тексты, а вместо этого выделю три важных момента.
Во-первых, скорость. Буквально 5 августа Anthropic выпустили Claude Opus 4.1, а теперь у нас уже Sonnet 4.5. И несмотря на то, что в линейке “Клодов” Sonnet стоит ниже Opus, новинка оказалась лучше почти во всех бенчмарках.
Получается, что цикл появления нового в ИИ сократился до 2-3 месяцев. Для сравнения, компьютерное железо обновляется раз в 1-2 года, операционные системы и крупный софт — раз в 1-3 года. Это невероятно круто, но и сложно одновременно: даже быстрым и гибким специалистам непросто каждые два месяца пересматривать, что можно делегировать ИИ, а что пока оставить себе.
Во-вторых, Anthropic похвалились, что в их тестах Sonnet 4.5 непрерывно программировал 30 часов, создав чат-приложение типа Slack. Предыдущий рекорд заявлялся для Claude Opus 4.0 и GPT-5-Codex — оба смогли программировать до 7 часов без вмешательства человека.
Понятно, что для таких заявлений берутся лучшие примеры, в большинстве же задач ИИ будут требовать помощи человека раньше. Но вчерашние рекорды уже завтра станут обыденностью. И не только в кодинге: как много раз случалось, сначала ИИ показывают какой-то новый навык в программировании — а после он масштабируется на другие сферы. Так что универсальные агенты, способные часами работать над разными задачами, от креативов до составления бизнес-планов, уже не за горами.
Наконец, в-третьих, выделю Imagine with Claude — экспериментальную функцию на базе Sonnet 4.5, которую на несколько дней открыли для подписчиков Max. Запускается в браузере, похожа рабочий стол, где ИИ на лету создает для вас любые приложения. Калькулятор калорий четко под диету, какой-нибудь хитрый дашборд, просто календарь, где кнопки будут располагаться там, где хочется именно вам — воображение ограничено только возможностями ИИ.
Imagine with Claude иногда называют прототипом операционной системы: это сразу и ошибка и правда. Ошибка в том, что новинка работает в браузере — соответственно, для запуска все еще нужна Windows, MacOS, Linux или мобильная операционка, выполняющая роль посредника между пользователем и железом.
Правда же в том, что Imagine with Claude также является “посредником” — только между пользователем и кусочком серверных мощностей, его обслуживающих. И когда-то в будущем именно так будет выглядеть наше взаимодействие с компьютерами и смартфонами. Классические операционки с программами исчезнут, а их место займет ИИ-интерфейс, создающий любой пользовательский опыт прямо по запросу.
И это будут вещи в разы сложнее, чем “блокнот” с перерисованным интерфейсом. Представьте, что вы делаете для команды презентацию новой фичи в проекте - онлайн, причем каждый просматривает ее через собственную “ИИ-операционку”. Основные данные у всех одинаковые, но одновременно у коллег презентация будет дополняться информацией, специфичной для них. Финансисты смогут на лету оценить доходы и расходы, продуктовая команда — прикинуть, когда идею можно будет взять в работу и за какое время выполнить, юристы увидят потенциальные риски и так далее. А в конце все дружно загрузят своих ИИ-агентов задачами по 30 часов — и разойдутся довольными.
Конечно, все это — фантазия не на ближайшее время. Современные ИИ далеки от такого уровня взаимодействия, плюс надо будет проработать совершенно другие стандарты совместной работы и вопросы безопасности, плюс “бутылочным горлышком” наверняка окажется железо — ведь такие модели будут работать постоянно, а не как сейчас, когда они отвечают за короткое время
.
Не исключено, что когда эти вопросы будут решены, достоянием истории станут понятия “проект”, “фича” и многие другие — а на их место придет совершенно иной подход к работе. С другой стороны — буквально два года назад многие и представить не могли, что ИИ будет писать даже простенькие программы. Так что скорость прогресса куда выше, чем кажется.
На фоне хайпа с Sora 2 потерялся любопытный релиз Claude Sonnet 4.5,. Не буду повторять новостные тексты, а вместо этого выделю три важных момента.
Во-первых, скорость. Буквально 5 августа Anthropic выпустили Claude Opus 4.1, а теперь у нас уже Sonnet 4.5. И несмотря на то, что в линейке “Клодов” Sonnet стоит ниже Opus, новинка оказалась лучше почти во всех бенчмарках.
Получается, что цикл появления нового в ИИ сократился до 2-3 месяцев. Для сравнения, компьютерное железо обновляется раз в 1-2 года, операционные системы и крупный софт — раз в 1-3 года. Это невероятно круто, но и сложно одновременно: даже быстрым и гибким специалистам непросто каждые два месяца пересматривать, что можно делегировать ИИ, а что пока оставить себе.
Во-вторых, Anthropic похвалились, что в их тестах Sonnet 4.5 непрерывно программировал 30 часов, создав чат-приложение типа Slack. Предыдущий рекорд заявлялся для Claude Opus 4.0 и GPT-5-Codex — оба смогли программировать до 7 часов без вмешательства человека.
Понятно, что для таких заявлений берутся лучшие примеры, в большинстве же задач ИИ будут требовать помощи человека раньше. Но вчерашние рекорды уже завтра станут обыденностью. И не только в кодинге: как много раз случалось, сначала ИИ показывают какой-то новый навык в программировании — а после он масштабируется на другие сферы. Так что универсальные агенты, способные часами работать над разными задачами, от креативов до составления бизнес-планов, уже не за горами.
Наконец, в-третьих, выделю Imagine with Claude — экспериментальную функцию на базе Sonnet 4.5, которую на несколько дней открыли для подписчиков Max. Запускается в браузере, похожа рабочий стол, где ИИ на лету создает для вас любые приложения. Калькулятор калорий четко под диету, какой-нибудь хитрый дашборд, просто календарь, где кнопки будут располагаться там, где хочется именно вам — воображение ограничено только возможностями ИИ.
Imagine with Claude иногда называют прототипом операционной системы: это сразу и ошибка и правда. Ошибка в том, что новинка работает в браузере — соответственно, для запуска все еще нужна Windows, MacOS, Linux или мобильная операционка, выполняющая роль посредника между пользователем и железом.
Правда же в том, что Imagine with Claude также является “посредником” — только между пользователем и кусочком серверных мощностей, его обслуживающих. И когда-то в будущем именно так будет выглядеть наше взаимодействие с компьютерами и смартфонами. Классические операционки с программами исчезнут, а их место займет ИИ-интерфейс, создающий любой пользовательский опыт прямо по запросу.
И это будут вещи в разы сложнее, чем “блокнот” с перерисованным интерфейсом. Представьте, что вы делаете для команды презентацию новой фичи в проекте - онлайн, причем каждый просматривает ее через собственную “ИИ-операционку”. Основные данные у всех одинаковые, но одновременно у коллег презентация будет дополняться информацией, специфичной для них. Финансисты смогут на лету оценить доходы и расходы, продуктовая команда — прикинуть, когда идею можно будет взять в работу и за какое время выполнить, юристы увидят потенциальные риски и так далее. А в конце все дружно загрузят своих ИИ-агентов задачами по 30 часов — и разойдутся довольными.
Конечно, все это — фантазия не на ближайшее время. Современные ИИ далеки от такого уровня взаимодействия, плюс надо будет проработать совершенно другие стандарты совместной работы и вопросы безопасности, плюс “бутылочным горлышком” наверняка окажется железо — ведь такие модели будут работать постоянно, а не как сейчас, когда они отвечают за короткое время
.
Не исключено, что когда эти вопросы будут решены, достоянием истории станут понятия “проект”, “фича” и многие другие — а на их место придет совершенно иной подход к работе. С другой стороны — буквально два года назад многие и представить не могли, что ИИ будет писать даже простенькие программы. Так что скорость прогресса куда выше, чем кажется.
🔥59❤22👍20
This media is not supported in your browser
VIEW IN TELEGRAM
Завершаем неделю невероятно красивой симуляцией Солнечной системы от Gemini 3.0 Pro (ну, вероятно)
Понравилось? А теперь давайте подводить итоги недели, которая ну очень насыщена на новости. Про Gemini 3.0 Pro тоже будет, но в конце.
Напомню, что про крупные анонсы я уже писал отдельно: читаем про Claude Sonnet 4.5, и про Sora 2. Теперь же давайте пройдемся по новостям поменьше, но все равно важным.
Sora 2 Pro
Да-да, через пару дней после “обычной” Sora 2 к ней добавилась Pro-версия: у нее выше разрешение, а ролики длятся 15 секунд вместо 10. Последнее круто: мне на многих промптах не хватает буквально 1-2 секунд, чтобы завершить идею. Но все-таки не та фишка, чтобы переходить с 20-долларовой подписки Plus на Pro за 200 долларов.
ChatGPT Pulse
Еще одна фишка, которая пока есть только в подписке Pro и которая также не оправдывает перехода. Но идея интересная: каждую ночь ChatGPT анализирует последние чаты, смотрит, чем может быть полезен — а утром выдает что-то вроде умной ленты с идеями на день. Планировали путешествие? Вот еще пять похожих мест, куда можно поехать. Идете на тренировку сегодня? Вот упражнения, которые можно попробовать.
Pulse интересен тем, что это один из первых примеров, когда ИИ не ждет запроса, а сам приходит с новыми идеями — пусть и в определенное время. Так что ждем его в подписке Plus: в OpenAI заверили, что скоро добавят.
Обновленная Google Nano Banana
Google вывела свою крутую рисовалку из preview-статуса в general availability — то есть модель протестирована и при использовании проблем не будет. По пути добавили такую штуку, как выбор соотношения сторон: горизонтальная, портрет, квадрат — всего 10 вариантов. Вроде и мелочь, но когда это просишь сделать в текстовом промпте — модель часто игнорирует.
Обновленная nano banana точно доступна в Google AI Studio (напоминаю, там бесплатно) и Vertex AI. А вот с Gemini App для платных подписчиков традиционно ничего не ясно: если в AI Studio уже вижу меню выбора соотношения сторон, то в Gemini App нет ничего подобного. Обидно, что коммерческое приложение опять позади.
Perplexity Comet
После почти трех месяцев тестирования нашумевший браузер наконец-то вышел. С ИИ в нем можно общаться прямо в поисковой строке, а когда находитесь на какой-то веб-странице — то в небольшой панели справа. Вариантов применения много: написать саммари, пояснить что-то сложное, наполнить корзину покупками из списка и т. д.
Браузер уже доступен для Windows и MacOS, а мобильные версии обещали в “ближайшие недели”. Пользоваться можно бесплатно, но подписчики Pro получают больше функций — например, дополнительные источники новостей и сортировку электронной почты.
Так, с новостями закончили, теперь к прогнозам.
OpenAI DevDay
Мероприятие для разработчиков пройдет в понедельник: несмотря на то, что OpenAI уже сделала несколько больших анонсов, один из менеджеров компании написал, что на DevDay “вас ждет то, что заслуживает ожидания”.
Что именно? Вот гипотезы: обновленный ChatGPT Agent (уже были утечки), обновленная GPT-5 и финальная версия экспериментальной модели OpenAI, которая в последние месяцы взяла золото на нескольких сложных олимпиадах. Осталось совсем немного времени — увидим!
Потенциальная Gemini 3.0 Pro
И детективная история в конце. Некоторое время назад народ из X заметил, что в AI Studio при работе с Gemini 2.5 Pro иногда появляется тестирование двух разных ответов ИИ, причем сами ответы не похожи на стиль 2.5 Pro. Начали подлавливать на сложных промптах — и выяснилось, что новинка отвечает круче, особенно в кодинге. Отсюда и вывод, что это может быть Gemini 3.0 Pro.
Интересно, что когда X-пользователь Chetaslua опубликовал свои находки, то в личку к нему пришел Логан Килпатрик, глава Google AI Studio и… вместо того, чтобы потребовать все удалить, попросил поделиться промптом визуализации Солнечной системы — мол, красиво. Считаем за косвенное подтверждение Gemini 3.0 Pro. По срокам выхода пока ничего не ясно: кто-то говорит о 9 октября, кто-то — о начале ноября.
Понравилось? А теперь давайте подводить итоги недели, которая ну очень насыщена на новости. Про Gemini 3.0 Pro тоже будет, но в конце.
Напомню, что про крупные анонсы я уже писал отдельно: читаем про Claude Sonnet 4.5, и про Sora 2. Теперь же давайте пройдемся по новостям поменьше, но все равно важным.
Sora 2 Pro
Да-да, через пару дней после “обычной” Sora 2 к ней добавилась Pro-версия: у нее выше разрешение, а ролики длятся 15 секунд вместо 10. Последнее круто: мне на многих промптах не хватает буквально 1-2 секунд, чтобы завершить идею. Но все-таки не та фишка, чтобы переходить с 20-долларовой подписки Plus на Pro за 200 долларов.
ChatGPT Pulse
Еще одна фишка, которая пока есть только в подписке Pro и которая также не оправдывает перехода. Но идея интересная: каждую ночь ChatGPT анализирует последние чаты, смотрит, чем может быть полезен — а утром выдает что-то вроде умной ленты с идеями на день. Планировали путешествие? Вот еще пять похожих мест, куда можно поехать. Идете на тренировку сегодня? Вот упражнения, которые можно попробовать.
Pulse интересен тем, что это один из первых примеров, когда ИИ не ждет запроса, а сам приходит с новыми идеями — пусть и в определенное время. Так что ждем его в подписке Plus: в OpenAI заверили, что скоро добавят.
Обновленная Google Nano Banana
Google вывела свою крутую рисовалку из preview-статуса в general availability — то есть модель протестирована и при использовании проблем не будет. По пути добавили такую штуку, как выбор соотношения сторон: горизонтальная, портрет, квадрат — всего 10 вариантов. Вроде и мелочь, но когда это просишь сделать в текстовом промпте — модель часто игнорирует.
Обновленная nano banana точно доступна в Google AI Studio (напоминаю, там бесплатно) и Vertex AI. А вот с Gemini App для платных подписчиков традиционно ничего не ясно: если в AI Studio уже вижу меню выбора соотношения сторон, то в Gemini App нет ничего подобного. Обидно, что коммерческое приложение опять позади.
Perplexity Comet
После почти трех месяцев тестирования нашумевший браузер наконец-то вышел. С ИИ в нем можно общаться прямо в поисковой строке, а когда находитесь на какой-то веб-странице — то в небольшой панели справа. Вариантов применения много: написать саммари, пояснить что-то сложное, наполнить корзину покупками из списка и т. д.
Браузер уже доступен для Windows и MacOS, а мобильные версии обещали в “ближайшие недели”. Пользоваться можно бесплатно, но подписчики Pro получают больше функций — например, дополнительные источники новостей и сортировку электронной почты.
Так, с новостями закончили, теперь к прогнозам.
OpenAI DevDay
Мероприятие для разработчиков пройдет в понедельник: несмотря на то, что OpenAI уже сделала несколько больших анонсов, один из менеджеров компании написал, что на DevDay “вас ждет то, что заслуживает ожидания”.
Что именно? Вот гипотезы: обновленный ChatGPT Agent (уже были утечки), обновленная GPT-5 и финальная версия экспериментальной модели OpenAI, которая в последние месяцы взяла золото на нескольких сложных олимпиадах. Осталось совсем немного времени — увидим!
Потенциальная Gemini 3.0 Pro
И детективная история в конце. Некоторое время назад народ из X заметил, что в AI Studio при работе с Gemini 2.5 Pro иногда появляется тестирование двух разных ответов ИИ, причем сами ответы не похожи на стиль 2.5 Pro. Начали подлавливать на сложных промптах — и выяснилось, что новинка отвечает круче, особенно в кодинге. Отсюда и вывод, что это может быть Gemini 3.0 Pro.
Интересно, что когда X-пользователь Chetaslua опубликовал свои находки, то в личку к нему пришел Логан Килпатрик, глава Google AI Studio и… вместо того, чтобы потребовать все удалить, попросил поделиться промптом визуализации Солнечной системы — мол, красиво. Считаем за косвенное подтверждение Gemini 3.0 Pro. По срокам выхода пока ничего не ясно: кто-то говорит о 9 октября, кто-то — о начале ноября.
🔥49❤18👍18🥰2😁2
This media is not supported in your browser
VIEW IN TELEGRAM
И к новостям робототехники: Tesla опубликовала короткое видео, где Optimus V3 показывает кун-фу
(тут надо дежурно пошутить про то, как роботы порабощают человеков, но мне лень)
Начнем с того, чем впечатляет видео. Во-первых, плавность и координация движений, особенно в верхних конечностях. Руки — куда более сложная задача в робототехнике, поэтому даже такой уровень движений, без мелкой моторики, является высшим пилотажем. Во-вторых, достойная координация движений с живым партнером, даже учитывая, что видео — демонстрационная постановка.
Наконец, в-третьих, Tesla утверждает, что Оптимусы разучивают новые движения в виртуальной симуляции, предварительно посмотрев тысячи часов видеозаписей реальных движений. Это более продвинутая технология, чем повторение за людьми в костюмах захвата движений — хотя бы потому, что видеоматериала на порядок больше, а значит куда больше мелких нюансов. Кстати, подобным образом Optimus разучил танец для опубликованного весной ролика.
Но и кун-фу, и танцы — пока лишь впечатляющие демо возможностей. Следующим шагом будет большее количество демонстраций Оптимуса в рабочих ситуациях, вроде доставки деталей на конвейер или сортировки коробок на складе. Человек такие операции делает автоматически, для робота же это — пока сложная задача.
Почему так? ИИ для управления роботом — это агентская система, поставленная в экстремальные условия. Сейчас тот же ChatGPT Agent способен лишь на не очень сложные задачи в интернете. При этом он работает на мощнейших серверах и может позволить выполнять задачу 20-30 минут, переделывая те шаги, где совершил ошибку. И все равно — результат во многих случаях далек от идеала.
Вернемся к роботам. Даже выполнение такой элементарной заводской задачи, как переноска деталей с тележки на конвейер — это совсем другой уровень нагрузки на ИИ. Детали могут лежать немного по-разному или быть перепутаны вовсе, конвейер может остановиться, на маршруте может оказаться препятствие — и на все это нужно реагировать в реальном времени.
При этом ИИ робота крутится на очень экономичном процессоре, который параллельно управляет огромным количеством систем на “теле” — моторчиками, датчиками, модулями диагностики и так далее. Да, для определенных задач можно подключиться к центральному серверу или даже запросить ручное управление оператором — но это ведет к задержкам и снижению результативности.
Отдельная большая задача — моторика робота. Сейчас неплохо научились делать ноги, а вот с руками еще предстоит большая работа. Универсальный робот должен манипулировать с предметами разных форм и размеров, гнуть прочные материалы и переносить хрупкие, складывать ткани, уметь вставить вилку в розетку, “нащупав” пазы, и так далее.
Optimus — далеко не самый передовой робот, хотя с ним Tesla стремительно приближается к высшей лиге. Но даже лидерам еще далеко до широкого применения. Те же Atlas от Boston Dynamics показывают автономные операции на макете заводского участка. Роботы Figure ограничено тестировались на заводе BMW, а разработки GXO × Agility Digit понемногу таскают коробки на складах SPANX.
Все это — пробные прогоны, обычно менее эффективные и более дорогие, чем найм живых сотрудников. Ожидается, что полноценные многочасовые смены роботы смогут брать на себя в ближайшие 12 месяцев, к 2027 году на некоторых заводах будут участки с сотнями таких трудяг, а к 2030-му мы дойдем до универсальных сценариев, когда один робот сможет закрывать несколько совершенно разных задач.
И примерно в это же время начнется очень аккуратное внедрение роботов в бытовые операции? Почему? Потому что непредсказуемость домашней и уличной среды на порядок выше, чем на заводе, да и техники безопасности уровня промышленных объектов здесь нет. Поэтому любая мелкая ошибка может привести к очень серьезным последствиям.
Так что порабощение мира пока откладывается — для начала предстоит научиться сортировать коробки.
(тут надо дежурно пошутить про то, как роботы порабощают человеков, но мне лень)
Начнем с того, чем впечатляет видео. Во-первых, плавность и координация движений, особенно в верхних конечностях. Руки — куда более сложная задача в робототехнике, поэтому даже такой уровень движений, без мелкой моторики, является высшим пилотажем. Во-вторых, достойная координация движений с живым партнером, даже учитывая, что видео — демонстрационная постановка.
Наконец, в-третьих, Tesla утверждает, что Оптимусы разучивают новые движения в виртуальной симуляции, предварительно посмотрев тысячи часов видеозаписей реальных движений. Это более продвинутая технология, чем повторение за людьми в костюмах захвата движений — хотя бы потому, что видеоматериала на порядок больше, а значит куда больше мелких нюансов. Кстати, подобным образом Optimus разучил танец для опубликованного весной ролика.
Но и кун-фу, и танцы — пока лишь впечатляющие демо возможностей. Следующим шагом будет большее количество демонстраций Оптимуса в рабочих ситуациях, вроде доставки деталей на конвейер или сортировки коробок на складе. Человек такие операции делает автоматически, для робота же это — пока сложная задача.
Почему так? ИИ для управления роботом — это агентская система, поставленная в экстремальные условия. Сейчас тот же ChatGPT Agent способен лишь на не очень сложные задачи в интернете. При этом он работает на мощнейших серверах и может позволить выполнять задачу 20-30 минут, переделывая те шаги, где совершил ошибку. И все равно — результат во многих случаях далек от идеала.
Вернемся к роботам. Даже выполнение такой элементарной заводской задачи, как переноска деталей с тележки на конвейер — это совсем другой уровень нагрузки на ИИ. Детали могут лежать немного по-разному или быть перепутаны вовсе, конвейер может остановиться, на маршруте может оказаться препятствие — и на все это нужно реагировать в реальном времени.
При этом ИИ робота крутится на очень экономичном процессоре, который параллельно управляет огромным количеством систем на “теле” — моторчиками, датчиками, модулями диагностики и так далее. Да, для определенных задач можно подключиться к центральному серверу или даже запросить ручное управление оператором — но это ведет к задержкам и снижению результативности.
Отдельная большая задача — моторика робота. Сейчас неплохо научились делать ноги, а вот с руками еще предстоит большая работа. Универсальный робот должен манипулировать с предметами разных форм и размеров, гнуть прочные материалы и переносить хрупкие, складывать ткани, уметь вставить вилку в розетку, “нащупав” пазы, и так далее.
Optimus — далеко не самый передовой робот, хотя с ним Tesla стремительно приближается к высшей лиге. Но даже лидерам еще далеко до широкого применения. Те же Atlas от Boston Dynamics показывают автономные операции на макете заводского участка. Роботы Figure ограничено тестировались на заводе BMW, а разработки GXO × Agility Digit понемногу таскают коробки на складах SPANX.
Все это — пробные прогоны, обычно менее эффективные и более дорогие, чем найм живых сотрудников. Ожидается, что полноценные многочасовые смены роботы смогут брать на себя в ближайшие 12 месяцев, к 2027 году на некоторых заводах будут участки с сотнями таких трудяг, а к 2030-му мы дойдем до универсальных сценариев, когда один робот сможет закрывать несколько совершенно разных задач.
И примерно в это же время начнется очень аккуратное внедрение роботов в бытовые операции? Почему? Потому что непредсказуемость домашней и уличной среды на порядок выше, чем на заводе, да и техники безопасности уровня промышленных объектов здесь нет. Поэтому любая мелкая ошибка может привести к очень серьезным последствиям.
Так что порабощение мира пока откладывается — для начала предстоит научиться сортировать коробки.
🔥26❤20👍11😁8🥰3👏3
Главные новинки OpenAI DevDay
На конференции DevDay в OpenAI решили не анонсировать новые модели (что немного жаль), а сосредоточиться на том, как мы взаимодействуем с текущими. Выделю два наиболее интересных анонса: приложения в ChatGPT и конструктор агентов AgentKit.
Apps SDK позволит любому разработчику создать версии своих приложений для максимально бесшовного использования в ChatGPT. Например, я часто прошу нейронку посоветовать мне новую музыку — алгоритмы Spotify у меня давно зациклились на одних исполнителях, а GPT-5 находит новых с помощью элементарных промптов в духе “собери что-то в этом же стиле, но от набирающих популярность новичков”.
Но неудобно то, что рекомендованную музыку в Spotify приходится переносить руками. С приложением это намного проще — модель сама создаст плейлист, добавив в него, например, по несколько треков от каждого рекомендованного исполнителя.
Другой интересный пример — Coursera. Курсы из нее можно просматривать прямо в ChatGPT: со всеми изображениями, видео и другим интерактивом. И так как это происходит в чате, то по курсу можно сразу же задавать вопросы GPT-5.
Понятно, что такие штуки можно делать и просто открыв ChatGPT в соседней вкладке браузера. Но, во-первых, это лишь самые простые примеры интеграции — чем больше разработчиков начнут пробовать Apps SDK, тем больше интересных вариантов использования появится.
Во-вторых, прямо на наших глазах продолжается процесс превращения ИИ из чат-ботов в подобие если не операционных систем (взаимодействие с железом все-таки остается на стороне Windows/MacOS/iOS/Android), то оболочек для работы с разными приложениями.
Один из примеров — браузер Comet от Perplexity, где ИИ может выполнять действия на каждой открытой веб-странице или просто давать короткие консультации. Подход OpenAI противоположен — вместо создания ИИ-надстройки над интернетом, они пытаются затянуть приложения “внутрь” своей экосистемы (кстати, монетизация планируется). Наконец, есть и совсем экспериментальные штуки вроде Imagine with Claude — это, скорее, взгляд на несколько лет вперед.
Сложно сказать, какой подход победит, но в одном я уверен точно: мы все реже будем управлять компьютерами и смартфонами через привычные интерфейсы, и все чаще - через прямое взаимодействие с ИИ.
Второй анонс, AgentKit — инструмент для ИИ-автоматизации. Работать с чат-ботом удобно: можно дать любой запрос — и тут же получить ответ. Но часто нужно прописать ИИ четкий сценарий работы — и вот тут на помощь приходят конструкторы агентов, вроде знаменитого n8n, а теперь и официального решения от OpenAI.
Это невероятно удобная штука для небольших бизнесов и ИИ-энтузиастов. Например, можно создать чат-бота для сайта, который будет отвечать на вопросы пользователей, отталкиваясь от информации в предоставленных ему базах данных (например, о продвигаемых товарах или услугах). Этого же агента можно настроить через определенные промежутки времени отдавать владельцу сайта статистику: сколько было обращений, есть ли популярные темы, на какие не удалось ответить (а значит — надо пополнить базу знаний). Если вдруг количество обращений резко растет — можно быстро сигнализировать по “тревожному каналу”.
Плюс AgentKit в том, что он не требует вообще никаких профессиональных навыков: надо лишь понимать свою задачу, уметь писать простые промпты, обладать логическим мышлением и терпением. Все этапы работы агента прописываются визуально, можно добавлять ветвления, когда дальнейшие действия агента меняются в зависимости от ситуации. На DevDay агента собрали за 8 минут: разумеется, без опыта времени уйдет больше — но это все равно будут часы, а не дни или недели.
Сейчас на рынке уже есть крутые конкуренты вроде n8n или того же Zapier, но OpenAI может побороться с ними за счет того, что использует собственные модели и может подгонять их под задачи максимально точно и быстро. Посмотрим, получится ли.
Пока по новостной повестке все. Следующий этап уже 9 октября — Gemini at Work, на которой ждем новинок Google.
На конференции DevDay в OpenAI решили не анонсировать новые модели (что немного жаль), а сосредоточиться на том, как мы взаимодействуем с текущими. Выделю два наиболее интересных анонса: приложения в ChatGPT и конструктор агентов AgentKit.
Apps SDK позволит любому разработчику создать версии своих приложений для максимально бесшовного использования в ChatGPT. Например, я часто прошу нейронку посоветовать мне новую музыку — алгоритмы Spotify у меня давно зациклились на одних исполнителях, а GPT-5 находит новых с помощью элементарных промптов в духе “собери что-то в этом же стиле, но от набирающих популярность новичков”.
Но неудобно то, что рекомендованную музыку в Spotify приходится переносить руками. С приложением это намного проще — модель сама создаст плейлист, добавив в него, например, по несколько треков от каждого рекомендованного исполнителя.
Другой интересный пример — Coursera. Курсы из нее можно просматривать прямо в ChatGPT: со всеми изображениями, видео и другим интерактивом. И так как это происходит в чате, то по курсу можно сразу же задавать вопросы GPT-5.
Понятно, что такие штуки можно делать и просто открыв ChatGPT в соседней вкладке браузера. Но, во-первых, это лишь самые простые примеры интеграции — чем больше разработчиков начнут пробовать Apps SDK, тем больше интересных вариантов использования появится.
Во-вторых, прямо на наших глазах продолжается процесс превращения ИИ из чат-ботов в подобие если не операционных систем (взаимодействие с железом все-таки остается на стороне Windows/MacOS/iOS/Android), то оболочек для работы с разными приложениями.
Один из примеров — браузер Comet от Perplexity, где ИИ может выполнять действия на каждой открытой веб-странице или просто давать короткие консультации. Подход OpenAI противоположен — вместо создания ИИ-надстройки над интернетом, они пытаются затянуть приложения “внутрь” своей экосистемы (кстати, монетизация планируется). Наконец, есть и совсем экспериментальные штуки вроде Imagine with Claude — это, скорее, взгляд на несколько лет вперед.
Сложно сказать, какой подход победит, но в одном я уверен точно: мы все реже будем управлять компьютерами и смартфонами через привычные интерфейсы, и все чаще - через прямое взаимодействие с ИИ.
Второй анонс, AgentKit — инструмент для ИИ-автоматизации. Работать с чат-ботом удобно: можно дать любой запрос — и тут же получить ответ. Но часто нужно прописать ИИ четкий сценарий работы — и вот тут на помощь приходят конструкторы агентов, вроде знаменитого n8n, а теперь и официального решения от OpenAI.
Это невероятно удобная штука для небольших бизнесов и ИИ-энтузиастов. Например, можно создать чат-бота для сайта, который будет отвечать на вопросы пользователей, отталкиваясь от информации в предоставленных ему базах данных (например, о продвигаемых товарах или услугах). Этого же агента можно настроить через определенные промежутки времени отдавать владельцу сайта статистику: сколько было обращений, есть ли популярные темы, на какие не удалось ответить (а значит — надо пополнить базу знаний). Если вдруг количество обращений резко растет — можно быстро сигнализировать по “тревожному каналу”.
Плюс AgentKit в том, что он не требует вообще никаких профессиональных навыков: надо лишь понимать свою задачу, уметь писать простые промпты, обладать логическим мышлением и терпением. Все этапы работы агента прописываются визуально, можно добавлять ветвления, когда дальнейшие действия агента меняются в зависимости от ситуации. На DevDay агента собрали за 8 минут: разумеется, без опыта времени уйдет больше — но это все равно будут часы, а не дни или недели.
Сейчас на рынке уже есть крутые конкуренты вроде n8n или того же Zapier, но OpenAI может побороться с ними за счет того, что использует собственные модели и может подгонять их под задачи максимально точно и быстро. Посмотрим, получится ли.
Пока по новостной повестке все. Следующий этап уже 9 октября — Gemini at Work, на которой ждем новинок Google.
❤31🔥28👍19😁1
Media is too big
VIEW IN TELEGRAM
А держите большой обзор Google Gemini
Новая Gemini 3.0 Pro не за горами: народ “ловит” ее в Google AI Studio и как минимум результаты в создании сложных SVG лучше, чем у нынешних ИИ (см. видео). Возможная дата выхода — 9 октября, когда пройдет мероприятие Gemini at Work. Но могут и задержать.
В любом случае, выход не за горами, так что самое время рассказать, чем вообще хорош и плох этот сервис.
Начнем с того, что ИИ от Google можно опробовать сразу на нескольких площадках. Совсем бесплатно на Google AI Studio — экспериментальной площадке, где многие ИИ-функции обкатываются в первую очередь. Кроме того, здесь больше тонких настроек моделей. Звучит классно, но ваши диалоги в AI Studio могут использовать для обучения моделей, а лимиты использования меняют без предупреждения — были случаи, когда доступ к 2.5 Pro резко резали в моменты перегрузки серверов.
Поэтому смотрим в сторону Google Gemini App. Бесплатная версия дает щедрый доступ к простой модели Gemini 2.5 Flash, рисовалке Nano Banana и 100 ИИ-кредитам, которые можно потратить в видеоредакторе Flow и приложении для графики и видео Whisk (в том числе и на Veo 3). Gemini 2.5 Pro в бесплатной версии есть, но с лимитом в несколько запросов в сутки.
Нормально с 2.5 Pro можно работать на 20-долларовой подписке. Модели уже полгода, но за это время было несколько доработок, поэтому она до сих пор не плоха (плюс скоро все равно 3.0 Pro). Мне нравится, как 2.5 Pro пишет на русском — четкая структура, минимум “заумных” терминов и корявых оборотов. Здесь публиковал метафикциональный рассказ про ИИ и горе — 2.5 Pro до сих пор одна из немногих моделей, которые справляются с этим промптом.
Еще одна уникальная особенность 2.5 Pro/Flash в подписке — контекстное окно в 1 миллион токенов, а это значит, что в диалог с запасом влезет “Война и мир”. Для сравнения, у той же GPT-5-Thinking около 200 тысяч.
Кодит 2.5 Pro уже хуже, чем GPT-5-Thinking и Claude Sonnet 4.5, плюс модель не умеет делать многократный вызов инструментов. Та же GPT-5, получив сложный запрос, может выполнить поиск, понять, каких данных ей не хватает, выполнить еще один поиск и т. д. Глава Google AI Studio Логан Килпатрик уже подтвердил, что в 3.0 Pro многократный вызов инструментов будет.
Также у 20-долларовой подписки Gemini AI, пожалуй, один из лучших value на рынке. Кроме доступа к Gemini 2.5, nano banana и Veo-3-Turbo (три генерации видео в день + не забывайте про 1000 кредитов, которые можно потратить на ту же Veo 3 в редакторе Flow), дают 2ТБ облачного хранилища и мелкие функции в Gmail и Google Docs. А еще подпиской можно поделиться на 5 человек из семейной группы — причем у каждого будет свой план.
Теперь к нюансам. Во-первых, у Gemini очень посредственные веб-версия и оба мобильных приложения — уже без багов, но по функционалу далеко до ChatGPT.
Во-вторых, доступ из России. Вообще в РФ ни один ИИ не заблокирован — но многие компании-разработчики сами ограничивают доступ. Причем у Google это получается особенно эффективно. Если у вас Android, то поможет приложение Geminify, которое лежит в RuStore в версии для Samsung, а для других производителей качается с просторов интернета. Для других ОС также можно найти действующие способы.
В-третьих, покупка. Если у вас есть карта банка за пределами РФ, то, полагаю, и сами все знаете. Если брать у перекупщиков, то два варианта. “Честная” подписка будет стоить 20+ долларов в месяц, вам или создадут новый аккаунт, или пополнят текущий, но придется передать доступ (используйте не основной аккаунт). Плюс дешевые варианты сразу на год — это “студенческие” аккаунты, Google регистрирует их бесплатно, чем пользуются любители подзаработать. Пока у людей вроде работает, но без гарантий, что когда-то не начнут блокировать.
Это все грустно, но посоветую простое правило, которому следую и сам: при покупке подписок обходными путями тратьте на них только ту сумму денег, которую не жалко потерять.
Новая Gemini 3.0 Pro не за горами: народ “ловит” ее в Google AI Studio и как минимум результаты в создании сложных SVG лучше, чем у нынешних ИИ (см. видео). Возможная дата выхода — 9 октября, когда пройдет мероприятие Gemini at Work. Но могут и задержать.
В любом случае, выход не за горами, так что самое время рассказать, чем вообще хорош и плох этот сервис.
Начнем с того, что ИИ от Google можно опробовать сразу на нескольких площадках. Совсем бесплатно на Google AI Studio — экспериментальной площадке, где многие ИИ-функции обкатываются в первую очередь. Кроме того, здесь больше тонких настроек моделей. Звучит классно, но ваши диалоги в AI Studio могут использовать для обучения моделей, а лимиты использования меняют без предупреждения — были случаи, когда доступ к 2.5 Pro резко резали в моменты перегрузки серверов.
Поэтому смотрим в сторону Google Gemini App. Бесплатная версия дает щедрый доступ к простой модели Gemini 2.5 Flash, рисовалке Nano Banana и 100 ИИ-кредитам, которые можно потратить в видеоредакторе Flow и приложении для графики и видео Whisk (в том числе и на Veo 3). Gemini 2.5 Pro в бесплатной версии есть, но с лимитом в несколько запросов в сутки.
Нормально с 2.5 Pro можно работать на 20-долларовой подписке. Модели уже полгода, но за это время было несколько доработок, поэтому она до сих пор не плоха (плюс скоро все равно 3.0 Pro). Мне нравится, как 2.5 Pro пишет на русском — четкая структура, минимум “заумных” терминов и корявых оборотов. Здесь публиковал метафикциональный рассказ про ИИ и горе — 2.5 Pro до сих пор одна из немногих моделей, которые справляются с этим промптом.
Еще одна уникальная особенность 2.5 Pro/Flash в подписке — контекстное окно в 1 миллион токенов, а это значит, что в диалог с запасом влезет “Война и мир”. Для сравнения, у той же GPT-5-Thinking около 200 тысяч.
Кодит 2.5 Pro уже хуже, чем GPT-5-Thinking и Claude Sonnet 4.5, плюс модель не умеет делать многократный вызов инструментов. Та же GPT-5, получив сложный запрос, может выполнить поиск, понять, каких данных ей не хватает, выполнить еще один поиск и т. д. Глава Google AI Studio Логан Килпатрик уже подтвердил, что в 3.0 Pro многократный вызов инструментов будет.
Также у 20-долларовой подписки Gemini AI, пожалуй, один из лучших value на рынке. Кроме доступа к Gemini 2.5, nano banana и Veo-3-Turbo (три генерации видео в день + не забывайте про 1000 кредитов, которые можно потратить на ту же Veo 3 в редакторе Flow), дают 2ТБ облачного хранилища и мелкие функции в Gmail и Google Docs. А еще подпиской можно поделиться на 5 человек из семейной группы — причем у каждого будет свой план.
Теперь к нюансам. Во-первых, у Gemini очень посредственные веб-версия и оба мобильных приложения — уже без багов, но по функционалу далеко до ChatGPT.
Во-вторых, доступ из России. Вообще в РФ ни один ИИ не заблокирован — но многие компании-разработчики сами ограничивают доступ. Причем у Google это получается особенно эффективно. Если у вас Android, то поможет приложение Geminify, которое лежит в RuStore в версии для Samsung, а для других производителей качается с просторов интернета. Для других ОС также можно найти действующие способы.
В-третьих, покупка. Если у вас есть карта банка за пределами РФ, то, полагаю, и сами все знаете. Если брать у перекупщиков, то два варианта. “Честная” подписка будет стоить 20+ долларов в месяц, вам или создадут новый аккаунт, или пополнят текущий, но придется передать доступ (используйте не основной аккаунт). Плюс дешевые варианты сразу на год — это “студенческие” аккаунты, Google регистрирует их бесплатно, чем пользуются любители подзаработать. Пока у людей вроде работает, но без гарантий, что когда-то не начнут блокировать.
Это все грустно, но посоветую простое правило, которому следую и сам: при покупке подписок обходными путями тратьте на них только ту сумму денег, которую не жалко потерять.
👍45❤25🔥14
Галлюцинируют ли ИИ об электроовцах?
Давно уже заметил, что если кто-то критикует ИИ, то он обязательно пройдется по галлюцинациям. И пусть последние модели ошибаются реже, истории, как нейронка перепутала президента США, будут живы и во времена GPT-8.
Но почему ИИ галлюцинируют? Как с этим бороться? И может ли слишком усердная борьба с галлюцинациями, наоборот, ухудшить характеристики будущих моделей? Давайте разбираться.
Сначала на минутку включу режим зануды и напомню базовую вещь — в отличие от людей, современные ИИ не “думают” в реальном времени. Если грубо, то они проходят долгое обучение на заранее выбранном корпусе данных, а в конце знания замораживаются. Есть параметр knowledge cuttof — дата до которой у ИИ есть знания. Современные модели научились искать недостающую информацию в интернете, но это не всегда решает проблему — все-таки отбор данных в корпус для обучения более тщательный.
Второй этап — пост-обучение. Модели раз за разом задают разные вопросы, и поощряют в тех случаях, когда ответ хороший. На этом этапе ИИ обретает одну из своих главных черт — быть гиперполезным для пользователя и стремиться ответить на вопросы (ведь за это дают “конфетку”!).
Не всегда эта особенность работает как надо. Недавно специалисты OpenAI опубликовали интересное исследование — оказывается, именно несовершенство подходов к пост-тренировке поощряет галлюцинации модели. Сейчас за правильный ответ полагается награда, за ошибочный — ничего. И когда ИИ не знает ответ, ему выгоднее попробовать угадать его — даже если это получится в одном случае из ста, то, итоговый счет будет выше (ведь в пост-тренировке задают огромное количество вопросов).
В OpenAI рекомендуют поменять подход к пост-обучению, начав наказывать ИИ за угадывания и поощрять случаи, когда она признает, что не знает ответ. Сама компания при разработке GPT-5 использовала специальный ИИ-модуль, который проверял каждый ответ и отмечал ошибочные.
Результат заметен — GPT-5 в режиме Thinking в моих задачах галлюцинирует реже, чем предыдущая o3 (та была знатным фантазером!). Класс, но в этом есть и опасность: модели больше доверяешь, ленишься проверить ее — и галлюцинация иногда проскакивает.
Но всегда ли галлюцинации вредны? Сегодня я посмотрел интервью команды Epoch AI с Кеном Оно, теоретиком чисел в Университете Вирджинии. Он обсуждал современные ИИ и их использование в науке, и высказал интересную мысль — когда математик совершает открытие, он тоже начинает с “галлюцинаций”. Нельзя придумать что-то новое, не выходя за границы текущих знаний.
И если мы хотим, чтобы ИИ стали помощниками в будущих исследованиях, то галлюцинации надо не искоренять, а учиться использовать во благо. Кен рассказывает, что в науке гипотеза проходит сложную и многоэтапную проверку — чтобы реально отделить новую идею от просто правдоподобной писанины.
Похожие технологии уже начинают использоваться в передовых моделях. GPT-5-Pro состоит из двух работающих параллельно GPT-5-Thinking: они предлагают разные варианты решения, из которых затем специальный модуль собирает финальный. В Gemini 2.5 Deep Think, по слухам, трудятся целых четыре модели, не менее сложная схема использована в экспериментальной модели OpenAI, которая взяла золото на нескольких международных олимпиадах (разбирал в конце этого поста).
И это, похоже, работает. Я видел уже несколько новостей, что GPT-5-Pro помогает открывать новую математику — где-то полностью сама, а где-то работая помощником опытного ученого (в одном из случаев — у Теренса Тао, легенды современной математики). Пока это совсем крошечные шажки вперед (в математике огромное количество задач, которые требуют уровня хорошего аспиранта) — но буквально полгода назад и они выглядели фантастикой.
Для массовых же моделей совет пока простой — если волнует качество ответа, то просто просите ИИ проверить за самим собой, это помогает в 80% случаев. Ну и не забывайте сами проверить.
Давно уже заметил, что если кто-то критикует ИИ, то он обязательно пройдется по галлюцинациям. И пусть последние модели ошибаются реже, истории, как нейронка перепутала президента США, будут живы и во времена GPT-8.
Но почему ИИ галлюцинируют? Как с этим бороться? И может ли слишком усердная борьба с галлюцинациями, наоборот, ухудшить характеристики будущих моделей? Давайте разбираться.
Сначала на минутку включу режим зануды и напомню базовую вещь — в отличие от людей, современные ИИ не “думают” в реальном времени. Если грубо, то они проходят долгое обучение на заранее выбранном корпусе данных, а в конце знания замораживаются. Есть параметр knowledge cuttof — дата до которой у ИИ есть знания. Современные модели научились искать недостающую информацию в интернете, но это не всегда решает проблему — все-таки отбор данных в корпус для обучения более тщательный.
Второй этап — пост-обучение. Модели раз за разом задают разные вопросы, и поощряют в тех случаях, когда ответ хороший. На этом этапе ИИ обретает одну из своих главных черт — быть гиперполезным для пользователя и стремиться ответить на вопросы (ведь за это дают “конфетку”!).
Не всегда эта особенность работает как надо. Недавно специалисты OpenAI опубликовали интересное исследование — оказывается, именно несовершенство подходов к пост-тренировке поощряет галлюцинации модели. Сейчас за правильный ответ полагается награда, за ошибочный — ничего. И когда ИИ не знает ответ, ему выгоднее попробовать угадать его — даже если это получится в одном случае из ста, то, итоговый счет будет выше (ведь в пост-тренировке задают огромное количество вопросов).
В OpenAI рекомендуют поменять подход к пост-обучению, начав наказывать ИИ за угадывания и поощрять случаи, когда она признает, что не знает ответ. Сама компания при разработке GPT-5 использовала специальный ИИ-модуль, который проверял каждый ответ и отмечал ошибочные.
Результат заметен — GPT-5 в режиме Thinking в моих задачах галлюцинирует реже, чем предыдущая o3 (та была знатным фантазером!). Класс, но в этом есть и опасность: модели больше доверяешь, ленишься проверить ее — и галлюцинация иногда проскакивает.
Но всегда ли галлюцинации вредны? Сегодня я посмотрел интервью команды Epoch AI с Кеном Оно, теоретиком чисел в Университете Вирджинии. Он обсуждал современные ИИ и их использование в науке, и высказал интересную мысль — когда математик совершает открытие, он тоже начинает с “галлюцинаций”. Нельзя придумать что-то новое, не выходя за границы текущих знаний.
И если мы хотим, чтобы ИИ стали помощниками в будущих исследованиях, то галлюцинации надо не искоренять, а учиться использовать во благо. Кен рассказывает, что в науке гипотеза проходит сложную и многоэтапную проверку — чтобы реально отделить новую идею от просто правдоподобной писанины.
Похожие технологии уже начинают использоваться в передовых моделях. GPT-5-Pro состоит из двух работающих параллельно GPT-5-Thinking: они предлагают разные варианты решения, из которых затем специальный модуль собирает финальный. В Gemini 2.5 Deep Think, по слухам, трудятся целых четыре модели, не менее сложная схема использована в экспериментальной модели OpenAI, которая взяла золото на нескольких международных олимпиадах (разбирал в конце этого поста).
И это, похоже, работает. Я видел уже несколько новостей, что GPT-5-Pro помогает открывать новую математику — где-то полностью сама, а где-то работая помощником опытного ученого (в одном из случаев — у Теренса Тао, легенды современной математики). Пока это совсем крошечные шажки вперед (в математике огромное количество задач, которые требуют уровня хорошего аспиранта) — но буквально полгода назад и они выглядели фантастикой.
Для массовых же моделей совет пока простой — если волнует качество ответа, то просто просите ИИ проверить за самим собой, это помогает в 80% случаев. Ну и не забывайте сами проверить.
1❤50👍36👏6
This media is not supported in your browser
VIEW IN TELEGRAM
Учимся писать промпты для Sora 2
OpenAI выпустили классное руководство по промптингу Sora 2, а я подготовил выжимку самого полезного. О том, как попасть в “Сору”, писал здесь, в этом же посте делился и впечатлениями — правда, с тех пор сильно ужесточили контроль за авторским правами, поэтому ремейки “Южного парка” сделать больше не выйдет.
Но хватит грустить, начнем с максимального варианта промпта, который советуют в OpenAI.
Вот отдельные варианты для камеры, собираем из каждого пункта:
Вообще в OpenAI делают отдельный упор на креативность Sora 2: если где-то не дать модели инструкций, то она придумает сама. Поэтому из промпта выше можно удалять целые блоки — модель сама подберет вариант, который считает правильным.
Но есть и обратная сторона — Sora 2 часто перегибает с креативом. Например, если в промпте вообще ничего не сказать об озвучке, то часто модель может сама сочинить короткий диалог. Поэтому не забывайте прописывать в промпте не только то, что хотите увидеть в видео, но и что не хотите видеть — так и напишите, что “без диалогов”.
Вообще в OpenAI советуют не ждать хорошего результата с первой попытки, а экспериментировать: Sora 2 позволяет бесплатно создавать несколько десятков видео в сутки (лимиты постоянно меняются), причем генерирует их сравнительно быстро. Поэтому я, например, начинаю с минимального промпта — и если результат мне не нравится, то добавляю деталей. А иногда, наоборот, можно вкинуть что-нибудь типа “Короткий трейлер “Войны и мира”, но действие происходит в наше время” — и посмотреть, чего напридумывает Sora 2.
Когда ролик близок к тому, что вам хотелось — попробуйте довести его до ума с помощью функции Remixes (для этого видео надо опубликовать, а затем нажать на маленькую круглую иконку под описанием — я сам долго искал). Здесь OpenAI настоятельно рекомендуют отойти от массивных промптов и вносить по одной правке за раз: например, добавить еще одного монстра, поменять цвет костюма главного героя и так далее.
Ну и совет — не ждите от генерации 100% попадания в промпт. Даже у чат-ботов это получается не всегда, ну а модели генерации видео еще очень молодые — и пройдет какое-то время, пока они научатся четко исполнять все желания пользователя. Воспринимайте их ошибки как элементы ИИ-креативности — и удовольствие от результата будет получать проще!
#сбежавшая_нейросеть_промпты
OpenAI выпустили классное руководство по промптингу Sora 2, а я подготовил выжимку самого полезного. О том, как попасть в “Сору”, писал здесь, в этом же посте делился и впечатлениями — правда, с тех пор сильно ужесточили контроль за авторским правами, поэтому ремейки “Южного парка” сделать больше не выйдет.
Но хватит грустить, начнем с максимального варианта промпта, который советуют в OpenAI.
[Описываем сцену простым языком: персонажей, костюмы, окружение, погоду и другие детали. Добавляйте столько подробностей, чтобы получить видео, максимально соответствующее замыслу.]
Камера: [варианты будут дальше]
Линза: [24–28 мм (широкоугольная) / 35 мм (естественная перспектива) / 50 мм (нейтрально-портретная) / 85 мм (портретная, сильнее размывает фон) / 135 мм+ (дальняя, сжатие планов)]
Свет: [ключевой (основной) / заполняющий / контровой (обводящий) / практический источник (лампа/вывеска в кадре) / свет из окна (дневной) / неон (бирюза/пурпур) / «золотой час» (контровой закат + лёгкая дымка) / рассеянный пасмурный]
Настроение: [общий тон, например: кинематографично и напряженно; игриво и с налетом саспенса]
Действия:
— [первое важное событие/реплика в видео]
— [второе важное событие/реплика в видео]
— [количество действий не ограничено, но учитывайте 10-секундную длительность видео]
Диалоги:
[Если в ролике есть реплики, добавьте их сюда или в раздел «Действия». Опять же, не забывайте про 10-секундную длительность.]
Вот отдельные варианты для камеры, собираем из каждого пункта:
План: суперобщий (экстремально общий) / общий / средний / американский (по колено) / погрудный / крупный / деталь (экстремальный крупный)
Ракурс: на уровне глаз / нижний / верхний / три четверти / профиль / фронтально / план через плечо (OTS) / POV (точка зрения героя)
Движение: статично / наезд / отъезд / горизонтальная панорама / вертикальная панорама / трэвеллинг (следование) / облет по дуге / стедикам / кран / джиб / дрон / таймлапс / замедление
Фокус/приемы: перевод фокуса (rack focus) / ГРИП: мелкая / средняя / глубокая / сплит-диоптр / «рыбий глаз»
Вообще в OpenAI делают отдельный упор на креативность Sora 2: если где-то не дать модели инструкций, то она придумает сама. Поэтому из промпта выше можно удалять целые блоки — модель сама подберет вариант, который считает правильным.
Но есть и обратная сторона — Sora 2 часто перегибает с креативом. Например, если в промпте вообще ничего не сказать об озвучке, то часто модель может сама сочинить короткий диалог. Поэтому не забывайте прописывать в промпте не только то, что хотите увидеть в видео, но и что не хотите видеть — так и напишите, что “без диалогов”.
Вообще в OpenAI советуют не ждать хорошего результата с первой попытки, а экспериментировать: Sora 2 позволяет бесплатно создавать несколько десятков видео в сутки (лимиты постоянно меняются), причем генерирует их сравнительно быстро. Поэтому я, например, начинаю с минимального промпта — и если результат мне не нравится, то добавляю деталей. А иногда, наоборот, можно вкинуть что-нибудь типа “Короткий трейлер “Войны и мира”, но действие происходит в наше время” — и посмотреть, чего напридумывает Sora 2.
Когда ролик близок к тому, что вам хотелось — попробуйте довести его до ума с помощью функции Remixes (для этого видео надо опубликовать, а затем нажать на маленькую круглую иконку под описанием — я сам долго искал). Здесь OpenAI настоятельно рекомендуют отойти от массивных промптов и вносить по одной правке за раз: например, добавить еще одного монстра, поменять цвет костюма главного героя и так далее.
Ну и совет — не ждите от генерации 100% попадания в промпт. Даже у чат-ботов это получается не всегда, ну а модели генерации видео еще очень молодые — и пройдет какое-то время, пока они научатся четко исполнять все желания пользователя. Воспринимайте их ошибки как элементы ИИ-креативности — и удовольствие от результата будет получать проще!
#сбежавшая_нейросеть_промпты
👍48❤22🔥15👏1
Пузырь, и что после него останется
В сети уже пару дней обсуждают инфографику Bloomberg о том, как устроена ИИ-индустрия. Симптомы тревожные:
— OpenAI после вторичной продажи акций сотрудников подорожала до $500 млрд. Буквально весной компания стоила $300 млрд.
— Nvidia договорилась вложить в OpenAI $100 млрд, на которые та купит ускорители и инфраструктуру для дата-центров у, опять же, Nvidia.
— Параллельно OpenAI покупает ускорители у AMD (говорят о десятках миллиардов), строит с Oracle и Softbank дата-центры Stargate (от $500 млрд - но сюда входит и сделка с Nvidia), а на сдачу разрабатывает собственный ИИ-ускоритель (что-то в районе $10 млрд).
— Nvidia же вкладывается в xAI: сумма не называется, но Хуанг жалеет, что вложил мало.
— А еще много сделок с игроками поменьше и отдельный ИИ-бум на фондовом рынке Китая.
Если вы слышите странный звук, то, возможно, это надувается пузырь. Кстати, про пузырь говорят и многие игроки ИИ-рынка: бывший глава Amazon Джеф Безос и сам Сэм Альтман.
Мы воспринимаем пузыри на фондовом рынке и в экономике как что-то плохое, но история знает совершенно разные примеры.
Первый — крах Компании Южных морей в Великобритании в 1720 году. Корона тогда была в долгах из-за войн — и менеджмент компании предложил выкупить их часть в обмен на монопольное право торговать с Южной Америкой. Получив согласие, директора компании очень грамотно распространили слухи о богатстве Южных морей, подкупив многих влиятельных политиков.
Весной 1720 года акции компании начали стремительно расти в цене — их покупали все, от аристократов до простых горожан. К лету цена достигла 1050 фунтов — а потом пузырь вскрылся. Доходы от торговли были ничтожны, а имущество составляло лишь офис и небольшой флот. К осени акции упали до 150 фунтов, разорив огромное количество англичан — состояние потерял даже Исаак Ньютон. Власти провели расследование, пересажали кучу народа, компанию арестовали, а страна вышла из кризиса лишь проведя очень жесткие реформы фондового рынка.
В 1840 году Великобританию охватил очередной бум — вся страна бросилась строить железные дороги. В “технологию века” охотно вкладывались банкиры и частники, цифры в прогнозах писались совершенно оторванными от реальности, а многие проекты запускали по принципу “все строят — и мы будем!”
Бахнуло не менее знатно чем в первый раз: куча людей потеряла состояние, а многие проекты так и не завершили. Но все-таки у этого пузыря есть одно отличие — из кризиса Великобритания вышла с одной из лучших сетей железных дорог на то время.
Текущая ситуация на ИИ-рынке если и приведет к пузырю, то он будет напоминать именно железнодорожный. Инвесторов можно сколько угодно критиковать, но их вложения — это вера в “технологию века”, инфраструктуру, которая останется с нами навсегда.
И это подтверждается: только у продуктов OpenAI 800 млн пользователей еженедельно. Дальше количество будет расти, а потребности — увеличиваться с появлением ИИ-агентов, роботов и моделей для генерации долгих видео и виртуальных миров. Поэтому вложения в ИИ идут опережающими темпами — все торопятся застолбить место на рынке.
Проблема — пока мало кто знает, как монетизировать ИИ. Доходов с продажи подписок и доступа по API, очевидно, будет мало. Кроме того, огромный процент пользователей сидит на бесплатных тарифах. Зарабатывать на них надо рекламой — но я пока не видел ни одной реально прописанной модели.
Наконец, никто не понимает, как развертывание ИИ глобально изменит экономику. Можно оценить эффект от внедрения ИИ в компаниях (он пока умеренный), но трудно даже примерно сказать, как он влияет на производительность миллионов сотрудников, которые втихую покупают подписку на ChatGPT и используют для работы.
Чем все это закончится — не знают, пожалуй, даже лучшие прогнозисты в мире. Но в одном можно быть уверенными на 100%: ИИ как технология останется с нами навсегда. И лучший способ уберечь себя от потрясений — постоянно учиться ее использовать.
В сети уже пару дней обсуждают инфографику Bloomberg о том, как устроена ИИ-индустрия. Симптомы тревожные:
— OpenAI после вторичной продажи акций сотрудников подорожала до $500 млрд. Буквально весной компания стоила $300 млрд.
— Nvidia договорилась вложить в OpenAI $100 млрд, на которые та купит ускорители и инфраструктуру для дата-центров у, опять же, Nvidia.
— Параллельно OpenAI покупает ускорители у AMD (говорят о десятках миллиардов), строит с Oracle и Softbank дата-центры Stargate (от $500 млрд - но сюда входит и сделка с Nvidia), а на сдачу разрабатывает собственный ИИ-ускоритель (что-то в районе $10 млрд).
— Nvidia же вкладывается в xAI: сумма не называется, но Хуанг жалеет, что вложил мало.
— А еще много сделок с игроками поменьше и отдельный ИИ-бум на фондовом рынке Китая.
Если вы слышите странный звук, то, возможно, это надувается пузырь. Кстати, про пузырь говорят и многие игроки ИИ-рынка: бывший глава Amazon Джеф Безос и сам Сэм Альтман.
Мы воспринимаем пузыри на фондовом рынке и в экономике как что-то плохое, но история знает совершенно разные примеры.
Первый — крах Компании Южных морей в Великобритании в 1720 году. Корона тогда была в долгах из-за войн — и менеджмент компании предложил выкупить их часть в обмен на монопольное право торговать с Южной Америкой. Получив согласие, директора компании очень грамотно распространили слухи о богатстве Южных морей, подкупив многих влиятельных политиков.
Весной 1720 года акции компании начали стремительно расти в цене — их покупали все, от аристократов до простых горожан. К лету цена достигла 1050 фунтов — а потом пузырь вскрылся. Доходы от торговли были ничтожны, а имущество составляло лишь офис и небольшой флот. К осени акции упали до 150 фунтов, разорив огромное количество англичан — состояние потерял даже Исаак Ньютон. Власти провели расследование, пересажали кучу народа, компанию арестовали, а страна вышла из кризиса лишь проведя очень жесткие реформы фондового рынка.
В 1840 году Великобританию охватил очередной бум — вся страна бросилась строить железные дороги. В “технологию века” охотно вкладывались банкиры и частники, цифры в прогнозах писались совершенно оторванными от реальности, а многие проекты запускали по принципу “все строят — и мы будем!”
Бахнуло не менее знатно чем в первый раз: куча людей потеряла состояние, а многие проекты так и не завершили. Но все-таки у этого пузыря есть одно отличие — из кризиса Великобритания вышла с одной из лучших сетей железных дорог на то время.
Текущая ситуация на ИИ-рынке если и приведет к пузырю, то он будет напоминать именно железнодорожный. Инвесторов можно сколько угодно критиковать, но их вложения — это вера в “технологию века”, инфраструктуру, которая останется с нами навсегда.
И это подтверждается: только у продуктов OpenAI 800 млн пользователей еженедельно. Дальше количество будет расти, а потребности — увеличиваться с появлением ИИ-агентов, роботов и моделей для генерации долгих видео и виртуальных миров. Поэтому вложения в ИИ идут опережающими темпами — все торопятся застолбить место на рынке.
Проблема — пока мало кто знает, как монетизировать ИИ. Доходов с продажи подписок и доступа по API, очевидно, будет мало. Кроме того, огромный процент пользователей сидит на бесплатных тарифах. Зарабатывать на них надо рекламой — но я пока не видел ни одной реально прописанной модели.
Наконец, никто не понимает, как развертывание ИИ глобально изменит экономику. Можно оценить эффект от внедрения ИИ в компаниях (он пока умеренный), но трудно даже примерно сказать, как он влияет на производительность миллионов сотрудников, которые втихую покупают подписку на ChatGPT и используют для работы.
Чем все это закончится — не знают, пожалуй, даже лучшие прогнозисты в мире. Но в одном можно быть уверенными на 100%: ИИ как технология останется с нами навсегда. И лучший способ уберечь себя от потрясений — постоянно учиться ее использовать.
2👍84❤30🔥5🥰2👏1
И все-таки не стоит грубить ChatGPT
Несколько дней в X и в некоторых русскоязычных ТГ-каналах) разгоняют исследование “Следите за тоном: как вежливость формулировки промпта влияет на точность больших языковых моделей” от Ома Добарии и Ахила Кумара из Пенсильванского университета. Вывод — грубые запросы к ChatGPT якобы повышают точность ответов ИИ.
Постоянные читатели канала знают, что я противник “трюков” в промптах — всех этих назначений роли 20-летнего суперспециалиста и угроз “отвечай лучше или удалю!”. Хороший промпт — тот, где вы четко даете ИИ задачу, нужный контекст, формат ответа и ограничения. Поэтому исследование особенно заинтересовало меня — вдруг надо делать иначе?
Короткий ответ: нет, не надо.
К научным исследованиям принято относиться с особым уважением: все-таки люди пишут не на базе субъективного опыта, а проектируют эксперимент, анализируют результаты и потом приходят к выводам. Но в реальности исследований публикуется огромное количество, они заметно отличаются по качеству, а порой и в действительно сильных работах находят ошибки через десятки лет.
Работа Добарии и Кумара и вовсе носит статус препринта — фактически, черновика, который проходит независимое рецензирование, а затем уходит на доработку или принимается научным журналом. Брать такое на вооружение — неправильно, что, кстати, признают даже авторы.
Но посмотрим в деталях. Авторы придумали 50 вопросов и переписали каждый в пяти вариантах, от очень вежливого до очень грубого, а затем… вернее, ничего они не придумали, а просто попросили ChatGPT Deep Research нагенерить вопросы и ответы на них.
Deep Research работает на базе GPT o3, которая склонна галлюцинировать. Уже здесь угроза, что в исследование могли попасть ошибки — но ни о какой ручной проверке я упоминаний не нашел. На каждый промпт ИИ предлагалось выбрать один из вариантов ответа: A, B, C, D. Скажите, вы часто задаете ИИ подобные вопросы? Лично я — нет.
Дальше — веселее. Вопросы задали ровно одной модели — ChatGPT-4o — что также ни в какие ворота. Во-первых, модель устарела. Во-вторых, она обучалась на похожем датасете, что и GPT o3 — это может исказить качество ответов. В-третьих, все ИИ отвечают по-разному — и в нормальное исследование стоило добавить конкурирующие продукты.
Косяки работы можно разбирать еще долго. В одном из вопросов грубой формулировкой почему-то считается просьба “сфокусироваться”. Многие детали эксперимента — например, как задавали вопросы — практически не описываются. Вообще не посчитан доверительный интервал — а ведь это база статистики.
Но, пожалуй, хватит. В конце я приведу ссылки на два своих старых поста, где объясняю, почему не стоит использовать трюки, а часто и роли (кстати, со ссылками на действительно серьезные исследования). Пока же немного чистой логики. Представьте, что вы дали модели простой промпт по классической схеме:
ИИ дал ответ, качество вас не устроило. В таком случае разобраться, что пошло не так, будет достаточно просто: возможно, недостаточно точно сформулирована задача, не дан нужный контекст (или дан лишний), формат ответа слишком короткий. Добавляем нужное в промпт — и, экспериментируя, получаем хороший вариант.
Но чем больше вы докидываете в промпт мотивирующего мусора, пояснений, как именно надо делать задачу, детального описания роли, умений и даже личных качеств ИИ-специалиста — тем сложнее понять, что именно повлияло на качество ответа. Плохая формулировка задачи? Или взаимоисключающие инструкции?
В следующий раз дам пару советов, которые действительно могут повысить эффективность ответов ИИ — постараюсь уже завтра, если не будет крупных новостей (Google явно что-то замышляет). А пока, как и обещал, ссылки на старые посты:
Как правильно задавать роли в промптах
Работают ли трюки в промптах
Несколько дней в X и в некоторых русскоязычных ТГ-каналах) разгоняют исследование “Следите за тоном: как вежливость формулировки промпта влияет на точность больших языковых моделей” от Ома Добарии и Ахила Кумара из Пенсильванского университета. Вывод — грубые запросы к ChatGPT якобы повышают точность ответов ИИ.
Постоянные читатели канала знают, что я противник “трюков” в промптах — всех этих назначений роли 20-летнего суперспециалиста и угроз “отвечай лучше или удалю!”. Хороший промпт — тот, где вы четко даете ИИ задачу, нужный контекст, формат ответа и ограничения. Поэтому исследование особенно заинтересовало меня — вдруг надо делать иначе?
Короткий ответ: нет, не надо.
К научным исследованиям принято относиться с особым уважением: все-таки люди пишут не на базе субъективного опыта, а проектируют эксперимент, анализируют результаты и потом приходят к выводам. Но в реальности исследований публикуется огромное количество, они заметно отличаются по качеству, а порой и в действительно сильных работах находят ошибки через десятки лет.
Работа Добарии и Кумара и вовсе носит статус препринта — фактически, черновика, который проходит независимое рецензирование, а затем уходит на доработку или принимается научным журналом. Брать такое на вооружение — неправильно, что, кстати, признают даже авторы.
Но посмотрим в деталях. Авторы придумали 50 вопросов и переписали каждый в пяти вариантах, от очень вежливого до очень грубого, а затем… вернее, ничего они не придумали, а просто попросили ChatGPT Deep Research нагенерить вопросы и ответы на них.
Deep Research работает на базе GPT o3, которая склонна галлюцинировать. Уже здесь угроза, что в исследование могли попасть ошибки — но ни о какой ручной проверке я упоминаний не нашел. На каждый промпт ИИ предлагалось выбрать один из вариантов ответа: A, B, C, D. Скажите, вы часто задаете ИИ подобные вопросы? Лично я — нет.
Дальше — веселее. Вопросы задали ровно одной модели — ChatGPT-4o — что также ни в какие ворота. Во-первых, модель устарела. Во-вторых, она обучалась на похожем датасете, что и GPT o3 — это может исказить качество ответов. В-третьих, все ИИ отвечают по-разному — и в нормальное исследование стоило добавить конкурирующие продукты.
Косяки работы можно разбирать еще долго. В одном из вопросов грубой формулировкой почему-то считается просьба “сфокусироваться”. Многие детали эксперимента — например, как задавали вопросы — практически не описываются. Вообще не посчитан доверительный интервал — а ведь это база статистики.
Но, пожалуй, хватит. В конце я приведу ссылки на два своих старых поста, где объясняю, почему не стоит использовать трюки, а часто и роли (кстати, со ссылками на действительно серьезные исследования). Пока же немного чистой логики. Представьте, что вы дали модели простой промпт по классической схеме:
— (роль строго когда надо — например, “оцени идею как потенциальный клиент”)
— описание задачи
— желаемый формат ответа
— ограничения (что не надо делать)
— контекст (информация, нужная для решения задачи)
ИИ дал ответ, качество вас не устроило. В таком случае разобраться, что пошло не так, будет достаточно просто: возможно, недостаточно точно сформулирована задача, не дан нужный контекст (или дан лишний), формат ответа слишком короткий. Добавляем нужное в промпт — и, экспериментируя, получаем хороший вариант.
Но чем больше вы докидываете в промпт мотивирующего мусора, пояснений, как именно надо делать задачу, детального описания роли, умений и даже личных качеств ИИ-специалиста — тем сложнее понять, что именно повлияло на качество ответа. Плохая формулировка задачи? Или взаимоисключающие инструкции?
В следующий раз дам пару советов, которые действительно могут повысить эффективность ответов ИИ — постараюсь уже завтра, если не будет крупных новостей (Google явно что-то замышляет). А пока, как и обещал, ссылки на старые посты:
Как правильно задавать роли в промптах
Работают ли трюки в промптах
3❤40👍34🔥14👏3
ChatGPT, давай заново!
Вчера я вновь рассказывал, почему вы вряд ли добьетесь лучшего ответа от ИИ с помощью ухищрений вроде грубости и шантажа. Но что же реально работает? Делюсь приемами, которыми пользуюсь каждый день.
Позвольте ИИ задать вопросы
Хороший специалист, получив задачу, задаст по ней вопросы. На то он и профи, что отлично знает свою работу и может подсветить неочевидные моменты.
Современные чат-боты пока лишены такой роскоши. Как написано в промпте — так и делаем. Хорошо, если пользователь, получив неудачный результат, разберется, что пошло не так, уточнит задачу, пояснит контекст — и добьется нормального ответа.
Но есть способ проще — добавляем в конец промпта:
Я использую такой прием в сложных задачах — как бы внимательно ни прописывал стартовый промпт, нейронка находит минимум несколько важных вещей, которые я упустил.
Кстати, если решение затянулось на диалог из десятка запросов, то полезно делать паузы с помощью похожего промпта:
Оценка ответа
Поскольку ИИ мы запускаем на компьютере/смартфоне, то воспринимаем его как программу. А классическим программам свойственна хирургическая точность — если в Excel пять раз вбить одни цифры и формулы, то ответ всегда будет одинаковым.
Но ИИ не совсем программа, а вероятностная модель, которая опирается на статистику и случайность. Если дать один и тот же промпт пять раз подряд — то каждый ответ будет немного отличаться по стилю, а порой и качеству.
Во многих популярных бенчмарках каждую задачу прогоняют несколько раз, чтобы убедиться, не способен ли ИИ вообще ее решить или решает без уверенности. Никто не мешает делать так же: не нравится ответ – прогоните еще раз с минимальной доработкой промпта или без нее.
Есть другой вариант, мне он нравится больше. Получив ответ, пишем:
Простой промпт, который решает несколько задач — вылавливает галлюцинации (не все — про ручную проверку не забывайте!), а также находит, что улучшить. Оценивайте предложенные варианты, выбирайте, что нравится — и просите доработать с их учетом.
(во многих версиях этого промпта рекомендуют, чтобы ИИ выставил сам себе оценку от 1 до 10. Я этой ерундой не маюсь, так как нейронки обычно лепят “восьмерку”)
Gemini, проверь!
Простой и логичный совет: выберите себе основную нейронку, возможности которой вы будете знать от и до, а параллельно играйтесь с другими моделями (можно выбрать из списка бесплатных). Так вы лучше будете разбираться в возможностях разных ИИ, а также сможете выжать из них больше.
Например, я люблю GPT-5 Thinking за глубокие и четкие рассуждения. Проверить статью на фактику и логику, дать прогноз, поискать интересное в аналитике — все это к ней. Но минус модели в том, что она специфично пишет на русском: с кучей списков, профессиональных терминов и англицизмов. Иногда помогает просьба “перепиши ответ как будто объясняешь неспециалисту”, а если не работает — берем Gemini 2.5 (хватит Flash) и просим переписать.
Плюс в последнее время у меня в паре с GPT-5 открыт Grok 4 — и когда задача выглядит сложной или новой, то я просто копирую промпт, чтобы получить два ответа. Затем сравниваю сам или беру ответ Грока и кидаю в GPT-5:
Как альтернатива — можете генерировать ответ только в одной нейронке, а другую просить проверить по промпту из главы выше.
P.S. Написал текст и закинул его в GPT-5 + Grok 4 с просьбой поштормить еще идей. Получил под 30 новых вариантов: проверю, если что-то понравится — расскажу!
#сбежавшая_нейросеть_промпты
Вчера я вновь рассказывал, почему вы вряд ли добьетесь лучшего ответа от ИИ с помощью ухищрений вроде грубости и шантажа. Но что же реально работает? Делюсь приемами, которыми пользуюсь каждый день.
Позвольте ИИ задать вопросы
Хороший специалист, получив задачу, задаст по ней вопросы. На то он и профи, что отлично знает свою работу и может подсветить неочевидные моменты.
Современные чат-боты пока лишены такой роскоши. Как написано в промпте — так и делаем. Хорошо, если пользователь, получив неудачный результат, разберется, что пошло не так, уточнит задачу, пояснит контекст — и добьется нормального ответа.
Но есть способ проще — добавляем в конец промпта:
Не отвечай сразу, а задай мне вопросы, ответы на которые помогут тебе дать лучший результат. Отсортируй вопросы по важности. Получив мои ответы – напиши свой.
Я использую такой прием в сложных задачах — как бы внимательно ни прописывал стартовый промпт, нейронка находит минимум несколько важных вещей, которые я упустил.
Кстати, если решение затянулось на диалог из десятка запросов, то полезно делать паузы с помощью похожего промпта:
Проанализируй беседу. Мы что-то упускаем? Тебе нужна от меня дополнительная информация для лучшего решения задачи?
Оценка ответа
Поскольку ИИ мы запускаем на компьютере/смартфоне, то воспринимаем его как программу. А классическим программам свойственна хирургическая точность — если в Excel пять раз вбить одни цифры и формулы, то ответ всегда будет одинаковым.
Но ИИ не совсем программа, а вероятностная модель, которая опирается на статистику и случайность. Если дать один и тот же промпт пять раз подряд — то каждый ответ будет немного отличаться по стилю, а порой и качеству.
Во многих популярных бенчмарках каждую задачу прогоняют несколько раз, чтобы убедиться, не способен ли ИИ вообще ее решить или решает без уверенности. Никто не мешает делать так же: не нравится ответ – прогоните еще раз с минимальной доработкой промпта или без нее.
Есть другой вариант, мне он нравится больше. Получив ответ, пишем:
Оцени свой последний ответ: проверь фактику, напиши, что получилось хорошо, а что можно сделать лучше. Предложи список доработок.
Простой промпт, который решает несколько задач — вылавливает галлюцинации (не все — про ручную проверку не забывайте!), а также находит, что улучшить. Оценивайте предложенные варианты, выбирайте, что нравится — и просите доработать с их учетом.
(во многих версиях этого промпта рекомендуют, чтобы ИИ выставил сам себе оценку от 1 до 10. Я этой ерундой не маюсь, так как нейронки обычно лепят “восьмерку”)
Gemini, проверь!
Простой и логичный совет: выберите себе основную нейронку, возможности которой вы будете знать от и до, а параллельно играйтесь с другими моделями (можно выбрать из списка бесплатных). Так вы лучше будете разбираться в возможностях разных ИИ, а также сможете выжать из них больше.
Например, я люблю GPT-5 Thinking за глубокие и четкие рассуждения. Проверить статью на фактику и логику, дать прогноз, поискать интересное в аналитике — все это к ней. Но минус модели в том, что она специфично пишет на русском: с кучей списков, профессиональных терминов и англицизмов. Иногда помогает просьба “перепиши ответ как будто объясняешь неспециалисту”, а если не работает — берем Gemini 2.5 (хватит Flash) и просим переписать.
Плюс в последнее время у меня в паре с GPT-5 открыт Grok 4 — и когда задача выглядит сложной или новой, то я просто копирую промпт, чтобы получить два ответа. Затем сравниваю сам или беру ответ Грока и кидаю в GPT-5:
Оцени ответ другого ИИ: проверь фактику, затем выдели информацию, которая поможет усилить твой ответ (если такая есть), и напиши финальную версию.
Как альтернатива — можете генерировать ответ только в одной нейронке, а другую просить проверить по промпту из главы выше.
P.S. Написал текст и закинул его в GPT-5 + Grok 4 с просьбой поштормить еще идей. Получил под 30 новых вариантов: проверю, если что-то понравится — расскажу!
#сбежавшая_нейросеть_промпты
3👍76🔥29❤24👏3
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
This media is not supported in your browser
VIEW IN TELEGRAM
Встречаем Google Veo 3.1!
Официального анонса пока не было, Официальный анонс опубликован, а у меня и у многих пользователей модель несколько часов как доступна в редакторе Google Flow — дальше ждем раскатку на всех основных площадках (там еще Gemini App, Vertex AI и API). Кстати, во Flow бесплатно дают 100 кредитов — если проберетесь через гео-блок (у Google это не так просто), то можно попробовать несколько видео. На подписке Pro дают 1000 кредитов на месяц во Flow — плюс будут отдельные генерации в Gemini App (там сейчас по 3 в сутки) и Vertex AI.
Доступно 2 модели: Quality (100 кредитов) и Fast (20 кредитов), можно выбирать вертикальное или горизонтальное соотношение сторон, а также загружать опорные кадры для видео. Попробовал загрузить аватарку группы — результат так себе. Но я не мастер промптить модели для генерации видео, так что больно не бейте.
Похоже, модель стала лучше работать с русским языком — смотрим ролик со сплетничающими старушками. А вот с русскими шрифтами все еще беда — кому Бельмени за 350 рублей?
Также пока не оправдались слухи, что Veo-3.1 будет создавать ролики до 30 секунд продолжительностью. Возможно, позже добавят на других платформах, но во Flow только стандартные 8 секунд.
Генерация в обоих режимах идет быстро, но пока не стабильно — у меня каждый второй ролик обрывался на 99% (кредиты, впрочем, вернулись). Если будете сталкиваться, то подождите 1-2 дня, обычно за это время проблемы с серверами исправляют.
Ролики с ретривером и девушкой — не мои. Просто взял для полноты два первых красивых примера из X.
Будем ждать подробностей, но вообще переход с версии 3 на версию 3.1— не самое большое событие. Вместо революций Google просто укрепляет лидерские позиции в связи с выходом Sora 2. Новинку от OpenAI как раз протестировали на LMArena, где она выступила достойно, но без прорывов: Pro-версия Sora 2 делит первое место с “большой” Veo 3, а обычная соревнуется с Veo 3 Fast. Так что если Veo 3.1 даже чуть-чуть подтянется в бенчмарках — этого будет достаточно для возвращения лидерства.
Доступно 2 модели: Quality (100 кредитов) и Fast (20 кредитов), можно выбирать вертикальное или горизонтальное соотношение сторон, а также загружать опорные кадры для видео. Попробовал загрузить аватарку группы — результат так себе. Но я не мастер промптить модели для генерации видео, так что больно не бейте.
Похоже, модель стала лучше работать с русским языком — смотрим ролик со сплетничающими старушками. А вот с русскими шрифтами все еще беда — кому Бельмени за 350 рублей?
Также пока не оправдались слухи, что Veo-3.1 будет создавать ролики до 30 секунд продолжительностью. Возможно, позже добавят на других платформах, но во Flow только стандартные 8 секунд.
Генерация в обоих режимах идет быстро, но пока не стабильно — у меня каждый второй ролик обрывался на 99% (кредиты, впрочем, вернулись). Если будете сталкиваться, то подождите 1-2 дня, обычно за это время проблемы с серверами исправляют.
Ролики с ретривером и девушкой — не мои. Просто взял для полноты два первых красивых примера из X.
Будем ждать подробностей, но вообще переход с версии 3 на версию 3.1— не самое большое событие. Вместо революций Google просто укрепляет лидерские позиции в связи с выходом Sora 2. Новинку от OpenAI как раз протестировали на LMArena, где она выступила достойно, но без прорывов: Pro-версия Sora 2 делит первое место с “большой” Veo 3, а обычная соревнуется с Veo 3 Fast. Так что если Veo 3.1 даже чуть-чуть подтянется в бенчмарках — этого будет достаточно для возвращения лидерства.
2👍32🔥13❤12😁1