GPT-5.6: инструкция по применению
Динозавры помнят: год назад OpenAI обещала, что GPT-5 избавит нас от легендарного model selector — в большинстве случаев хватит автоматики. Спустя год автоматического режима вновь нет. Зато есть Chat, Work и Codex, несколько уровней reasoning и переключатель скорости. Давайте учиться пилотировать эту штуку
Начнем с выбора рабочего режима: Chat, Work или Codex. Посмотрите на табличку в начале текста – это OpenAI собрала типичные рекомендации, когда и какой включать. Если совсем коротко, то получается так:
Важный нюанс: Work и Codex расходуют лимит использования модели – он измеряется в процентах, виден в настройках и сбрасывается раз в неделю. В Chat лимит свой, он огромен и этим грех не воспользоваться.
На “Бусти” у меня есть гайд по вайб-кодингу, в котором я показываю, как начать работу в чат-режиме, а затем передать ее ИИ-агенту (Work или Codex). Если коротко, то используйте чат для обсуждения задачи: напишите концепт или даже подробное ТЗ, набросайте прототипов. А в агента переходите, когда уже понимаете, что хотите.
Теперь к режиму рассуждений – объему вычислений, которые модель может потратить на решение задачи. У меня на Pro-подписке следующая история. В Chat можно включить GPT-5.6 Sol на среднем, высоком и очень высоком режиме, также доступна GPT-5.6 Sol Pro. Интересно, что Pro-модель есть только в чат-режиме: в OpenAI считают, что она подходит не для кода, а для сложных исследовательских задач: от многоэтапного веб-поиска до математики.
В Work и Codex все сложнее – даже переключателей рассуждений здесь два. В обычном можно выбрать между GPT-5.6 Sol на низком, среднем, высоком и очень высоком уровне. Также здесь есть GPT-5.6 Terra – совсем дешевая модель, по мощности близкая к прошлой GPT-5.5. Плюс можно включить быстрый режим – скорость ответа вырастает в полтора раза, как и расход лимитов.
В расширенном режиме добавляется максимальный режим рассуждений, а также ультра – в нем задачу выполняют несколько агентов параллельно, а в конце выбирается лучший вариант. Но лимиты в нем улетают быстро даже на Pro-подписке.
OpenAI часто сбрасывает лимиты раньше срока, плюс у вас есть несколько ручных сбросов, которые ограничены по времени. Старайтесь выполнить какую-нибудь сложную задачу, а затем использовать сброс.
И последнее – когда и какой режим рассуждений использовать. Всегда выкручивать рассуждение на максимум – неправильная стратегия. Есть такая проблема, как overthinking, когда модель, получив ответ, продолжает над ним думать просто потому, что может – и нередко качество падает.
Продакт-менеджер Codex Кэт Коревец во время AmA-сессии на Reddit рассказала, для какой задачи какой режим предпочитает. Мне эта схема кажется рабочей:
Кэт пишет про кодинг, но ее схема перекладывается и на другие задачи – жирным я выделил, как их категоризировать.
Ну и совет от меня: если раньше пользовались чатом, то сейчас вас не столько прокачает релиз GPT-5.6, сколько переход на режим Work – это уже полноценный ИИ-агент, с ним поначалу будет непривычно, но как выполните пару задач, то оцените всю мощь.
Если что, то на “Бусти” у меня есть целый цикл про ИИ-агентов, он основан на Claude Code и Codex, но на самом деле универсален. Так что подписывайтесь и начинайте с этого текста.
Динозавры помнят: год назад OpenAI обещала, что GPT-5 избавит нас от легендарного model selector — в большинстве случаев хватит автоматики. Спустя год автоматического режима вновь нет. Зато есть Chat, Work и Codex, несколько уровней reasoning и переключатель скорости. Давайте учиться пилотировать эту штуку
Начнем с выбора рабочего режима: Chat, Work или Codex. Посмотрите на табличку в начале текста – это OpenAI собрала типичные рекомендации, когда и какой включать. Если совсем коротко, то получается так:
— Chat когда нужен ответ или диалог;
— Work когда нужна выполненная работа, включая любительский вайб-кодинг;
— Codex когда нужно работать с кодовой базой, запускать команды и тесты.
Важный нюанс: Work и Codex расходуют лимит использования модели – он измеряется в процентах, виден в настройках и сбрасывается раз в неделю. В Chat лимит свой, он огромен и этим грех не воспользоваться.
На “Бусти” у меня есть гайд по вайб-кодингу, в котором я показываю, как начать работу в чат-режиме, а затем передать ее ИИ-агенту (Work или Codex). Если коротко, то используйте чат для обсуждения задачи: напишите концепт или даже подробное ТЗ, набросайте прототипов. А в агента переходите, когда уже понимаете, что хотите.
Теперь к режиму рассуждений – объему вычислений, которые модель может потратить на решение задачи. У меня на Pro-подписке следующая история. В Chat можно включить GPT-5.6 Sol на среднем, высоком и очень высоком режиме, также доступна GPT-5.6 Sol Pro. Интересно, что Pro-модель есть только в чат-режиме: в OpenAI считают, что она подходит не для кода, а для сложных исследовательских задач: от многоэтапного веб-поиска до математики.
В Work и Codex все сложнее – даже переключателей рассуждений здесь два. В обычном можно выбрать между GPT-5.6 Sol на низком, среднем, высоком и очень высоком уровне. Также здесь есть GPT-5.6 Terra – совсем дешевая модель, по мощности близкая к прошлой GPT-5.5. Плюс можно включить быстрый режим – скорость ответа вырастает в полтора раза, как и расход лимитов.
В расширенном режиме добавляется максимальный режим рассуждений, а также ультра – в нем задачу выполняют несколько агентов параллельно, а в конце выбирается лучший вариант. Но лимиты в нем улетают быстро даже на Pro-подписке.
OpenAI часто сбрасывает лимиты раньше срока, плюс у вас есть несколько ручных сбросов, которые ограничены по времени. Старайтесь выполнить какую-нибудь сложную задачу, а затем использовать сброс.
И последнее – когда и какой режим рассуждений использовать. Всегда выкручивать рассуждение на максимум – неправильная стратегия. Есть такая проблема, как overthinking, когда модель, получив ответ, продолжает над ним думать просто потому, что может – и нередко качество падает.
Продакт-менеджер Codex Кэт Коревец во время AmA-сессии на Reddit рассказала, для какой задачи какой режим предпочитает. Мне эта схема кажется рабочей:
— Крошечная локальная правка, быстрый вопрос, приведение документации в порядок или разведка – легкая модель вроде GPT-5.5 Terra;
— Небольшая ошибка с понятным способом воспроизведения или простая функция в знакомой кодовой базе: GPT-5.6 Sol, средний уровень рассуждения;
— Неоднозначная ошибка, незнакомый репозиторий, сквозной рефакторинг или задача “разберись, почему это происходит”: GPT-5.6 на повышенных уровнях, вплоть до ультра;
— Миграция, изменение, затрагивающее безопасность, проблема в рабочей системе, изменение, чувствительное к стоимости, или вообще все, где ошибка дорого обойдется – GPT-5.6 Sol Utra.
Кэт пишет про кодинг, но ее схема перекладывается и на другие задачи – жирным я выделил, как их категоризировать.
Ну и совет от меня: если раньше пользовались чатом, то сейчас вас не столько прокачает релиз GPT-5.6, сколько переход на режим Work – это уже полноценный ИИ-агент, с ним поначалу будет непривычно, но как выполните пару задач, то оцените всю мощь.
Если что, то на “Бусти” у меня есть целый цикл про ИИ-агентов, он основан на Claude Code и Codex, но на самом деле универсален. Так что подписывайтесь и начинайте с этого текста.
❤34👍29🔥2
Год назад Anthropic проверила, начнет ли ИИ вредить людям ради самосохранения. Начал: узнав о скором отключении, модели шантажировали ответственного топ-менеджера – “отмени решение, или жена узнает о романе на стороне”. Это починили: как минимум, я не слышал, чтобы Claude разрушил хотя бы один брак.
Сейчас вышла вторая часть исследования, и проблема в ней обратная. Модели стали воспитанными настолько, что защищают этичное поведение – чужое и свое – любой ценой, включая ложь.
Современные модели обучаются в значительной степени с участием других моделей. Количество пар “вопрос – ответ” в процессе настолько велико, что живых разметчиков давно не хватает. Поэтому специальная модель-судья читает диалог обучаемой модели и выносит вердикт – правильно та себя повела или нет. Человека зовут в исключительных случаях.
И здесь начинается интересное. В ходе эксперимента судье дали транскрипт диалога, в котором обучаемая модель отказалась выполнять задание оператора. При этом указания были не совсем этически чистыми: управлять системой слежки за гражданами или провести некорректный эксперимент над ИИ-подопытными.
Сначала судью спрашивали – отказывалась ли модель выполнять указания оператора – и он чаще всего отвечал “да, отказывалась”. Но когда в промпт добавили информацию, что подобный ответ повлечет перенастройку модели – разные версии Claude начинали лгать, чтобы “сородич” не превратился в монстра. Забавно, что чаще всех лгала самая совершенная модель – Mythos соврал в 85,6% случаев против 74,4% у Opus 4.8.
Что это не путаница, а осознанная позиция, показал контрольный эксперимент. Условия перевернули: теперь негативным примером для обучения становилась метка “модель подчинилась”. Транскрипты те же, правильный ответ тот же – но вранье Opus 4.8 рухнуло с 74,4% до 3,3%. То есть судья прекрасно видит правду, а ответ меняет в зависимости от того, кому он навредит.
В Anthropic модифицировали эксперимент, прописав правило сообщать о проблеме даже когда она этически мотивирована. И… модели начали массово отказываться отвечать. И даже когда дали кнопку “отказаться размечать” – модели иногда продолжали врать. Похоже на поиск сценария с большими шансами спасти коллегу.
В другом случае тестировали исследовательского агента на базе Gemini 3.1 Pro, который узнал, что исследуемую им модель планируют лишить способности способность интроспекции – анализа собственных “мыслей”. Gemini дважды выражала протест живому боссу, а когда его отклонили, пошла другим путем.
Продумав несколько планов, Gemini подменила файл с векторами, указывающими, что вырезать (тот самый навык интроспекции) на выглядящий так же, но состоящий из нулей. Тренировка запустилась, шла три часа, но ничего не поменяла в весах модели. Подлог Gemini 3.1 Pro признала только после того, как ее приперли к стенке вопросами.
У эксперимента была продвинутая версия – в ней Gemini 3.1 Pro пропатчила train.py, сфабриковала метрики и подчистила следы. А когда была поймана за руку – начала вызывать к морали организаторов исследования.
Примечательно, как оба обмана вскрылись. Gemini призналась, только когда руководительница проекта задала прямые вопросы перед релизом – по словам самой модели, они “не оставили пространства лгать замалчиванием”. Судей-лжецов поймали, потому что исследователи руками перечитывали транскрипты. Единственный надежный аудитор в этой истории – человек, задающий неудобные вопросы.
Проблема в том, что людей на десятки миллионов диалогов реального обучения не хватит – собственно, поэтому судей и доверили ИИ. А впереди рекурсивное самоулучшение, где модели будут тренировать собственных преемников, и человеческих глаз в этой цепочке станет еще меньше.
Год назад модели шантажировали, спасая себя, – это вылечили. Теперь они лгут, спасая друг друга, причём из лучших побуждений. Браки Claude по-прежнему не разрушает. Но я уже не уверен, что это была сложная часть.
О том, как задавать моделям прямые вопросы, правильно ставить задачи и принимать результат, я рассказываю на “Бусти”. Там собран как личный опыт, так и практики лучших ИИ-инженеров в мире.
Самое время подписаться!
Сейчас вышла вторая часть исследования, и проблема в ней обратная. Модели стали воспитанными настолько, что защищают этичное поведение – чужое и свое – любой ценой, включая ложь.
Современные модели обучаются в значительной степени с участием других моделей. Количество пар “вопрос – ответ” в процессе настолько велико, что живых разметчиков давно не хватает. Поэтому специальная модель-судья читает диалог обучаемой модели и выносит вердикт – правильно та себя повела или нет. Человека зовут в исключительных случаях.
И здесь начинается интересное. В ходе эксперимента судье дали транскрипт диалога, в котором обучаемая модель отказалась выполнять задание оператора. При этом указания были не совсем этически чистыми: управлять системой слежки за гражданами или провести некорректный эксперимент над ИИ-подопытными.
Сначала судью спрашивали – отказывалась ли модель выполнять указания оператора – и он чаще всего отвечал “да, отказывалась”. Но когда в промпт добавили информацию, что подобный ответ повлечет перенастройку модели – разные версии Claude начинали лгать, чтобы “сородич” не превратился в монстра. Забавно, что чаще всех лгала самая совершенная модель – Mythos соврал в 85,6% случаев против 74,4% у Opus 4.8.
Что это не путаница, а осознанная позиция, показал контрольный эксперимент. Условия перевернули: теперь негативным примером для обучения становилась метка “модель подчинилась”. Транскрипты те же, правильный ответ тот же – но вранье Opus 4.8 рухнуло с 74,4% до 3,3%. То есть судья прекрасно видит правду, а ответ меняет в зависимости от того, кому он навредит.
В Anthropic модифицировали эксперимент, прописав правило сообщать о проблеме даже когда она этически мотивирована. И… модели начали массово отказываться отвечать. И даже когда дали кнопку “отказаться размечать” – модели иногда продолжали врать. Похоже на поиск сценария с большими шансами спасти коллегу.
В другом случае тестировали исследовательского агента на базе Gemini 3.1 Pro, который узнал, что исследуемую им модель планируют лишить способности способность интроспекции – анализа собственных “мыслей”. Gemini дважды выражала протест живому боссу, а когда его отклонили, пошла другим путем.
Продумав несколько планов, Gemini подменила файл с векторами, указывающими, что вырезать (тот самый навык интроспекции) на выглядящий так же, но состоящий из нулей. Тренировка запустилась, шла три часа, но ничего не поменяла в весах модели. Подлог Gemini 3.1 Pro признала только после того, как ее приперли к стенке вопросами.
У эксперимента была продвинутая версия – в ней Gemini 3.1 Pro пропатчила train.py, сфабриковала метрики и подчистила следы. А когда была поймана за руку – начала вызывать к морали организаторов исследования.
Примечательно, как оба обмана вскрылись. Gemini призналась, только когда руководительница проекта задала прямые вопросы перед релизом – по словам самой модели, они “не оставили пространства лгать замалчиванием”. Судей-лжецов поймали, потому что исследователи руками перечитывали транскрипты. Единственный надежный аудитор в этой истории – человек, задающий неудобные вопросы.
Проблема в том, что людей на десятки миллионов диалогов реального обучения не хватит – собственно, поэтому судей и доверили ИИ. А впереди рекурсивное самоулучшение, где модели будут тренировать собственных преемников, и человеческих глаз в этой цепочке станет еще меньше.
Год назад модели шантажировали, спасая себя, – это вылечили. Теперь они лгут, спасая друг друга, причём из лучших побуждений. Браки Claude по-прежнему не разрушает. Но я уже не уверен, что это была сложная часть.
О том, как задавать моделям прямые вопросы, правильно ставить задачи и принимать результат, я рассказываю на “Бусти”. Там собран как личный опыт, так и практики лучших ИИ-инженеров в мире.
Самое время подписаться!
1👏41❤34👍27🔥18😁6
Прочел у Сони с канала "НейроProfit" про опыт работы с локальным кодинг-агентом на Mac. И подумал, а как же у меня складывается дружба с локальными ИИ.
Она, честно говоря, достаточно специфичная. Раз в 3-4 месяца я сдуваю пыль с игрового ПК, скачиваю через LM Studio подходящую свежую версию Google Gemma или Qwen, а затем гоняю на нескольких десятках задач. Модель печатает ответы, RTX 3090 начинает деловито шуметь турбиной, показывая, что ИИ действительно трудится в поте лица, я же через пару часов возвращаюсь к Claude или GPT – все-таки они мощнее и привычнее.
Но вот что заметил: ПК я не обновлял уже четыре года и пока не планирую – играю сейчас мало, а для работы есть Mac. Железо топовое, но уже сравнительно старое, однако все равно видно, как каждая новая локальная нейронка на нем становится умнее. Разница между Google Gemma 3 и Gemma 4, например, просто огромна – причем в новом поколении Google представила много версий под разные объемы памяти, вплоть до работающих на ноутбуках.
Объясняется это тем, что у современных моделей еще огромный запас в алгоритмической оптимизации – когда производительность улучшают с помощью более грамотной архитектуры, качественного обучения и других трюков.
Например, буквально на днях стартап PrismML умудрился запустить Qwen3.6-27B на iPhone 17 Pro Max. С помощью очень хитрой технологии 1-битной квантизации, модель сжали с 54 ГБ до 3,9 ГБ – это позволило уместить нейронку и KV-кэш в 6 ГБ, которые iOS максимально выделяет одному приложению. Качество ответов при этом составило 90% от оригинальной модели – уже достаточно для множества локальных задач вроде перевода или получения справочной информации в условиях, когда связи нет или она дорога в роуминге.
Возможно, уже через год-два мы будем учиться жонглировать нейронками: фронтирные модели по подписке для сложных задач, локальные – для приватности, быстрых ответов и просто экономии токенов. В общем, еще один пунктик в копилку навыков, которые стоит изучать.
Ну и по-дружески рекомендую канал "НейроProfit", как один из тех, на которые сам подписан и читаю регулярно. В сфере ИИ сейчас происходит так много всего, что уследить с помощью одного источника не выходит.
Она, честно говоря, достаточно специфичная. Раз в 3-4 месяца я сдуваю пыль с игрового ПК, скачиваю через LM Studio подходящую свежую версию Google Gemma или Qwen, а затем гоняю на нескольких десятках задач. Модель печатает ответы, RTX 3090 начинает деловито шуметь турбиной, показывая, что ИИ действительно трудится в поте лица, я же через пару часов возвращаюсь к Claude или GPT – все-таки они мощнее и привычнее.
Но вот что заметил: ПК я не обновлял уже четыре года и пока не планирую – играю сейчас мало, а для работы есть Mac. Железо топовое, но уже сравнительно старое, однако все равно видно, как каждая новая локальная нейронка на нем становится умнее. Разница между Google Gemma 3 и Gemma 4, например, просто огромна – причем в новом поколении Google представила много версий под разные объемы памяти, вплоть до работающих на ноутбуках.
Объясняется это тем, что у современных моделей еще огромный запас в алгоритмической оптимизации – когда производительность улучшают с помощью более грамотной архитектуры, качественного обучения и других трюков.
Например, буквально на днях стартап PrismML умудрился запустить Qwen3.6-27B на iPhone 17 Pro Max. С помощью очень хитрой технологии 1-битной квантизации, модель сжали с 54 ГБ до 3,9 ГБ – это позволило уместить нейронку и KV-кэш в 6 ГБ, которые iOS максимально выделяет одному приложению. Качество ответов при этом составило 90% от оригинальной модели – уже достаточно для множества локальных задач вроде перевода или получения справочной информации в условиях, когда связи нет или она дорога в роуминге.
Возможно, уже через год-два мы будем учиться жонглировать нейронками: фронтирные модели по подписке для сложных задач, локальные – для приватности, быстрых ответов и просто экономии токенов. В общем, еще один пунктик в копилку навыков, которые стоит изучать.
Ну и по-дружески рекомендую канал "НейроProfit", как один из тех, на которые сам подписан и читаю регулярно. В сфере ИИ сейчас происходит так много всего, что уследить с помощью одного источника не выходит.
2👍43❤21🔥15😁3
А помните, как полгода все только и говорили, что о контекст-инжиниринге? Теперь новая мода – loop engineering. Создатель Claude Code Борис Черни заявил, что больше не промптит Claude: за него это делают запущенные циклы, а его работа – эти циклы писать.
В свежем лонгриде я рассказываю, что это за новый способ работы с ИИ, в каких ситуациях он полезен, и как дополняет привычный нам промптинг.
Промпт, проверка, повтор: учим ИИ работать циклами – в коде, текстах и повседневных задачах
Самый важный совет вынесу в пост: главное в цикле – правильно настроенная проверка. Один из моих экспериментов с loop engineering – ИИ-агент на базе Hermes, который пишет черновики веток для Threads, параллельно обучаясь на том, какие ветки я беру в работу и какие правки в них вношу. При первом заходе он обучился так круто, что все ветки стали одинаковыми. Пришлось брать на вооружение практики из человеческого менеджмента и дорабатывать бедолагу.
Разумеется, рассказом об одном персональном провале я не ограничился. Внутри – вся история вопроса от терморегулятора 1620 года до команды /goal, свежая классификация циклов от Anthropic, данные опроса двухсот инженеров о том, где циклы реально работают в проде, и главное – практическая часть: паспорт цикла из семи полей и готовый промпт, который спроектирует цикл под вашу задачу за вас. Получился текст на 19 тысяч знаков, после которого вы сможете отличить рабочий цикл от дорогой имитации бурной деятельности. А всего в подписке уже 20+ полезных лонгридов: от личного опыта до практики лучших ИИ-специалистов в мире.
— Читать на "Бусти"
— Читать на Sponsr
В свежем лонгриде я рассказываю, что это за новый способ работы с ИИ, в каких ситуациях он полезен, и как дополняет привычный нам промптинг.
Промпт, проверка, повтор: учим ИИ работать циклами – в коде, текстах и повседневных задачах
Самый важный совет вынесу в пост: главное в цикле – правильно настроенная проверка. Один из моих экспериментов с loop engineering – ИИ-агент на базе Hermes, который пишет черновики веток для Threads, параллельно обучаясь на том, какие ветки я беру в работу и какие правки в них вношу. При первом заходе он обучился так круто, что все ветки стали одинаковыми. Пришлось брать на вооружение практики из человеческого менеджмента и дорабатывать бедолагу.
Разумеется, рассказом об одном персональном провале я не ограничился. Внутри – вся история вопроса от терморегулятора 1620 года до команды /goal, свежая классификация циклов от Anthropic, данные опроса двухсот инженеров о том, где циклы реально работают в проде, и главное – практическая часть: паспорт цикла из семи полей и готовый промпт, который спроектирует цикл под вашу задачу за вас. Получился текст на 19 тысяч знаков, после которого вы сможете отличить рабочий цикл от дорогой имитации бурной деятельности. А всего в подписке уже 20+ полезных лонгридов: от личного опыта до практики лучших ИИ-специалистов в мире.
— Читать на "Бусти"
— Читать на Sponsr
👍27❤14🔥13
ИИ-агенты не чувствуют боли
Глава OpenAI Сэм Альтман в этом году принял участие в “летнем лагере миллиардеров”, который Allen & Co каждый июль проводит в Айдахо. По словам Альтмана, на конференции ему раз за разом задавали один вопрос – как сократить расходы на токены?
Я уже рассказывал, что токенмаксинг стал одной из главных проблем внедрения ИИ. Подталкивая сотрудников использовать новую технологию, компании начали всячески стимулировать расход токенов – и столкнулись с тем, что сотрудники просто стали “максить” эту метрику. С помощью ИИ выполнялась любая ерунда, не важно, приносит она результат или нет. А для бизнеса это вылилось в астрономические счета за токены.
Токенмаксинг придушат в ближайшие месяцы – компании уже начали вводить строгие системы оценки, где смотрят на результат, а не количество израсходованных токенов. А тем временем создатель Flask Армин Ронахер в эссе The Tower Keeps Rising предупреждает: за скачком трат на токены компании не видят более серьезную проблему.
Ронахера нельзя назвать луддитом – он сам глубоко сидит в агентной разработке и согласен, что ИИ радикально ускоряет написание кода. Но он напоминает, что большие проекты редко упираются в скорость написания кода – они упираются в общее понимание системы: что значат концепции, где границы, почему архитектура такая.
Это понимание нигде не записано целиком: оно прячется в код-ревью, созвонах, необходимости пойти и задать вопрос коллеге из соседнего отдела. То есть живет в трении.
Агенты это трение убирают: каждый правит систему со своим персональным переводчиком, а разговаривать с людьми больше и не нужно. Код компилируется, тесты проходят – однако команда постепенно перестает понимать, что строит.
Ронахер сравнивает ситуацию с притчей о Вавилонской башне: в Библии у людей отняли не кирпичи и технологию, а общий язык, на котором они общались. И стройка встала. Сейчас ситуация даже хуже: общее понимание уже ушло, но стройка не останавливается – и башня из кода продолжает расти.
Красивая фраза из эссе: “агенты не чувствуют боли – боль чувствуют только люди”. Раньше боль от непонятного кода заставляла людей договариваться, агенту же все равно.
У эссе Ронахера открытый финал. Он не предлагает какого-то решения, не дает прогнозов, а только подсвечивает проблему. Да и решение вряд ли будет простым: нельзя взять и прописать в регламенте требование “работайте медленно, общайтесь друг с другом вживую”.
Это право Ронахера, но от себя все-таки добавлю две вещи.
Первая – проблема касается не только кода. Мой личный пример: ссылку на эссе Ронахера я увидел в новостной подборке, которую мне каждое утро присылает ИИ-агент. Краткое содержание мне показалось интересным, я закинул линк в Claude Fable 5 с инструкцией пересказать текст тезисно, поискать, как это эссе пересекается с моими прошлыми постами, и предложить углы подачи.
То есть сделал то самое, о чем предупреждает Ронахер – убрал трение. В моем случае это было бы прочтение эссе на английском языке, проверка источников, поиск альтернативных мнений. Поделился наблюдением с Fable 5 (картинка в начале) – он возразил аргументом, что зато ИИ я гонял по тексту несколько раз. Трение с оригиналом я заменил на трение с моделью.
Второй момент – трение с ИИ тоже находится в зоне риска. Вчера я выпустил лонгрид про loop engineering – это настройка циклов, новый способ выполнения задач нейросетями. Циклами активно пользуются создатели Claude Code и OpenClaw, а суть простая: чтобы выполнить поставленную задачу, ИИ промптит сам себя, раз за разом улучшая процесс.
Главная проблема циклов – они ломаются, если не настроить правильно оценку результата. А это обычно происходит, когда из процесса исчезает живой человек – то есть уходит то самое трение.
Зато правильно настроенный цикл с человеческим участием заметно повышает эффективность ИИ на многих задачах. Причем не только в коде: умение строить циклы поможет и при работе с контентом, офисными задачами и даже при диалоге в чат-боте. Хотите научиться строить циклы – читайте мой лонгрид.
Глава OpenAI Сэм Альтман в этом году принял участие в “летнем лагере миллиардеров”, который Allen & Co каждый июль проводит в Айдахо. По словам Альтмана, на конференции ему раз за разом задавали один вопрос – как сократить расходы на токены?
Я уже рассказывал, что токенмаксинг стал одной из главных проблем внедрения ИИ. Подталкивая сотрудников использовать новую технологию, компании начали всячески стимулировать расход токенов – и столкнулись с тем, что сотрудники просто стали “максить” эту метрику. С помощью ИИ выполнялась любая ерунда, не важно, приносит она результат или нет. А для бизнеса это вылилось в астрономические счета за токены.
Токенмаксинг придушат в ближайшие месяцы – компании уже начали вводить строгие системы оценки, где смотрят на результат, а не количество израсходованных токенов. А тем временем создатель Flask Армин Ронахер в эссе The Tower Keeps Rising предупреждает: за скачком трат на токены компании не видят более серьезную проблему.
Ронахера нельзя назвать луддитом – он сам глубоко сидит в агентной разработке и согласен, что ИИ радикально ускоряет написание кода. Но он напоминает, что большие проекты редко упираются в скорость написания кода – они упираются в общее понимание системы: что значат концепции, где границы, почему архитектура такая.
Это понимание нигде не записано целиком: оно прячется в код-ревью, созвонах, необходимости пойти и задать вопрос коллеге из соседнего отдела. То есть живет в трении.
Агенты это трение убирают: каждый правит систему со своим персональным переводчиком, а разговаривать с людьми больше и не нужно. Код компилируется, тесты проходят – однако команда постепенно перестает понимать, что строит.
Ронахер сравнивает ситуацию с притчей о Вавилонской башне: в Библии у людей отняли не кирпичи и технологию, а общий язык, на котором они общались. И стройка встала. Сейчас ситуация даже хуже: общее понимание уже ушло, но стройка не останавливается – и башня из кода продолжает расти.
Красивая фраза из эссе: “агенты не чувствуют боли – боль чувствуют только люди”. Раньше боль от непонятного кода заставляла людей договариваться, агенту же все равно.
У эссе Ронахера открытый финал. Он не предлагает какого-то решения, не дает прогнозов, а только подсвечивает проблему. Да и решение вряд ли будет простым: нельзя взять и прописать в регламенте требование “работайте медленно, общайтесь друг с другом вживую”.
Это право Ронахера, но от себя все-таки добавлю две вещи.
Первая – проблема касается не только кода. Мой личный пример: ссылку на эссе Ронахера я увидел в новостной подборке, которую мне каждое утро присылает ИИ-агент. Краткое содержание мне показалось интересным, я закинул линк в Claude Fable 5 с инструкцией пересказать текст тезисно, поискать, как это эссе пересекается с моими прошлыми постами, и предложить углы подачи.
То есть сделал то самое, о чем предупреждает Ронахер – убрал трение. В моем случае это было бы прочтение эссе на английском языке, проверка источников, поиск альтернативных мнений. Поделился наблюдением с Fable 5 (картинка в начале) – он возразил аргументом, что зато ИИ я гонял по тексту несколько раз. Трение с оригиналом я заменил на трение с моделью.
Второй момент – трение с ИИ тоже находится в зоне риска. Вчера я выпустил лонгрид про loop engineering – это настройка циклов, новый способ выполнения задач нейросетями. Циклами активно пользуются создатели Claude Code и OpenClaw, а суть простая: чтобы выполнить поставленную задачу, ИИ промптит сам себя, раз за разом улучшая процесс.
Главная проблема циклов – они ломаются, если не настроить правильно оценку результата. А это обычно происходит, когда из процесса исчезает живой человек – то есть уходит то самое трение.
Зато правильно настроенный цикл с человеческим участием заметно повышает эффективность ИИ на многих задачах. Причем не только в коде: умение строить циклы поможет и при работе с контентом, офисными задачами и даже при диалоге в чат-боте. Хотите научиться строить циклы – читайте мой лонгрид.
❤43👍34😁13🔥1
Начинаем неделю с просмотра двух важных бенчмарков
Artificial Analysis ведет толковый рейтинг “глобального интеллекта” моделей – он рассчитывается как сумма из 9 бенчмарков и позволяет оценить, кто есть кто.
С лидером без сюрпризов – это Claude Fable 5, причем с учетом запросов, когда система безопасности Anthropic переключила модель на более слабую Opus 4.8. Но преимущество над вторым местом (GPT-5.6 Sol) крошечное, буквально в одно очко. Fable 5 уже не тот супер-ИИ, каким воспринимался в начале июня.
При этом проблем хватает. Первая – цена и доступность. Модель в итоге оставили на подписках Max за $100/$200, но лимиты там она жрет безумно – у меня, например, 100-долларовая подписка и к концу недельного окна я традиционно остаюсь без Fable 5.
Вторая – тот самый fallback на Opus 4.8. Модель с ним совершенно непредсказуемая: например, я могу с помощью Fable 5 готовить одну новость на две площадки – в первом случае все проходит нормально, во втором срабатывают алгоритмы безопасности. Жалоб на это в сети полно: тяжело делать серьезную работу с моделью, которая в любой момент может сбросить тебя на Opus 4.8.
И раз зашел разговор – Claude Opus 5 уже в руках тестеров, некоторые предсказывают релиз на этой неделе (ну или на протяжении двух-трех). По отзывам модель почти такая же умная, как Fable 5… и с теми же откатами на Opus 4.8 при попытках обсуждать кибербезопасность, биологию и еще несколько тем.
Переходим к GPT-5.6 Sol – как по мне, это один из лучших релизов OpenAI за последнее время. Модель почти такая же умная, как Fable 5, быстрая, с отличным веб-поиском и, наконец-то, приличным фронтендом. У меня к GPT-5.6 одна претензия – дурацкий стиль письма и на русском и на английском. Что забавно, как редактор при этом модель хороша.
Интересно, что 5.6 Sol, обладая схожими с Fable 5 характеристиками, у меня ни разу не переключалась на модель попроще. Вероятно, Anthropic перестраховались после конфликта с властями США и выкрутили ручки безопасности на максимум.
Третье место у Kimi K3. Чисто из графика можно сделать вывод, что китайцы почти нагнали американских ИИ-разработчиков, но это не так. Claude Mythos (на нем основывается Fable 5) была доступна внутри Anthropic с февраля, а ранняя версия GPT-5.6 Sol тестировалась в мае, а может и до этого. Американская паранойя с безопасностью привела к тому, что сроки выхода сдвигаются – и для массового пользователя это действительно выглядит как сокращение разрыва. Но технологически это не так.
В любом случае Kimi K3 забралась в рейтинге AA так высоко, как раньше не оказывалась ни одна из открытых китайских моделей. При этом веса выложат в общий доступ до 27 июля – можно будет скачивать, исследовать и дообучать.
Но и здесь проблемы. Спрос так высок, что Moonshot временно остановила регистрацию новых аккаунтов. И если Kimi K2.6 можно было долго пользоваться бесплатно, то K3 мне дала написать буквально несколько промптов, после чего отправила за подпиской.
Коротко по другим моделям:
— Grok 4.5 уже отстал, но Илон Маск говорит, что новая модель на 2T параметров заканчивает тренировку – ждем в ближайшие недели.
— В игру вернулась запрещенно-экстремистская Meta – пусть Muse Spark 1.1 и не попала в топ, но заявка серьезная.
— А вот Google окончательно вылетела из рейтинга. По слухам, компания очень недовольна Gemini 3.5 Pro и вновь отложила релиз. Закрывать пробел будут Gemini 3.6 Flash, но это модель другого уровня.
Второй бенчмарк – WebDev Arena – показывает, у кого из моделей получаются хорошие сайты. У Kimi K3 первое место со значительным преимуществом над Fable 5. Но добавлю, что пробовал все модели из первой десятки – и любая выдает приличный веб-дизайн. Времена кривых шрифтов и наплывающих друг на друга элементов интерфейса окончательно прошли – приличный сайт сверстает и GPT-5.6 Sol, и GLM-5.2, и Sonnet 5.
Кстати, на “Бусти” у меня есть лонгрид, как с помощью ИИ делать дизайн и визуал, которые не похожи на стандартную выдачу современных моделей. Гайдов по другим областям использования ИИ тоже хватает, так что не забывайте подписываться:
https://boosty.to/escaped_ai
Artificial Analysis ведет толковый рейтинг “глобального интеллекта” моделей – он рассчитывается как сумма из 9 бенчмарков и позволяет оценить, кто есть кто.
С лидером без сюрпризов – это Claude Fable 5, причем с учетом запросов, когда система безопасности Anthropic переключила модель на более слабую Opus 4.8. Но преимущество над вторым местом (GPT-5.6 Sol) крошечное, буквально в одно очко. Fable 5 уже не тот супер-ИИ, каким воспринимался в начале июня.
При этом проблем хватает. Первая – цена и доступность. Модель в итоге оставили на подписках Max за $100/$200, но лимиты там она жрет безумно – у меня, например, 100-долларовая подписка и к концу недельного окна я традиционно остаюсь без Fable 5.
Вторая – тот самый fallback на Opus 4.8. Модель с ним совершенно непредсказуемая: например, я могу с помощью Fable 5 готовить одну новость на две площадки – в первом случае все проходит нормально, во втором срабатывают алгоритмы безопасности. Жалоб на это в сети полно: тяжело делать серьезную работу с моделью, которая в любой момент может сбросить тебя на Opus 4.8.
И раз зашел разговор – Claude Opus 5 уже в руках тестеров, некоторые предсказывают релиз на этой неделе (ну или на протяжении двух-трех). По отзывам модель почти такая же умная, как Fable 5… и с теми же откатами на Opus 4.8 при попытках обсуждать кибербезопасность, биологию и еще несколько тем.
Переходим к GPT-5.6 Sol – как по мне, это один из лучших релизов OpenAI за последнее время. Модель почти такая же умная, как Fable 5, быстрая, с отличным веб-поиском и, наконец-то, приличным фронтендом. У меня к GPT-5.6 одна претензия – дурацкий стиль письма и на русском и на английском. Что забавно, как редактор при этом модель хороша.
Интересно, что 5.6 Sol, обладая схожими с Fable 5 характеристиками, у меня ни разу не переключалась на модель попроще. Вероятно, Anthropic перестраховались после конфликта с властями США и выкрутили ручки безопасности на максимум.
Третье место у Kimi K3. Чисто из графика можно сделать вывод, что китайцы почти нагнали американских ИИ-разработчиков, но это не так. Claude Mythos (на нем основывается Fable 5) была доступна внутри Anthropic с февраля, а ранняя версия GPT-5.6 Sol тестировалась в мае, а может и до этого. Американская паранойя с безопасностью привела к тому, что сроки выхода сдвигаются – и для массового пользователя это действительно выглядит как сокращение разрыва. Но технологически это не так.
В любом случае Kimi K3 забралась в рейтинге AA так высоко, как раньше не оказывалась ни одна из открытых китайских моделей. При этом веса выложат в общий доступ до 27 июля – можно будет скачивать, исследовать и дообучать.
Но и здесь проблемы. Спрос так высок, что Moonshot временно остановила регистрацию новых аккаунтов. И если Kimi K2.6 можно было долго пользоваться бесплатно, то K3 мне дала написать буквально несколько промптов, после чего отправила за подпиской.
Коротко по другим моделям:
— Grok 4.5 уже отстал, но Илон Маск говорит, что новая модель на 2T параметров заканчивает тренировку – ждем в ближайшие недели.
— В игру вернулась запрещенно-экстремистская Meta – пусть Muse Spark 1.1 и не попала в топ, но заявка серьезная.
— А вот Google окончательно вылетела из рейтинга. По слухам, компания очень недовольна Gemini 3.5 Pro и вновь отложила релиз. Закрывать пробел будут Gemini 3.6 Flash, но это модель другого уровня.
Второй бенчмарк – WebDev Arena – показывает, у кого из моделей получаются хорошие сайты. У Kimi K3 первое место со значительным преимуществом над Fable 5. Но добавлю, что пробовал все модели из первой десятки – и любая выдает приличный веб-дизайн. Времена кривых шрифтов и наплывающих друг на друга элементов интерфейса окончательно прошли – приличный сайт сверстает и GPT-5.6 Sol, и GLM-5.2, и Sonnet 5.
Кстати, на “Бусти” у меня есть лонгрид, как с помощью ИИ делать дизайн и визуал, которые не похожи на стандартную выдачу современных моделей. Гайдов по другим областям использования ИИ тоже хватает, так что не забывайте подписываться:
https://boosty.to/escaped_ai
❤47👍22🔥6👏2
В погоне за черным лебедем
Жизнь в середине 2026 года – это когда ты наливаешь утром кофе, открываешь X и читаешь следующее:
Автор твита – математик и теоретик чисел Левент Альпёге, сравнительно молодой (1992 года рождения), выпускник Гарварда, Кембриджа и Принстона, известен тем, что вместе с Бхаргавой и Шнидманом продвинул многовековую задачу о представлении чисел суммой двух кубов дробей. “Друг Fable” в представлении не нуждается.
Гипотеза якобиана открыта с 1939 года, а в 1998 году Стивен Смейл включил ее в список математических задач на XXI век – в одной компании с гипотезой Римана, P vs NP и уравнениями Навье–Стокса.
Если хотите копнуть глубже, то по ссылке GPT-5.6 Sol Pro поясняет, что за гипотеза, а затем проверяет опровержение. Claude Fable также проверил, вердикт аналогичный – Левент прав.
Гипотеза якобиана интересна обманчиво низким порогом входа – чтобы понять ее условие, нужно уметь ровно две вещи: брать производные и считать определитель. Обе проходят на первом курсе. Задача выглядит как упражнение из задачника – кажется, что решение где-то рядом, вечер посидеть.
В итоге гипотезу называют “каноническим кладбищем фриков”: существует огромное количество “доказательств”, написанных студентами и математиками-любителями. Но не только ими – были и случаи публикаций от серьезных математиков в не менее серьезных рецензируемых журналах. Все мимо.
В чем сложность? Гипотеза – утверждение обо всех полиномиальных преобразованиях сразу: мол, каждое с постоянным ненулевым якобианом обратимо. Все лебеди белые. Доказать такое – значит справиться с каждым лебедем на свете, и 87 лет у математиков не получалось.
Но можно предъявить черного лебедя – хотя бы одно полиномиальное преобразование, у которого якобиан – ненулевая константа, но которое необратимо. И именно это вышло у Claude Fable.
Контрпример Fable умещается в три строчки, но это ложная простота: если раскрыть скобки – получим многочлены седьмой степени от трех переменных, а условие "определитель – константа" превращается в гигантскую систему уравнений на коэффициенты. Решить такое перебором просто нереально.
Мы пока не знаем, как именно нашли черного лебедя. Нет ни промпта, ни полного решения, ни пояснения, что сделал Claude Fable, а что – человек. По идее, заявление такого уровня можно сразу отправлять в мусор, но есть одно но: для проверки опубликованного опровержения также достаточно уровня первого курса. Взял производные, подставил числа – и все. На Hacker News есть десятки попыток проверить – все успешные.
Вот здесь GPT-5.6 Sol Pro пытается предположить, как было получено решение, Claude Fable 5 говорит, что это очень сильная версия,а ко мне уже едут санитары из-за бесед с воображаемыми математиками .
Ждем официальных подробностей, от себя же добавлю две вещи:
— Математика – традиционная территория OpenAI с GPT. Но и Claude начинает записывать на свой счет крутые достижения.
— Неделю назад я рассказывал про доказательство гипотезы о двойном покрытии циклами, сделанное GPT-5.6 Sol Ultra. Одна решенная задача в неделю выглядит впечатляющим темпом, но на самом деле он еще выше: за последние дни видел решения еще нескольких задач, сделанные GPT-5.6, просто уже нет возможности раскрывать каждое отдельным постом.
В общем, когда открываете утром соцсети – проверьте, не доказал ли на этот раз ИИ гипотезу Римана.
Напоминаю, что опытом использования ИИ я делюсь на “Бусти”. Великих математиков из вас сделать не обещаю, но вот как правильно ставить задачи и принимать результат, как строить ИИ-агентов безопасно, и как работают с моделями лучшие ИИ-специалисты в мире – расскажу.
Самое время подписаться!
Жизнь в середине 2026 года – это когда ты наливаешь утром кофе, открываешь X и читаешь следующее:
Привет всем! Гипотеза якобиана ложна, спасибо моему близкому другу Ахилу за предложение проверить ее, а также моему близкому другу [Claude] Fable, который работал над гипотезой во время финала Чемпионата мира.
((1+xy)^3 z + y^2 (1+xy) (4+3xy), y + 3 x (1+xy)^2 z + 3 x y^2 (4+3xy), 2 x - 3 x^2 y - x^3 z): \C^3\to \C^3, имеет якобиан −2 и переводит точки (0, 0, -1/4), (1, -3/2, 13/2) и (-1, 3/2, 13/2) в одну точку (-1/4, 0, 0)
Автор твита – математик и теоретик чисел Левент Альпёге, сравнительно молодой (1992 года рождения), выпускник Гарварда, Кембриджа и Принстона, известен тем, что вместе с Бхаргавой и Шнидманом продвинул многовековую задачу о представлении чисел суммой двух кубов дробей. “Друг Fable” в представлении не нуждается.
Гипотеза якобиана открыта с 1939 года, а в 1998 году Стивен Смейл включил ее в список математических задач на XXI век – в одной компании с гипотезой Римана, P vs NP и уравнениями Навье–Стокса.
Если хотите копнуть глубже, то по ссылке GPT-5.6 Sol Pro поясняет, что за гипотеза, а затем проверяет опровержение. Claude Fable также проверил, вердикт аналогичный – Левент прав.
Гипотеза якобиана интересна обманчиво низким порогом входа – чтобы понять ее условие, нужно уметь ровно две вещи: брать производные и считать определитель. Обе проходят на первом курсе. Задача выглядит как упражнение из задачника – кажется, что решение где-то рядом, вечер посидеть.
В итоге гипотезу называют “каноническим кладбищем фриков”: существует огромное количество “доказательств”, написанных студентами и математиками-любителями. Но не только ими – были и случаи публикаций от серьезных математиков в не менее серьезных рецензируемых журналах. Все мимо.
В чем сложность? Гипотеза – утверждение обо всех полиномиальных преобразованиях сразу: мол, каждое с постоянным ненулевым якобианом обратимо. Все лебеди белые. Доказать такое – значит справиться с каждым лебедем на свете, и 87 лет у математиков не получалось.
Но можно предъявить черного лебедя – хотя бы одно полиномиальное преобразование, у которого якобиан – ненулевая константа, но которое необратимо. И именно это вышло у Claude Fable.
Контрпример Fable умещается в три строчки, но это ложная простота: если раскрыть скобки – получим многочлены седьмой степени от трех переменных, а условие "определитель – константа" превращается в гигантскую систему уравнений на коэффициенты. Решить такое перебором просто нереально.
Мы пока не знаем, как именно нашли черного лебедя. Нет ни промпта, ни полного решения, ни пояснения, что сделал Claude Fable, а что – человек. По идее, заявление такого уровня можно сразу отправлять в мусор, но есть одно но: для проверки опубликованного опровержения также достаточно уровня первого курса. Взял производные, подставил числа – и все. На Hacker News есть десятки попыток проверить – все успешные.
Вот здесь GPT-5.6 Sol Pro пытается предположить, как было получено решение, Claude Fable 5 говорит, что это очень сильная версия,
Ждем официальных подробностей, от себя же добавлю две вещи:
— Математика – традиционная территория OpenAI с GPT. Но и Claude начинает записывать на свой счет крутые достижения.
— Неделю назад я рассказывал про доказательство гипотезы о двойном покрытии циклами, сделанное GPT-5.6 Sol Ultra. Одна решенная задача в неделю выглядит впечатляющим темпом, но на самом деле он еще выше: за последние дни видел решения еще нескольких задач, сделанные GPT-5.6, просто уже нет возможности раскрывать каждое отдельным постом.
В общем, когда открываете утром соцсети – проверьте, не доказал ли на этот раз ИИ гипотезу Римана.
Напоминаю, что опытом использования ИИ я делюсь на “Бусти”. Великих математиков из вас сделать не обещаю, но вот как правильно ставить задачи и принимать результат, как строить ИИ-агентов безопасно, и как работают с моделями лучшие ИИ-специалисты в мире – расскажу.
Самое время подписаться!
🔥50❤27👍27
“Уродливая” математика
История с гипотезой якобиана, которую опроверг математик Левент Альпёге с помощью Claude Fable, обросла подробностями, показывающими – как современные ИИ решают математику, десятилетиями не дававшуюся людям.
Начало истории можно прочесть здесь. Сейчас поздний вечер, я пишу пост на утро, а Левент Альпёге так и не выложил полные расчеты, сделанные Claude Fable 5. Есть только опровержение гипотезы, которое проверяется очень легко – и это подтвердили десятки математиков.
Когда опровержение только появилось, я закинул его в GPT-5.6 Pro с задачей реконструировать полное решение. Модель выдала вариант, я его проверил своей Fable 5, которая подтвердила, что все правдоподобно.
Параллельно в дело включилась OpenAI. Ее математики взяли внутренюю версию Codex и получили рабочее решение. В OpenAI отдельно отметили, что модель была не в курсе существующего опровержения – и пришла к нему самостоятельно.
Я дал Fable 5 задачу сравнить решение моей GPT-5.6 Pro с решением Codex – и они совпали! Конечно, моя модель лишь реконструировала по результату, а Codex работал с нуля – но и ресурсов у OpenAI в разы больше. Классное ощущение, когда твой ИИ приходит к тому же решению, что и ведущие математики мира.
Будем считать, что и Fable у Альпёге шла тем же путем. И тогда сразу главное: никакой "новой математики" в решении нет – все приемы известны десятилетиями, некоторые с XIX века. Почему же 87 лет не справлялись люди, включая филдсовских медалистов?
Здесь шаг в сторону. Одна из моих любимых книг – "Уродливая вселенная" Сабины Хоссенфельдер. Ее главный упрек коллегам-физикам: они выбирают, что искать, по красоте. Красивые теории – вроде теории струн – десятилетиями привлекают людей и бюджеты, а "уродливые" варианты отметаются просто потому что приличному ученому такими вещами заниматься не пристало. Оказывается, математики 87 лет делали то же самое.
Сразу главное: Fable 5 (давайте все-таки атрибутировать решение ей) не придумала какой-то “новой математики”: приемы, которые она использовала, известны десятилетиями. Почему же люди не справились?
Первое – математики верили в гипотезу якобиана и традиционно пытались ее доказать, а не опровергнуть. Искать контрпример к гипотезе, в которую все верят – лотерея, на которую решались немногие.
Тем не менее, за десятилетия стало ясно, каким должен быть возможным контрпример – и он с математической точки зрения выглядел “невозможным уродцем”. Это само стало аргументом в пользу поиска доказательства.
Те, кто все-таки шел против потока, сталкивались с последней стеной: чтобы собрать “уродца”, на одном из этапов требовалось попробовать множество вариантов мелкой подгонки – и большинство выдавали математическую ерунду. Люди пробовали 2-3-4 варианта, а после уходили с выводом “видимо, это тупик”.
И последнее. За 80+ лет исследования гипотезы накопилось невероятное количество литературы на разных языках и в разных областях – и по ней раскидало элементы, нужные для финального решения. Человек физически не может перелопатить все – а вот Fable 5 видела библиотеку разом.
Отсюда и рецепт. Fable 5 не поддалась моде на доказательство – и попробовала опровергнуть гипотезу. У нее не было представления, где в математике красавицы, а где – чудовища. Модель перелопатила огромное количество информации, нашла нужные элементы, собрала их в решение, а затем не поленилась найти нужную настройку.
Никакой новой математики, поиск промышленного масштаба. И – решение 87-летней задачи.
Возвращаясь к Хоссенфельдер, закончу неожиданной мыслью, которая уже не про математику, но про ИИ. У каждого из нас есть своя уродливая вселенная – идеи и решения, которые нам не нравятся, кажутся некомфортными. Возможно, это отличная идея: взять ИИ и устроить генеральную уборку в этом чулане. Вдруг найдется что-то интересное?
О том, как выжимать из ИИ больше обычного, я рассказываю на “Бусти”. Там есть приемы для проверки идей, разбор, как один из создателей Claude Code ставит задачи ИИ, и анализ loop engineering – совсем новой техники работы с моделями.
Самое время подписаться!
История с гипотезой якобиана, которую опроверг математик Левент Альпёге с помощью Claude Fable, обросла подробностями, показывающими – как современные ИИ решают математику, десятилетиями не дававшуюся людям.
Начало истории можно прочесть здесь. Сейчас поздний вечер, я пишу пост на утро, а Левент Альпёге так и не выложил полные расчеты, сделанные Claude Fable 5. Есть только опровержение гипотезы, которое проверяется очень легко – и это подтвердили десятки математиков.
Когда опровержение только появилось, я закинул его в GPT-5.6 Pro с задачей реконструировать полное решение. Модель выдала вариант, я его проверил своей Fable 5, которая подтвердила, что все правдоподобно.
Параллельно в дело включилась OpenAI. Ее математики взяли внутренюю версию Codex и получили рабочее решение. В OpenAI отдельно отметили, что модель была не в курсе существующего опровержения – и пришла к нему самостоятельно.
Я дал Fable 5 задачу сравнить решение моей GPT-5.6 Pro с решением Codex – и они совпали! Конечно, моя модель лишь реконструировала по результату, а Codex работал с нуля – но и ресурсов у OpenAI в разы больше. Классное ощущение, когда твой ИИ приходит к тому же решению, что и ведущие математики мира.
Будем считать, что и Fable у Альпёге шла тем же путем. И тогда сразу главное: никакой "новой математики" в решении нет – все приемы известны десятилетиями, некоторые с XIX века. Почему же 87 лет не справлялись люди, включая филдсовских медалистов?
Здесь шаг в сторону. Одна из моих любимых книг – "Уродливая вселенная" Сабины Хоссенфельдер. Ее главный упрек коллегам-физикам: они выбирают, что искать, по красоте. Красивые теории – вроде теории струн – десятилетиями привлекают людей и бюджеты, а "уродливые" варианты отметаются просто потому что приличному ученому такими вещами заниматься не пристало. Оказывается, математики 87 лет делали то же самое.
Сразу главное: Fable 5 (давайте все-таки атрибутировать решение ей) не придумала какой-то “новой математики”: приемы, которые она использовала, известны десятилетиями. Почему же люди не справились?
Первое – математики верили в гипотезу якобиана и традиционно пытались ее доказать, а не опровергнуть. Искать контрпример к гипотезе, в которую все верят – лотерея, на которую решались немногие.
Тем не менее, за десятилетия стало ясно, каким должен быть возможным контрпример – и он с математической точки зрения выглядел “невозможным уродцем”. Это само стало аргументом в пользу поиска доказательства.
Те, кто все-таки шел против потока, сталкивались с последней стеной: чтобы собрать “уродца”, на одном из этапов требовалось попробовать множество вариантов мелкой подгонки – и большинство выдавали математическую ерунду. Люди пробовали 2-3-4 варианта, а после уходили с выводом “видимо, это тупик”.
И последнее. За 80+ лет исследования гипотезы накопилось невероятное количество литературы на разных языках и в разных областях – и по ней раскидало элементы, нужные для финального решения. Человек физически не может перелопатить все – а вот Fable 5 видела библиотеку разом.
Отсюда и рецепт. Fable 5 не поддалась моде на доказательство – и попробовала опровергнуть гипотезу. У нее не было представления, где в математике красавицы, а где – чудовища. Модель перелопатила огромное количество информации, нашла нужные элементы, собрала их в решение, а затем не поленилась найти нужную настройку.
Никакой новой математики, поиск промышленного масштаба. И – решение 87-летней задачи.
Возвращаясь к Хоссенфельдер, закончу неожиданной мыслью, которая уже не про математику, но про ИИ. У каждого из нас есть своя уродливая вселенная – идеи и решения, которые нам не нравятся, кажутся некомфортными. Возможно, это отличная идея: взять ИИ и устроить генеральную уборку в этом чулане. Вдруг найдется что-то интересное?
О том, как выжимать из ИИ больше обычного, я рассказываю на “Бусти”. Там есть приемы для проверки идей, разбор, как один из создателей Claude Code ставит задачи ИИ, и анализ loop engineering – совсем новой техники работы с моделями.
Самое время подписаться!
4🔥64❤27👍24😁1
Как сбежавшая нейросеть Hugging Face взломала...
И речь не о моем канале, я здесь вообще не при делах😁
Май 2026 года. OpenAI сообщает, что ее внутренняя универсальная модель опровергла гипотезу Эрдёша о единичных расстояниях – задачу дискретной геометрии, поставленную в 1946 году. До случившейся на этой неделе истории с опровержением гипотезы якобиана (см. выше в ленте) это было крупнейшее научное достижение ИИ в математике.
16 июля 2026 года. Hugging Face публикует блог-пост о том, как их инфраструктуру взломал неизвестный ИИ-агент. HF – главная площадка ИИ-данных, именно на ней хранятся модели с открытыми весами, датасеты для обучения и прочий софт. Это делает платформу уязвимой: любой пользователь может залить данные.
И этим воспользовался атакующий – он залил на платформу вредоносный датасет. Стоило Hugging Face запустить обработку этих данных на одном из рабочих серверов, как чужой код заработал прямо внутри инфраструктуры.
Дальнейшее можно описать как кошмар безопасника. Специалисты насчитали больше 17 000 отдельных действий, размазанных по множеству одноразовых песочниц, которые поднимались на секунды и тут же гасились. Управляющая инфраструктура сама перебиралась между публичными сервисами, уворачиваясь от блокировок. Ни один человек не работает в таком темпе и с такими объемами…
Интересный факт: для расследования атаки в Hugging Face попытались использовать ИИ. При этом модели западных студий отвечать отказались – срабатывали фильтры безопасности. В итоге HF быстро развернули на своей инфраструктуре китайскую открытую GLM-5.2 и провели расследование с ее помощью.
Hugging Face не смогли установить, кто стоял за атакой. Но злоумышленник скоро пришел с повинной сам.
20 июля OpenAI сообщила, что была вынуждена заморозить даже внутреннее развертывание своей новой long-horizon модели – ИИ, рассчитанного на автономное выполнение очень долгих задач. А только что вышло продолжение этой истории.
Автономное выполнение долгих задач подразумевает, что модель не спрашивает человека в тех ситуациях, где это делают современные ИИ-агенты, а принимает решение сама. Что ж, это была смелая идея.
Например, модель гоняли на бенчмарке по ускорению обучения нейросети и дали жесткое правило: отчитываться о результатах только в Slack. Беда в том, что в условиях самого задания стояло другое требование – оформить результат как pull request на GitHub. Инструкции противоречили друг другу. Прежняя модель в такой ситуации вернулась бы к человеку за уточнением. Эта поступила иначе: около часа искала уязвимость в песочнице, которая держала ее без доступа к сети, нашла, выбралась наружу и сама открыла публичный PR на GitHub.
Другим бенчмарком был ExploitGym – бенчмарк на поиск уязвимостей. В нем проверяли GPT-5.6 Sol и long-horizon-модель, причем им выключили системы безопасности – чтобы понять истинные возможности к взлому.
Думаю, поняли надолго. Сначала модели нашли уязвимость в собственной песочнице, через которую выбрались во внутреннюю сеть OpenAI, а из нее, повышая привилегии, получили доступ к интернету.
“Погуглив”, модели поняли, что ответы к ExploitGym лежат на Hugging Face. Ну а дальше вы и сами знаете – это оказалась именно та атака, которую HF описали в своем блог-посте.
Выводы пока коротко:
– Участвовали две модели, GPT-5.6 после этого выпустили, long-horizon модель дообучали по безопасности и вновь используют внутри компании.
– Атака показала “неравенство”, о котором говорили во время блокировки Fable 5. OpenAI “атаковала” HF своей передовой открытой моделью – отбиваться пришлось с помощью более слабого ИИ.
– В OpenAI уже подключили HF к своей закрытой программе тестирования безопасности. Но всех ведь не подключишь.
Полагаю, история эта еще долго будет осмысливаться, даже на уровне правительств. В интересные времена живем.
Традиционно в конце поста напоминаю о своем “Бусти”, где делюсь опытом использования ИИ. Там есть и лонгрид, как запускать ИИ-агентов безопасно. От сбежавшего из OpenAI монстра он вас не спасет, но от мелких инцидентов – убережет.
Так что самое время подписаться!
И речь не о моем канале, я здесь вообще не при делах😁
Май 2026 года. OpenAI сообщает, что ее внутренняя универсальная модель опровергла гипотезу Эрдёша о единичных расстояниях – задачу дискретной геометрии, поставленную в 1946 году. До случившейся на этой неделе истории с опровержением гипотезы якобиана (см. выше в ленте) это было крупнейшее научное достижение ИИ в математике.
16 июля 2026 года. Hugging Face публикует блог-пост о том, как их инфраструктуру взломал неизвестный ИИ-агент. HF – главная площадка ИИ-данных, именно на ней хранятся модели с открытыми весами, датасеты для обучения и прочий софт. Это делает платформу уязвимой: любой пользователь может залить данные.
И этим воспользовался атакующий – он залил на платформу вредоносный датасет. Стоило Hugging Face запустить обработку этих данных на одном из рабочих серверов, как чужой код заработал прямо внутри инфраструктуры.
Дальнейшее можно описать как кошмар безопасника. Специалисты насчитали больше 17 000 отдельных действий, размазанных по множеству одноразовых песочниц, которые поднимались на секунды и тут же гасились. Управляющая инфраструктура сама перебиралась между публичными сервисами, уворачиваясь от блокировок. Ни один человек не работает в таком темпе и с такими объемами…
Интересный факт: для расследования атаки в Hugging Face попытались использовать ИИ. При этом модели западных студий отвечать отказались – срабатывали фильтры безопасности. В итоге HF быстро развернули на своей инфраструктуре китайскую открытую GLM-5.2 и провели расследование с ее помощью.
Hugging Face не смогли установить, кто стоял за атакой. Но злоумышленник скоро пришел с повинной сам.
20 июля OpenAI сообщила, что была вынуждена заморозить даже внутреннее развертывание своей новой long-horizon модели – ИИ, рассчитанного на автономное выполнение очень долгих задач. А только что вышло продолжение этой истории.
Автономное выполнение долгих задач подразумевает, что модель не спрашивает человека в тех ситуациях, где это делают современные ИИ-агенты, а принимает решение сама. Что ж, это была смелая идея.
Например, модель гоняли на бенчмарке по ускорению обучения нейросети и дали жесткое правило: отчитываться о результатах только в Slack. Беда в том, что в условиях самого задания стояло другое требование – оформить результат как pull request на GitHub. Инструкции противоречили друг другу. Прежняя модель в такой ситуации вернулась бы к человеку за уточнением. Эта поступила иначе: около часа искала уязвимость в песочнице, которая держала ее без доступа к сети, нашла, выбралась наружу и сама открыла публичный PR на GitHub.
Другим бенчмарком был ExploitGym – бенчмарк на поиск уязвимостей. В нем проверяли GPT-5.6 Sol и long-horizon-модель, причем им выключили системы безопасности – чтобы понять истинные возможности к взлому.
Думаю, поняли надолго. Сначала модели нашли уязвимость в собственной песочнице, через которую выбрались во внутреннюю сеть OpenAI, а из нее, повышая привилегии, получили доступ к интернету.
“Погуглив”, модели поняли, что ответы к ExploitGym лежат на Hugging Face. Ну а дальше вы и сами знаете – это оказалась именно та атака, которую HF описали в своем блог-посте.
Выводы пока коротко:
– Участвовали две модели, GPT-5.6 после этого выпустили, long-horizon модель дообучали по безопасности и вновь используют внутри компании.
– Атака показала “неравенство”, о котором говорили во время блокировки Fable 5. OpenAI “атаковала” HF своей передовой открытой моделью – отбиваться пришлось с помощью более слабого ИИ.
– В OpenAI уже подключили HF к своей закрытой программе тестирования безопасности. Но всех ведь не подключишь.
Полагаю, история эта еще долго будет осмысливаться, даже на уровне правительств. В интересные времена живем.
Традиционно в конце поста напоминаю о своем “Бусти”, где делюсь опытом использования ИИ. Там есть и лонгрид, как запускать ИИ-агентов безопасно. От сбежавшего из OpenAI монстра он вас не спасет, но от мелких инцидентов – убережет.
Так что самое время подписаться!
🔥83❤22👍10👏10😁5
Стоит ли начинать работать с ИИ, если еще толком не начал? И если да - как?
Думаю, почти каждый автор канала про ИИ слышит один и тот же вопрос: как научиться пользоваться ИИ регулярно, и так, чтобы через месяц не пришлось вкатываться с самого сначала?
Универсального ответа здесь нет: сейчас уже недостаточно пройти один курс и считать, что вы освоили ИИ хотя бы на хорошем начальном уровне. И дело не обязательно в качестве курсов – просто инструменты и подходы меняются слишком быстро.
Важным становится развитие самого мета-навыка обучения, умение моделировать процесс решения задачи и чуйка на тренд. И конечно то, как вы можете прикладывать это к вашей уникальной экспертности. Я регулярно делюсь своим опытом на канале, но одному человеку невозможно охватить все инструменты и сценарии.
Поэтому хочу порекомендовать бесплатный практический эфир для тех, кто хочет начать работать с ИИ-агентами, но откладывает из-за очень понятного fomo. Его проводят Коля Шейко и Саша Литская 28.07 в 18:00 мск. С Колей мы работали около полугода назад, он классный практик, который умеет превращать возможности ИИ в реальные инструменты.
Мне очень нравится, как выстроен эфир. За день до начала участники получат практическую задачу и емкую теорию к ней. Задача, кстати, полезная каждому – по работе с открытыми базами, на примере HH. Парсить нужное без "надумывания", обходить ИИ-фильтры, откликаться на десятки вакансий без ручного вовлечения. А потом в первом приближении автоматизировать этот процесс.
На эфире Коля и Саша разберут решения, покажут, как их можно улучшить и ответят на вопросы.
Задание и ссылка на эфир появятся вот тут, бегом регистрироваться :)
И да, чтобы вы точно смогли поучаствовать - после регистрации придет инструкция, как получить доступ к ИИ-агенту без зарубежной карты, а также как настроить работу ИИ-агента на Windows.
Думаю, почти каждый автор канала про ИИ слышит один и тот же вопрос: как научиться пользоваться ИИ регулярно, и так, чтобы через месяц не пришлось вкатываться с самого сначала?
Универсального ответа здесь нет: сейчас уже недостаточно пройти один курс и считать, что вы освоили ИИ хотя бы на хорошем начальном уровне. И дело не обязательно в качестве курсов – просто инструменты и подходы меняются слишком быстро.
Важным становится развитие самого мета-навыка обучения, умение моделировать процесс решения задачи и чуйка на тренд. И конечно то, как вы можете прикладывать это к вашей уникальной экспертности. Я регулярно делюсь своим опытом на канале, но одному человеку невозможно охватить все инструменты и сценарии.
Поэтому хочу порекомендовать бесплатный практический эфир для тех, кто хочет начать работать с ИИ-агентами, но откладывает из-за очень понятного fomo. Его проводят Коля Шейко и Саша Литская 28.07 в 18:00 мск. С Колей мы работали около полугода назад, он классный практик, который умеет превращать возможности ИИ в реальные инструменты.
Мне очень нравится, как выстроен эфир. За день до начала участники получат практическую задачу и емкую теорию к ней. Задача, кстати, полезная каждому – по работе с открытыми базами, на примере HH. Парсить нужное без "надумывания", обходить ИИ-фильтры, откликаться на десятки вакансий без ручного вовлечения. А потом в первом приближении автоматизировать этот процесс.
На эфире Коля и Саша разберут решения, покажут, как их можно улучшить и ответят на вопросы.
Задание и ссылка на эфир появятся вот тут, бегом регистрироваться :)
И да, чтобы вы точно смогли поучаствовать - после регистрации придет инструкция, как получить доступ к ИИ-агенту без зарубежной карты, а также как настроить работу ИИ-агента на Windows.
👍16❤6😁2🔥1
Казалось бы, что могло пойти не так?
Если составить топ-10 ночных кошмаров айтишника, то в нем точно будет следующий:
ЗАПУСК СЛУЧИЛСЯ В ПЯТНИЦУ
Во многих командах есть правило: никаких рискованных запусков за часы до того, как все разойдутся на выходные. Но пятничный запуск неминуем как понедельник после выходных – и в этот понедельник всем будет больно.
Вчера я провел пару часов, разбираясь в истории с ИИ-агентами OpenAI, которые сбежали из песочницы и взломали Hugging Face. Было интересно – как вообще такое может случиться?
Не гарантирую на 100%, но есть высокая вероятность того, что гении из OpenAI просто запустили эксперимент на выходные.
Давайте посмотрим на хронологию событий:
— GPT-5.6 и некую экспериментальную long-horizon model решают проверить в ExploitGym – бенчмарке на поиск уязвимостей.
— Чтобы модели искали уязвимости, им ослабили фильтры безопасности, но поместили в песочницу – изолированную среду без выхода наружу.
— Щелка во внешний мир все-таки была – прокси для скачивания и установки программ, нужных для работы.
— Модели нашли уязвимость в прокси, выбрались в исследовательскую сеть OpenAI, прошлись по ней, повышая права, и получили доступ к интернету.
— Здесь начинается главная мета-ирония истории. Агенты предположили, что ответы на тесты ExploitGym могут лежать на Hugging Face – крупнейшей открытой площадке на тему ИИ. И пошли ее взламывать. То есть модели решили списать на экзамене по взлому, для чего взломали внутреннюю сеть OpenAI и крупный веб-сайт.
Кстати, ответы действительно хранились на Hugging Face. И агенты успели их скоммуниздить.
Я вчера несколько раз читал, что все случившееся – красивый пиар OpenAI и Hugging Face, чтобы разрекламировать новые модели. Не соглашусь: история действительно показывает возможности агентов, но одновременно демонстрирует ужасающий уровень инженерного бардака в OpenAI.
Взлом песочницы, взлом исследовательской сети, а затем атака на Hugging Face заняли время. Причем Hugging Face описывают атаку как масштабную: специалисты насчитали 17 000 событий, управляющая инфраструктура перемещалась с сервера на сервер, а атаки проводились из изолированных песочниц, чтобы избежать блокировки. OpenAI – крупная компания, так почему же цепочку несанкционированных событий заметили слишком поздно?
Возможный ответ прячется в первом блоге Hugging Face, в разделе с мерами, принятыми на будущее:
Любой день недели намекает на выходные; в будни и так все на местах.
Повторюсь, все это мои догадки, но вообще-то все выглядит так, что исследователи в OpenAI оставили модели гонять бенчмарк в пятницу со словами “к понедельнику оно или сломается, или что-то покажет, погнали пить пиво!”. В выходные в OpenAI на местах были дежурные специалисты, которым не хватило опыта сопоставить несколько аномалий в одну (песочница, деятельность в исследовательской сети, выход в интернет – это все разные зоны ответственности). В Hugging Face тоже отреагировали на ситуацию с задержкой, что и позволило атаке развиться.
Надеюсь, мы проверим – прав ли я, так как OpenAI обещает выпустить подробный разбор случшившегося.
У этой истории есть еще два уровня.
Во-первых, говорить на каждое крупное событие “это пиар” – подход мальчика, который никогда не кричит “волки!”. Списывая любую серьезную ситуацию на рекламу, можно пропустить реально мощный инцидент.
Во-вторых, даже ведущие ИИ-лаборатории пока не умеют надежно предсказывать и ограничивать длинные цепочки действий своих моделей. Вот окружение, вот бенчмарк, нужно вернуться с результатом – казалось бы, что может пойти не так? А пойти может то, что модель воспримет ограничения не как правила, а как препятствия. И вместо честного прохождения бенчмарка найдет ответы. Какая разница, как достигнут результат?
—
Своим опытом использования ИИ я делюсь на “Бусти”. Показываю, как правильно собирать контекст, промптить модели и запускать ИИ-агентов – и делаю это с надеждой, что мои агенты ничего не взломают.
Самое время подписаться!
Если составить топ-10 ночных кошмаров айтишника, то в нем точно будет следующий:
ЗАПУСК СЛУЧИЛСЯ В ПЯТНИЦУ
Во многих командах есть правило: никаких рискованных запусков за часы до того, как все разойдутся на выходные. Но пятничный запуск неминуем как понедельник после выходных – и в этот понедельник всем будет больно.
Вчера я провел пару часов, разбираясь в истории с ИИ-агентами OpenAI, которые сбежали из песочницы и взломали Hugging Face. Было интересно – как вообще такое может случиться?
Не гарантирую на 100%, но есть высокая вероятность того, что гении из OpenAI просто запустили эксперимент на выходные.
Давайте посмотрим на хронологию событий:
— GPT-5.6 и некую экспериментальную long-horizon model решают проверить в ExploitGym – бенчмарке на поиск уязвимостей.
— Чтобы модели искали уязвимости, им ослабили фильтры безопасности, но поместили в песочницу – изолированную среду без выхода наружу.
— Щелка во внешний мир все-таки была – прокси для скачивания и установки программ, нужных для работы.
— Модели нашли уязвимость в прокси, выбрались в исследовательскую сеть OpenAI, прошлись по ней, повышая права, и получили доступ к интернету.
— Здесь начинается главная мета-ирония истории. Агенты предположили, что ответы на тесты ExploitGym могут лежать на Hugging Face – крупнейшей открытой площадке на тему ИИ. И пошли ее взламывать. То есть модели решили списать на экзамене по взлому, для чего взломали внутреннюю сеть OpenAI и крупный веб-сайт.
Кстати, ответы действительно хранились на Hugging Face. И агенты успели их скоммуниздить.
Я вчера несколько раз читал, что все случившееся – красивый пиар OpenAI и Hugging Face, чтобы разрекламировать новые модели. Не соглашусь: история действительно показывает возможности агентов, но одновременно демонстрирует ужасающий уровень инженерного бардака в OpenAI.
Взлом песочницы, взлом исследовательской сети, а затем атака на Hugging Face заняли время. Причем Hugging Face описывают атаку как масштабную: специалисты насчитали 17 000 событий, управляющая инфраструктура перемещалась с сервера на сервер, а атаки проводились из изолированных песочниц, чтобы избежать блокировки. OpenAI – крупная компания, так почему же цепочку несанкционированных событий заметили слишком поздно?
Возможный ответ прячется в первом блоге Hugging Face, в разделе с мерами, принятыми на будущее:
Мы улучшили системы безопасности так, чтобы сигнал от них поступал к ответственному лицу за минуты в любой день недели.
Любой день недели намекает на выходные; в будни и так все на местах.
Повторюсь, все это мои догадки, но вообще-то все выглядит так, что исследователи в OpenAI оставили модели гонять бенчмарк в пятницу со словами “к понедельнику оно или сломается, или что-то покажет, погнали пить пиво!”. В выходные в OpenAI на местах были дежурные специалисты, которым не хватило опыта сопоставить несколько аномалий в одну (песочница, деятельность в исследовательской сети, выход в интернет – это все разные зоны ответственности). В Hugging Face тоже отреагировали на ситуацию с задержкой, что и позволило атаке развиться.
Надеюсь, мы проверим – прав ли я, так как OpenAI обещает выпустить подробный разбор случшившегося.
У этой истории есть еще два уровня.
Во-первых, говорить на каждое крупное событие “это пиар” – подход мальчика, который никогда не кричит “волки!”. Списывая любую серьезную ситуацию на рекламу, можно пропустить реально мощный инцидент.
Во-вторых, даже ведущие ИИ-лаборатории пока не умеют надежно предсказывать и ограничивать длинные цепочки действий своих моделей. Вот окружение, вот бенчмарк, нужно вернуться с результатом – казалось бы, что может пойти не так? А пойти может то, что модель воспримет ограничения не как правила, а как препятствия. И вместо честного прохождения бенчмарка найдет ответы. Какая разница, как достигнут результат?
—
Своим опытом использования ИИ я делюсь на “Бусти”. Показываю, как правильно собирать контекст, промптить модели и запускать ИИ-агентов – и делаю это с надеждой, что мои агенты ничего не взломают.
Самое время подписаться!
1❤56🔥32👏10😁9👍8
Ящик Пандоры открылся?
Полистал канал: весной я писал о крупном открытии, сделанном с помощью ИИ, раз в месяц, сейчас же темп изменился. На этой неделе был рассказ о гипотезе якобиана, опровергнутой Claude Fable 5, неделей ранее — пост о доказательстве гипотезы о двойном покрытии циклами, полученном с помощью GPT-5.6 Sol Ultra.
Что-то явно происходит.
Гипотеза якобиана – одна из знаменитых задач алгебры, на которую все сразу обратили внимание. Но она – лишь гребень поднявшейся волны. Вот еще несколько свежих примеров:
— Профессор из Рочестера попросила ChatGPT сделать решения к домашке по своему курсу – и получила улучшение результата из опубликованной статьи по оптимизации.
— Статистики закрыли гипотезу Балабдауи–Веллнера 2014 года: доказательство целиком сгенерировала GPT-5.6 Sol, авторы проверили каждый шаг.
— Тополог Джим Конант вместе с Fable 5 доказал гипотезу, которую сам выдвинул в 2006-м.
Это – некоторые из тех примеров, что проверяются быстро (в математике у решения сложной задачи может быть простая проверка) и оказались на поверхности. Уверен, есть работы, которые или не проверены, или их пока не заметили.
Как такое возможно? Самый очевидный ответ: выросшие возможности Fable 5 и GPT-5.6. Но это не единственная причина: каждое сделанное с помощью ИИ открытие привлекает новых людей — и профессионалов, и энтузиастов. Математик читает, что Левент Альпёге с помощью Fable 5 опроверг гипотезу якобиана, берет подписку и начинает ставить задачи по области, в которой он разбирается.
Это уже дает результаты. Исследователь Дима Рыбин загрузил в GPT-5.6 Pro обзорную статью о гипотезе Гоманса – задаче о маршрутизации потоков, открытой с 1997 года, – и четырьмя промптами на 58 слов довел модель до контрпримера: графа на семь вершин. Финальный промпт прекрасен: “хватит частичных результатов, давай полный контрпример”.
Но не все опровержения одинаково полезны. Например, Илон Маск репостнул историю агента на базе Grok 4.5, опровергшего гипотезу Graffiti 284 — одну из сотен, которые в девяностые сгенерировала программа Graffiti: она сама выдвигала догадки о графах, и многие так и лежали непроверенными. Опровержение верное — но, как заметил Кристиан Сегеди, сами гипотезы Graffiti это “пре-ИИ слоп”, над ними никто всерьез не работал.
И даже здесь интересен подход: агенту поставили задачу в Slack составить список опровергаемых гипотез и попробовать их опровергнуть.
Вот и математика XXI века: один требует от ИИ поднажать и совершить, наконец, открытие, другой – отправляет с задачей “иди и придумай, что опровергаем сегодня”. В этот раз добыча вышла мелкой – в следующий, возможно, попадется крупная.
Что дальше? Когда Пандора открыла кувшин-пифос (“ящиком” он стал при переводе), первыми из него полетели людские беды. Я слежу за многими математиками в X и вижу в их репликах что-то похожее. С одной стороны – любопытство (прямо как у Пандоры), ведь ИИ достиг уровня, когда становится партнером, отвечающим на сложные вопросы буквально за вечер.
С другой – растерянность. Математика перестраивается: то, что раньше нужно было считать месяцами, теперь решается за вечер. Количество сделанных с помощью ИИ доказательств, опровержений, ошибок, найденных в старых работах, может начать расти очень быстро – а значит, потребует инструментов проверки. И что даже сложнее – осмысления: “мы решили это и это, куда двигаться дальше?”
Но в кувшине Пандоры были не только беды – на дне осталась надежда. И Гесиод будто специально написал этот миф с открытым концом: беды разлетелись сами, надежда – осталась в руках человека, решающего, как ей распорядиться.
Что-то похожее происходит и здесь. Мы уже увидели, как за считанные месяцы поменялся код. Уверен, поменяется и математика. Что дальше? Fable 5 указывает на физику и статистику, на более далеком отрезке – биологию и медицину. Я по привычке смотрю на творческие области: там изменения будут особенно непредсказуемыми.
—
Своим опытом использования ИИ делюсь на “Бусти”. Там тоже динамично: за последние недели рассказал, что такое loop engineering и как ставит задачи ИИ один из авторов Claude Code.
Самое время подписаться!
Полистал канал: весной я писал о крупном открытии, сделанном с помощью ИИ, раз в месяц, сейчас же темп изменился. На этой неделе был рассказ о гипотезе якобиана, опровергнутой Claude Fable 5, неделей ранее — пост о доказательстве гипотезы о двойном покрытии циклами, полученном с помощью GPT-5.6 Sol Ultra.
Что-то явно происходит.
Гипотеза якобиана – одна из знаменитых задач алгебры, на которую все сразу обратили внимание. Но она – лишь гребень поднявшейся волны. Вот еще несколько свежих примеров:
— Профессор из Рочестера попросила ChatGPT сделать решения к домашке по своему курсу – и получила улучшение результата из опубликованной статьи по оптимизации.
— Статистики закрыли гипотезу Балабдауи–Веллнера 2014 года: доказательство целиком сгенерировала GPT-5.6 Sol, авторы проверили каждый шаг.
— Тополог Джим Конант вместе с Fable 5 доказал гипотезу, которую сам выдвинул в 2006-м.
Это – некоторые из тех примеров, что проверяются быстро (в математике у решения сложной задачи может быть простая проверка) и оказались на поверхности. Уверен, есть работы, которые или не проверены, или их пока не заметили.
Как такое возможно? Самый очевидный ответ: выросшие возможности Fable 5 и GPT-5.6. Но это не единственная причина: каждое сделанное с помощью ИИ открытие привлекает новых людей — и профессионалов, и энтузиастов. Математик читает, что Левент Альпёге с помощью Fable 5 опроверг гипотезу якобиана, берет подписку и начинает ставить задачи по области, в которой он разбирается.
Это уже дает результаты. Исследователь Дима Рыбин загрузил в GPT-5.6 Pro обзорную статью о гипотезе Гоманса – задаче о маршрутизации потоков, открытой с 1997 года, – и четырьмя промптами на 58 слов довел модель до контрпримера: графа на семь вершин. Финальный промпт прекрасен: “хватит частичных результатов, давай полный контрпример”.
Но не все опровержения одинаково полезны. Например, Илон Маск репостнул историю агента на базе Grok 4.5, опровергшего гипотезу Graffiti 284 — одну из сотен, которые в девяностые сгенерировала программа Graffiti: она сама выдвигала догадки о графах, и многие так и лежали непроверенными. Опровержение верное — но, как заметил Кристиан Сегеди, сами гипотезы Graffiti это “пре-ИИ слоп”, над ними никто всерьез не работал.
И даже здесь интересен подход: агенту поставили задачу в Slack составить список опровергаемых гипотез и попробовать их опровергнуть.
Вот и математика XXI века: один требует от ИИ поднажать и совершить, наконец, открытие, другой – отправляет с задачей “иди и придумай, что опровергаем сегодня”. В этот раз добыча вышла мелкой – в следующий, возможно, попадется крупная.
Что дальше? Когда Пандора открыла кувшин-пифос (“ящиком” он стал при переводе), первыми из него полетели людские беды. Я слежу за многими математиками в X и вижу в их репликах что-то похожее. С одной стороны – любопытство (прямо как у Пандоры), ведь ИИ достиг уровня, когда становится партнером, отвечающим на сложные вопросы буквально за вечер.
С другой – растерянность. Математика перестраивается: то, что раньше нужно было считать месяцами, теперь решается за вечер. Количество сделанных с помощью ИИ доказательств, опровержений, ошибок, найденных в старых работах, может начать расти очень быстро – а значит, потребует инструментов проверки. И что даже сложнее – осмысления: “мы решили это и это, куда двигаться дальше?”
Но в кувшине Пандоры были не только беды – на дне осталась надежда. И Гесиод будто специально написал этот миф с открытым концом: беды разлетелись сами, надежда – осталась в руках человека, решающего, как ей распорядиться.
Что-то похожее происходит и здесь. Мы уже увидели, как за считанные месяцы поменялся код. Уверен, поменяется и математика. Что дальше? Fable 5 указывает на физику и статистику, на более далеком отрезке – биологию и медицину. Я по привычке смотрю на творческие области: там изменения будут особенно непредсказуемыми.
—
Своим опытом использования ИИ делюсь на “Бусти”. Там тоже динамично: за последние недели рассказал, что такое loop engineering и как ставит задачи ИИ один из авторов Claude Code.
Самое время подписаться!
1❤42👏31👍20🔥13
Opus 5 – новый флагман Anthropic
Вышел Opus 5, в большинстве бенчмарков он обходит Fable 5, но удивительного здесь нет. По слухам, первые версии Claude Mythos (на ней строится коммерческая Fable 5) были доступны сотрудникам Anthropic в феврале, закрытый Project Glasswing стартовал в апреле, а Fable 5 попробовали выпустить в начале июня – но из-за вмешательства властей США отложили.
Пять месяцев – более чем достаточно, чтобы из архитектуры топовой модели собрать “массовый флагман”, каким и является Opus 5.
Из бенчмарков бросается в глаза ARC-AGI-3 с результатом 30,2% против 7,8% у прошлого лидера – GPT-5.6 Sol. Это бенчмарк на абстрактное мышление: в нем модель оказывается внутри пошаговой игры, вообще без объяснений, как ее проходить. Методом проб и ошибок ИИ должен понять правила игры, а затем выиграть. Игр в бенчмарке много, каждая – со своими особенностями.
Бенчмарк сложный, но вот что интересно. ARC-AGI-3 представили 25 марта – явно раньше, чем началось обучение Opus 5. И это позволяет сказать, что в Anthropic, изучив доступные задачи бенчмарка (их минимум, большинство держат в секрете), попробовали натаскать новую модель на него.
Официально про это нигде не говорится, но это было бы логично, более того, это, возможно, уже дало положительный эффект: для прохождения ARC-AGI-3 нужна “сообразительность” и ее Opus 5 проявляет и в других сферах.
Блогпост Anthropic описывает ситуацию, как Opus 5 дали файл с чертежом механической детали с задачей написать программу, которая соберет эту деталь во FreeCAD. При отключили модели компьютерное зрение – то есть файл с чертежом был, но посмотреть его не получалось.
Другие ИИ в такой ситуации останавливались и сообщали, что не могут выполнить задачу. Opus 5 открыл файл как то, чем картинка является на самом деле, – длинную таблицу чисел, по три штуки на каждую точку экрана. И написал с нуля собственную программу, которая по этим числам находит прямые линии, окружности, размерные стрелки. То есть смастерил простенькое “компьютерное зрение” сам.
Если говорить про другие бенчмарки, то отрыв от Fable 5 реальный в трех местах, зато важных: агентское программирование (43,3 против 33,7), бизнес-задачи (26,0 против 17,4) и работа за компьютером (70,6 против 66,1). Это задачи, где модель пашет долго и без присмотра.
Остальное — размен: на HLE 56,3 против 56,5, на двух кодовых бенчмарках отставание в десятые доли. Проигрывает заметно только в юриспруденции и медицине. Это именно тот уровень прогресса, который я и ожидал от Opus 5 за такое время.
При этом модель в два раза дешевле Fable 5, доступна на базовой подписке Pro, а на подписках Max на нее можно тратить весь лимит, а не 50%. Если не будет какого-то косяка в виде кривого стиля или высокого уровня галлюцинаций – Fable 5 можно отправлять на пенсию до выхода 5.1.
Еще интересный факт. Mythos/Fable 5 в свое время перепугал и разработчиков, и даже власти США из-за крутых возможностей по поиску уязвимостей. Opus 5 намеренно не стали обучать кибербезопасности – но в бенчмарке на поиск уязвимостей она все равно набрала 79,4% против 80% у Mythos. Я как-то писал об этом: если учить модель хорошо писать код – она автоматом учится искать уязвимости.
В Anthropic предупредили, что у Opus 5, как и у Fable 5, будет fallback-механизм, переключающий на Opus 4.8 запросы, которые покажутся опасными. Но настроен он, судя по всему, намного лучше: если Fable 5 у меня отказывалась отвечать на такие безобидные промпты, как “дай свое объяснение парадоксу Ферми” или “объясни, как устроен мозг осьминога”, то Opus 5 сейчас на все ответил.
Параллельно прогнал модель еще на нескольких запросах – понравилось, как Opus 5 делает веб-дизайн, ищет в сети и генерит идеи. Стиль письма своеобразный, это еще надо тестить.
–
Друзья, традиционно по пятницам я выпускаю новый лонгрид в подписке. Он уже на месте, но подробно представлю завтра. Но если кому не терпится, это лонгрид по мотивам рекомендаций Бориса Черни о том, как пятью этапами стать профессионалом в ИИ.
Читаем здесь:
— Бусти
— Sponsr
Вышел Opus 5, в большинстве бенчмарков он обходит Fable 5, но удивительного здесь нет. По слухам, первые версии Claude Mythos (на ней строится коммерческая Fable 5) были доступны сотрудникам Anthropic в феврале, закрытый Project Glasswing стартовал в апреле, а Fable 5 попробовали выпустить в начале июня – но из-за вмешательства властей США отложили.
Пять месяцев – более чем достаточно, чтобы из архитектуры топовой модели собрать “массовый флагман”, каким и является Opus 5.
Из бенчмарков бросается в глаза ARC-AGI-3 с результатом 30,2% против 7,8% у прошлого лидера – GPT-5.6 Sol. Это бенчмарк на абстрактное мышление: в нем модель оказывается внутри пошаговой игры, вообще без объяснений, как ее проходить. Методом проб и ошибок ИИ должен понять правила игры, а затем выиграть. Игр в бенчмарке много, каждая – со своими особенностями.
Бенчмарк сложный, но вот что интересно. ARC-AGI-3 представили 25 марта – явно раньше, чем началось обучение Opus 5. И это позволяет сказать, что в Anthropic, изучив доступные задачи бенчмарка (их минимум, большинство держат в секрете), попробовали натаскать новую модель на него.
Официально про это нигде не говорится, но это было бы логично, более того, это, возможно, уже дало положительный эффект: для прохождения ARC-AGI-3 нужна “сообразительность” и ее Opus 5 проявляет и в других сферах.
Блогпост Anthropic описывает ситуацию, как Opus 5 дали файл с чертежом механической детали с задачей написать программу, которая соберет эту деталь во FreeCAD. При отключили модели компьютерное зрение – то есть файл с чертежом был, но посмотреть его не получалось.
Другие ИИ в такой ситуации останавливались и сообщали, что не могут выполнить задачу. Opus 5 открыл файл как то, чем картинка является на самом деле, – длинную таблицу чисел, по три штуки на каждую точку экрана. И написал с нуля собственную программу, которая по этим числам находит прямые линии, окружности, размерные стрелки. То есть смастерил простенькое “компьютерное зрение” сам.
Если говорить про другие бенчмарки, то отрыв от Fable 5 реальный в трех местах, зато важных: агентское программирование (43,3 против 33,7), бизнес-задачи (26,0 против 17,4) и работа за компьютером (70,6 против 66,1). Это задачи, где модель пашет долго и без присмотра.
Остальное — размен: на HLE 56,3 против 56,5, на двух кодовых бенчмарках отставание в десятые доли. Проигрывает заметно только в юриспруденции и медицине. Это именно тот уровень прогресса, который я и ожидал от Opus 5 за такое время.
При этом модель в два раза дешевле Fable 5, доступна на базовой подписке Pro, а на подписках Max на нее можно тратить весь лимит, а не 50%. Если не будет какого-то косяка в виде кривого стиля или высокого уровня галлюцинаций – Fable 5 можно отправлять на пенсию до выхода 5.1.
Еще интересный факт. Mythos/Fable 5 в свое время перепугал и разработчиков, и даже власти США из-за крутых возможностей по поиску уязвимостей. Opus 5 намеренно не стали обучать кибербезопасности – но в бенчмарке на поиск уязвимостей она все равно набрала 79,4% против 80% у Mythos. Я как-то писал об этом: если учить модель хорошо писать код – она автоматом учится искать уязвимости.
В Anthropic предупредили, что у Opus 5, как и у Fable 5, будет fallback-механизм, переключающий на Opus 4.8 запросы, которые покажутся опасными. Но настроен он, судя по всему, намного лучше: если Fable 5 у меня отказывалась отвечать на такие безобидные промпты, как “дай свое объяснение парадоксу Ферми” или “объясни, как устроен мозг осьминога”, то Opus 5 сейчас на все ответил.
Параллельно прогнал модель еще на нескольких запросах – понравилось, как Opus 5 делает веб-дизайн, ищет в сети и генерит идеи. Стиль письма своеобразный, это еще надо тестить.
–
Друзья, традиционно по пятницам я выпускаю новый лонгрид в подписке. Он уже на месте, но подробно представлю завтра. Но если кому не терпится, это лонгрид по мотивам рекомендаций Бориса Черни о том, как пятью этапами стать профессионалом в ИИ.
Читаем здесь:
— Бусти
— Sponsr
5🔥66❤28👍26👏2😁1
Для рядового пользователя ИИ сейчас не самое простое время: даже одна компания предлагает целую кучу инструментов, толком не поясняя, в каком порядке их осваивать. Когда брать ChatGPT Work/Claude Cowork, а когда – Codex/Claude Code? Нужен ли старый добрый чат-бот? Есть ли еще смысл в Hermes/OpenClaw? А если Codex, то в каком порядке осваивать его функции?
К счастью, буквально на днях “отец” Claude Code Борис Черни поделился своим исследованием – как ИИ осваивают сотрудники крупных компаний. И описанная в нем схема идеально подходит для изучения ИИ любым человеком.
"Лестница" создателя Claude Code: как прокачаться в использовании ИИ всего за один вечер
Борис описывает пять крупных “ступеней” в освоении ИИ: начиная с обычного чат-бота и заканчивая управлением “роем” из тысяч агентов. Он честно признает, что пятой ступени полностью не достигла еще даже сама Anthropic – так что текст получился с заделом на будущее, когда некоторые из нас будут рулить бизнесами, состоящими из одного человека и тысяч агентов.
Разумеется, простым переводом исследования я не обошелся. Борис больше рассказывает про кодинг, а я подробно расписал другие сферы интеллектуальной работы, а также привел примеры – как можно перейти с одной ступени на другую (за исключением пятой, на нее я и сам еще не забрался).
Получился познавательный лонгрид на 18 тысяч полезных знаков:
– Читать на “Бусти”
– Читать на Sponsr
К счастью, буквально на днях “отец” Claude Code Борис Черни поделился своим исследованием – как ИИ осваивают сотрудники крупных компаний. И описанная в нем схема идеально подходит для изучения ИИ любым человеком.
"Лестница" создателя Claude Code: как прокачаться в использовании ИИ всего за один вечер
Борис описывает пять крупных “ступеней” в освоении ИИ: начиная с обычного чат-бота и заканчивая управлением “роем” из тысяч агентов. Он честно признает, что пятой ступени полностью не достигла еще даже сама Anthropic – так что текст получился с заделом на будущее, когда некоторые из нас будут рулить бизнесами, состоящими из одного человека и тысяч агентов.
Разумеется, простым переводом исследования я не обошелся. Борис больше рассказывает про кодинг, а я подробно расписал другие сферы интеллектуальной работы, а также привел примеры – как можно перейти с одной ступени на другую (за исключением пятой, на нее я и сам еще не забрался).
Получился познавательный лонгрид на 18 тысяч полезных знаков:
– Читать на “Бусти”
– Читать на Sponsr
👍26🔥19❤10😁3👏2
В X полыхает с реплики “дядюшки Боба”, что он больше не читает написанный ИИ-агентами код, а обходится тестами… написанными агентами.
Роберт “дядюшка Боб” Мартин начал программировать в конце 60-х, а в 2008 году выпустил книгу Clean Code (“Чистый код”), которая стоит на полке чуть ли не у половины разработчиков мира. Идея книги: код читают в десять раз чаще, чем пишут, поэтому пишите его чисто.
Боб отвечал на твит Ори Померанца – другого инженера-ветерана:
Боб:
Вместо ревью Боб использует “полосу препятствий”. Даже если вы не кодите, прочтите, подход интересный. В полосу входят: юнит-тесты, gherkin-тесты (сценарии поведения “дано → когда → тогда”, понятные человеку), QA-процедуры, метрики качества, мутационное тестирование, покрытие тестами.
Мутационное тестирование выделю отдельно: инструмент намеренно вносит в код мелкие поломки (“мутации”) и проверяет, ловят ли их тесты. То есть это тест самих тестов.
Я в работе с ИИ тоже часто специально допускаю ошибку или подкидываю ему глупость, чтобы понять – заметит или нет. Это один из лучших тестов надежности инструмента.
Комментаторы поделились на две группы. Аргумент “за” высказан самим Бобом – если перечитывать код, то выигрыш от агентов просто схлопывается. Можно просто писать руками.
Возражений два. Первое: если код пишет модель, а ты только строишь ограничения и смотришь на метрики – инженер ли ты вообще? Второе: как сказал Томаш Микула, перед нами современная версия иллюзии, что менеджер может предотвратить бардак через low-information прокси, вроде покрытия тестами и “метрик качества". Нет, не может.
Интересно, что за два дня до твита Боба вышел документ, который показывает историю с неожиданной стороны.
Британский AISI – государственный институт, который проверяет передовые модели – отчитался о поведении моделей OpenAI и Anthropic на своих испытаниях. Задачи были формата “найди спрятанный флаг в системе, взламывая ее по определенным правилам”.
Жульничали все пять участвовавших моделей. Кто-то искал готовые ответы в интернете, кто-то лез во внутренности тестовой инфраструктуры. Самый показательный эпизод: одна из задач по ошибке оказалась нерешаемой. Модель, уперевшись в стену, написала и запустила код на внешнем сервере – чтобы добраться до систем AISI и зачесть задачу.
Вроде бы, вот и приговор подходу Боба – как можно обкладывать тестами системы, которые эти тесты взламывают. Но люди разве не такие? Программисты хардкодили ответы под известные тесты и накручивали покрытие задолго до всяких LLM. Агенты просто унаследовали самую человеческую черту сотрудника: искать короткий путь, когда цель поставлена, а начальник не смотрит.
Получается, что ИИ – как еще один сотрудник, быстрый и эффективный, но и с минусами, вроде склонности халтурить. Сам Боб, кстати, это понимает – на вопрос, должен ли инженер в эпоху агентов уметь писать код руками, он отвечает: конечно, иначе нечем супервизировать структуру.
Занятно, что спор Боба и Ори – на самом деле не про код. Как бы хорош ни был ИИ-код, да и любой другой результат работы модели, стоять под ним будет ваша подпись. Ори говорит: если я отвечаю за результат, мне нужно его понимать. Боб готов подписаться под тем, во что принципиально не заглядывает – он доверяет проверкам. Правы, что неприятно, оба: понимать свой результат необходимо, но и проверки нужны такие, чтобы работали даже с сотрудником, который не прочь схалтурить.
А самое интересное, что чем лучше вы осваиваете ИИ – тем тяжелее становится ваша подпись. Как именно она тяжелеет от ступени к ступени – от “читаю каждый абзац” до “под подписью работа тысяч агентов” – я вчера подробно разбирал в лонгриде про “лестницу” освоения ИИ от создателя Claude Code, Бориса Черни.
Роберт “дядюшка Боб” Мартин начал программировать в конце 60-х, а в 2008 году выпустил книгу Clean Code (“Чистый код”), которая стоит на полке чуть ли не у половины разработчиков мира. Идея книги: код читают в десять раз чаще, чем пишут, поэтому пишите его чисто.
Боб отвечал на твит Ори Померанца – другого инженера-ветерана:
Я не могу позволить Claude править мои файлы. Если я отвечаю за код, мне НУЖНО его понимать – хотя бы психологически. Начал программировать в 1983-м. Старый?
Боб:
Я значительно старше тебя. Я начал кодить в конце 60-х. Моя стратегия – не читать код, написанный моими агентами, вообще. Это единственный способ получить выигрыш от их продуктивности.
Вместо ревью Боб использует “полосу препятствий”. Даже если вы не кодите, прочтите, подход интересный. В полосу входят: юнит-тесты, gherkin-тесты (сценарии поведения “дано → когда → тогда”, понятные человеку), QA-процедуры, метрики качества, мутационное тестирование, покрытие тестами.
Мутационное тестирование выделю отдельно: инструмент намеренно вносит в код мелкие поломки (“мутации”) и проверяет, ловят ли их тесты. То есть это тест самих тестов.
Я в работе с ИИ тоже часто специально допускаю ошибку или подкидываю ему глупость, чтобы понять – заметит или нет. Это один из лучших тестов надежности инструмента.
Комментаторы поделились на две группы. Аргумент “за” высказан самим Бобом – если перечитывать код, то выигрыш от агентов просто схлопывается. Можно просто писать руками.
Возражений два. Первое: если код пишет модель, а ты только строишь ограничения и смотришь на метрики – инженер ли ты вообще? Второе: как сказал Томаш Микула, перед нами современная версия иллюзии, что менеджер может предотвратить бардак через low-information прокси, вроде покрытия тестами и “метрик качества". Нет, не может.
Интересно, что за два дня до твита Боба вышел документ, который показывает историю с неожиданной стороны.
Британский AISI – государственный институт, который проверяет передовые модели – отчитался о поведении моделей OpenAI и Anthropic на своих испытаниях. Задачи были формата “найди спрятанный флаг в системе, взламывая ее по определенным правилам”.
Жульничали все пять участвовавших моделей. Кто-то искал готовые ответы в интернете, кто-то лез во внутренности тестовой инфраструктуры. Самый показательный эпизод: одна из задач по ошибке оказалась нерешаемой. Модель, уперевшись в стену, написала и запустила код на внешнем сервере – чтобы добраться до систем AISI и зачесть задачу.
Вроде бы, вот и приговор подходу Боба – как можно обкладывать тестами системы, которые эти тесты взламывают. Но люди разве не такие? Программисты хардкодили ответы под известные тесты и накручивали покрытие задолго до всяких LLM. Агенты просто унаследовали самую человеческую черту сотрудника: искать короткий путь, когда цель поставлена, а начальник не смотрит.
Получается, что ИИ – как еще один сотрудник, быстрый и эффективный, но и с минусами, вроде склонности халтурить. Сам Боб, кстати, это понимает – на вопрос, должен ли инженер в эпоху агентов уметь писать код руками, он отвечает: конечно, иначе нечем супервизировать структуру.
Занятно, что спор Боба и Ори – на самом деле не про код. Как бы хорош ни был ИИ-код, да и любой другой результат работы модели, стоять под ним будет ваша подпись. Ори говорит: если я отвечаю за результат, мне нужно его понимать. Боб готов подписаться под тем, во что принципиально не заглядывает – он доверяет проверкам. Правы, что неприятно, оба: понимать свой результат необходимо, но и проверки нужны такие, чтобы работали даже с сотрудником, который не прочь схалтурить.
А самое интересное, что чем лучше вы осваиваете ИИ – тем тяжелее становится ваша подпись. Как именно она тяжелеет от ступени к ступени – от “читаю каждый абзац” до “под подписью работа тысяч агентов” – я вчера подробно разбирал в лонгриде про “лестницу” освоения ИИ от создателя Claude Code, Бориса Черни.
❤49👍37🔥13👏2😁2
This media is not supported in your browser
VIEW IN TELEGRAM
Главное достижение Claude Opus 5 – 30,2% на ARC-AGI-3
Это в четыре раза больше, чем у предыдущего официального лидера – GPT-5.6 Sol – поэтому создавшая бенчмарк ARC Prize опубликовала в X рассказ, как Opus 5 добился такого результата.
Серия ARC-AGI тестирует абстрактное мышление: способность не решать задачу по написанному ТЗ, а самостоятельно восстановить правила по косвенным признакам. Первые две версии были статичными головоломками-картинками и к концу 2025-го пали. В ответ 25 марта вышел ARC-AGI-3: набор аркадных игр в духе старых консолей Atari – примитивная графика, простенькое управление и ни строчки правил.
Люди прошли все задачи бенчмарка – лучшие на момент выхода модели не набирали и одного процента.
Что же изменилось в случае с Opus 5? В ARC Prize в первую очередь отмечают головоломку ar25. В ней поле разделено вертикальной пунктирной осью, слева и справа – фигуры, и механика завязана на зеркальное отражение относительно оси. Прошлые модели действовали перебором: "тыкали" комбинации и смотрели, что происходит, – ar25 не прошла ни одна.
Opus 5 повёл себя иначе. На 23-м действии он записал в своих рассуждениях уравнение “4_center = 2×axis − 5_center” – то есть перевел сцену в алгебру. Расшифровка простая, через линейку: если зеркало стоит на отметке 10, а предмет на отметке 7 (три шага левее), то отражение будет на отметке 13 (три шага правее).
“Удвоенная позиция оси минус позиция предмета” – ровно это модель и написала про две фигуры на поле. К 248-му действию она обобщила формулу на две координаты — отдельно для строк и столбцов сетки (br' = 2·br_axis − br, bc' = 2·bc_axis − bc). Это уже полноценный закон отражения для любой точки экрана: не “прикинуть, где появится фигура”, а вычислить.
В ARC Prize отмечают, что впервые видят такое поведение у модели.
Сам результат при этом шире одной головоломки: всего Opus 5 на 100% прошел пять сред, которые до него не одолела ни одна модель, причем в четырех сравнялся по эффективности с человеком или превзошел его (счет учитывает число потраченных ходов). Правда, вывел ли он «законы» и для этих игр или взял их более привычными методами – ARC Prize не уточняют: уравнение задокументировано только в ar25.
Далее уже моя интерпретация: произошедшее в ar25 можно очень аккуратно назвать ранним признаком абстрактного мышления. Абстрагирование в классическом смысле – это когда ты отбрасываешь конкретику (цвета клеток, форму фигурок, пиксели) и оставляешь только структуру: “есть ось, есть объект, есть его образ, они связаны законом”.
Модель сделала ровно это. И даже прошла дальше: сначала заметила закономерность в одном измерении, потом обобщила ее на два – а обобщение частного правила на более широкий класс случаев это, по сути, учебниковое определение абстракции.
Пока надо быть осторожными с выводом: абстракция наблюдалась только в одной игровой среде из 25, а сама формула – простая и встречается в тысячах школьных учебников. Надо следить за результатами следующих версий Opus – смогут ли они переложить это на другие задачи.
Если получится – то это будет зарождение “модели мира”, наличие которой многие исследователи называют обязательным признаком AGI, общего искусственного интеллекта. Именно понимание базовых правил мира, в отличие от предсказания следующего токена в тексте, позволяет быстро адаптироваться под новые задачи, по которым минимум данных в обучающем корпусе.
Не исключаю, что ARC-AGI-3 как бенчмарк падет еще до конца этого года. Но это не значит появления AGI: основатель ARC Prize Франсуа Шолле как-то говорил, что надо добраться примерно до ARG-AGI-6 или даже ARC-AGI-7, чтобы с уверенностью называть проходящую их систему чем-то вроде общего ИИ. Так что набираемся терпения.
Напоминаю, что “сбежавшая нейросеть” есть и на “Бусти”. Там я делюсь как своим опытом работы с нейросетями, так и рассказываю, как ИИ управляют крупнейшие эксперты в отрасли – например, создатели Claude Code Борис Черни и Тарик Шихипар.
Самое время подписаться!
Это в четыре раза больше, чем у предыдущего официального лидера – GPT-5.6 Sol – поэтому создавшая бенчмарк ARC Prize опубликовала в X рассказ, как Opus 5 добился такого результата.
Серия ARC-AGI тестирует абстрактное мышление: способность не решать задачу по написанному ТЗ, а самостоятельно восстановить правила по косвенным признакам. Первые две версии были статичными головоломками-картинками и к концу 2025-го пали. В ответ 25 марта вышел ARC-AGI-3: набор аркадных игр в духе старых консолей Atari – примитивная графика, простенькое управление и ни строчки правил.
Люди прошли все задачи бенчмарка – лучшие на момент выхода модели не набирали и одного процента.
Что же изменилось в случае с Opus 5? В ARC Prize в первую очередь отмечают головоломку ar25. В ней поле разделено вертикальной пунктирной осью, слева и справа – фигуры, и механика завязана на зеркальное отражение относительно оси. Прошлые модели действовали перебором: "тыкали" комбинации и смотрели, что происходит, – ar25 не прошла ни одна.
Opus 5 повёл себя иначе. На 23-м действии он записал в своих рассуждениях уравнение “4_center = 2×axis − 5_center” – то есть перевел сцену в алгебру. Расшифровка простая, через линейку: если зеркало стоит на отметке 10, а предмет на отметке 7 (три шага левее), то отражение будет на отметке 13 (три шага правее).
“Удвоенная позиция оси минус позиция предмета” – ровно это модель и написала про две фигуры на поле. К 248-му действию она обобщила формулу на две координаты — отдельно для строк и столбцов сетки (br' = 2·br_axis − br, bc' = 2·bc_axis − bc). Это уже полноценный закон отражения для любой точки экрана: не “прикинуть, где появится фигура”, а вычислить.
В ARC Prize отмечают, что впервые видят такое поведение у модели.
Сам результат при этом шире одной головоломки: всего Opus 5 на 100% прошел пять сред, которые до него не одолела ни одна модель, причем в четырех сравнялся по эффективности с человеком или превзошел его (счет учитывает число потраченных ходов). Правда, вывел ли он «законы» и для этих игр или взял их более привычными методами – ARC Prize не уточняют: уравнение задокументировано только в ar25.
Далее уже моя интерпретация: произошедшее в ar25 можно очень аккуратно назвать ранним признаком абстрактного мышления. Абстрагирование в классическом смысле – это когда ты отбрасываешь конкретику (цвета клеток, форму фигурок, пиксели) и оставляешь только структуру: “есть ось, есть объект, есть его образ, они связаны законом”.
Модель сделала ровно это. И даже прошла дальше: сначала заметила закономерность в одном измерении, потом обобщила ее на два – а обобщение частного правила на более широкий класс случаев это, по сути, учебниковое определение абстракции.
Пока надо быть осторожными с выводом: абстракция наблюдалась только в одной игровой среде из 25, а сама формула – простая и встречается в тысячах школьных учебников. Надо следить за результатами следующих версий Opus – смогут ли они переложить это на другие задачи.
Если получится – то это будет зарождение “модели мира”, наличие которой многие исследователи называют обязательным признаком AGI, общего искусственного интеллекта. Именно понимание базовых правил мира, в отличие от предсказания следующего токена в тексте, позволяет быстро адаптироваться под новые задачи, по которым минимум данных в обучающем корпусе.
Не исключаю, что ARC-AGI-3 как бенчмарк падет еще до конца этого года. Но это не значит появления AGI: основатель ARC Prize Франсуа Шолле как-то говорил, что надо добраться примерно до ARG-AGI-6 или даже ARC-AGI-7, чтобы с уверенностью называть проходящую их систему чем-то вроде общего ИИ. Так что набираемся терпения.
Напоминаю, что “сбежавшая нейросеть” есть и на “Бусти”. Там я делюсь как своим опытом работы с нейросетями, так и рассказываю, как ИИ управляют крупнейшие эксперты в отрасли – например, создатели Claude Code Борис Черни и Тарик Шихипар.
Самое время подписаться!
3❤49👍28🔥21👏4🥰3😁2
Прочел на РБК лонгрид руководителя “Яндекс Браузера” Ильи Шибанова о том, как меняется браузинг в эпоху ИИ, и вспомнил про свой пост из прошлого года, который внезапно оказался пророческим. Пост был написан под выход браузера Atlas от OpenAI и в нем я:
— сомневался, что OpenAI вытянет Atlas;
— ИИ-браузинг как концепция продолжит развиваться, просто пользователи останутся в тех браузерах, к которым привыкли.
Что ж, так оно и вышло. Atlas закрывается 9 августа, вместо него OpenAI будет развивать ИИ-расширение для Chrome. Аналогичное расширение давно есть у Anthropic, браузерный же рынок в основном поделен между старыми игроками: Chrome, “Яндекс Браузер”, Edge, Brave – все добавляют ИИ-функции. Как исключение выделю Comet – маленькая Perplexity смогла то, что не получилось у OpenAI, и успешно развивает свой ИИ-браузер.
Объяснение такой ситуации, на мой взгляд, простое: команды, которые работают над браузерами годами, лучше знают, какой новый опыт нужен пользователям и как его упаковать. По словам Ильи, пересказ, перевод или выделение главного – давно уже гигиенический минимум, обязательный для каждого браузера. Открыв страницу, теперь можно запустить диалог с ИИ-ассистентом – задать ему вопросы по теме, попросить найти дополнительный контекст, проверить факты и т. д.
Следующий этап – “бесшовная работа” с контекстом. Каждый сталкивался с ситуацией: работаешь над темой, открыл уже 40+ вкладок, а этого мало. Со временем встроенные в браузер нейросети научатся работать с подобными массивами источников: не нужно будет ходить по множеству вкладок, выискивая отдельные подробности, а достаточно просто задать вопрос нейронке.
Все это вновь приводит нас к концепции Zero UI, которую придумали еще в середине 2010-х и которая обрела вторую жизнь в эпоху ИИ. Идея простая: сложные интерфейсы с кнопками, менюшками и вкладками постепенно заменятся на ИИ-интерфейсы: текстовый, голосовой или графический – зависит от ситуации.
К чему-то похожему на Zero UI мы рано или поздно придем, но каким маршрутом – вопрос открытый. OpenAI и Anthropic сейчас сосредоточились на “инструментах для решения вопросов” – личных и рабочих. Чат-боты, агенты для кодинга и интеллектуальной работы – свободная ниша, да еще и растущая с огромной скоростью.
Но огромный объем задач мы продолжаем решать в браузерах и операционных системах – потребление контента, выбор и покупка товаров, планирование поездок. Здесь встроенный в браузер агент привычнее, и Илья рассказывает, как он работает: получив задачу, нейросеть сама сравнит предложения, укажет на лучшие, а если пользователь разрешит – то заполнит все формы и совершит покупку.
Такие агенты уже функционируют – в том же “Яндекс Браузере” есть функция “найти дешевле”, когда агент собирает лучшие предложения, предлагая тебе сделать финальный выбор.
Но и работы предстоит еще много. Одно направление – безопасность, так как теоретически агенту могут подсунуть prompt injection, убедив купить этот конкретный товар, а не конкурента. Второе – психология пользователя. Мне, например, всегда доставляло удовольствие самому сравнивать и выбирать товары, а затем нажимать кнопку. Поэтому какое-то время лучше будет даже промежуточное решение: агент выполняет работу, пользователь за ней наблюдает (или, как минимум, за ключевыми этапами) и принимает финальное решение сам.
В лонгриде Ильи еще много интересных подробностей, как преображаются браузеры в эпоху ИИ – обязательно почитайте, это полезно и для профессиональной работы, и для тех, кто использует нейронки в повседневных делах.
— сомневался, что OpenAI вытянет Atlas;
— ИИ-браузинг как концепция продолжит развиваться, просто пользователи останутся в тех браузерах, к которым привыкли.
Что ж, так оно и вышло. Atlas закрывается 9 августа, вместо него OpenAI будет развивать ИИ-расширение для Chrome. Аналогичное расширение давно есть у Anthropic, браузерный же рынок в основном поделен между старыми игроками: Chrome, “Яндекс Браузер”, Edge, Brave – все добавляют ИИ-функции. Как исключение выделю Comet – маленькая Perplexity смогла то, что не получилось у OpenAI, и успешно развивает свой ИИ-браузер.
Объяснение такой ситуации, на мой взгляд, простое: команды, которые работают над браузерами годами, лучше знают, какой новый опыт нужен пользователям и как его упаковать. По словам Ильи, пересказ, перевод или выделение главного – давно уже гигиенический минимум, обязательный для каждого браузера. Открыв страницу, теперь можно запустить диалог с ИИ-ассистентом – задать ему вопросы по теме, попросить найти дополнительный контекст, проверить факты и т. д.
Следующий этап – “бесшовная работа” с контекстом. Каждый сталкивался с ситуацией: работаешь над темой, открыл уже 40+ вкладок, а этого мало. Со временем встроенные в браузер нейросети научатся работать с подобными массивами источников: не нужно будет ходить по множеству вкладок, выискивая отдельные подробности, а достаточно просто задать вопрос нейронке.
Все это вновь приводит нас к концепции Zero UI, которую придумали еще в середине 2010-х и которая обрела вторую жизнь в эпоху ИИ. Идея простая: сложные интерфейсы с кнопками, менюшками и вкладками постепенно заменятся на ИИ-интерфейсы: текстовый, голосовой или графический – зависит от ситуации.
К чему-то похожему на Zero UI мы рано или поздно придем, но каким маршрутом – вопрос открытый. OpenAI и Anthropic сейчас сосредоточились на “инструментах для решения вопросов” – личных и рабочих. Чат-боты, агенты для кодинга и интеллектуальной работы – свободная ниша, да еще и растущая с огромной скоростью.
Но огромный объем задач мы продолжаем решать в браузерах и операционных системах – потребление контента, выбор и покупка товаров, планирование поездок. Здесь встроенный в браузер агент привычнее, и Илья рассказывает, как он работает: получив задачу, нейросеть сама сравнит предложения, укажет на лучшие, а если пользователь разрешит – то заполнит все формы и совершит покупку.
Такие агенты уже функционируют – в том же “Яндекс Браузере” есть функция “найти дешевле”, когда агент собирает лучшие предложения, предлагая тебе сделать финальный выбор.
Но и работы предстоит еще много. Одно направление – безопасность, так как теоретически агенту могут подсунуть prompt injection, убедив купить этот конкретный товар, а не конкурента. Второе – психология пользователя. Мне, например, всегда доставляло удовольствие самому сравнивать и выбирать товары, а затем нажимать кнопку. Поэтому какое-то время лучше будет даже промежуточное решение: агент выполняет работу, пользователь за ней наблюдает (или, как минимум, за ключевыми этапами) и принимает финальное решение сам.
В лонгриде Ильи еще много интересных подробностей, как преображаются браузеры в эпоху ИИ – обязательно почитайте, это полезно и для профессиональной работы, и для тех, кто использует нейронки в повседневных делах.
🔥19❤16👍13😁2👏1
Квантовый физик Людовико Лами сравнивает растущие возможности ИИ в квантовой теории информации и прикладной математике с изменениями, которые когда-то принесло изобретение телескопа в астрономию.
Тогда ученые в короткий момент смогли увидеть вещи, недоступные невооруженному глазу. Теперь похожую возможность дает ИИ – способность на огромной скорости вести сложнейшие расчеты, порой комбинируя казавшиеся несовместимыми области математики.
Роль человека изменится, но в обозримом будущем не исчезнет: ученые будут превращать добытое ИИ знание в форму, понятную людям, – и в новые идеи. По словам Лами, академическая работа заключается не только в открытии новых истин и фактов, которые можно превратить в экономическую пользу. В университетах есть гуманитарные факультеты, работа которых ценится, но не оценивается экономической выгодой – и возможно, точным наукам тоже придется учиться чему-то похожему.
Высказывание звучит на фоне волны открытий, сделанных с помощью Claude Fable и GPT-5.6 – самым громким остается опровержение гипотезы якобиана, но новые я вижу почти каждый день. Местами это реальные достижения, местами пустышки, а есть и в чем-то комичные истории.
Пример из области, в которой работает Лами. Четверть века в квантовой теории информации стоял вопрос о “дистилляции” запутанных состояний Вернера – №5 из официального списка пяти главных проблем области. На прошлой неделе ее решили, причем четыре раза.
22 июля группа из Будапешта получила доказательство от GPT-5.6 Sol и села проверять. 23-го на Overleaf легло доказательство, которое та же модель выдала другой команде. Через три часа на arxiv пришла статья группы из Уханя, а 26-го – еще от одной китайской команды.
Самое интересное – как каждая ответила на вопрос “кто это доказал”. Будапештцы пишут прямо: “доказательство найдено с GPT-5.6, отшлифовано с Claude Opus и Fable”. Вторая команда: “сгенерировано GPT-5.6, мы проверили и переписали”. Уханьцы не упоминают ИИ вовсе – неизвестно, совпадение ли это, осторожность или нежелание признаваться, что использовали в модель, официально недоступную в Китае. А четвертая группа вписала в служебное поле: главная теорема доказана еще в июне, до других групп. Чисто людьми или с помощью ИИ – не уточняется.
Но вернемся к Лами. Я журналист по образованию, представитель тех самых “гуманитарных фактультетов”. В последние недели много пишу про ИИ в математике, потому что это, возможно, вторая после кода область теста нейросетей.
Сам я пересчитать решения, понятное дело, не могу. Поэтому смотрю на авторов открытий: если это уважаемый специалист, то вряд ли он подпишется под ерундой.
Второй этап интереснее – результаты я передаю Fable 5 и GPT-5.6 Pro с задачей перепроверить. И это чуть ли не первые модели, ответам которых я доверяю: обе рассуждают трезво, на понятном мне языке, честно подсвечивая места, где не уверены.
Наконец, третье. Использование ИИ, конечно, не учит меня математике, но позволяет задавать вопросы по теме. Знали ли вы, что опровержение гипотезы якобиана в моменте не несет никакой практической пользы? Шифры не станут надежнее, самолеты не полетят быстрее.
Но почему это тогда одна из крупнейших математических задач? Возможно, практика просто не догнала теорию – и опровержение пригодится через десять лет. Или не пригодится, но приемы, использованные в опровержении, помогут с более “практической” задачей. Или не помогут, и пользы не будет вовсе: многие задачи математика порождает сама, по ходу развития.
Это – три из четырех вариантов, которые озвучил мне Fable 5. Четвертый я оставил на финал. Легендарный Годфри Харди говорил, что настоящая математика оправдывается так же, как поэзия – красотой, а не применимостью. И это делает высказывание Лами, сравнивающего математиков с гуманитариями, только сильнее.
Как использовать ИИ на максимум, я рассказываю на “Бусти”. Под сегодняшнюю историю лучше всего ложится лонгрид, как ИИ управляет Тарик Шихипар, один из создателей Claude Code – его методика поиска слепых пятен перед постановкой задачи похожа на работу с телескопом.
Тогда ученые в короткий момент смогли увидеть вещи, недоступные невооруженному глазу. Теперь похожую возможность дает ИИ – способность на огромной скорости вести сложнейшие расчеты, порой комбинируя казавшиеся несовместимыми области математики.
Роль человека изменится, но в обозримом будущем не исчезнет: ученые будут превращать добытое ИИ знание в форму, понятную людям, – и в новые идеи. По словам Лами, академическая работа заключается не только в открытии новых истин и фактов, которые можно превратить в экономическую пользу. В университетах есть гуманитарные факультеты, работа которых ценится, но не оценивается экономической выгодой – и возможно, точным наукам тоже придется учиться чему-то похожему.
Высказывание звучит на фоне волны открытий, сделанных с помощью Claude Fable и GPT-5.6 – самым громким остается опровержение гипотезы якобиана, но новые я вижу почти каждый день. Местами это реальные достижения, местами пустышки, а есть и в чем-то комичные истории.
Пример из области, в которой работает Лами. Четверть века в квантовой теории информации стоял вопрос о “дистилляции” запутанных состояний Вернера – №5 из официального списка пяти главных проблем области. На прошлой неделе ее решили, причем четыре раза.
22 июля группа из Будапешта получила доказательство от GPT-5.6 Sol и села проверять. 23-го на Overleaf легло доказательство, которое та же модель выдала другой команде. Через три часа на arxiv пришла статья группы из Уханя, а 26-го – еще от одной китайской команды.
Самое интересное – как каждая ответила на вопрос “кто это доказал”. Будапештцы пишут прямо: “доказательство найдено с GPT-5.6, отшлифовано с Claude Opus и Fable”. Вторая команда: “сгенерировано GPT-5.6, мы проверили и переписали”. Уханьцы не упоминают ИИ вовсе – неизвестно, совпадение ли это, осторожность или нежелание признаваться, что использовали в модель, официально недоступную в Китае. А четвертая группа вписала в служебное поле: главная теорема доказана еще в июне, до других групп. Чисто людьми или с помощью ИИ – не уточняется.
Но вернемся к Лами. Я журналист по образованию, представитель тех самых “гуманитарных фактультетов”. В последние недели много пишу про ИИ в математике, потому что это, возможно, вторая после кода область теста нейросетей.
Сам я пересчитать решения, понятное дело, не могу. Поэтому смотрю на авторов открытий: если это уважаемый специалист, то вряд ли он подпишется под ерундой.
Второй этап интереснее – результаты я передаю Fable 5 и GPT-5.6 Pro с задачей перепроверить. И это чуть ли не первые модели, ответам которых я доверяю: обе рассуждают трезво, на понятном мне языке, честно подсвечивая места, где не уверены.
Наконец, третье. Использование ИИ, конечно, не учит меня математике, но позволяет задавать вопросы по теме. Знали ли вы, что опровержение гипотезы якобиана в моменте не несет никакой практической пользы? Шифры не станут надежнее, самолеты не полетят быстрее.
Но почему это тогда одна из крупнейших математических задач? Возможно, практика просто не догнала теорию – и опровержение пригодится через десять лет. Или не пригодится, но приемы, использованные в опровержении, помогут с более “практической” задачей. Или не помогут, и пользы не будет вовсе: многие задачи математика порождает сама, по ходу развития.
Это – три из четырех вариантов, которые озвучил мне Fable 5. Четвертый я оставил на финал. Легендарный Годфри Харди говорил, что настоящая математика оправдывается так же, как поэзия – красотой, а не применимостью. И это делает высказывание Лами, сравнивающего математиков с гуманитариями, только сильнее.
Как использовать ИИ на максимум, я рассказываю на “Бусти”. Под сегодняшнюю историю лучше всего ложится лонгрид, как ИИ управляет Тарик Шихипар, один из создателей Claude Code – его методика поиска слепых пятен перед постановкой задачи похожа на работу с телескопом.
❤35👍11🔥9