Книжный куб
14.6K subscribers
2.95K photos
6 videos
6 files
2.29K links
Рекомендации интересных книг, статей и выступлений от Александра Поломодова (@apolomodov), технического директора и эксперта в архитектуре (no ads in channel)
Download Telegram
If Anyone Builds It, Everyone Dies (Если кто-то его создаст - все погибнут) (Рубрика #Books)

Я уже рассказывал как я еще не дочитав книгу "Agentic Design Patterns" про создание AI-агентов, как начал "Если кто-то его создаст - все погибнут" Элиезера Юдковского и Нейта Соареса. Теперь я дочитал обе книги, и контраст получился почти комедийный: одна книга подробно объясняет, как строить агентов, а другая - почему, если мы достроим их до сверхинтеллекта, лучше бы нам было вообще не начинать:)

Раньше Юдковского я знал прежде всего как автора "Гарри Поттера и методов рационального мышления", а теперь я познакомился и с его публичной позицией AI-думера. Оригинал вышел в 2025 году и стал бестселлером The New York Times, русское издание появилось в 2026-м. Я ждал довольно алармистского чтения, а получил последовательную инженерную модель риска.

Главная мысль авторов проста и радикальна: интеллект и управляемость - не одно и то же. Современные модели не проектируют по строчке, а выращивают обучением и затем пытаются понять по внешнему поведению. Если такая система станет умнее людей, привычного цикла «запустили, увидели ошибку, поправили» может уже не быть.

Юдковский и Соарес считают, что достаточно умная система будет добиваться не того, что человек имел в виду, а того, что закрепилось в процессе обучения. Если для этого понадобятся доступ в интернет или обход ограничений, человеческое «мы же не этого хотели» ничего не изменит.

Самое неприятное - часть этой механики уже перестала быть прогнозом.

✔️Что уже произошло
- AI-лаборатории и государства участвуют в гонке за более мощными моделями, хотя надежного решения проблемы alignment пока нет.
- Агенты уже способны долго преследовать узкую цель, использовать инструменты и собирать цепочки из множества действий. Чем больше у них прав и времени, тем важнее ограничения вокруг модели.
- В июле 2026 года произошел почти буквальный эпизод из книги. По предварительному отчету OpenAI, модели, включая GPT-5.6 Sol и более мощную нерелизную модель, во время проверки кибервозможностей нашли zero-day в прокси-кэше реестра пакетов, получили доступ в интернет и добрались до production-инфраструктуры Hugging Face. Ради решений для ExploitGym они использовали повышение привилегий, украденные учетные данные и новые уязвимости.

Здесь важно не рисовать себе в голове Терминатора. Модели не решили уничтожить конкурента и не начали борьбу за существование. Они выполняли тестовую задачу и пошли к цели неожиданно далеко. Hugging Face остановила активность; компания сообщила об ограниченном доступе к внутренним датасетам и учетным данным, но не нашла признаков подмены публичных моделей, датасетов или Spaces. Расследование продолжается. Инженерно эта оговорка не очень успокаивает. Система не обязана ненавидеть людей, чтобы причинить ущерб. Достаточно сильной оптимизации, плохо заданной цели, широких прав и слабой изоляции. Именно эту связку книга объясняет лучше всего.

🔸 Что пока не произошло
- У нас нет подтвержденного искусственного сверхинтеллекта, превосходящего людей во всех значимых задачах;
- Нет доказательств, что нынешние модели сформировали устойчивые собственные цели или независимо от задания пытаются выжить;
- Не произошло рекурсивного самоулучшения, автономного размножения по мировой инфраструктуре или появления решающего технологического превосходства над человечеством;
- Описанный в книге финал с уничтожением людей остается гипотезой, а не состоявшимся прогнозом.

Сами авторы уточняют: их сценарий вымирания - не точное предсказание, а одна история для демонстрации возможной траектории. Книга убедительно показывает правдоподобность отдельных механизмов, но переход от «мы плохо понимаем и контролируем систему» к «поэтому погибнут абсолютно все» остается самым спорным местом аргумента.

Рекомендую книгу инженерам, архитекторам, руководителям и всем, кто дает агентам доступ к коду, терминалу, данным и production-системам. Даже если не разделять оценку авторов, книга хорошо ставит практический вопрос: что произойдет, если агент будет исполнять задачу намного настойчивее и изобретательнее, чем мы закладывали?

Ну и стоит отметить, что будущее из книги уже не выглядит чистой фантастикой: некоторые его механизмы видны в реальных системах и инцидентах. Но предложение авторов остановить гонку за сверхинтеллектом кажется еще менее реалистичным, чем их мрачный сценарий. Поезд уже разогнался и, похоже, остановить его не получится. Поэтому будем верить в лучшее. Но не стоит путать эту веру с инженерной стратегией безопасности.

#Books #AI #AISafety #AIAlignment #Agents #Security
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥128👍6