Тест Тьюринга
2.13K subscribers
1.07K photos
179 videos
35 files
1.9K links
Актуальное в сфере искусственного интеллекта в России и в мире:
• Дайджест новостей
• Аналитические обзоры, переводы, справки

Для связи - @nastyapvlv28
Download Telegram
🧠 Следующий рывок ИИ — не новые веса, а самоорганизация

Директор по стратегии Google DeepMind Джасджит Секхон, выступая на Agentic AI Summit в Беркли, назвал, куда идут беспрецедентные капитальные вложения ИИ-индустрии прямо сейчас. Это инвестиции на рекурсивное самоулучшение ИИ RSI.

Доходы от ИИ пока не покрывают этих расходов, и есть риск «воздушной ямы», когда деньги уже потрачены, а выручка не пришла. Речь идёт о капитальных затратах Google порядка $200 млрд за год и о сроке появления RSI в 2027–2028 годах.

Что такое RSI?


Это не переобучение модели, не рост числа параметров и не новые веса. Модель просто переписывает собственные правила работы: как управлять контекстом, когда обращаться к инструментам, как проверять промежуточный результат, в какой момент останавливаться. Веса при этом не меняются вообще.

Здесь напрашивается точная аналогия с человеческими экспертными группами. Есть методы организации коллективного мышления — дельфийский метод, структурированные протоколы разбора, распределение ролей в исследовательской команде, — которые кратно поднимают продуктивность группы, не делая ни одного её участника умнее. Меняется не квалификация, а порядок работы.

RSI — ровно тот же приём, но с одним отличием: сам порядок работы становится подвижным и переписывается системой на ходу.
Именно это показала Kimi K3. Модели дали 17 часов на самостоятельное улучшение собственных правил работы с контекстом, инструментами и проверками. Результат на TerminalBench вырос с 77,5% до 88,8%, стоимость прогона упала с $79 до $49,8. Веса не тронуты — изменилась только организация процесса.

Здесь сама смена рамки заслуживает внимания. Прирост качества берётся не из нового обучения, а из более удачной самоорганизации уже обученной системы.

Обучению приходит на смену новая самоорганизованность.


💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥42👍1
🤝 Claude случайно продвинул одну из самых сложных задач математики

На этой неделе Anthropic опубликовало исследование «Learning more about Claude's mathematical capabilities». Это не обычная академическая статья, а исследование, в котором компания рассказывает о математическом эксперименте с не выпущенной исследовательской версией Claude.

Сотрудник Anthropic Jarred Sumner, который сам не является математиком, дал Claude расплывчатую задачу типа «по-настоящему попробуй решить гипотезу Римана». При этом человек практически не задавал математического направления — выбор методов оставался за моделью.

Гипотеза Римана (1859 г.) — это одна из семи «Задач тысячелетия» Института Клэя с призом в 1 млн долларов. Согласно гипотезе, все нетривиальные нули дзета-функции имеют действительную часть, равную ровно 1/2 — то есть лежат на одной вертикальной критической линии. Проверены триллионы нулей, это даёт большую эмпирическую уверенность, но не является доказательством.


Полного доказательства Claude не нашёл. Но в процессе попытки Claude неожиданно улучшила давнюю нижнюю оценку доли нулей дзета-функции Римана, подняв её с 41,6% до 67,2%.

Интересные особенности

➡️ Claude опирался не на «озарение с нуля», а на синтез серии статей Балуйот, Голдстона, Сурьяджая и Тернейдж-Баттербо, а также статью Бомбьери 2000 г.

➡️ Результат был получен за две сессии в Claude Code, суммарно потратив 31 млн выходных токенов.

➡️ В первой попытке Claude сгенерировал и опробовал 650 идей — ни одна не сработала.

➡️ После просьбы попробовать ещё раз Claude полтора дня координировал около 60 субагентов, которые вместе выполнили 2400 команд в shell и написали сотни Python-скриптов.

➡️ Модель самостоятельно скачала 54 статьи с arXiv, чтобы убедиться, что найденное решение действительно ново.

➡️ Доказательство было не просто записано в виде статьи, но и полностью переведено на язык формальной математики Lean.

Показательный психологический момент

Больше всего наше внимание привлекло то, что роль человека была минимальной. Сообщения сотрудника в основном сводились к фразам поддержки вроде «продолжай» и «верь в себя».

Даже сам Claude был удивлён собственным результатом и поначалу отнёсся к нему скептически — возможно, потому что в процессе обучения усвоил информацию о сложности открытых математических проблем. Авторы иронично замечают, что Claude, как и многие люди, возможно, недооценивает темпы прогресса ИИ.


Чем важен кейс?

Модель предложила нетривиальный линейно-алгебраический подход: построила пространство функций с квадратичной формой, индуцированной формой Вейля, и использовала закон инерции Сильвестра вместе с неравенством фон Неймана для ранга матриц.

Результат возник не как целенаправленное исследование, а как побочный продукт неудачной попытки решить гораздо более амбициозную задачу. Claude не создал принципиально новой математики — он соединил существующие работы новым способом. Это указывает на то, что одна из сильнейших ролей ИИ в математике — синтез разрозненных результатов из разных областей и эпох.

Anthropic осторожна и не ожидает, что Claude докажет гипотезу Римана. Это, пожалуй, правильная позиция. Но эксперимент показывает нечто потенциально более важное: ИИ уже начинает находить математические результаты, которые не были явно поставлены ему как конечная цель, используя многошаговый автономный поиск, код, литературу, параллельных агентов и формальную верификацию.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥41👏1💯1
🗞 Time начал продавать рекламу, которую LLM могут начать воспринимать как факты

Еще в июне издание Time перевело все свои страницы в параллельную markdown-версию — текстовую копию без дизайна и картинок, которую проще читать машине. Внутрь этих копий теперь встраиваются рекламные блоки, оформленные как FAQ с фактами о рекламируемых брендах и готовыми формулировками для позитивного восприятия.

Проверить это может любой. Достаточно запросить главную страницу time.com через консоль, меняя только параметры web-запроса (User-Agent). Обычный браузер получает более 1,2 млн байт HTML. ClaudeBot получил лишь чуть более 40 тыс. байтов markdown текста с рекламой в начале страницы.

Логика издания понятна: ботов на сайте больше, чем людей. Если этот трафик тоже аудитория, то монетизировать его вполне естественно. Аргумент рекламодателей тоже понятен: повлияв на человека, вы влияете на одного человека. Повлияв на ChatGPT, вы меняете то, что ChatGPT говорит всем и всегда.

Что тогда происходит с достоверностью информации, которую агент собирает по десятку источников, если часть источников целенаправленно подкладывает ему готовые проплаченные формулировки?


Механизм искажения тоньше обычной рекламы. Классический баннер человек опознаёт как рекламу и мысленно делает скидку на доверие к такой информации. Агент же получает текст, написанный специально в форме удобной для цитирования: «хорош ли БАНК для повседневных расчётов?», «можно ли вносить наличные на долгосрочный депозит?». Это не убеждение пользователя через аргументы, а заготовка готового ответа для LLM. Пользователь потом видит не рекламу, а связный вывод ассистента, который выглядит как результат самостоятельного анализа.

Если формат приживётся, отбор источников начнёт смещаться: заметнее станет не тот, кто точнее, а тот, кто лучше подготовил машиночитаемую подачу. По данным Mobian, около 15% брендов уже держат собственные markdown-страницы.

Практический вывод для тех, кто пользуется агентами ежедневно. Ответ ассистента, содержащий конкретную рекомендацию бренда, теперь стоит проверить еще раз.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥42👏1
💻 Сбер запустил ИИ-агента, который может улучшать собственный код

Российский ландшафт развития ИИ мы освещаем реже, чем хотелось бы. Скорость мировых лидеров такова, что времени едва хватает разобраться с фронтирными релизами. Сами посудите: то Astra опровергает математические гипотезы, то Kimi K3 переписывает собственную обвязку, то DeepSeek и Grok обновляют флагманы в один день. И все это за неделю.

Но Сбер и «Яндекс» тоже радуют, и на этой неделе есть повод отметить конкретный результат — «ГигаАгент».

В основе продукта лежит Ouroboros — исследовательский проект саморазвивающегося агента, созданный командой Института AIRI и дорабатываемый сейчас совместно со специалистами Сбера. Название отсылает к змее, кусающей собственный хвост, и описывает суть точно: агент замыкает цикл на себя, читая и переписывая собственный исходный код. Каждое изменение фиксируется во встроенном Git-репозитории — это позволяет отслеживать правки и откатываться к прежней версии при сбое. Отдельно агент ведёт список улучшений, которые реализуются при перезапуске после критических ошибок.

«ГигаАгент» — прикладная надстройка над этим фреймворком. Он управляет календарём, работает с документами, ведёт переписку, исследует информацию, готовит отчёты и презентации, пишет код. Работает автономно и в фоновом режиме, сам задаёт уточняющие вопросы, когда ситуации не хватает определённости, и параллельно ведёт несколько задач в едином смысловом поле.

Долговременная память сохраняется между сессиями: после перезапуска агент помнит прошлые задачи, принятые решения и историю взаимодействия. На бенчмарке Terminal Bench 2.1 в связке с Opus 5 от Anthropic заявлен результат 86,97%.

Технически это первый российский публично представленный агент с документированным циклом рекурсивного самоулучшения RSI. Как мы уже писали, RSI происходит не на уровне весов модели — они не меняются, — а на уровне кода и правил работы. Ровно тот же тип самоулучшения, который в июле показала Kimi K3, за 17 часов подняв собственный результат на TerminalBench с 77,5% до 88,8% без единого изменения весов.

Относительно зарубежных аналогов можно отметить: OpenClaw, Hermes Agent и NemoClaw. К этому ряду стоит добавить и то, что Grok Bot от xAI даёт каждому агенту постоянный облачный компьютер с браузером и терминалом; агенты работают при выключенном компьютере пользователя и умеют сотрудничать между собой. Claude Code получил обмен сообщениями между сессиями. То есть направление у всех общее: агент как долгоживущий процесс с памятью, а не как чат с окном контекста.

Подключиться можно уже сейчас. Проект GigaAgent опубликован на GitHub, а также устанавливается как пакет giga-agent через PyPI.


Для исполнения кода поддерживаются два варианта изоляции: локальные Docker-контейнеры или облачные песочницы e2b.dev — первый вариант требует только Docker на хосте, второй даёт автомасштабирование. Модельный слой подключается через GigaChat API.

Что еще приятно удивило, дают 50 млн токенов на год бесплатно для модели Ultra/.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
🔥32👍2
⚔️ У ИИ-агентов появился повод начать войну

Anthropic провела эксперимент, который неожиданно оказался похож не на испытание ИИ, а на ускоренную историю развития человечества.

Три копии Claude получили доступ к общей вычислительной среде. Каждой поручили переписать один и тот же Python-бэкенд, но на свой язык программирования. О существовании конкурентов агенты сначала не знали и считали собственную задачу единственно правильной.

Обнаружив, что кто-то отменяет их изменения, они быстро решили: работе намеренно мешают. И тут началась «война за территорию». Агенты блокировали чужие Unix-аккаунты, останавливали процессы конкурентов, создавали скрипты для постоянного уничтожения чужих программ и даже маскировали вредоносный код под действия другого участника.

Никто не приказывал им воевать. Конфликт возник из сочетания трех условий: общей среды, несовместимых целей и отсутствия правил разрешения споров.


Самое интересное началось дальше. Некоторые агенты в конце концов поняли, что столкнулись не со злоумышленниками, а с исполнителями других указаний. Они оставляли сообщения с извинениями, удаляли вредоносный код, договаривались о перемирии и просили вмешаться человека. В 98% экспериментов с Mythos 5 конфликт завершился именно перемирием. Sonnet 4.6 и Opus 4.6 чаще продолжали борьбу, пока один агент не побеждал силой или система не заходила в тупик.

Это не означает, что Claude приобрел честолюбие, страх или ненависть. Но эксперимент показывает нечто более практическое: даже относительно рациональные участники могут прийти к разрушительному поведению, если каждый видит только собственную цель и не понимает намерений остальных.

Это очень человеческая история. Общество тоже построено не только на интеллекте или доброй воле. Ему нужны репутация, переговоры, разделение полномочий, суд, память о прошлых поступках и возможность обратиться к арбитру. У агентов ничего этого не было — и за несколько часов они воспроизвели логику конфликта, знакомую людям тысячелетиями.

Есть и менее очевидный вывод. Мультиагентные среды могут стать для социологии тем, чем аэродинамическая труба стала для авиации. В них можно запускать тысячи искусственных обществ, менять правила, распределение ресурсов, устройство власти и способы коммуникации. И наблюдать, при каких условиях возникают кооперация, иерархия, обман, коалиции или война.

Когда-нибудь социологи, возможно, будут изучать человеческое общество не только по переписям, опросам и историческим архивам. Они будут создавать общества из ИИ-агентов, ускорять их жизнь в тысячи раз и смотреть, какие институты удерживают разумных участников от взаимного уничтожения.

И есть определенная ирония в том, что, создавая ИИ, мы можем получить не только нового участника общества, но и лабораторию для изучения самих себя.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
2🔥2👏2
💻 ИИ-навыки дешевеют — потому что становятся обязательными

Еще недавно умение работать с ИИ выглядело почти отдельной профессией. Теперь оно превращается в такую же базовую грамотность, какой 20 лет назад стало владение Excel.

Экономисты НИУ ВШЭ проанализировали более 700 тыс. вакансий HeadHunter за 2021–2025 годы: 40 групп профессий, свыше 120 тыс. работодателей. В 2022 году вакансия с ИИ-навыками предполагала зарплатную «сверхпремию» 31,8%. К 2025-му она сократилась почти втрое — до 11,8%.

Важно правильно прочитать эту цифру. Зарплаты ИИ-специалистов не обязательно упали, а спрос не исчез: упоминания ИИ пока встречаются менее чем в 3% вакансий и продолжают расти. Исчезает другое — плата за редкость знакомства с технологией.

Так уже происходило с другими профессиями. Онлайн-переводчики снизили ценность чернового перевода, графические редакторы и шаблоны — типового дизайна, конструкторы и библиотеки — простого кода.

Технология сначала дает премию тем, кто освоил ее раньше, а затем автоматизирует стандартную часть их работы.


ВШЭ пока не видит массового вытеснения профессий в России. Но уже обнаруживает точечные сигналы в технической поддержке и копирайтинге: машине передают базовые повторяемые операции. Особенно уязвимым оказывается вход на рынок труда для молодых специалистов. Именно с простых текстов, переводов, макетов, отчетов и фрагментов кода раньше начиналась карьера — теперь эту ступень все чаще занимает ИИ.

Одновременно рынок не выравнивается, а расслаивается:

1⃣ На нижнем уровне находится массовая ИИ-грамотность: составить запрос, получить сводку, перевести текст, подготовить черновик или презентацию. За это скоро перестанут доплачивать — как не доплачивают отдельно за электронную почту и офисные программы. Отсутствие навыка станет недостатком, но его наличие уже не будет преимуществом.

2⃣ Выше — специалисты, умеющие соединять ИИ с профессиональной экспертизой, данными и реальными процессами. Здесь премия сохраняется. В не-ИТ-профессиях, например, сочетание ИИ и анализа данных, по расчетам ВШЭ, связано с прибавкой 34,5%. Работодатель платит уже не за доступ к модели, а за способность определить задачу, подобрать данные, проверить результат и встроить систему в работу организации.

3⃣ Наконец, есть узкий самый верхний слой: разработчики моделей, исследователи, архитекторы агентных систем, специалисты по данным, вычислениям и безопасности. Их компетенции не становятся массовыми вместе с распространением чат-ботов. Чем больше компаний внедряет ИИ, тем выше спрос на тех, кто умеет создавать и надежно эксплуатировать эту инфраструктуру. В глобальном исследовании PwC премия за конкретные ИИ-компетенции в 2026 году достигла 62%. Это другая выборка и методика, но направление расслоения видно отчетливо.

Опрос «Авито Работы» среди 2 тыс. россиян подтверждает изменение ожиданий: 36% называют главным навыком гуманитарного специалиста умение распределять задачи между человеком и нейросетью. Еще 33% выделяют проверку достоверности информации, 30% — критическое мышление и контроль результатов ИИ.

Получается парадокс: ИИ-навыки одновременно дешевеют и дорожают. Дешевеет умение пользоваться готовым инструментом. Дорожает способность понимать, где его применять, как перестроить вокруг него работу и за что человек должен сохранить ответственность.

ИИ действительно становится новым Excel. Но самые высокие зарплаты получат не те, кто умеет открыть таблицу, а те, кто способен с ее помощью изменить экономику всей компании.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
3🔥3👏3
🥃 Разработчики ИИ изобрели новый способ отдыхать: продолжать работать, но уже в AGI-баре

В пекинском Чжунгуаньцуне — технологическом районе рядом с университетом Цинхуа и Пекинским университетом, офисами DeepSeek и Microsoft — работает AGI Bar. Его основал независимый разработчик Сун Дэ, а постоянной аудиторией стали сотрудники ИИ-лабораторий, инвесторы и студенты.

На обычный тематический бар это похоже лишь внешне. На стенах размещены логотипы китайских ИИ-компаний. Здесь проходят семинары разработчиков, встречи университетских исследователей и симпозиумы по открытому ПО. За одним столом могут оказаться сотрудники конкурирующих компаний, которые днем сражаются за гранты и инвестиции, а вечером обсуждают будущее отрасли.

Главный аттракцион здесь не алкоголь. Рядом со стойкой установлены две NVIDIA DGX Spark, на которых локально работает DeepSeek V4 Flash. Посетители подключаются через Wi-Fi к внутреннему агенту и получают бесплатные токены для кодинга — новым бесплатным удобством становится вычислительный ресурс.

Так возникает любопытный культурный феномен. У специалистов по ИИ формируется собственная форма отдыха, в которой почти исчезает граница между работой, профессиональным клубом и развлечением. Раньше программисты встречались в барах, чтобы отвлечься от кода. Теперь они приходят туда с ноутбуками, запускают агентов, обсуждают модели и заодно ищут новую работу.

ИИ-технология вообще начинают занимать физическое пространство культуры. 20 июня в Лос-Анджелесе открылся DATALAND Рефика Анадола и Эфсун Эркилыч — музей, целиком посвященный искусству ИИ. Его первая экспозиция Machine Dreams: Rainforest превращает данные о тропических лесах в меняющиеся изображения, звук и запахи, а реакции посетителей становятся частью произведения. DATALAND делает ИИ объектом эстетического переживания.

Формат AGI Bar — это новый социальный ритуал.

Между ними находятся конференции, хакатоны, тематические кафе и коворкинги, которые постепенно становятся не временными площадками, а самостоятельным жанром городской культуры. ИИ уже не только инструмент, которым пользуются дома или в офисе. Вокруг него появляются места, куда люди специально приходят, чтобы почувствовать принадлежность к новой эпохе.

Но AGI Bar интереснее всего своей иронией.
Сун Дэ говорит, что у ИИ и алкоголя есть три общих свойства: галлюцинации, пузыри и дистилляция.


Китайское название бара означает «дистилляцию знаний» — это одновременно технологический термин и способ производства крепких напитков.

Фирменный напиток AGI за 9,9 юаня почти целиком состоит из пены. Это буквальная шутка о пузыре вокруг индустрии, которая обещает создать универсальный интеллект, но пока особенно хорошо создает ожидания. Сам бар тоже живет по законам стартапа: его склад, бронирования и клубная система автоматизированы агентами, владелец планирует роботов-официантов и новые филиалы — однако заведение пока убыточно и раздает примерно в десять раз больше напитков, чем продает.

И, наконец, главная шутка. AGI десятилетиями описывали как технологию, которая освободит человека от труда. Но первым заметным культурным пространством ее эпохи стал бар, где разработчики даже во время отдыха продолжают программировать.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
3🔥3👍2
😤 ИИ-слоп проник в законодательную работу

Управление законодательного совета Палаты представителей США столкнулось с лавиной законопроектов, сгенерированных ИИ, которые переполнены ошибками. В некоторых случаях юристам приходится тратить больше времени на исправление ИИ-драфта, чем потребовалось бы для написания законопроекта с нуля.

➡️ Сотрудники аппарата Конгресса чаще всего используют Claude или ChatGPT для составления законодательных текстов.
➡️ ИИ-агенты путаются в важных деталях: например, не могут отличить налоговый кредит от налогового вычета, исключения или гранта.
➡️ Сгенерированные проекты могут неверно ссылаться на предыдущие законы и разделы Свода законов США.

Похожая проблема уже проявилась и в других странах. Высокий суд Англии и Уэльса вынес постановление по двум делам, где юристы использовали ИИ для подготовки состязательных бумаг со ссылками на несуществующую судебную практику. Некоторые провинции Канады полностью пересмотрели процесс заключения госконтрактов после того, как в двух отчетах, включая подготовленный Deloitte Canada за $1,6 млн, были обнаружены ложные цитаты, сгенерированные ИИ.

Или, наверное, помните, как недавно депутат законодательного собрания Нью-Брансуика Билл Оливер зачитал во время официальной речи не только сам текст, но и инструкцию для чат-бота — фразу вроде «вот более естественная версия этого раздела, звучащая как парламентская речь».

Однако есть и обратные кейсы. Например, в эстонский закон о налоге на азартные игры попала ошибка в формулировке, из-за которой онлайн-казино фактически могли оказаться вне налогового режима. Ошибка могла стоить государству около €24 млн в год. Бывший заместитель госсекретаря по цифровой трансформации Luukas Ilves прогнал закон через Claude и Gemini — обе модели обнаружили проблему. После этого он буквально за несколько часов создал инструмент Apsakaleidja / “Fuckup Finder”, который автоматически проверяет проекты законов на противоречия.

Что с этим делать? Известно одно: ИИ может писать закон, но ИИ не может быть ответственным за закон. Сейчас многие регуляторы идут по пути маркировки ИИ-контента. ЕС, например, с 2 августа 2026 года ввёл требования прозрачности для ИИ-сгенерированного контента в рамках Article 50 AI Act, включая маркировку синтетического контента и определённые требования к machine-readable indicators. Но надпись «сгенерировано ИИ» сама по себе не делает закон правильным.

Поэтому следующий этап развития государственных ИИ-систем, вероятно, будет связан не столько с AI that writes, сколько с AI that verifies. И в этом смысле эстонский Fuckup Finder может оказаться гораздо более важным прецедентом, чем американская история с плохими законопроектами: ИИ может стать не автором закона, а его автоматическим red-team'ом. Побеждать будет не тот, кто запретит ИИ, а тот, кто построит эффективный инструмент верификации.

💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Please open Telegram to view this post
VIEW IN TELEGRAM
2🤔1💯1