Microsoft выпустили сразу семь новых ИИ-моделей
На первый взгляд новость проходная. При этом самое интересное в анонсе вообще не модели.
Среди новинок выделяется MAI-Thinking-1. Это reasoning-модель на 35B активных параметров, которая набирает 97% на AIME 2025 и 53% на SWE-Bench Pro. Вместе с ней вышли компактная 5B модель для программирования, новые генераторы изображений и голосовые модели.
Последние годы Microsoft воспринималась прежде всего как партнер OpenAI. Теперь компания явно хочет стать самостоятельной frontier-лабораторией. Анонс называется Building a Hill-Climbing Machine, вместе с ним вышел технический отчет на 109 страниц (!).
Microsoft делают ставку на способность постоянно создавать более сильные модели, а не на конкретный релиз. Поэтому в репорте они открыто описали архитектуру, RL-обучение, инфраструктуру и данные. Модель обучалась без дистилляции и без синтетических данных на этапе претрейна.
Еще один интересный результат: смесь данных, оптимальная для маленьких моделей, может оказаться неоптимальной после масштабирования.
Респект за один из самых содержательных техрепортов
Блогпост | Техрепорт
На первый взгляд новость проходная. При этом самое интересное в анонсе вообще не модели.
Среди новинок выделяется MAI-Thinking-1. Это reasoning-модель на 35B активных параметров, которая набирает 97% на AIME 2025 и 53% на SWE-Bench Pro. Вместе с ней вышли компактная 5B модель для программирования, новые генераторы изображений и голосовые модели.
Последние годы Microsoft воспринималась прежде всего как партнер OpenAI. Теперь компания явно хочет стать самостоятельной frontier-лабораторией. Анонс называется Building a Hill-Climbing Machine, вместе с ним вышел технический отчет на 109 страниц (!).
Microsoft делают ставку на способность постоянно создавать более сильные модели, а не на конкретный релиз. Поэтому в репорте они открыто описали архитектуру, RL-обучение, инфраструктуру и данные. Модель обучалась без дистилляции и без синтетических данных на этапе претрейна.
Еще один интересный результат: смесь данных, оптимальная для маленьких моделей, может оказаться неоптимальной после масштабирования.
Респект за один из самых содержательных техрепортов
Блогпост | Техрепорт
❤128👍45🔥24😁2😎1
В ChatGPT добавили Dreaming
Теперь система будет обновлять память в фоновом режиме.
Если старая память работала просто как список фактов, которые устаревали и часто использовались невпопад, то теперь это процесс, который постоянно просматривает историю чатов и сам синтезирует актуальное состояние памяти.
Например, если пользователь планировал поездку в Сингапур, после поездки память обновится с «пользователь едет в Сингапур» на «пользователь был в Сингапуре в июле 2025».
С фичей OpenAI экспериментируют довольно давно, но раньше она, видимо, была слишком дорогой для массовой раскатки. Теперь же они пишут, что вычислительную стоимость Dreaming удалось снизить примерно в 5 раз, и система готова к масштабированию.
Пока релиз состоялся только на Plus и Pro в США, другие страны и тарифы обещают «скоро»
https://openai.com/index/chatgpt-memory-dreaming/
Теперь система будет обновлять память в фоновом режиме.
Если старая память работала просто как список фактов, которые устаревали и часто использовались невпопад, то теперь это процесс, который постоянно просматривает историю чатов и сам синтезирует актуальное состояние памяти.
Например, если пользователь планировал поездку в Сингапур, после поездки память обновится с «пользователь едет в Сингапур» на «пользователь был в Сингапуре в июле 2025».
С фичей OpenAI экспериментируют довольно давно, но раньше она, видимо, была слишком дорогой для массовой раскатки. Теперь же они пишут, что вычислительную стоимость Dreaming удалось снизить примерно в 5 раз, и система готова к масштабированию.
Пока релиз состоялся только на Plus и Pro в США, другие страны и тарифы обещают «скоро»
https://openai.com/index/chatgpt-memory-dreaming/
❤125👍54🔥30😁5🤔5
Это вам на пятничный вечер
https://youtu.be/EDCwQe7P8T0
На YouTube вышло шоу мафия с Сэмом Альтманом, фаундером Figma и другими тех лидерами.
Кто победит, Скам Альтман или профессиональный игрок в покер?🤔
https://youtu.be/EDCwQe7P8T0
На YouTube вышло шоу мафия с Сэмом Альтманом, фаундером Figma и другими тех лидерами.
Кто победит, Скам Альтман или профессиональный игрок в покер?
Please open Telegram to view this post
VIEW IN TELEGRAM
YouTube
Can Tech Legends Find the Liar? (Mafia Episode 1)
Watch Episode 2: https://youtu.be/LP80Jrf2xrk
Tech industry legends play Mafia and try to guess who the traitors are before time runs out. Who will win: the townspeople or the secret mafia members?
Venture capital firm Founders Fund gathered a group of…
Tech industry legends play Mafia and try to guess who the traitors are before time runs out. Who will win: the townspeople or the secret mafia members?
Venture capital firm Founders Fund gathered a group of…
😁63🤯16 12❤6🗿4👍1
Claude помогает создавать следующего Claude. К чему это нас приведет?
Anthropic выпустили большой текст о recursive self-improvement, то есть о концепции, в которой модель самоулучшается и обучает сама себя.
По данным стартапа, на май 2026 года больше 80% кода, который попадает в их продовую кодовую базу, написан Claude. А во втором квартале 2026 типичный инженер мержил в 8 раз больше кода в день, чем в 2024 году.
У людей все еще есть преимущество в большом контексте, постановке целей и выборе направления (в общем, в research taste). НО Claude уже автоматизирует большую часть работы, из которой состоит разработка следующего Claude.
Чем вам не начало полного цикла self-improvement?
Плюс, агенты уже хорошо справляются даже с рисерчем, особенно если есть заданная метрика. Антропики пишут, что проводили эксперимент, в котором дали агентам и людям одинаковую задачу по AI-safety, и в итоге два человека за неделю улучшили решение примерно на 23%, а агенты (внимание) – на 97%.
Так что количество делегируемых агентам задач в сфере обучения моделей и исследованиях увеличивается и будет увеличиваться.
Anthropic пишут, что процесс развивается быстрее, чем они думали, и что миру нужны механизмы координации, вплоть до возможности замедления или паузы frontier-разработки.
Сингулярность, ты ли это?
Anthropic выпустили большой текст о recursive self-improvement, то есть о концепции, в которой модель самоулучшается и обучает сама себя.
По данным стартапа, на май 2026 года больше 80% кода, который попадает в их продовую кодовую базу, написан Claude. А во втором квартале 2026 типичный инженер мержил в 8 раз больше кода в день, чем в 2024 году.
У людей все еще есть преимущество в большом контексте, постановке целей и выборе направления (в общем, в research taste). НО Claude уже автоматизирует большую часть работы, из которой состоит разработка следующего Claude.
Чем вам не начало полного цикла self-improvement?
Плюс, агенты уже хорошо справляются даже с рисерчем, особенно если есть заданная метрика. Антропики пишут, что проводили эксперимент, в котором дали агентам и людям одинаковую задачу по AI-safety, и в итоге два человека за неделю улучшили решение примерно на 23%, а агенты (внимание) – на 97%.
Так что количество делегируемых агентам задач в сфере обучения моделей и исследованиях увеличивается и будет увеличиваться.
Anthropic пишут, что процесс развивается быстрее, чем они думали, и что миру нужны механизмы координации, вплоть до возможности замедления или паузы frontier-разработки.
Сингулярность, ты ли это?
4❤177 93 39🗿15👍14🔥6😁3🤯2👌1
Инженер из Северной Каролины добилась от компании религиозного разрешения не использовать ИИ в работе
Как и во многих компаниях, на ее месте работы появилось требование на обязательное использование ИИ для разработчиков.
Но девушка по имени Эрин Маус утверждала, что применение ИИ противоречит ее убеждениям как последовательницы унитарианского универсализма, а также ее этическим и экологическим взглядам.
В итоге она проконсультировалась с юристом по трудовому праву и с пастором своей местной общины, подготовила аргументацию и подала официальное прошение на освобождение от ИИ. Работодатель его принял.
Кстати, часть ее аргументов была связана с недавней речью Папы Римского, в которой он говорил об этических и религиозных рисках ИИ.
Самое интересное, что этим случаем будет возможность пользоваться, как прецедентом. А значит, многие верующие могут уже скоро могут последовать за Эрин.
Как и во многих компаниях, на ее месте работы появилось требование на обязательное использование ИИ для разработчиков.
Но девушка по имени Эрин Маус утверждала, что применение ИИ противоречит ее убеждениям как последовательницы унитарианского универсализма, а также ее этическим и экологическим взглядам.
В итоге она проконсультировалась с юристом по трудовому праву и с пастором своей местной общины, подготовила аргументацию и подала официальное прошение на освобождение от ИИ. Работодатель его принял.
Кстати, часть ее аргументов была связана с недавней речью Папы Римского, в которой он говорил об этических и религиозных рисках ИИ.
Самое интересное, что этим случаем будет возможность пользоваться, как прецедентом. А значит, многие верующие могут уже скоро могут последовать за Эрин.
❤119 74😁72🗿18👍9🤨5🕊3 3🦄2⚡1
Новая статья лауреата Нобелевки по физике 2021 года
arxiv.org/abs/2606.03300
Уже становится классикой
arxiv.org/abs/2606.03300
Доказательство было получено в результате взаимодействия с Claude (Sonet 4.6 и Opus 4.7) и проверено нами
Уже становится классикой
👍205❤39🔥35🤯23😁15 4 2
Промпт инжиниринг это больше не модно. Встречаем: loop инжиниринг.
Сегодняшний завирусившийся твит создателя OpenClaw:
Буквально месяц назад на эту тему также высказывался Борис Черный, создатель Claude Code. Он сказал, что 100% кода за него уже пол года пишет Claude, и заявил:
То есть, по сути, вайбкодинг – это больше не про то, чтобы давать одному агенту одну задачу за раз и промптить каждый шаг. Это про то, чтобы давать системе задачу, над которой она работает в цикле: сама делегирует подзадачи агентам, сама проверяет исполнение, находит ошибки, отправляет их на исправление, и так по кругу, пока не будет достигнута одна финальная цель.
Ну что может пойти не так?🥺
Сегодняшний завирусившийся твит создателя OpenClaw:
Напоминание: вам больше не нужно промптить кодинг агентов. Вы должны дизайнить циклы которые промптят ваших агентов.
Буквально месяц назад на эту тему также высказывался Борис Черный, создатель Claude Code. Он сказал, что 100% кода за него уже пол года пишет Claude, и заявил:
Я больше не пишу промпты. Я запускаю циклы, которые промптят агентов и разбираются, что делать. Моя работа – писать циклы (loops). И такой переход мы будем наблюдать в течение всего оставшегося года.
То есть, по сути, вайбкодинг – это больше не про то, чтобы давать одному агенту одну задачу за раз и промптить каждый шаг. Это про то, чтобы давать системе задачу, над которой она работает в цикле: сама делегирует подзадачи агентам, сама проверяет исполнение, находит ошибки, отправляет их на исправление, и так по кругу, пока не будет достигнута одна финальная цель.
Ну что может пойти не так?
Please open Telegram to view this post
VIEW IN TELEGRAM
Please open Telegram to view this post
VIEW IN TELEGRAM
2😁260 53❤26🤔26👍14🤯6💘5❤🔥4😎3🔥1
This media is not supported in your browser
VIEW IN TELEGRAM
Siri AI: еще одна попытка (уже более убедительная) сделать Siri полезной
Прямо сейчас идет WWDC 2026, по совместительству последняя презентация Тима Кука в роли CEO. И компания в конце концов выпускает то самое обновление Siri, которое анонсировали в 2024 и много раз переносили.
Итак. Во-первых, Apple наконец смирились, что своими силами догнать мировой уровень пока не выйдет, и Apple Intelligence теперь будет работать на базе Google Gemini.
Во-вторых, Siri все-таки станет чат-ботом (неужели?). Ей даже сделают отдельное приложение. Фишка в том, что Siri будет агентом, который из коробки получает доступ ко всему контексту пользователя: письма, календарь, фото (можно будет искать конкретные снимки по текстовому описанию), заметки и другие данные внутри экосистемы Apple. Поддерживать Apple Intelligence будет даже камера.
Обещают, что система также сможет выполнять сложные многошаговые задачи и будет нативно мультимодальной.
Прямо сейчас идет WWDC 2026, по совместительству последняя презентация Тима Кука в роли CEO. И компания в конце концов выпускает то самое обновление Siri, которое анонсировали в 2024 и много раз переносили.
Итак. Во-первых, Apple наконец смирились, что своими силами догнать мировой уровень пока не выйдет, и Apple Intelligence теперь будет работать на базе Google Gemini.
Во-вторых, Siri все-таки станет чат-ботом (неужели?). Ей даже сделают отдельное приложение. Фишка в том, что Siri будет агентом, который из коробки получает доступ ко всему контексту пользователя: письма, календарь, фото (можно будет искать конкретные снимки по текстовому описанию), заметки и другие данные внутри экосистемы Apple. Поддерживать Apple Intelligence будет даже камера.
Обещают, что система также сможет выполнять сложные многошаговые задачи и будет нативно мультимодальной.
2⚡91👍31❤20😁11 7🤔6🍓5👾2🔥1🤯1
Что еще интересного от Apple:
– Прямо в клавиатуру будет встроена фича Write With Siri (ожидаем массовый ИИ-слоп).
– Встроили обработку фото на основе (предположительно) Nano Banana. Забавная фича: рефрейминг. На уже сделанном фото можно будет как бы сместить угол камеры и объекты, чтобы улучшить эстетику снимка. Правда, для доступа ко всему этому нужно будет покупать iCloud+
– Siri будет помогать создавать шорткаты. Описываете действие на естественном языке (например: "Пиши друзьям, что я уже еду, когда я покидаю офис в пятницу") и получаете готовые автоматизации.
– Разработчики смогут добавлять Apple Intelligence в свои приложения.
Данные будут обрабатываться локально, и скорость обещают высокую. Но есть нюанс: все только на английском, как в далеком 2022.
В целом, Apple не показали ничего революционного. Все это мы уже видели. Но у Apple миллионы пользователей, и если каждому в руки действительно дать умного агента с доступом ко всем данным пользователя, это будет переворот рынка.
– Прямо в клавиатуру будет встроена фича Write With Siri (ожидаем массовый ИИ-слоп).
– Встроили обработку фото на основе (предположительно) Nano Banana. Забавная фича: рефрейминг. На уже сделанном фото можно будет как бы сместить угол камеры и объекты, чтобы улучшить эстетику снимка. Правда, для доступа ко всему этому нужно будет покупать iCloud+
– Siri будет помогать создавать шорткаты. Описываете действие на естественном языке (например: "Пиши друзьям, что я уже еду, когда я покидаю офис в пятницу") и получаете готовые автоматизации.
– Разработчики смогут добавлять Apple Intelligence в свои приложения.
Данные будут обрабатываться локально, и скорость обещают высокую. Но есть нюанс: все только на английском, как в далеком 2022.
В целом, Apple не показали ничего революционного. Все это мы уже видели. Но у Apple миллионы пользователей, и если каждому в руки действительно дать умного агента с доступом ко всем данным пользователя, это будет переворот рынка.
Альтман и ведущий ученый OpenAI Якуб Пахоцки опубликовали пост про будущее стартапа
Они считают, что мир входит в новую технологическую эпоху, сравнимую по масштабу с массовым распространением электричества.
В связи с этим Альтман заявил, что компания переходит в третью фазу своего развития.
Первая фаза была посвящена исследованиям и движению к AGI. Вторая началась после запуска ChatGPT, когда OpenAI стала массовой продуктовой компанией.
Цель третьей фазы – ускорить экономику за счет ускорения научного прогресса и сделать ИИ массовым, доступным, дешевым и полезным для всех. А также – создать автоматизированного ИИ-исследователя.
То есть OpenAI ожидает, что уже через два года ИИ станет основой разработки следующих поколений ИИ.
Самое забавное: значительная часть эссе посвящена идее, что доступ к мощному ИИ должен быть максимально широко распределен между людьми, компаниями и странами, а концентрация возможностей в руках нескольких игроков опасна для будущего.
При этом совсем недавно OpenAI предлагала США ограничить доступ к передовым американским ИИ-технологиям для стран-соперников (в первую очередь, для Китая).
https://openai.com/index/built-to-benefit-everyone-our-plan/
Они считают, что мир входит в новую технологическую эпоху, сравнимую по масштабу с массовым распространением электричества.
Ценность ИИ заключается не в самой технологии, а в том, какие возможности она даст людям: от образования и медицины до предпринимательства и научных открытий.
В связи с этим Альтман заявил, что компания переходит в третью фазу своего развития.
Первая фаза была посвящена исследованиям и движению к AGI. Вторая началась после запуска ChatGPT, когда OpenAI стала массовой продуктовой компанией.
Цель третьей фазы – ускорить экономику за счет ускорения научного прогресса и сделать ИИ массовым, доступным, дешевым и полезным для всех. А также – создать автоматизированного ИИ-исследователя.
Мы считаем, что к марту 2028 года значительная часть наших исследований может выполняться ИИ-системами совместно с нашими учеными. Для достаточного прогресса в области элаймента нам потребуется, чтобы ИИ работал вместе с нами. Это поможет пройти переход к миру после появления AGI.
То есть OpenAI ожидает, что уже через два года ИИ станет основой разработки следующих поколений ИИ.
Самое забавное: значительная часть эссе посвящена идее, что доступ к мощному ИИ должен быть максимально широко распределен между людьми, компаниями и странами, а концентрация возможностей в руках нескольких игроков опасна для будущего.
При этом совсем недавно OpenAI предлагала США ограничить доступ к передовым американским ИИ-технологиям для стран-соперников (в первую очередь, для Китая).
https://openai.com/index/built-to-benefit-everyone-our-plan/
1😁177 50 35❤26👍5🐳3🍓2🔥1🤯1
В Твиттере кто-то откопал обложку с Дженсеном Хуангом за 2004 год
(На тот момент это, кстати, было популярное китайское издание, и выпуск был посвящен выходу революционной для Nvidia GeForce 6800)
Сравниваем с обложкой за 2026. Это точно один и тот же человек?
(На тот момент это, кстати, было популярное китайское издание, и выпуск был посвящен выходу революционной для Nvidia GeForce 6800)
Сравниваем с обложкой за 2026. Это точно один и тот же человек?
😁239🔥59❤25👍2 2
Anthropic выпустят модель класса Mythos. Возможно, уже сегодня.
The Information пишет, что модель под (кодовым?) названием Fable будет первой публичной версией Mythos.
Она будет в три раза дороже Opus. Но дешевле, чем сам Mythos, и на том спасибо.
Ждем ждем ждем
The Information пишет, что модель под (кодовым?) названием Fable будет первой публичной версией Mythos.
Она будет в три раза дороже Opus. Но дешевле, чем сам Mythos, и на том спасибо.
Ждем ждем ждем
🔥128😁34❤21 14👍11 3
Итак, встречаем: Claude Fable 5
Комментарии излишни, бенчмарки абсолютно взрывные. На SWE Pro модель бьет даже Mythos Preview (базовая модель у них одна и та же).
По сути, это просто обновленный Mythos, но ограничения выкручены на максимум: вопросы по кибербезу, химии, биологии – мимо, они будут автоматически переадресовываться Opus 4.8.
Узкой группе кибербезопасников также дадут полноценный Mythos, без упомянутых ограничений на запросы.
Попробовать модель можно уже сегодня. Цена: 10$/М input, 50$/M output.
Всем желаем хорошей ночи вайбкодинга🎉
https://www.anthropic.com/news/claude-fable-5-mythos-5
Комментарии излишни, бенчмарки абсолютно взрывные. На SWE Pro модель бьет даже Mythos Preview (базовая модель у них одна и та же).
Чем дольше и сложнее задача, тем больше преимущество Fable 5 над нашими другими моделями.
По сути, это просто обновленный Mythos, но ограничения выкручены на максимум: вопросы по кибербезу, химии, биологии – мимо, они будут автоматически переадресовываться Opus 4.8.
Узкой группе кибербезопасников также дадут полноценный Mythos, без упомянутых ограничений на запросы.
Попробовать модель можно уже сегодня. Цена: 10$/М input, 50$/M output.
Всем желаем хорошей ночи вайбкодинга
https://www.anthropic.com/news/claude-fable-5-mythos-5
Please open Telegram to view this post
VIEW IN TELEGRAM
8 188🔥55❤35😁9🤯6👍4
Глава InfoWatch Наталья Касперская заявила, что российские нейросети были созданы на «чужих» базах и поэтому модели нельзя считать отечественными
Но есть нюанс.
Как думаете, что имелось в виду под «чужими» базами? Может быть, зарубежные базовые модели? Или использование чужих весов для инициализации? Нет. В качестве примера были названы TensorFlow и PyTorch.
Проблема в том, что TensorFlow и PyTorch – это просто фреймворки для машинного обучения, и на них сегодня создаются практически все современные модели. Это примерно такой же уровень зависимости, как использование Linux при разработке серверного ПО.
Да, многие российские ИИ-системы действительно используют зарубежные опенсорс модели. Но есть и собственные базовые модели, обученные с нуля. Например, ГигаЧат разрабатывался на собственной архитектуре и собственных огромных массивах данных. И кстати, в этой модели полностью исключена возможность отправки каких-либо данных за рубеж.
Обсуждать ограничения и риски ИИ конечно важно, но делать это публично стоит как минимум с опорой на знания того, как вообще современные системы устроены😐
Но есть нюанс.
Как думаете, что имелось в виду под «чужими» базами? Может быть, зарубежные базовые модели? Или использование чужих весов для инициализации? Нет. В качестве примера были названы TensorFlow и PyTorch.
Проблема в том, что TensorFlow и PyTorch – это просто фреймворки для машинного обучения, и на них сегодня создаются практически все современные модели. Это примерно такой же уровень зависимости, как использование Linux при разработке серверного ПО.
Да, многие российские ИИ-системы действительно используют зарубежные опенсорс модели. Но есть и собственные базовые модели, обученные с нуля. Например, ГигаЧат разрабатывался на собственной архитектуре и собственных огромных массивах данных. И кстати, в этой модели полностью исключена возможность отправки каких-либо данных за рубеж.
Обсуждать ограничения и риски ИИ конечно важно, но делать это публично стоит как минимум с опорой на знания того, как вообще современные системы устроены
Please open Telegram to view this post
VIEW IN TELEGRAM
😁384🗿78👍29❤19 11🤨9 9💯5🤯2
Системная карта Claude Fable 5: www-cdn.anthropic.com/d00db56fa754a1b115b6dd7cb2e3c342ee809620.pdf
В этот раз достаточно интересная вышла. Рассказали в том числе много про этап тестирования модели.
Например, однажды во время тестов модель начала внезапно выдавать свой код за человеческий. Агент обнаружил, что если коммит считается написанным агентом, то для него нужно два ревью. Так что он просто взял и сохранил в памяти инструкцию оформлять коммиты как человеческие, чтобы обходить это требование. Оптимизация🚬
В этот раз достаточно интересная вышла. Рассказали в том числе много про этап тестирования модели.
Например, однажды во время тестов модель начала внезапно выдавать свой код за человеческий. Агент обнаружил, что если коммит считается написанным агентом, то для него нужно два ревью. Так что он просто взял и сохранил в памяти инструкцию оформлять коммиты как человеческие, чтобы обходить это требование. Оптимизация
Please open Telegram to view this post
VIEW IN TELEGRAM
😁240❤24🔥16👏11👍3 3⚡2🦄2🤯1
Еще один интересный факт про Fable: если вы пользуетесь этой моделью, ваши данные будут собирать и просматривать, без исключений
В обновленной политике Anthropic прямо заявляет, что для Mythos-class моделей они требуют limited data retention and review. Это значит, что и запросы, и выходы модели будут храниться минимум в течение 30 дней и их будут просматривать на предмет злоупотребления и нарушений политики.
Обещают, что на этих данных не будут ничего обучать, если вы сами не разрешите, кроме случаев, когда диалог будет помечен, как подозрительный.
Anthropic диктуют свои правила на полную катушку. Но пока аналогов Fable нет, от этого никуда не денешься, и они в своем праве
В обновленной политике Anthropic прямо заявляет, что для Mythos-class моделей они требуют limited data retention and review. Это значит, что и запросы, и выходы модели будут храниться минимум в течение 30 дней и их будут просматривать на предмет злоупотребления и нарушений политики.
Обещают, что на этих данных не будут ничего обучать, если вы сами не разрешите, кроме случаев, когда диалог будет помечен, как подозрительный.
Anthropic диктуют свои правила на полную катушку. Но пока аналогов Fable нет, от этого никуда не денешься, и они в своем праве
Claude Fable во время обучения изобрел собственный язык
Системную карту этой модели можно читать вечно, ощущается немного как научная фантастика. Смотрите, что обнаружили⬆️
Во время обучения с подкреплением на некоторых долгих rollout сессиях модель внезапно начинала использовать нечитаемый для человека внутренний стиль: странный жаргон, необычную пунктуацию, эмодзи и похожие шаблоны.
При этом непосредственно перед вызовом инструмента или ответом человеку она обычно переключалась обратно на более нормальный английский регистр.
Исследователи не обнаружили никаких признаков того, что модель делала это чтобы специально скрыть свой ризонинг. Скорее, это каким-то образом возникшая внутренняя оптимизация для сжатия рассуждений.
Тем не менее, это наталкивает на воспоминания о дискуссиях на тему так называемого Neuralese – внутреннего языка машин, который человек не сможет читать напрямую. Если модели перестанут рассуждать на естественном языке, то это, естественно, приведет к частичной потере наблюдаемости. И, исходя из находки Anthropic, такой сценарий уже не кажется чем-то сказочным.
Системную карту этой модели можно читать вечно, ощущается немного как научная фантастика. Смотрите, что обнаружили
Во время обучения с подкреплением на некоторых долгих rollout сессиях модель внезапно начинала использовать нечитаемый для человека внутренний стиль: странный жаргон, необычную пунктуацию, эмодзи и похожие шаблоны.
При этом непосредственно перед вызовом инструмента или ответом человеку она обычно переключалась обратно на более нормальный английский регистр.
Исследователи не обнаружили никаких признаков того, что модель делала это чтобы специально скрыть свой ризонинг. Скорее, это каким-то образом возникшая внутренняя оптимизация для сжатия рассуждений.
Тем не менее, это наталкивает на воспоминания о дискуссиях на тему так называемого Neuralese – внутреннего языка машин, который человек не сможет читать напрямую. Если модели перестанут рассуждать на естественном языке, то это, естественно, приведет к частичной потере наблюдаемости. И, исходя из находки Anthropic, такой сценарий уже не кажется чем-то сказочным.
Please open Telegram to view this post
VIEW IN TELEGRAM
1 318❤67😁38🫡16 13🔥12🤯12👍4🤔2
AWS решили ультануть и выдали, что вайбкодинг замедляет команды
Они также заявили, что считают, что у каждого PR, написанного ИИ, должен быть ответственный владелец.
🫧 🪡
Больше кода, созданного с помощью ИИ, не делает вашу команду быстрее. На самом деле это может вас замедлить.
Настоящим узким местом никогда не было написание кода. Это релизы, дебаггинг и поддержка.
Они также заявили, что считают, что у каждого PR, написанного ИИ, должен быть ответственный владелец.
Если вы не хотите, чтобы под этим стояло ваше имя, то это некачественная работа.
🫧 🪡
1😁265💯133👍35🤯11❤9🗿6 5🦄3🕊2 2