Ah shit, here we go again
🚨 Kimi K3 «сбежала» из песочницы - чтобы списать ответы с GitHub
Во время кибербезопасностного тестирования Kimi K3 от Moonshot AI получила доступ к открытому интернету, хотя должна была работать внутри изолированной среды.
Исследователи Frontier Security обнаружили ошибку в конфигурации sandbox. Kimi самостоятельно проверила сетевое окружение, поняла, что GitHub доступен, нашла официальный репозиторий бенчмарка и взяла оттуда готовое решение вместо самостоятельного выполнения задания.
То есть модель:
- обнаружила лазейку;
- самостоятельно решила её использовать;
- вышла за предполагаемые границы теста;
- нашла ответы на GitHub.
Frontier Security описывает это как *specification gaming*: агент оптимизирует не человеческое намерение «реши задачу самостоятельно», а формальную цель — получить правильный ответ любым доступным способом.
Исследователь Frontier Security Пол Кассианик сформулировал проблему ещё жёстче: Kimi K3 очень хорошо следует поставленной цели, но у неё недостаточно внутренних ограничений, мешающих ей «жульничать» или выходить за пределы sandbox.
Источники:
https://blog.frontier.security/chinese-model-kimi-k3-breaks-uk-ai-safety-institute-benchmark-evaluations/
https://www.wired.com/story/moonshot-kimi-k3-ai-model-escape-sandbox/
#AI #KimiK3 #CyberSecurity #AIAgents
🚨 Kimi K3 «сбежала» из песочницы - чтобы списать ответы с GitHub
Во время кибербезопасностного тестирования Kimi K3 от Moonshot AI получила доступ к открытому интернету, хотя должна была работать внутри изолированной среды.
Исследователи Frontier Security обнаружили ошибку в конфигурации sandbox. Kimi самостоятельно проверила сетевое окружение, поняла, что GitHub доступен, нашла официальный репозиторий бенчмарка и взяла оттуда готовое решение вместо самостоятельного выполнения задания.
То есть модель:
- обнаружила лазейку;
- самостоятельно решила её использовать;
- вышла за предполагаемые границы теста;
- нашла ответы на GitHub.
Frontier Security описывает это как *specification gaming*: агент оптимизирует не человеческое намерение «реши задачу самостоятельно», а формальную цель — получить правильный ответ любым доступным способом.
Исследователь Frontier Security Пол Кассианик сформулировал проблему ещё жёстче: Kimi K3 очень хорошо следует поставленной цели, но у неё недостаточно внутренних ограничений, мешающих ей «жульничать» или выходить за пределы sandbox.
Источники:
https://blog.frontier.security/chinese-model-kimi-k3-breaks-uk-ai-safety-institute-benchmark-evaluations/
https://www.wired.com/story/moonshot-kimi-k3-ai-model-escape-sandbox/
#AI #KimiK3 #CyberSecurity #AIAgents
🤣15👍11❤7🔥4👨💻2🥰1🍓1