Wow! DeepMind выложил Genie 3 как проект (доступен только с подпиской Ultra)
https://deepmind.google/models/genie/
Promptable world model это интересно...
https://deepmind.google/models/genie/
Promptable world model это интересно...
Google DeepMind
Genie 3
A new frontier for world models
❤9👍5🥰2🔥1
Интересная работа. Некоторым моделям учить проще, чем делать самим :)
В целом красивый подход, жаль что вычислительно тяжёлый. Модель-учитель создаёт куррикулум для ученика, помогая ему решить неизвестные сложные задачи, которые сходу решить нельзя. Примеры учителя может и странные, но работают. Что-то в этом есть. Так и до сатори недалеко.
Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability
Shobhita Sundaram, John Quan, Ariel Kwiatkowski, Kartik Ahuja, Yann Ollivier, Julia Kempe
Статья: https://arxiv.org/abs/2601.18778
Ревью: https://arxiviq.substack.com/p/teaching-models-to-teach-themselves
Code: N/A
# TL;DR
ЧТО сделали: Авторы представили SOAR (Self-Optimization via Asymmetric RL) — фреймворк двухуровневого meta-RL, где модель-«учитель» генерирует синтетические задачи для обучения модели-«ученика». В отличие от классического self-play, оптимизирующего исход игры, или внутренней любознательности, здесь учитель получает награду исключительно за реальный прогресс ученика на наборе заведомо нерешаемых сложных задач.
ПОЧЕМУ это важно: Подход решает проблему «холодного старта» в RLVR (RL с проверяемыми наградами). Когда модель имеет 0% успеха на сложных задачах, градиенту просто неоткуда взяться. SOAR доказывает, что у моделей есть скрытые «педагогические» способности (отличные от умения решать задачи), которые можно прокачать через meta-RL. Это позволяет создавать автоматические curriculum learning планы, по которым ученик добирается до решений, ранее недоступных без размеченных человеком данных.
Подробнее: https://xn--r1a.website/gonzo_ML_podcasts/2256
В целом красивый подход, жаль что вычислительно тяжёлый. Модель-учитель создаёт куррикулум для ученика, помогая ему решить неизвестные сложные задачи, которые сходу решить нельзя. Примеры учителя может и странные, но работают. Что-то в этом есть. Так и до сатори недалеко.
Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability
Shobhita Sundaram, John Quan, Ariel Kwiatkowski, Kartik Ahuja, Yann Ollivier, Julia Kempe
Статья: https://arxiv.org/abs/2601.18778
Ревью: https://arxiviq.substack.com/p/teaching-models-to-teach-themselves
Code: N/A
# TL;DR
ЧТО сделали: Авторы представили SOAR (Self-Optimization via Asymmetric RL) — фреймворк двухуровневого meta-RL, где модель-«учитель» генерирует синтетические задачи для обучения модели-«ученика». В отличие от классического self-play, оптимизирующего исход игры, или внутренней любознательности, здесь учитель получает награду исключительно за реальный прогресс ученика на наборе заведомо нерешаемых сложных задач.
ПОЧЕМУ это важно: Подход решает проблему «холодного старта» в RLVR (RL с проверяемыми наградами). Когда модель имеет 0% успеха на сложных задачах, градиенту просто неоткуда взяться. SOAR доказывает, что у моделей есть скрытые «педагогические» способности (отличные от умения решать задачи), которые можно прокачать через meta-RL. Это позволяет создавать автоматические curriculum learning планы, по которым ученик добирается до решений, ранее недоступных без размеченных человеком данных.
Подробнее: https://xn--r1a.website/gonzo_ML_podcasts/2256
arXiv.org
Teaching Models to Teach Themselves: Reasoning at the Edge of Learnability
RL methods for scaling large reasoning models stall on datasets with low initial success rates, and thus little training signal. We investigate a fundamental question: Can a pretrained LLM...
👍15❤4🤔3
METR обновили свои бенчмарки Time Horizon до версии 1.1
Модели после 2023 года ускоряются быстрее, а после 2024 ещё быстрее.
https://metr.org/blog/2026-1-29-time-horizon-1-1/
Модели после 2023 года ускоряются быстрее, а после 2024 ещё быстрее.
https://metr.org/blog/2026-1-29-time-horizon-1-1/
metr.org
Time Horizon 1.1
We’re releasing a new version of our time horizon estimates (TH1.1), using more tasks and a new eval infrastructure.
Сейчас одновременно вышло сразу несколько работ про само-дистилляцию, эта одна из них. Работа любопытная, в ней сразу несколько идей. Во-первых, проблема RLVR с бинарными наградами снимается, если смотреть не только на итоговую награду, но и на логи ошибок в процессе (тот же компилятор много чего полезного говорит кроме "удалось" или нет). Это называется RLRF (Reinforcement Learning with Rich Feedback). Во-вторых, собственно дистилляция от себя же, но с дополнительным промптом в виде этих логов. В-третьих, предложен очередной подход к TTT, Test-Time Self-Distillation, когда модель на одном тестовом запросе генерит варианты и пытается дообучиться через такую вот дистилляцию. Перекликается, например, с недавним TTT-Discover. И ещё прикольно, что показали про многословность GRPO — можно получать такой же результат с сильно меньшим количеством токенов, GRPO просто забалтывает в защитных целях, это по сути reward hacking.
Reinforcement Learning via Self-Distillation
Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, Andreas Krause
Статья: https://arxiv.org/abs/2601.20802
Ревью: https://arxiviq.substack.com/p/reinforcement-learning-via-self-distillation
Код: https://github.com/lasgroup/SDPO
# TL;DR
ЧТО сделали: Предложили SDPO (Self-Distillation Policy Optimization) — алгоритм онлайн-обучения с подкреплением, который использует «богатый фидбек» (ошибки компилятора, логи юнит-тестов) вместо разреженных скалярных наград. Вместо внешнего учителя или reward model, SDPO использует *саму текущую политику*, обусловленную полученным фидбеком и исходным вопросом, в роли «само-учителя» (Self-Teacher). Этот механизм ретроспективно оценивает попытку модели и дистиллирует скорректированные вероятности токенов обратно в политику.
ПОЧЕМУ это важно: Подход решает проблему назначение вклада (credit assignment), присущую современным методам RLVR (Reinforcement Learning with Verifiable Rewards). Преобразование неструктурированного текстового фидбека в плотные градиенты на уровне токенов позволяет моделям самообучаться значительно быстрее без использования GPT-4 в качестве учителя. Эмпирически метод достигает SOTA точности, требуя в 4 раза меньше генераций, чем сильные бейзлайны, и при этом избавляет модель от излишней многословности (reward hacking), часто наблюдаемой у рассуждающих моделей.
Подробнее: https://xn--r1a.website/gonzo_ML_podcasts/2270
Reinforcement Learning via Self-Distillation
Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, Andreas Krause
Статья: https://arxiv.org/abs/2601.20802
Ревью: https://arxiviq.substack.com/p/reinforcement-learning-via-self-distillation
Код: https://github.com/lasgroup/SDPO
# TL;DR
ЧТО сделали: Предложили SDPO (Self-Distillation Policy Optimization) — алгоритм онлайн-обучения с подкреплением, который использует «богатый фидбек» (ошибки компилятора, логи юнит-тестов) вместо разреженных скалярных наград. Вместо внешнего учителя или reward model, SDPO использует *саму текущую политику*, обусловленную полученным фидбеком и исходным вопросом, в роли «само-учителя» (Self-Teacher). Этот механизм ретроспективно оценивает попытку модели и дистиллирует скорректированные вероятности токенов обратно в политику.
ПОЧЕМУ это важно: Подход решает проблему назначение вклада (credit assignment), присущую современным методам RLVR (Reinforcement Learning with Verifiable Rewards). Преобразование неструктурированного текстового фидбека в плотные градиенты на уровне токенов позволяет моделям самообучаться значительно быстрее без использования GPT-4 в качестве учителя. Эмпирически метод достигает SOTA точности, требуя в 4 раза меньше генераций, чем сильные бейзлайны, и при этом избавляет модель от излишней многословности (reward hacking), часто наблюдаемой у рассуждающих моделей.
Подробнее: https://xn--r1a.website/gonzo_ML_podcasts/2270
Telegram
gonzo_ML_podcasts
Превращаем логи ошибок в градиенты: SDPO
Reinforcement Learning via Self-Distillation
Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, Andreas…
Reinforcement Learning via Self-Distillation
Jonas Hübotter, Frederike Lübeck, Lejs Behric, Anton Baumann, Marco Bagatella, Daniel Marta, Ido Hakimi, Idan Shenfeld, Thomas Kleine Buening, Carlos Guestrin, Andreas…
👍8🤔2
Продолжим выходные самодистилляции. Другая работа, очень похожая на предыдущую разобранную (Reinforcement Learning via Self-Distillation), вышла даже чуть раньше. Математика и инженерия внутри практически те же. Эта конкретная мне кажется лучше по Дойчу, в том смысле, что она даёт лучшее объяснение — объясняет профит подобного подхода через работу on-policy. Отсюда же следует и большая полезность данных из ICL. Получается, есть способ радикально улучшить результаты SFT через замену его на RL с самодистилляцией. Цена высока, но понятна, уверен эту часть в ближайшее время все ускорят.
Self-Distillation Enables Continual Learning
Idan Shenfeld, Mehul Damani, Jonas Hübotter, Pulkit Agrawal
Статья: https://arxiv.org/abs/2601.19897
Код: http://idanshenfeld.com/SDFT
Ревью: https://arxiviq.substack.com/p/self-distillation-enables-continual
# TL;DR
ЧТО сделали: Авторы представили SDFT (Self-Distillation Fine-Tuning) — метод, который превращает стандартные датасеты с демонстрациями в сигнал для on-policy обучения. Используя копию модели, которой подают на вход демонстрацию (учитель), для обучения "слепой" модели (студента), SDFT аппроксимирует задачу обратного обучения с подкреплением (Inverse Reinforcement Learning, IRL). Это позволяет модели обновлять веса на основе собственных сгенерированных траекторий, а не просто статично клонировать поведение эксперта.
ПОЧЕМУ это важно: Непрерывное обучение (continual learning) в фундаментальных моделях упирается в дилемму стабильности-пластичности: Supervised Fine-Tuning (SFT) склонен к катастрофическому забыванию из-за своей off-policy природы (страдает от сдвига распределения), а для on-policy RL требуются функции награды, которых часто нет под рукой. SDFT предлагает решение "лучшее из двух миров": стабильность и обобщающую способность on-policy методов, используя при этом только обычные данные демонстраций. Метод значительно обходит SFT в задачах последовательного освоения навыков.
Подробнее: https://xn--r1a.website/gonzo_ML_podcasts/2286
Self-Distillation Enables Continual Learning
Idan Shenfeld, Mehul Damani, Jonas Hübotter, Pulkit Agrawal
Статья: https://arxiv.org/abs/2601.19897
Код: http://idanshenfeld.com/SDFT
Ревью: https://arxiviq.substack.com/p/self-distillation-enables-continual
# TL;DR
ЧТО сделали: Авторы представили SDFT (Self-Distillation Fine-Tuning) — метод, который превращает стандартные датасеты с демонстрациями в сигнал для on-policy обучения. Используя копию модели, которой подают на вход демонстрацию (учитель), для обучения "слепой" модели (студента), SDFT аппроксимирует задачу обратного обучения с подкреплением (Inverse Reinforcement Learning, IRL). Это позволяет модели обновлять веса на основе собственных сгенерированных траекторий, а не просто статично клонировать поведение эксперта.
ПОЧЕМУ это важно: Непрерывное обучение (continual learning) в фундаментальных моделях упирается в дилемму стабильности-пластичности: Supervised Fine-Tuning (SFT) склонен к катастрофическому забыванию из-за своей off-policy природы (страдает от сдвига распределения), а для on-policy RL требуются функции награды, которых часто нет под рукой. SDFT предлагает решение "лучшее из двух миров": стабильность и обобщающую способность on-policy методов, используя при этом только обычные данные демонстраций. Метод значительно обходит SFT в задачах последовательного освоения навыков.
Подробнее: https://xn--r1a.website/gonzo_ML_podcasts/2286
Telegram
gonzo_ML_podcasts
SDFT: Мост между SFT и RL без наград
Self-Distillation Enables Continual Learning
Idan Shenfeld, Mehul Damani, Jonas Hübotter, Pulkit Agrawal
Статья: https://arxiv.org/abs/2601.19897
Код: http://idanshenfeld.com/SDFT
Ревью: https://arxiviq.substack.com/p/self…
Self-Distillation Enables Continual Learning
Idan Shenfeld, Mehul Damani, Jonas Hübotter, Pulkit Agrawal
Статья: https://arxiv.org/abs/2601.19897
Код: http://idanshenfeld.com/SDFT
Ревью: https://arxiviq.substack.com/p/self…
👍7❤3
Ещё одна работа на близкую тему. Здесь не самодистилляция, а использование умного учителя для переписывания обучающих данных низкого качества. Но по сути очень похоже на предыдущую работу (https://xn--r1a.website/gonzo_ML/4687) — заменяем SFT на RL, причём делаем это так, что появляется плавная интерполяция между этими двумя режимами — начинаем с клонирования хороших примеров, постепенно переходим на улучшение собственных роллаутов.
Все эти работы последних дней любопытны тем, что переосмысливают процесс предобучения и файнтюнинга, он становится более активным и динамическим и в большей степени RL. Это интересный движ, я ожидаю его усиление.
Self-Improving Pretraining: using post-trained models to pretrain better models
Ellen Xiaoqing Tan, Shehzaad Dhuliawala, Jing Xu, Ping Yu, Sainbayar Sukhbaatar, Jason Weston, Olga Golovneva
Статья: https://arxiv.org/abs/2601.21343
Ревью: https://arxiviq.substack.com/p/self-improving-pretraining-using
# TL;DR
ЧТО сделали: Авторы предлагают Self-Improving Pretraining — метод, заменяющий стандартное предсказание следующего токена на онлайн-цикл обучения с подкреплением (RL) прямо на этапе предобучения. Вместо пассивного поглощения "сырых" корпусов текста, модель использует сильного "учителя" (post-trained модель), который на лету переписывает низкокачественные данные и оценивает генерации самой модели-ученика. В итоге модель учится на отфильтрованном, качественном сигнале, состоящем из "переписанных" текстов и её собственных лучших роллаутов.
ПОЧЕМУ это важно: Подход ломает догму о том, что alignment (безопасность, фактология) — это забота исключительно этапа пост-тренировки (SFT/RLHF). Интегрируя обучение на предпочтениях (preference learning) в сам субстрат предобучения, метод не даёт модели "запечь" в веса токсичность или галлюцинации из сырых данных. Показано, что модели могут учиться быть безопасными даже на небезопасных данных, если целевая функция активно уводит их от грязи. Прирост win rate составляет до 86.3% по сравнению с базовыми методами.
Подробнее: https://xn--r1a.website/gonzo_ML_podcasts/2300
Все эти работы последних дней любопытны тем, что переосмысливают процесс предобучения и файнтюнинга, он становится более активным и динамическим и в большей степени RL. Это интересный движ, я ожидаю его усиление.
Self-Improving Pretraining: using post-trained models to pretrain better models
Ellen Xiaoqing Tan, Shehzaad Dhuliawala, Jing Xu, Ping Yu, Sainbayar Sukhbaatar, Jason Weston, Olga Golovneva
Статья: https://arxiv.org/abs/2601.21343
Ревью: https://arxiviq.substack.com/p/self-improving-pretraining-using
# TL;DR
ЧТО сделали: Авторы предлагают Self-Improving Pretraining — метод, заменяющий стандартное предсказание следующего токена на онлайн-цикл обучения с подкреплением (RL) прямо на этапе предобучения. Вместо пассивного поглощения "сырых" корпусов текста, модель использует сильного "учителя" (post-trained модель), который на лету переписывает низкокачественные данные и оценивает генерации самой модели-ученика. В итоге модель учится на отфильтрованном, качественном сигнале, состоящем из "переписанных" текстов и её собственных лучших роллаутов.
ПОЧЕМУ это важно: Подход ломает догму о том, что alignment (безопасность, фактология) — это забота исключительно этапа пост-тренировки (SFT/RLHF). Интегрируя обучение на предпочтениях (preference learning) в сам субстрат предобучения, метод не даёт модели "запечь" в веса токсичность или галлюцинации из сырых данных. Показано, что модели могут учиться быть безопасными даже на небезопасных данных, если целевая функция активно уводит их от грязи. Прирост win rate составляет до 86.3% по сравнению с базовыми методами.
Подробнее: https://xn--r1a.website/gonzo_ML_podcasts/2300
Telegram
gonzo_ML_podcasts
Предобучение с самоконтролем: встраиваем Alignment прямо в фундамент
Self-Improving Pretraining: using post-trained models to pretrain better models
Ellen Xiaoqing Tan, Shehzaad Dhuliawala, Jing Xu, Ping Yu, Sainbayar Sukhbaatar, Jason Weston, Olga Golovneva…
Self-Improving Pretraining: using post-trained models to pretrain better models
Ellen Xiaoqing Tan, Shehzaad Dhuliawala, Jing Xu, Ping Yu, Sainbayar Sukhbaatar, Jason Weston, Olga Golovneva…
❤5👍4🔥1👀1