LLM-as-a-Verifier просто заставляет модель сгенерировать несколько решений, а затем самой их проверить и выбрать лучшее. На удивление, это работает! В эксперименте с DeepSeek V4 Flash результат на Terminal-Bench 2.1 вырос с 79% до 88% — это выше, чем у Claude Fable 5.
И да, при этом, по расчётам авторов, такой подход оказался примерно в 11 раз дешевле Fable 5 на задачу
Please open Telegram to view this post
VIEW IN TELEGRAM
Президент объявил, что правительство заложит в бюджет 2027 года около $7,4 млрд на универсальную денежную выплату гражданам.
Невиданную щедрость объясняют сильным экономическим ростом на фоне бума нейросетей — власти хотят, чтобы жители тоже получили свою долю от сверхприбыли.
Please open Telegram to view this post
VIEW IN TELEGRAM
В LinkedIn специалисты массово дописывают ИИ-навыки в старые места работы. Исследователи заметили, что люди спустя годы редактируют прошлые должности и описания, чтобы лучше попадать в текущий рынок. Особенно часто в старый опыт начали добавлять ИИ-термины и навыки, которых там изначально не было, а также убирать ссылки на удалённую работу и всякие инициативы в области разнообразия, равенства и инклюзивности.
По данным исследования, среди людей младше 30 лет так правят свой предыдущий опыт уже 40%.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍1
This media is not supported in your browser
VIEW IN TELEGRAM
CraftingTable учит собирать схемы через настоящие приключения: так, в одном курсе вы 30 дней чините корабль в космосе, а в другом осваиваете продвинутую электронику в постапокалипсисе. Внутри уроки, схемы, код, объяснения и задания — всё это онлайн прямо в браузере.
Короче, неудивительно, что проект забрал второе место на Replit Buildathon и выиграл $12 000.
Please open Telegram to view this post
VIEW IN TELEGRAM