Новости AI за неделю AMD AdaptEvolve и SkillRL
AMD придумала, как не платить за ‘умного’ болвана

AMD выпустила AdaptEvolve: технологию, которая динамически переключается между маленькими и большими языковыми моделями. Если задача простая — работает ‘малыш’ (дёшево и быстро). Если сложная — подключается ‘тяжеловес’. Система сама оценивает свою уверенность и не тратит ресурсы там, где они не нужны.
Представьте: вы задаёте ИИ вопрос ‘Кто президент США?’ — он отвечает мгновенно и дешёво. А если просите ‘Напиши код для нейросети, которая отличает кошек от собак с точностью 99%’ — тогда в бой идёт большая модель. ИИ сам решает, когда ‘прикинуться дурачком’, а когда включить гения.
Почему я в восторге: это снижает затраты на инференс в среднем на 37,9%. При этом качество падает всего до 97,5% от уровня ‘всегда дорогой модели’. То есть вы почти не теряете в уме, но платите на треть меньше. В 2026 году это называется ‘жить хорошо’.
Как научить ИИ-агента не наступать на одни и те же грабли

Исследователи из Университета Северной Каролины создали SkillRL: метод, который превращает хаотичный опыт агента в структурированные навыки. Вместо того чтобы хранить миллионы ‘сырых’ действий (большинство из которых — ошибки), система выделяет устойчивые поведенческие шаблоны и складывает их в библиотеку SkillBank.
Главная фишка — рекурсивная эволюция. Агент учится, его библиотека навыков растёт, а новые умения помогают решать ещё более сложные задачи. Это как если бы вы не просто запоминали, что в прошлый раз сунули руку в огонь и обожглись, а выработали навык ‘пользоваться прихваткой’.
На тестах ALFWorld, WebShop и поисковых QA-задачах SkillRL дал прирост качества более чем на 15% по сравнению с лучшими аналогами. А главное — метод сжимает длинные истории действий в короткие правила, экономя токены и помогая модели не отвлекаться на ерунду. Если в 2026 году ваш домашний робот-пылесос вдруг перестал натыкаться на одни и те же тапки — возможно, там внутри SkillRL.
Короткой строкой: что ещё случилось в мире AI
- Anthropic выпустила Claude Sonnet 4.6 — говорят, стал умнее и быстрее.
- Google показала Gemini 3.1 Pro — фокус на сложные задачи и агентные сценарии. По бенчмаркам уже обгоняет Gemini 3 Pro, Opus 4.6 и GPT-5.2. Да, конкуренция бешеная.
- xAI анонсировала бета-релиз Grok 4.20 с кооперацией четырёх взаимодействующих AI-агентов. Представьте: четыре ИИ спорят друг с другом, чтобы решить вашу проблему. Звучит как начало апокалипсиса, но работает.
- Microsoft Research научили ИИ усваивать временные знания из контекста через обучение на собственных генерациях. Грубо говоря, модель учится на своих же ошибках под присмотром ‘учителя’.
- Snowflake разработала синтетический пайплайн для создания исполняемых агентных сред — теперь можно тестировать агентов в виртуальных песочницах, не боясь, что они наломают дров в реальном мире.
- Tencent предложила механизм экстраполяции награды: ученик может превзойти учителя. То есть AI-модель способна выйти за пределы качества той модели, на которой её обучали. Это страшно и круто одновременно.
- Mila представила автоматизированную мультиагентную систему, которая управляет разработкой ПО как корпорацией. Теперь не только люди могут создавать стартапы, но и роботы.
- China Telecom описала метод дообучения, использующий прошлые чекпоинты как корректирующие сигналы для преодоления плато качества. Если модель ‘застревает’, ей показывают её же старые, удачные версии, чтобы вспомнить, как быть умной.
Новости предоставлены аналитическим центром red_mad_robot. Я только добавил эмоций и живых примеров, потому что сухой AI — это скучно, а наш блог — нет.


