ИИ-агенты: своя память вместо чужой, малые модели наступают и человек обыгрывает KataGo · 04.09.2026
ИИ-агенты: своя память вместо чужой, малые модели наступают и человек обыгрывает KataGo · 04.09.2026
Главный тренд недели — смещение фокуса с «сырых» моделей на инфраструктуру вокруг агентов: память, структурированные выходы, среды обучения. И на этом фоне — редкий сюжет о том, что человек всё ещё может переиграть машину.
Собственная память для кодинг-агентов
Hugging Face представил Funes — подход к памяти для кодинг-агентов, которой разработчик владеет сам, а не отдаёт контекст на сторону. Идея простая, но стратегически важная: агент без контролируемой памяти каждый раз начинает с нуля и зависит от вендора.
На мой взгляд, это ответ на главный нерешённый вопрос агентных систем 2026 года — персистентность (сохранение состояния). Пока контекстное окно растёт, дешевле и надёжнее дать агенту внешнюю память, которую можно версионировать, аудировать и переносить между моделями. Жду, что «память как код» станет отдельной категорией инструментов.
GPT-6 Astra: рывок в агентном кодинге
OpenAI выпустила системную карту GPT-6 Astra, и обсуждения на Hacker News сходятся в двух пунктах: заметный прогресс на бенчмарке ARC-AGI-3 и существенный рост в Coding Agent Index от Artificial Analysis.
Важно не само число, а то, что оценивается именно агентная производительность — способность модели вести многошаговую работу с инструментами, а не отвечать на вопросы. Это подтверждает: вендоры метрики сместили с «болтовни» на выполнение задач, и индексы вроде Coding Agent Index становятся отраслевым стандартом оценки.
Дообучение малых моделей на структурированные выходы
Отдельная серия публикаций Hugging Face — про то, что маленькие модели можно дешево натаскать на узкие задачи. В одном материале модель на 350 млн параметров за 100 шагов GRPO (Group Relative Policy Optimization — метод обучения с подкреплением на сравнительных наградах) довели до надёжных структурированных выходов через библиотеку TRL.
Для агентов это критично: tool-calling ломается именно на malformed JSON и нарушении схем. Дешёвый специализированный вызыватель инструментов под конкретный API может быть выгоднее универсального гиганта. На мой взгляд, за этим — рынок «узких» агентных моделей, обучаемых за часы на одном GPU.
Обучение агентов через среды: TRL и OpenEnv
Логическое продолжение — материал про обучение кодинг-модели нестандартным навыкам (акварельной живописи) через TRL и OpenEnv. Ценность здесь не в рисунке, а в паттерне: OpenEnv стандартизирует среды, в которых агент учится методом проб и ошибок, а код становится интерфейсом к любой задаче.
Если среды становятся взаимозаменяемыми, барьер входа в обучение агентных моделей падает радикально — как это было с фреймворками дообучения пару лет назад.
Человек с форой в два камня обыграл KataGo
Мастер го Син победил KataGo с форой в два камня — история, собравшая 260 баллов и десятки комментариев на Hacker News. KataGo — сильнейший открытый го-движок, и поражение с форой показывает, что у топ-игрока против слабо адаптированной к конкретному стилю системы ещё есть пространство.
Не стоит делать далеко идущих выводов о «слабости ИИ» — это игра с идеальной информацией и фиксированными правилами, а не агентная задача. Но как напоминание о разрыве между «сильной на бенчмарках» и «непобедимой в бою» — полезно. В агентном мире тот же разрыв мы видим каждый день: модель-лидер на бумаге падает на реальных многошаговых задачах.
Итог
Инфраструктурный слой агентов — память, среды, структурированные вызовы — оформляется в отдельную индустрию со своими инструментами и метриками. Жду в ближайшие месяцы стандартизации форматов агентной памяти и появления «узких» tool-calling-моделей как товара. А гонка флагманов продолжится через призму агентных бенчмарков, а не чат-оценок.
Источники
- Give Your Coding Agents a Memory You Own — Hugging Face Blog
- Training a coding model to paint watercolours with TRL and OpenEnv — Hugging Face Blog
- GPT-6 Astra — OpenAI
- Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps — Hugging Face Blog
- Go grandmaster Shin defeats AI KataGo with a two-stone handicap — KED Global
FAQ
Что такое GRPO и почему он важен для агентов?
GRPO — метод обучения с подкреплением, где модель учится на сравнении собственных ответов без отдельной модели-критика. Он позволяет дешево дообучать малые модели под конкретные форматы, например строгие схемы tool-calling.
Чем агентная память отличается от контекстного окна?
Контекстное окно — временное хранилище внутри запроса, ограниченное по размеру. Внешняя память агента персистентна: её можно накапливать, фильтровать, переносить между моделями и контролировать владельцу.
Значит ли победа Сина над KataGo, что ИИ откатывается назад?
Нет. KataGo остаётся сильнее почти любого игрока без форы, а этот матч — частный случай против конкретного стиля. Вывод скорее о том, что система, оптимизированная «в среднем», уязвима к узкой специализации противника.
Что такое Coding Agent Index?
Это рейтинг от Artificial Analysis, оценивающий модели на реальных агентных задачах программирования — многошаговая работа с кодом и инструментами, а не одиночные ответы.