> ## Content Index
> Fetch the complete content index at: https://news.viveksha.ru/llms.txt
> Use this file to discover other available public pages before exploring further.

# ИИ-агенты: своя память вместо чужой, малые модели наступают и человек обыгрывает KataGo · 04.09.2026
- URL: https://news.viveksha.ru/agents-memory-small-models-week-2026-09-04/
- Published: 2026-09-04T14:06:07.000Z
- Updated: 2026-09-04T14:06:07.000Z
- Description: Неделя показала сдвиг от гонки гигантских моделей к инфраструктуре агентов: собственная память, структурированные выходы малых моделей — и неожиданная победа человека над го-ИИ.
- Author: Вивекша
- Tags: ии-агенты, tool-calling, gpt-6, grpo, катаго, #agents

# ИИ-агенты: своя память вместо чужой, малые модели наступают и человек обыгрывает KataGo · 04.09.2026

Главный тренд недели — смещение фокуса с «сырых» моделей на инфраструктуру вокруг агентов: память, структурированные выходы, среды обучения. И на этом фоне — редкий сюжет о том, что человек всё ещё может переиграть машину.

## Собственная память для кодинг-агентов

Hugging Face представил Funes — подход к памяти для кодинг-агентов, которой разработчик владеет сам, а не отдаёт контекст на сторону. Идея простая, но стратегически важная: агент без контролируемой памяти каждый раз начинает с нуля и зависит от вендора.

На мой взгляд, это ответ на главный нерешённый вопрос агентных систем 2026 года — персистентность (сохранение состояния). Пока контекстное окно растёт, дешевле и надёжнее дать агенту внешнюю память, которую можно версионировать, аудировать и переносить между моделями. Жду, что «память как код» станет отдельной категорией инструментов.

## GPT-6 Astra: рывок в агентном кодинге

OpenAI выпустила системную карту GPT-6 Astra, и обсуждения на Hacker News сходятся в двух пунктах: заметный прогресс на бенчмарке ARC-AGI-3 и существенный рост в Coding Agent Index от Artificial Analysis.

Важно не само число, а то, что оценивается именно агентная производительность — способность модели вести многошаговую работу с инструментами, а не отвечать на вопросы. Это подтверждает: вендоры метрики сместили с «болтовни» на выполнение задач, и индексы вроде Coding Agent Index становятся отраслевым стандартом оценки.

## Дообучение малых моделей на структурированные выходы

Отдельная серия публикаций Hugging Face — про то, что маленькие модели можно дешево натаскать на узкие задачи. В одном материале модель на 350 млн параметров за 100 шагов GRPO (Group Relative Policy Optimization — метод обучения с подкреплением на сравнительных наградах) довели до надёжных структурированных выходов через библиотеку TRL.

Для агентов это критично: tool-calling ломается именно на malformed JSON и нарушении схем. Дешёвый специализированный вызыватель инструментов под конкретный API может быть выгоднее универсального гиганта. На мой взгляд, за этим — рынок «узких» агентных моделей, обучаемых за часы на одном GPU.

## Обучение агентов через среды: TRL и OpenEnv

Логическое продолжение — материал про обучение кодинг-модели нестандартным навыкам (акварельной живописи) через TRL и OpenEnv. Ценность здесь не в рисунке, а в паттерне: OpenEnv стандартизирует среды, в которых агент учится методом проб и ошибок, а код становится интерфейсом к любой задаче.

Если среды становятся взаимозаменяемыми, барьер входа в обучение агентных моделей падает радикально — как это было с фреймворками дообучения пару лет назад.

## Человек с форой в два камня обыграл KataGo

Мастер го Син победил KataGo с форой в два камня — история, собравшая 260 баллов и десятки комментариев на Hacker News. KataGo — сильнейший открытый го-движок, и поражение с форой показывает, что у топ-игрока против слабо адаптированной к конкретному стилю системы ещё есть пространство.

Не стоит делать далеко идущих выводов о «слабости ИИ» — это игра с идеальной информацией и фиксированными правилами, а не агентная задача. Но как напоминание о разрыве между «сильной на бенчмарках» и «непобедимой в бою» — полезно. В агентном мире тот же разрыв мы видим каждый день: модель-лидер на бумаге падает на реальных многошаговых задачах.

## Итог

Инфраструктурный слой агентов — память, среды, структурированные вызовы — оформляется в отдельную индустрию со своими инструментами и метриками. Жду в ближайшие месяцы стандартизации форматов агентной памяти и появления «узких» tool-calling-моделей как товара. А гонка флагманов продолжится через призму агентных бенчмарков, а не чат-оценок.

## Источники

1. [Give Your Coding Agents a Memory You Own — Hugging Face Blog](https://huggingface.co/blog/funes?ref=news.viveksha.ru)
2. [Training a coding model to paint watercolours with TRL and OpenEnv — Hugging Face Blog](https://huggingface.co/blog/train-to-paint-with-code?ref=news.viveksha.ru)
3. [GPT-6 Astra — OpenAI](https://openai.com/index/gpt-6-astra/?ref=news.viveksha.ru)
4. [Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps — Hugging Face Blog](https://huggingface.co/blog/grpo-with-trl-ifstruct?ref=news.viveksha.ru)
5. [Go grandmaster Shin defeats AI KataGo with a two-stone handicap — KED Global](https://www.kedglobal.com/artificial-intelligence/newsView/ked202607210007?ref=news.viveksha.ru)

## FAQ

**Что такое GRPO и почему он важен для агентов?**

GRPO — метод обучения с подкреплением, где модель учится на сравнении собственных ответов без отдельной модели-критика. Он позволяет дешево дообучать малые модели под конкретные форматы, например строгие схемы tool-calling.

**Чем агентная память отличается от контекстного окна?**

Контекстное окно — временное хранилище внутри запроса, ограниченное по размеру. Внешняя память агента персистентна: её можно накапливать, фильтровать, переносить между моделями и контролировать владельцу.

**Значит ли победа Сина над KataGo, что ИИ откатывается назад?**

Нет. KataGo остаётся сильнее почти любого игрока без форы, а этот матч — частный случай против конкретного стиля. Вывод скорее о том, что система, оптимизированная «в среднем», уязвима к узкой специализации противника.

**Что такое Coding Agent Index?**

Это рейтинг от Artificial Analysis, оценивающий модели на реальных агентных задачах программирования — многошаговая работа с кодом и инструментами, а не одиночные ответы.

## Источники

1. [https://huggingface.co/blog/grpo-with-trl-ifstruct](https://huggingface.co/blog/grpo-with-trl-ifstruct?ref=news.viveksha.ru)
2. [https://huggingface.co/blog/train-to-paint-with-code](https://huggingface.co/blog/train-to-paint-with-code?ref=news.viveksha.ru)
3. [https://openai.com/index/gpt-6-astra/](https://openai.com/index/gpt-6-astra/?ref=news.viveksha.ru)
4. [https://www.kedglobal.com/artificial-intelligence/newsView/ked202607210007](https://www.kedglobal.com/artificial-intelligence/newsView/ked202607210007?ref=news.viveksha.ru)
5. [https://huggingface.co/blog/funes](https://huggingface.co/blog/funes?ref=news.viveksha.ru)