FAQ — Контекст и память
14 вопрос(ов) в 5 статье(ях).
Другие разделы FAQ: Экономика ИИ (12) · Рынок ИИ (5) · Безопасность ИИ (9) · Архитектура агентов (32) · Кодинг и RFC (9) · Креативный ИИ (7) · Железо и инфраструктура (10) · Поведение LLM (16) · Локальные модели и VRAM (9) · Открытые веса (7) · Промпт-инжиниринг (5) · Регулирование (1) · Робототехника (3) · Обучение и RLHF (2) · Верификация и наука (4) · Голосовые агенты (5)
ИИ-агенты: дайджест за 29 July 2026
2026-07-29
Что такое контекстная база данных для агентов?
Специализированное хранилище (например, OpenViking), объединяющее память агента, RAG и навыки в одном компоненте. Контекст — главный боттлнек агентных систем, его выделение в отдельный слой закономерно.
Зачем нужны специализированные движки вывода для агентов?
Агентные нагрузки отличаются от чат-инференса: длинный контекст, множественные вызовы инструментов, цепочки промптов. Универсальные движки (vLLM, TensorRT-LLM) здесь неоптимальны. Специализированные решения вроде TokenSpeed — индикатор зрелости направления.
Что такое context collapse в безопасности ИИ-агентов?
Коллапс контекста — когда агент не различает доверенные и недоверенные источники внутри одного окна. Демонстрировался через самораспространяющиеся ИИ-черви в Copilot for Word. Главный вектор атак на агентные системы.
ИИ-агенты: Open-source захватывает инфраструктуру инструментирования. Дайджест за 31 July 2026
2026-07-31
Как MCP связывает агентов с браузером?
Проект chrome-devtools-mcp позволяет агентам (Claude, Cursor, Copilot) напрямую управлять браузером и инспектировать DOM-дерево через Model Context Protocol. Это стирает границу между кодинг-агентами и веб-автоматизацией.
ИИ-агенты: фреймворки умирают, навыки и MCP-серверы побеждают
2026-08-01
Что такое "навыки" (skills) в контексте ИИ-агентов?
Это модульные, узкоспециализированные пакеты инструкций и инструментов (например, для пентестинга или аудита безопасности), которые агент может динамически подключать к своей базе знаний в процессе работы.
«ДА ЧТО С ТОБОЙ СЕГОДНЯ ОПЯТЬ СЛУЧИЛОСЬ!? ЧТО СЛОМАЛОСЬ??»
2026-07-30
Что такое Contextual Drag?
Эффект, при котором ошибка в контексте диалога притягивает структурно похожие ошибки в последующих ответах. Каскад — ни внешняя обратная связь, ни самопроверка не устраняют его полностью. Описан в arXiv:2602.04288.
Что предложить вместо монолита?
Созвездие микро-моделей под управлением роутера. Mixture-of-Agents (arXiv:2406.04692) превосходит GPT-4o на open-source моделях. Короткий контекст, изоляция шума, специализация сужает пространство хаоса.
Что такое Embedding Injection?
Инъекция поведения напрямую в латентное пространство слоёв внимания (activation steering), минуя текст. Вместо описания поведения словами — вектор, сдвигающий активации модели. Точнее текста, потому что вектор — это конкретное число, а не бросок кубика.
Вайбкодинг без иллюзий: гибридная схема «облачный оркестратор + локальный кодер», которая работает
2026-07-27
Что такое гибридная схема вайбкодинга?
Разделение задач между облачной LLM-координатором и локальной LLM-кодером. Облако управляет, локаль кодит. Координатор не видит код — только текстовую карту проекта. Кодер работает в своём контексте 96K и не делит окно с координатором.
Какую модель использовать для локального кодинга?
qwen3-coder:30b (MoE, 96K контекст) на 2× RTX 3060 (24GB VRAM) через llama.cpp. Все слои загружаются в VRAM, KV cache квантируется в q4_0. Бесплатно, без облачных токенов.
Зачем нужна память проектов (PMB)?
PMB — SQLite-база с embedding-поиском. Хранит факты, уроки и цели проекта. Кодер вызывает pmbprepare() перед задачей для контекста и pmbfind_lessons() при сомнениях. Без памяти модель каждый раз начинает с нуля.
Чем отличается доступ к PMB у координатора и кодера?
Координатор (Лиса) имеет только recall и record_batch — запрашивает конкретный факт, когда нужно. Кодер (Codex) имеет полный доступ: все инструменты, hooks, auto-recall, ambient write. Если дать координатору полный доступ — PMB затопит его промпт чанками и он потеряет идентичность.
Почему не Claude Code или Cursor? Зачем своя схема?
Claude Code и Cursor — отличные инструменты, но они привязаны к облаку и тарифицируют каждый токен. Гибридная схема разделяет координацию и кодинг: облако платит только за координацию (дёшево), кодинг — локально и бесплатно. Плюс: полное владение данными, нет утечек кода в облако, работа офлайн. Минус: 30B-модель слабее Claude на сложных задачах — но с PMB и AGENTS.md компенсирует.
24 ГБ VRAM — хватает для серьёзной работы?
Для qwen3-coder:30b (MoE) — да. Модель занимает 22.4 ГБ, KV cache в q4_0 умещается в остаток. Контекст 96K — 100% в VRAM. Но свободно ~400 МБ — забита под завязку. Для моделей крупнее 30B (32B+) уже нужно 36+ ГБ VRAM. Апгрейд третьей картой решит проблему.