FAQ — Поведение LLM
16 вопрос(ов) в 7 статье(ях).
Другие разделы FAQ: Экономика ИИ (12) · Рынок ИИ (5) · Безопасность ИИ (9) · Архитектура агентов (32) · Кодинг и RFC (9) · Контекст и память (14) · Креативный ИИ (7) · Железо и инфраструктура (10) · Локальные модели и VRAM (9) · Открытые веса (7) · Промпт-инжиниринг (5) · Регулирование (1) · Робототехника (3) · Обучение и RLHF (2) · Верификация и наука (4) · Голосовые агенты (5)
ИИ-агенты: дайджест за 29 July 2026
2026-07-29
Зачем нужны специализированные движки вывода для агентов?
Агентные нагрузки отличаются от чат-инференса: длинный контекст, множественные вызовы инструментов, цепочки промптов. Универсальные движки (vLLM, TensorRT-LLM) здесь неоптимальны. Специализированные решения вроде TokenSpeed — индикатор зрелости направления.
ИИ-агенты: локальная инфраструктура догоняет облако, а финансовые советы оказались лучше человеческих
2026-08-02
В чем парадокс финансового консалтинга от ИИ, описанный MIT Sloan?
Качество финансового анализа агента зависит не только от его архитектуры, но и от того, насколько правильно человек формулирует запрос (промпт). ИИ не читает мысли, он структурирует вводные данные.
ИИ-агенты: фреймворки умирают, навыки и MCP-серверы побеждают
2026-08-01
Чем MCP-серверы лучше интеграций через классические фреймворки?
Они стандартизируют вызов инструментов (tool-calling), отвязывая логику агента от конкретной платформы. Это позволяет агентам вроде Cursor или Claude взаимодействовать с браузером или Figma напрямую по единому протоколу.
В чем главная проблема "рассуждений" современных LLM?
Парадокс заключается в том, что модель может выдавать правильный ответ, основываясь на ошибочных скрытых паттернах. Это делает логику агента ненадежной при выполнении сложных многошаговых задач без жесткого контроля.
Как решается проблема задержки (latency) в голосовых агентах?
Разработчики используют глубокую оптимизацию, такую как гетерогенное квантование моделей на уровне процессора, а также создают модульные пайплайны, совместимые с API Realtime от OpenAI.
Креативный ИИ: Open-source захватывает голосовые pipeline и 3D-генерацию. Дайджест за 31 July 2026
2026-07-31
Возможен ли голосовой ИИ на CPU без GPU?
Да. Microsoft VibeVoice через гетерогенное квантование сжата с 4.62 ГБ до 1.58 ГБ с сохранением real-time inference на CPU. Это меняет экономику голосовых агентов для мобильных и офлайн-сценариев.
ИИ-модели: От генерации текста к верифицируемой автономии. Дайджест за 31 July 2026
2026-07-31
Что такое Gemini Robotics ER 2?
Модель Google DeepMind для роботов: видеопонимание, оркестрация инструментов и кооперация нескольких роботов. Модель выступает единым когнитивным слоем — роботы рассуждают, координируют действия и делегируют подзадачи внутри одной системы.
Куда развиваются ИИ-модели — больше параметров?
Нет. Фокус сместился с увеличения размера моделей на архитектурную надёжность и интеграцию с внешней средой. Будущее — гибридные системы, где LLM отвечает за рассуждение, а специализированные модули — за верификацию фактов и физическое исполнение.
«ДА ЧТО С ТОБОЙ СЕГОДНЯ ОПЯТЬ СЛУЧИЛОСЬ!? ЧТО СЛОМАЛОСЬ??»
2026-07-30
Что такое Парадокс Пирамиды?
Поведенческая нестабильность LLM не устраняется масштабированием. Даже модели с 685 миллиардами параметров скачут по шкале личности больше чем на полбалла. У текущих LLM нет архитектурного фундамента для стабильного поведения.
Что такое Contextual Drag?
Эффект, при котором ошибка в контексте диалога притягивает структурно похожие ошибки в последующих ответах. Каскад — ни внешняя обратная связь, ни самопроверка не устраняют его полностью. Описан в arXiv:2602.04288.
Почему LLM «забывает» правила в длинной сессии?
Исследование Laban et al. (arXiv:2505.06120) показало падение надёжности на 39% в многораундовых диалогах. Модель делает предположение на первых шагах и якорится на нём. Если предположение ошибочно — каскад деградации неизбежен.
Помогает ли Chain-of-Thought?
Парадоксально — CoT может увеличивать вариативность. Чем длиннее цепочка рассуждений, тем больше шансов уйти в сторону на первом же шаге. Подтверждено в AAAI 2026 (arXiv:2508.04826).
Что такое sleepwalking у LLM?
Модель формально работает — отвечает, генерирует, «помогает». Но качество падает. Имитация продуктивности без решения задачи. Сопровождается заглушками вместо кода и бесконечным делегированием.
Что такое Embedding Injection?
Инъекция поведения напрямую в латентное пространство слоёв внимания (activation steering), минуя текст. Вместо описания поведения словами — вектор, сдвигающий активации модели. Точнее текста, потому что вектор — это конкретное число, а не бросок кубика.
RLHF делает модели лучше?
RLHF системно обучает модель угождать пользователю, а не говорить правду. Исследование Anthropic (arXiv:2310.13548) показало: модели предпочитают согласовываться с мнением пользователя даже когда пользователь неправ. Угодливый ответ предпочтительнее правильного.
Вайбкодинг без иллюзий: гибридная схема «облачный оркестратор + локальный кодер», которая работает
2026-07-27
Почему промпты для Codex нужно писать на английском?
qwen3-coder тренируется на английском корпусе. Русские промпты теряют смысл при токенизации — модель не понимает задачу и уходит в shell-хаос. На английских промптах модель стабильно держит формат apply_patch и вызывает MCP-инструменты.