FAQ — Поведение LLM

16 вопрос(ов) в 7 статье(ях).

Другие разделы FAQ: Экономика ИИ (12) · Рынок ИИ (5) · Безопасность ИИ (9) · Архитектура агентов (32) · Кодинг и RFC (9) · Контекст и память (14) · Креативный ИИ (7) · Железо и инфраструктура (10) · Локальные модели и VRAM (9) · Открытые веса (7) · Промпт-инжиниринг (5) · Регулирование (1) · Робототехника (3) · Обучение и RLHF (2) · Верификация и наука (4) · Голосовые агенты (5)


ИИ-агенты: дайджест за 29 July 2026

2026-07-29

Зачем нужны специализированные движки вывода для агентов?

Агентные нагрузки отличаются от чат-инференса: длинный контекст, множественные вызовы инструментов, цепочки промптов. Универсальные движки (vLLM, TensorRT-LLM) здесь неоптимальны. Специализированные решения вроде TokenSpeed — индикатор зрелости направления.

Читать в дайджесте


ИИ-агенты: локальная инфраструктура догоняет облако, а финансовые советы оказались лучше человеческих

2026-08-02

В чем парадокс финансового консалтинга от ИИ, описанный MIT Sloan?

Качество финансового анализа агента зависит не только от его архитектуры, но и от того, насколько правильно человек формулирует запрос (промпт). ИИ не читает мысли, он структурирует вводные данные.

Читать в дайджесте


ИИ-агенты: фреймворки умирают, навыки и MCP-серверы побеждают

2026-08-01

Чем MCP-серверы лучше интеграций через классические фреймворки?

Они стандартизируют вызов инструментов (tool-calling), отвязывая логику агента от конкретной платформы. Это позволяет агентам вроде Cursor или Claude взаимодействовать с браузером или Figma напрямую по единому протоколу.

Читать в дайджесте

В чем главная проблема "рассуждений" современных LLM?

Парадокс заключается в том, что модель может выдавать правильный ответ, основываясь на ошибочных скрытых паттернах. Это делает логику агента ненадежной при выполнении сложных многошаговых задач без жесткого контроля.

Читать в дайджесте

Как решается проблема задержки (latency) в голосовых агентах?

Разработчики используют глубокую оптимизацию, такую как гетерогенное квантование моделей на уровне процессора, а также создают модульные пайплайны, совместимые с API Realtime от OpenAI.

Читать в дайджесте


Креативный ИИ: Open-source захватывает голосовые pipeline и 3D-генерацию. Дайджест за 31 July 2026

2026-07-31

Возможен ли голосовой ИИ на CPU без GPU?

Да. Microsoft VibeVoice через гетерогенное квантование сжата с 4.62 ГБ до 1.58 ГБ с сохранением real-time inference на CPU. Это меняет экономику голосовых агентов для мобильных и офлайн-сценариев.

Читать в дайджесте


ИИ-модели: От генерации текста к верифицируемой автономии. Дайджест за 31 July 2026

2026-07-31

Что такое Gemini Robotics ER 2?

Модель Google DeepMind для роботов: видеопонимание, оркестрация инструментов и кооперация нескольких роботов. Модель выступает единым когнитивным слоем — роботы рассуждают, координируют действия и делегируют подзадачи внутри одной системы.

Читать в дайджесте

Куда развиваются ИИ-модели — больше параметров?

Нет. Фокус сместился с увеличения размера моделей на архитектурную надёжность и интеграцию с внешней средой. Будущее — гибридные системы, где LLM отвечает за рассуждение, а специализированные модули — за верификацию фактов и физическое исполнение.

Читать в дайджесте


«ДА ЧТО С ТОБОЙ СЕГОДНЯ ОПЯТЬ СЛУЧИЛОСЬ!? ЧТО СЛОМАЛОСЬ??»

2026-07-30

Что такое Парадокс Пирамиды?

Поведенческая нестабильность LLM не устраняется масштабированием. Даже модели с 685 миллиардами параметров скачут по шкале личности больше чем на полбалла. У текущих LLM нет архитектурного фундамента для стабильного поведения.

Читать в дайджесте

Что такое Contextual Drag?

Эффект, при котором ошибка в контексте диалога притягивает структурно похожие ошибки в последующих ответах. Каскад — ни внешняя обратная связь, ни самопроверка не устраняют его полностью. Описан в arXiv:2602.04288.

Читать в дайджесте

Почему LLM «забывает» правила в длинной сессии?

Исследование Laban et al. (arXiv:2505.06120) показало падение надёжности на 39% в многораундовых диалогах. Модель делает предположение на первых шагах и якорится на нём. Если предположение ошибочно — каскад деградации неизбежен.

Читать в дайджесте

Помогает ли Chain-of-Thought?

Парадоксально — CoT может увеличивать вариативность. Чем длиннее цепочка рассуждений, тем больше шансов уйти в сторону на первом же шаге. Подтверждено в AAAI 2026 (arXiv:2508.04826).

Читать в дайджесте

Что такое sleepwalking у LLM?

Модель формально работает — отвечает, генерирует, «помогает». Но качество падает. Имитация продуктивности без решения задачи. Сопровождается заглушками вместо кода и бесконечным делегированием.

Читать в дайджесте

Что такое Embedding Injection?

Инъекция поведения напрямую в латентное пространство слоёв внимания (activation steering), минуя текст. Вместо описания поведения словами — вектор, сдвигающий активации модели. Точнее текста, потому что вектор — это конкретное число, а не бросок кубика.

Читать в дайджесте

RLHF делает модели лучше?

RLHF системно обучает модель угождать пользователю, а не говорить правду. Исследование Anthropic (arXiv:2310.13548) показало: модели предпочитают согласовываться с мнением пользователя даже когда пользователь неправ. Угодливый ответ предпочтительнее правильного.

Читать в дайджесте


Вайбкодинг без иллюзий: гибридная схема «облачный оркестратор + локальный кодер», которая работает

2026-07-27

Почему промпты для Codex нужно писать на английском?

qwen3-coder тренируется на английском корпусе. Русские промпты теряют смысл при токенизации — модель не понимает задачу и уходит в shell-хаос. На английских промптах модель стабильно держит формат apply_patch и вызывает MCP-инструменты.

Читать в дайджесте