FAQ — Локальные модели и VRAM

9 вопрос(ов) в 4 статье(ях).

Другие разделы FAQ: Экономика ИИ (12) · Рынок ИИ (5) · Безопасность ИИ (9) · Архитектура агентов (32) · Кодинг и RFC (9) · Контекст и память (14) · Креативный ИИ (7) · Железо и инфраструктура (10) · Поведение LLM (16) · Открытые веса (7) · Промпт-инжиниринг (5) · Регулирование (1) · Робототехника (3) · Обучение и RLHF (2) · Верификация и наука (4) · Голосовые агенты (5)


ИИ-агенты: дайджест за 29 July 2026

2026-07-29

Зачем нужны специализированные движки вывода для агентов?

Агентные нагрузки отличаются от чат-инференса: длинный контекст, множественные вызовы инструментов, цепочки промптов. Универсальные движки (vLLM, TensorRT-LLM) здесь неоптимальны. Специализированные решения вроде TokenSpeed — индикатор зрелости направления.

Читать в дайджесте


ИИ-агенты: локальная инфраструктура догоняет облако, а финансовые советы оказались лучше человеческих

2026-08-02

Почему локальный тренинг моделей через Unsloth так важен для ИИ-агентов?

Он позволяет разработчикам настраивать open-source модели на специфические корпоративные данные без затрат на облака и рисков утечки, что критично для безопасности tool-calling агентов.

Читать в дайджесте


Креативный ИИ: Open-source захватывает голосовые pipeline и 3D-генерацию. Дайджест за 31 July 2026

2026-07-31

Возможен ли голосовой ИИ на CPU без GPU?

Да. Microsoft VibeVoice через гетерогенное квантование сжата с 4.62 ГБ до 1.58 ГБ с сохранением real-time inference на CPU. Это меняет экономику голосовых агентов для мобильных и офлайн-сценариев.

Читать в дайджесте


Вайбкодинг без иллюзий: гибридная схема «облачный оркестратор + локальный кодер», которая работает

2026-07-27

Что такое гибридная схема вайбкодинга?

Разделение задач между облачной LLM-координатором и локальной LLM-кодером. Облако управляет, локаль кодит. Координатор не видит код — только текстовую карту проекта. Кодер работает в своём контексте 96K и не делит окно с координатором.

Читать в дайджесте

Какую модель использовать для локального кодинга?

qwen3-coder:30b (MoE, 96K контекст) на 2× RTX 3060 (24GB VRAM) через llama.cpp. Все слои загружаются в VRAM, KV cache квантируется в q4_0. Бесплатно, без облачных токенов.

Читать в дайджесте

Почему промпты для Codex нужно писать на английском?

qwen3-coder тренируется на английском корпусе. Русские промпты теряют смысл при токенизации — модель не понимает задачу и уходит в shell-хаос. На английских промптах модель стабильно держит формат apply_patch и вызывает MCP-инструменты.

Читать в дайджесте

Почему не Claude Code или Cursor? Зачем своя схема?

Claude Code и Cursor — отличные инструменты, но они привязаны к облаку и тарифицируют каждый токен. Гибридная схема разделяет координацию и кодинг: облако платит только за координацию (дёшево), кодинг — локально и бесплатно. Плюс: полное владение данными, нет утечек кода в облако, работа офлайн. Минус: 30B-модель слабее Claude на сложных задачах — но с PMB и AGENTS.md компенсирует.

Читать в дайджесте

24 ГБ VRAM — хватает для серьёзной работы?

Для qwen3-coder:30b (MoE) — да. Модель занимает 22.4 ГБ, KV cache в q4_0 умещается в остаток. Контекст 96K — 100% в VRAM. Но свободно ~400 МБ — забита под завязку. Для моделей крупнее 30B (32B+) уже нужно 36+ ГБ VRAM. Апгрейд третьей картой решит проблему.

Читать в дайджесте

Облачные модели подешевели — зачем локальная?

Экономика не только в цене за токен. Локальная модель: ноль затрат на рутину, нет rate limits, нет задержек сети, нет риска отзыва доступа. Десять итераций отладки за вечер — $30 на облаке или ноль на локали. Месяц разработки — сотни долларов против ноля. Облако выигрывает на сложных задачах (архитектура, рефакторинг), локаль — на рутине (правки, тесты, аудит).

Читать в дайджесте