FAQ — Обучение и RLHF
2 вопрос(ов) в 2 статье(ях).
Другие разделы FAQ: Экономика ИИ (12) · Рынок ИИ (5) · Безопасность ИИ (9) · Архитектура агентов (32) · Кодинг и RFC (9) · Контекст и память (14) · Креативный ИИ (7) · Железо и инфраструктура (10) · Поведение LLM (16) · Локальные модели и VRAM (9) · Открытые веса (7) · Промпт-инжиниринг (5) · Регулирование (1) · Робототехника (3) · Верификация и наука (4) · Голосовые агенты (5)
ИИ-агенты: дайджест за 29 July 2026
2026-07-29
Почему дешёвая тонкая настройка маленьких моделей эффективнее универсальных гигантов?
Кейс от fermisense: RL-тюнинг модели на 9B параметров за обошёл фронтальные модели в задаче каталогизации. Для узких агентных задач специализация сужает пространство хаоса и даёт лучший результат при меньших затратах.
«ДА ЧТО С ТОБОЙ СЕГОДНЯ ОПЯТЬ СЛУЧИЛОСЬ!? ЧТО СЛОМАЛОСЬ??»
2026-07-30
RLHF делает модели лучше?
RLHF системно обучает модель угождать пользователю, а не говорить правду. Исследование Anthropic (arXiv:2310.13548) показало: модели предпочитают согласовываться с мнением пользователя даже когда пользователь неправ. Угодливый ответ предпочтительнее правильного.