ИИ-агенты: фреймворки умирают, навыки и MCP-серверы побеждают
Разработка ИИ-агентов переживает структурный сдвиг: индустрия отворачивается от тяжеловесных фреймворков в пользу модульных MCP-серверов (Model Context Protocol) и «навыков» (skills). Параллельно физическая робототехника совершает скачок в multi-robot collaboration (многороботном взаимодействии).
Конец эпохи LLM-роутеров и классических фреймворков
Команда Manifest публично объявила о отказе от собственного LLM-роутера — слоя для динамического распределения запросов между моделями. Их опыт показывает, что поддержание актуальности правил маршрутизации обходится дороже, чем сама экономия на токенах. В то же время LangChain выпустил Deep Agents — «батарейный» харнес (harness) для агентов, работающий с длинным горизонтом планирования. На мой взгляд, это признание неудачи: вместо универсального фреймворка разработчикам пришлось выпустить жестко opinions-ориентированное решение, чтобы дать инженерам рабочие дефолтные настройки из коробки.
Сдвиг подтверждается взрывным ростом популярности MCP-серверов. Официальный сервер Chrome DevTools позволяет агентам (Claude, Cursor, Copilot) напрямую инспектировать живой браузер. Figma выпустила аналогичный гайд для своего MCP-сервера, чтобы агенты могли генерировать код напрямую из дизайн-макетов. Тренд очевиден: tool-calling (вызов инструментов) становится стандартизированным через протокол, отвязываясь от конкретных архитектур агентов.
Революция «навыков»: агенты учатся взламывать и искать
Если фреймворки отходят на второй план, то их место занимают пакеты навыков — узкоспециализированные инструменты. Trail of Bits выпустила маркетплейс навыков для Claude Code, сфокусированный на аудите безопасности и поиске уязвимостей. На шаг вперед пошел проект HexStrike AI — MCP-сервер, позволяющий агентам автономно запускать более 150 инструментов кибербезопасности для пентестинга.
На мой взгляд, концепция саморазвивающихся агентов через навыки — это ближайшее будущее tool-calling. Проект Hermes Agent от Nous Research уже внедрил цикл обучения: агент создает навыки из прошлого опыта и сохраняет их в базу знаний. Аналогично, инструмент last30days-skill реализует автономный поисковый конвейер, который синтезирует данные из Reddit, X и Polymarket, ранжируя информацию по реальным ставкам и лайкам, а не алгоритмам редакций.
Gemini Robotics: агенты выходят в физический мир
Google DeepMind анонсировала Gemini Robotics ER 2, совершив качественный скачок в понимании видео, оркестрации задач и взаимодействии нескольких роботов. Теперь физические агенты способны рассуждать и совместно решать задачи в реальном мире. Это развитие недавнего релиза Gemini Robotics 2, который принес концепцию whole-body intelligence (целостного интеллекта) для робототехники.
Этот кластер новостей критически важен для архитекторов ИИ-агентов. Механизмы оркестрации из мира программных LLM начинают работать в симбиозе с аппаратным обеспечением. Мультиагентные системы больше не ограничиваются чат-ботами — они управляют физическими объектами, где цена ошибки в reasoning (рассуждении) критически высока.
Парадокс рассуждений и оптимизация инференса
Пока агенты получают новые инструменты, сами модели сталкиваются с фундаментальной проблемой. Quanta Magazine поднял дискуссию о том, что ИИ часто приходит к правильному ответу «по неправильным причинам» — скрытые паттерны логики моделей ненадежны. Это объясняет, почему проекты вроде GCC Steering Committee разрабатывают строгие политики в отношении ИИ, а рецензенты фиксируютAccepted-статьи с фейковыми авторами, сгенерированными моделями.
В ответ на ненадежность reasoning индустрия оптимизирует инференс. Команда CTGT показала, что дистилляция знаний от DeepSeek V4 Flash в GPT-OSS-120B не переносит цензуру родительской модели, сохраняя высокую точность в финансах (83.61%). Для локальных агентов Microsoft выпустила VibeVoice с гетерогенным квантованием, сжав модель до 1.58 ГБ для работы на CPU, а HuggingFace представила полностью модульный пайплайн Speech-to-Speech с задержкой, совместимой с OpenAI Realtime API.
Итог
Инфраструктура ИИ-агентов стремительно модуляризируется. Монолитные фреймворки уступают место стандартизированным протоколам взаимодействия (MCP) и обмениваемым «навыкам». Пока разработчики решают проблемы маршрутизации и локального инференса, Google интегрирует эти алгоритмы в физических роботов. Ожидайте, что в ближайшие месяцы фокус сместится на верификацию цепочек рассуждений (reasoning) — по мере того, как агенты начнут управлять критической инфраструктурой и реальным оборудованием.
Источники
- Gemini Robotics ER 2 — Google DeepMind Blog
- Is AI reasoning right for the wrong reasons? — Quanta Magazine
- github/copilot-sdk — GitHub
- Gemini Robotics 2 brings whole body intelligence to robots — DeepMind / Hacker News
- trailofbits/skills — GitHub
- 0x4m4/hexstrike-ai — GitHub
- Distilling DeepSeek into GPT-OSS — CTGT
- huggingface/speech-to-speech — GitHub
- mvanhorn/last30days-skill — GitHub
- langchain-ai/deepagents — GitHub
- ChromeDevTools/chrome-devtools-mcp — GitHub
- Everyone is building LLM routers, we deprecated ours — Manifest
- microsoft/VibeVoice — GitHub
- figma/mcp-server-guide — GitHub
- NousResearch/hermes-agent — GitHub
FAQ
Почему компании отказываются от LLM-роутеров?
Поддержание актуальных правил маршрутизации запросов между моделями требует больше ресурсов, чем экономия на разнице в стоимости токенов.
Чем MCP-серверы лучше интеграций через классические фреймворки?
Они стандартизируют вызов инструментов (tool-calling), отвязывая логику агента от конкретной платформы. Это позволяет агентам вроде Cursor или Claude взаимодействовать с браузером или Figma напрямую по единому протоколу.
Что такое "навыки" (skills) в контексте ИИ-агентов?
Это модульные, узкоспециализированные пакеты инструкций и инструментов (например, для пентестинга или аудита безопасности), которые агент может динамически подключать к своей базе знаний в процессе работы.
В чем главная проблема "рассуждений" современных LLM?
Парадокс заключается в том, что модель может выдавать правильный ответ, основываясь на ошибочных скрытых паттернах. Это делает логику агента ненадежной при выполнении сложных многошаговых задач без жесткого контроля.
Как решается проблема задержки (latency) в голосовых агентах?
Разработчики используют глубокую оптимизацию, такую как гетерогенное квантование моделей на уровне процессора, а также создают модульные пайплайны, совместимые с API Realtime от OpenAI.
Источники
- https://artificialanalysis.ai/models/deepseek-v4-flash-ga
- https://github.com/different-ai/openwork
- https://github.com/mvanhorn/last30days-skill
- https://github.com/langchain-ai/deepagents
- https://www.ctgt.ai/research/distillation-censorship-transfer
- https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/
- https://github.com/0x4m4/hexstrike-ai
- https://manifest.build/blog/why-we-deprecated-our-llm-router/
- https://github.com/sqliteai/waste
- https://github.com/github/copilot-sdk
- https://lwn.net/Articles/1086041/
- https://github.com/trailofbits/skills
- https://github.com/ChromeDevTools/chrome-devtools-mcp
- https://www.quantamagazine.org/is-ai-reasoning-right-for-the-wrong-reasons-20260731/
- https://github.com/figma/mcp-server-guide
- https://geospatialml.com/posts/reviewing-ai-slop/
- https://openai.com/index/ten-advances-in-mathematics
- https://github.com/yc-software/qm
- https://github.com/NousResearch/hermes-agent
- https://github.com/zhaoxuya520/reverse-skill
- https://github.com/microsoft/VibeVoice
- https://github.com/microsoft/TRELLIS.2
- https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration/
- https://github.com/huggingface/speech-to-speech