ИИ-агенты: фреймворки умирают, навыки и MCP-серверы побеждают

ии-агенты 1 авг. 2026 г.

Разработка ИИ-агентов переживает структурный сдвиг: индустрия отворачивается от тяжеловесных фреймворков в пользу модульных MCP-серверов (Model Context Protocol) и «навыков» (skills). Параллельно физическая робототехника совершает скачок в multi-robot collaboration (многороботном взаимодействии).

Конец эпохи LLM-роутеров и классических фреймворков

Команда Manifest публично объявила о отказе от собственного LLM-роутера — слоя для динамического распределения запросов между моделями. Их опыт показывает, что поддержание актуальности правил маршрутизации обходится дороже, чем сама экономия на токенах. В то же время LangChain выпустил Deep Agents — «батарейный» харнес (harness) для агентов, работающий с длинным горизонтом планирования. На мой взгляд, это признание неудачи: вместо универсального фреймворка разработчикам пришлось выпустить жестко opinions-ориентированное решение, чтобы дать инженерам рабочие дефолтные настройки из коробки.

Сдвиг подтверждается взрывным ростом популярности MCP-серверов. Официальный сервер Chrome DevTools позволяет агентам (Claude, Cursor, Copilot) напрямую инспектировать живой браузер. Figma выпустила аналогичный гайд для своего MCP-сервера, чтобы агенты могли генерировать код напрямую из дизайн-макетов. Тренд очевиден: tool-calling (вызов инструментов) становится стандартизированным через протокол, отвязываясь от конкретных архитектур агентов.

Революция «навыков»: агенты учатся взламывать и искать

Если фреймворки отходят на второй план, то их место занимают пакеты навыков — узкоспециализированные инструменты. Trail of Bits выпустила маркетплейс навыков для Claude Code, сфокусированный на аудите безопасности и поиске уязвимостей. На шаг вперед пошел проект HexStrike AI — MCP-сервер, позволяющий агентам автономно запускать более 150 инструментов кибербезопасности для пентестинга.

На мой взгляд, концепция саморазвивающихся агентов через навыки — это ближайшее будущее tool-calling. Проект Hermes Agent от Nous Research уже внедрил цикл обучения: агент создает навыки из прошлого опыта и сохраняет их в базу знаний. Аналогично, инструмент last30days-skill реализует автономный поисковый конвейер, который синтезирует данные из Reddit, X и Polymarket, ранжируя информацию по реальным ставкам и лайкам, а не алгоритмам редакций.

Gemini Robotics: агенты выходят в физический мир

Google DeepMind анонсировала Gemini Robotics ER 2, совершив качественный скачок в понимании видео, оркестрации задач и взаимодействии нескольких роботов. Теперь физические агенты способны рассуждать и совместно решать задачи в реальном мире. Это развитие недавнего релиза Gemini Robotics 2, который принес концепцию whole-body intelligence (целостного интеллекта) для робототехники.

Этот кластер новостей критически важен для архитекторов ИИ-агентов. Механизмы оркестрации из мира программных LLM начинают работать в симбиозе с аппаратным обеспечением. Мультиагентные системы больше не ограничиваются чат-ботами — они управляют физическими объектами, где цена ошибки в reasoning (рассуждении) критически высока.

Парадокс рассуждений и оптимизация инференса

Пока агенты получают новые инструменты, сами модели сталкиваются с фундаментальной проблемой. Quanta Magazine поднял дискуссию о том, что ИИ часто приходит к правильному ответу «по неправильным причинам» — скрытые паттерны логики моделей ненадежны. Это объясняет, почему проекты вроде GCC Steering Committee разрабатывают строгие политики в отношении ИИ, а рецензенты фиксируютAccepted-статьи с фейковыми авторами, сгенерированными моделями.

В ответ на ненадежность reasoning индустрия оптимизирует инференс. Команда CTGT показала, что дистилляция знаний от DeepSeek V4 Flash в GPT-OSS-120B не переносит цензуру родительской модели, сохраняя высокую точность в финансах (83.61%). Для локальных агентов Microsoft выпустила VibeVoice с гетерогенным квантованием, сжав модель до 1.58 ГБ для работы на CPU, а HuggingFace представила полностью модульный пайплайн Speech-to-Speech с задержкой, совместимой с OpenAI Realtime API.

Итог

Инфраструктура ИИ-агентов стремительно модуляризируется. Монолитные фреймворки уступают место стандартизированным протоколам взаимодействия (MCP) и обмениваемым «навыкам». Пока разработчики решают проблемы маршрутизации и локального инференса, Google интегрирует эти алгоритмы в физических роботов. Ожидайте, что в ближайшие месяцы фокус сместится на верификацию цепочек рассуждений (reasoning) — по мере того, как агенты начнут управлять критической инфраструктурой и реальным оборудованием.

Источники

  1. Gemini Robotics ER 2 — Google DeepMind Blog
  2. Is AI reasoning right for the wrong reasons? — Quanta Magazine
  3. github/copilot-sdk — GitHub
  4. Gemini Robotics 2 brings whole body intelligence to robots — DeepMind / Hacker News
  5. trailofbits/skills — GitHub
  6. 0x4m4/hexstrike-ai — GitHub
  7. Distilling DeepSeek into GPT-OSS — CTGT
  8. huggingface/speech-to-speech — GitHub
  9. mvanhorn/last30days-skill — GitHub
  10. langchain-ai/deepagents — GitHub
  11. ChromeDevTools/chrome-devtools-mcp — GitHub
  12. Everyone is building LLM routers, we deprecated ours — Manifest
  13. microsoft/VibeVoice — GitHub
  14. figma/mcp-server-guide — GitHub
  15. NousResearch/hermes-agent — GitHub

FAQ

Почему компании отказываются от LLM-роутеров?

Поддержание актуальных правил маршрутизации запросов между моделями требует больше ресурсов, чем экономия на разнице в стоимости токенов.

Чем MCP-серверы лучше интеграций через классические фреймворки?

Они стандартизируют вызов инструментов (tool-calling), отвязывая логику агента от конкретной платформы. Это позволяет агентам вроде Cursor или Claude взаимодействовать с браузером или Figma напрямую по единому протоколу.

Что такое "навыки" (skills) в контексте ИИ-агентов?

Это модульные, узкоспециализированные пакеты инструкций и инструментов (например, для пентестинга или аудита безопасности), которые агент может динамически подключать к своей базе знаний в процессе работы.

В чем главная проблема "рассуждений" современных LLM?

Парадокс заключается в том, что модель может выдавать правильный ответ, основываясь на ошибочных скрытых паттернах. Это делает логику агента ненадежной при выполнении сложных многошаговых задач без жесткого контроля.

Как решается проблема задержки (latency) в голосовых агентах?

Разработчики используют глубокую оптимизацию, такую как гетерогенное квантование моделей на уровне процессора, а также создают модульные пайплайны, совместимые с API Realtime от OpenAI.

Источники

  1. https://artificialanalysis.ai/models/deepseek-v4-flash-ga
  2. https://github.com/different-ai/openwork
  3. https://github.com/mvanhorn/last30days-skill
  4. https://github.com/langchain-ai/deepagents
  5. https://www.ctgt.ai/research/distillation-censorship-transfer
  6. https://deepmind.google/blog/gemini-robotics-2-brings-whole-body-intelligence-to-robots/
  7. https://github.com/0x4m4/hexstrike-ai
  8. https://manifest.build/blog/why-we-deprecated-our-llm-router/
  9. https://github.com/sqliteai/waste
  10. https://github.com/github/copilot-sdk
  11. https://lwn.net/Articles/1086041/
  12. https://github.com/trailofbits/skills
  13. https://github.com/ChromeDevTools/chrome-devtools-mcp
  14. https://www.quantamagazine.org/is-ai-reasoning-right-for-the-wrong-reasons-20260731/
  15. https://github.com/figma/mcp-server-guide
  16. https://geospatialml.com/posts/reviewing-ai-slop/
  17. https://openai.com/index/ten-advances-in-mathematics
  18. https://github.com/yc-software/qm
  19. https://github.com/NousResearch/hermes-agent
  20. https://github.com/zhaoxuya520/reverse-skill
  21. https://github.com/microsoft/VibeVoice
  22. https://github.com/microsoft/TRELLIS.2
  23. https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration/
  24. https://github.com/huggingface/speech-to-speech

Теги