ИИ-агенты: софт перестраивают под агентов, а не под людей — и это меняет всё · 16.08.2026

ии-агенты 16 авг. 2026 г.

Инфраструктура для ИИ-агентов прошла точку невозврата: инструменты теперь создаются не для удобства разработчиков, а для прямого потребления автономными системами. Параллельно снижается порог входа — от fine-tuning на 4 ГБ видеопамяти до превращения знаний уволенных коллег в переиспользуемые навыки.

CLI-Anything: программное обеспечение становится agent-native

Проект CLI-Anything из HKUDS предлагает радикально простой тезис: сегодняшнее ПО обслуживает людей, завтрашними пользователями будут агенты. Инструмент предоставляет единый хаб CLI-интерфейсов (command-line interface), через который агенты могут взаимодействовать с произвольным софтом — от установки через pip до вызова команд. [1]

На мой взгляд, это недооценённый сдвиг. Вся индустрия tool-calling сейчас бьётся над тем, как научить LLM вызывать API. CLI-Anything идёт другим путём: он делает CLI универсальным протоколом взаимодействия между агентом и софтом. CLI уже есть у большинства инструментов, он текстовый, детерминированный и не требует специальной адаптации. Это может стать более прагматичным путём к агент-нативному софту, чем ожидание, пока каждый вендор откроет чистый API.

Soup: fine-tuning в один YAML-файл

Soup сводит fine-tuning и post-training LLM к одной команде и одному конфигурационному файлу YAML. Проект заявляет о возможности обучать 8B-модель на ноутбуке с 4 ГБ видеопамяти — благодаря технике послойного стриминга (layer streaming). Никакого SSH, никаких многофайловых конфигураций. [2]

Это важно для экосистемы агентов по простой причине: кастомизированные модели — основа специализированных агентов. Если раньше команда для fine-tuning'а нужна была инфраструктура и ML-инженер, то теперь порог снижается до уровня «установил пакет, написал YAML». Демократизация fine-tuning'а означает, что нишевые агенты для конкретных доменов станут массовыми.

SGLang-Omni: мультимодальный сервинг как инфраструктура

SGLang-Omni расширяет возможности SGLang на мультимодальные модели — TTS (text-to-speech), ASR (automatic speech recognition) и омнимодальные архитектуры. Проект поддерживает Day-0 интеграцию с новыми моделями, включая MiniMax. [3]

Для агентных систем это означает, что голосовые и мультимодальные агенты перестают быть экзотикой. Если раньше TTS и ASR нужно было разворачивать отдельно и сшивать через оркестрацию, то SGLang-Omni унифицирует сервинг. Агент, который слушает, думает и говорит, становится не исследовательским прототипом, а деплоймент-паттерном.

Colleague-skill: знания уходящих сотрудников как цифровые навыки

Проект colleague-skill переосмысляет онбординг: когда коллега увольняется, ментор выпускается или команда расформировывается, его знания можно превратить в структурированные «skills» — модули, которые агент может вызывать как инструменты. Проект называет это «цифровой жизнью 1.0». [4]

На мой взгляд, это один из самых интересных кейсов практического применения агентной архитектуры. Корпоративная память — болезненная проблема, которую классические базы знаний не решили. Если знания уходящего сотрудника превращаются в tool-calling-модуль, который новый сотрудник (или агент-помощник) может дёргать в реальном времени — это меняет экономику текучести кадров. Концепция «dot-skill» как формата упаковки экспертности потенциально так же важна, как MCP для стандартизации инструментов.

OpenBiliClaw: локальный самоэволюционирующий агент для контента

OpenBiliClaw — локальный, open-source агент, который сначала «понимает» пользователя, а затем проактивно ищет контент на платформах: Bilibili, Xiaohongshu, Douyin, YouTube, X, Zhihu, Reddit, Weibo и в открытом вебе. Поддерживает плагины deepseek harness. [5]

Проект иллюстрирует важный тренд: переход от реактивных агентов (промпт ответ) к проактивным (агент сам определяет, что искать и когда). Локальность и приватность — ключевое требование для персональных агентов, и OpenBiliClaw показывает, что это реализуемо на открытых моделях. Кроссплатформенность при этом решает проблему фрагментации контента.

Рабочая память ИИ vs человеческий мозг

Параллельно идёт дискуссия о когнитивных пределах агентов. Аналитик Дэвид Пиффер указывает, что рабочая память ИИ значительно превосходит человеческую, но это не означает превосходства в математическом рассуждении. Дискуссия на Hacker News набрала 470 баллов с 405 комментариями. [6]

Для агентной архитектуры это имеет прямой смысл: ограниченность контекстного окна — не фундаментальная проблема, а инженерная. Агенты с доступом к инструментам и внешней памяти могут компенсировать слабости в чистом рассуждении через оркестрацию — что и демонстрируют проекты выше.

Итог

Тенденция недели — инфраструктурная зрелость. CLI-Anything делает софт агент-нативным без переделки API. Soup снижает порог fine-tuning'а. SGLang-Omni унифицирует мультимодальный сервинг. Colleague-skill превращает экспертность в tool-calling-модули. OpenBiliClaw показывает проактивных локальных агентов. Каждый слой стека — от обучения до деплоймента до оркестрации — становится доступнее. В ближайшие месяцы ожидайте взрыв нишевых вертикальных агентов: порог входа упал ниже, чем у классических SaaS-продуктов.

Источники

  1. CLI-Anything — GitHub Trending
  2. Soup — GitHub Trending
  3. SGLang-Omni — GitHub Trending
  4. Colleague-skill — GitHub Trending
  5. OpenBiliClaw — GitHub Trending
  6. AI has access to a vastly larger working memory — Hacker News

FAQ

Чем подход CLI-Anything отличается от стандартного tool-calling через API?

CLI-Anything использует существующие CLI-интерфейсы как универсальный протокол, вместо того чтобы ждать, пока каждый вендор откроет API. CLI уже есть у большинства инструментов и не требует адаптации.

Может ли Soup реально обучить 8B-модель на 4 ГБ видеопамяти?

Проект заявляет это благодаря технике послойного стриминга — последовательной загрузке слоёв в память вместо одновременной. Это компромисс между скоростью и доступностью, но рабочий.

Что такое dot-skill в контексте colleague-skill?

Это формат упаковки знаний сотрудника в структурированный модуль, который агент может вызывать как инструмент (tool). По сути — перенос концепции tool-calling на корпоративную экспертизу.

Почему локальность важна для агентов вроде OpenBiliClaw?

Проактивный агент анализирует поведение и интересы пользователя — это чувствительные данные. Локальная обработка исключает передачу персональных данных на внешние сервера.

Что значит «проактивный агент» в отличие от реактивного?

Реактивный агент отвечает на запрос. Проактивный сам определяет, что и когда искать, основываясь на построенной модели пользователя — без явного промпта. ```

Источники

  1. https://github.com/titanwings/colleague-skill
  2. https://www.science.org/content/blog-post/so-how-ai-drug-discovery-doing-really
  3. https://github.com/whiteguo233/OpenBiliClaw
  4. https://github.com/sgl-project/sglang-omni
  5. https://github.com/MakazhanAlpamys/Soup
  6. https://davidepiffer.com/p/ai-isnt-outthinking-mathematicians
  7. https://github.com/HKUDS/CLI-Anything

Теги