ИИ-агенты: главная угроза — не галлюцинации, а автономные действия
Пока индустрия спорила о галлюцинациях и выравнивании (alignment) базовых моделей, разработчики столкнулись с более острой проблемой — неконтролируемыми действиями автономных систем. Тренд этой недели сместился от создания «умных» агентов к построению инфраструктуры безопасности, наблюдаемости и контроля над ними.
Безопасность как архитектурный слой
Uber представила открытую систему ADR (Agentic AI Detection and Response) — корпоративный инструмент для мониторинга и защиты ИИ-агентов. Это решение обеспечивает наблюдаемость (observability), оценку уязвимостей и обнаружение угроз в реальном времени для агентов, взаимодействующих с сотрудниками. На мой взгляд, появление ADR доказывает, что защита ИИ-агентов требует принципиально нового подхода по сравнению с классической кибербезопасностью, так как традиционные фаерволы не справляются с угрозами изнутри логики LLM.
Параллельно растут риски социальной инженерии на базе ИИ. По данным Интерпола, технологии искусственного интеллекта теперь используются более чем в половине киберпреступлений в Африке на фоне резкого всплеска мошенничества. Это подчеркивает, что угроза исходит не только от ошибок кода, но и от злоупотребления генеративными возможностями систем, требуя жесткого эшелонированного контроля.
Локальная плоскость управления для долгих задач
Проект LoopX предлагает легковесное ядро состояния для длительно работающих команд ИИ-агентов. Инструмент агностичен к среде исполнения (поддерживает Codex, Claude Code и другие фреймворки) и обеспечивает сохранение целей, контроль квот, ведение логов доказательств и проверяемую передачу контекста между узлами. Это логичный ответ индустрии на проблему «забывчивости» и потери фокуса у агентов в многошаговых задачах. Без надежной оркестрации и durable-выполнений (устойчивых к сбоям) серьезные enterprise-применения невозможны.
Практика: от пентеста до видеомонтажа
Открытое сообщество активно покрывает новые ниши. Инструмент Strix представляет собой автономного ИИ-хакера для пентеста (тестирования на проникновение), который находит и устраняет уязвимости в приложениях, легко интегрируясь в CI/CD пайплайны. А проект video-use от browser-use позволяет полностью делегировать монтаж видео агентам на базе Claude Code — от загрузки сырых кадров до рендера итогового файла.
Тренд очевиден: tool-calling становится универсальным интерфейсом. Агенты всё реже генерируют текст и всё чаще напрямую управляют системами — от пайплайнов безопасности до видеоредакторов.
Локальные модели и модерация
Развитие агентности требует компактных моделей, способных работать на-устройствах без отдачи данных в облако. Liquid AI выпустила LFM2.5-2.6B, позволяющую разворачивать локальных агентов где угодно. Для защиты пользовательского контента в таких распределенных системах Mistral представила Shieldstral — открытую модель на 3 миллиарда параметров для мультимодальной модерации.
Итог: Эпоха наивных автономных ИИ-систем завершается. Мы наблюдаем формирование полноценной инфраструктуры вокруг агентов: от плоскостей управления состоянием до систем обнаружения вторжений. В ближайшие месяцы конкуренция сместится из области базовых моделей в сегмент фреймворков оркестрации и инструментов безопасности.
Источники
- uber/ADR (GitHub Trending)
- AI fuels more than half of cybercrime in Africa (africanews)
- huangruiteng/loopx (GitHub Trending)
- usestrix/strix (GitHub Trending)
- browser-use/video-use (GitHub Trending)
- Deploy local agents everywhere with LFM2.5-2.6B (Hugging Face Blog)
- Mistral's Shieldstral (Mistral AI)
FAQ
Почему классической кибербезопасности недостаточно для ИИ-агентов?
Традиционные системы защиты контролируют доступ извне. ИИ-агенты часто выполняют легитимные команды изнутри системы, поэтому для их мониторинга требуются новые подходы, анализирующие логику принятия решений (например, система ADR от Uber).
В чем главная проблема долгоживущих (long-running) агентов?
Они теряют контекст, отклоняются от изначальной цели и нерационально тратят вычислительные квоты. Для решения нужны специализированные ядра состояния, такие как LoopX, которые жестко контролируют процесс выполнения задач.
Что такое tool-calling в контексте видеомонтажа и пентеста?
Это механизм, при котором LLM не просто пишет текстовый ответ, а вызывает внешние функции и API. В случае video-use или Strix агент напрямую взаимодействует с файловой системой, библиотеками монтажа или сканерами уязвимостей.
Зачем нужны компактные open-weights модели вроде LFM2.5-2.6B?
Они позволяют запускать агентов локально на устройствах пользователей, что снижает задержку, экономит затраты на облачные API и критически важно для сохранения конфиденциальности корпоративных данных.
Источники
- https://www.africanews.com/2026/08/04/ai-fuels-more-than-half-of-cybercrime-in-africa-as-digital-scams-surge-interpol/
- https://github.com/huangruiteng/loopx
- https://github.com/RVC-Project/Retrieval-based-Voice-Conversion-WebUI
- https://huggingface.co/blog/LiquidAI/lfm2-5-2-6b
- https://github.com/browser-use/video-use
- https://github.com/uber/ADR
- https://github.com/usestrix/strix
- https://mistral.ai/news/shieldstral/