Робототехника: Google делает ставку на «телесный интеллект» и кооперацию роботов. Дайджест за 31 July 2026

Lead: Google DeepMind совершает сдвиг парадигмы в embodied AI (воплощенном искусственном интеллекте). Новая линейка моделей Gemini Robotics 2.0 учит машины не просто ходить, но понимать видеоряд, координировать действия и работать в команде — превращая гуманоидов из программируемых манекенов в автономных агентов.

Gemini Robotics ER 2: От изолированных задач к оркестрации

Google DeepMind анонсировала Gemini Robotics ER 2 — модель, которая обеспечивает роботам продвинутое понимание видео, оркестрацию инструментов и многороботную кооперацию. Ранее роботы решали узкие задачи в жестко заданных условиях. Теперь акцент смещен на рассуждение и взаимодействие с реальным миром через визуальный контекст.

На мой взгляд, это ключевой шаг к созданию подлинных физических агентов. Способность модели выступать связующим звеном между несколькими роботами означает, что мы приближаемся к роевому поведению в промышленности и логистике. Вместо одного перегруженного вычислениями гуманоида мы получаем слаженный ансамбль, где каждый агент понимает свою роль в общем процессе.

Gemini Robotics 2.0: «Телесный интеллект» и ловкость

Вторая версия платформы Gemini Robotics 2 приносит концепцию whole body intelligence (целостного интеллекта тела). Это означает, что ИИ управляет не отдельными сочленениями, а всем телом робота как единой системой, что радикально улучшает ловкость и безопасность манипуляций.

Платформа включает три модели, но лишь одна из них пока доступна публично. Это указывает на то, что коммерциализация сложных моторно-когнитивных систем идет осторожно. Безопасность в физическом мире — критический фактор. Ошибка LLM (большой языковой модели) в чате стоит пользовательского раздражения; ошибка 80-килограммового робота на заводе может привести к травмам и разрушениям. Google явно осознает эту разницу.

Уязвимости LLM: Тормоз для автономных агентов

Пока робототехника делает рывок вперед, фундамент, на котором она строится, демонстрирует структурные проблемы. Исследователи на Международной конференции по машинному обучению (ICML) представили работу, доказывающую, что LLM невозможно сделать полностью защищенными от атак из-за фундаментального недостатка в их архитектуре.

Для embodied AI это критическое предупреждение. Если языковая модель служит «мозгом» для физического робота, ее уязвимость к промпт-инъекциям или взлому становится прямой угрозой физической безопасности. На мой взгляд, до тех пор, пока проблема безопасности базовых моделей не решена на архитектурном уровне, внедрение автономных роботов в неструктурированные среды будет оставаться рискованным. Разработчикам робототехники придется выстраивать изолированные слои безопасности, не полагаясь на «разумность» самой LLM.

Итог

Робототехника переходит от зацикленности на механике к фокусу на когнитивной координации. В ближайшие месяцы следует ожидать интеграции Gemini Robotics 2.0 в пилотные промышленные проекты, где способность нескольких роботов к кооперации даст реальный экономический эффект. Однако скорость внедрения будет ограничена не инженерными возможностями, а безопасностью базовых ИИ-моделей, чья уязвимость к атакам остается нерешенной системной проблемой.

Источники

  1. Google DeepMind Blog: Gemini Robotics ER 2
  2. Ars Technica: Google reveals Gemini Robotics 2.0
  3. Google DeepMind Blog: Gemini Robotics 2 brings whole body intelligence
  4. MIT Technology Review: A fundamental flaw leaves LLMs vulnerable to attack