
Архитектуры ИИ-моделей стремительно эволюционируют от пассивной генерации контента к активному, верифицируемому воздействию на физический и научный мир. Два релиза этого периода — Gemini Robotics ER 2 и фреймворк Science One — фиксируют переход к глубокому мультимодальному пониманию и автономному доказательству.
Gemini Robotics ER 2: видеопонимание и рои роботов
Google DeepMind представила Gemini Robotics ER 2 — модель, обеспечивающую качественный скачок в понимании видео, оркестрации инструментов и кооперации нескольких роботов. Архитектура позволяет машинам не просто воспринимать визуальный поток, но и строить логические связи для решения прикладных задач в реальном мире.
На мой взгляд, главный прорыв здесь — не в самом распознавании объектов, а в архитектурной возможности многороботного взаимодействия. Модель выступает единым когнитивным слоем: роботы получают возможность рассуждать, координировать действия и делегировать подзадачи внутри одной системы.
Это сдвиг парадигмы от узкоспециализированных контроллеров к универсальным embodied-агентам (воплощенным агентам). Визуальное понимание становится базой для сложной оркестрации, где LLM-подобные механизмы рассуждения применяются к физическим действиям.
Science One: верифицируемая наука через цепочки доказательств
Параллельно Google Research представила Science One — фреймворк для автономных научных исследований, построенный на концепции Chain-of-Evidence (цепочка доказательств). Это ответ на главную проблему LLM в научной сфере — галлюцинации и невозможность отследить логику вывода.
Архитектура фреймворка требует от модели не просто генерировать гипотезы, но и формировать проверяемый след доказательств на каждом шаге рассуждения. Это превращает ИИ из черного ящика в инструмент, результаты которого могут верифицироваться традиционными научными методами.
На мой взгляд, Science One задает новый стандарт для автономных исследовательских агентов. Внедрение верифицируемых цепочек в архитектуру критически важно: без этого широкое внедрение ИИ в фундаментальную науку невозможно из-за рисков недостоверных данных.
Итог
Оба релиза показывают, что фокус разработок сместился с увеличения размера базовых моделей на архитектурную надежность и интеграцию с внешней средой. В ближайшем будущем стоит ожидать массового появления гибридных систем, где мощные LLM будут отвечать за рассуждение, а специализированные модули — за строгую верификацию фактов и физическое исполнение.