
Индустрия постепенно отходит от гонки за «голосовым» интеллектом, переходя к физическому взаимодействию с миром и тонкой оптимизации архитектур. На этой неделе в фокусе — коллаборация роботов от Google DeepMind и математическое превосходство тонкой настройки от OpenAI.
Gemini Robotics ER 2: видео-понимание и рой роботов
Google DeepMind представила Gemini Robotics ER 2 — новую модель, которая обеспечивает качественный скачок в управлении физическими агентами. Архитектура теперь глубже интегрирует понимание видеопотока (video understanding), оркестрацию инструментов и — что наиболее важно — возможность взаимодействия нескольких роботов одновременно.
Если прошлые поколения фокусировались на изолированных задачах одного механизма, то теперь система способна распределять роли в рамках единого рабочего процесса. Модели требуется меньше жестко заданного кода: ИИ сам «смотрит» на окружение через камеры, строит логическую цепочку и координирует действия группы машин для решения комплексной физической задачи.
На мой взгляд, именно мультиагентность — следующий главный рубеж в робототехнике. Одно дело — обучить руку брать кубик, и совсем другое — заставить два манипулятора динамически координироваться, опираясь исключительно на визуальный контекст в реальном времени. DeepMind делает верную ставку на зрение как на основу для логики физического мира.
Настройки API против сырой вычислительной мощности
OpenAI рассказала о впечатляющем результате: всего два измененных параметра API утроили результаты модели GPT-5.6 на сложнейшем бенчмарке ARC-AGI-3. Секрет кроется во включении удержания цепочки рассуждений (reasoning) и сжатия контекста (compaction).
Бенчмарки семейства ARC традиционно считаются «киммерийскими» для LLM (больших языковых моделей), так как требуют абстрактного мышления, а не простого паттерн-мэтчинга. Ранее считалось, что для прогресса на таких тестах необходимо экспоненциально увеличивать размер и объем обучающих данных. Однако OpenAI доказывает, что архитектурное управление плотностью контекста на этапе инференса работает эффективнее.
Этот кейс наглядно демонстрирует, что алгоритмическая компоновка запроса способна победить брутфорс. Сжатие контекста позволяет модели не «распыляться» на шум, сохраняя фокус на структурной логике теста.
Граница цены и производительности
Вместе с алгоритмическими победами OpenAI снизила цены на использование флагманских конфигураций GPT-5.6 — версий Luna и Terra. Компания официально заявляет об оптимизации архитектуры, которая делает развертывание ИИ-рабочих процессов для enterprise-клиентов (корпоративного сектора) значительно дешевле без потери качества.
Снижение стоимости API при одновременном росте эффективности на сложных бенчмарках — четкий сигнал рынку. Индустрия переходит от стадии демонстрации возможностей к стадии масштабируемой интеграции. Вычисления становятся доступнее, а барьер для входа разработчиков сложных ИИ-систем снижается.
Итог
Главная тенденция последних релизов — переход от экстенсивного роста параметров к интенсивной оптимизации. Будущее ИИ лежит не в бесконечном масштабировании, а в более умном управлении контекстом для LLM и глубоком мультимодальном слиянии для физических роботизированных систем. В ближайшие месяцы стоит ожидать, как конкуренты начнут копировать методы оркестрации контекста, а мультиагентные архитектуры станут стандартом для индустриальной робототехники.