LingBot-VA 2.0 – «модель мира» для роботов как альтернатива VLA
19.07.2026Если VLA-модели ИИ (как RT-2 или OpenVLA), набирающие популярность, строятся на базе больших языковых или видеомоделей, то LingBot-VA 2.0 спроектирована как «видео-действенная» (video-action) модель мира для роботов. Вместо того чтобы дорабатывать модели, изначально созданные для генерации цифрового контента, она обучается «с нуля» предсказывать, как действие изменит окружение, и на этой основе планировать следующие шаги.
Этот подход практикует китайская компания Robbyant - подразделение Ant Group, занимающееся воплощенным ИИ (embodied AI).
Основные особенности:
▫️Это авторегрессионная модель с семантическим визуально-действенным токенизатором (semantic visual-action tokenizer). Токенизатор совместно кодирует визуальную информацию и действия, помогая модели переводить словесные инструкции в движения робота
▫️Используется подход MoE (Mixture of Experts — «смесь экспертов»), который расширяет возможности модели без потери эффективности вывода.
▫️Асинхронный вывод (enhanced asynchronous inference) позволяет роботу одновременно предсказывать будущие состояния и выполнять действия, корректируя решения на основе актуальных наблюдений
▫️Модель обеспечивает управление в реальном времени: до 150 Гц на одном GPU
▫️Для освоения новой задачи роботу достаточно всего 20 демонстраций - без переобучения, за счет механизма in-context learning (обучение в контексте).
Компания продемонстрировала возможности робота на ряде задач, требующих выполнения цепочек действий, например, в игре в настольный аэрохоккей с человеком в реальном времени. LingBot-VLA 2.0 установлена на 20 вариантов реализации роботов, расшаривающих информацию о своих действиях для ускорения обучения роботов.
((фото и видео - компании RobbyAnt; видео - смотрите в мессенджерах))
✓ | зеркало -












