
Развитие Physical AI сегодня уткнулось в отсутствие достаточного количества данных. Если для обучения VLM мы могли взять огромный объем текстовой информации, который годами копился в интернете, то VLA и world‑action-модели кормить практически нечем, создавать новые датасеты для обучения этих моделей оказалось чуть ли не сложнее, чем разработать конструкцию робота. Хотя люди сняли и выложили в открытый доступ огромное количество видео от первого лица, где руками делают что угодно — готовят, собирают, крутят, хватают, но использовать их в таком виде пока невозможно.
Я Артём Лыков, руководитель R&D-направления Physical AI в MWS, и сегодня я расскажу вам о том, с какими проблемами сталкивается отрасль, и о том, как мы разработали и протестировали AgenticFocus — пайплайн, который берет любое FPV-видео и превращает его в полноценный датасет для обучения гуманоидных роботов тонкой моторике. Ключевая идея AgenticFocus — разделить видеоряд на несколько полноценных слоев информации — фон, объекты и кинематику конкретного робота.
Читать далее