Microsoft는 로보틱스를 위한 획기적인 인공지능 모델 Rho-alpha를 공식적으로 공개했습니다. 성공적인 Phi 시리즈의 비전-언어 모델을 기반으로 한 Rho-alpha는 구현형 인공지능 분야에서 큰 도약을 의미합니다. 이 새로운 모델은 비전-언어-행동 모델로 분류되지만, Microsoft 내부 팀에서는 전통적인 시각 데이터를 넘어서는 확장된 지각 능력 때문에 이를 종종 "비전-언어-행동 플러스"라고 부릅니다.
Rho-alpha의 핵심 혁신은 복잡한 자연어 지시를 로봇 하드웨어를 위한 정밀한 제어 신호로 직접 변환하는 능력에 있습니다. 현재 이 모델은 이중 팔 시스템과 휴머노이드 로봇 플랫폼에서 엄격한 평가를 받고 있습니다. 주로 시각 입력에 의존했던 기존의 로봇 인공지능과 달리, Rho-alpha는 고도화된 촉각 센싱을 통합합니다. 이를 통해 로봇은 주변 환경을 "느낄" 수 있으며, 작은 전자 부품을 삽입하거나 섬세한 물체를 사람처럼 정교하게 다루는 등 접촉이 많은 작업을 수행할 수 있습니다.
이 수준의 성능을 달성하기 위해 Microsoft는 정교한 공동 학습 파이프라인을 활용했습니다. 이 모델은 실제 물리 시연, Azure의 NVIDIA Isaac Simulation으로 생성한 고정밀 합성 데이터, 그리고 웹 규모의 시각 질의응답 데이터셋을 조합해 학습되었습니다. 또한 Vision-Language-Action plus의 "plus"는 인간 피드백 루프의 포함을 의미합니다. 인간 작업자는 원격 조작을 통해 교정 피드백을 제공할 수 있으며, 이를 통해 Rho-alpha는 실제 배포 중에도 성능을 지속적으로 개선합니다.
앞으로 Microsoft는 모델의 감각 범위를 힘 감지까지 확장할 계획이며, 이를 통해 시뮬레이션된 지능과 물리적 실행 간의 격차를 더욱 좁힐 예정입니다. 기술 사양과 포괄적인 연구 논문은 앞으로 몇 달 내 공개될 예정이며, 전 세계 개발자 커뮤니티에 이 혁신적인 기술에 대한 더 깊은 통찰을 제공할 것입니다.