Robotersysteme, die im Microsoft-Labor mit Technologie interagieren und das Rho-alpha Vision-Language-Action-Modell präsentieren.

Microsoft stellt Rho-alpha vor: Die nächste Grenze für Vision-Sprach-Aktionsmodelle in der Robotik

Rho-alpha Vision-Language-Action-Modell ist Microsofts innovatives KI-Modell für Robotik, das robotische Fähigkeiten durch sensorische Integration und menschliches Feedback verbessert.
SK hynix erreicht 2025 Rekordhöhen dank KI-getriebenem Speicherboom Du liest Microsoft stellt Rho-alpha vor: Die nächste Grenze für Vision-Sprach-Aktionsmodelle in der Robotik 2 Minuten Weiter Die Lebensdauergrenze überwinden: Nippon Kojundos Durchbruch bei Zinkbatterien
Microsoft hat sein bahnbrechendes Modell der künstlichen Intelligenz für Robotik mit dem Namen Rho-alpha offiziell vorgestellt. Abgeleitet von der erfolgreichen Phi-Serie von Vision-Language-Modellen stellt Rho-alpha einen bedeutenden Sprung im Bereich der verkörperten künstlichen Intelligenz dar. Dieses neue Modell wird als Vision-Language-Action-Modell eingeordnet, doch Microsoft-interne Teams bezeichnen es aufgrund seiner erweiterten Wahrnehmungsfähigkeiten, die über herkömmliche visuelle Daten hinausgehen, häufig als „Vision-Language-Action plus“.
Die Kerninnovation von Rho-alpha liegt in seiner Fähigkeit, komplexe Anweisungen in natürlicher Sprache direkt in präzise Steuersignale für Roboterhardware zu übersetzen. Derzeit wird das Modell einer gründlichen Bewertung auf Zweiarm-Systemen und humanoiden Roboterplattformen unterzogen. Anders als frühere Iterationen der Robotik-KI, die vor allem auf visuellen Eingaben beruhten, integriert Rho-alpha fortschrittliche taktile Sensorik. Dadurch können Roboter ihre Umgebung „fühlen“ und kontaktintensive Aufgaben wie das Einsetzen kleiner elektronischer Bauteile oder den Umgang mit empfindlichen Objekten mit menschenähnlicher Geschicklichkeit ausführen.
Um dieses Leistungsniveau zu erreichen, setzte Microsoft eine ausgefeilte Co-Training-Pipeline ein. Das Modell wurde mithilfe einer Kombination aus realen physischen Demonstrationen, hochpräzisen synthetischen Daten, die über NVIDIA Isaac Simulation auf Azure erzeugt wurden, sowie webskaligen Datensätzen für visuelle Frage-Antwort-Systeme trainiert. Darüber hinaus steht das „plus“ in Vision-Language-Action plus für die Einbeziehung von Feedback-Schleifen mit Menschen. Menschliche Bediener können über Teleoperation korrigierendes Feedback geben, wodurch Rho-alpha seine Leistung während des tatsächlichen Einsatzes kontinuierlich verbessern kann.
Mit Blick nach vorn plant Microsoft, die Sensorsuite des Modells um Kraftsensorik zu erweitern und so die Lücke zwischen simulierter Intelligenz und physischer Ausführung weiter zu verkleinern. Technische Spezifikationen und ein umfassendes Forschungspapier sollen in den kommenden Monaten veröffentlicht werden und der globalen Entwicklergemeinschaft tiefere Einblicke in diese transformative Technologie bieten.