Roboterwelt

Vidar: ShengShu und Tsinghua trainieren Roboter mit einem Videomodell

Das Pekinger KI-Unternehmen ShengShu und Forscher der Tsinghua-Universität lassen ein Videogenerierungsmodell vorhersagen, wie eine Roboteraufgabe ablaufen müsste. Für einen neuen Roboter sollen so rund 20 Minuten Vorführungen genügen.

Von Roboterwelt RedaktionAktualisiert 4 Min. LesezeitQuellen: 6
KI-generierte Illustration: weißer Roboterarm greift einen Apfel, daneben Bildschirme mit Ansichten des Arms, ein Würfel, eine Badeente und ein Tennisball
Foto: KI-generiert (Roboterwelt)

Was ShengShu im August 2025 angekündigt hat

Am 8. August 2025 berichtete The Robot Report über Vidar, ein Modell, mit dem ShengShu Technology Roboter mit wenig echten Trainingsdaten anlernen will. Der Name steht für „Video Diffusion for Action Reasoning“. Nach Angaben des Unternehmens kann Vidar aus nur 20 Minuten Trainingsdaten verallgemeinerte Roboterhandlungen ableiten. Das entspreche zwischen einem Achtzigstel und einem Zwölfhundertstel der Datenmenge, die etablierte Modelle wie RDT und π0.5 benötigen. Als Einsatzfelder nennt ShengShu Haushaltsroboter, Altenpflege, Fertigung und Medizinrobotik. Diese Angaben stammen vom Hersteller. 

ShengShu wurde im März 2023 in Peking gegründet und ist vor allem für die Videogenerierungsplattform Vidu bekannt. Auf ihr baut Vidar auf. 

Wie das System arbeitet

Die technischen Details stehen in einem Fachaufsatz, der seit dem 17. Juli 2025 auf dem Preprint-Server arXiv liegt und bisher nicht begutachtet ist. Die acht Autoren um Yao Feng und Hengkai Tan gehören zur Tsinghua-Universität und zum Tsinghua-Bosch Joint ML Center. In der jüngsten Fassung ist zusätzlich ShengShu als Institution genannt. Letzter Autor ist Jun Zhu, den eine ShengShu-Pressemitteilung vom April 2026 als Gründer des Unternehmens nennt. 

Vidar arbeitet in zwei Stufen. Zuerst erzeugt ein Videomodell, wie die Aufgabe aussehen soll, etwa „Lege den grünen Apfel in den Korb“. Grundlage ist Vidu 2.0, das die Forscher mit rund 750.000 Aufzeichnungen von drei zweiarmigen Roboterplattformen weitertrainiert haben. Fast alle davon, 726.843, stammen aus dem Datensatz Agibot-World. Die übrigen kommen aus den Sammlungen RDT und RoboMind. Jede Aufzeichnung zeigt die Szene aus mehreren Kameraperspektiven. Daher rührt die Bezeichnung „Multi-View“. Roboter, Kameras, Aufgabe und Szene werden dabei in einem einheitlichen Beobachtungsraum codiert. 

Die zweite Stufe ist ein „maskiertes inverses Dynamikmodell“ mit 92 Millionen Parametern. Es lernt ohne gesonderte Beschriftung, welche Bildbereiche für die Bewegung des Roboters relevant sind, und übersetzt die vorhergesagten Bilder in Gelenkbefehle. Ein verwandter Aufsatz desselben Teams beschreibt mit AnyPos, wie sich dafür aufgabenunabhängige Bewegungsdaten automatisch erzeugen lassen. 

Was die Versuche zeigen

Getestet wurde auf einer ALOHA-Plattform mit zwei Armen, 14 Freiheitsgraden und drei Kameras, die im Vortraining nicht vorkam. Als Anpassungsdaten dienten 232 menschliche Vorführungen zu 81 Aufgaben, im Schnitt drei je Aufgabe und zusammen etwa 20 Minuten. Bei bekannten Aufgaben und Hintergründen erreichte Vidar eine Erfolgsquote von 68,2 Prozent. Die videobasierten Vergleichsverfahren UniPi und VPP kamen auf 36,4 und 4,5 Prozent. Bei unbekannten Aufgaben lag Vidar bei 66,7 Prozent, bei unbekannten Hintergründen bei 55,6 Prozent. 

Die Zahlen zur Dateneffizienz rechnen die Autoren selbst vor: RDT-1B habe 27 Stunden Vorführungen benötigt, das 81-Fache, π0.5 rund 400 Stunden, das 1.200-Fache. Aus diesen Rechnungen stammen die Werte der Pressemeldung. Ein direkter Leistungsvergleich mit RDT oder π0.5 auf denselben Aufgaben steht in den hier geprüften Tabellen nicht. Die aktuelle Fassung spricht von etwa einem Prozent der üblichen Datenmenge. 

Grenzen

Die Autoren nennen selbst mehrere Schwächen. Das Video enthält nicht alle Informationen, die für die Bewegungsvorhersage nötig sind. Die Gelenke der Arme liegen oft außerhalb des Bildes, auch bei drei Kameras. Zudem ist das Verfahren langsam: 60 Videobilder zu erzeugen dauert nach der jüngsten Fassung etwa 25 Sekunden auf acht Nvidia-Grafikprozessoren der Ampere-Generation mit je 80 Gigabyte Speicher. 

Was seither geschah

Am 19. Dezember 2025 stellte das Team mit Vidarc einen Nachfolger als Preprint vor. Er ist auf Regelung im geschlossenen Kreis ausgelegt, wurde mit rund einer Million Aufzeichnungen verschiedener Roboter trainiert und soll gegenüber Vergleichsverfahren mindestens 15 Prozent höhere Erfolgsquoten und 91 Prozent weniger Verzögerung erreichen. Code für Vidar und Vidarc hat die Arbeitsgruppe im GitHub-Repository thu-ml/vidar veröffentlicht. 

Am 29. April 2026 kündigte ShengShu in Singapur „Motubrain“ an, ein sogenanntes World Action Model für Roboter, das auf Vidu aufbaut. Nach Unternehmensangaben erreichte es im Benchmark RoboTwin 2.0 durchschnittlich 96,0 Punkte über 50 Aufgaben. Als Partner nennt ShengShu die Robotikfirmen Astribot, SimpleAI und Anyverse Dynamics. Vidar wird in dieser Mitteilung nicht erwähnt. Zum Unternehmen heißt es dort, es werde durch eine Series-B-Finanzierung über 293 Millionen US-Dollar unter Führung von Alibaba Cloud gestützt. 

Roboterwelt Redaktion

Mehr zu Künstliche Intelligenz

Alle 29 Beiträge
Schwarz-goldener VW-Kleinbus von hinten auf einem Messestand, Aufschrift „Self-Driving-Vehicle“ und Typschild „ID. Buzz AD“, auf der Seite das Logo von MOIA, auf dem Dach Sensoraufbauten, links stehen MessebesucherAnalyseRobotaxis in Deutschland: Was das Gesetz erlaubt und wer wo fährtSeit 2021 erlaubt das deutsche Recht Autos ohne Fahrer, seit 2022 regelt eine Verordnung die Einzelheiten. In den beiden Projekten, die heute Fahrgäste befördern, sitzt im Oktober 2026 trotzdem noch ein Sicherheitsfahrer am Steuer. Ein Überblick über die Rechtslage, die Projekte in Hamburg, Rhein-Main und München und die Pläne von Uber, Waymo und Baidu.07.10.2026Drei Soldaten in Tarnuniform in einer langen, hell beleuchteten Halle: Links steht einer mit verschränkten Armen und weißer Videobrille, in der Mitte sitzt einer mit Videobrille an einem Klapptisch und hält eine Fernsteuerung, rechts steht ein dritter ohne Brille; auf dem Tisch liegen weitere Brillen und SteuergeräteRatgeberGlossar Militärrobotik: 35 Begriffe von Abfangdrohne bis USVWas ist der Unterschied zwischen UAV und UAS, was meint Human-in-the-loop, und warum ist eine Glasfaserdrohne nicht zu stören? 35 Begriffe der Militärrobotik, kurz erklärt und mit Definitionen von US-Verteidigungsministerium, NATO, Rotem Kreuz, Vereinten Nationen und Bundeswehr belegt.07.10.2026Schwarzer sechsrädriger Rover aus Lochblech-Aluminium mit grobstolligen Reifen klettert in einem Park über einen Steinhaufen, auf einem Mast sitzt ein LED-Display mit lachendem Gesicht und roter MützeRatgeberRaspberry Pi als Roboterhirn: Modelle, Motoren, Kamera und ROS 2Ein Raspberry Pi ist kein Mikrocontroller, sondern ein vollständiger Linux-Rechner. Das macht ihn stark bei Kamera, KI und ROS 2 und schwach beim exakten Timing. Welches Modell passt, wie Motoren richtig angeschlossen werden und worauf es bei der Stromversorgung ankommt.06.10.2026Simulierter weißer Roboterarm über einer hellgelben Fläche, vor ihm sechs rote Zylinder als Hindernisse und rechts eine grüne Linie als ZielbereichForschungHardFlow: MIT-Verfahren lässt Roboter-KI harte Vorgaben einhaltenEin Roboterarm, der eine Route „fast“ kollisionsfrei plant, ist in einer Fabrikhalle voller Menschen wertlos. Generative KI-Modelle liefern aber genau das: Ergebnisse, die den Vorgaben nahekommen. Ein neuer Algorithmus vom MIT sorgt dafür, dass vortrainierte Modelle strikte Regeln zuverlässig einhalten – ohne dass sie neu trainiert werden müssen.14.09.2026