Was ShengShu im August 2025 angekündigt hat
Am 8. August 2025 berichtete The Robot Report über Vidar, ein Modell, mit dem ShengShu Technology Roboter mit wenig echten Trainingsdaten anlernen will. Der Name steht für „Video Diffusion for Action Reasoning“. Nach Angaben des Unternehmens kann Vidar aus nur 20 Minuten Trainingsdaten verallgemeinerte Roboterhandlungen ableiten. Das entspreche zwischen einem Achtzigstel und einem Zwölfhundertstel der Datenmenge, die etablierte Modelle wie RDT und π0.5 benötigen. Als Einsatzfelder nennt ShengShu Haushaltsroboter, Altenpflege, Fertigung und Medizinrobotik. Diese Angaben stammen vom Hersteller.
ShengShu wurde im März 2023 in Peking gegründet und ist vor allem für die Videogenerierungsplattform Vidu bekannt. Auf ihr baut Vidar auf.
Wie das System arbeitet
Die technischen Details stehen in einem Fachaufsatz, der seit dem 17. Juli 2025 auf dem Preprint-Server arXiv liegt und bisher nicht begutachtet ist. Die acht Autoren um Yao Feng und Hengkai Tan gehören zur Tsinghua-Universität und zum Tsinghua-Bosch Joint ML Center. In der jüngsten Fassung ist zusätzlich ShengShu als Institution genannt. Letzter Autor ist Jun Zhu, den eine ShengShu-Pressemitteilung vom April 2026 als Gründer des Unternehmens nennt.
Vidar arbeitet in zwei Stufen. Zuerst erzeugt ein Videomodell, wie die Aufgabe aussehen soll, etwa „Lege den grünen Apfel in den Korb“. Grundlage ist Vidu 2.0, das die Forscher mit rund 750.000 Aufzeichnungen von drei zweiarmigen Roboterplattformen weitertrainiert haben. Fast alle davon, 726.843, stammen aus dem Datensatz Agibot-World. Die übrigen kommen aus den Sammlungen RDT und RoboMind. Jede Aufzeichnung zeigt die Szene aus mehreren Kameraperspektiven. Daher rührt die Bezeichnung „Multi-View“. Roboter, Kameras, Aufgabe und Szene werden dabei in einem einheitlichen Beobachtungsraum codiert.
Die zweite Stufe ist ein „maskiertes inverses Dynamikmodell“ mit 92 Millionen Parametern. Es lernt ohne gesonderte Beschriftung, welche Bildbereiche für die Bewegung des Roboters relevant sind, und übersetzt die vorhergesagten Bilder in Gelenkbefehle. Ein verwandter Aufsatz desselben Teams beschreibt mit AnyPos, wie sich dafür aufgabenunabhängige Bewegungsdaten automatisch erzeugen lassen.
Was die Versuche zeigen
Getestet wurde auf einer ALOHA-Plattform mit zwei Armen, 14 Freiheitsgraden und drei Kameras, die im Vortraining nicht vorkam. Als Anpassungsdaten dienten 232 menschliche Vorführungen zu 81 Aufgaben, im Schnitt drei je Aufgabe und zusammen etwa 20 Minuten. Bei bekannten Aufgaben und Hintergründen erreichte Vidar eine Erfolgsquote von 68,2 Prozent. Die videobasierten Vergleichsverfahren UniPi und VPP kamen auf 36,4 und 4,5 Prozent. Bei unbekannten Aufgaben lag Vidar bei 66,7 Prozent, bei unbekannten Hintergründen bei 55,6 Prozent.
Die Zahlen zur Dateneffizienz rechnen die Autoren selbst vor: RDT-1B habe 27 Stunden Vorführungen benötigt, das 81-Fache, π0.5 rund 400 Stunden, das 1.200-Fache. Aus diesen Rechnungen stammen die Werte der Pressemeldung. Ein direkter Leistungsvergleich mit RDT oder π0.5 auf denselben Aufgaben steht in den hier geprüften Tabellen nicht. Die aktuelle Fassung spricht von etwa einem Prozent der üblichen Datenmenge.
Grenzen
Die Autoren nennen selbst mehrere Schwächen. Das Video enthält nicht alle Informationen, die für die Bewegungsvorhersage nötig sind. Die Gelenke der Arme liegen oft außerhalb des Bildes, auch bei drei Kameras. Zudem ist das Verfahren langsam: 60 Videobilder zu erzeugen dauert nach der jüngsten Fassung etwa 25 Sekunden auf acht Nvidia-Grafikprozessoren der Ampere-Generation mit je 80 Gigabyte Speicher.
Was seither geschah
Am 19. Dezember 2025 stellte das Team mit Vidarc einen Nachfolger als Preprint vor. Er ist auf Regelung im geschlossenen Kreis ausgelegt, wurde mit rund einer Million Aufzeichnungen verschiedener Roboter trainiert und soll gegenüber Vergleichsverfahren mindestens 15 Prozent höhere Erfolgsquoten und 91 Prozent weniger Verzögerung erreichen. Code für Vidar und Vidarc hat die Arbeitsgruppe im GitHub-Repository thu-ml/vidar veröffentlicht.
Am 29. April 2026 kündigte ShengShu in Singapur „Motubrain“ an, ein sogenanntes World Action Model für Roboter, das auf Vidu aufbaut. Nach Unternehmensangaben erreichte es im Benchmark RoboTwin 2.0 durchschnittlich 96,0 Punkte über 50 Aufgaben. Als Partner nennt ShengShu die Robotikfirmen Astribot, SimpleAI und Anyverse Dynamics. Vidar wird in dieser Mitteilung nicht erwähnt. Zum Unternehmen heißt es dort, es werde durch eine Series-B-Finanzierung über 293 Millionen US-Dollar unter Führung von Alibaba Cloud gestützt.
Quellen
- Vidar: Embodied Video Diffusion Model for Generalist Manipulation (arXiv:2507.12898, v1–v4, Preprint) – Yao Feng u. a., Tsinghua-Universität – 17.07.2025 (v4: 20.12.2025)
- ShengShu Technology launches Vidar multi-view physical AI training model – The Robot Report – 08.08.2025
- AnyPos: Automated Task-Agnostic Actions for Bimanual Manipulation (arXiv:2507.12768, Preprint) – Hengkai Tan u. a. – 17.07.2025
- Vidarc: Embodied Video Diffusion Model for Closed-loop Control (arXiv:2512.17661, Preprint) – Yao Feng u. a. – 19.12.2025
- thu-ml/vidar (Code-Repository) – Tsinghua ML Group – abgerufen 03.10.2026
- ShengShu Technology Unveils World Action Model "Motubrain" – ShengShu Technology via PR Newswire – 29.04.2026
Aktualisiert : Auf Basis der Primärquellen neu gefasst Erstveröffentlichung: .

Mehr zu Künstliche Intelligenz




