Alle Depeschen

DepescheModelle

GEN-1.5 lernt Handgriffe aus einer 3 bis 12 Sekunden langen Vorführung – 59 Prozent Erfolg ohne einen einzigen Trainingsschritt

Das Robotik-Start-up Generalist AI hat am 19. August 2026 GEN-1.5 vorgestellt, ein Roboter-Basismodell, das eine neue Aufgabe aus einer einzigen Vorführung übernimmt: Die 3 bis 12 Sekunden lange Aufzeichnung von Sensordaten und Bewegungsbahnen wandert als „physischer Prompt“ in ein 30-Sekunden-Kontextfenster, danach führt der Roboter die Aufgabe ohne jede Gewichtsanpassung aus. Über zehn Aufgaben meldet das Unternehmen 59 Prozent Erfolg (±10 Prozentpunkte) ohne Training und 83 Prozent (±9) nach zehn Gradientenschritten auf fünf Minuten Daten je Aufgabe. Alle Zahlen sind anbieter-selbstberichtet.

Aussagen gegen die Quellen geprüft · 21. August 2026

Generalist AI beschreibt GEN-1.5 als multimodales Basismodell für Roboter. Ein „physical prompt“ sind nach der Definition des Unternehmens „sensorimotor examples (i.e. sensor data plus action trajectories)“ – aufgezeichnet unter anderem als menschliche Vorführung, 3 bis 12 Sekunden lang. Sie werden in ein Kontextfenster von 30 Sekunden gelegt; die Aufgabe wird anschließend ohne Gewichtsanpassung ausgeführt.

Die gemeldeten Werte über zehn verschiedene kurzhorizontige Manipulationsaufgaben: 59 Prozent mittlere Erfolgsquote (Standardabweichung 10 Prozentpunkte) ohne jeden Gradientenschritt; 66,5 Prozent nach einem Gradientenschritt auf einer Minute Daten; 83 Prozent (Standardabweichung 9 Prozentpunkte) nach zehn Gradientenschritten auf fünf Minuten Daten je Aufgabe, was rund 50 Vorführungen entspricht.

Zum Vortraining schreibt das Unternehmen, es habe über acht Monate durchgehend auf zufällig gezogenen zusammenhängenden Abschnitten aus der eigenen Datenerfassung in Wohnungen, Lagerhallen und Fabriken trainiert. Bemerkenswert ist die ausdrückliche Abgrenzung: „GEN-1.5 pretraining contains no simulation data, neither rendered video nor simulated dynamics“ – Simulation kommt nach dieser Darstellung nicht im Vortraining vor, wohl aber, so die Rezeption von The Decoder, als Quelle einzelner Vorführungen im Prompt. Das ist kein Widerspruch, sondern eine Trennung zwischen Trainingskorpus und Prompt-Material, die man beim Lesen mitführen sollte.

⚠️ Einordnung: Sämtliche Zahlen stammen aus der Ankündigung des Anbieters und sind unabhängig nicht reproduziert. The Decoder hält fest, die gezeigten Aufgaben seien „einfach und kurz“ und die Ergebnisse stammten allein vom Unternehmen. Zur eingesetzten Roboter-Hardware macht die Ankündigung keine Angabe; Preise, Verfügbarkeit oder offene Gewichte werden nicht genannt.