Zum Inhalt springen
Kontakt

SO-101 Roboterarm (LeRobot)

Zwei selbst aufgebaute Arme, eine Bewegung: Entdecke, wie der SO-101 mit LeRobot aus vorgemachten Griffen lernen kann.

Projektporträt · Fortgeschritten

Selbst ausprobieren

Aus einem Winkel wird Bewegung.

Bewege ein Gelenk und beobachte die Position des Greifers.

Winkel → Gelenk → Greiferposition

Was du beobachten kannst

Wenn ein Gelenk dreht, verändert sich die Position des Greifers. Mehrere Gelenke wirken beim echten Arm zusammen.

Vereinfachtes Gelenkmodell mit einer Achse. Der echte SO-101 hat mehrere Gelenke; hier wird kein Roboter angesteuert.

Ein Griff, den du vormachst

Ein kleiner Gegenstand liegt auf dem Tisch. Du führst einen Roboterarm zum Objekt, schliesst den Greifer und legst es in eine Schale. Der zweite Arm folgt deiner Bewegung. So beginnt beim SO-101 der Weg vom selbst gebauten Mechanismus zum lernenden Roboter.

Der SO-101 stammt von The Robot Studio in Zusammenarbeit mit Hugging Face. Die gedruckten Bauteile halten Motoren, Gelenke und Greifer zusammen; LeRobot verbindet die Hardware mit Werkzeugen für Datensammlung und maschinelles Lernen. Unser LunoLabs-Aufbau besteht aus zwei selbst aufgebauten Armen. Die Fotos aus dem Originalprojekt zeigen zusätzlich, wie sich Führungs- und Folgearm unterscheiden. Originalprojekt und Bauteile

So wird aus einer Bewegung ein Lernbeispiel

  1. Vormachen: Du bewegst den Führungsarm von Hand. Der Folgearm übernimmt die entsprechenden Gelenkstellungen. Vorher werden beide Arme aufgebaut und kalibriert. Aufbau und Kalibrierung
  2. Aufnehmen: Kamerabilder, Gelenkzustände und ausgeführte Aktionen bilden gemeinsam ein Lernbeispiel. Wiederhole eine überschaubare Aufgabe und kontrolliere, ob die Kamera Objekt und Greifer gut erfasst.
  3. Trainieren: Eine Steuerungsstrategie, die sogenannte Policy, lernt aus den aufgezeichneten Beispielen. LeRobot bietet dafür unter anderem ACT. Das Modell lernt Zusammenhänge zwischen Beobachtung und Bewegung.
  4. Ausprobieren: Die trainierte Policy erzeugt Aktionen für den Folgearm. Prüfe zunächst dieselbe Aufgabe und verändere anschliessend einzelne Bedingungen. Ein erfolgreicher Versuch sagt noch wenig über andere Objekte oder Kamerawinkel aus. Der LeRobot-Lernablauf

Wo kommen visuelle Modelle ins Spiel?

Ein visuelles Sprachmodell kann Bildinhalte mit Sprache verbinden. Für Roboteraktionen geht beispielsweise SmolVLA weiter: Kamerabilder, Roboterzustand und ein sprachlicher Auftrag werden gemeinsam genutzt, um Bewegungsfolgen zu erzeugen. Diese Verbindung heisst Vision-Language-Action, kurz VLA. Sie benötigt passende Daten und eine Prüfung am eigenen Aufbau. SmolVLA erklärt

Dein erster kleiner Versuch

Vergleiche auf den Bildern zuerst den Griff am Führungsarm mit dem Greifer am Folgearm. Nach Aufbau und Kalibrierung kannst du einen leichten Gegenstand per Handsteuerung in eine Schale legen. Kontrolliere dabei den Kamerablick: Bleibt der Gegenstand während des gesamten Griffs sichtbar? Das ist eine konkrete Frage für deinen nächsten Besuch beim Tech-Treff.

Von anderen Makern lernen

Schau dir an, wie es geht.

Hugging FaceTrain AI Robots Without Writing Code! (Introducing LeLab)

YouTube · Hugging Face · Englisch

Train AI Robots Without Writing Code! (Introducing LeLab)

Achte ab 1:21 auf den Wechsel vom Vormachen zur Datensammlung. Was wird gespeichert, bevor das Training beginnt?

Auf YouTube ansehen ↗

Beim Laden wird eine Verbindung zu YouTube aufgebaut.

Дмитрий СергеевSO-101 Robot Arm — Autonomous Pick-and-Place (ACT Imitation Learning)

YouTube · Дмитрий Сергеев · Visuelle Demo; keine Sprachkenntnisse erforderlich, Audiosprache nicht verifiziert

SO-101 Robot Arm — Autonomous Pick-and-Place (ACT Imitation Learning)

Verfolge Greifer und Objekt: Welche Zwischenbewegungen liegen zwischen Greifen und Ablegen?

Auf YouTube ansehen ↗

Beim Laden wird eine Verbindung zu YouTube aufgebaut.

Originalprojekt & Quellen

Die Technik dahinter.

  • VLM

    Bilder verstehen

    Was passiert zwischen Foto und Antwort? Verfolge Pixel, Bildmerkmale und Sprache durch ein VLM – und finde heraus, was es dabei wirklich lernt.

    Bild + Frage → Textantwort
    15 Min. Einstieg

Zum Projekt weiterlesen.

Was möchtest du als Nächstes versuchen?

Entdecke weitere Projekte oder bring deine Frage zum Tech-Treff mit.