Die KI schlägt vor. Ein Mensch entscheidet.
Ein Cobot, der nur die Artikel greifen kann, für die einmal jemand ein Programm geschrieben hat, ist Automatisierung von 1995. In Cira OS lernst du einen Artikel an, indem du ihn fotografierst — und alles, was die KI daraus ableitet, ist sichtbar, begründet und von dir überschreibbar. Deine Korrektur gewinnt: im Training, in der Griffkarte und in jeder erneuten Annotation.
- 6
- Stufen von der ersten Aufnahme zum trainierten Modell
- 9
- Pipeline-Stufen, die der Inspektor einzeln offenlegt
- 30 mm
- ebene Fläche, die ein Sauggriff mindestens braucht
Sechs Stufen — und bei jeder bleibst du am Steuer
Die Reihenfolge ist kein Diagramm, sondern die Ursache dafür, dass das Ergebnis stabil ist. Vor allem Stufe 2 — sie entscheidet, ob der Rest überhaupt funktioniert.
-
01
Fotos sammeln
Das Capture Studio führt dich am Roboter durch die Aufnahme — eine Anweisung zur Zeit. Alternativ Bilder hochladen, die Galerie des verknüpften Commerce-Produkts importieren, oder eine Zellkamera das Objekt fotografieren lassen.
-
02
Der gemeinsame Durchgang
Bevor irgendein einzelnes Foto beschrieben wird, werden alle Fotos miteinander auf eine Greifeinheit abgestimmt. Genau das verhindert, dass Foto A den auf der Verpackung abgedruckten Artikel beschreibt und Foto B die Verpackung.
-
03
KI-Annotation
Ein starkes Vision-Modell beschreibt jedes Foto: von welcher Seite gesehen, nackt oder verpackt, wo der Sauggreifer ansetzen kann, welche Hindernisse ringsum stehen. Es beschreibt den Körper, auf den sich der gemeinsame Durchgang geeinigt hat — es darf nicht neu entscheiden, was das Objekt ist.
-
04
Griff-Verifikation
Jeder vorgeschlagene Griff geht durch einen zweiten, gegnerisch angelegten KI-Durchgang, dessen einzige Aufgabe es ist, ihn zu widerlegen: ein Punkt auf dem Schattenwurf, auf dem Hintergrund oder auf einer gewölbten Fläche fliegt raus, der nächste Kandidat kommt dran. Widerlegte Griffe stehen mit Begründung auf der Aufnahme.
-
05
Menschliche Prüfung
Du prüfst, korrigierst oder verwirfst — direkt auf dem Foto. Bist du mit einer Aussage nicht einverstanden, zeigt der Pipeline-Inspektor, welche Stufe sie produziert hat.
-
06
Training
Der geprüfte Datensatz geht an eine Zelle, die ihn zu einem Erkennungsprofil für genau dieses Objekt destilliert — zusammen mit der Griffkarte (dem festen Griffrezept je Ruhelage) und einer Augmentierungs-Policy, die den Trainingsdatensatz gegen Lagerbedingungen härtet, die deine Fotos nie hatten.
Capture Studio — fotografieren am Roboter, nicht am Schreibtisch
Einen Ordner hochzuladen ist der schnellste Weg zu einem Datensatz mit sechs Bildern derselben Vorderseite. Das Studio macht daraus eine geführte Sitzung.
- 01
-
Eine Anweisung zur Zeit
„Dreh das Objekt eine Vierteldrehung nach links, damit die rechte Seite zu dir zeigt." Dazu ein Zähler, wie viele der gewünschten Aufnahmen du schon hast, und warum die Anweisung wichtig ist.
- 02
-
Aufs Handy per QR
Der QR-Code neben „Fotos aufnehmen" öffnet die Sitzung für genau diesen Artikel auf dem Gerät, das du am Roboter in der Hand hältst. Der Sucher nimmt den Bildschirm ein, der Auslöser liegt, wo ein Daumen hinkommt.
- 03
-
Zwei Kameraquellen
Die Kamera des Geräts (schnellster Weg für Objekte, die du in die Hand nehmen kannst) oder die Orbbec-Gemini am Arm — dann trainierst du auf genau der Optik, dem Abstand und dem Licht, mit denen der Griff später läuft. Mitten in der Sitzung umschaltbar.
- 04
-
Vorgelesen, weil die Hände am Objekt sind
Die Anweisung wird laut vorgelesen, wenn sie sich ändert (abschaltbar). Der Filmstreifen unten hält die Aufnahmen der Sitzung — unscharfe verwirfst du sofort statt sie später in der Prüfung zu finden.
- 05
-
Eine Aufnahme zählt, sobald du sie machst
Die Sitzung wartet nicht auf die Pipeline, bevor sie weitergeht — zu einem gerade fotografierten Winkel zurückgeschickt zu werden ist der schnellste Weg, das Vertrauen in die Führung zu verlieren. Weicht später ab, was die Pipeline findet, ist genau das ein Prüfsignal.
- 06
-
Am Ende ein Durchgang
„Fertig" lässt die Pipeline einmal über den ganzen Satz laufen — erst der gemeinsame Durchgang, dann die Annotation pro Foto. Bewusst nicht pro Aufnahme: ein Lauf je Foto würde seinen eigenen gemeinsamen Durchgang immer wieder ungültig machen.
Das Wichtigste an der ganzen Pipeline
Ein einzelnes Foto kann die Frage „welches der Dinge im Bild ist das, was wir greifen" nicht beantworten. Das Produktfoto auf der Verpackung sieht aus wie das Produkt. Beurteilt man jedes Bild einzeln, schwanken die Antworten — und die Zelle wird auf zwei verschiedene Dinge unter einem Namen trainiert. Das ist die klassische Ursache für einen Griff, der „manchmal funktioniert".
- 01
-
Wiederkehr
Ein echtes physisches Objekt ist aus jeder Perspektive sichtbar. Aufgedruckte Grafik existiert nur auf einer Fläche, ihr Cluster erscheint also in einer Minderheit der Fotos — und verliert.
- 02
-
Enthaltensein
Liegt eine Region auf den Fotos, die sie teilen, konsistent innerhalb einer anderen, ist sie eine Region dieses Körpers (Aufdruck, Etikett, Teilstück) und nie eine eigene Greifeinheit. Der äußerste konsistente Körper gewinnt.
- 03
-
Identitätsanker
Sobald freigegebene Fotos und visuelle Fingerprints existieren, stechen sie beide Regeln aus: Das Cluster, das zu deinem bestätigten Produkt passt, ist die Greifeinheit — auch wenn etwas Größeres häufiger wiederkehrt (das Objekt liegt vielleicht auf jedem Bild auf derselben Palette).
- 04
-
Sichtbar, was ausgeschlossen wurde
Die Karte „Gemeinsamer Durchgang" zeigt, wie viele Fotos abgeglichen wurden, warum der Sieger gewann und — wichtiger — was auf welcher Regel ausgeschieden ist. Auf jedem Foto stehen die ausgeschlossenen Regionen als dünne gestrichelte Kästen.
- 05
-
Danach darf nicht neu entschieden werden
Die Annotation pro Foto beschreibt ab dann nur noch das Segment, auf das sich der ganze Satz geeinigt hat: Lage, Verpackung, Handhabung, Hindernisse, Notizen. Die visuelle Signatur des Siegers wird sofort zum Bootstrap-Fingerprint — identitätsgetriebene Erkennung wartet nicht auf die erste menschliche Freigabe.
Je mehr die Pipeline weiß, desto weniger muss sie raten
Geschätzte Geometrie ist der Grund, warum ein Griff drei Millimeter neben der Dichtfläche landet. Vier Wege, aus Schätzung Messung zu machen.
- 01
-
Formklasse als stärkster Prior
Karton, Zylinder, Blister, Weichgut im Beutel oder Freiform — die Klasse sagt der KI, wo ein Sauggriff überhaupt physisch existieren kann. Ein Zylinder von der Seite hat keinen ausführbaren Griff, ein Blister nur auf der ebenen Kartonrückseite, taute Folie über dem Produktkörper ist greifbar, lose Folienränder und Luftpolster dichten nie.
- 02
-
Der 120-mm-Marker als Lineal
Leg den gedruckten Kalibrier-Marker flach neben das Objekt. Dann hat die Annotation in jedem Bild einen metrischen Maßstab: Objektmaße und Dichtflächen werden gegen den Marker gemessen statt geschätzt, und Perspektiv-/Skalenverwechslungen werden viel unwahrscheinlicher.
- 03
-
3D-Scan vom iPhone
Ein LiDAR-Scan (Polycam, Scaniverse, Reality Composer) als .glb in Metern hochgeladen: die gemessenen Maße ersetzen die getippten, und die ebenen Saugflächen ab 30 mm werden geometrisch auf der echten Oberfläche berechnet. Beim Training reist das Netz mit zur Zelle, also laufen Griff- und Kollisionsplanung auf gemessener Geometrie.
- 04
-
Gemessene Geometrie statt geschätzter
Ist der Vision-Geometrie-Dienst eingerichtet, umreißt ein Segmentierungsmodell das Objekt pixelgenau, die größte ebene Fläche darin wird der Saugpunkt, und der Marker oder die bekannten Maße liefern den echten Millimeter-Maßstab. Solche Aufnahmen tragen ein „Gemessen"-Abzeichen; das KI-Modell beurteilt dann nur noch die Semantik.
- 05
-
Visuelle Fingerprints — die Identität des Produkts
Aus deinen freigegebenen Fotos werden kompakte Einbettungen gebaut. Danach gewinnt bei einer neuen Aufnahme nicht der größte oder mittigste Umriss, sondern der, der deinem Produkt am meisten gleicht. Passt selbst der beste Umriss nicht, bekommt die Aufnahme ein „Identität?"-Warnabzeichen, die gemessene Geometrie wird nicht angewandt, und das Foto geht zu dir.
- 06
-
Verpackung ist nicht Abbildung
Die Annotation klassifiziert jedes Foto explizit: nacktes Objekt, in Verpackung (dann ist das Paket die Greifeinheit und der Kasten umreißt das ganze Paket, nie die Grafik) oder nur eine aufgedruckte Abbildung — letztere trägt per harter Regel keine Erkennung und keinen Griff, egal was das Modell sonst behauptet hat.
Human-in-the-loop heißt hier: jedes Feld ist korrigierbar
Nicht „Daumen hoch oder runter". Du arbeitest direkt auf dem Bild, und deine Labels liegen über dem Original der KI, das auditierbar bleibt.
- 01
-
Auf dem Foto zeichnen
Bester Griff anklicken, bis zu zwei Ausweichgriffe setzen, den Objektkasten (ohne Schatten) neu ziehen, Marker löschen — oder mit einem Klick sagen: „diese Ansicht hat keinen ausführbaren Griff". Dieses ehrliche Label ist für das Training wertvoller als ein geratener Punkt.
- 02
-
Auch die Semantik
Ansichtsseite, Sichtbarkeit, Darstellung (nackt/verpackt/nur Abbildung), Lage (Rotation und Neigung), Hindernisse und Trainingsnotizen liegen im selben Dialog. Eine „nur Abbildung"-Korrektur löscht Erkennung und Griffe automatisch.
- 03
-
Vier Urteile pro Aufnahme
Freigeben (wird Referenzfoto und Teil des Golden Sets), Ablehnen (nie im Training, wird von der Annotation übersprungen), Korrigieren, Löschen. Freigeben ist optionale Qualitätssicherung — offene Aufnahmen trainieren mit.
- 04
-
Handhabungs-Eigenschaften bestätigen
Enthält Flüssigkeit (Zyklus langsam und waagerecht), zerbrechlich (reduzierte Beschleunigungen), porös/luftig (Sauger dichtet womöglich nicht), spiegelnd/transparent (Tiefenmessung unzuverlässig), verformbar — je mit Konfidenz, über alle Fotos aggregiert. Deine Bestätigung ist die Wahrheit, mit der die Zelle fährt, und sticht die KI aus.
- 05
-
Korrekturen bleiben Korrekturen
Wird das Annotationsmodell besser, aktualisiert „Alles neu annotieren" den ganzen Datensatz — deine manuellen Korrekturen bleiben erhalten und überstimmen die KI weiter.
Drei Prüfungen, bevor der Arm etwas anfasst
Ein Datensatz, der auf seinen eigenen Fotos gut aussieht, ist kein Beweis. Deshalb gibt es je eine Prüfung für die Vollständigkeit, für die Pipeline und für die echte Zelle.
- 01
-
Perspektiv-Abdeckung
Ein Chip je Ruhefläche (oben, unten, vorn, hinten, links, rechts, plus der Schrägring): grün = fotografiert und liefert einen Griff, bernstein = fotografiert, aber kein Griff gefunden, gestrichelt = nie fotografiert. Dazu die aus deinen Fotos gemessenen Hauptmaße gegen die eingetragene Größe — und Ansichten, deren Maße nicht zum selben Körper gehören können, mit Aufnahme-Nummer.
- 02
-
Geführte nächste Aufnahme
Unter den Chips steht in Klartext und Priorität, welches Foto als nächstes fehlt und warum. Dieselbe Liste treibt das Capture Studio, den Assistenten („welche Fotos braucht Artikel X noch?") und einen Endpunkt, den eine Zelle oder ein Handy zwischen Aufnahmen abfragen kann.
- 03
-
Der Pipeline-Inspektor
„Die Erkennung ist falsch" ist nicht ein Fehler, sondern mehrere mit verschiedenen Lösungen. Der Inspektor zeigt die Stufen in Ausführungsreihenfolge — gemeinsamer Durchgang, Segmentierung, Identitätsprüfung, Vision-Modell, Messfusion, Griffmessung, gegnerische Griffprüfung, geometrischer Default, ansichtsübergreifende Geometrieprüfung — inklusive der übersprungenen mit Grund. Auf dem Foto lassen sich die Ebenen einzeln einschalten.
- 04
-
Trainingsvarianten sichtbar machen
Die Zelle trainiert nicht auf deinen Fotos allein: eine aus deinem Datensatz abgeleitete Augmentierungs-Policy erzeugt jede Epoche Varianten — Zoom, Rotation, Über- und Unterbelichtung, warmes und kaltes Licht, Bewegungsunschärfe, Sensorrauschen, JPEG-Artefakte, Blendenflecke, Teilverdeckung. Ein spiegelndes Produkt bekommt mehr Glanz, ein dünner Satz mehr Varianten, ein verformbarer Artikel elastische Verzerrung. „Rendern" zeigt die Bilder, die der Trainer wirklich produziert.
- 05
-
Virtueller Trockenlauf
Die aktuelle Pipeline wird gegen deine freigegebenen Aufnahmen — das Golden Set — nachgespielt und bewertet, ohne eine gespeicherte Annotation anzufassen: Objekt gefunden? Lage erkannt? Kastenüberdeckung (IoU)? Griff im Ziel (innerhalb 15 % der Objektdiagonale)? Es gibt ein Urteil, die Veränderung gegen den letzten Lauf und die schlechtesten Aufnahmen. Kein Roboter bewegt sich dabei.
- 06
-
Testgriff auf der echten Zelle
Der Trockenlauf bewertet die Pipeline. Ob die echte Zelle das Produkt auf einem echten Tisch mit fünf anderen Dingen darauf findet, sagt nur ein Testgriff. Du legst das Szenario aus und erklärst, was du ausgelegt hast — die Bewertung läuft dagegen, denn ohne dieses Wissen ist „ein Objekt gefunden" nicht von „das richtige Objekt gefunden" zu unterscheiden.
Was Cira beim Anlernen übernimmt
Der KI-Assistent bedient exakt dieselben Oberflächen — mit denselben Regeln und derselben Nachvollziehbarkeit.
- „Welche Fotos braucht Artikel X noch?" — die Anweisungen des Coaches, in Priorität
- „Warum ist der Kasten auf Aufnahme 42 falsch?" — liest die Stufenspur des Inspektors
- „Verschieb den Griff von Aufnahme 42 in die Mitte des Deckels" / „Aufnahme 17 hat keinen ausführbaren Griff"
- „Aufnahme 12 zeigt nur die aufgedruckte Grafik, nicht das Objekt" — löscht Erkennung und Griffe
- „Markiere Artikel X als flüssigkeitshaltig" · „Baue die Fingerprints für Artikel X neu"
- „Lass Artikel X trockenlaufen und sag mir, was ich reparieren soll"
- Die KI-Inferenz läuft in Frankfurt (eu-central-1) — deine Daten bleiben in der EU.
Wie viele Fotos braucht ein Artikel?
Trainieren lässt sich ab einer trainierbaren annotierten Aufnahme, aber ein robustes Modell braucht mehr: ein Dutzend scharfe Fotos oder mehr, jede Ruhelage abgedeckt, mindestens zwei Schrägaufnahmen, ein echter metrischer Maßstab und ein bestandener Trockenlauf. Die beiden Karten oben auf der Prüfseite — gemeinsamer Durchgang und Perspektiv-Abdeckung — sind die Checkliste dafür.
Was passiert, wenn die KI etwas falsch beschreibt?
Du korrigierst es direkt auf dem Bild, und deine Korrektur gewinnt — im Training, in der Griffkarte und in jeder erneuten Annotation. Das Original der KI bleibt auditierbar daneben stehen. Willst du wissen, welche Stufe den Fehler gemacht hat, zeigt der Pipeline-Inspektor die Stufenspur.
Brauchen wir den Vision-Geometrie-Dienst?
Nein — ohne ihn läuft die Annotation vollständig, nur schätzt sie Geometrie statt sie zu messen. Mit ihm werden Umriss und Saugpunkt pixelgenau gemessen, Fingerprints gebaut und der gemeinsame Durchgang ab zwei Fotos aktiv. Der stärkste Prior bleibt ein 3D-Scan des Objekts.
Was, wenn ein Artikel schon im Commerce-Modul liegt?
Dann verknüpfst du ihn: Die Produktgalerie lässt sich als Trainingsquelle importieren, und Gewicht sowie Maße erbt der greifbare Artikel aus dem Produkt. Robotik ist hier kein zweiter Artikelstamm.
Zelle ansehen, bevor du sie kaufst.
Cira OS ist in der Closed Beta. Frag Zugang an — wir onboarden dich, sobald dein Konto freigeschaltet ist.