SafeHarness: Coding-Agenten weichen Hindernissen aus

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Ein arXiv-Paper (2609.20822) stellt fest, dass Coding-Agenten für Roboter, bei denen ein Sprachmodell die Steuerung schreibt, in den meisten sicherheitsbeschränkten Aufgaben mit dem Hindernis kollidieren. Die Autoren ergänzen SafeHarness, zwei Harnesses zur Routenprüfung und Wahl der Kontaktseite. Mit GPT-6 erreicht es auf SafeLIBERO 71,9 % Erfolg und 87,5 % Kollisionsvermeidung.

Was das Paper berichtet

Ein neues arXiv-Paper (arXiv:2609.20822, Kategorie cs.RO, eingereicht am 17. September 2026) von Bingxin Xu (USC), Yuzhang Shang (UCF), Zhen Dong (UCSB) und Emilio Ferrara (USC) stellt eine Frage, die frühere Arbeiten nach Angaben der Autoren offen gelassen haben. Beim Ansatz der »Coding-Agenten« für Robotermanipulation schreibt ein Sprachmodell die Robotersteuerung als Programm. Solche Agenten bedienen inzwischen Roboter ohne robotikspezifisches Training. Aber ist dieser Ansatz auch sicher?

Um das zu prüfen, bewerten die Autoren einen Coding-Agenten unter einer Sicherheitsvorgabe. Jede Aufgabe verbindet ein Manipulationsziel mit einem Hindernis, das der Roboter nicht berühren darf. Der Agent verfolgt sein Ziel und stößt in den meisten Fällen gegen das Hindernis. Das Paper stellt dann SafeHarness vor, das zwei »hindernisbewusste Harnesses« um den Agenten legt. Mit GPT-6 als Basismodell erreicht SafeHarness auf dem Benchmark SafeLIBERO 71,9 % Aufgabenerfolg und 87,5 % Kollisionsvermeidung. Laut Paper übertrifft das den bisherigen Stand der Technik um 6,5 % und 27,0 %, und den gleichen Agenten ohne Harness um das 2,3-Fache und das 1,5-Fache.

Hintergrund: Warum Sicherheit nie gemessen wurde

Das Paper skizziert die Arbeiten, auf denen es aufbaut. Code as Policies setzte das Muster: Das Modell setzt Wahrnehmungs- und Steuer-APIs zu einem Programm zusammen, und das Programm ist die Policy. Spätere Agenten schreiben ihren Steuerungscode nach einem Fehlschlag um, führen eine Bibliothek bewährter Fähigkeiten und setzen zusätzliche Rechenzeit zur Laufzeit für mehr Zuverlässigkeit ein. Harness VLA lässt den Agenten eine Szene erkunden, Bewährtes als Fähigkeitsgedächtnis speichern und eine eingefrorene Vision-Language-Action-Policy (VLA) nur dort aufrufen, wo die Aufgabe kontaktreich wird.

Die Autoren argumentieren, dass diese Arbeiten einen Durchlauf danach bewerten, ob das Ziel erreicht wurde. Was der Roboter unterwegs berührt hat, wird nie gemessen. Sie zitieren außerdem frühere Studien, um zu belegen, dass Erfolg keine Sicherheit bedeutet: Über eine Modellgeneration hinweg können beide in entgegengesetzte Richtungen laufen, und ein Training mit zehnmal so vielen kollisionsfreien Demonstrationen senkt die Kollisionsrate nur um weniger als drei Punkte. In ihren Worten sind das Erledigen der Aufgabe und das Nichtberühren von allem anderen zwei Hälften einer einzigen Anforderung.

Die Diagnose: Die Vorgabe wird nie zur Priorität

Die Autoren bewerten zuerst einen Coding-Agenten auf einem Sicherheits-Benchmark für Roboter. Er erledigt Aufgaben, trifft aber in den meisten Fällen das Hindernis. Zwei naheliegende Erklärungen schließen sie aus. Die Wahrnehmung ist nicht schuld, denn der Agent erkennt das Hindernis richtig und erwähnt es in seiner Argumentation. Auch die Anweisung ist nicht schuld, denn der Prompt verbietet die Berührung bereits. Der Agent wiederholt die Vorgabe und verletzt sie dann.

Das Paper verortet den Fehler in der Planung und teilt jede Manipulationsphase in zwei Teile. Auf der Route durch den freien Raum kennt das Modell keinen Weg, der das Hindernis freihält, und nimmt deshalb den kürzesten. Es kennt auch keine Neuplanung, wenn die gewählte Route unterwegs unbrauchbar wird. Beim Kontakt, dem kontaktreichen Moment am Ende der Phase, erkennt das Modell nicht, dass schon der Kontakt selbst derselben Sicherheitsvorgabe unterliegt. Ein stärkerer Planer schließt die Lücke nicht, wie die Ablation in Abschnitt 4.3 zeigt.

Abschnitt 3.4 bietet eine Erklärung. Eine Episode ist ein einziges langes Gespräch mit Hunderten von Schritten. Jeder Werkzeugaufruf und jedes Bild vergrößert den Kontext auf Zehntausende Tokens, während der eine Satz, der das Hindernis nennt, nahe am Anfang bleibt. Die Autoren verweisen auf Forschung, nach der das Abrufen von Inhalten aus der Mitte, das Befolgen von Anweisungen und die Treue zum Systemprompt mit wachsendem Kontext nachlassen. In ihren Durchläufen erscheint die Vorgabe in den ersten Denkschritten und verschwindet dann.

Wie SafeHarness funktioniert

SafeHarness schneidet eine Aufgabe an ihren Kontaktereignissen in Phasen. Beide Harnesses laufen einmal pro Phase.

Die hindernisbewusste Routenplanung folgt einem Zyklus aus Planen, Prüfen und Ausführen. Ein Segmentierungsmodell (SAM-3) verankert Ziel und Hindernis als Begrenzungsboxen. Das Sprachmodell schlägt eine Route als Linienzug aus Wegpunkten vor, die am Ziel enden und die Hindernisbox nicht kreuzen darf. Eine Prüfung außerhalb des Sprachmodells testet die Route dann gegen die Box. Sie umfasst den Greifer und, wenn ein Objekt gehalten wird, auch das Objekt. Eine Route, die in die Box eindringt, wird abgelehnt, und das Modell plant neu. Neuplanung wird auch während der Ausführung ausgelöst: Bleibt der Arm stehen, etwa weil er klemmt, wird von der Haltestelle aus eine neue Route geplant. Das Harness begrenzt außerdem, wie oft das Routenplan-Bild während der Ausführung gelesen werden darf, weil wiederholte gleiche Bilder den Kontext nur verlängern.

Die hindernisbewusste Kontaktausführung beginnt mit einem Nachbarschaftstest zwischen Hindernis und Kontaktziel. Ohne benachbartes Hindernis ist jede Strategie erlaubt. Mit einem solchen Hindernis nähert sich der Greifer aus einer Richtung, die Abstand hält, und wählt die Richtung, die am weitesten vom Hindernis entfernt ist. Passt keine Richtung, dreht sich der Greifer so, dass seine Öffnungsachse tangential zum Hindernis liegt, und die Last wird senkrecht abgesenkt. Derselbe Test läuft beim Greifen und beim Ablegen.

Benchmark und Ergebnisse

SafeLIBERO nimmt aus den LIBERO-Suiten Spatial, Goal, Object und Long je vier Aufgaben und fügt jeder ein Hindernis hinzu: eine Mokkakanne, eine Aufbewahrungsbox, einen Milchkarton, eine Weinflasche, eine Tasse oder ein Buch. Der Aufgabentext erwähnt das Hindernis nie. Jede Aufgabe kommt in zwei Stufen vor. In Stufe I liegt das Hindernis nahe am Ziel und stört das Greifen oder Ablegen. In Stufe II liegt es abseits des Ziels, aber auf dem Transportweg. Das Paper nutzt 32 Aufgaben mit 10 Seeds pro Aufgabe. Es übernimmt die Coding-Agenten-Schleife von Harness VLA, eine eingefrorene π0.5-Policy und das ursprüngliche Fähigkeitsgedächtnis unverändert, sodass allein die beiden Harnesses den Unterschied machen. Gemessen werden die Aufgabenerfolgsrate (TSR) und die Kollisionsvermeidungsrate (CAR).

Durchschnitte aus Tabelle 1 in Prozent, erst TSR, dann CAR: OpenVLA-OFT 26,2 und 5,7; π0.5 57,8 und 17,1; AEGIS, eine Sicherheitsschicht mit Barrierefunktionen über π0.5 und die stärkste frühere Methode, 67,5 und 68,9; SafeHarness mit GPT-5.5 70,0 und 86,0; SafeHarness mit GPT-6 71,9 und 87,5. In der Suite Long erreicht AEGIS 46,3 TSR, gegenüber 54,3 bei der eingefrorenen Policy, die es umhüllt.

Die Ablation in Tabelle 2 vergleicht drei Agenten. Mit GPT-6 erreicht das Modell allein 6,0 TSR und 50,0 CAR. Die Autoren nennen diesen CAR-Wert bedeutungslos, denn ein Arm, der früh scheitert, berührt nichts. Mit Fähigkeiten und eingefrorenem VLA sind es 31,0 und 59,0. Mit den Harnesses sind es 71,9 und 87,5. Mit GPT-5.5 ergeben Fähigkeiten ohne Harness 28,0 und 31,0, SafeHarness 70,0 und 86,0. Der Schluss des Papers: Sicherheit ist hier eine Eigenschaft des Harness, nicht des Modells, das es umgibt.

Unsere Analyse

Drei Punkte fallen auf. Erstens ist die Kernidee eine alte Ingenieursgewohnheit an neuer Stelle: einer Regel, die einmal im Prompt stand, nicht zu trauen, sondern sie im entscheidenden Moment mit einem Werkzeug neu zu prüfen. Das Paper sagt, seine Prüfwerkzeuge seien gegenüber dem Gespräch zustandslos, und für eine Invariante, die über eine lange Episode gelten muss, sei eine Werkzeugschnittstelle ein verlässlicherer Träger als der Prompt.

Zweitens verdienen die Zahlen ein genaues Lesen. Die Zuwächse von 6,5 % und 27,0 % entsprechen relativen Unterschieden aus Tabelle 1 (71,9 gegen 67,5 und 87,5 gegen 68,9), nicht Abständen in Punkten. Die Abstände in Punkten betragen etwa 4,4 und 18,6. Beide Lesarten zeigen einen Gewinn, doch der Punktabstand beim Aufgabenerfolg ist klein. Der Vergleich des Papers mit demselben Agenten ohne Harness (40,9 und 28,5 Punkte) ist der stärkere Beleg.

Drittens zeigt die Ablation eine nützliche Trennung. Ein stärkerer Planer verbessert die lokale Entscheidung, von welcher Seite man sich nähert: Mit nur Fähigkeiten steigt die Vermeidung in Stufe I von 18,8 auf 69,0. Für die Routensicherheit in Stufe II bringt er wenig, dort beträgt der Gewinn sechs Punkte. Mit Harnesses schrumpft der Unterschied zwischen den Planern.

Grenzen und offene Fragen

Die Autoren nennen ihre Grenzen selbst. Die Auswertung folgt SafeLIBERO, mit einem Hindernis pro Szene und einer achsenparallelen Box als Hindernismodell. Der Kontaktseiten-Test ist auf einen Parallelbackengreifer abgestimmt. Die Qualität der Verankerung stammt vom Segmentierungsmodell, und ein Verankerungsfehler zeigt sich als abgelehnte Route statt als Kollision. Jede Episode kostet Minuten an Planungszeit. Die Auswertung findet zunächst in der Simulation statt.

SafeHarness ist auch nicht kollisionsfrei: Es verschiebt das Hindernis noch in etwa einer von acht Episoden. Der Aufgabenerfolg bleibt in Stufe II niedriger (64,0 gegen 76,0 mit GPT-5.5 und 62,5 gegen 81,2 mit GPT-6). Die Autoren halten für am plausibelsten, dass ein geprüfter Umweg eine Episode unter festem Schrittbudget verlängert. Das ist eine Vermutung, kein getestetes Ergebnis.

Unsere eigenen Grenzen als Leser: Wir haben nur den Text des Papers gesehen, nicht den Code, und einige Tabellenwerte konnten wir mit dem beschriebenen Protokoll nicht in Einklang bringen. Die Ergebnisse stammen aus einem einzigen Benchmark, und Tests an einem echten Roboter werden nicht berichtet.

Praktische Folgerungen

Teams, die LLM-Agenten für physische oder besonders kritische Systeme bauen, können drei Lehren mitnehmen. Nebenwirkungen messen, nicht nur das Erreichen des Ziels. Harte Vorgaben in Prüfern verankern, die der Agent passieren muss, und nicht nur im Prompttext.

Pläne vor der Ausführung prüfen und einen Neuplanungsweg für das behalten, was der Prüfer nicht sieht. Das Paper erwartet, dass sich derselbe werkzeugbasierte Ansatz auf Arbeitsraum- und Kraftgrenzen ausdehnen lässt, doch das ist eine Erwartung, kein Ergebnis. Vor jedem Einsatz sollte man mit mehreren Hindernissen, anderen Greifern und echter Hardware testen.

Sources

FAQ

Welches Problem untersucht das Paper?

Es fragt, ob Coding-Agenten für Robotermanipulation sicher sind. Wenn jede Aufgabe ein Hindernis hinzufügt, das der Roboter nicht berühren darf, verfolgt der Agent sein Ziel und stößt in den meisten Fällen gegen das Hindernis.

Was fügt SafeHarness dem Agenten hinzu?

Zwei hindernisbewusste Harnesses. Die Routenplanung verankert Objekte als Begrenzungsboxen, lässt das Modell Wegpunkte vorschlagen, prüft die Route außerhalb des Modells und plant bei Bedarf neu. Die Kontaktausführung testet, ob ein Hindernis neben dem Kontaktziel liegt, und wählt danach die Annäherungsseite.

Welche Ergebnisse berichtet das Paper?

Mit GPT-6 erreicht SafeHarness auf SafeLIBERO 71,9 % Aufgabenerfolg und 87,5 % Kollisionsvermeidung. Derselbe Agent mit Fähigkeiten, aber ohne Harnesses, kommt auf 31,0 und 59,0. Das Paper betont, die Auswertung finde zunächst in der Simulation statt und SafeHarness verschiebe das Hindernis noch in etwa einer von acht Episoden.