Attacca: zielgerichtete Steuerung unter Zustandskontinuität für verkörperte Langzeit-Agenten
Attacca adressiert eine Lücke in der Bewertung verkörperter Agenten. Visuelle zielkonditionierte Policies werden meist an isolierten Interaktionen getestet, bei denen das Ziel schon sichtbar ist. Das verdeckt, was in kontinuierlichen Langzeitläufen geschieht. Die Methode trainiert auf vollständigen Trajektorien von der Suche bis zur Interaktion, nutzt entkoppelte Zielbilder aus verschiedenen Umgebungen, sagt eine Zielmaske vorher und konditioniert auf die Phasen Search, Approach und Interact. Berichtet werden 39,0 % bis 47,5 % saubere Erfolgsquote bei Kurzzeitaufgaben (das 1,7- bis 2,4-Fache der Baselines) und 54 %, 30 % und 28 % Abschluss bei Langzeitaufgaben, mit bis zu 7-fachem Gewinn. Die Zusammenfassung nennt weder absolute Baseline-Werte noch Latenz oder Rechenkosten.
Attacca ist ein arXiv-Paper (2610.07785), eingereicht am 6. Oktober 2026 von Gyusik Seo und Jaehong Yoon. Es zielt auf eine klare Lücke. Verkörperte Agenten müssen komplexe Ziele über Ketten voneinander abhängiger Aufgaben erreichen. Die visuellen zielkonditionierten Policies, auf denen diese Agenten beruhen, werden jedoch meist an isolierten Interaktionen getestet, und das Ziel ist schon beim Teststart sichtbar. Echte Langzeitarbeit sieht anders aus. Der Agent muss das Ziel finden, sich nähern und dann handeln. Der Zustand nach einer Aufgabe ist der Startzustand der nächsten. Dieser Artikel stützt sich nur auf die Zusammenfassung des Papers und die öffentliche Seite. Wo die Zusammenfassung schweigt, etwa bei der Netzarchitektur, der Größe der Trainingsdaten, den Simulatoren oder den Ablationszahlen, raten wir nicht. Zustandskontinuität: das Kernproblem Der Begriff „Zustandskontinuität" im Titel ist der Schlüssel zum ganzen Paper. In einem Kurzzeit-Benchmark startet jeder Versuch in einem sauberen Zustand. Das Ziel ist im Blickfeld. Die Policy muss nur den Interaktionsschritt ausführen. In einem Langzeitlauf gibt es zwischen den Aufgaben kein Zurücksetzen. Wo Körper und Arm stehen geblieben sind, wohin Objekte bewegt wurden und ob das nächste Ziel sichtbar ist, sind alles Ergebnisse früherer Schritte. Die Policy muss den Fall behandeln, dass das Ziel nicht sichtbar ist. Sie muss zuerst suchen, dann sich nähern, dann interagieren. Eine einzige Policy auf allen drei Phasen zu trainieren, ist der Ausgangspunkt des Papers.
Die Methode: drei Entwurfsentscheidungen Laut Zusammenfassung trainiert Attacca Policies auf vollständigen Trajektorien von der Suche bis zur Interaktion. Es nutzt Zielbilder, die von der Szene entkoppelt sind und aus verschiedenen Umgebungen stammen. Die Zusammenfassung nennt drei Kernideen. Erstens: kontextentkoppeltes Ziel-Sampling. Das Zielbild stammt nicht aus derselben Szene wie die aktuelle Ansicht. Es kommt aus einer anderen Umgebung. Das zwingt die Policy zu lernen, was das Zielobjekt ist, und nicht, ob das Zielbild dem aktuellen Bild ähnelt. Wenn Ziel und Szene immer dieselbe Quelle haben, kann eine Policy eine Abkürzung nehmen: Sie gleicht Hintergrund, Beleuchtung oder Anordnung ab, statt das Objekt zu erkennen. Die Entkopplung beseitigt diese Abkürzung und sollte die Generalisierung auf neue Umgebungen verbessern. Das ist unsere Deutung der Motivation. Die genaue Sampling-Verteilung steht im Hauptteil des Papers.
Zweitens: Vorhersage der Zielmaske. Die Policy muss das Ziel in der aktuellen Ansicht verankern. Die Maskenvorhersage dient als zusätzliches Trainingssignal. Das Modell muss angeben, wo das Ziel im Bild liegt. Das hilft vor allem in der Suchphase, in der das Ziel außerhalb des Blickfelds liegen kann: Eine leere Maske ist dann selbst eine nützliche Information. In der Annäherungs- und Interaktionsphase liefert die Maske einen präzisen räumlichen Hinweis. Drittens: Konditionierung auf die Verhaltensphase. Die Policy erfährt, ob sie sich in der Phase Suche (Search), Annäherung (Approach) oder Interaktion (Interact) befindet. Die besten Aktionen unterscheiden sich stark von Phase zu Phase. Suche braucht explorative Bewegung. Annäherung braucht gleichmäßige Bewegung zum Ziel. Interaktion braucht feine Manipulation. Die Konditionierung auf die Phase senkt das Risiko, dass eine einzelne Policy über sehr verschiedene Verhaltensweisen mittelt. Sie macht es auch leichter, einen Fehler einer bestimmten Phase zuzuordnen.
Berichtete Ergebnisse Die Zusammenfassung nennt diese Zahlen. Bei Kurzzeitaufgaben erreicht Attacca eine saubere Erfolgsquote von 39,0 % bis 47,5 %, also das 1,7- bis 2,4-Fache der Baselines. Bei Langzeitaufgaben liegen die Abschlussraten bei 54 %, 30 % und 28 %, und das Paper nennt eine Verbesserung von bis zu 7-fach gegenüber Baselines. Zwei Vorbehalte gelten. Erstens beziehen sich die Faktoren auf Baselines, deren Niveau die Zusammenfassung nicht nennt. Ein Gewinn von 7-fach kann von einer sehr niedrigen Basis ausgehen. Zweitens zeigen Raten von 54 %, 30 % und 28 %, dass die Schwierigkeit mit längeren Ketten steigt. Das ist typisch für Langzeitaufgaben, weil sich Fehler entlang einer Kette aufsummieren, in der jeder Zustand den nächsten speist. In absoluten Zahlen wird die Mehrheit der langen Ketten weiterhin nicht abgeschlossen. Die Zusammenfassung enthält keine Angaben zu Latenz, Rechenkosten oder Inferenz-Overhead. Wir können daher den Kompromiss zwischen Kosten und Geschwindigkeit nicht bewerten.
Bedeutung für Entwickler und Unternehmen Für Robotik- und Embodied-AI-Teams betrifft die direkteste Lehre die Evaluation. Wer Erfolgsquoten nur unter „Ziel sichtbar, Zustand zurückgesetzt" meldet, überschätzt die Leistung im Einsatz. Ein Team, das Lagerkommissionierung, Haushaltshilfe oder mehrstufige Montage baut, sollte Policies mit kontinuierlichen Langzeitprotokollen ohne Zurücksetzen testen. Bei den Trainingsdaten deuten szenenentkoppelte Zielbilder auf flexiblere Datenerfassung hin. Zielbilder könnten aus anderen Umgebungen oder sogar anderen Datenquellen stammen. Das könnte die Kosten senken, jedem Szenario ein Zielbild zuzuordnen. Dies ist eine Schlussfolgerung. Die tatsächliche Ersparnis hängt von der Umsetzung im Paper ab. Für das Ökosystem sind Phasenkonditionierung und Maskenvorhersage Module, die andere visuelle zielkonditionierte Policies einzeln übernehmen könnten. Ob Code oder Gewichte veröffentlicht sind, sagt die Zusammenfassung nicht. Leser sollten die Paper-Seite prüfen. Grenzen und nächste Schritte Erstens sind die Erfolgsraten weiterhin niedrig. Kurzzeitergebnisse bleiben unter der Hälfte, Langzeitergebnisse erreichen höchstens 54 %. Das ist weit von industrieller Zuverlässigkeit entfernt. Zweitens ist die Lücke zwischen Testumgebungen und realer Welt unbekannt. Das Hintergrundmaterial erwähnt vielfältige Manipulationsumgebungen, aber die Zusammenfassung sagt nicht, ob Versuche mit echten Robotern enthalten sind. Drittens braucht die Phasenkonditionierung Phasenlabels oder eine Phasenentscheidung. Woher die Labels kommen und was bei einer falschen Phasenbeurteilung geschieht, sind offene Fragen. Viertens fehlen öffentliche Daten zu Kosten und Latenz.
Mögliche nächste Schritte sind längere Aufgabenketten, stärkere Fehlerbehebung, die Behandlung der Phase als gelernte latente Variable und die Validierung auf echten Robotern. Insgesamt macht Attacca den gesamten Prozess von der Suche bis zur Interaktion zum Gegenstand von Training und Evaluation und bietet einen kompakten, gezielten Satz von Entwürfen. Praktiker der Embodied AI sollten es beobachten, die Zahlen aber erst nach der Lektüre des vollständigen Papers beurteilen.