SafeHarness:コーディングエージェントに障害物回避を組み込む
arXiv 論文(2609.20822)は、言語モデルが制御器を書くロボット用コーディングエージェントが、障害物のある課題の多くで衝突することを示した。著者らは経路の検証と接触方向の選択を行う二つのハーネス SafeHarness を提案する。GPT-6 では SafeLIBERO で成功率 71.9%、衝突回避率 87.5% を達成した。
論文が報告していること
arXiv の新しい論文 arXiv:2609.20822(分類 cs.RO、2026年9月17日投稿)は、Bingxin Xu(USC)、Yuzhang Shang(UCF)、Zhen Dong(UCSB)、Emilio Ferrara(USC)によるものです。著者らは、これまでの研究が問わなかった問いを立てます。ロボット操作の「コーディングエージェント」方式では、言語モデルがロボットの制御器をプログラムとして書きます。こうしたエージェントは、ロボット専用の学習なしでロボットを動かせるようになりました。では、この方式は安全なのでしょうか。
これを調べるため、著者らは安全制約の下でコーディングエージェントを評価します。各タスクは、操作の目標と、ロボットが触れてはならない障害物を組にしたものです。結果として、エージェントは目標を追い、多くの場合に障害物へ衝突しました。そこで論文は SafeHarness を提案します。これはエージェントの周囲に置く二つの「障害物認識ハーネス」です。GPT-6 をバックボーンにすると、SafeHarness は SafeLIBERO ベンチマークで タスク成功率 71.9%、衝突回避率 87.5% に達します。論文によれば、これは従来の最高水準を 6.5% と 27.0% 上回り、ハーネスなしの同じエージェントに対しては 2.3 倍と 1.5 倍になります。
背景:なぜ安全性は測られてこなかったのか
論文は、自らが基づく研究の流れを整理しています。Code as Policies が型を作りました。モデルが知覚と制御の API を組み合わせてプログラムを作り、そのプログラム自体が方策になります。その後のエージェントは、失敗のあとに制御器のコードを書き直し、うまくいった技能のライブラリを保持し、信頼性のためにテスト時の計算を増やします。Harness VLA は、エージェントにシーンを探索させ、うまくいった方法を技能メモリに残し、タスクが接触の多い場面になったときだけ凍結した視覚・言語・行動(VLA)方策を呼び出します。
著者らは、これらの研究がロールアウトを「目標に到達したか」だけで採点しており、途中でロボットが何に触れたかは測られていないと述べます。また、成功は安全を意味しないことを示すため、既存研究を引用しています。モデルの世代をまたぐと、両者が逆方向に動くことがあります。衝突のない実演データを10倍にして同じ方策を学習しても、衝突率の低下は3ポイント未満です。著者の言葉では、タスクを終えることと、ほかに何も触れないことは、一つの要求の二つの半分です。
診断:制約が優先事項にならない
著者らはまず、ロボット安全ベンチマークでコーディングエージェントを評価します。エージェントはタスクを完了しますが、多くの場合に障害物へぶつかります。論文は、思いつきやすい二つの説明を退けます。知覚のせいではありません。エージェントは障害物を正しく認識し、推論の中でも触れています。指示のせいでもありません。プロンプトは最初から接触を禁じています。エージェントは制約を復唱したうえで、それを破ります。
論文は原因を計画にあると位置づけ、各操作フェーズを二つに分けます。自由空間を通る経路では、モデルは障害物を避ける経路という概念を持たず、最短経路を選びます。選んだ経路が途中で実行不能になったときに再計画するという概念もありません。フェーズ末尾の接触の場面では、接触そのものが同じ安全制約に縛られることをモデルが認識しません。第4.3節のアブレーションによれば、より強い計画器を使ってもこの差は埋まりません。
第3.4節は一つの説明を示します。1エピソードは数百ステップに及ぶ一つの長い会話です。ツール呼び出しと画像が加わるたびにコンテキストが伸び、数万トークンになりますが、障害物を名指しした一文は冒頭に残ったままです。著者らは、コンテキストが長くなると、中間部分の想起、指示への追従、システムプロンプトへの忠実さがいずれも低下するという研究を引いています。彼らのロールアウトでは、制約は最初の数ステップの推論に現れ、その後は消えていました。
SafeHarness の仕組み
SafeHarness はタスクを接触イベントで区切ってフェーズに分け、二つのハーネスをフェーズごとに一度ずつ実行します。
障害物認識の経路計画は「計画、検証、実行」のサイクルで動きます。セグメンテーションモデル(SAM-3)が、目標と障害物をバウンディングボックスとして特定します。言語モデルは、ウェイポイントの折れ線として経路を提案します。経路は目標で終わり、障害物のボックスを横切ってはなりません。その後、言語モデルの外にある検査が、経路をボックスに照らして確認します。対象はグリッパーで、物体を持っているときは物体も含みます。ボックスに侵入する経路は却下され、モデルは再計画します。実行中にも再計画が起きます。たとえば腕が引っかかって止まった場合は、止まった位置から新しい経路を計画します。さらに、実行中に経路計画画像を読める回数にも上限を設けています。同じ画像を繰り返し読んでもコンテキストが長くなるだけだからです。
障害物認識の接触実行は、障害物と接触対象が隣接しているかの検査から始まります。隣接していなければ、どの戦略でも構いません。隣接していれば、グリッパーは間隔を保てる方向から近づき、その中で障害物から最も遠い方向を選びます。どの方向も成り立たない場合は、グリッパーを回転させて開口軸を障害物に接する向きにし、荷物を垂直に下ろします。同じ検査を、つかむ場所と置く場所の両方で行います。
ベンチマークと結果
SafeLIBERO は、LIBERO の Spatial、Goal、Object、Long の各スイートから4タスクずつを取り、それぞれに障害物を一つ加えます。障害物はモカポット、収納ボックス、牛乳パック、ワインボトル、マグカップ、本のいずれかです。タスクの文章には障害物が出てきません。各タスクは二つのレベルで登場します。Level I では障害物が目標の近くにあり、つかむ動作や置く動作を妨げます。Level II では目標から離れていますが、運搬経路の上にあります。論文は32タスク、タスクごとに10シードを使い、Harness VLA のコーディングエージェントのループ、凍結した π0.5 方策、元の技能メモリをそのまま再利用しています。したがって違いは二つのハーネスだけです。指標は、タスク成功率(TSR)と衝突回避率(CAR)です。
表1の平均結果(パーセント、TSR、CARの順)は次のとおりです。OpenVLA-OFT は 26.2 と 5.7、π0.5 は 57.8 と 17.1、AEGIS(π0.5 にバリア関数の安全層を加えたもので、最も強い既存手法)は 67.5 と 68.9、GPT-5.5 版 SafeHarness は 70.0 と 86.0、GPT-6 版 SafeHarness は 71.9 と 87.5 です。Long スイートでは、AEGIS の TSR は 46.3 で、包んでいる凍結方策の 54.3 を下回ります。
表2のアブレーションは三種類のエージェントを比べます。GPT-6 では、モデル単体が TSR 6.0、CAR 50.0 です。著者らはこの CAR を意味がないと述べます。腕が早く失敗すれば、何にも触れないからです。技能と凍結 VLA を加えると 31.0 と 59.0 になり、ハーネスを加えると 71.9 と 87.5 になります。GPT-5.5 では、技能のみでハーネスなしが 28.0 と 31.0、SafeHarness が 70.0 と 86.0 です。論文の結論は、ここでの安全性は、包まれるモデルではなくハーネスの性質だというものです。
私たちの分析
注目点は三つあります。第一に、中心の考え方は古いエンジニアリングの習慣を新しい場所に当てはめたものです。プロンプトで一度述べた規則を信用せず、重要な瞬間にツールで確認し直します。論文は、検証ツールが会話に対して状態を持たず、長いエピソードにわたって守るべき不変条件の運び手としては、プロンプトよりツールのインターフェースのほうが信頼できると述べています。
第二に、数字は丁寧に読む必要があります。6.5% と 27.0% は、表1の相対差(71.9 対 67.5、87.5 対 68.9)と一致し、ポイント差ではありません。ポイント差は約 4.4 と 18.6 です。どちらの読み方でも向上は示されますが、タスク成功率のポイント差は小さいものです。論文がハーネスなしの同じエージェントと比べた結果(40.9 ポイントと 28.5 ポイント)のほうが、強い証拠になります。
第三に、アブレーションは有用な切り分けを示します。より強い計画器は、どちら側から近づくかという局所的な判断を改善します。技能のみの設定では、Level I の回避率が 18.8 から 69.0 に上がります。一方、Level II の経路の安全性への効果は小さく、向上は6ポイントです。ハーネスを加えると、計画器の間の差は小さくなります。
限界と未解決の問い
著者ら自身が限界を挙げています。評価は SafeLIBERO に従い、シーンごとに障害物は一つで、障害物のモデルは軸に沿った一つのボックスです。接触側の判定は平行ジョー型グリッパー向けに調整されています。接地の品質はセグメンテーションモデルに依存し、接地の失敗は衝突ではなく経路の却下として現れます。1エピソードに数分の計画時間がかかります。評価はシミュレーションが中心です。
SafeHarness も衝突ゼロではありません。およそ8エピソードに1回は障害物を動かします。タスク成功率は Level II のほうが低いままです(GPT-5.5 で 64.0 対 76.0、GPT-6 で 62.5 対 81.2)。著者らは、検証済みの迂回によってエピソードが長くなり、ステップ数の予算が固定されているためだろうと考えていますが、これは推測であり、検証された結果ではありません。
読み手としての私たちにも限界があります。読んだのは論文本文だけでコードは見ておらず、表の一部の数値は、記載された実験手順と整合させられませんでした。結果は単一のベンチマークによるもので、実機での試験は報告されていません。
読者への実践的な示唆
物理システムや重大な場面向けに LLM エージェントを作るチームは、三つの教訓を持ち帰れます。一つ目は、目標の達成だけでなく副作用を測ることです。二つ目は、厳しい制約をプロンプトの文面だけに置かず、エージェントが通過しなければならない検証器に置くことです。
三つ目は、実行前に計画を検査し、検査器が見えない事態のために再計画の道筋を残すことです。論文は、このツールに基づく方法が作業空間の制限や力の制限にも広がると見込んでいますが、それは期待であり結果ではありません。導入の前には、複数の障害物、別のグリッパー、実機で試験してください。
Sources
FAQ
この論文は何を問題にしていますか。
ロボット操作のコーディングエージェントが安全かどうかを問います。触れてはならない障害物を各課題に加えると、エージェントは目標を追い、多くの場合に障害物へ衝突します。
SafeHarness はエージェントに何を加えますか。
二つの障害物認識ハーネスです。経路計画は物体をバウンディングボックスとして特定し、モデルにウェイポイントを提案させ、モデルの外で経路を検証し、必要なら再計画します。接触実行は、障害物が接触対象の隣にあるかを調べ、それに応じて接近する側を選びます。
論文はどんな結果を報告していますか。
GPT-6 では、SafeHarness は SafeLIBERO で成功率 71.9%、衝突回避率 87.5% に達します。技能はあるがハーネスのない同じエージェントは 31.0 と 59.0 です。論文は、評価がシミュレーション中心であり、およそ8エピソードに1回は障害物を動かすと述べています。