CADFather: Ein Vision-Sprache-Agent koordiniert Werkzeuge und rekonstruiert parametrisches CAD aus Netzen

Published · AI Daily — AI-assisted deep research, methodology & disclosure

CADFather ist ein Agent, der aus 3D-Netzen ohne zusätzliches Training editierbare parametrische CAD-Programme rekonstruiert. Ein Vision-Sprache-Assistent (Qwen3.8-27B) prüft Renderings und verteilt die Arbeit auf drei Werkzeuge: gelernte Vorschläge von CADENA-RL, algorithmische geometrische Vorschläge und numerische Parameteroptimierung. Das beste gültige Ergebnis bleibt geschützt. Auf den vollständigen Testmengen von DeepCAD, Fusion360 und MCB meldet er keine ungültigen Ausgaben und einen mittleren IoU von 0,987, 0,976 und 0,913, über CADENA-RL mit Sampling. Auf BenchCAD erreicht er einen Voxel-IoU von 0,968 bei geschätzt 0,046 Dollar pro Teil.

Hintergrund: vom Netz zum editierbaren CAD-Programm

Ein Netz beschreibt eine Form, aber nicht, wie sie gebaut wurde. Existiert ein Bauteil nur als Scan oder als altes Netz, kann ein Ingenieur weder einen Bohrungsdurchmesser noch eine Wandstärke ändern, weil keine Konstruktionshistorie vorliegt. CADFather greift dieses Reverse-Engineering-Problem an. Aus einem Zielnetz stellt es ein ausführbares, strukturell stimmiges und editierbares parametrisches CAD-Programm wieder her. Die Arbeit stammt von der Lomonossow-Universität Moskau, der Universität Innopolis und dem FusionBrain Lab. Sie trägt die Kennung arXiv 2610.09127, wurde am 6. Oktober 2026 eingereicht, und der Code liegt öffentlich auf GitHub (kulibinai/CADFather).

Jede bestehende Methode hat eine Stärke und eine Schwäche. CAD-Recode, cadrille und CADEvolve erzeugen ein vollständiges Programm in einem Durchgang. CADReasoner überarbeitet ein vollständiges Programm anhand von Abweichungen. CADENA fügt je eine Operation hinzu. CADFit verbindet geometrisches Anpassen mit einer Optimierungssuche. Die zentrale Beobachtung der Arbeit ist einfach: Keine einzelne Quelle für CAD-Operationen funktioniert bei allen Geometrien und in allen Phasen der Rekonstruktion gleich gut. Ein gelerntes Modell schlägt plausible Operationen vor, kann aber ein Merkmal übersehen oder falsche Maße wählen. Eine algorithmische Konstruktion leitet Operationen direkt aus der Zielgeometrie ab. Numerische Optimierung feilt an den Maßen eines Programms, das schon nahe dran ist. Die eigentliche Frage lautet deshalb: Welchen Kandidaten entwickelt man in jedem Schritt weiter, und mit welchem Werkzeug?

Kernarchitektur: ein Vision-Sprache-Assistent und drei Werkzeuge

CADFather ist ein Agent, der kein zusätzliches Training braucht. Der Assistent ist Qwen3.8-27B mit FP8-Gewichten und abgeschaltetem expliziten Denken. Der gelernte Operationsgenerator ist der Checkpoint CADENA-RL, bereitgestellt in bfloat16. Beide Modelle bleiben eingefroren. Alle Werkzeuge schreiben dieselbe Darstellung, die CadQuery-basierte DSL von CADENA. Deshalb kann ein Kandidat, den ein Werkzeug erzeugt hat, von einem anderen erweitert oder verfeinert werden.

Die drei Werkzeuge haben klare Aufgaben. Erstens die gelernte Vorschlagserzeugung: Für ein Elternprogramm liefert eine Anfrage n alternative nächste Operationen. Der Assistent wählt n, höchstens 32 pro Aufruf. Zweitens die algorithmische Vorschlagserzeugung: Sie passt Geometrie an das Zielnetz an und nutzt kein gelerntes Modell. Am leeren Startpunkt prüft sie, ob das Teil ein Rotationskörper ist. Wenn nicht, schneidet sie das Ziel mit Ebenen, behandelt jeden Querschnitt als Skizze und sucht die Tiefe, über die diese Skizze der Zieloberfläche folgt. Extrusionen, die wenig zur Überdeckung beitragen, verwirft sie. Bei einem vorhandenen Kandidaten vergleicht sie Kandidat und Ziel, findet fehlendes und überschüssiges Material und baut Extrusionen für das erste und Schnitte für das zweite. Sie liefert eine geordnete Liste, vier Vorschläge pro Aufruf. Drittens die Parameteroptimierung: Sie ändert nur Zahlen und behält die Operationen. Frei sind Skizzenkoordinaten, Radien und Extrusionstiefen.

Entscheidungsschleife und Kandidatenpool

Pro Teil führt das System einen Pool von Kandidaten. Jeder Eintrag speichert Kennung, Elternteil, Quellwerkzeug, Programm, Netz, Operationszahl, Gültigkeit und Messwerte. Wer einen Kandidaten erweitert, erzeugt ein Kind und schreibt die Historie nie um. Eine Deduplizierung auf Codeebene verhindert doppelte Einträge. In jedem Schritt sieht der Assistent eine begrenzte Tabelle: bis zu zwölf Kandidaten mit der besten Punktzahl, dazu das geschützte Beste und die leere Wurzel. Jede Zeile nennt das erzeugende Werkzeug, die Operationszahl, IoU und GMS, die Punktzahl der ersten Operation der Kette und die noch verfügbaren Werkzeuge. Der Assistent bekommt außerdem Renderings des Ziels und der letzten Kandidaten. Er schreibt einen Satz zur Absicht und setzt dann bis zu vier act-Aufrufe ab, oder er ruft finish mit dem Grund shape (alle Merkmale vorhanden) oder stalled (kein Fortschritt mehr) auf.

Die Antwort eines Werkzeugs ist nur ein Vorschlag. Die Ausführungskomponente baut, prüft und misst ihn. Danach sieht sich der Assistent das Rendering an und entscheidet über die Aufnahme in den Pool. Die Gültigkeitsregel ist streng: Das Programm muss sich bauen lassen, und das ganze Netz muss ein wasserdichter Körper mit positivem Volumen sein. Ziel und Kandidat liegen im selben Koordinatensystem, und der Kandidat wird nicht auf seine eigene Bounding Box skaliert, sodass eine falsche Größe Punkte kostet. Die Punktzahl ist der Mittelwert aus IoU und normalisiertem GMS, ein ungültiger Kandidat erhält null. Ausgegeben wird das geschützte beste Ergebnis, nicht der zuletzt bearbeitete Kandidat. Feste Budgets sichern das Ende: pro Teil 24 Assistentenschritte, höchstens 12 Operationen, 1000 Sekunden, 80 Generatorproben, 6 algorithmische Aufrufe, 10 Optimiereraufrufe und 120 Programmausführungen.

Die Mathematik des Optimierers

Der Optimierer arbeitet mit vorzeichenbehafteten Abständen: dem Abstand eines Punktes zur Körperoberfläche, innen negativ. Der Abstand des Programms wird direkt aus seinen Operationen berechnet, der des Ziels aus dem Netz an Stichprobenpunkten. Die Abweichung ist der mittlere quadratische Unterschied beider Abstände. Der Gradient wird numerisch geschätzt: Jeder Parameter wird um einen kleinen Schritt verschoben, und die Änderung der Abweichung ergibt seine Ableitung.

Zuerst werden Punkte über das ganze Teil angepasst, dann Punkte nahe der Oberfläche. Von den Start-, groben und feinen Parametern behält der Optimierer die, die nahe der Oberfläche am besten passen, das Programm kann also unverändert zurückkommen. Unterstützt werden nur Extrusionen, Bohrungen und Rotationen. Die Autoren betonen, dass sie keinen neuen numerischen Optimierer einführen.

Benchmark-Ergebnisse

Auf den vollständigen Testmengen von DeepCAD, Fusion360 und MCB (8046, 1725 und 5000 Teile) liegt die Ungültigkeitsrate von CADFather bei null. Der mittlere IoU beträgt 0,987, 0,976 und 0,913, gegenüber 0,966, 0,952 und 0,895 bei CADENA-RL mit Sampling. Der mittlere GMS liegt bei 0,983, 0,960 und 0,766. Der mediane Chamfer-Abstand bei 30000 Punkten (mal 1000) beträgt 0,039, 0,034 und 0,083, gegenüber 0,042, 0,036 und 0,089. Das gelernte Werkzeug ist derselbe CADENA-RL-Checkpoint, der Gewinn stammt also nicht von einem stärkeren Generator. Eine Einschränkung: Die veröffentlichten CADENA-Zeilen nutzen eine nachsichtigere Gültigkeitsregel. Die Ungültigkeitsraten sind daher nicht direkt vergleichbar.

Auf CADENA-Bench (3396 Teile) erreicht CADFather IoU 0,909 und GMS 0,721, gegenüber 0,876 und 0,670 bei CADENA-RL greedy. Auf CADBench, mit dem Bewertungscode des Benchmarks über 18000 Teile, ergeben sich IoU 0,930, Oberflächen-IoU 0,787 und Chamfer-Abstand 0,029, vor CADFit mit 0,859, 0,679 und 0,038. Die Rate gültiger Formen, 0,968, liegt unter den 0,981 von CADFit, weil 576 Teile das 30-Sekunden-Limit des Auswerters überschreiten. Auf BenchCAD beträgt der Voxel-IoU 0,968, ohne ein einziges ungültiges Programm.

Ablationen: algorithmische Vorschläge zählen am meisten

Auf Teilmengen von je 1000 Teilen senkt der Verzicht auf algorithmische Vorschläge die mittlere Punktzahl um 0,012 bis 0,110. Auf MCB steigt die Ungültigkeitsrate von 0 auf 0,124. Der Grund ist konkret. Bei manchen Teilen ergibt jede vom Generator gezogene erste Operation eine offene Fläche, und die Suche kann von einer nicht wasserdichten Basis nicht weitermachen.

Die Extrusion eines Zielquerschnitts liefert einen geschlossenen Körper. Der Verzicht auf den Optimierer kostet nur 0,004 bis 0,006 und lässt die Ungültigkeit bei null. In diesem System kauft Werkzeugvielfalt also vor allem Robustheit, während der Optimierer den letzten kleinen Passgewinn beisteuert. Die Autoren räumen ein, dass die Ablationen den Wert der Auswahlstrategie des Assistenten nicht isolieren.

Kosten und Latenz

Die mittleren Assistentenschritte pro Teil betragen 6,37 bei DeepCAD, 8,41 bei Fusion360, 12,25 bei MCB und 13,04 bei CADENA-Bench. Die Wanduhrzeit liegt bei 82,6, 119,9, 245,6 und 306,7 Sekunden. Die Generatorproben reichen von 19,0 bis 67,1. Der Assistent beendet bei DeepCAD 86,1 % der Teile selbst, bei CADENA-Bench nur 25,0 %, komplexe mechanische Teile werden also oft vom Budget abgeschnitten.

Auf BenchCAD, bewertet zu den OpenRouter-Preisen von Qwen3.8-27B (0,425 und 2,55 US-Dollar je Million Eingabe- und Ausgabetoken), erreicht CADFather nach vier Schritten einen Voxel-IoU von 0,943 für etwa 0,016 Dollar pro Teil und bei vollem Budget 0,968 für etwa 0,046 Dollar. Die Arbeit zitiert Claude Opus 5.5 und GPT-6 Astra mit Werkzeugen bei 0,962 und 0,959, zu Kosten von 5,94 und 1,75 Dollar pro Teil. Diese Zahlen der Spitzenmodelle sind Eigenangaben der Anbieter mit anderen Eingaben und Teilmengen, und die Autoren nennen den Vergleich kontextuell. Die Schätzung für CADFather zählt nur Modelltoken, nicht Geometrieverarbeitung oder Ausführung.

Bedeutung für Entwickler und Unternehmen

Für Fertigungs- und Industriesoftware-Teams macht dieser Ansatz aus alten Scans und Netzen ohne Historie parametrische Modelle, die sich bearbeiten lassen. Er braucht kein eigens trainiertes Modell.

Er kombiniert einen vorhandenen Generator, geometrische Algorithmen und ein allgemeines Vision-Sprache-Modell und kann daher mit offenen Gewichten in einer privaten Umgebung laufen. Der modulare Aufbau erlaubt außerdem, jedes Werkzeug auszutauschen: Ein stärkerer Generator oder ein schnelleres Anpassungsverfahren lässt sich direkt einstecken. Die weitere Lehre lautet, dass in überprüfbaren Gebieten wie der Geometrie der Wert eines Agenten aus Weichenstellung und Budgetverteilung kommt, nicht aus der Rohleistung eines einzelnen Modells.

Grenzen und Ausblick

Die Autoren nennen mehrere Grenzen. Das System hängt von den Operationen ab, die seine CAD-Darstellung trägt, und von den Vorschlägen, die seine Werkzeuge liefern können. Parameteroptimierung kann eine falsche Operationsfolge nicht reparieren, und alte Kandidaten zu behalten hilft nicht, wenn eine gute Alternative nie erzeugt wurde. Suchgrenzen können einen Lauf abbrechen, der noch erfolgreich geworden wäre. Der Assistent entscheidet auf Basis unvollständiger visueller und numerischer Hinweise, das Ergebnis kann also vom Prompt und vom Modell abhängen. Typische Fehler sind eine falsche Anfangstopologie (ein Vollblock wird als hohler Rahmen nachgebaut), passendes Volumen bei fehlenden Oberflächendetails (Rändelung, flache Taschen) und eine Schraubenfeder, die als Rohr rekonstruiert wird. Die Bewertung misst Geometrie und Programmgültigkeit, nicht Konstruktionshistorie, Fertigungsabsicht oder technische Randbedingungen. Sie deckt Einzelteile ab, keine Baugruppen, Toleranzen oder Simulation. Ein direkter Vergleich mit anderen CAD-Agenten wie CAD-Assistant und IterCAD sowie eine kontrollierte Untersuchung der Werkzeugauswahl bleiben offen.

Noch ein Hinweis für genaue Leser: Die endgültige Auswahl nutzt dieselben Kennzahlen IoU und GMS, die die Arbeit berichtet. Es ist also eine Best-of-N-Auswahl nach den berichteten Kennzahlen. Behalten Sie das im Kopf, wenn Sie die Zahlen zitieren.

Sources