Perplexity bringt lokalen KI-Agenten auf Windows-RTX-PCs

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Perplexitys Portable Computer führt den KI-Agenten lokal auf RTX-GPUs mit mindestens 24 GB VRAM aus, startet heute für Windows und bringt integrierte Connectoren für Office, Slack und GitHub mit.

Perplexity hat Portable Computer vorgestellt, eine lokale Version seines KI-Agenten, der mehrstufige Aufgaben direkt auf dem eigenen Rechner der Nutzer plant und ausführt, statt sie über Cloud-Server laufen zu lassen. Da die gesamte Denk- und Ausführungsschleife auf dem Gerät läuft, müssen sensible Dateien, Zugangsdaten und Geschäftsdaten das Gerät nicht verlassen, um von der Agentenunterstützung zu profitieren. Die Windows-Unterstützung startet heute und ergänzt die bereits bestehende Unterstützung für Linux-basierte RTX-PCs und NVIDIA-DGX-Spark-Systeme; die Unterstützung für DGX Station soll demnächst folgen. Das System benötigt eine NVIDIA-GeForce-RTX- oder RTX-PRO-GPU mit mindestens 24 GB VRAM, eine Schwelle, die sofort trennt, welche Hardware diese Agentenklasse ausführen kann und welche nicht.

Im Inneren nutzt Portable Computer lokal optimierte Modelle wie Qwen 3.8 27B, wodurch die manuelle Konfiguration eines lokalen Modell-Stacks entfällt. Das Tool bringt integrierte Connectoren für Microsoft Office, Google Workspace, Slack und GitHub mit, dazu einen Browser und eine Sandbox-Umgebung namens "SPACE" für die Ausführung von Aufgaben. Perplexity nennt konkrete Anwendungsfälle wie die Verwaltung von GitHub-Pull-Requests, Finanzanalysen über Steuerdokumente hinweg und Nutzer-Funnel-Analysen für Startups, alles ohne Dateien an einen externen Dienst hochzuladen. Preisinformationen wurden bei der Ankündigung nicht veröffentlicht.

Warum die 24-GB-VRAM-Schwelle wichtig ist

Eine Anforderung von 24 GB VRAM oder mehr ist kein Nebendetail, sondern ein echter Filter. Sie schließt die meisten Mainstream-Consumer-Grafikkarten aus und richtet sich klar an Prosumer- und Workstation-Hardware oder an dedizierte Systeme wie DGX Spark.

Das ist ein bewusster Kompromiss: Eine leistungsfähige Agentenschleife, ein Modell der 27B-Klasse sowie der Overhead von Browser und Sandbox gleichzeitig zu betreiben, verlangt echten Speicherspielraum. In der Praxis bedeutet das, dass der Begriff "lokaler KI-Agent" nicht mehr nur eine Marketingfloskel ist, die jeder für sich beanspruchen kann, sondern zu einem echten Datenblatt wird: Entweder ist genug GPU-Speicher vorhanden, oder eben nicht. Das setzt eine reale Hardware-Untergrenze dafür, was als ernstzunehmender On-Device-Agent gilt, und dürfte bei Enthusiasten und kleinen Unternehmen, die den Datenschutzvorteil wollen, ohne für jede Aufgabe Cloud-API-Kosten zu zahlen, eine Welle von GPU-Upgrades auslösen.

Ein pragmatischer Mittelweg: lokal zuerst, Cloud nur bei Bedarf

Dieses hybride Modell, das standardmäßig lokal läuft und nur mit ausdrücklicher Erlaubnis des Nutzers auf Cloud-Rechenleistung eskaliert, liegt zwischen zwei Extremen, die beide ihre eigenen Schwächen haben: reine Cloud-Agenten, die leistungsstark sind, aber verlangen, dass jedes Dokument das Gerät verlässt, und rein lokale Agenten, die die Privatsphäre schützen, aber bei den schwierigsten Aufgaben an eine Leistungsgrenze stoßen.

Indem die Eskalation als Opt-in gestaltet ist, kann der Nutzer den Großteil der routinemäßigen Dokumentenanalyse, Workflow-Automatisierung und Datenextraktion vollständig auf dem eigenen Gerät erledigen und nur dann auf leistungsfähigere Cloud-Modelle zurückgreifen, wenn eine Aufgabe es wirklich erfordert. Das verringert zudem die Abhängigkeit von Cloud-Guthaben und pro Aufruf abgerechneten API-Kosten für die tägliche Arbeit, da die meisten Aufgaben das Gerät gar nicht erst verlassen.

Bedeutung für Datenresidenz in Unternehmen und datenschutzsensible Workflows

Für Workflows in Recht, Steuern und Finanzen, bei denen Dokumente aus Compliance-Gründen häufig weder eine bestimmte Rechtsordnung noch die eigene Infrastruktur eines Unternehmens verlassen dürfen, verändert ein lokal priorisierter Agent, was überhaupt möglich ist.

Das von Perplexity genannte Beispiel der Finanzanalyse über Steuerdokumente hinweg veranschaulicht das direkt: Ein Agent, der sensible Unterlagen lesen, abgleichen und zusammenfassen kann, ohne sie jemals irgendwohin zu übertragen, hat ein deutlich anderes Risikoprofil als ein reines Cloud-Tool, selbst wenn dieses strenge Datenverarbeitungsversprechen macht. Dieselbe Logik gilt für die Verwaltung von GitHub-Pull-Requests oder die Analyse des Nutzer-Funnels eines Startups, Aufgaben, die proprietären Code oder interne Kennzahlen betreffen, die viele Teams standardmäßig lieber nicht über einen Drittanbieter-Server leiten möchten.

Wettbewerbskontext

Die Entscheidung, einen vollständigen Agenten-Stack auf Consumer- und Prosumer-GPUs laufen zu lassen, statt ein dediziertes Cloud-Abonnement zu verlangen, reiht Perplexity in eine kleine, aber wachsende Gruppe von Anbietern ein, die darauf wetten, dass On-Device-Inferenz eine echte Nutzbarkeitsschwelle überschritten hat. Die Anforderung von RTX- oder RTX-PRO-GPUs mit 24 GB VRAM oder mehr, beziehungsweise von NVIDIA-DGX-Spark- und DGX-Station-Hardware, bindet das Angebot eng an die Hardware-Roadmap von NVIDIA, statt die GPU als austauschbare Massenware zu behandeln.

Wenn weitere Anbieter in dieselbe Nische lokaler Agenten vordringen, dürfte sich der eigentliche Wettbewerb weniger um die Modellqualität drehen als darum, wie geschmeidig jedes Produkt den Übergang zwischen lokal und Cloud handhabt und wie weit sich die VRAM-Untergrenze senken lässt, ohne die Leistungsfähigkeit zu opfern. Dieser noch ohne Preisangabe erfolgte Start beantwortet diese Frage nicht, markiert aber einen der konkreteren Schritte hin zu einer agentischen KI, die lokale Ausführung als Standard und nicht als Ausnahme behandelt.

Sources

FAQ

Was ist Perplexitys Portable Computer?

Es ist eine lokale Version von Perplexitys KI-Agent, der mehrstufige Aufgaben direkt auf dem Gerät des Nutzers plant und ausführt, statt über die Cloud.

Welche Hardware wird dafür benötigt?

Nötig ist eine NVIDIA-GeForce-RTX- oder RTX-PRO-GPU mit mindestens 24 GB VRAM, oder ein DGX-Spark-System bzw. ein Linux-basierter RTX-PC; die Windows-Unterstützung startet heute.

Kann es bei Bedarf Cloud-KI nutzen?

Ja, mit ausdrücklicher Erlaubnis des Nutzers kann es komplexe Aufgaben an Cloud-Modelle eskalieren und so lokalen Datenschutz mit Cloud-Rechenleistung verbinden.