NVIDIA erweitert Agentensicherheit: Laufzeitrechte garantieren keine korrekte Arbeit
Kurzfassung
NVIDIA startet seine Open Agent Safety Platform. OpenShell 0.1.0 setzt Datei-, Netzwerk- und Werkzeugrechte außerhalb des Modells durch. Das kann Fehler begrenzen; über 100 beteiligte Organisationen belegen jedoch weder Einsatzerfolge noch korrekte Arbeit.
NVIDIA hat am 2026-09-28 seine Open Agent Safety Platform vorgestellt. Sie verlagert die Durchsetzung von Agentenberechtigungen in Systeme außerhalb des Modells. Ob das längere autonome Arbeit ermöglicht, lässt sich an versuchten Grenzüberschreitungen prüfen: Bleiben verbotene Aktionen gesperrt, wenn ein Agent das Werkzeug wechselt oder einen Unterprozess startet? Ein Versprechen im Gespräch, die Regeln einzuhalten, beantwortet diese Frage nicht.Ankündigung Technische Erläuterung
Ereignis und Artikel fallen nach Taipeher Ortszeit auf den 28. September. Diese Reuters-Fassung erschien um 05:01 EDT, entsprechend 17:01 in Taipei und damit vor dem Redaktionsschluss um 23:56. Die offizielle Ankündigung nennt nur das Datum. Die Veröffentlichungszeit des Berichts darf nicht als Freischaltzeit der Software gelten. Es handelt sich um eine Ankündigung desselben Tages, nicht um einen Rückgriff auf den Vortag.Veröffentlichungszeit
OpenShell 0.1.0 ist als Open Source verfügbar und kontrolliert Dateien, Netzwerkzugriffe, Prozesse und Werkzeugaufrufe von außen. Ein Proxy auf Anwendungsebene kann angeforderte Operationen prüfen und innerhalb desselben Dienstes unterschiedliche Rechte für Lesen und Schreiben durchsetzen. Zugangsdaten können außerhalb der Agentenumgebung bleiben. Damit lässt sich die Handlung selbst blockieren, ohne darauf angewiesen zu sein, dass das Modell nach dem Lesen bösartiger Inhalte weiterhin seine Anweisungen befolgt.Laufzeitkontrolle Quellcode und Architektur
Zur Plattform gehört außerdem das Referenzdesign NVIDIA Sentry. Infrastruktur wie BlueField-4 trennt die kontinuierliche Überwachung von den Ressourcen, auf denen der Agent läuft. Das ist eine Architektur zur Integration durch Anbieter, kein bereits bei sämtlichen Kunden installiertes Produkt. Sie beweist auch nicht, dass ein beliebiger Agent fehlerfrei arbeitet.Überwachungsarchitektur
Nach Angaben von NVIDIA arbeiten über 100 Organisationen mit den Plattformtechnologien. OpenShell wurde zudem in Slack integriert: Teams können Aktivitäten einsehen sowie zusätzliche Berechtigungen genehmigen oder ablehnen. Die Zahl der Organisationen belegt nicht die Zahl produktiver Installationen. Reuters berichtet über NVIDIAs Behauptung, die Werkzeuge hätten den früheren Hugging-Face-Vorfall verhindern können. Das ist eine kontrafaktische Einschätzung des Anbieters, kein unabhängig reproduzierter Test.Beteiligung und Integration Grenzen der Aussage
HP kündigte am selben Tag an, mit den Plattformtechnologien Komponenten für KI-Infrastruktur zu entwickeln. Das ist eine zukünftige Produktplanung; Liefertermine, Preise und vergleichende Kundenergebnisse fehlen in der Mitteilung. Sie ist von der bestehenden Slack-Integration zu unterscheiden. Eine Partnerliste bedeutet nicht, dass sämtliche Funktionen bereits allgemein verfügbar sind.HPs Planung
Änderungen vorschlagen lassen, ohne die Autorisierung abzugeben
Ich befürworte die Trennung zwischen Agent und Zugriffsrechten. Angenommen, ein Agent zur Fehlerbehebung liest einen bösartigen Text, der ihn zum Hochladen von Zugangsdaten auffordert. Verbietet eine externe Regel das Ziel, sollte die Übertragung auch dann scheitern, wenn das Modell die Anweisung akzeptiert. Dafür muss das Modell nicht jeden Angriff erkennen. Voraussetzung bleibt jedoch, dass die Anfrage die Kontrollschicht durchläuft und der Agent seine eigenen Regeln nicht ändern kann.
Diese Trennung kann auch beeinflussen, wie ein Produkt autonome Arbeit anbietet. Ein Team könnte fortlaufende Änderungen auf einem rücksetzbaren Branch erlauben und die Freigabe zur Veröffentlichung bei einem Menschen oder einem anderen System belassen. Für Nutzer ist die Zusage nützlicher, welche Handlungen selbstständig erfolgen dürfen und welche anhalten müssen, als ein allgemeines Versprechen über die mögliche Arbeitsdauer. Das ist eine aus dem Mechanismus abgeleitete Produktentscheidung, keine bereits vorhandene Funktion sämtlicher Integrationen.
Ein ordnungsgemäß berechtigter Agent kann weiterhin einen falschen Patch liefern. Angenommen, er bearbeitet eine erlaubte Datei und beschädigt dabei eine Funktion. Dann kann das Berechtigungssystem völlig korrekt arbeiten, während das Ergebnis unbrauchbar bleibt. Die Erlaubnis für eine Operation und die Abnahme eines Ergebnisses benötigen deshalb unterschiedliche Nachweise. Ein fehlender Rechteverstoß rechtfertigt nicht, auf Tests und Prüfung zu verzichten.
Zu weit gefasste Rechte schwächen den Schutz; zu enge Rechte können legitime Aufgaben wiederholt unterbrechen. Ich würde Nutzern den Unterbrechungsgrund anzeigen, statt dem Agenten zu erlauben, seine Befugnisse für die Fertigstellung selbst auszuweiten. Hilfreiche spätere Messgrößen sind der Anteil legitimer Aufgaben, die an Berechtigungen scheitern, und der Anteil abgenommener Arbeitsergebnisse. Diese Veröffentlichung liefert Werkzeuge zur Durchsetzung von Rechten, aber noch keine unabhängigen Daten, die beide Fragen ausreichend beantworten.
Das Titelbild verwendet eine vorhandene Archivaufnahme eines NVIDIA-Standorts, keine Ansicht der neuen Plattform. Der Download des Ereignisbildes scheiterte an der DNS-Auflösung.
Quellen:
Verwandte Artikel
OpenAI startet Dots: Dauerhafte Unterstützung darf nicht immer mehr Prüfarbeit erzeugen
OpenAI führt dots für berechtigte zahlende Nutzer ein. Hintergrundrecherche mit reinem Lesezugriff und begrenzte Gedächtniskontrollen machen versäumte Aufgaben und aufgelaufene Prüfarbeit zu aussagekräftigeren Maßstäben als bloße Aktivität.
Copilot vereint Office und dauerhafte Agenten: Arbeit ohne Versionsabgleich?
Microsoft kündigt Home, Code und Autopilot an und verbindet gemeinsam bearbeitete Office-Dateien mit Copilot. Das könnte Versionsabgleiche ersparen; dauerhafte Agenten müssen jedoch überholte Ziele erkennen. Der Zugang erfolgt schrittweise.