DeepMind sperrt Modell und Test gemeinsam ein: Der erste Doppelblind-Pilot für KI-Evaluation
Kurzfassung
Google DeepMind und unabhängige Prüfer isolierten Gemini-Gewichte und vertrauliche Testfragen per Confidential Computing und adressierten damit einen Grundkonflikt der KI-Evaluation.
Dieser Pilot verändert Beschaffungsentscheidungen nur unter einer überprüfbaren Bedingung: Innerhalb von sechs Monaten muss mindestens ein weiterer Modellentwickler eine vergleichbare Doppelblind-Evaluation akzeptieren und eine reproduzierbare Methode veröffentlichen. Bleibt Google DeepMind das einzige Unternehmen mit einer solchen Demonstration, können Käufer damit weiterhin keine Anbieter vergleichen. Am 2026-08-27 kündigte Google DeepMind nach eigenen Angaben die erste Doppelblind-Evaluation eines proprietären Frontier-Modells an. Getestet wurde Gemini 2.5 Flash Lite.
Öffentliche Bestenlisten haben ein strukturelles Informationsproblem. Sendet ein Prüfer geheime Fragen über die API eines Modellanbieters, kann der Anbieter technisch auf diese Fragen zugreifen. Übergibt der Anbieter stattdessen die Modellgewichte an einen externen Prüfer, legt er mit hohem Trainingsaufwand geschaffenes geistiges Eigentum offen. Verträge, Zero-Logging-Zusagen und Zugriffskontrollen beschränken das Verhalten von Organisationen, verhindern auf Hardwareebene aber nicht, dass eine Seite die Daten der anderen liest. Hinzu kommt die Kontamination: Sind öffentliche Benchmark-Aufgaben bereits in Trainingsdaten enthalten, kann ein Ergebnis das Erinnern bekannter Antworten statt der Leistung bei unbekannten Aufgaben messen.
Google DeepMind führte den Pilot mit dem AI Safety Institute in Singapur, OpenMined, AVERI und MLCommons durch. Das Team lud Modellgewichte und Inferenzcode in eine Google Cloud A3 Confidential VM. Reservierte Aufgaben aus dem Sicherheitsbenchmark AILuminate und ein auf schädliche Inhalte im Kontext Singapurs ausgerichteter Datensatz gelangten in dieselbe isolierte Umgebung. Intel TDX schützte den Arbeitsspeicher des Hosts; für die Beschleunigung diente eine einzelne NVIDIA H100 Confidential GPU mit 80 GB. Remote Attestation prüfte die Softwareumgebung, bevor Daten über verschlüsselte Verbindungen übertragen wurden. Der Modellanbieter konnte die Fragen nicht einsehen, und die Prüfer konnten die Gewichte nicht abrufen.
Die Architektur schützt Informationen während der Ausführung; sie bescheinigt nicht die Qualität des Benchmarks. MLCommons muss Repräsentativität, Qualität und Lebenszyklus der Aufgaben weiterhin sorgfältig verwalten. Hardware, Attestierungsdienst der Cloud und Deployment-Code bilden außerdem eine neue Vertrauensgrenze. Entscheidend ist, dass weder Google DeepMind noch der unabhängige Bericht die Gesamtpunktzahl oder Einzelergebnisse von Gemini 2.5 Flash Lite veröffentlicht haben. Aus dem Pilot lässt sich daher weder eine höhere Sicherheit ableiten noch ein Vergleich mit konkurrierenden Modellen erstellen.
Die Einsatzbedingungen begrenzen den unmittelbaren Nutzen. Im demonstrierten System passt das Modell auf eine einzelne NVIDIA H100, während größere Frontier-Systeme üblicherweise mehrere Beschleuniger benötigen. Die vorliegenden Quellen beziffern weder Leistungseinbußen und Betriebskosten noch die Sicherheit einer vertraulichen Multi-GPU-Umgebung. Unternehmenskäufer können die Methode dennoch als präzisere Prüfliste verwenden: Wer verwahrt die Aufgaben, wer bewertet die Ausgaben, welchen Code verifiziert die Remote Attestation und welche Ergebnisse werden offengelegt? Eine einzelne Zahl aus einer Bestenliste beantwortet keine dieser Fragen.
Für die kommenden drei bis sechs Monate zählen zwei beobachtbare Entwicklungen. Andere Modellunternehmen müssten das Protokoll übernehmen, und eine unabhängig validierte Multi-GPU-Version müsste verfügbar werden. Ohne diese Schritte bleibt die Arbeit ein technischer Nachweis auf einer GPU. Kann ein externes Labor den Ablauf reproduzieren und Ergebnisse veröffentlichen, erhält die KI-Evaluation eine überprüfbare Beweiskette, die vertragliche Zusagen allein nicht liefern.
Quellen:
Verwandte Artikel
Google startet Gemini 3.8 Flash: Token-Kosten und Cyber-Zugang hinter dem niedrigen Preis
Google führt Gemini 3.8 Flash und eine auf vertrauenswürdige Verteidiger beschränkte Cyber-Variante ein; niedrige Stückpreise können durch längeres Reasoning relativiert werden.
Fable-5-Verbot Tag 7: Das Weiße Haus fordert Zero-Jailbreaks, Experten sagen technisch unmöglich
Tag 7 des Fable-5-Verbots: Das Weiße Haus fordert vollständige Jailbreak-Sicherheit vor dem Neustart. Sicherheitsexperten sind sich einig: Das ist technisch unmöglich für jedes Frontier-Modell, und Dario Amodei hat bereits beide Lösungsvorschläge der Regierung abgelehnt.