Step 5 Preview startet: Günstige lange Läufe brauchen verlässliche Rückmeldungen
Kurzfassung
StepFun stellt Step 5 Preview mit 600B Parametern, API-Zugang und geplanter Gewichtsfreigabe vor. Ein Kernel-Experiment zeigt längere Arbeit; günstige Tokens belegen jedoch keine niedrigeren Kosten pro akzeptierter Änderung.
StepFun stellte am 2026-09-20 Step 5 Preview vor und bietet Entwicklern damit eine weitere Möglichkeit für längere Schlussfolgerungsprozesse. Die öffentlich verfügbaren Daten zeigen noch nicht, wie viel ein gewöhnliches Team insgesamt für jede akzeptable Codeänderung bezahlen würde. Ob neben dem Stückpreis auch Wiederholungen und Prüfaufwand sinken, beeinflusst die tatsächliche Ersparnis. National Business Daily
National Business Daily veröffentlichte die Meldung zur offiziellen Vorstellung an diesem Tag um 10:27 Uhr. Artificial Analysis nennt dagegen 2026-09-18 als Veröffentlichungsdatum des Modells. Dieser Artikel behandelt die offizielle Ankündigung vom 20. September und trägt dasselbe Veröffentlichungsdatum in Taipeh; Rechercheschluss war 20:36 Uhr. Die offizielle Seite nennt keine genaue Uhrzeit, und der Zeitpunkt der ersten API-Freischaltung bleibt unbestätigt. Laut StepFun ist der API-Zugang verfügbar; die Modellgewichte sollen am 2026-10-15 folgen. Der bestehende Dienst darf deshalb nicht als vollständiges, bereits für den Eigenbetrieb herunterladbares Modell beschrieben werden. Offizielle Ankündigung National Business Daily Unabhängige Evaluation
Das Mixture-of-Experts-Modell besitzt insgesamt 600B Parameter, aktiviert jeweils 27B und unterstützt einen Kontext von 1M Tokens. Das schafft Platz für längere Aufgabenverläufe, belegt aber keine korrekte Nutzung jedes Eingabeteils. Hardwareanforderungen und Lizenzbedingungen müssen anhand der tatsächlichen Gewichtsfreigabe beurteilt werden. Aus der Zahl aktiver Parameter allein lassen sich die Betriebskosten nicht ableiten. National Business Daily
Artificial Analysis nennt einen Intelligence-Index-Wert von 44 sowie Preise von USD 1 für die Eingabe und USD 2.70 für die Ausgabe je Million Tokens. Die Evaluation verbrauchte rund 160M Ausgabe-Tokens; der Median der getesteten Modelle lag bei etwa 92M. Diese Nutzung gilt für die Bedingungen der Evaluation, nicht für jede Anwendung. Sie verdeutlicht jedoch, weshalb Stückpreis und Gesamtverbrauch gemeinsam betrachtet werden müssen. Unabhängige Evaluation
Für ein Kernel-Experiment auf einer H100 meldet StepFun 508 TFLOPS nach ungefähr 22 Stunden bei einem Zeitbudget von 24 Stunden. Angegeben wird der beste von 4 Läufen. Rückmeldungen zum Durchsatz halfen, langsamere Änderungen auszusortieren. Das ist eine Herstellerdemonstration, kein durchschnittliches Projektergebnis und kein Nachweis einer einheitlichen Erfolgsquote bei längeren Aufgaben. Offizielle Ankündigung
Code hat eine messbare Geschwindigkeit; Dokumente brauchen Abnahmekriterien
Dieses Beispiel spricht aus meiner Sicht dafür, günstiges, langes Schlussfolgern dort einzusetzen, wo Ergebnisse wiederholt überprüft werden können. Bei der Kernel-Optimierung lässt sich der Durchsatz messen. Sobald die Korrektheit bestätigt ist, gibt es einen Grund, eine schnellere Version zu behalten. Mehr Zeit ermöglicht zusätzliche Lösungsversuche, sofern das umgebende System Verschlechterungen erkennt und eine geprüfte Version bewahrt.
Als hypothetisches Gegenbeispiel dient ein Dokument mit Produktanforderungen. Eine längere oder flüssiger formulierte Fassung deckt die Anforderungen nicht zwangsläufig vollständiger ab. Ohne eine Festlegung, welche Nutzungsszenarien enthalten sein müssen, könnte das Modell dasselbe lückenhafte Dokument immer weiter überarbeiten. Hier braucht es zunächst nachvollziehbare Anforderungen und eine Entscheidung darüber, welche Änderungen automatisch akzeptiert werden dürfen. Zusätzliche Denkzeit ersetzt diese Produktentscheidung nicht.
Ein niedriger Stückpreis hat dennoch einen praktischen Nutzen. Bei bereits klar definierter Prüfung lässt dasselbe Budget mehr Lösungsvarianten zu, statt die erste brauchbare Antwort sofort als endgültige Fassung zu übernehmen. Beim Vergleich würde ich aber verworfene Läufe, Rechenaufwand für Tests und menschliche Kontrolle mitrechnen. Nur die Tokens des erfolgreichen Versuchs zu zählen reicht nicht aus. Diese Kostenbetrachtung folgt aus den Bedingungen der Demonstration; die Quellen liefern keine ausreichenden Daten, um den Ertrag für ein typisches Team zu berechnen.
Die Veröffentlichung erweitert heute die API-Auswahl. Die angekündigten Gewichte könnten zusätzliche Flexibilität beim Betrieb schaffen, ihre tatsächliche Bereitstellung steht jedoch noch aus. Den wirtschaftlichen Nutzen würde ich an den Gesamtkosten jeder Änderung messen, die dieselben Abnahmekriterien erfüllt. Solange nicht mehr akzeptierte Ergebnisse entstehen, belegen zusätzliche Stunden Modellaktivität noch keinen Effizienzgewinn.
Das Titelbild verwendet eine vorhandene Illustration von Agentensystemen dieser Website. Es zeigt weder die Architektur von Step 5 noch dessen Vorstellung; das Quellbild ließ sich wegen einer fehlgeschlagenen DNS-Auflösung nicht herunterladen.
Quellen:
Verwandte Artikel
OpenAI startet Dots: Dauerhafte Unterstützung darf nicht immer mehr Prüfarbeit erzeugen
OpenAI führt dots für berechtigte zahlende Nutzer ein. Hintergrundrecherche mit reinem Lesezugriff und begrenzte Gedächtniskontrollen machen versäumte Aufgaben und aufgelaufene Prüfarbeit zu aussagekräftigeren Maßstäben als bloße Aktivität.
NVIDIA erweitert Agentensicherheit: Laufzeitrechte garantieren keine korrekte Arbeit
NVIDIA startet seine Open Agent Safety Platform. OpenShell 0.1.0 setzt Datei-, Netzwerk- und Werkzeugrechte außerhalb des Modells durch. Das kann Fehler begrenzen; über 100 beteiligte Organisationen belegen jedoch weder Einsatzerfolge noch korrekte Arbeit.