Zum Inhalt springen
Zurück zu Updates
27. September 2026
Tool Updatevon Claudius Neidig

Ember-1 im Vercel AI Gateway: Kimi K3 mit rund 40 % weniger Tokens

Vercel hat am 27. September 2026 Ember-1 von Fireworks ins AI Gateway aufgenommen. Das Reasoning-Modell basiert auf Kimi K3 und soll bei gleicher Qualität rund 40 Prozent weniger Tokens erzeugen. Für Coding-Agenten, die viele Schritte durchlaufen, ist das vor allem eine Kostenfrage.

Was Ember-1 ist

Ember-1 ist ein Reasoning-Modell von Fireworks Research, gebaut auf dem offenen Modell Kimi K3 von Moonshot AI. Seit dem 27. September 2026 steht es als Research Preview im Vercel AI Gateway bereit, unter der Kennung fireworks/ember-1.

Fireworks hat Kimi K3 nachtrainiert, damit das Modell weniger repetitiv „nachdenkt“. Laut Anbieter liefert Ember-1 vergleichbare Qualität mit etwa 40 Prozent weniger erzeugten Tokens. In einem A/B-Test auf echtem Coding-Traffic sanken die Reasoning-Tokens um 71 Prozent, die Gesamt-Tokens um 39 Prozent, bei gleicher Erfolgsquote.


Die Eckdaten

  • Kontextfenster: rund 1 Million Tokens
  • Eingaben: Text und Bilder, dazu Tool-Calling und implizites Prompt-Caching
  • Preis im AI Gateway: 3 US-Dollar pro Million Input-Tokens, 15 US-Dollar pro Million Output-Tokens
  • Status: Research Preview, zunächst für ein Zeitfenster von zwei Wochen angekündigt

Wer das AI SDK nutzt, tauscht nur den Modellnamen aus. Über die OpenAI-kompatible Schnittstelle genügt es, die Basis-URL auf das Gateway zu setzen. Für Coding-Agenten wie Claude Code oder Codex richtet npx vercel ai-gateway setup den Zugang ein, danach lässt sich Ember-1 per /model auswählen.


Warum weniger Tokens mehr bringen, als es klingt

Bei Reasoning-Modellen entfällt ein großer Teil der Ausgabe auf den Denkprozess. In einem Agenten-Workflow wird dieser Verlauf in jedem weiteren Schritt erneut mitgelesen. Ein Agent, der zwanzig Tool-Aufrufe braucht, zahlt die langen Denkspuren also nicht einmal, sondern immer wieder, und füllt nebenbei sein Kontextfenster.

Genau dort setzt Ember-1 an. Der Listenpreis pro Token ist nicht niedrig, die Ersparnis entsteht über die Menge. Ob sie im eigenen Einsatz ankommt, hängt davon ab, wie viel Reasoning die Aufgaben tatsächlich brauchen.


Was Teams beachten sollten

Eine Research Preview ist kein Produktionsmodell. Verfügbarkeit, Preis und Verhalten können sich ändern, und das angekündigte Zwei-Wochen-Fenster spricht eher für einen Test als für einen Dauerbetrieb. Außerdem stammen die Benchmark-Zahlen vom Anbieter selbst.

Sinnvoll ist ein Vergleich an den eigenen Aufgaben: dieselben zehn bis zwanzig typischen Agenten-Läufe mit dem bisherigen Modell und mit Ember-1, gemessen an Erfolgsquote, Tokens und Laufzeit. Das AI Gateway macht diesen Wechsel einfach, weil sich nur der Modellname ändert.


Fazit

Ember-1 ist ein interessanter Kandidat für Teams, deren Coding-Agenten vor allem an den Token-Kosten scheitern. Für den produktiven Einsatz ist es noch zu früh. Für einen kurzen, gemessenen Vergleich lohnt sich der Test, solange die Preview läuft.

Diese Website verwendet Cookies. Notwendige Cookies sind immer aktiv. Analyse-Cookies (PostHog) helfen mir anonym zu verstehen, welche Inhalte hilfreich sind.