Eine neue Modellgeneration für Sprache
Mit Eleven v4 bringt ElevenLabs eine neu gebaute Modellgeneration für Text-to-Speech. Das Modell soll Tonfall, Tempo und Emotion stärker aus dem Text ableiten und dabei die Stimme des Sprechers stabil halten. Die Zahl der unterstützten Sprachen steigt von rund 70 bei v3 auf mehr als 90.
Daneben steht Eleven v4 Turbo, gebaut für Sprachagenten und Echtzeit-Anwendungen. ElevenLabs nennt eine mittlere Latenz von etwa 100 ms. Beide Modelle sind seit dem 28. September in ElevenAgents, ElevenCreative und über die API verfügbar, auch im kostenlosen Tarif.
Was Teams wissen müssen:
- Eleven v4 ist das Modell für Qualität: Hörbücher, Erklärvideos, Schulungen, Werbung.
- v4 Turbo ist das Modell für Gespräche: Telefon-Bots, Support-Agenten, Sprachsteuerung.
- Instant Voice Clones sollen schon aus rund 10 Sekunden Audio eine Stimme gut treffen.
Neue Modelle für ElevenAgents
Die Agenten-Plattform bekommt eine längere Liste an Sprachmodellen, die hinter dem Gespräch die Antworten formulieren. Neu dabei sind unter anderem gpt-6-sol, gpt-6-luna, claude-opus-5, claude-opus-5-5, glm-52 und deepseek-v41-flash.
Für die Kostenplanung hilfreich: Testläufe eines Agenten zeigen jetzt die verbrauchten Credits und den Preis in US-Dollar an. Wer einen Agenten vor dem Livegang durchtestet, sieht also direkt, was ein typisches Gespräch kostet, und kann das Modell danach wählen. Ein großes Modell wie Claude Opus lohnt sich vor allem bei komplexen Beratungsgesprächen, für einfache Terminabfragen reicht meist ein kleines.
Transkripte per Anweisung korrigieren
Speech to Text kann ein fertiges Transkript jetzt per Anweisung in natürlicher Sprache überarbeiten, mit bis zu 2.000 Zeichen. In der API heißt der Parameter transcript_edit, das Ergebnis steht im Feld edited_transcript. Typische Fälle sind Fachbegriffe, Produktnamen oder Personennamen, die die Erkennung falsch schreibt.
Auch Text to Dialogue legt zu: Über vorherigen und folgenden Text sowie Request-IDs klingen aufeinanderfolgende Abschnitte zusammenhängender. Ein neuer Modus erlaubt es, professionelle Stimmklone wie Instant Clones zu verwenden (use_pvc_as_ivc).
Was Admins beachten sollten
- Gleichzeitige Anfragen: Für Enterprise-API-Keys gibt es jetzt Limits für parallele Anfragen bei Sprache, Musik und Dubbing. Wer große Batches verarbeitet, sollte die eigenen Grenzen prüfen.
- Veraltete Felder: Die Modell-Felder
max_characters_request_free_userundmax_characters_request_subscribed_usersind abgekündigt. Eigene Integrationen, die darauf zugreifen, sollten umgestellt werden. - SDKs: Die neuen Funktionen stecken in den SDKs für JavaScript und Python ab Version
2.70.0.
Datenschutz bleibt ein Thema: ElevenLabs sitzt in den USA. Bei Stimmklonen von Mitarbeitenden brauchst du eine schriftliche Einwilligung, und Kundengespräche mit Sprachagenten gehören in die Datenschutz-Folgenabschätzung.
Fazit
Eleven v4 ist vor allem für Teams interessant, die Sprache in mehreren Sprachen produzieren oder Sprachagenten betreiben. Ein schneller Test lohnt sich: dieselben fünf bis zehn Texte mit v3 und v4 erzeugen und im Team blind vergleichen. Für Agenten-Projekte gilt, die neue Kostenanzeige zu nutzen, bevor das Sprachmodell festgelegt wird.