ElevenLabs-Konto mit lebenslangem Abonnement
Inhalt
ElevenLabs präsentiert v4-Sprachmodelle mit schnellerem Voice Cloning und breiterer Sprachunterstützung
Neue Architektur und schnelleres Voice Cloning
Verbesserter Ausdruck und besseres Kontextverständnis
Unterstützung für mehr als 90 Sprachen
Geringere Latenz für Sprachagenten in Unternehmen
Wachsender Wettbewerb im Bereich Sprach-KI
Finanzierung, Umsatzwachstum und Expansion
Mögliche Börsenpläne
ElevenLabs-Sprachmodell v4 bietet mehr Kontrolle über den Ausdruck und unterstützt 90 Sprachen
Zeit: Sep, 28, 2026

ElevenLabs präsentiert v4-Sprachmodelle mit schnellerem Voice Cloning und breiterer Sprachunterstützung

ElevenLabs hat am Montag zwei neue Sprachmodelle auf den Markt gebracht: ElevenLabs v4 und v4 Turbo. Die Modelle bieten eine bessere Kontrolle über den stimmlichen Ausdruck, eine geringere Latenz für Sprachagenten und Unterstützung für mehr als 90 Sprachen.

Neue Architektur und schnelleres Voice Cloning

Nach der Veröffentlichung seines v3-Modells im vergangenen Jahr und einer Vorschau auf dessen Nachfolger bei einer Veranstaltung in Warschau Anfang dieses Jahres hat ElevenLabs eine neue Architektur für die v4-Generation eingeführt. Das überarbeitete Design ermöglicht eine präzisere Steuerung und schnelleres Voice Cloning, sodass Nutzer eine Stimme anhand von nur 10 Sekunden Audiomaterial nachbilden können.

Verbesserter Ausdruck und besseres Kontextverständnis

Bei kreativen Anwendungen bewahrt v4 die Identität einer Stimme über längere Passagen hinweg konsistenter. Das Modell berücksichtigt beim Vorlesen außerdem den Textkontext und ermöglicht dadurch passendere Veränderungen des Ausdrucks.

ElevenLabs führte mit v3 Inline-Tags für den Ausdruck ein. In v4 wurde diese Funktion erweitert, sodass Nutzer mehrere Tags kombinieren können, die das Modell der Reihe nach befolgt.

Unterstützung für mehr als 90 Sprachen

Das vorherige Modell unterstützte 70 Sprachen, während v4 die Abdeckung auf mehr als 90 erweitert. Laut ElevenLabs wurden die größten Qualitätsverbesserungen bei Japanisch, brasilianischem Portugiesisch, Mandarin und Kantonesisch erzielt.

Geringere Latenz für Sprachagenten in Unternehmen

ElevenLabs hat sein Geschäft mit Anruflösungen für Unternehmen im vergangenen Jahr rasch ausgebaut. Großunternehmen machen inzwischen mehr als 55 % des Geschäfts aus. Nach Angaben des Unternehmens eignet sich v4 besonders gut für Sprachagenten, da die geringere Latenz flüssigere und natürlichere Gespräche ermöglicht.

Das Modell kann mit der Audioausgabe beginnen, sobald das zugrunde liegende große Sprachmodell eine Antwort generiert. Es kann zudem unterschiedlich auf Konfrontationen, Eskalationen und Warteschleifen reagieren und so eine effektivere Problemlösung unterstützen.

Wachsender Wettbewerb im Bereich Sprach-KI

Der Wettbewerb auf dem Markt für Sprachmodelle hat sich verschärft, da Start-ups wie Cartesia, Deepgram, Fish Audio, Boson und WellSaid Labs zunehmend ausdrucksstarke Systeme entwickeln. Auch große Technologieunternehmen wie Google und OpenAI haben ihre Sprachmodelle kontinuierlich verbessert.

Finanzierung, Umsatzwachstum und Expansion

Anfang dieses Jahres nahm ElevenLabs in einer von Sequoia angeführten Finanzierungsrunde 500 Millionen US-Dollar auf, bei der das Unternehmen mit 11 Milliarden US-Dollar bewertet wurde. Seitdem sind Gerüchte über eine weitere Finanzierungsrunde aufgekommen, durch die sich die Bewertung auf 22 Milliarden US-Dollar verdoppeln könnte.

Der auf Jahresbasis hochgerechnete Umsatz des Unternehmens ist von rund 330 Millionen US-Dollar zu Jahresbeginn auf mehr als 600 Millionen US-Dollar gestiegen. ElevenLabs hat zudem in Märkten wie Indien, Europa und Brasilien umfangreich neue Mitarbeiter eingestellt und seine Belegschaft auf mehr als 800 Beschäftigte vergrößert.

Mögliche Börsenpläne

Mitgründer und CEO Mati Staniszewski erklärte kürzlich, dass ElevenLabs einen Börsengang „in den kommenden Jahren“ anstrebe, nannte jedoch keinen konkreten Zeitplan.

Live Chat
0