Konto ElevenLabs z dożywotnią subskrypcją
Zadowolony
ElevenLabs prezentuje modele mowy v4 z szybszym klonowaniem głosu i obsługą większej liczby języków
Nowa architektura i szybsze klonowanie głosu
Lepsza ekspresja i rozumienie kontekstu
Obsługa ponad 90 języków
Mniejsze opóźnienia dla firmowych agentów głosowych
Rosnąca konkurencja w obszarze głosowej sztucznej inteligencji
Finansowanie, wzrost przychodów i ekspansja
Potencjalne plany wejścia na giełdę
Model mowy ElevenLabs v4 zapewnia większą kontrolę nad ekspresją i obsługuje 90 języków
Czas: Sep, 28, 2026

ElevenLabs prezentuje modele mowy v4 z szybszym klonowaniem głosu i obsługą większej liczby języków

W poniedziałek ElevenLabs wprowadziło dwa nowe modele mowy: ElevenLabs v4 oraz v4 Turbo. Modele zapewniają większą kontrolę nad ekspresją głosu, mniejsze opóźnienia w przypadku agentów głosowych oraz obsługę ponad 90 języków.

Nowa architektura i szybsze klonowanie głosu

Po udostępnieniu w ubiegłym roku modelu v3 i zaprezentowaniu jego następcy podczas wydarzenia w Warszawie na początku tego roku ElevenLabs wprowadziło nową architekturę dla generacji v4. Ulepszona konstrukcja zapewnia bardziej precyzyjną kontrolę i szybsze klonowanie głosu, umożliwiając użytkownikom odtworzenie głosu na podstawie zaledwie 10 sekund nagrania.

Lepsza ekspresja i rozumienie kontekstu

W zastosowaniach kreatywnych v4 bardziej konsekwentnie zachowuje tożsamość głosu w dłuższych fragmentach. Podczas odczytywania tekstu na głos uwzględnia również jego kontekst, co pozwala na bardziej adekwatne zmiany ekspresji.

ElevenLabs wprowadziło w modelu v3 śródtekstowe znaczniki ekspresji. W wersji v4 funkcję tę rozszerzono, dzięki czemu użytkownicy mogą łączyć wiele znaczników, a model stosuje je kolejno.

Obsługa ponad 90 języków

Poprzedni model obsługiwał 70 języków, natomiast v4 rozszerza ich liczbę do ponad 90. Według ElevenLabs największą poprawę jakości odnotowano w przypadku języka japońskiego, brazylijskiej odmiany portugalskiego, mandaryńskiego i kantońskiego.

Mniejsze opóźnienia dla firmowych agentów głosowych

W ciągu ostatniego roku ElevenLabs szybko rozwinęło swoją działalność w zakresie połączeń dla firm, a duże przedsiębiorstwa odpowiadają obecnie za ponad 55% działalności firmy. Według ElevenLabs model v4 szczególnie dobrze sprawdza się w przypadku agentów głosowych, ponieważ mniejsze opóźnienia umożliwiają płynniejsze i bardziej naturalne rozmowy.

Model może rozpocząć generowanie dźwięku natychmiast po tym, jak bazowy duży model językowy zacznie tworzyć odpowiedź. Potrafi również różnie reagować na sytuacje konfliktowe, eskalacje i wstrzymanie rozmowy, wspierając skuteczniejsze rozwiązywanie problemów.

Rosnąca konkurencja w obszarze głosowej sztucznej inteligencji

Konkurencja na rynku modeli mowy nasiliła się, ponieważ startupy, takie jak Cartesia, Deepgram, Fish Audio, Boson i WellSaid Labs, opracowują coraz bardziej ekspresyjne systemy. Duże firmy technologiczne, takie jak Google i OpenAI, również nieustannie ulepszają swoje modele głosowe.

Finansowanie, wzrost przychodów i ekspansja

Na początku tego roku ElevenLabs pozyskało 500 mln USD w rundzie finansowania prowadzonej przez Sequoia, która wyceniła firmę na 11 mld USD. Od tego czasu pojawiły się pogłoski o kolejnej rundzie, która mogłaby podwoić jej wycenę do 22 mld USD.

Zannualizowane tempo przychodów firmy wzrosło z około 330 mln USD na początku roku do ponad 600 mln USD. ElevenLabs prowadziło również intensywną rekrutację na rynkach obejmujących Indie, Europę i Brazylię, zwiększając zatrudnienie do ponad 800 pracowników.

Potencjalne plany wejścia na giełdę

Współzałożyciel i dyrektor generalny Mati Staniszewski powiedział niedawno, że ElevenLabs planuje pierwszą ofertę publiczną “w ciągu najbliższych kilku lat”, nie podał jednak konkretnego terminu.

Live Chat
0