ElevenLabs prezentuje modele mowy v4 z szybszym klonowaniem głosu i obsługą większej liczby języków
W poniedziałek ElevenLabs wprowadziło dwa nowe modele mowy: ElevenLabs v4 oraz v4 Turbo. Modele zapewniają większą kontrolę nad ekspresją głosu, mniejsze opóźnienia w przypadku agentów głosowych oraz obsługę ponad 90 języków.
Nowa architektura i szybsze klonowanie głosu
Po udostępnieniu w ubiegłym roku modelu v3 i zaprezentowaniu jego następcy podczas wydarzenia w Warszawie na początku tego roku ElevenLabs wprowadziło nową architekturę dla generacji v4. Ulepszona konstrukcja zapewnia bardziej precyzyjną kontrolę i szybsze klonowanie głosu, umożliwiając użytkownikom odtworzenie głosu na podstawie zaledwie 10 sekund nagrania.
Lepsza ekspresja i rozumienie kontekstu
W zastosowaniach kreatywnych v4 bardziej konsekwentnie zachowuje tożsamość głosu w dłuższych fragmentach. Podczas odczytywania tekstu na głos uwzględnia również jego kontekst, co pozwala na bardziej adekwatne zmiany ekspresji.
ElevenLabs wprowadziło w modelu v3 śródtekstowe znaczniki ekspresji. W wersji v4 funkcję tę rozszerzono, dzięki czemu użytkownicy mogą łączyć wiele znaczników, a model stosuje je kolejno.
Obsługa ponad 90 języków
Poprzedni model obsługiwał 70 języków, natomiast v4 rozszerza ich liczbę do ponad 90. Według ElevenLabs największą poprawę jakości odnotowano w przypadku języka japońskiego, brazylijskiej odmiany portugalskiego, mandaryńskiego i kantońskiego.
Mniejsze opóźnienia dla firmowych agentów głosowych
W ciągu ostatniego roku ElevenLabs szybko rozwinęło swoją działalność w zakresie połączeń dla firm, a duże przedsiębiorstwa odpowiadają obecnie za ponad 55% działalności firmy. Według ElevenLabs model v4 szczególnie dobrze sprawdza się w przypadku agentów głosowych, ponieważ mniejsze opóźnienia umożliwiają płynniejsze i bardziej naturalne rozmowy.
Model może rozpocząć generowanie dźwięku natychmiast po tym, jak bazowy duży model językowy zacznie tworzyć odpowiedź. Potrafi również różnie reagować na sytuacje konfliktowe, eskalacje i wstrzymanie rozmowy, wspierając skuteczniejsze rozwiązywanie problemów.
Rosnąca konkurencja w obszarze głosowej sztucznej inteligencji
Konkurencja na rynku modeli mowy nasiliła się, ponieważ startupy, takie jak Cartesia, Deepgram, Fish Audio, Boson i WellSaid Labs, opracowują coraz bardziej ekspresyjne systemy. Duże firmy technologiczne, takie jak Google i OpenAI, również nieustannie ulepszają swoje modele głosowe.
Finansowanie, wzrost przychodów i ekspansja
Na początku tego roku ElevenLabs pozyskało 500 mln USD w rundzie finansowania prowadzonej przez Sequoia, która wyceniła firmę na 11 mld USD. Od tego czasu pojawiły się pogłoski o kolejnej rundzie, która mogłaby podwoić jej wycenę do 22 mld USD.
Zannualizowane tempo przychodów firmy wzrosło z około 330 mln USD na początku roku do ponad 600 mln USD. ElevenLabs prowadziło również intensywną rekrutację na rynkach obejmujących Indie, Europę i Brazylię, zwiększając zatrudnienie do ponad 800 pracowników.
Potencjalne plany wejścia na giełdę
Współzałożyciel i dyrektor generalny Mati Staniszewski powiedział niedawno, że ElevenLabs planuje pierwszą ofertę publiczną “w ciągu najbliższych kilku lat”, nie podał jednak konkretnego terminu.