Kwotę 1 249,99 zł z faktury poprzedni model ElevenLabs przeczytał jako “milion dwieście czterdzieści dziewięć złoty”, a ElevenLabs v4, wydany 28 września 2026 roku, powiedział ją bezbłędnie, razem z groszami. Dzień po premierze przepuściliśmy przez cztery modele tej firmy siedem polskich zdań-pułapek: szumiące głoski, daty, skróty urzędowe, angielskie słowa w polskim zdaniu, odmianę nazwisk i tagi emocji. Poniżej są wyniki, nagrania do odsłuchania i ściąga tagów. Jest też sposób na angielskie nazwy, którego nie ma w dokumentacji, oraz koszt zrobienia lektora AI po polsku.
Co nowego w ElevenLabs v4 i v4 Turbo
ElevenLabs wypuściło jednocześnie dwa modele zamiany tekstu na mowę. Eleven v4 służy do nagrań: lektora do filmu, audiobooka, reklamy, dubbingu. Według producenta ma nową architekturę, która odczytuje ton, tempo i emocje z samego tekstu. Obsługuje ponad 90 języków, a poprzednik v3 obsługiwał ponad 70. Polski jest na oficjalnej liście. Jedna generacja mieści do 10 000 znaków, czyli około 10 minut nagrania.
Eleven v4 Turbo to wersja do rozmów na żywo, na przykład dla agenta głosowego na infolinii. Producent deklaruje około 150 milisekund do pierwszego dźwięku. Ta liczba nie obejmuje opóźnień sieci i aplikacji.
Najmocniejszym argumentem za v4 nie jest jednak materiał prasowy. W rankingu Artificial Analysis TTS Arena, gdzie słuchacze w ślepych porównaniach wybierają lepsze nagranie, v4 zajmował 29 września pierwsze miejsce z wynikiem 1315 punktów. Za nim były Cartesia Sonic 3.6 (1275) i Gemini 3.8 Flash TTS (1267). To niezależny pomiar i ważymy go wyżej niż badanie preferencji przeprowadzone przez samo ElevenLabs.
Dwie zmiany zaskoczą osoby, które znają starsze modele. Według dokumentacji Eleven v4 v4 nie obsługuje SSML, czyli znaczników typu <break> do sterowania pauzami i wymową. Z czterech suwaków ustawień głosu zostały dwa: stabilność i podobieństwo do głosu wzorcowego. Poprzedni model v3 nie został wycofany i nadal działa.
Jak ElevenLabs v4 mówi po polsku: nasz test na 28 nagraniach
Przygotowaliśmy siedem zdań, na których syntezatory mowy najczęściej się wykładają. Każde wygenerowaliśmy w czterech modelach: v4, v4 Turbo, v3 i starszym Multilingual v2. Użyliśmy tego samego gotowego głosu z biblioteki ElevenLabs. Każde nagranie przepuściliśmy przez rozpoznawanie mowy i porównaliśmy z tekstem wejściowym. Potem przesłuchaliśmy je jeszcze na ucho.
Liczby, grosze i skróty
| Zdanie testowe | v4 | v4 Turbo | v3 | Multilingual v2 |
|---|---|---|---|---|
| “Chrząszcz brzmi w trzcinie w Szczebrzeszynie…” | poprawnie | poprawnie | “bzimi” zamiast “brzmi” | poprawnie |
| Kwota 1 249,99 zł na fakturze | poprawnie, z groszami | poprawnie, z groszami | “milion dwieście…” | “jeden dwieście…”, bez groszy |
| “3,4 proc. r/r” | “rok do roku” | “rok do roku” | “rok do rok” | “trzy cztery procent r/r” |
| Odmiana nazwisk i miast | poprawnie | poprawnie | poprawnie | poprawnie |
| Tagi emocji w nawiasach | wykonane | wykonane | wykonane | przeczytane na głos |
| “n8n” w zwykłym zdaniu | źle | źle | źle | poprawnie |
Najpoważniejszy błąd zrobił v3. Agent, który czyta klientowi saldo i mówi “milion” zamiast “tysiąc”, generuje reklamację, a nie oszczędność. Multilingual v2 zgubił grosze i przeczytał skrót “r/r” jako dwie litery. v4 i Turbo przeszły wszystkie zdania z liczbami i skrótami bez błędu.
Nagrania do porównania
Tak brzmi to samo zdanie z fakturą w v4 i w v3:
Na ucho v4 i Turbo brzmią naturalnie, z polską intonacją. Głos z biblioteki jest opisany jako amerykański, a mimo to po polsku nie słychać obcego akcentu. Zgadza się to z dokumentacją, według której v4 celowo mówi w każdym języku z natywnym akcentem. To jeden głos i jeden przebieg, więc traktujcie test jako próbkę, nie benchmark.
Agenci AI · Kodożercy
Zbuduj agenta, który wykonuje zadania za Ciebie
Kurs Agenci AI od Kodożerców prowadzi przez pięciu agentów zbudowanych w n8n: bibliotekarza odpowiadającego na pytania z Twoich dokumentów, asystenta proszącego o zgodę przed ważnym krokiem, badacza, inżyniera i łącznika spinającego narzędzia przez MCP. Kod, tam gdzie jest potrzebny, pisze Claude pod Twoim nadzorem.
Zobacz program kursu →
Jak zrobić lektora AI w ElevenLabs krok po kroku
Najprostsza droga prowadzi przez aplikację w przeglądarce i nie wymaga żadnego kodu:
- Załóż konto na elevenlabs.io. Darmowy plan wystarczy do testów, ale nie do zastosowań komercyjnych.
- Otwórz moduł zamiany tekstu na mowę i wybierz z listy model Eleven v4.
- Wybierz głos z biblioteki. Gotowe głosy mówią po polsku, nawet jeśli w opisie mają inny język.
- Wklej tekst. Jedna generacja przyjmie do 10 000 znaków.
- Dodaj tagi emocji tam, gdzie zmienia się ton (ściąga w następnej sekcji). Przycisk Enhance zrobi to automatycznie przy pomocy modelu językowego.
- Ustaw stabilność. Niższa daje żywszą, bardziej zmienną interpretację. Wyższa trzyma równy ton, lepszy do instrukcji i komunikatów.
- Wygeneruj, odsłuchaj i pobierz plik MP3.
Do automatyzacji, na przykład w n8n albo własnym skrypcie, służy API. Wystarczy podać identyfikator modelu eleven_v4 albo eleven_v4_turbo:
curl -X POST "https://api.elevenlabs.io/v1/text-to-speech/ID_GŁOSU" \
-H "xi-api-key: TWÓJ_KLUCZ" \
-H "Content-Type: application/json" \
-d '{"text": "Dzień dobry, tu asystent obsługi klienta.", "model_id": "eleven_v4"}' \
--output nagranie.mp3
Jedna rada z testu: klucz API w ElevenLabs można ograniczyć do wybranych uprawnień. Nasz testowy klucz nie mógł na przykład tworzyć słowników wymowy. Przy pracy z automatyzacją lepiej wiedzieć o tym wcześniej niż w połowie przepływu.
Tagi emocji w ElevenLabs: szept, śmiech i pauza
Tag to krótka instrukcja w nawiasie kwadratowym, wstawiona w miejscu, gdzie zmienia się sposób mówienia. Tagi piszemy po angielsku, także w polskim tekście. W naszym teście zdanie “[whispers] Nie mów nikomu, ale jutro wychodzi nowa wersja. [pause] [excited] I jest naprawdę świetna! [laughs]” zabrzmiało dokładnie tak, jak było zapisane:
| Rodzaj | Przykładowe tagi | Uwagi |
|---|---|---|
| Głos i emocje | [whispers] [laughs] [sighs] [exhales] [excited] [curious] [sarcastic] [crying] | najpewniejsze działanie |
| Pauzy | [pause] [long pause] | zamiast znacznika <break>, którego v4 nie obsługuje |
| Efekty dźwiękowe | [applause] [clapping] [explosion] [gunshot] | działają w v4 lepiej niż w v3 |
| Eksperymentalne | [sings] [strong X accent] | wynik zależy od głosu |
Lista nie jest zamknięta. Według poradnika ElevenLabs model rozumie też opisowe polecenia w rodzaju [Low, steady voice, restrained urgency]. Do tego dochodzi interpunkcja: wielokropek dodaje pauzę i ciężar, a WIELKIE LITERY dodają nacisk.
Dwie pułapki warto znać. Tag musi pasować do głosu, bo spokojny lektor od medytacji nie zachichocze na komendę. Druga dotyczy migracji: Multilingual v2 nie rozumie tagów i czyta je na głos. W naszym teście powiedział “No whispers… Pulse excited… Laughs”. Przed użyciem tekstu z v4 w starszym modelu trzeba więc usunąć całe tagi, razem ze słowami w nawiasach.
Jak ElevenLabs czyta angielskie nazwy: polski cudzysłów działa, myślniki nie
Jedyną wpadką v4 w teście była nazwa narzędzia n8n. W zdaniu “Odpal workflow w n8n i sprawdź, czy API zwraca poprawny JSON” model powiedział coś w rodzaju “enejdżemej”. Pozostałe angielskie słowa, czyli prompt, workflow, API i JSON, przeczytał poprawnie.
Sprawdziliśmy więc siedem sposobów zapisu tej samej nazwy w zdaniu “Odpal workflow w … i sprawdź wynik”:
| Zapis w tekście | Wynik w v4 (odsłuch) |
|---|---|
| polski cudzysłów: dolny na początku, górny na końcu | poprawnie |
| prosty cudzysłów z klawiatury | “wu en osiem en”: przyimek “w” czytany jak litera |
| apostrofy | zgubione litery |
| n-8-n | model czyta na głos słowo “myślnik” |
| n-eight-n | źle |
| en-ejt-en | źle |
| en osiem en | źle |
Zadziałał wyłącznie polski cudzysłów, ten sam, którego używa się w wydrukach. Prosty cudzysłów z klawiatury, który wpisuje się odruchowo, też nie pomógł: model przeczytał nazwę jako “en osiem en”, a przyimek “w” jak nazwę litery. Nasze przypuszczenie jest takie, że polski cudzysłów sygnalizuje modelowi nazwę własną w polskim zdaniu. Tak wygląda zapis, który zadziałał:
Odpal workflow w „n8n” i sprawdź wynik.
Posłuchajcie różnicy:
Oficjalne metody są dwie. Pierwsza to zapis fonetyczny w alfabecie IPA, wpisany wprost w tekst między ukośnikami. Druga to słownik wymowy, w którym raz ustawiasz regułę dla nazwy n8n i działa ona w każdym nagraniu. Reguły typu alias działają we wszystkich modelach, a reguły fonetyczne tylko w v4, v3 i Flash v2. Słownika nie przetestowaliśmy, bo testowy klucz API nie miał do niego uprawnień. Przy dłuższych projektach to właściwa droga. Cudzysłów jest szybkim obejściem na pojedyncze zdania.
Klonowanie głosu AI po polsku w v4: 10 sekund czy minuta?
Na stronie premiery ElevenLabs pisze, że v4 sklonuje głos z 10 sekund nagrania. Instrukcja klonowania mówi co innego: nagraj co najmniej minutę, najlepiej jedną do dwóch minut. Traktujemy 10 sekund jako najlepszy możliwy przypadek, a do pracy przyjmujemy wartości z dokumentacji. v4 kopiuje głos wierniej niż poprzednicy, razem z szumem tła i trzaskami mikrofonu. Jakość nagrania źródłowego ma więc większe znaczenie niż wcześniej.
Klon profesjonalny wymaga co najmniej 30 minut nagrań, a zalecane są 2-3 godziny. W v3 nie działał, w v4 wrócił. Sklonować w ten sposób można tylko własny głos, po weryfikacji głosowej. Każdy klon w v4, szybki i profesjonalny, wymaga potwierdzonej zgody właściciela głosu. Klony zrobione na starszych modelach trzeba przeszkolić pod v4. Gdzie kończy się legalne klonowanie głosu i jak rozpoznać oszustwo z jego użyciem, piszemy w tekście klonowanie głosu AI: jak działa i jak się nie nabrać.
Jedna zmiana może zdziwić osoby, które klonują głos do kilku języków. Klon nagrany po angielsku, który mówi po polsku, dostanie polski akcent, a nie angielski. ElevenLabs nazywa to celową zmianą i na razie nie da się jej wyłączyć. Klonowania nie obejmował nasz test, więc opieramy się tu wyłącznie na dokumentacji.
Ile kosztuje ElevenLabs v4
W aplikacji v4 kosztuje tyle samo co inne modele: jeden znak tekstu to jeden kredyt. Plan wybiera się więc według tego, ile nagrań potrzebujesz miesięcznie:
| Plan | Cena miesięcznie | Kredyty | Co daje |
|---|---|---|---|
| Free | 0 $ | 10 000 | tylko użytek prywatny |
| Starter | 6 $ | 30 000 | licencja komercyjna, szybkie klonowanie |
| Creator | 22 $ (pierwszy miesiąc 11 $) | 121 000 | klon profesjonalny |
| Pro | 99 $ | 600 000 | wyższa jakość plików w API |
Jak to przełożyć na minuty? Skoro 10 000 znaków to około 10 minut mowy, plan Creator wystarcza na mniej więcej dwie godziny nagrań miesięcznie. W podstawowym teście wysłaliśmy w 28 generacjach łącznie około 2 800 znaków tekstu, czyli na darmowym planie zmieścilibyśmy go trzy razy.
W API cena jest liczona od tysiąca znaków. Wynosi 0,08 dolara dla v4 i 0,04 dolara dla Turbo. Do 12 października 2026 roku cennik API podaje promocję z rabatem 72%. Od planu Creator w aplikacji przez dwa tygodnie część kredytów zużytych na v4 nie jest liczona.
v4 czy v4 Turbo: który model do agenta głosowego
Do nagrań, które ktoś odsłucha później, wybierz v4. Do rozmowy, w której człowiek czeka na odpowiedź, wybierz Turbo. W naszym teście oba modele dały identyczną poprawność, a różniły się czasem.
Zmierzyliśmy czas od wysłania zapytania z Polski do otrzymania pierwszego fragmentu dźwięku. Turbo odpowiadał zwykle po 0,2-0,6 sekundy, raz po 1,2 sekundy. v4 potrzebował od 0,8 do 2 sekund. Deklarowane przez producenta 150 milisekund nie obejmuje sieci, a my mierzyliśmy razem z nią i przez zwykłe zapytanie HTTP, nie przez WebSocket. W rozmowie przez telefon różnica między 0,3 a 1 sekundą ciszy jest wyraźnie słyszalna.
Tak właśnie działa agent głosowy na infolinii Allegro Delivery, zbudowany na platformie ElevenLabs. Jeśli liczy się koszt, a nie ekspresja, warto porównać wyniki z tańszymi modelami. Opisywaliśmy na przykład Voxtral TTS od Mistrala, którego można użyć w n8n.
Agent AI, który pracuje na danych Twojej firmy
Budujemy agentów, którzy odpowiadają klientom, czytają dokumenty i przygotowują raporty, podłączonych do Waszych systemów. Zaczynamy od jednego procesu i sprawdzamy efekt, zanim pójdziemy dalej.
FAQ: najczęstsze pytania o nowy model
Czy ElevenLabs v4 jest za darmo?
Tak, v4 działa także na darmowym planie z 10 000 kredytów miesięcznie, czyli około 10 minutami nagrań. Darmowy plan pozwala jednak tylko na użytek prywatny. Nagrania do filmu firmowego, reklamy czy kursu wymagają co najmniej planu Starter za 6 dolarów.
Czy Eleven v3 nadal działa?
Tak, v3 nie został wycofany i można go dalej wybierać w aplikacji i w API. Sam producent zaleca przejście na v4, ale uprzedza, że nowy model może brzmieć zupełnie inaczej. Projekty z dopracowanym brzmieniem warto przed migracją porównać na kilku próbkach.
Czy ElevenLabs v4 obsługuje SSML?
Nie. Znaczniki SSML, w tym <break> do pauz, są w v4 wyłączone. Pauzy ustawia się tagiem [pause] albo wielokropkiem. Wymowę trudnych słów poprawia się zapisem IPA między ukośnikami albo słownikiem wymowy.
Jak sprawić, żeby ElevenLabs dobrze czytał angielskie nazwy po polsku?
W naszym teście pomógł wyłącznie polski cudzysłów, dolny na początku i górny na końcu nazwy. Prosty cudzysłów z klawiatury, apostrofy, myślniki i zapis fonetyczny literami nie pomogły. Przy nazwach, które powtarzają się w wielu nagraniach, lepszy jest słownik wymowy z regułą typu alias.
Podsumowanie
Na polskich zdaniach ElevenLabs v4 wyraźnie wygrał z poprzednikami. W naszym teście poprawnie przeczytał kwotę z groszami i skrót “r/r”, z którymi v3 i Multilingual v2 miały problemy. Tagi emocji działają także w polskim tekście, choć pisze się je po angielsku. Tekst przygotowany pod v4 nie nadaje się jednak do starszego v2, który czyta tagi na głos. Słabym punktem zostają angielskie nazwy wplecione w polskie zdanie. Przy nazwie n8n pomógł polski cudzysłów, ale inne nazwy trzeba sprawdzić odsłuchem, a przy większych projektach lepszy będzie słownik wymowy. Do nagrań wybierz v4, do rozmów na żywo Turbo, a przy klonowaniu głosu przyjmij z dokumentacji minutę nagrania zamiast 10 sekund z materiałów premierowych. Tanie ceny w API obowiązują do 12 października, więc na własne testy jest jeszcze niecałe dwa tygodnie.
Newsletter · DevstockAcademy & Kodożercy
Bądź na bieżąco ze światem IT, AI i automatyzacji
Co wtorek: newsy z branży, praktyczne tipy i narzędzia które warto znać. Zero spamu.



