Skip to content
KURS: Agenci AI od podstaw
zbuduj zespół cyfrowych pomocników
Sprawdzam
KURS: Agenci AI
Sprawdzam
logo Devstock
  • O nas
  • Moduły Akademii
    • Moduł 1
    • Moduł 2
    • Moduł 3
    • Pozostałe moduły
  • Kursy AI i IT
    • Pierwsza Misja AI (Podstawy)
    • Automatyzacje z n8n 2.0
    • Frontend Master 2026
  • Blog
  • Kontakt
  • O nas
  • Moduły Akademii
    • Moduł 1
    • Moduł 2
    • Moduł 3
    • Pozostałe moduły
  • Kursy AI i IT
    • Pierwsza Misja AI (Podstawy)
    • Automatyzacje z n8n 2.0
    • Frontend Master 2026
  • Blog
  • Kontakt
Kurs Pierwsza Misja AI - banner reklamowy
Narzędzia i Automatyzacja

ElevenLabs v4 po polsku: test i poradnik lektora AI

  • 29 wrz, 2026
  • Komentarze 0
ElevenLabs v4 po polsku - model zamiany tekstu na mowę jako lektor AI

Kwotę 1 249,99 zł z faktury poprzedni model ElevenLabs przeczytał jako “milion dwieście czterdzieści dziewięć złoty”, a ElevenLabs v4, wydany 28 września 2026 roku, powiedział ją bezbłędnie, razem z groszami. Dzień po premierze przepuściliśmy przez cztery modele tej firmy siedem polskich zdań-pułapek: szumiące głoski, daty, skróty urzędowe, angielskie słowa w polskim zdaniu, odmianę nazwisk i tagi emocji. Poniżej są wyniki, nagrania do odsłuchania i ściąga tagów. Jest też sposób na angielskie nazwy, którego nie ma w dokumentacji, oraz koszt zrobienia lektora AI po polsku.

Co nowego w ElevenLabs v4 i v4 Turbo

ElevenLabs wypuściło jednocześnie dwa modele zamiany tekstu na mowę. Eleven v4 służy do nagrań: lektora do filmu, audiobooka, reklamy, dubbingu. Według producenta ma nową architekturę, która odczytuje ton, tempo i emocje z samego tekstu. Obsługuje ponad 90 języków, a poprzednik v3 obsługiwał ponad 70. Polski jest na oficjalnej liście. Jedna generacja mieści do 10 000 znaków, czyli około 10 minut nagrania.

Eleven v4 Turbo to wersja do rozmów na żywo, na przykład dla agenta głosowego na infolinii. Producent deklaruje około 150 milisekund do pierwszego dźwięku. Ta liczba nie obejmuje opóźnień sieci i aplikacji.

Najmocniejszym argumentem za v4 nie jest jednak materiał prasowy. W rankingu Artificial Analysis TTS Arena, gdzie słuchacze w ślepych porównaniach wybierają lepsze nagranie, v4 zajmował 29 września pierwsze miejsce z wynikiem 1315 punktów. Za nim były Cartesia Sonic 3.6 (1275) i Gemini 3.8 Flash TTS (1267). To niezależny pomiar i ważymy go wyżej niż badanie preferencji przeprowadzone przez samo ElevenLabs.

Dwie zmiany zaskoczą osoby, które znają starsze modele. Według dokumentacji Eleven v4 v4 nie obsługuje SSML, czyli znaczników typu <break> do sterowania pauzami i wymową. Z czterech suwaków ustawień głosu zostały dwa: stabilność i podobieństwo do głosu wzorcowego. Poprzedni model v3 nie został wycofany i nadal działa.

Jak ElevenLabs v4 mówi po polsku: nasz test na 28 nagraniach

Przygotowaliśmy siedem zdań, na których syntezatory mowy najczęściej się wykładają. Każde wygenerowaliśmy w czterech modelach: v4, v4 Turbo, v3 i starszym Multilingual v2. Użyliśmy tego samego gotowego głosu z biblioteki ElevenLabs. Każde nagranie przepuściliśmy przez rozpoznawanie mowy i porównaliśmy z tekstem wejściowym. Potem przesłuchaliśmy je jeszcze na ucho.

Liczby, grosze i skróty

Zdanie testowev4v4 Turbov3Multilingual v2
“Chrząszcz brzmi w trzcinie w Szczebrzeszynie…”poprawniepoprawnie“bzimi” zamiast “brzmi”poprawnie
Kwota 1 249,99 zł na fakturzepoprawnie, z groszamipoprawnie, z groszami“milion dwieście…”“jeden dwieście…”, bez groszy
“3,4 proc. r/r”“rok do roku”“rok do roku”“rok do rok”“trzy cztery procent r/r”
Odmiana nazwisk i miastpoprawniepoprawniepoprawniepoprawnie
Tagi emocji w nawiasachwykonanewykonanewykonaneprzeczytane na głos
“n8n” w zwykłym zdaniuźleźleźlepoprawnie

Najpoważniejszy błąd zrobił v3. Agent, który czyta klientowi saldo i mówi “milion” zamiast “tysiąc”, generuje reklamację, a nie oszczędność. Multilingual v2 zgubił grosze i przeczytał skrót “r/r” jako dwie litery. v4 i Turbo przeszły wszystkie zdania z liczbami i skrótami bez błędu.

Nagrania do porównania

Tak brzmi to samo zdanie z fakturą w v4 i w v3:

Eleven v4: numer faktury, kwota 1 249,99 zł i termin płatności przeczytane poprawnie.
Eleven v3: to samo zdanie, kwota przeczytana jako “milion dwieście czterdzieści dziewięć złoty”.

Na ucho v4 i Turbo brzmią naturalnie, z polską intonacją. Głos z biblioteki jest opisany jako amerykański, a mimo to po polsku nie słychać obcego akcentu. Zgadza się to z dokumentacją, według której v4 celowo mówi w każdym języku z natywnym akcentem. To jeden głos i jeden przebieg, więc traktujcie test jako próbkę, nie benchmark.

Agenci AI · Kodożercy

Zbuduj agenta, który wykonuje zadania za Ciebie

Kurs Agenci AI od Kodożerców prowadzi przez pięciu agentów zbudowanych w n8n: bibliotekarza odpowiadającego na pytania z Twoich dokumentów, asystenta proszącego o zgodę przed ważnym krokiem, badacza, inżyniera i łącznika spinającego narzędzia przez MCP. Kod, tam gdzie jest potrzebny, pisze Claude pod Twoim nadzorem.

Zobacz program kursu →
Kurs Agenci AI - Kodożercy

Jak zrobić lektora AI w ElevenLabs krok po kroku

Najprostsza droga prowadzi przez aplikację w przeglądarce i nie wymaga żadnego kodu:

  1. Załóż konto na elevenlabs.io. Darmowy plan wystarczy do testów, ale nie do zastosowań komercyjnych.
  2. Otwórz moduł zamiany tekstu na mowę i wybierz z listy model Eleven v4.
  3. Wybierz głos z biblioteki. Gotowe głosy mówią po polsku, nawet jeśli w opisie mają inny język.
  4. Wklej tekst. Jedna generacja przyjmie do 10 000 znaków.
  5. Dodaj tagi emocji tam, gdzie zmienia się ton (ściąga w następnej sekcji). Przycisk Enhance zrobi to automatycznie przy pomocy modelu językowego.
  6. Ustaw stabilność. Niższa daje żywszą, bardziej zmienną interpretację. Wyższa trzyma równy ton, lepszy do instrukcji i komunikatów.
  7. Wygeneruj, odsłuchaj i pobierz plik MP3.

Do automatyzacji, na przykład w n8n albo własnym skrypcie, służy API. Wystarczy podać identyfikator modelu eleven_v4 albo eleven_v4_turbo:

curl -X POST "https://api.elevenlabs.io/v1/text-to-speech/ID_GŁOSU" \
  -H "xi-api-key: TWÓJ_KLUCZ" \
  -H "Content-Type: application/json" \
  -d '{"text": "Dzień dobry, tu asystent obsługi klienta.", "model_id": "eleven_v4"}' \
  --output nagranie.mp3

Jedna rada z testu: klucz API w ElevenLabs można ograniczyć do wybranych uprawnień. Nasz testowy klucz nie mógł na przykład tworzyć słowników wymowy. Przy pracy z automatyzacją lepiej wiedzieć o tym wcześniej niż w połowie przepływu.

Tagi emocji w ElevenLabs: szept, śmiech i pauza

Tag to krótka instrukcja w nawiasie kwadratowym, wstawiona w miejscu, gdzie zmienia się sposób mówienia. Tagi piszemy po angielsku, także w polskim tekście. W naszym teście zdanie “[whispers] Nie mów nikomu, ale jutro wychodzi nowa wersja. [pause] [excited] I jest naprawdę świetna! [laughs]” zabrzmiało dokładnie tak, jak było zapisane:

Eleven v4: szept, pauza, ekscytacja i śmiech sterowane tagami w polskim zdaniu.
RodzajPrzykładowe tagiUwagi
Głos i emocje[whispers] [laughs] [sighs] [exhales] [excited] [curious] [sarcastic] [crying]najpewniejsze działanie
Pauzy[pause] [long pause]zamiast znacznika <break>, którego v4 nie obsługuje
Efekty dźwiękowe[applause] [clapping] [explosion] [gunshot]działają w v4 lepiej niż w v3
Eksperymentalne[sings] [strong X accent]wynik zależy od głosu

Lista nie jest zamknięta. Według poradnika ElevenLabs model rozumie też opisowe polecenia w rodzaju [Low, steady voice, restrained urgency]. Do tego dochodzi interpunkcja: wielokropek dodaje pauzę i ciężar, a WIELKIE LITERY dodają nacisk.

Dwie pułapki warto znać. Tag musi pasować do głosu, bo spokojny lektor od medytacji nie zachichocze na komendę. Druga dotyczy migracji: Multilingual v2 nie rozumie tagów i czyta je na głos. W naszym teście powiedział “No whispers… Pulse excited… Laughs”. Przed użyciem tekstu z v4 w starszym modelu trzeba więc usunąć całe tagi, razem ze słowami w nawiasach.

Jak ElevenLabs czyta angielskie nazwy: polski cudzysłów działa, myślniki nie

Jedyną wpadką v4 w teście była nazwa narzędzia n8n. W zdaniu “Odpal workflow w n8n i sprawdź, czy API zwraca poprawny JSON” model powiedział coś w rodzaju “enejdżemej”. Pozostałe angielskie słowa, czyli prompt, workflow, API i JSON, przeczytał poprawnie.

Sprawdziliśmy więc siedem sposobów zapisu tej samej nazwy w zdaniu “Odpal workflow w … i sprawdź wynik”:

Zapis w tekścieWynik w v4 (odsłuch)
polski cudzysłów: dolny na początku, górny na końcupoprawnie
prosty cudzysłów z klawiatury“wu en osiem en”: przyimek “w” czytany jak litera
apostrofyzgubione litery
n-8-nmodel czyta na głos słowo “myślnik”
n-eight-nźle
en-ejt-enźle
en osiem enźle

Zadziałał wyłącznie polski cudzysłów, ten sam, którego używa się w wydrukach. Prosty cudzysłów z klawiatury, który wpisuje się odruchowo, też nie pomógł: model przeczytał nazwę jako “en osiem en”, a przyimek “w” jak nazwę litery. Nasze przypuszczenie jest takie, że polski cudzysłów sygnalizuje modelowi nazwę własną w polskim zdaniu. Tak wygląda zapis, który zadziałał:

Odpal workflow w „n8n” i sprawdź wynik.

Posłuchajcie różnicy:

Eleven v4, zapis bez cudzysłowu: nazwa n8n przeczytana błędnie.
Eleven v4, nazwa n8n w polskim cudzysłowie: przeczytana poprawnie.

Oficjalne metody są dwie. Pierwsza to zapis fonetyczny w alfabecie IPA, wpisany wprost w tekst między ukośnikami. Druga to słownik wymowy, w którym raz ustawiasz regułę dla nazwy n8n i działa ona w każdym nagraniu. Reguły typu alias działają we wszystkich modelach, a reguły fonetyczne tylko w v4, v3 i Flash v2. Słownika nie przetestowaliśmy, bo testowy klucz API nie miał do niego uprawnień. Przy dłuższych projektach to właściwa droga. Cudzysłów jest szybkim obejściem na pojedyncze zdania.

Klonowanie głosu AI po polsku w v4: 10 sekund czy minuta?

Na stronie premiery ElevenLabs pisze, że v4 sklonuje głos z 10 sekund nagrania. Instrukcja klonowania mówi co innego: nagraj co najmniej minutę, najlepiej jedną do dwóch minut. Traktujemy 10 sekund jako najlepszy możliwy przypadek, a do pracy przyjmujemy wartości z dokumentacji. v4 kopiuje głos wierniej niż poprzednicy, razem z szumem tła i trzaskami mikrofonu. Jakość nagrania źródłowego ma więc większe znaczenie niż wcześniej.

Klon profesjonalny wymaga co najmniej 30 minut nagrań, a zalecane są 2-3 godziny. W v3 nie działał, w v4 wrócił. Sklonować w ten sposób można tylko własny głos, po weryfikacji głosowej. Każdy klon w v4, szybki i profesjonalny, wymaga potwierdzonej zgody właściciela głosu. Klony zrobione na starszych modelach trzeba przeszkolić pod v4. Gdzie kończy się legalne klonowanie głosu i jak rozpoznać oszustwo z jego użyciem, piszemy w tekście klonowanie głosu AI: jak działa i jak się nie nabrać.

Jedna zmiana może zdziwić osoby, które klonują głos do kilku języków. Klon nagrany po angielsku, który mówi po polsku, dostanie polski akcent, a nie angielski. ElevenLabs nazywa to celową zmianą i na razie nie da się jej wyłączyć. Klonowania nie obejmował nasz test, więc opieramy się tu wyłącznie na dokumentacji.

Ile kosztuje ElevenLabs v4

W aplikacji v4 kosztuje tyle samo co inne modele: jeden znak tekstu to jeden kredyt. Plan wybiera się więc według tego, ile nagrań potrzebujesz miesięcznie:

PlanCena miesięcznieKredytyCo daje
Free0 $10 000tylko użytek prywatny
Starter6 $30 000licencja komercyjna, szybkie klonowanie
Creator22 $ (pierwszy miesiąc 11 $)121 000klon profesjonalny
Pro99 $600 000wyższa jakość plików w API

Jak to przełożyć na minuty? Skoro 10 000 znaków to około 10 minut mowy, plan Creator wystarcza na mniej więcej dwie godziny nagrań miesięcznie. W podstawowym teście wysłaliśmy w 28 generacjach łącznie około 2 800 znaków tekstu, czyli na darmowym planie zmieścilibyśmy go trzy razy.

W API cena jest liczona od tysiąca znaków. Wynosi 0,08 dolara dla v4 i 0,04 dolara dla Turbo. Do 12 października 2026 roku cennik API podaje promocję z rabatem 72%. Od planu Creator w aplikacji przez dwa tygodnie część kredytów zużytych na v4 nie jest liczona.

v4 czy v4 Turbo: który model do agenta głosowego

Do nagrań, które ktoś odsłucha później, wybierz v4. Do rozmowy, w której człowiek czeka na odpowiedź, wybierz Turbo. W naszym teście oba modele dały identyczną poprawność, a różniły się czasem.

Zmierzyliśmy czas od wysłania zapytania z Polski do otrzymania pierwszego fragmentu dźwięku. Turbo odpowiadał zwykle po 0,2-0,6 sekundy, raz po 1,2 sekundy. v4 potrzebował od 0,8 do 2 sekund. Deklarowane przez producenta 150 milisekund nie obejmuje sieci, a my mierzyliśmy razem z nią i przez zwykłe zapytanie HTTP, nie przez WebSocket. W rozmowie przez telefon różnica między 0,3 a 1 sekundą ciszy jest wyraźnie słyszalna.

Eleven v4 Turbo: komunikat infolinii z westchnieniem sterowanym tagiem [sighs].

Tak właśnie działa agent głosowy na infolinii Allegro Delivery, zbudowany na platformie ElevenLabs. Jeśli liczy się koszt, a nie ekspresja, warto porównać wyniki z tańszymi modelami. Opisywaliśmy na przykład Voxtral TTS od Mistrala, którego można użyć w n8n.

Devstock { agenci AI }

Agent AI, który pracuje na danych Twojej firmy

Budujemy agentów, którzy odpowiadają klientom, czytają dokumenty i przygotowują raporty, podłączonych do Waszych systemów. Zaczynamy od jednego procesu i sprawdzamy efekt, zanim pójdziemy dalej.

Sprawdź, jak wdrażamy agentów → Software house, który prowadzi ten blog

FAQ: najczęstsze pytania o nowy model

Czy ElevenLabs v4 jest za darmo?

Tak, v4 działa także na darmowym planie z 10 000 kredytów miesięcznie, czyli około 10 minutami nagrań. Darmowy plan pozwala jednak tylko na użytek prywatny. Nagrania do filmu firmowego, reklamy czy kursu wymagają co najmniej planu Starter za 6 dolarów.

Czy Eleven v3 nadal działa?

Tak, v3 nie został wycofany i można go dalej wybierać w aplikacji i w API. Sam producent zaleca przejście na v4, ale uprzedza, że nowy model może brzmieć zupełnie inaczej. Projekty z dopracowanym brzmieniem warto przed migracją porównać na kilku próbkach.

Czy ElevenLabs v4 obsługuje SSML?

Nie. Znaczniki SSML, w tym <break> do pauz, są w v4 wyłączone. Pauzy ustawia się tagiem [pause] albo wielokropkiem. Wymowę trudnych słów poprawia się zapisem IPA między ukośnikami albo słownikiem wymowy.

Jak sprawić, żeby ElevenLabs dobrze czytał angielskie nazwy po polsku?

W naszym teście pomógł wyłącznie polski cudzysłów, dolny na początku i górny na końcu nazwy. Prosty cudzysłów z klawiatury, apostrofy, myślniki i zapis fonetyczny literami nie pomogły. Przy nazwach, które powtarzają się w wielu nagraniach, lepszy jest słownik wymowy z regułą typu alias.

Podsumowanie

Na polskich zdaniach ElevenLabs v4 wyraźnie wygrał z poprzednikami. W naszym teście poprawnie przeczytał kwotę z groszami i skrót “r/r”, z którymi v3 i Multilingual v2 miały problemy. Tagi emocji działają także w polskim tekście, choć pisze się je po angielsku. Tekst przygotowany pod v4 nie nadaje się jednak do starszego v2, który czyta tagi na głos. Słabym punktem zostają angielskie nazwy wplecione w polskie zdanie. Przy nazwie n8n pomógł polski cudzysłów, ale inne nazwy trzeba sprawdzić odsłuchem, a przy większych projektach lepszy będzie słownik wymowy. Do nagrań wybierz v4, do rozmów na żywo Turbo, a przy klonowaniu głosu przyjmij z dokumentacji minutę nagrania zamiast 10 sekund z materiałów premierowych. Tanie ceny w API obowiązują do 12 października, więc na własne testy jest jeszcze niecałe dwa tygodnie.

Newsletter · DevstockAcademy & Kodożercy

Bądź na bieżąco ze światem IT, AI i automatyzacji

Co wtorek: newsy z branży, praktyczne tipy i narzędzia które warto znać. Zero spamu.


Udostępnij na:
Mateusz Wojdalski

Specjalista SEO i content marketingu w Devstock. Zajmuję się strategią treści, automatyzacją procesów marketingowych i wdrożeniami AI w codziennej pracy. Badam nowe narzędzia, adaptuję je do realnych zadań i piszę o tym, co faktycznie działa.

RAG AI w n8n: bot, który odpowiada z twoich dokumentów
Wyciek z Fakturowni: co zrobić i jak ostrzec kontrahentów
Pudelko kursu Agenci AI od Kodozercow z robotem i schematem przeplywu agentow
Banner reklamowy Frontend Master 2026

Najnowsze wpisy

Thumb
Copilot czy Cursor za darmo: co daje
04 paź, 2026
Thumb
ChatGPT Plus czy Gemini Advanced: co wybrać
04 paź, 2026
Thumb
Anna z 116 117. Jak odróżnić asystentkę
04 paź, 2026
Thumb
Aktualizacja Windows 11 KB5124010 zamyka starsze programy
04 paź, 2026
Thumb
mZUS dla Płatnika: składki ZUS zapłacisz w
04 paź, 2026

Kategorie

  • Aktualności i Wydarzenia (117)
  • Bezpieczeństwo i Jakość (233)
  • Branża IT i Nowe Technologie (275)
  • Design i User Experience (4)
  • Narzędzia i Automatyzacja (190)
  • Programowanie i Technologie Webowe (91)
  • Rozwój kariery i Edukacja (45)

Tagi

5G AI Architektura Cyberbezpieczeństwo Feedback Frontend Git IoT JavaScript Motywacja Nauka efektywna Optymalizacja i wydajność Programowanie React.JS Rozwój osobisty WebDevelopment
Logo FitBody Center Warszawa

Odkryj zabiegi Endermologii LPG Infinity w FitBody Center Warszawa

Maszyna zabiegowa - endermologia lpg infinity
banner-reklamowy-frontend-master
Pudelko kursu Agenci AI od Kodozercow z robotem i schematem przeplywu agentow
Group-5638-1

Devstock – Akademia programowania z gwarancją pracy

🏠 ul. Bronowska 5a,
03-995 Warszawa
📞 +48 517 313 589
✉️ contact@devstockacademy.pl

Linki

  • Poznaj firmę Devstock
  • Wejdź do społeczności Devstock
  • Polityka prywatności
  • Regulamin

FitBody Center

Strona

  • Strona główna
  • Kontakt

Newsletter

Bądź na bieżąco, otrzymuj darmową wiedzę i poznaj nas lepiej!


Icon-facebook Icon-linkedin2 Icon-instagram Icon-youtube Tiktok
Copyright 2026 Devstock. Wszelkie prawa zastrzeżone
Devstock AcademyDevstock Academy
Sign inSign up

Sign in

Don’t have an account? Sign up
Lost your password?

Sign up

Already have an account? Sign in