Zamiana mowy na tekst dzieli się na dwa przypadki. Dyktowanie na żywo, gdy mówisz i słowa pojawiają się od razu — do tego najlepsze są darmowe narzędzia wbudowane w system. Transkrypcja, gdy masz już nagranie i chcesz je przepisać — tym zajmuje się skryba.ai, ze znacznikami czasu i rozpoznaniem mówców.
Prześlij nagranie. Konto założysz dopiero po wyniku.
Upuść plik tutaj lub wybierz go z dysku. Najpierw pokażemy Ci początek transkryptu.
Który model transkrypcji myli najmniej słów?
skryba.ai transkrybuje na modelu Scribe v2, który w niezależnym indeksie Artificial Analysis myli 2,2% słów — najmniej ze wszystkich mierzonych. Dla porównania Gemini 3.5 Transcribe myli 2,6%, a Whisper large-v3 — 4,1%. To ten sam model, który zapisuje początek transkryptu pokazywany przed płatnością.
Word Error Rate — błędnie rozpoznane słowa — mniej = lepiej
Model
WER
skryba.ai (Scribe v2)model, na którym transkrybujemy
2,2%
MAI-Transcribe-1.5Microsoft Azure
2,4%
Gemini 3.5 TranscribeGoogle
2,6%
Universal-3 ProAssemblyAI
3,1%
GPT TranscribeOpenAI
3,3%
Whisper large-v3OpenAI
4,1%
Nova-3Deepgram
5,2%
Źródło: Artificial Analysis, indeks AA-WER v2, tryb non-streaming — odczyt 27 sierpnia 2026. Pokazujemy siedem z ponad 40 mierzonych modeli: czołówkę zestawienia i najbardziej rozpoznawalne nazwy. Ranking mierzy przede wszystkim nagrania po angielsku — dla polszczyzny nikt takiego porównania nie publikuje. Dlatego początek każdej transkrypcji pokazujemy, zanim o cokolwiek poprosimy.
Które z dwóch zadań masz?
Sygnał
Dyktowanie na żywo
Transkrypcja nagrania
Kiedy powstaje tekst
W trakcie mówienia
Po przesłaniu pliku
Ile osób mówi
Jedna — Ty
Zwykle kilka
Typowe zastosowanie
Notatka, e-mail, wiadomość
Wywiad, spotkanie, wykład, rozprawa
Czego potrzebujesz
Narzędzia systemowego, za darmo
Transkrypcji ze znacznikami czasu
Przewiń tabelę w bok, aby zobaczyć pozostałe kolumny.
Jeśli chcesz dyktować na żywo
skryba.ai tego nie robi i nie ma sensu, żebyś zakładał u nas konto. Dyktowanie masz już opłacone w sprzęcie, który trzymasz w ręku.
iPhone i iPad: ikona mikrofonu na klawiaturze systemowej. Polski jest obsługiwany.
Android: mikrofon w Gboard, ta sama ścieżka.
macOS: Dyktowanie w Ustawieniach systemowych, skrót domyślnie dwa razy Control.
Windows 11: Windows + H otwiera dyktowanie w dowolnym polu tekstowym.
Google Docs: Narzędzia → Pisanie głosowe, jeśli i tak piszesz w dokumencie.
Gdzie trafia Twój głos, zależy od narzędzia i nie jest to jednolite: dyktowanie w Windows 11 i w Dokumentach Google działa po stronie serwera, a Apple i Google potrafią rozpoznawać mowę na samym urządzeniu, ale zależnie od modelu i języka. Jeśli nagranie jest poufne, sprawdź to w dokumentacji konkretnego systemu, zanim zaczniesz dyktować.
Wróć tutaj, jeśli okaże się, że jednak masz nagranie do przepisania — na przykład dyktafon z zebrania albo plik od kogoś innego.
Jeśli masz nagranie do przepisania
To jest przypadek, do którego skryba.ai została zbudowana. Różnica wobec dyktowania jest większa niż moment powstania tekstu: nagranie ma wielu mówców, tło, przerwania i akustykę pomieszczenia, a wynik ma być dokumentem, nie strumieniem słów.
Znaczniki czasu przy każdym fragmencie, więc wracasz do miejsca w nagraniu.
Rozpoznanie mówców, więc widać kto co powiedział.
Polski i angielski, z automatycznym wykrywaniem języka.
Edycja w przeglądarce — poprawiasz nazwiska i terminy, których model nie mógł znać.
Wybór narzędzia wpływa na wynik mniej niż jakość nagrania. Te same czynniki psują transkrypcję u każdego dostawcy, więc warto je znać przed nagraniem, a nie po.
Odległość mikrofonu od mówiących — najważniejszy pojedynczy czynnik.
Nakładające się głosy, których nie rozdzieli żaden model.
Pogłos w pustej sali, gorszy dla dokładności niż równomierny szum.
Żargon, nazwiska i skróty — tu poprawka ręczna jest szybsza niż szukanie lepszego modelu.
Najczęściej zadawane pytania
Czy skryba.ai pozwala dyktować na żywo?
Nie. skryba.ai przepisuje nagrania, które już masz. Do dyktowania na żywo użyj narzędzia wbudowanego w system — na iPhonie i Androidzie mikrofonu na klawiaturze, na Windowsie skrótu Windows + H, na macOS Dyktowania w ustawieniach.
Czym różni się „mowa na tekst” od transkrypcji?
„Mowa na tekst” to szersze pojęcie, które obejmuje jedno i drugie. Transkrypcja to konkretnie przepisanie istniejącego nagrania, zwykle wielu mówców i ze znacznikami czasu. Dyktowanie to zamiana Twojego głosu na tekst w czasie rzeczywistym.
Mam nagranie głosowe z telefonu — to się nadaje?
Tak. Notatki głosowe z iPhone'a to pliki M4A, a wiadomości z komunikatorów zwykle OGG lub WebM — wszystkie te formaty obsługujemy. Prześlij plik bez zakładania konta i zobacz podgląd transkryptu.
Czy zamiana mowy na tekst działa po polsku?
Tak, polski jest podstawowym językiem tego narzędzia, obok angielskiego, a język rozpoznawany jest automatycznie. Najlepszym testem jest własne nagranie — darmowy podgląd istnieje właśnie po to.