Plik MP3 zamienisz na tekst, przesyłając go bez zakładania konta i czytając darmowy podgląd transkryptu. O rozmiarze decyduje przepływność, więc w limicie 5 GB mieści się orientacyjnie od 37 godzin nagrania przy 320 kbps do ponad 370 godzin przy 32 kbps. Wynik dostajesz ze znacznikami czasu i oznaczeniem mówców.
Prześlij nagranie. Konto założysz dopiero po wyniku.
Upuść plik tutaj lub wybierz go z dysku. Najpierw pokażemy Ci początek transkryptu.
Który model transkrypcji myli najmniej słów?
skryba.ai transkrybuje na modelu Scribe v2, który w niezależnym indeksie Artificial Analysis myli 2,2% słów — najmniej ze wszystkich mierzonych. Dla porównania Gemini 3.5 Transcribe myli 2,6%, a Whisper large-v3 — 4,1%. To ten sam model, który zapisuje początek transkryptu pokazywany przed płatnością.
Word Error Rate — błędnie rozpoznane słowa — mniej = lepiej
Model
WER
skryba.ai (Scribe v2)model, na którym transkrybujemy
2,2%
MAI-Transcribe-1.5Microsoft Azure
2,4%
Gemini 3.5 TranscribeGoogle
2,6%
Universal-3 ProAssemblyAI
3,1%
GPT TranscribeOpenAI
3,3%
Whisper large-v3OpenAI
4,1%
Nova-3Deepgram
5,2%
Źródło: Artificial Analysis, indeks AA-WER v2, tryb non-streaming — odczyt 27 sierpnia 2026. Pokazujemy siedem z ponad 40 mierzonych modeli: czołówkę zestawienia i najbardziej rozpoznawalne nazwy. Ranking mierzy przede wszystkim nagrania po angielsku — dla polszczyzny nikt takiego porównania nie publikuje. Dlatego początek każdej transkrypcji pokazujemy, zanim o cokolwiek poprosimy.
Ile godzin MP3 mieści się w limicie
Limit przesyłania to 5 GB i jest jednakowy dla wszystkich — anonimowo, w teście i w planach płatnych. Przy MP3 to praktycznie nigdy nie jest przeszkoda, bo o rozmiarze decyduje przepływność, a nie długość.
Poniższe wartości są orientacyjne. MP3 bywa kodowany ze zmienną przepływnością, gdzie ustawiona wartość jest średnią, a nie stałą; dodatkowe bajty dokładają też tagi i okładka.
Bitrate
Typowe źródło
Na godzinę
Zmieści się w 5 GB
32 kbps
dyktafon, tryb mowy
14 MB
ok. 370 h
64 kbps
nagrania mono, podcast mowy
29 MB
ok. 186 h
128 kbps
domyślny eksport, stereo
58 MB
ok. 93 h
192 kbps
podcast muzyczny
86 MB
ok. 62 h
320 kbps
maksymalna jakość MP3
144 MB
ok. 37 h
Przewiń tabelę w bok, aby zobaczyć pozostałe kolumny.
Nie znasz bitrate'u swojego pliku? Podziel rozmiar w megabajtach przez długość w godzinach i porównaj z kolumną „na godzinę”. Godzina nagrania z dyktafonu to zwykle 30–60 MB.
Czy kompresja MP3 psuje transkrypcję
Przy typowych ustawieniach — praktycznie nie. Model rozpoznaje fonemy, a nie wierność brzmienia instrumentów, a to, co MP3 usuwa jako pierwsze, leży poza pasmem mowy. Różnica między 128 a 320 kbps nie przekłada się na dokładność. Bardzo niska przepływność i mocna kompresja to jednak inna sprawa: artefakty potrafią zjeść końcówki wyrazów, zwłaszcza w hałasie.
Dlatego nie ma sensu rekompresować pliku „w górę” przed przesłaniem: z MP3 128 kbps nie odzyska się informacji, której tam nie ma, a plik urośnie. Sensowne jest coś odwrotnego — jeśli masz WAV-a, konwersja do MP3 128 kbps skróci wysyłanie bez straty dokładności.
Co naprawdę psuje wynik: odległy mikrofon, nakładające się głosy, pogłos w pustej sali.
Co nie psuje: rozsądna kompresja, format kontenera, brak wideo w pliku.
Skąd zwykle biorą się pliki MP3
Dyktafony cyfrowe — najczęściej mono, 32–128 kbps, gotowe do przesłania bez konwersji.
Eksport z programów do montażu i z platform podcastowych.
Nagrania rozmów telefonicznych z central i systemów call center.
Konwersja z innego formatu, gdy plik źródłowy był za duży albo nieobsługiwany.
Obsługujemy też M4A, WAV, AAC, OGG, Opus, FLAC i WMA, a z wideo MP4, MOV, MKV i AVI, więc konwersja do MP3 „na wszelki wypadek” zwykle nie jest potrzebna — poza sytuacją, gdy chcesz zmniejszyć plik przed wysłaniem.
Ograniczeniem jest rozmiar, nie długość: 5 GB. Przy typowym MP3 128 kbps to około 93 godziny nagrania, przy 320 kbps około 37 godzin. Praktycznie żadne pojedyncze nagranie tego nie przekracza.
Czy niska jakość MP3 obniża dokładność?
Przy typowych ustawieniach różnica jest pomijalna, a znacznie większy wpływ mają warunki nagrania — odległość mikrofonu, nakładające się głosy i pogłos. Przy bardzo niskiej przepływności artefakty kompresji potrafią już jednak obniżyć dokładność.
Czy muszę konwertować plik do MP3?
Nie. Poza MP3 obsługujemy M4A, WAV, AAC, OGG, Opus, FLAC, AIFF, WMA i AMR, a także pliki wideo — MP4, MOV, MKV, AVI, WMV i WebM. Konwersja ma sens tylko wtedy, gdy chcesz zmniejszyć duży plik WAV przed wysłaniem — 128 kbps w zupełności wystarczy.
Czy transkrypcja MP3 ma znaczniki czasu?
Tak, każdy fragment ma znacznik czasu i oznaczenie mówcy, więc możesz wrócić do konkretnego miejsca w nagraniu. Eksport do SRT — przydatny przy napisach — jest dostępny w planach płatnych.