Godzinny wywiad zamienia się w tekst w kilka minut. Każda wypowiedź ma znacznik czasu i oznaczenie mówcy, a gotowy transkrypt pobierasz jako TXT albo SRT, z etykietami mówców lub bez. Jedno godzinne nagranie kosztuje jednorazowo 23,40 zł. Dziesięć takich wywiadów zmieści się w pakiecie za 99 zł, czyli 9,90 zł za godzinę. Nagrania do pięciu minut są darmowe po zalogowaniu.
Prześlij nagranie. Konto założysz dopiero po wyniku.
Upuść plik tutaj lub wybierz go z dysku. Najpierw pokażemy Ci początek transkryptu.
Który model transkrypcji myli najmniej słów?
skryba.ai transkrybuje na modelu Scribe v2, który w niezależnym indeksie Artificial Analysis myli 2,2% słów — najmniej ze wszystkich mierzonych. Dla porównania Gemini 3.5 Transcribe myli 2,6%, a Whisper large-v3 — 4,1%. To ten sam model, który zapisuje początek transkryptu pokazywany przed płatnością.
Word Error Rate — błędnie rozpoznane słowa — mniej = lepiej
Model
WER
skryba.ai (Scribe v2)model, na którym transkrybujemy
2,2%
MAI-Transcribe-1.5Microsoft Azure
2,4%
Gemini 3.5 TranscribeGoogle
2,6%
Universal-3 ProAssemblyAI
3,1%
GPT TranscribeOpenAI
3,3%
Whisper large-v3OpenAI
4,1%
Nova-3Deepgram
5,2%
Źródło: Artificial Analysis, indeks AA-WER v2, tryb non-streaming — odczyt 27 sierpnia 2026. Pokazujemy siedem z ponad 40 mierzonych modeli: czołówkę zestawienia i najbardziej rozpoznawalne nazwy. Ranking mierzy przede wszystkim nagrania po angielsku — dla polszczyzny nikt takiego porównania nie publikuje. Dlatego początek każdej transkrypcji pokazujemy, zanim o cokolwiek poprosimy.
Trzy sytuacje, jedna seria nagrań
Wywiad rzadko jest jeden. Zwykle jest ich kilkanaście i to zmienia rachunek: liczy się nie cena pliku, a cena całej serii i to, ile pracy zostaje po transkrypcji. Wywiady badawcze to najdłuższe nagrania, jakie do nas trafiają — godzinne i dłuższe — i najczęstszy powód, dla którego ktoś kupuje pakiet godzin.
Kto przesyła
Typowa seria
Co jest naprawdę potrzebne
Magistrant albo doktorant, wywiady IDI
8–15 rozmów po 45–90 minut
Tekst do kodowania i rozdzielenie badacza od rozmówcy
Badacz w agencji, sesje FGI
4–8 sesji po 90–120 minut
Znaczniki czasu do wracania do nagrania i cytaty do raportu
Dziennikarz
Jedna rozmowa, dziś
Dosłowny cytat i pewność, kto go wypowiedział
Przewiń tabelę w bok, aby zobaczyć pozostałe kolumny.
Do wszystkich trzech prowadzi ta sama droga: przesyłasz plik, po kilku minutach masz tekst z podziałem na mówców, poprawiasz go w przeglądarce i eksportujesz. Różni się tylko to, co wybierzesz w cenniku.
Kto mówi — i kiedy to przestaje działać
Rozpoznawanie mówców jest włączone domyślnie. Model dzieli nagranie na osoby i przypisuje każdą wypowiedź do jednej z nich, a Ty nadajesz im nazwy w edytorze: „Badaczka”, „R1”, nazwisko.
Wywiad IDI, dwie osoby przy jednym mikrofonie — przypadek najłatwiejszy i najczęstszy.
Trzy, cztery osoby mówiące po kolei — nadal dobrze, o ile nie wchodzą sobie w słowo.
Sesja FGI, sześć głosów i rozmowa równoległa — tu jakość podziału spada i trzeba go poprawić ręcznie.
Jeden mikrofon na środku stołu — najsłabsze wejście, niezależnie od liczby osób.
Piszemy to wprost, bo różnica między dwoma a sześcioma głosami jest realna i lepiej sprawdzić ją przed zakupem niż po. Darmowy podgląd pokazuje początek transkryptu razem z podziałem na mówców — na Twoim nagraniu, nie na naszej próbce.
Co dostajesz do dalszej pracy
Edytor w przeglądarce — poprawiasz nazwiska, terminy i etykiety mówców, słuchając nagrania w tym samym oknie.
TXT do wczytania w MAXQDA, NVivo albo ATLAS.ti, w dwóch wariantach: z etykietami mówców i bez.
SRT ze znacznikami czasu, jeśli chcesz wracać do konkretnej minuty nagrania.
Link do udostępnienia transkryptu promotorowi albo redakcji, unieważniany w każdej chwili.
Wyszukiwanie po treści wszystkich nagrań — wpisujesz zdanie, dostajesz nagranie, w którym padło.
Jeśli tniesz nagrania na fragmenty — po pytaniu, po rozmówcy — każdy plik jest osobnym nagraniem: z własnym podglądem, własnymi etykietami mówców i własnym eksportem. Nazwa pliku zostaje, więc „W2_pyt3.m4a” odnajdziesz po nazwie i po treści. Jedno zastrzeżenie do rachunku: każdy plik rozlicza się osobno. Przy zakupie jednorazowym każdy ma własne minimum 4,99 zł, a przy godzinach z pakietu każdy zaokrągla się osobno do pełnej minuty — trzydzieści dwuminutowych fragmentów to jednorazowo 149,70 zł, a jeden godzinny plik 23,40 zł. Jeśli możesz, wgrywaj całe wywiady i tnij dopiero tekst.
Eksport i wersja zredagowana są w ofercie płatnej. Sam transkrypt i edytor otwierają się także po darmowym odblokowaniu nagrania do pięciu minut.
Cytat dosłowny, wersja zredagowana i anonimizacja
Domyślny transkrypt jest dosłowny: zostaje w nim „yyy”, powtórzenie i urwane zdanie. Dla analizy jakościowej to zwykle zaleta, bo wahanie rozmówcy jest daną, a nie błędem zapisu.
Wersja zredagowana usuwa wypełniacze i jąkania, i nic więcej. Nie zmienia szyku, słów ani sensu wypowiedzi: model może wyłącznie skreślać, a każda jego odpowiedź jest przed zapisaniem sprawdzana mechanicznie. Jeśli sprawdzenie nie przejdzie, fragment zostaje dokładnie tak, jak padł.
Czego ta wersja nie robi: nie usuwa nazwisk, adresów ani innych danych osobowych. Pseudonimizację transkryptu robisz sam w edytorze, przed eksportem — my nie podmieniamy imion na kody. Warto o tym wiedzieć, zanim opiszesz procedurę we wniosku do komisji etycznej.
Transkrypt powstaje automatycznie, więc nazwiska, nazwy własne i liczby zawsze warto sprawdzić przy nagraniu. Pobrane pliki mają dopisek, że tekst wygenerowała AI — przy publikowaniu cytatów ta informacja bywa potrzebna.
Ile kosztuje przepisanie całej serii
Pojedynczy transkrypt kosztuje 0,39 zł za rozpoczętą minutę, przy minimum 4,99 zł. Godzinny wywiad to więc 23,40 zł. Od trzeciej godziny nagrań taniej wychodzi pakiet, a godziny z pakietu nie mają terminu ważności.
Ile masz nagrań
Co wybrać
Koszt
Jeden wywiad, godzina
Pojedynczy transkrypt
23,40 zł
Trzy wywiady po godzinie
Pakiet 5 godzin
59 zł (11,80 zł za godzinę)
8–12 wywiadów po godzinie
Pakiet 10 godzin
99 zł (9,90 zł za godzinę)
Nagrania co miesiąc, przez cały projekt
Abonament Pro, 10 godzin miesięcznie
89 zł miesięcznie (8,90 zł za godzinę)
Przewiń tabelę w bok, aby zobaczyć pozostałe kolumny.
Pakiet i abonament różnią się terminem: godziny z abonamentu wygasają z końcem okresu rozliczeniowego, godziny z pakietu zostają na koncie, dopóki ich nie zużyjesz. Przy serii wywiadów rozłożonej na semestr pakiet zwykle pasuje lepiej. Jest jeszcze Starter za 39 zł miesięcznie z czterema godzinami.
Sposób
Ile trwa
Za godzinę nagrania
skryba.ai
Kilka minut
8,90–23,40 zł
Freelancer albo biuro transkrypcji
1–3 dni
80–400 zł
Samodzielne przepisywanie
4–8 godzin pracy
Twój czas
Przewiń tabelę w bok, aby zobaczyć pozostałe kolumny.
Stawki rynkowe podajemy jako rząd wielkości — zależą od terminu, jakości nagrania i tego, czy zamawiasz zapis dosłowny. Dla dziesięciu godzinnych wywiadów oznaczają od kilkuset do kilku tysięcy złotych u wykonawcy albo co najmniej czterdzieści godzin własnego pisania.
Dlaczego nie Whisper na własnym laptopie
Whisper od OpenAI jest darmowy, otwarty i po polsku transkrybuje dobrze. Jeśli umiesz go zainstalować i masz czas maszyny, jest realną alternatywą — piszemy to wprost, bo przy serii wywiadów to on, a nie inny serwis, jest tym, z czym naprawdę konkurujemy.
Instalacja: Python, ffmpeg i pobranie modelu. Na Macu albo Linuksie zwykle wieczór, na Windowsie częściej dwa.
Czas: bez karty graficznej dziesięć godzin nagrań to od kilku do kilkunastu godzin liczenia, z włączonym komputerem.
Mówcy: sam Whisper nie rozdziela głosów. Do tego potrzebna jest osobna biblioteka i sklejenie jej wyników z tekstem.
Cisza i muzyka: w miejscach bez mowy model potrafi dopisać zdania, których nikt nie wypowiedział — trzeba je wyłapać przy odsłuchu.
Poprawki: wynik to plik tekstowy. Edytor, w którym klikasz zdanie i słyszysz nagranie, trzeba sobie znaleźć osobno.
Skryba to ten sam rząd jakości bez tej pracy: wgrywasz plik, po kilku minutach masz tekst z podziałem na mówców w edytorze z odtwarzaczem, a dziesięć godzin wywiadów kosztuje 99 zł. Jeśli liczysz swój czas po zero złotych i lubisz terminal, Whisper wygra. Jeśli masz obronę za miesiąc — raczej nie.
Poufność, RODO i to, co usuwa się samo
Wywiad badawczy to zwykle dane osobowe, czasem szczególnej kategorii. Poniżej fakty, które możesz przepisać do opisu przetwarzania, bez naszej interpretacji.
Nagrania leżą na Cloudflare R2 w Europejskim Obszarze Gospodarczym, w prywatnym zasobniku.
Rozpoznawanie mowy wykonuje ElevenLabs, Inc. w USA: dostaje plik audio przez wygasający link i zwraca tekst; transfer na standardowych klauzulach umownych, szczegóły w polityce prywatności.
Plik audio możesz kazać usuwać automatycznie po 1, 7 albo 30 dniach; transkrypt zostaje.
Nagranie razem z transkryptem i wszystkimi udostępnieniami usuwasz sam, w każdej chwili. To samo dotyczy całego konta.
Link do udostępnienia wygasa po 30 dniach i możesz go unieważnić wcześniej.
Przygotowanie wersji zredagowanej wysyła sam tekst transkryptu do Anthropic w USA — pytamy o to osobno, przed pierwszym użyciem. Pliku audio tam nie wysyłamy.
Czego nie zrobimy za Ciebie: zgody rozmówców, informacji o nagrywaniu i anonimizacji transkryptu. To zostaje po Twojej stronie i tak też opisz to w dokumentacji badania.
Płacisz kartą albo BLIK-iem, a przy zakupie jednorazowym karta nie zostaje zapisana. Przez 14 dni od zakupu możesz odstąpić od umowy i odzyskać całą kwotę, także jeśli zdążyłeś zużyć część godzin — nie potrącamy nic za wykorzystane minuty.
Cztery sposoby przepisania wywiadu — ręcznie, przez redyktowanie, w biurze i z AI — opisaliśmy osobno, razem z czasami, kosztami i instrukcją krok po kroku.
Czy rozpozna, kto mówi, przy dwóch albo czterech osobach?
Tak, i najlepiej działa właśnie w tym zakresie. Wywiad IDI z dwiema osobami oraz rozmowa trzech lub czterech osób mówiących po kolei dzielą się dobrze; wypowiedzi trafiają do osobnych mówców, którym nadajesz nazwy w edytorze. Przy sześciu głosach i rozmowie równoległej, typowej dla FGI, podział będzie wymagał poprawek. Sprawdź to na darmowym podglądzie swojego nagrania, zanim zapłacisz.
Czy przyjmiecie nagranie z dyktafonu, telefonu albo Teams?
Tak, wszystkie trzy i bez konwersji. Dyktafony zapisują zwykle MP3, WAV albo WMA, iPhone i Android — M4A, a Teams i Zoom oddają nagranie jako MP4 lub M4A. Plik wideo przesyłasz w całości, ścieżkę dźwiękową wyciągamy po swojej stronie. Limit to 5 GB, a godzina nagrania z dyktafonu to zwykle 30–60 MB.
Co dzieje się z nagraniem po transkrypcji?
Zostaje w prywatnym zasobniku na Cloudflare R2 w EOG, dopóki go nie usuniesz — albo dopóki nie zrobi tego za Ciebie ustawienie automatycznego usuwania audio po 1, 7 lub 30 dniach. Transkrypt przy takim usunięciu zostaje, bo to on jest wynikiem pracy. Nagranie razem z transkryptem i udostępnieniami możesz usunąć ręcznie w każdej chwili, tak samo jak całe konto.
Czy transkrypt jest dosłowny i czy usuwacie z niego nazwiska?
Transkrypt jest dosłowny: wahania, powtórzenia i urwane zdania zostają. Wersja zredagowana, dostępna w ofercie płatnej, usuwa wyłącznie wypełniacze i jąkania — nie zmienia szyku ani słów i nie usuwa nazwisk, adresów ani innych danych osobowych. Anonimizację robisz sam w edytorze, przed eksportem.
W jakich formatach pobiorę transkrypt do MAXQDA albo NVivo?
TXT i SRT, każdy w wariancie z etykietami mówców i bez. TXT wczytasz do MAXQDA, NVivo albo ATLAS.ti jak każdy dokument tekstowy, a SRT przydaje się, gdy chcesz wracać do konkretnej minuty nagrania. Eksportu do DOCX nie mamy — jeśli potrzebujesz dokumentu Worda, otwórz plik TXT i zapisz go w tym formacie.
Czy dwugodzinna sesja fokusowa przejdzie w jednym pliku?
Tak. Nie ma limitu długości nagrania, jest limit rozmiaru pliku: 5 GB, ten sam dla wszystkich. Nagranie dźwiękowe nigdy nie zbliża się do tej granicy; realnie zaczyna ona przeszkadzać przy długim wideo w wysokiej jakości, a wtedy wystarczy wyeksportować z niego samą ścieżkę dźwiękową. Płacisz za rozpoczęte minuty, więc dwie godziny to 46,80 zł jednorazowo.