Przejrzystość AI
Ta strona wyjaśnia, jak skryba.ai korzysta ze sztucznej inteligencji: jakie modele przygotowują transkrypcje, jakie mają ograniczenia i jak oznaczamy treści wygenerowane przez AI. Publikujemy ją w ramach obowiązków przejrzystości wynikających z rozporządzenia (UE) 2024/1689 (aktu o sztucznej inteligencji).
Jak powstaje transkrypcja
Transkrypcja powstaje w pełni automatycznie: przesłane nagranie jest przetwarzane przez model rozpoznawania mowy (ASR), który zamienia dźwięk na tekst, dzieli go na segmenty ze znacznikami czasu i w przybliżeniu przypisuje wypowiedzi do mówców. Żaden człowiek nie odsłuchuje nagrania ani nie weryfikuje wyniku — tekst, który widzisz, jest surowym wynikiem działania modelu, dopóki sam go nie poprawisz.
Wersja zredagowana
Obok wersji dokładnej możesz poprosić o wersję zredagowaną: ten sam tekst z usuniętymi wypełniaczami („yyy”, „eee”, „no”), powtórzeniami słów i fałszywymi startami. Przygotowuje ją model językowy, a nie człowiek. Nie uruchamia się sama — powstaje wyłącznie wtedy, gdy sam o nią poprosisz dla konkretnego nagrania, ponieważ to jedyny moment, w którym treść transkryptu jest przekazywana poza infrastrukturę Cloudflare.
Model wolno tylko usuwać. Zanim wersja zredagowana zostanie zapisana, każdy fragment jest sprawdzany automatycznie: jeżeli model przestawił słowa, dopisał cokolwiek od siebie, usunął w jednym miejscu dłuższy fragment niż pojedyncza wtrącona fraza albo pozbawił wypowiedź ponad połowy słów, jego odpowiedź jest odrzucana, a dana wypowiedź pozostaje w wersji dokładnej. Nie jest to jednak gwarancja — wersją wiążącą pozostaje wersja dokładna, a tryb „Porównanie” pokazuje wprost, co zostało usunięte.
Modele i dostawcy
- ElevenLabs Scribe (ElevenLabs, Inc., USA) — podstawowy model rozpoznawania mowy. Otrzymuje nagranie przez tymczasowy, wygasający link i zwraca transkrypcję; transfer danych odbywa się na podstawie standardowych klauzul umownych.
- Deepgram Nova-3 uruchamiany w infrastrukturze Cloudflare Workers AI — zapasowy model rozpoznawania mowy, używany gdy podstawowy dostawca jest niedostępny. W tym trybie rozpoznawania mowy nagranie nie opuszcza infrastruktury Cloudflare i nie jest przekazywane firmie Deepgram, Inc. Zastrzeżenie to dotyczy wyłącznie rozpoznawania mowy — nie obejmuje wersji zredagowanej opisanej niżej.
- Claude (Anthropic PBC, USA) — model językowy przygotowujący wersję zredagowaną transkryptu. Uruchamia się wyłącznie wtedy, gdy sam o to poprosisz dla konkretnego nagrania; otrzymuje wówczas tekst transkryptu (nie plik audio). Dostawca przechowuje go co do zasady przez 30 dni — dłużej tylko wtedy, gdy wymagają tego jego obowiązki prawne albo procedury bezpieczeństwa — i nie wykorzystuje go do trenowania modeli. Transfer na podstawie standardowych klauzul umownych.
Aktualna lista podmiotów przetwarzających dane oraz zasady transferów poza Europejski Obszar Gospodarczy znajdują się w polityce prywatności.
Ograniczenia i dokładność
Wyniki modeli zawierają błędy. Dokładność zależy od jakości nagrania, liczby i nakładania się głosów, tempa mowy, gwary, terminologii specjalistycznej i nazw własnych. Rozpoznanie mówców jest przybliżone i może mylić osoby o podobnych głosach. Nie gwarantujemy określonego poziomu dokładności.
Przed wykorzystaniem transkrypcji w postępowaniu urzędowym, sądowym, w dokumentacji medycznej lub w innym celu, w którym błąd miałby istotne skutki, zweryfikuj ją z nagraniem. Tam, gdzie przepisy wymagają transkrypcji sporządzonej przez człowieka, nasza usługa jej nie zastępuje.
Twoje dane a modele
Twoich nagrań ani transkrypcji nie wykorzystujemy do trenowania modeli i wymagamy tego samego od wszystkich dostawców modeli, z których korzystamy — zarówno rozpoznawania mowy, jak i modelu językowego przygotowującego wersję zredagowaną. Zasady przechowywania i usuwania danych — w tym automatyczne wygasanie plików audio oraz okres przechowywania po stronie dostawcy wersji zredagowanej — opisuje polityka prywatności.
Jak oznaczamy treści z AI
- Widoczna informacja przy każdym transkrypcie: w aplikacji, w podglądzie bez konta oraz na stronie udostępnionego transkryptu.
- Zdanie informacyjne w e-mailu z powiadomieniem o udostępnieniu transkryptu.
- Stopka w eksportowanym pliku TXT.
- Oznaczenie maszynowe: pole aiGenerated w eksporcie danych konta (JSON) oraz metadane na stronie udostępnionego transkryptu.
- Wersja zredagowana jest oznaczona osobno i mocniej: jest opisana jako wygenerowana przez AI wszędzie tam, gdzie ją widać, nazwa pobranego pliku odróżnia ją od wersji dokładnej, a jej stopka w pliku TXT mówi wprost, że tekst został przez model zmieniony, a nie tylko zapisany.
Usługa nie jest systemem wysokiego ryzyka w rozumieniu aktu o sztucznej inteligencji, nie prowadzi rozpoznawania emocji ani kategoryzacji biometrycznej i nie służy do interakcji konwersacyjnej. Sama transkrypcja odwzorowuje treść nagrania bez istotnej zmiany danych wejściowych ani ich znaczenia i oznaczamy ją dla pełnej przejrzystości. Wersja zredagowana jest natomiast tekstem zmienionym przez model, więc jej oznaczenie traktujemy jako obowiązek wynikający z art. 50 ust. 2 aktu o sztucznej inteligencji, a nie jako dobrą praktykę.
O czym pamiętać, korzystając z transkryptów
- Odpowiadasz za weryfikację transkryptu przed jego wykorzystaniem — zwłaszcza nazw własnych, liczb i wypowiedzi przypisanych mówcom.
- Jeśli publikujesz transkrypt w celu informowania opinii publicznej o sprawach leżących w interesie publicznym, możesz mieć własny obowiązek ujawnienia, że tekst wygenerowano automatycznie (art. 50 ust. 4 aktu o sztucznej inteligencji), chyba że tekst przeszedł weryfikację redakcyjną, a odpowiedzialność za publikację ponosi konkretna osoba lub podmiot.
- Odpowiadasz za podstawę prawną nagrania i przetwarzania wypowiedzi innych osób — szczegóły opisują regulamin i polityka prywatności.
Kontakt i nadzór
Usługę świadczy Wondel.ai sp. z o.o. z siedzibą w Warszawie, ul. Twarda 18, 00-105 Warszawa, KRS 0001029516, NIP 5252951298, REGON 524989057. Pytania dotyczące działania AI w serwisie: hello@wondel.ai.
Nadzór nad rynkiem systemów sztucznej inteligencji w Polsce sprawuje Komisja Rozwoju i Bezpieczeństwa Sztucznej Inteligencji (KRiBSI), powołana ustawą o systemach sztucznej inteligencji wdrażającą akt o sztucznej inteligencji. W sprawach danych osobowych organem nadzorczym pozostaje Prezes Urzędu Ochrony Danych Osobowych.