Proces i jakość

ASR (automatyczne rozpoznawanie mowy)

ASR (ang. automatic speech recognition) to automatyczne rozpoznawanie mowy — technologia zamieniająca nagranie na tekst bez udziału człowieka. Daje szybki wynik roboczy, ale przy materiale dowodowym wymaga korekty, bo myli nazwiska i gubi fragmenty niewyraźne.

Gdzie ASR działa dobrze?

Przy nagraniach studyjnych i konferencyjnych: jeden mówca, mikrofon blisko ust, brak hałasu, słownictwo ogólne. Podcast albo webinar system rozpozna z dokładnością, która do celów roboczych wystarcza.

Gdzie ASR zawodzi?

Niestety dokładnie tam, gdzie powstaje większość materiału dowodowego:

  • Nazwiska i nazwy własne — systemy dopasowują je do najbliższego znanego słowa.
  • Kilka osób naraz — kłótnia, przekrzykiwanie, wtrącenia w tle.
  • Złe warunki — telefon w kieszeni, rozmowa w samochodzie, nagranie z odległości.
  • Fragmenty niewyraźne — zamiast przyznać niepewność, system podstawia prawdopodobne słowo.
  • Terminologia prawnicza i medyczna — poza słownikiem ogólnym.

Ostatni punkt jest najgroźniejszy. Automat nie zostawia luki — zapisuje coś, co brzmi podobnie. Czytelnik nie ma jak odróżnić rozpoznania pewnego od zgadniętego.

Jak wygląda korekta po ASR?

Korektor odsłuchuje całe nagranie z otwartym tekstem i poprawia to, czego system nie mógł wiedzieć: przypisania wypowiedzi, nazwiska, terminy, fragmenty niesłyszalne. Tam, gdzie nie da się rozpoznać treści, stawia [dźwięk niewyraźny] zamiast pozostawiać zgadnięte słowo.

Czy sama transkrypcja automatyczna wystarczy do sądu?

Nie zalecamy jej w tej roli. Dokument, na który powołuje się strona, powinien być zweryfikowany przez człowieka, który odsłuchał nagranie i bierze odpowiedzialność za zgodność zapisu. W ProTranskrypcje żaden stenogram nie trafia do klienta bez tego etapu.

Najczęstsze pytania

Czym jest ASR?

To automatyczne rozpoznawanie mowy — technologia zamieniająca nagranie na tekst bez udziału człowieka. Daje szybki wynik roboczy, ale wymaga korekty przy materiale wymagającym dokładności.

Dlaczego automatyczna transkrypcja nie wystarcza do sądu?

Bo automat nie zostawia luki w miejscu, którego nie rozpoznał, tylko podstawia prawdopodobne słowo. Czytelnik nie ma jak odróżnić rozpoznania pewnego od zgadniętego.

Kiedy transkrypcja automatyczna jest wystarczająca?

Przy nagraniach dobrej jakości z jednym mówcą i do celów roboczych — na przykład żeby przeszukać własny podcast czy webinar.

Potrzebujesz zapisu nagrania?

Stenogram do sądu od 199 zł brutto. Wycena zwykle w 30 minut.

Zamów transkrypcję z korektą

Inne hasła w słowniku

Wszystkie hasła w słowniku pojęć