ASR (ang. automatic speech recognition) to automatyczne rozpoznawanie mowy — technologia zamieniająca nagranie na tekst bez udziału człowieka. Daje szybki wynik roboczy, ale przy materiale dowodowym wymaga korekty, bo myli nazwiska i gubi fragmenty niewyraźne.
Przy nagraniach studyjnych i konferencyjnych: jeden mówca, mikrofon blisko ust, brak hałasu, słownictwo ogólne. Podcast albo webinar system rozpozna z dokładnością, która do celów roboczych wystarcza.
Niestety dokładnie tam, gdzie powstaje większość materiału dowodowego:
Ostatni punkt jest najgroźniejszy. Automat nie zostawia luki — zapisuje coś, co brzmi podobnie. Czytelnik nie ma jak odróżnić rozpoznania pewnego od zgadniętego.
Korektor odsłuchuje całe nagranie z otwartym tekstem i poprawia to, czego system nie mógł wiedzieć: przypisania wypowiedzi, nazwiska, terminy, fragmenty niesłyszalne. Tam, gdzie nie da się rozpoznać treści, stawia [dźwięk niewyraźny] zamiast pozostawiać zgadnięte słowo.
Nie zalecamy jej w tej roli. Dokument, na który powołuje się strona, powinien być zweryfikowany przez człowieka, który odsłuchał nagranie i bierze odpowiedzialność za zgodność zapisu. W ProTranskrypcje żaden stenogram nie trafia do klienta bez tego etapu.
To automatyczne rozpoznawanie mowy — technologia zamieniająca nagranie na tekst bez udziału człowieka. Daje szybki wynik roboczy, ale wymaga korekty przy materiale wymagającym dokładności.
Bo automat nie zostawia luki w miejscu, którego nie rozpoznał, tylko podstawia prawdopodobne słowo. Czytelnik nie ma jak odróżnić rozpoznania pewnego od zgadniętego.
Przy nagraniach dobrej jakości z jednym mówcą i do celów roboczych — na przykład żeby przeszukać własny podcast czy webinar.
Potrzebujesz zapisu nagrania?
Stenogram do sądu od 199 zł brutto. Wycena zwykle w 30 minut.