HomeBlog › Nauwkeurigheid spraakherkenning
Techniek

Hoe nauwkeurig is medische spraakherkenning?

· bijgewerkt · Leestijd ± 5 min · door het team van MedLogica

"Herkent hij mijn vakjargon wel?" is misschien wel de belangrijkste vraag bij een AI-scribe. Terecht: een transcriptie die medicatienamen of afkortingen verhaspelt, kost meer tijd dan hij bespaart. Goed nieuws is dat medische spraakherkenning de afgelopen jaren enorm is verbeterd — mits je begrijpt wat de nauwkeurigheid bepaalt en hoe je die opkrikt.

Wat betekent "nauwkeurig"?

De standaardmaat is de WER (Word Error Rate): het percentage woorden dat verkeerd, gemist of te veel wordt herkend ten opzichte van een correcte referentie. Een WER van 5% betekent grofweg één afwijking per twintig woorden. Maar let op: niet elke fout weegt even zwaar — een verkeerde "de/het" is iets anders dan een verkeerde dosering. Bij medische tekst kijk je dus niet alleen naar het getal, maar naar welke woorden misgaan.

Ter ijking wat cijfers uit onderzoek. Op Nederlandse spraak van volwassenen haalt Whisper een WER van rond de 6,7%; op kinderspraak loopt dat op naar 9,8%. Zodra er medisch jargon bij komt wordt het lastiger: in een studie waarin Whisper Large-v2 werd ingezet voor Franstalige radiologieverslagen kwam de WER op medische terminologie uit op 17,1%. Afstemmen op de eigen doelgroep maakt veel uit — fine-tunen op Nederlandse spraakcorpora leverde relatieve verbeteringen van 65 tot 81% op.

Belangrijk bij het lezen van zulke getallen: een WER van 7% betekent niet dat 7% van je verslag onbruikbaar is. De meeste fouten zitten in leestekens, verbuigingen of veelvoorkomende woorden. Wat telt is of de klinisch betekenisvolle termen kloppen — medicatienamen, doseringen, negaties. Daarom is een lage WER een indicatie, geen garantie.

Waarom medische taal lastig is

Algemene spraakherkenning is getraind op alledaagse taal. De spreekkamer zit vol met woorden die daarin zeldzaam zijn: medicatienamen, Latijnse termen, afkortingen en vakjargon. Daar komt bij: achtergrondgeluid, accenten, snel praten en meerdere sprekers. Al die factoren duwen de WER omhoog.

Wat de nauwkeurigheid bepaalt — en verbetert

  • Audiokwaliteit: een goede microfoon en weinig omgevingsgeluid doen meer dan welke instelling ook.
  • Eigen terminologie: als het systeem jullie formularium en veelgebruikte termen kent, herkent het die woorden veel beter (denk aan "hotwords" die de herkenning sturen).
  • Term-correctie achteraf: een controlestap die veelvoorkomende verhaspelingen van medische termen automatisch rechtzet.
  • Context: moderne modellen wegen de omringende woorden mee, wat losse fouten opvangt.
Nauwkeurigheid is geen vast getal, maar iets dat je vormt: met goede audio, jullie eigen woordenlijst en een correctiestap wordt een generiek model een medisch model.

De arts blijft het vangnet

Ook bij een lage WER geldt: een AI-scribe levert een concept, geen eindproduct. De arts leest het na en corrigeert — precies daar worden de laatste fouten gevangen vóór het het dossier in gaat. Dat is geen zwakte maar het ontwerp: de mens blijft verantwoordelijk, de AI versnelt alleen het typewerk. Zo hoeft de spraakherkenning niet perfect te zijn om enorm veel tijd te besparen.

Zo pakt MedLogica het aan: spraakherkenning op eigen servers, afgestemd op jullie terminologie, met term-correctie en de arts als eindcontrole. Lees hoe de AI-scribe werkt of bekijk de Scribe-pagina.

Bronnen

  1. Fine-tuning van Whisper op het Nederlandse JASMIN-CGN-corpus — WER-cijfers voor Nederlandse spraak. Bekijk het onderzoek
  2. Toepassing van Whisper Large-v2 op Franstalige radiologieverslagen — WER op medische terminologie. Bekijk de studie
FAQ

Veelgestelde vragen over nauwkeurigheid

Wat is WER bij spraakherkenning?
WER staat voor Word Error Rate: het percentage woorden dat verkeerd, gemist of te veel wordt herkend ten opzichte van een correcte referentie. Een lagere WER betekent nauwkeuriger transcriptie.
Waarom is medische spraakherkenning lastiger?
Medische taal zit vol jargon, medicatienamen, afkortingen en Latijnse termen die zeldzaam zijn in alledaagse spraak. Ook achtergrondgeluid, accenten en meerdere sprekers maken het moeilijker.
Hoe verbeter je de nauwkeurigheid?
Door goede audio, en door het systeem jullie eigen terminologie te laten kennen (bijvoorbeeld het formularium), plus term-correctie achteraf. En doordat de arts het concept controleert voordat het het dossier in gaat.

Zelf de nauwkeurigheid ervaren?

Plan een demo — we testen 'm graag op jullie eigen vakjargon en manier van rapporteren.

Demo aanvragen