Kunden ringer for at flytte en tid. Hun står ved køkkenbordet med telefonen på højttaler. Agenten foreslår torsdag kl. 14. Hun siger »ja, det …«, og i samme øjeblik siger hendes mand ved bordet »nej, torsdag skal vi jo ud til mor«.
Agenten har fået to svar på ét spørgsmål, fra to mennesker, i den samme lydstrøm. Den ved ikke, at der er to.
Mandag den 28. september lancerede Fish Audio transskriptionsmodellen transcribe-1-pro, som markerer, hvem der taler i en optagelse. Den indsætter nummererede talermarkeringer og markører som »[latter]« direkte i teksten, til 0,36 dollar pr. lydtime. Det er nyttigt. Det er også et godt udgangspunkt for at forklare, hvorfor problemet er så meget sværere, mens samtalen står på, end bagefter.
Én kanal, alle stemmer
Et almindeligt telefonopkald er én lydkanal. Telefonen opfanger det, mikrofonen hører, og sender det videre som én strøm. Der findes ikke et særskilt spor til kunden og et andet til resten af rummet. Linjen smider desuden en god del af lyden væk undervejs, så det, der når frem til agenten, er både smallere og mere blandet end det, kunden selv hører.
Talegenkendelsen gør det, den er lavet til: Den skriver tale ned. Den skelner ikke mellem tale, der er rettet til agenten, og tale, der bare foregår i nærheden. Fire kilder går igen:
| Hvad der er i rummet | Hvad agenten gør forkert | Hvad der hjælper |
|---|---|---|
| En anden person, der taler | Tager en bemærkning til kunden som et svar | At læse vigtige oplysninger op igen og vente på et ja |
| Radio, tv eller musik i baggrunden | Skriver ord ned, som ingen sagde til den, eller tror, at kunden afbryder | At kræve mere end et par stavelser, før agenten stopper |
| Agentens egen stemme retur | Hører sig selv og afbryder sig selv | Ekkoannullering, testet med højttaler og i bil |
| Et åbent kontorlandskab | Blander kollegers samtaler ind | At kunne håndtere, at kunden siger »vent lige« |
Agenten, der afbryder sig selv
Den tredje række overrasker flest. Når kunden har telefonen på højttaler eller taler gennem bilens håndfri, kommer agentens stemme ud af en højttaler få centimeter fra mikrofonen. Telefonen forsøger at trække den lyd fra igen – det kaldes ekkoannullering – og den er god, men ikke fejlfri. Det, der slipper igennem, går tilbage til agenten.
En agent, der er sat op til at holde op med at tale, så snart den hører tale, gør så præcis det: Den stopper midt i en sætning, fordi den hørte sig selv. For kunden lyder det som en agent, der hakker, eller som aldrig lader hende få et helt svar.
Den samme indstilling afgør, hvad der sker med radioen. Er tærsklen for lav, stopper agenten for hver eneste stemme i baggrunden. Er den for høj, taler den hen over kunden, når hun faktisk vil afbryde. Der findes ikke én rigtig værdi. Den skal afprøves på de opkald, I rent faktisk får.





