Kunden ringer for å flytte en time. Hun står ved kjøkkenbenken med telefonen på høyttaler. Agenten foreslår torsdag klokka 14. Hun sier «ja, det …», og i samme øyeblikk sier mannen hennes ved bordet «nei, torsdag skal vi jo til mor».
Agenten har fått to svar på ett spørsmål, fra to mennesker, i den samme lydstrømmen. Den vet ikke at det er to.
Mandag 28. september lanserte Fish Audio transkripsjonsmodellen transcribe-1-pro, som merker hvem som snakker i et opptak. Den setter inn nummererte talermerker og markører som «[latter]» rett i teksten, til 0,36 dollar per lydtime. Det er nyttig. Det er også et godt utgangspunkt for å forklare hvorfor problemet er så mye vanskeligere mens samtalen pågår enn etterpå.
Én kanal, alle stemmer
En vanlig telefonsamtale er én lydkanal. Telefonen fanger opp det mikrofonen hører og sender det videre som én strøm. Det finnes ikke et eget spor for kunden og et annet for resten av rommet. Linja kaster dessuten bort en god del av lyden underveis, så det som når agenten, er både smalere og mer blandet enn det kunden selv hører.
Talegjenkjenningen gjør det den er laget for: den skriver ned tale. Den skiller ikke mellom tale som er ment for agenten, og tale som bare skjer i nærheten. Fire kilder går igjen:
| Hva som er i rommet | Hva agenten gjør feil | Hva som hjelper |
|---|---|---|
| En annen person som snakker | Tar en kommentar til kunden som et svar | Bekrefte viktige opplysninger tilbake og vente på et ja |
| Radio, TV eller musikk i bakgrunnen | Skriver ned ord ingen sa til den, eller tror kunden avbryter | Kreve mer enn et par stavelser før agenten stopper |
| Agentens egen stemme i retur | Hører seg selv og avbryter seg selv | Ekkodemping, testet med høyttaler og bil |
| Et åpent kontorlandskap | Blander inn kollegers samtaler | Tåle at kunden sier «vent litt» |
Agenten som avbryter seg selv
Den tredje raden overrasker flest. Når kunden har telefonen på høyttaler eller snakker gjennom bilens handsfree, kommer agentens stemme ut av en høyttaler noen centimeter fra mikrofonen. Telefonen prøver å trekke den lyden fra igjen – det kalles ekkodemping – og den er god, men ikke feilfri. Det som slipper gjennom, går tilbake til agenten.
En agent som er satt opp til å slutte å snakke straks den hører tale, gjør da nøyaktig det: den stopper midt i en setning fordi den hørte seg selv. For kunden høres det ut som en agent som hakker, eller som aldri lar henne få et helt svar.
Den samme innstillingen avgjør hva som skjer med radioen. Er terskelen for lav, stopper agenten for hver stemme i bakgrunnen. Er den for høy, snakker den over kunden når hun faktisk vil avbryte. Det finnes ikke én riktig verdi. Den må prøves på de samtalene dere faktisk får.





