Lyd og talegenkendelse

Agenten hørte to stemmer. Den troede, begge var kunden.

Et telefonopkald kommer ind som én lydkanal, og alt, hvad mikrofonen opfanger, havner i den: kunden, den, der sidder ved bordet i køkkenet, radioen – og agentens egen stemme, der kommer retur. Hvorfor det er et af de sværeste problemer i en stemmeagent, forklaret uden fagsprog.

Set over skulderen på en mand ved et spisebord i et køkken: en kvinde i rustrød strikbluse står ved køkkenbordet og taler ind i den mobil, hun holder fladt foran munden, med den anden hånd løftet mod manden, som gestikulerer mod hende. Eftermiddagssol gennem persienner falder hen over bordpladen og en lille radio.

Kunden ringer for at flytte en tid. Hun står ved køkkenbordet med telefonen på højttaler. Agenten foreslår torsdag kl. 14. Hun siger »ja, det …«, og i samme øjeblik siger hendes mand ved bordet »nej, torsdag skal vi jo ud til mor«.

Agenten har fået to svar på ét spørgsmål, fra to mennesker, i den samme lydstrøm. Den ved ikke, at der er to.

Mandag den 28. september lancerede Fish Audio transskriptionsmodellen transcribe-1-pro, som markerer, hvem der taler i en optagelse. Den indsætter nummererede talermarkeringer og markører som »[latter]« direkte i teksten, til 0,36 dollar pr. lydtime. Det er nyttigt. Det er også et godt udgangspunkt for at forklare, hvorfor problemet er så meget sværere, mens samtalen står på, end bagefter.

Én kanal, alle stemmer

Et almindeligt telefonopkald er én lydkanal. Telefonen opfanger det, mikrofonen hører, og sender det videre som én strøm. Der findes ikke et særskilt spor til kunden og et andet til resten af rummet. Linjen smider desuden en god del af lyden væk undervejs, så det, der når frem til agenten, er både smallere og mere blandet end det, kunden selv hører.

Talegenkendelsen gør det, den er lavet til: Den skriver tale ned. Den skelner ikke mellem tale, der er rettet til agenten, og tale, der bare foregår i nærheden. Fire kilder går igen:

Hvad der er i rummet Hvad agenten gør forkert Hvad der hjælper
En anden person, der taler Tager en bemærkning til kunden som et svar At læse vigtige oplysninger op igen og vente på et ja
Radio, tv eller musik i baggrunden Skriver ord ned, som ingen sagde til den, eller tror, at kunden afbryder At kræve mere end et par stavelser, før agenten stopper
Agentens egen stemme retur Hører sig selv og afbryder sig selv Ekkoannullering, testet med højttaler og i bil
Et åbent kontorlandskab Blander kollegers samtaler ind At kunne håndtere, at kunden siger »vent lige«

Agenten, der afbryder sig selv

Den tredje række overrasker flest. Når kunden har telefonen på højttaler eller taler gennem bilens håndfri, kommer agentens stemme ud af en højttaler få centimeter fra mikrofonen. Telefonen forsøger at trække den lyd fra igen – det kaldes ekkoannullering – og den er god, men ikke fejlfri. Det, der slipper igennem, går tilbage til agenten.

En agent, der er sat op til at holde op med at tale, så snart den hører tale, gør så præcis det: Den stopper midt i en sætning, fordi den hørte sig selv. For kunden lyder det som en agent, der hakker, eller som aldrig lader hende få et helt svar.

Den samme indstilling afgør, hvad der sker med radioen. Er tærsklen for lav, stopper agenten for hver eneste stemme i baggrunden. Er den for høj, taler den hen over kunden, når hun faktisk vil afbryde. Der findes ikke én rigtig værdi. Den skal afprøves på de opkald, I rent faktisk får.

Vil du tale med nogen, der har gjort det før?

Femten minutter på telefon eller video. Vi siger ærligt, om en stemmeagent passer til jer – og hvad der skal være afklaret, før den går i drift.

15 minutter · uforpligtende · vælg selv tid

Hvorfor det er lettere bagefter

At adskille talere i en færdig optagelse er en anden opgave end at gøre det, mens samtalen står på. Bagefter har modellen hele samtalen. Den kan høre, at stemme nummer to dukker op igen og igen, sammenligne og gå tilbage. Under samtalen har agenten nogle få stavelser og en brøkdel af et sekund til at afgøre, om den skal svare.

Fish Audio skriver selv, at talernumrene kun gælder inden for én optagelse. De siger ikke, hvem personen er – og heller ikke, hvem af dem der holder telefonen.

Det betyder ikke, at markeringen er værdiløs. Den hører hjemme i gennemgangen bagefter. Med talermarkeringer i sporet over, hvad agenten sagde, bliver det muligt at finde de opkald, hvor en anden stemme end kundens styrede udfaldet. Det er et bedre udgangspunkt for at justere opsætningen end en samlet fejlrate.

Løsningen er ikke kun lydbehandling

Den mest robuste løsning ligger i samtaledesignet. Hvert led i samtalen har sit eget punkt, hvor den kan gå i stykker, og her er der tre vaner, der klarer det meste:

Bekræft det, der koster noget. Tid, dato, navn og beløb siges tilbage, og agenten venter på et tydeligt ja: »Så flytter jeg din tid til fredag kl. 10. Passer det?« Et spørgsmål, der er rettet direkte til den, der ringer, bliver som regel besvaret af den, der ringer.

Læg mærke til modsigelser. Kommer der to forskellige svar på det samme spørgsmål inden for et par sekunder, er det et signal i sig selv. Agenten bør spørge én gang til i stedet for at vælge det sidste, den hørte.

Håndtér »vent lige«. Kunder taler ofte med en anden midt i opkaldet. En agent, der forstår »vent lige« og »jeg skal lige spørge min mand«, og som så venter i stedet for at tolke det, der bliver sagt bagefter, har løst en stor del af problemet.

Test det dér, hvor kunderne faktisk ringer fra

En opsætning, der er testet fra et stille mødelokale med hovedtelefoner, er testet under de bedste forhold, den nogensinde kommer til at møde. Ring hellere til jeres eget nummer fra bilen med håndfri, fra køkkenet med radioen tændt og med telefonen på højttaler, mens en kollega taler ved siden af. Lyt efter, om agenten stopper, når den ikke skal. Læs transskriptionen bagefter: Står der ord i den, som ingen sagde til agenten?

Kunder ringer sjældent fra et stille rum. Agenten hører kun én linje, men den skal opføre sig, som om den ved, at den ikke er alene i samtalen.

Threll.ai bygger stemmeagenter på dansk, svensk og norsk. Testen ovenfor tager en halv time, og den kan laves i dag.