Kunden ringer för att flytta en tid. Hon står vid köksbänken med telefonen på högtalare. Agenten föreslår torsdag klockan 14. Hon säger ”ja, det …”, och i samma ögonblick säger hennes man vid bordet ”nej, på torsdag ska vi ju till mamma”.
Agenten har fått två svar på en fråga, från två människor, i samma ljudström. Den vet inte att de är två.
Måndagen den 28 september lanserade Fish Audio transkriberingsmodellen transcribe-1-pro, som markerar vem som talar i en inspelning. Den lägger in numrerade talarmarkeringar och markörer som ”[skratt]” direkt i texten, för 0,36 dollar per ljudtimme. Det är användbart. Det är också en bra ingång för att förklara varför problemet är så mycket svårare medan samtalet pågår än efteråt.
En kanal, alla röster
Ett vanligt telefonsamtal är en enda ljudkanal. Telefonen fångar upp det mikrofonen hör och skickar det vidare som en ström. Det finns inget eget spår för kunden och ett annat för resten av rummet. Linjen slänger dessutom bort en stor del av ljudet på vägen, så det som når agenten är både smalare och mer blandat än det kunden själv hör.
Taligenkänningen gör det den är byggd för: den skriver ner tal. Den skiljer inte på tal som är riktat till agenten och tal som bara förekommer i närheten. Fyra källor återkommer:
| Vad som finns i rummet | Vad agenten gör fel | Vad som hjälper |
|---|---|---|
| En annan person som pratar | Tar en kommentar till kunden som ett svar | Att läsa tillbaka viktiga uppgifter och vänta på ett ja |
| Radio, tv eller musik i bakgrunden | Skriver ner ord som ingen sa till den, eller tror att kunden avbryter | Att kräva mer än ett par stavelser innan agenten tystnar |
| Agentens egen röst i retur | Hör sig själv och avbryter sig själv | Ekosläckning, testad med högtalare och i bil |
| Ett öppet kontorslandskap | Blandar in kollegornas samtal | Att klara av att kunden säger ”vänta lite” |
Agenten som avbryter sig själv
Den tredje raden överraskar flest. När kunden har telefonen på högtalare eller pratar genom bilens handsfree kommer agentens röst ut ur en högtalare några centimeter från mikrofonen. Telefonen försöker dra bort det ljudet igen – det kallas ekosläckning – och den är bra, men inte felfri. Det som släpps igenom går tillbaka till agenten.
En agent som är inställd på att sluta prata så fort den hör tal gör då precis det: den tystnar mitt i en mening för att den hörde sig själv. För kunden låter det som en agent som hackar, eller som aldrig låter henne få ett helt svar.
Samma inställning avgör vad som händer med radion. Är tröskeln för låg tystnar agenten för varje röst i bakgrunden. Är den för hög pratar den över kunden när hon faktiskt vill avbryta. Det finns inget enda rätt värde. Det måste provas på de samtal ni faktiskt får.





