Samtalsförlopp

Ett kundsamtal, moment för moment. Sju led som kan brista.

OpenAI har nu satt en prislapp på enbart röstlagret: 0,05 dollar i minuten för den del som hör och talar. Det gör det värt att gå igenom ett helt vanligt samtal led för led och se vem som egentligen äger vart och ett av dem.

Sett från en korridor genom en öppen dörröppning in i en tom personalmatsal i eftermiddagssol: en kvinna med headset står längst bort vid fönsterväggen med ryggen halvt vänd, medan en man i ljus skjorta sitter närmare kameran vid långbordet med händerna knäppta, en mugg och en mobil med skärmen nedåt framför sig

Den 10 september lade OpenAI ut GPT-Live-1 i API:et, till 0,05 dollar i minuten. Priset gäller uttryckligen bara röstlagret – den del som hör och talar. Det djupare resonerandet och verktygsanropen läggs ut på en textmodell som utvecklaren väljer själv och betalar för vid sidan av.

Det är en träffsäker beskrivning av något som varit sant ett tag: en röstagent är inte en enda sak. Den är en rad led som måste hålla i tur och ordning, inom några få sekunder, i en bestämd följd. Här är ett helt vanligt samtal – en butiksägare som ringer sin leverantör om en felleverans – och vad som måste stämma i varje led.

Telefonen ringer

Det första ledet har ingenting med AI att göra. Samtalet ska gå från kundens operatör, in på ert nummer, genom telefonileverantören och fram till agenten, helst inom tre eller fyra ringsignaler.

Det är också det enda ledet utan något att falla tillbaka på. Brister det hör kunden ingenting alls. Vem som äger numret, och vart samtalet går om agenten inte svarar, avgörs här – inte i en diskussion om modellval.

Den första meningen

Agenten säger något. Det är den enda mening som hundra procent av dem som ringer får höra, och den ska göra fyra saker samtidigt: säga vem som svarar, säga att det är en AI, ge en väg ut, och ställa en fråga som är tillräckligt öppen för att kunden ska börja berätta.

Felet är nästan alltid detsamma. Meningen skrevs sist, på fem minuter, av någon som skulle bli klar.

”Ja, hej – det gäller en leverans som kom i går”

Kunden berättar allt på en gång, i fel ordning, med ett sidospår om att han ringde förra veckan också. Ingen talar i formulärfält.

Det som måste hålla här är att agenten inte försöker styra tillbaka honom till steg ett. Den ska plocka upp det den fick gratis – att det gäller en leverans, att den kom i går, att något är fel – och bara fråga om det som saknas. En agent som frågar om något den redan fått svar på är det snabbaste sättet att förlora ett samtal.

Ordernumret

Nu ska en rad siffror läsas upp, och det är den svagaste punkten i hela kedjan. Siffror är det svåraste en röstagent hör, och telefonlinjen kastar samtidigt bort mycket av det som skiljer siffrorna åt.

Det som måste vara sant här är inte att agenten hör rätt varje gång. Det är att den läser tillbaka numret när den är osäker, i stället för att skriva in något som bara ser rimligt ut.

Vill du prata med någon som har gjort det här förut?

Femton minuter på telefon eller video. Vi säger ärligt om en röstagent passar er – och vad som måste vara klart innan den går i drift.

15 minuter · förutsättningslöst · välj tid själv

De fyra sekunderna då ingen säger något

Agenten har numret. Nu ska något slås upp i ett system, och det tar tid. I en kedjad uppsättning är det oftast här samtalet faller isär: agenten tystnar, kunden tror att linjen är död, och sedan talar båda samtidigt.

Just det här ledet är den nya modellgenerationen byggd för. OpenAI kallar det ”silent context management” – att hantera tystnad och bakgrundsljud utan att avbryta samtalet eller berätta högt om varje steg på vägen. Språktjänsten Speak uppger att avbrotten under elevernas tankepauser minskade med nästan 80 procent jämfört med deras tidigare, turbaserade uppsättning.

Men om de fyra sekunderna känns rätt avgörs inte av modellen ensam. Det avgörs av om någon har bestämt vad agenten gör medan den väntar – och vad den säger om svaret aldrig kommer tillbaka.

Man i femtioårsåldern i mörk arbetsskjorta står i baklokalet i en butik med mobilen mot höger öra och ett blankt papper i vänster hand, bredvid en uppskuren kartong på hyllan, med staplade kartonger mot väggen till vänster och hårt sidoljus från höger
Led fem: sekunderna då agenten väntar på ett system, och den som ringer inte vet om linjen fortfarande lever.

Svaret agenten inte får ge

Svaret kommer tillbaka: fel vara skickad, och det är leverantörens fel. Kunden frågar om han får en kreditnota.

Här slutar samtalet handla om teknik. Agenten kan mycket väl formulera ett svar. Frågan är om någon har bestämt att den får. Ett ja på ett krav binder er oavsett om det kommer från en anställd eller från en agent, och den gränsen bör stå nedskriven före det första samtalet, inte efter det första klagomålet.

Överlämningen

Agenten kopplar vidare. Om den som svarar öppnar med ”hej, vad gäller saken?” var de fyra föregående minuterna bortkastade – och värre: kunden har nu förklarat samma sak två gånger för samma företag.

Det är kontexten som försvinner vid en överlämning, och den försvinner hur bra röstmodellen än var. Det här ledet följer inte med modellen. Det måste byggas.

Vad ett modellbyte faktiskt löser

Sju led. Ett av dem är röstmodellen.

Det nyttiga med att priset nu anges för sig är att det blir tydligt vad en uppgradering kan och inte kan lösa. En bättre röstmodell hjälper i led tre, fyra och fem. Den gör ingenting åt vem som äger numret, vad agenten får lova, eller vad människan får veta när hon tar över.

Threll.ai bygger röstagenter på svenska, norska och danska. Gå igenom de sju leden i er egen uppsättning och markera vilka som skulle bli bättre av en ny modell. Det är sällan samma led som faktiskt håller projektet tillbaka.