En pilot slutter påfaldende ofte med sætningen »det gik fint«. Ingen ved helt, hvad der gik fint, og ingen kan sige, hvad der skulle til, for at det ikke gjorde det.
Det skyldes sjældent, at teknologien er uklar. Det skyldes, at piloten blev sat op som en demonstration i stedet for en prøve. En demonstration har til formål at vise, at noget kan fungere, og det lykkes den næsten altid. En prøve har til formål at finde ud af, om det gør det – og den skal derfor kunne gå galt.
To uger er nok. Den mest almindelige fejl er at bruge tre måneder på noget, der var afgjort efter ni hverdage. Nedenfor står den rækkefølge, der gør de to uger til en beslutning i stedet for en anbefaling.
1. Skriv beslutningen ned, før du skriver samtalen
Første sætning i pilotdokumentet skal ikke handle om agenten. Den skal handle om, hvad I skal gøre den femtende i næste måned.
»Vi skal afgøre, om agenten skal tage alle indgående tidsbestillinger uden for åbningstid fra 1. oktober« er en beslutning. »Vi skal teste voice AI« er det ikke.
Skriv derefter den sværere halvdel ned: hvilket resultat betyder nej. Ét tal, aftalt før I har set nogen data. Kan ingen formulere, hvad der ville få jer til at aflyse, kommer I ikke til at aflyse – uanset hvad de to uger viser.
2. Vælg én samtaletype, ikke én afdeling
»Kundeservice« er ikke en samtaletype. Det er tyve.
Vælg én med højt volumen, kort levetid og et tydeligt slutpunkt: bekræfte en tid, oplyse status på en sag, tage imod en afbestilling, registrere en fejlmelding. Noget I kan tælle før og efter.
Indvendingen kommer med det samme: de nemme samtaler er vel ikke værd at automatisere. Den er forkert på to måder. De nemme er de fleste, og de er de eneste, der giver et rent svar på to uger. En pilot lagt på de svære samtaler måler ikke agenten. Den måler eskaleringen.
3. Mål nulpunktet i fem dage, før agenten tændes
Næsten ingen gør det, og det er grunden til, at næsten ingen piloter beviser noget.
Fem almindelige hverdage, agenten slukket. Tæl hvor mange der ringede om den valgte samtaletype, hvor mange der fik svar, hvor længe de ventede, hvor mange der lagde på, før nogen tog den – og hvor mange der ringede igen om det samme inden for et døgn.
Det sidste tal er det vigtigste, og det eneste, der er lidt bøvlet at trække ud. Tag det arbejde nu. Om to uger er det den eneste linje, I kommer til at diskutere.
4. Aftal vejen ud, før I aftaler vejen ind
Det, der afgør, om piloten opleves som vellykket, er ikke åbningsreplikken. Det er, hvad der sker, når agenten ikke kommer videre.
Beslut tre ting før første samtale: hvad der udløser en omstilling, hvad mennesket får at vide, når samtalen kommer, og hvad der sker, når ingen tager den. Eskaleringen er den del, det er dyrest at gøre halvt, og i en pilot er den også den del, alle lægger mærke til.
Sæt tærsklen lavt de første dage. En agent, der stiller om for tidligt, giver jer en liste over, hvad den ikke magtede. En agent, der holder fast for længe, giver jer irriterede kunder og ingen liste.
5. Uge 1: begræns volumen, ikke ambitionen
Lad ikke agenten tage ti procent af arbejdet på alle samtalerne. Lad den tage hele arbejdet på ti procent af samtalerne.
En agent, der løser én sagstype helt, på et lille volumen, er målbar. En agent, der gør lidt af hvert på hele volumenet, er det ikke – så sidder I tilbage med et indtryk og ikke et resultat.
Agenten skal oplyse, at den er AI, i første replik. Det er en pligt, ikke et virkemiddel, og den gælder også i en pilot, også når volumenet er lille. Det er desuden en dårlig idé at lade være: en pilot, der skjuler, hvad agenten er, måler noget, I ikke må drive bagefter.
6. Uge 2: tag hjælpen væk
I den første uge er der nogen, der følger tæt med. Nogen justerer en formulering om tirsdagen, retter en fejl om onsdagen, sidder ved siden af om torsdagen.
Det er rigtigt i uge 1 og ødelæggende i uge 2. Et system, der ændres hver dag, kan ikke måles – så måler I jeres egen opmærksomhed og ikke agenten.
Frys konfigurationen mandag morgen i uge 2. Skriv alt ned, I har lyst til at ændre, og lad det stå til fredag. Listen bliver kortere, end I tror.
7. Lyt til tyve samtaler, I ikke har valgt ud
Træk tyve tilfældigt. Ikke de tyve korteste, ikke de tyve leverandøren foreslår, ikke de tyve, der blev eskaleret.
Tallene fortæller, hvor ofte noget skete. De tyve samtaler fortæller, hvad der skete – og de er den eneste kilde til de fejl, der ikke har nogen tæller bag sig: agenten, der bekræftede den forkerte dato i helt korrekt format, kunden, der gav op uden at lægge på, ordet ingen havde tænkt på, at folk faktisk bruger om jeres produkt.
Sæt to timer af. Lad den, der skal drive det til daglig, sidde med.
8. Afgør på tallet fra punkt 1
Fredag i uge 2 lægger I nulpunktet fra punkt 3 ved siden af de to uger og læser den ene linje, I blev enige om på forhånd.
Modstå fristelsen til at skifte tal. Den kommer, og den kommer pænt pakket ind: den gennemsnitlige samtaletid er faldet, svarprocenten er højere, agenten håndterede 340 samtaler uden at brokke sig. Det er tal, der smigrer, og de er som regel sande. De er bare ikke det, I spurgte om.
Det, to uger ikke kan afgøre
Ti hverdage siger intet om drift over tid. Intet om, hvad der sker mellem jul og nytår, om hvordan agenten opfører sig, når en integration ligger ned, eller om hvad der sker med opsætningen, når den, der byggede den, siger op.
Piloten kan afgøre én ting, og den ene er to uger værd: om denne samtaletype bliver bedre eller værre for kunden, når agenten tager den.
Threll.ai bygger stemmeagenter på dansk, norsk og svensk. En pilot, der ikke kunne være endt i nej, har ikke svaret på noget. Den har brugt to uger på at bekræfte, at nogen allerede havde besluttet sig.




