Tillgänglighet

”Röst är det mest inkluderande gränssnittet.” Hälften av påståendet stämmer.

Argumentet för att låta en agent svara i telefon är ofta att telefonen är den enda kanal alla kan använda. Det stämmer för fler än man tror – och inte för en grupp som nästan aldrig finns med i kalkylen.

Kvinna i sextioårsåldern i ljus kofta sitter ensam vid ett litet ekbord i hörnet av ett vardagsrum, halvt vänd mot fönstret, och håller mobilen en bit från örat medan den andra handen vilar vid ett uppslaget anteckningsblock; flackt dagsljus från fönstret till vänster och en låg bokhylla längs väggen bakom

Påståendet dyker upp tidigt i nästan varje projekt, och det blir sällan ifrågasatt: en app kräver att du letar rätt på den, loggar in, träffar rätt knapp och läser det finstilta. Telefonen kräver bara att du talar. Alla kan tala.

Första halvan av det stämmer, och den är viktigare än kritikerna av röstagenter brukar medge.

Vem telefonen faktiskt öppnar dörren för

För någon som är blind eller synskadad är en telefonlinje ett gränssnitt utan skärm att navigera i. För någon med dyslexi är det ett gränssnitt utan formulär. För någon som inte har en smartmobil, eller inte har fått BankID att fungera, är det den enda vägen in i ett företag som har flyttat resten av kontaktytan till nätet. Och för någon som inte har svenska som förstaspråk är det ofta lättare att förklara ett problem med egna ord än att hitta rätt kategori i en rullgardinsmeny.

Det är ingen liten grupp. I praktiken är telefonen reservlösningen för alla de fall där självbetjäning inte passar – och en agent som svarar på första signalen, dygnet runt, gör den reservlösningen märkbart bättre än en kö med väntemusik.

Så långt håller påståendet.

Där det slutar gälla

”Alla kan tala” är ett påstående om människan. Det säger ingenting om maskinen.

En taligenkänningsmodell hör bra det som liknar det den är tränad på, och sämre allt som ligger längre bort. De små utslagen av det har vi skrivit om tidigare: telefonlinjen slänger bort en hel del av signalen innan modellen ens får den. Längre ut på skalan ser det helt annorlunda ut.

Ett forskarlag vid Stony Brook University mätte i höstas Whisper mot TORGO-datamängden – inspelningar av åtta personer med dysartri, en motorisk talstörning som beror på skada i nervsystemet, till exempel efter stroke, vid cerebral pares eller vid ALS. Utan någon anpassning hörde Whisper-small i genomsnitt fel på 71 procent av orden.

Genomsnittet är inte det intressanta. Spannet är det. Av de åtta hade den med lindrigast utslag en felfrekvens på 7 procent – ungefär som för alla andra. Den med kraftigast utslag låg över 100 procent, alltså fler fel än det fanns ord att höra fel på. Samma modell, samma uppgift, samma diagnos, och två helt olika tjänster.

Studien är liten, och författarna säger det själva: åtta personer, engelskt tal, en modellfamilj. Men mekanismen är inte engelsk. Den gäller lika mycket för stamning, för afasi efter stroke, för tal efter en struphuvudoperation, för mycket långsamt tal – och i mildare grad för kraftig brytning.

Samma kanal, två grupper

Telefonen är lättare Telefonen är svårare
Varför Ingen skärm, inget formulär, ingen inloggning Talet liknar föga det modellen är tränad på
För vem Blinda och synskadade, personer med dyslexi, äldre utan smartmobil, personer utan fungerande e-legitimation Dysartri, afasi, stamning, tal efter struphuvudoperation, mycket långsamt tal
Vad som händer Kommer i kontakt utan att be någon om hjälp Blir inte förstådd, försöker igen, ger upp

Det är det obehagliga med påståendet: samma kanal är samtidigt den mest och den minst tillgängliga. Vilket av de två den är för dig beror inte på om du har en funktionsnedsättning, utan på vilken.

Vill du prata med någon som har gjort det här förut?

Femton minuter på telefon eller video. Vi säger ärligt om en röstagent passar er – och vad som måste vara klart innan den går i drift.

15 minuter · förutsättningslöst · välj tid själv

Det som gör det värre än felfrekvensen antyder

Ett formulär väntar på dig. En agent gör inte det. Tre helt vanliga inställningar straffar den som behöver längre tid.

Tidsgränsen. Agenten tolkar en paus som att den som ringer är klar, och börjar tala. För den som stammar ligger pausen mitt inne i ordet.

Bekräftelseslingan. Agenten hör fel, ber om en upprepning, hör fel igen. Tredje gången lägger folk på. Det är inget tekniskt avbrott, och det hamnar inte i någon felstatistik.

Vägen ut kräver tal. Uppmaningen att säga ”medarbetare” för att bli kopplad vidare fungerar inte för den som just inte blir förstådd. Utgången är stängd av samma skäl som ingången.

Fyra beslut

Svaret är inte att låta bli att låta en agent svara i telefon. Det skulle drabba den första gruppen för att skona den andra.

  1. En väg ut som inte kräver att agenten förstår något. En knapptryckning är det enklaste: ”tryck noll, så kopplar jag dig vidare”. Det fungerar oavsett vad den som ringer säger eller inte säger, och kostar ingenting att lägga in. Vart knapptryckningen går, och vad som händer om ingen svarar, är samma beslut som all annan eskalering.
  2. Längre tröskel innan agenten tar ordet. Standardvärdena är satta för att göra samtalet snabbt. De är inte satta för dem som behöver tid på en mening.
  3. Automatisk koppling efter två misslyckade försök. Inte tre, inte fem. Har agenten frågat om samma sak två gånger är chansen att tredje gången löser det liten, och kostnaden för den som ringer hög.
  4. Mät bortfallet, inte genomsnittet. Igenkänningen kan vara utmärkt i snitt samtidigt som en liten grupp aldrig kommer fram. Siffror som ser bra ut på ett målkort säger sällan något om det enskilda samtalet. Ta fram de samtal där den som ringde lade på inom de första nittio sekunderna, och lyssna på tio av dem.

Det ligger inte hos den som ringer

Vi har tidigare gått igenom samtalet där agenten hörde allt, men den som ringde inte gjorde det. Det här är den motsatta riktningen, och den är lättare att missa, för den ser inte ut som ett fel i loggen. Den ser ut som en kund som lade på.

Röst är det mest inkluderande gränssnittet för de allra flesta. Det är inte detsamma som för alla. Skillnaden ligger inte hos den som ringer, utan i vad ni har bestämt ska hända tredje gången agenten inte förstår.

Threll.ai bygger röstagenter på svenska, norska och danska. Testet tar fem minuter: ring ert eget nummer, säg en mening medvetet otydligt, och räkna hur många försök ni får innan ni är ute ur samtalet.