Fra tastatur til samtale
De fleste forbinder kunstig intelligens med tekst: ChatGPT, e-mailassistenter, tekstforfattere og analytiske sprogmodeller. Men det er let at glemme én grundlæggende sandhed:
Mennesket er ikke skabt til tastaturet. Vi er skabt til stemmen.
Vi taler, før vi skriver. Vi bruger tonefald, pauser, latter og tøven til at formidle mening. Vi afbryder, tænker højt og gør ikke altid vores sætninger færdige. Alt det er naturligt for os – men ekstremt svært for maskiner.
Derfor er Voice AI det næste store skridt inden for kunstig intelligens. Det handler ikke kun om at få maskiner til at læse tekst op. Det handler om at få dem til at forstå, svare og handle i naturlige samtaler – på ægte menneskelig vis.
Og det er præcis det, Threll Voice Lab er bygget til at mestre.
Hvad er Voice AI – helt konkret?
Voice AI er teknologi, der lader mennesker tale direkte med kunstig intelligens – uden tastatur, skærm eller menuer. Når du taler med en stemmeagent fra Threll, sker der en lynhurtig kæde af processer i løbet af nogle få hundrededele af et sekund.
Den proces kaldes taleprocessen og består af fem trin:
1. ASR – Automatic Speech Recognition
Tale ind → Tekst ud
ASR er systemets ører. Det er her, din stemme oversættes til tekst, som AI'en kan forstå. Det lyder enkelt, men det er en af de sværeste udfordringer inden for norsk Voice AI. ASR skal håndtere:
- Norske dialekter, nynorsk og regionale udtryk.
- Telefonlinjer, der skærer store dele af lydspektret væk (kun 300–3400 Hz).
- Bluetooth-forsinkelser og ustabil båndbredde.
- Baggrundsstøj, ekko og overlappende tale.
I Threll Voice Lab træner vi ASR på ægte norske stemmer – fra hele landet – så systemet lærer, hvordan folk faktisktaler. Ikke sådan som de skriver.
2. NLU / LLM – Natural Language Understanding
Tekst → Forståelse
Når ordene er transskriberet, skal AI'en forstå, hvad du mener. NLU handler om semantik – altså om at fortolke meningen bag det, du siger. Norsk er fuld af korte, ufuldstændige og flertydige udtryk:
«Ja, det kan du godt gjøre.» «Kanskje. Vi får se.» «Nei, vent litt – jeg mente tirsdag, ikke torsdag!»
NLU (ofte drevet af store sprogmodeller, såkaldte LLM'er) skal finde ud af:
- Hvad er hensigten (bestille, afbryde, spørge, bekræfte)?
- Hvilke nøgleoplysninger er nævnt (navn, dato, produkt, sted)?
- Hvad betyder tonefaldet – er brugeren tilfreds, irriteret, usikker?
3. Dialog Manager
Styrer samtaleflowet
Dialog Manager (DM) er den hjerne, der holder styr på konteksten i samtalen. Den afgør:
- Hvornår AI'en skal tale, og hvornår den skal lytte.
- Hvad der er sagt tidligere, og hvad der mangler.
- Hvordan afbrydelser, overlappende tale og spørgsmål uden for emnet skal håndteres.
Uden en god Dialog Manager bliver samtaler kaotiske. En professionel DM sørger for, at samtalen flyder naturligt – også når du taler i munden på AI'en, præcis som mennesker gør.
4. Action Layer
Forståelse → Handling
Her ligger kernen i Thrells tilgang: AI'en skal ikke kun tale – den skal gøre noget.
Action-laget kobler sig til kundens egne systemer, som:
- CRM (HubSpot, Salesforce, SuperOffice)
- ERP (Visma, SAP, Tripletex)
- Ordre- og bookingsystemer
- Kundeserviceværktøjer
Når du siger:
«Kan du sende mig en kopi af fakturaen fra juni?» … så gør Voice AI præcis det. Den finder fakturaen, sender den og fortæller dig, når det er gjort.
Det er forskellen mellem en snakkende robot og en stemmeagent, der faktisk skaber værdi i virksomhedens værdikæde.





