Fra tastatur til samtale
De fleste forbinder kunstig intelligens med tekst: ChatGPT, e-postassistanter, tekstforfattere og analytiske språkmodeller. Men det er lett å glemme én grunnleggende sannhet:
Mennesket er ikke laget for tastaturet. Vi er laget for stemmen.
Vi snakker før vi skriver. Vi bruker tonefall, pauser, latter og nøling for å formidle mening. Vi avbryter, tenker høyt og fullfører ikke alltid setningene våre. Alt dette er naturlig for oss – men ekstremt vanskelig for maskiner.
Derfor er Voice AI det neste store steget i kunstig intelligens. Det handler ikke bare om å få maskiner til å lese opp tekst. Det handler om å få dem til å forstå, svare og handle i naturlige samtaler – på ekte menneskelig vis.
Og det er nettopp dette Threll Voice Lab er bygget for å mestre.
Hva er Voice AI – egentlig?
Voice AI er teknologi som lar mennesker snakke direkte med kunstig intelligens – uten tastatur, skjerm eller menyer. Når du snakker med en stemmeagent fra Threll, skjer det en lynrask kjede av prosesser i løpet av noen hundredeler av et sekund.
Denne prosessen kalles taleprosessen, og består av fem trinn:
1. ASR – Automatic Speech Recognition
Tale inn → Tekst ut
ASR er ørene til systemet. Det er her stemmen din oversettes til tekst som AI-en kan forstå. Dette høres enkelt ut, men det er en av de vanskeligste utfordringene i norsk Voice AI. ASR må håndtere:
- Norske dialekter, nynorsk og regionale uttrykk.
- Telefonlinjer som klipper bort store deler av lydspekteret (bare 300–3400 Hz).
- Bluetooth-forsinkelser og ustabil båndbredde.
- Bakgrunnsstøy, ekko og overlappende tale.
I Threll Voice Lab trener vi ASR på ekte norske stemmer – fra hele landet – slik at systemet lærer hvordan folk faktisksnakker. Ikke slik de skriver.
2. NLU / LLM – Natural Language Understanding
Tekst → Forståelse
Når ordene er transkribert, må AI-en forstå hva du mener. NLU handler om semantikk – altså å tolke meningen bak det du sier. Språket vårt er fullt av korte, ufullstendige og tvetydige uttrykk:
«Ja, det kan du godt gjøre.» «Kanskje. Vi får se.» «Nei, vent litt – jeg mente tirsdag, ikke torsdag!»
NLU (ofte drevet av store språkmodeller, såkalte LLM-er) må finne ut:
- Hva er intensjonen (bestille, avbryte, spørre, bekrefte)?
- Hvilke nøkkelinformasjoner er nevnt (navn, dato, produkt, sted)?
- Hva betyr tonefallet – er brukeren fornøyd, irritert, usikker?
3. Dialog Manager
Styrer samtaleflyten
Dialog Manager (DM) er hjernen som holder styr på konteksten i samtalen. Den avgjør:
- Når AI-en skal snakke, og når den skal lytte.
- Hva som er sagt tidligere, og hva som gjenstår.
- Hvordan håndtere avbrytelser, overlappende tale og spørsmål utenfor tema.
Uten en god Dialog Manager blir samtaler kaotiske. En profesjonell DM sørger for at samtalen flyter naturlig, selv når du snakker i munnen på AI-en – akkurat som mennesker gjør.
4. Action Layer
Forståelse → Handling
Her ligger kjernen i Threll sin tilnærming: AI-en skal ikke bare snakke – den skal gjøre noe.
Action-laget kobler seg til kundens egne systemer, som:
- CRM (HubSpot, Salesforce, SuperOffice)
- ERP (Visma, SAP, Tripletex)
- Ordre- og bookingsystemer
- Kundeserviceverktøy
Når du sier:
«Kan du sende meg en kopi av fakturaen fra i juni?» … så gjør Voice AI nettopp det. Den finner fakturaen, sender den, og forteller deg når det er gjort.
Dette er forskjellen mellom en pratende robot og en stemmeagent som faktisk skaper verdi i bedriftens verdikjede.





