Voice Lab

Fra tekst til tale – derfor handler AI's fremtid om stemmen

Threll Voice Lab bygger stemmeagenter, der forstår norsk og alle dialekter – og som ikke kun taler, men handler.

IngridIngrid,
Class room

Fra tastatur til samtale

De fleste forbinder kunstig intelligens med tekst: ChatGPT, e-mailassistenter, tekstforfattere og analytiske sprogmodeller. Men det er let at glemme én grundlæggende sandhed:

Mennesket er ikke skabt til tastaturet. Vi er skabt til stemmen.

Vi taler, før vi skriver. Vi bruger tonefald, pauser, latter og tøven til at formidle mening. Vi afbryder, tænker højt og gør ikke altid vores sætninger færdige. Alt det er naturligt for os – men ekstremt svært for maskiner.

Derfor er Voice AI det næste store skridt inden for kunstig intelligens. Det handler ikke kun om at få maskiner til at læse tekst op. Det handler om at få dem til at forstå, svare og handle i naturlige samtaler – på ægte menneskelig vis.

Og det er præcis det, Threll Voice Lab er bygget til at mestre.

Hvad er Voice AI – helt konkret?

Voice AI er teknologi, der lader mennesker tale direkte med kunstig intelligens – uden tastatur, skærm eller menuer. Når du taler med en stemmeagent fra Threll, sker der en lynhurtig kæde af processer i løbet af nogle få hundrededele af et sekund.

Den proces kaldes taleprocessen og består af fem trin:

1. ASR – Automatic Speech Recognition

Tale ind → Tekst ud

ASR er systemets ører. Det er her, din stemme oversættes til tekst, som AI'en kan forstå. Det lyder enkelt, men det er en af de sværeste udfordringer inden for norsk Voice AI. ASR skal håndtere:

  • Norske dialekter, nynorsk og regionale udtryk.
  • Telefonlinjer, der skærer store dele af lydspektret væk (kun 300–3400 Hz).
  • Bluetooth-forsinkelser og ustabil båndbredde.
  • Baggrundsstøj, ekko og overlappende tale.

I Threll Voice Lab træner vi ASR på ægte norske stemmer – fra hele landet – så systemet lærer, hvordan folk faktisktaler. Ikke sådan som de skriver.

2. NLU / LLM – Natural Language Understanding

Tekst → Forståelse

Når ordene er transskriberet, skal AI'en forstå, hvad du mener. NLU handler om semantik – altså om at fortolke meningen bag det, du siger. Norsk er fuld af korte, ufuldstændige og flertydige udtryk:

«Ja, det kan du godt gjøre.» «Kanskje. Vi får se.» «Nei, vent litt – jeg mente tirsdag, ikke torsdag!»

NLU (ofte drevet af store sprogmodeller, såkaldte LLM'er) skal finde ud af:

  • Hvad er hensigten (bestille, afbryde, spørge, bekræfte)?
  • Hvilke nøgleoplysninger er nævnt (navn, dato, produkt, sted)?
  • Hvad betyder tonefaldet – er brugeren tilfreds, irriteret, usikker?

3. Dialog Manager

Styrer samtaleflowet

Dialog Manager (DM) er den hjerne, der holder styr på konteksten i samtalen. Den afgør:

  • Hvornår AI'en skal tale, og hvornår den skal lytte.
  • Hvad der er sagt tidligere, og hvad der mangler.
  • Hvordan afbrydelser, overlappende tale og spørgsmål uden for emnet skal håndteres.

Uden en god Dialog Manager bliver samtaler kaotiske. En professionel DM sørger for, at samtalen flyder naturligt – også når du taler i munden på AI'en, præcis som mennesker gør.

4. Action Layer

Forståelse → Handling

Her ligger kernen i Thrells tilgang: AI'en skal ikke kun tale – den skal gøre noget.

Action-laget kobler sig til kundens egne systemer, som:

  • CRM (HubSpot, Salesforce, SuperOffice)
  • ERP (Visma, SAP, Tripletex)
  • Ordre- og bookingsystemer
  • Kundeserviceværktøjer

Når du siger:

«Kan du sende mig en kopi af fakturaen fra juni?» … så gør Voice AI præcis det. Den finder fakturaen, sender den og fortæller dig, når det er gjort.

Det er forskellen mellem en snakkende robot og en stemmeagent, der faktisk skaber værdi i virksomhedens værdikæde.

5. TTS – Text-to-Speech

Handling → Svar med stemme

Når handlingen er udført, skal AI'en svare dig naturligt – med den rette tone, tempo og følelse. Her kommer Text-to-Speech (TTS) ind.

TTS forvandler teksten til menneskelig tale, men ikke blot som en oplæsning. Den skal:

  • Tilpasse sig konteksten (rolig stemme ved klager, energisk ved salg).
  • Variere tonefald og rytme.
  • Have lav latency – svare på under et halvt sekund for at føles naturligt.

Den sidste finpudsning handler om emotionel realisme: små pauser, latter, overraskelse – alt det, der får AI-stemmen til at føles levende.

Når det hele fungerer sammen

Når alle fem lag – ASR → NLU → Dialog → Action → TTS – arbejder sømløst sammen, sker magien:

Du taler. AI'en forstår. Den handler. Den svarer. Alt på under et sekund.

Det er forskellen mellem en digital assistent – og en autonom stemmeagent.

Derfor betyder det noget for virksomheder

For virksomheder handler Voice AI ikke kun om teknologi. Det handler om effektivitet, kundetilfredshed og skalering.

  • Kundeservice: Stemmen kan løse henvendelser, før de rammer køen.
  • Salg: AI kan håndtere kvalificeringssamtaler og mødebooking 24/7.
  • Support: Stemmen kan give vejledning og opdateringer uden ventetid.
  • Drift: Integreret Voice AI skærer manuelle led væk og frigør medarbejdere.

Når stemmeagenten er koblet til virksomhedens systemer, kan den træffe reelle beslutninger – ikke kun svare på spørgsmål

Derfor er dette spændende for investorer

Voice AI har tre egenskaber, der gør området særligt interessant at investere i:

  1. **Høj teknisk barriere.**Systemet kræver samspil i realtid mellem flere avancerede modeller (ASR, NLU, TTS) – noget kun få selskaber mestrer.
  2. **Lokale sprogmoats.**Threll Voice Lab træner på norsk – med alle dialekterne. Data og model er unikke og svære at kopiere.
  3. **Stærk kundelåsning (stickiness).**Når Action-laget integreres i CRM og ERP, bliver Thrells løsninger en del af kundens kerneproces. Det bliver svært at skifte leverandør.

Kort sagt: Voice AI kombinerer teknologisk kompleksitet med direkte, målbar forretningsværdi.

Derfor elsker udviklere Voice AI

For teknologer er Voice AI der, hvor frontlinjen inden for kunstig intelligens ligger lige nu. Her mødes flere discipliner:

  • Signalbehandling – filtrere, analysere og forbedre lydsignaler.
  • Maskinlæring og sprogmodeller – forstå mening og kontekst.
  • Realtidssystemer – levere svar på under 500 millisekunder.
  • Integrationer – orkestrere API-kald, events og dataflow på tværs af systemer.

Voice AI er der, hvor tekst-AI var for fem år siden – blot langt mere teknisk krævende og uendeligt meget mere menneskeligt.

Her starter Threll Voice Lab

Vi begynder der, hvor det er mest krævende, men også mest værdifuldt: forståelse af norsk tale. Det betyder, at vi træner modeller, der:

  • Forstår bokmål, nynorsk og dialekter.
  • Tåler baggrundsstøj, ekko og overlappende tale.
  • Klarer lav båndbredde og Bluetooth-forsinkelser.
  • Giver transskription i realtid (streaming ASR) med lav latency.

Derudover bygger vi:

  • Dialog Manager, der tåler menneskelige afbrydelser.
  • Action Layer, der kobles til virksomhedens systemer.
  • TTS, der svarer naturligt og bekræfter faktiske handlinger.

Fremtiden taler – helt bogstaveligt

AI-revolutionen startede med tekst. Men den fuldendes med stemmen.

Hvor tekstbaseret AI hjælper os med at skrive hurtigere, hjælper Voice AI os med at handle hurtigere – ved at tale direkte med vores systemer.

Det er den fremtid, Threll Voice Lab bygger. Stemmer, der forstår norsk – alle dialekter, alle tonefald – og som gør det, du beder om. Stemmer, der skaber værdi, ikke kun lyd.

**Vil du høre mere?**Uanset om du er kunde, partner, investor eller udvikler: Threll Voice Lab inviterer dig til at være med til at forme, hvordan Norge taler med AI.

👉 Kontakt os i chatten for en snak.

Relaterede artikler

Fortsæt med at læse flere artikler