Kunstig intelligens kan no lage podkastar der både manus og stemmer er genererte av KI. Kor lett er det eigentleg å høyre at det ikkje er menneske som snakkar?
Det ville masterstudentane Syed Fawad Ali Shah og Nusrat Akter, og professor Frode Eika Sandnes, ved OsloMet, finne ut av, i eit forsøk på OsloMet.
Dei lét 60 studentar lytte til ulike podkastklipp. Ingen av dei var innfødde engelskbrukarar, og alle podkastane hadde amerikansk-engelsk aksent. Nokre av podkastane var laga av menneske, nokre hadde manus skrive av menneske og syntetiske stemmer, medan andre var laga fullt ut ved hjelp av kunstig intelligens.
Resultata viser at KI-stemmene i fleire tilfelle var overtydande.
– Vi fann at mange oppfatta det fullt ut KI-genererte innhaldet som menneskeleg tale. Det overraska oss, seier Shah.
Over halvparten trudde KI-stemmene var menneskelege
Eitt av dei tydelegaste resultata kom frå ein podkast som var generert fullt ut med Google NotebookLM. Her var både manus og stemmer laga ved hjelp av KI.
I eitt av klippa trudde 56 prosent av deltakarane at dei høyrde menneskelege stemmer. Berre 22 prosent identifiserte talen som kunstig, medan 15 prosent var usikre.
Men biletet er ikkje så enkelt som at KI som oftast klarte å lure deltakarane. Ser forskarane på resultata samla, var deltakarane i stand til å skilje mellom naturleg og syntetisk tale betre enn dette enkeltdømet skulle tilseie.
Det var likevel mange tilfelle der deltakarane tok feil begge vegar: Syntetiske stemmer vart oppfatta som menneskelege, men menneskelege stemmer vart også tekne for å vere kunstige.
Akter meiner KI-stemmene no har kome svært nær måten menneske snakkar på.
– Når du lyttar på vanleg måte, kan det vere svært vanskeleg å høyre forskjell. Lyttar du svært nøye over lengre tid, kan du framleis oppdage ting som tyder på at stemma er generert av KI, seier ho.
Akter legg også til at det ikkje hadde noko å seie kva kjønn dei hadde dei som lytta på podkastane.
KI-stemmene har no kome svært nær måten menneske snakkar på, og mange oppfatta det KI-genererte innhaldet som menneskeleg tale, fortel Nusrat Akter (til venstre) og Syed Fawad Ali Shah. Foto: Olav-Johan Øye
Små detaljar kan avsløre KI
Kva er det så vi reagerer på når vi mistenkjer at ei stemme ikkje er ekte?
Akter peikar mellom anna på rytmen og tempoet i talen. Menneske har ulike måtar å snakke på, medan syntetisk tale i enkelte tilfelle kan bli for jamn, for rask eller for langsam.
Spontaniteten kan også spele ei rolle. Når menneske snakkar saman, tenkjer dei medan dei snakkar, stoppar opp og reagerer på kvarandre. KI-generert tale kan i større grad gje inntrykk av å følgje eit ferdig manus.
Samtidig vert nettopp slike menneskelege trekk stadig betre etterlikna.
I forsøket brukte forskarane mellom anna verktøya NotebookLM og ElevenLabs. Dei syntetiske stemmene kunne variere tonehøgd og uttrykk, og forskarane hadde i enkelte klipp også teke vare på smålydar som «umm», «eh» og «ohh» frå det menneskeskrivne manuset for å gjere talen meir naturleg.
– Første gong vi høyrde samtalen som NotebookLM hadde generert, vart vi sjølve overraska. Variasjonen i stemmene og måten dei snakka saman på, gjorde at det ikkje var lett å høyre med ein gong at dette var KI, seier Shah.
Halvparten av deltakarane vart spurde eitt år før den andre halvparten. Den første gruppa vart spurd før NotebookLM hadde blitt allment kjend i mainstream-miljøet, medan den andre vart spurd etter at NotebookLM hadde skapt overskrifter. Men det var ikkje stor skilnad mellom gruppene, og fleire i den sistnemnde gruppa hadde ikkje ein gong høyrt om NotebookLM.
Den same teknologien kan brukast til svindel
Di meir menneskelege KI-stemmene vert, desto større vert også risikoen for misbruk.
Akter trekkjer fram stemmekloning som eit døme. Dersom nokon klarer å etterlikne stemma til ein person du kjenner, kan det verte vanskeleg å vite om det faktisk er denne personen du snakkar med.
– Nokon kan klone stemma mi og late som om dei er meg. Dei kan til dømes kontakte nokon eg kjenner og be om pengar, passord eller andre opplysningar. Når stemma høyrest ekte ut, kan det vere lettare å tru på det ein høyrer, seier ho.
Shah meiner vi derfor må utvikle den same kritiske haldninga til KI-generert lyd som til anna KI-generert innhald.
– Vi bør vere kritiske til informasjonen vi får, og kontrollere om han er ekte. Det gjeld tekst, men også lyd og video som kan vere generert eller manipulert ved hjelp av KI, seier han.
KI-stemmene vart lettare avslørte i sportsprat
Kor lett det var å avsløre dei syntetiske stemmene, varierte mykje mellom lydklippa i forsøket.
I eit klipp om sport, der eit menneskeskrive manus vart lese av syntetiske stemmer frå ElevenLabs, meinte 65 prosent av deltakarane at talen var kunstig. Berre 9 prosent trudde stemmene var menneskelege.
Forskarane peikar på at sportsprat ofte er prega av engasjement, kjensler og spontanitet. Dersom dette manglar i ei syntetisk stemme, kan det vere lettare å høyre at det ikkje er ei menneskestemme.
Men forskarane understrekar at dei ikkje kan slå fast at dette var årsaka. Dei konkrete syntetiske stemmene som vart brukte i sportsinnslaget, høyrdest også mindre menneskelege ut enn nokre av dei andre stemmene i forsøket.
Fleire endra meining medan dei lytta
Kor lenge vi lyttar, kan ha noko å seie.
Deltakarane vart spurde om inntrykket deira hadde endra seg etter at dei hadde høyrt heile lydklippet. For fleire av klippa var det ein vesentleg del av dei som endra oppfatning undervegs. For eitt av klippa som var fullt ut KI-generert, endra rundt halvparten vurderinga si undervegs, utan at det nødvendigvis tydde at dei enda på rett svar.
Forskarane meiner ei mogleg forklaring er at vi får fleire haldepunkt jo lenger vi lyttar.
– Når du først høyrer ei stemme, dannar du deg raskt eit inntrykk av om ho er menneskeleg eller kunstig. Men for mange endra denne vurderinga seg etter at dei hadde høyrt heile klippet, seier Shah.
Forsøket gav dessutan deltakarane gode føresetnader for å lytte kritisk. Dei sat i eit stille rom, brukte hovudtelefonar og visste at dei skulle vurdere om stemmene var menneskelege eller syntetiske.
Det er ein annan situasjon enn når vi høyrer ein podkast på bussen, medan vi trenar eller samtidig som vi gjer noko anna.
Kan høyre at det er KI, og likevel høyrest det naturleg ut
Eit anna interessant resultat er at spørsmålet om ei stemme høyrest naturleg ut, ikkje nødvendigvis er det same som spørsmålet om ho kjem frå eit menneske.
Deltakarar kunne gje syntetisk tale høg vurdering for kor naturleg han høyrdest ut, samtidig som dei identifiserte talen som KI-generert.
Det kan få noko å seie for korleis KI-generert lyd vert brukt framover. Ei syntetisk stemme treng ikkje nødvendigvis lure lyttaren til å tru at ho er menneskeleg for å fungere godt.
Forskarane ser potensial mellom anna innan utdanning.
Studentar kan til dømes gje NotebookLM pensum, artiklar eller anna fagstoff og få laga ein samtalebasert lydversjon av materialet. Dermed kan dei lytte til ei oppsummering medan dei reiser, går tur eller gjer andre ting.
– Det kan vere ein enkel måte å få hovudinnhaldet i eit tema på. I staden for å lese alt der og då, kan du få ei kort lydoppsummering, seier Akter.
Vil undersøkje stemmekloning nærare
Forskarane ser fleire spørsmål det kan vere interessant å undersøkje vidare.
Eitt av dei er kva konkrete eigenskapar ved ei stemme som gjer at lyttarar oppfattar henne som menneskeleg eller syntetisk. Dei vil også undersøkje kva rolle kjensler i syntetisk tale spelar.
Shah peikar i intervjuet også på eit mogleg nytt eksperiment: å samanlikne ei ekte stemme direkte med ei KI-klona utgåve av den same stemma.
– Då kan vi spele av originalstemma og den klona stemma, og undersøkje om folk klarer å høyre kva som er ekte og kva som er syntetisk, seier han.
Referanse
Syed Fawad Ali Shah, Nusrat Akter og Frode Eika Sandnes: “Is It Really AI Generated?” Listeners’ Perceptions of Human-Made Versus AI-generated Podcasts. (Vert publisert på Springer i oktober 2026.)