Den 14. september 2026 udgav vi Klang Dialects, et åbent datasæt og testgrundlag for svensk talegenkendelse. Optagelserne blev indsamlet gennem Knäck Klang, hvor deltagerne læste tre sætninger op på deres egen dialekt. Jo sværere Klang havde ved at transskribere talen, desto flere point fik deltageren.
Svenske dialekter er underrepræsenteret i almindelige testgrundlag for talegenkendelse. Klang Dialects giver forskere og udviklere mulighed for at undersøge, hvordan teknologien fungerer for flere måder at tale svensk på. Bidragene kommer fra forskellige dele af landet, med flest optagelser fra Sydsverige.
Versionen sv-clean indeholder 1.804 optagelser med kvalitetssikrede referencetekster. Vores forskningsteam gennemgik omkring 1.000 optagelser manuelt for at sikre, at teksten svarer til det, der faktisk bliver sagt. Datasættet er frit tilgængeligt på Hugging Face sammen med en beskrivelse af, hvordan det kan bruges.
Hent datasættet på Hugging Face
