Den 14. september 2026 lanserte vi Klang Dialects, et åpent datasett og testgrunnlag for svensk talegjenkjenning. Opptakene ble samlet inn gjennom Knäck Klang, der deltakerne leste tre setninger på sin egen dialekt. Jo vanskeligere Klang hadde for å transkribere talen, desto flere poeng fikk deltakeren.
Svenske dialekter er underrepresentert i vanlige testgrunnlag for talegjenkjenning. Klang Dialects gir forskere og utviklere mulighet til å undersøke hvordan teknologien håndterer ulike måter å snakke svensk på. Bidragene kommer fra forskjellige deler av landet, med flest opptak fra Sør-Sverige.
Versjonen sv-clean inneholder 1 804 opptak med kvalitetssikrede referansetekster. Forskningsteamet vårt gjennomgikk rundt 1 000 opptak manuelt for å sikre at teksten samsvarer med det som faktisk blir sagt. Datasettet er fritt tilgjengelig på Hugging Face, med dokumentasjon om hvordan det kan brukes.
Hent datasettet på Hugging Face
