Samisk språkteknologi og språklege data
Møte med Nasjonalbiblioteket 15.9.2026
hva er deres oppdrag, hvilke behov har dere, hva slags modeller jobber dere med (enten det er utvikling eller bruk), hvilke språk jobber dere med, hva er deres ønsker for samarbeid.
Samfunnsoppdrag
Frå tildelingsbrevet:
1. Divvuns oppgaver
Bevilgningen skal benyttes slik at Divvun kan tilby moderne språkteknologiske løsninger for det samiske samfunnet, og dermed bidra til at samisk språk skal kunne overleve som bruksspråk innenfor flest mulige samfunnsområder.
Tolkinga vår, ut frå budsjett og tilgjengelege ressursar:
- Nord-, lule- og sørsamisk
- Andre samiske språk
- Andre urfolks- og minoritetsspråk
Det vi lagar
- alle slags verktøy og tenester, frå tastatur til talegjenkjenning
- fleire tenester tilgjengeleg over nettbaserte API-ar, som andre kan byggja vidare på
“Vi” = Divvun
- 3 lingvistar og morsmålstalarar (nord-, lule-, sørsamisk)
- 1 ekspert på grammatisk og semantisk analyse, grammatikkontroll
- 1 ekspert på taleteknologi (TTS + ASR)
- 1 fst-ekspert, programmerar
- 1 programmerar
- 1 gruppeleiar
I tillegg: Giellatekno og senter for samisk leksikografi
Divvun-gruppa etabliert i 2004, Giellatekno starta i 2001
Oversikt over språk og verktøy (Divvun & Giellatekno)
| Verktøy | Nordsamisk | Lulesamisk | Sørsamisk | Enaresamisk | Skoltesamisk |
|---|---|---|---|---|---|
| Datamaskintastatur (4 OS) | ✅ | ✅ | ✅ | ✅ | ✅ |
| Mobiltastatur (2 OS) | ✅ | ✅ | ✅ | ✅ | ✅ |
| Stavekontroll | ✅ | ✅ | ✅ | ✅ | ✅ |
| Grammatikkontroll | ✅ | ✅ | ✅ | ✅ | ⚠️ |
| Orddeling | ✅ | ✅ | ✅ | ✅ | 🚫 |
| Tekstanalyse m. dep | ✅ | ✅ | ✅ | ✅ | ✅ |
Oversikt over språk og verktøy (Divvun & Giellatekno) (framh.)
| Verktøy | Nordsamisk | Lulesamisk | Sørsamisk | Enaresamisk | Skoltesamisk |
|---|---|---|---|---|---|
| TTS-tekstpros. | ✅ | ✅ | ✅ | 🚫 | 🚫 |
| E-ordbok, terminologi | ✅ | ✅ | ✅ | ✅ | ✅ |
| Maskinomsetjing (H) | ✅ | ✅ | ✅ | ✅ | 🚫 |
| Språklæring | ✅ | 🚫 | ✅ | ✅ | 🚫 |
| Talesyntese (ML) | ✅ | ✅ | ✅ | 🚫 | 🚫 |
| ASR-eksperiment (ML) | ✅ | ✅ | 🚫 | 🚫 | 🚫 |
Nettbaserte tenester
Dvs tilgjengeleg med nett-API.
| Verktøy | Nordsamisk | Lulesamisk | Sørsamisk | Enaresamisk | Skoltesamisk |
|---|---|---|---|---|---|
| Korpus | ✅ | ✅ | ✅ | ✅ | ✅ |
| Stavekontroll | ✅ | ✅ | ✅ | ✅ | ✅ |
| Grammatikkontroll | ✅ | ✅ | ✅ | ✅ | ⚠️ |
| TTS | ✅ | ✅ | ✅ | 🚫 | 🚫 |
| Ordboksinnhald/term. | ✅ | ✅ | ✅ | ✅ | ✅ |
| Maskinomsetjing | ✅ | ✅ | ✅ | ✅ | 🚫 |
Vi vil tilby ASR òg så snart ASR-en er god nok.
Data er alltid ein flaskehals
Vi treng rådata, både tekst og tale:
- Tale: ASR (og seinare: dialogsystem)
- Tekst:
- forbetra dekningsgrad og dermed alle verktøy
- betre korpus til samfunnet (gje tilbake til samfunnet det forskarar tidlegare har samla inn, og det samfunnet har produsert)
- for å testa alle verktøy mot
- fleirspråklege/parallelle tekstar ekstra verdefulle
Vi har:
- TTS-data (3 SME, 3, SMJ, 1 SMA, 2 SMN)
- transkiberte ASR-data (SME, SMJ, SMA)
- samlar inn meir taledata for ASR no i samarbeid med NRK, SVTm, YLE m.fl.
- godt organiserte tekstdata, inkl gullstandarddata for normative verkøty
To slags modellar
ML-modellar
- TTS: vi byggjer sjølve
- ASR: i samarbeid med NB og Aalto
- generative tekstmodellar?
Kunnskapsbaserte modellar
- Morfologisk og syntaktisk analyse og generering. Grunnlag for all tekstprosessering.
Framtida er hybrid?
- jo mindre ressursar, jo meir kunnskapsbaserte modellar treng ein
- betre ML-modellar dersom ein kombinerer med kunnskapsbaserte modellar
- normative verktøy som kanskje kan brukast til automatisk evaluering
layout: two-cols-header —
Språk vi arbeider med
::left::
- alle samiske språk
- urfolks- og minoritetsspråk:
- i Norden
- Canada
- Uralske språk i Russland (når det blir mogleg igjen)
- andre land og språk (sjå kart)
- ca 160 språk i infrastrukturen vår
::right::

Divvun + Giellatekno + NB
Tekst:
- vi treng all tekst vi kan få (jf over)
- vi kan gjera NB-tekst rikare gjennom analyse
- for Korp
- for framtidig modelltrening
- NB kan gje samisk tekst tilbake til det samiske samfunnet gjennom Korp, utan å bryta opphavsrettslover (berre ei setning som kontekst)
Tale:
- ASR-trening treng all samisk tale som finst
- NB er arkiv-instans for NRK
- NB har no ei kompensasjonsordning for nyheitsmateriale
- TTS-trening på NB sine maskiner (eller Sigma2 via NB-samarbeid)
- Vi (dvs Katri) har svært gode TTS-kunnskapar, til nytte for NB
Konkret samarbeid
- samarbeidsavtale som gjer datadeling lettare
- tilgang til NB sine maskiner (jf førre punkt)
- forsking knytt til hybride metodar for ASR, OCR, generative språkmodellar for språk med lite data
- nyheitsmateriale er allereie dekt av frikjøpet til regjeringa, lat oss starta med det:
- tale: ca 1500 timar med Ođđasat sidan starten i 2001
- [retting: lydmateriale er ikkje omfatta av frikjøpsavtalen. Takk for avklaringa!]
- tekst: historisk materiale frå forgjengarane til Ávvir (frå 2008): Min Áigi (frå 1993) og Áššu (òg frå 1993)
- tale: ca 1500 timar med Ođđasat sidan starten i 2001
layout: center —
Det viktigaste først
Samarbeid, ikkje konkurranse
Giitu! Takk!