Opinn hugbúnaður

Miðeind hefur gefið út fjölda opinna hugbúnaðarpakka fyrir íslenska máltækni. Pakkarnir eru skrifaðir í Python og gefnir út með MIT-leyfi, svo öllum er frjálst að nota þá, jafnt í rannsóknum sem í eigin hugbúnaði. Hér er yfirlit yfir helstu pakkana en nánari lýsingar, dæmi og leiðbeiningar má finna á GitHub.

Tokenizer skiptir texta í tóka, þ.e. orð, greinarmerki, tölur, dagsetningar, netföng, vefslóðir og fleira, og skiptir honum í setningar. Hann ræður við skammstafanir og dagsetningar inni í setningum, sem annars rugla setningaskiptingu. Tilreiðing er fyrsta skrefið í mörgum máltækniverkefnum, t.d. mörkun, þáttun, stafsetningarleiðréttingu og gerð málheilda.

pip install tokenizer

BinPackage gerir Beygingarlýsingu íslensks nútímamáls (BÍN) aðgengilega í Python. Í pakkanum eru um 300.000 uppflettiorð og yfir 3,1 milljón orðmynda. Með honum má fletta upp orðmyndum, finna uppflettiorð, orðflokk og beygingu og finna aðrar beygingarmyndir sama orðs, t.d. þágufall fleirtölu. Hann greinir líka samsett orð sem ekki eru í BÍN. Gögnin fylgja pakkanum svo ekki þarf annað niðurhal eða gagnagrunn.

pip install islenska

Greynir greinir íslenskar setningar í setningatré. Út frá þeim má finna uppflettiorð, marka orðflokka og beygja nafnliði í rétt fall, t.d. breyta „tveir brimsaltir pokar af poppi“ í „tveimur brimsöltum pokum af poppi“. Setningatrén nýtast einnig til að draga upplýsingar úr texta, t.d. um fólk, titla, staðreyndir og skoðanir. Greynir byggir á handskrifaðri málfræði fyrir íslensku og notar Tokenizer og BinPackage.

pip install reynir

GreynirCorrect rýnir og leiðréttir íslenskan texta. Hann getur leiðrétt texta hratt, orð fyrir orð, t.d. stafsetningarvillur, endurtekin orð og rangt rituð orðasambönd. Hann getur líka greint textann málfræðilega og bent á villur á borð við rangt fall. Villunum fylgja skýringar og tillögur að leiðréttingu. GreynirCorrect byggir á Greyni.

pip install reynir-correct

Icegrams geymir tíðni um 78 milljóna þrístæðna, þ.e. runa þriggja orða, úr Risamálheildinni. Með pakkanum má fá tíðni og líkur einstakra orða, orðapara og þrístæðna og finna þau orð sem líklegast koma næst. Uppflettingar eru mjög hraðar. Icegrams nýtist t.d. í stafsetningarleiðréttingu, textaspá og tölfræðigreiningu á texta.

pip install icegrams

IceBERT-PoS markar orðflokka og beygingarþætti hvers orðs í íslenskum texta með mállíkaninu IceBERT-PoS. Mörkin fylgja markamengi Íslenskrar orðtíðnibókar og hvert orð heldur staðsetningu sinni í upphaflega textanum. Textinn er fyrst tilreiddur með Tokenizer.

pip install "icebert-pos[torch] @ git+https://github.com/mideind/IceBERT-PoS.git"