Fókuszban a nyelvi adatvagyon a nyolcadik magyar adatgazdász találkozón
Az ELTE Digitális Örökség Nemzeti Laboratórium (ELTE DH-LAB), a HUN-REN Adatrepozitórium Platform (HUN-REN ARP) és a Pro-M Zrt. által közösen szervezett adatgazdász találkozó sorozat 2026-os első alkalmának a Magyar Tudományos Akadémia adott otthont. A rendezvény középpontjában ezúttal a nyelvészeti adatgazdálkodás, különösen a korpuszok álltak, kiemelve az ELTE Nyelvtudományi Kutatóközpont (NYTK) szerepét a magyar nyelvi adatvagyon fejlesztésében és megőrzésében.

A találkozót Lipp Veronika, az ELTE NYTK főigazgatója nyitotta meg. Köszöntőjében méltatta a sorozatot, hangsúlyozta az adatgazdász szakma fontosságát, és biztosította támogatásáról az adatgazdász közösséget.
Ezt követően Sass Bálint (ELTE NYTK, Lexikológiai Intézet) mesélt nagyméretű korpuszokról, tokenekről, vertikális formátumról, token-annotációról és struktúra-annotációról, spanról, metaadatról, valamint gold-standardról és silver-standardról. Bemutatójában sok egyéb mellett szó esett az 1 milliárd szavas Magyar Nemzeti Szövegtárról vagy a mesterséges intelligencia tanításához használt, nyomtatásban 50 km könyvnyi terjedelmű, 100 milliárd szavas óriáskorpuszról.
Kristóf Ibolya (ELTE NYTK, Lexikológiai Intézet) A magyar nyelv nagyszótárának megírásához készített, 1772 és 2020 között keletkezett magyar nyelvű, nyomtatásban megjelent szövegek bibliográfiai adatait tartalmazó Magyar történeti szövegtárról mesélt a hallgatóságnak. Előadásában beszélt kézírás-felismerésről, cédulázásról, cédulák tárolásáról, használatáról és olvashatóságáról, Horger Antalról és II. Józsefről, valamint a Prószéky-kódokról. A magyar nyelv nagyszótára sorozatban eddig 8 kötet jelent meg nyomtatásban, miközben a teljes szócikkállomány szabadon elérhető digitális adatbázisba rendezve is.
A program zárásaként Sidó Zsuzsa (ELTE HTK MI – MTA Művészeti Gyűjtemény) vezetésével a résztvevők megtekinthették az Akadémia 19–20. századi történetét bemutató 200 év kincsei című kiállítást.