Databases and corpora

23 results
23 results
Adatbázis

A magyar nyelv nagyszótára

A magyar nyelv nagyszótára a magyar nyelvtudomány eddigi legnagyobb szótári vállalkozása, amely a magyar lexikográfiai gyakorlatból még hiányzó, új műfajt képvisel. Történeti jellegű értelmező szótárként legfontosabb feladata a szavak jelentéstartalmának kibontása és e jelentések viszonyrendszerének ábrázolása.

Database

Uralic Languages under the Influence Database (UraLUID)

One of the aims of the project was to build a linguistically annotated database of written and spoken sources in Udmurt, Tundra Nenets, Synja and Surgut Khanty languages, which makes it possible to research on Uralic–Russian language contacts.

Szoftveralkalmazás

BEAST2 Online – magyar nyelvű leiratozó

Magyar nyelvű hanganyagok leiratozása kutatók és magánfelhasználók számára. Előre felvett beszélgetéseket vagy közvetlenül a telefon vagy számítógép mikrofonjába mondott hanganyagokat iratozunk le mély neuronháló alapú, a HUN-REN Nyelvtudományi Kutatóközpont nyelvi adatbázisaira épített mesterséges intelligencia modellekkel.

Database

BEA Spoken Language Database

The BEA is a large speech corpus containing approximately 500 hours of read and spontaneous speech collected from 472 speakers. In addition to the audio recordings, orthographic transcriptions as well as word- and phone-level annotations are available to researchers.

Adatbázis

Budapesti Szociolingvisztikai Adatbázis (BUSZI)

A BUSZI nagyszabású felmérés, amely megbízható adatokat és elemzéseket szolgáltat a magyar nyelv Budapesten beszélt változatairól.

Szövegkorpusz

Csángó korpusz

A 2013 márciusában a Nyelvtudományi Intézetben kákovai (forrófalvi) és klézsei adatközlők részvételével tartott csángó mondattani szeminárium hanganyaga és átirata.

Adatbázis

Hanti adatbázis

Az adatbázis a hanti nyelv keleti ágához tartozó szurguti nyelvjárás megismeréséhez visz közelebb. A honlapon feldolgozott harminc szöveg stílusa és szókincse változatos: vannak köztük egyszerű, ábécéskönyvi olvasmányok, iskolai fogalmazások, mesék, újságcikkek, szépirodalmi igényességű írások és folklór alkotások is. A szövegeket mondatokra bontva morfológiai és szófaji elemzéssel, valamint magyar és angol fordítással láttuk el.

Database

The Lajos Hegedűs Collection of Hungarian Dialects

Lajos Hegedűs was the first linguist to undertake large-scale audio documentation of Hungarian dialects across an extensive geographical area in the 1940s and 1950s. Selected recordings from the surviving collection of 108 gramophone discs are available on our website.

Szövegkorpusz

Magyar Nemzeti Szövegtár

A Magyar Nemzeti Szövegtár az első olyan magyar nyelvi korpusz, amely a magyarországiak mellett a határon túli magyar nyelvváltozatokat is felöleli.

Szoftveralkalmazás

Magyar nyelvű neurális modelleken alapuló megoldások

A magyar nyelvre készített generatív PULI rendszerünk mellett itt az ún. enkóderekre épülő neurális modelljeink demóalkalmazásai találhatók, melyek gépi fordítást, szövegekből összefoglaló-készítést, szentimentelemzést, névelemek felismerését, szövegosztályozást és ékezet nélküli szövegek ékezetekkel való ellátását végzik.

Adatbázis

Magyar szerkezettár

A nyelv valójában nem szavakból, hanem szerkezetekből áll, nem szavak sora, hanem szerkezetek szövedéke. Innen ered a projekt alapgondolata, hogy talán nem is a szavakat érdemes számbavenni (vö: „szótár”), hanem a szerkezeteket. Erre tesz kísérletet a „Magyar szerkezettár”.

Szövegkorpusz

Magyar történeti szövegtár (A magyar nyelv nagyszótárának korpusza)

Az MTSz. jelenleg 30 millió szövegszónyi anyagot tartalmaz az 1772–2010-ig terjedő majd 240 évből. A kibővített korpuszhoz 2016-ban új lekérdezőfelületet készítettünk, amely szabadon hozzáférhető kutatási célra és a nagyközönség számára is.

Egyéb

Mai magyar nyelvjárási hangoskönyv 1.

A nyelvjárási hangoskönyv olyan adattár, amelyben eredeti hanggal összekapcsolt lejegyzések találhatók, azaz miközben a felhasználó hallgatja a felvételeket, olvashatja is az elhangzottakat. A szövegek közlése olyan nyelvészeti technológiákkal készült tehát, amelyek segítségével a hangfelvétel és annak fonetikus lejegyzése összekapcsolva jelenik meg.

Adatbázis

Mazsola – a magyar igei bővítményszerkezet vizsgálata

Megtudhatja, hogy adott ige melletti adott (esetrag vagy névutó által meghatározott) bővítményi pozícióban milyen jellegzetes szavak jelenhetnek meg, legyen az vonzat vagy szabad bővítmény vagy az igével idiomatikus szerkezetet alkotó szó.

Szövegkorpusz

Moldvai magyar nyelvjárási szövegek Tánczos Vilmos gyűjtéséből

Tánczos Vilmos moldvai gyűjtése páratlan kincs nemcsak a néprajztudomány, hanem a magyar nyelvészeti kutatások számára is, hiszen a magyar nyelvészet régi adóssága a moldvai magyar nyelvjárások kutatására alkalmas, megfelelő pontossággal lejegyezett szövegkorpusz létrehozása

Egyéb

Nemzeti korpuszportál

A Nemzeti Korpuszportál célja a szóalapú online keresővel rendelkező magyar nyelvű korpuszok összegyűjtése, és távlatilag az elemzőeszközök és a korpuszkeresési funkciók elérhetővé tétele minden korpusz számára.

Szövegkorpusz

Ó- és középmagyar történeti magánéleti korpusz

A Történeti magánéleti korpusz (TMK) az 1772 előtti magánlevelekből és peres eljárások jegyzőkönyveiből épül fel. Elsősorban a történeti morfológiai és szociolingvisztikai kutatásokhoz kínál anyagot, de segítséget nyújt a történeti mondattani, pragmatikai és lexikológiai vizsgálatokhoz is.

Szövegkorpusz

Ómagyar korpusz

A korpusz tartalmazza az összes fennmaradt ómagyar kori (896–1526) és néhány középmagyar kori (1526–1772) szövegemléket, valamint számos középmagyar bibliafordítást. A feldolgozott anyag 47 ómagyar kódexet, 24 rövidebb ómagyar szövegemléket, 244 misszilist (elküldött levelet), valamint 5 középmagyar kori bibliafordítást foglal magában, vagyis mindösszesen 3,2 millió szövegszót.

Adatbázis

Párhuzamos Bibliaolvasó

A Párhuzamos Bibliolvasó mögött levő adatbázis a Párhuzamos Bibliakorpusz, amely egyrészt a magyar nyelv különböző korszakaiból tartalmaz bibliafordításokat, másrészt egyéb uráli nyelvek bibliafordításai is belekerülnek, ami hasznos segítség lehet az uráli nyelveket és a magyar nyelv történetét kutatók számára is.

Szoftveralkalmazás

PULI, az első teljesen magyar nyelvű GPT-3

A PULI család a HUN-REN NYTK nagy magyar nyelvmodellje nyers (pre-trained), illetve utasításvégző (instruct) változatainak demói. A nyers modell csak a szöveg folytatására alkalmas, az utasításkövető viszont válaszol kérdésekre, fordít vagy éppen kivonatot készít ‒ aszerint, hogy milyen instrukciót adunk neki.

Adatbázis

Új magyar etimológiai szótár

ÚESz. a mai magyar köznyelv minden szavát tartalmazza. Továbbá megtalálható benne minden olyan kihalt, illetve elavult szó, amely nyelvi vagy művelődéstörténeti szempontból fontosnak számít; a tájszók közül azok, amelyek nagy területen használatosak és a már meghonosodott nemzetközi szók közül azok, amelyek a leginkább beépültek a magyar szókészletbe. A szótár szerkesztés alatt áll.

Adatbázis

Uralonet

Az Uralonet egy olyan, kutatásra és oktatásra egyaránt alkalmas adatbázis és kérdezőfelület, melynek az uráli etimológiákat tartalmazó hagyományos, német nyelvű szótár, az Uralisches Etymologisches Wörterbuch, (=UEW, Akadémiai Kiadó 1986–1989) anyaga képezi az alapját.

Adatbázis

Magyar orvosi nevezettár

Bősze Péter nőgyógyász-onkológus professzor a magyar orvosi nyelv magyarításának elkötelezettjeként készítette el a Magyar orvosi nevezettárat, amely orvosi-biológiai és egészségügyi fogalmak magyar és angol megfelelőit, magyarázatait, és az esetek jelentős részében saját magyarításait tartalmazza. Az ELTE NYTK az elektronikus kiadással tiszteleg munkája előtt, de jelzi: nem támogatja a gyakorlatban kevéssé vagy egyáltalán nem használt magyarítások erőltetését.