A következő címkéjű bejegyzések mutatása: korpusznyelvészet. Összes bejegyzés megjelenítése
A következő címkéjű bejegyzések mutatása: korpusznyelvészet. Összes bejegyzés megjelenítése

2013. február 7.

CILC 2013

Megtisztelő, hogy a CILC 2013 elfogadta absztraktomat. A Corpus and ICT trackben fogok beszélni a korpuszok ipari alkalmazhatóságáról és az adatgondozás (data curation) szerepéről. Szerencsére egyre több remek eszköz áll rendelkezésünkre és az elérhető korpuszok száma is szépen növekszik, azonban az ipar és az akadémia nem igazán talál egymásra eltérő igényeik miatt. Az előadásommal pár ipari példa alapján arra szeretnék ösztönözni mindenkit, hogy az akadémiai kreativitást ötvözze az ipar pragmatikusságával.

2012. október 19.

Megújult a Google Ngram Viewer

A szimpla frekvenciákon túl immár minden korpusznyelvész szívét megmelengető képességekkel bővült a Google Books Ngram Viewer. A Google Research Blog bejelentése szerint:
Two features of the Ngram Viewer may appeal to users who want to dig a little deeper into phrase usage: part-of-speech tags and ngram compositions.
Az alábbi tag set (azaz POS tagek, magyarán szófaj címkék) áll rendelkezésünkre:



A tagek egy része önmagában is állhat ill. a egy adott szót pontosíthatunk vele, másrészük pedig önmagában áll (stand alone). Egy példa arra hogy mire jó ez:



Lehetőségünk van immár összetett kifejezések keresésére is, ezt fedi az ngram compositions. Az összetételeket a reguláris kifejezések nyelvéhez hasonló operátorokkal építhetjük fel.



Az operátorokkal ilyen összetett query-ket építhetünk fel:



Ben Zimmer posztja a Language Log-on részletesen bemutatja az Ngram Viewer hátterét és linkel két tanulmányt ami a projekt technikai részletei iránt érdeklődőknek ajánlott.


2011. augusztus 3.

Korpusznyelvészet - Unicode; a korpuszkészítés alapjai 2

Az előző posztban végig vettük Leech maximáit, melyek segítenek minket abban hogy használható korpuszt készítsünk. Mivel egy korpusz általában szöveges (de nem szükségszerűen, hiszen már vannak audio korpuszok is) szükségünk van arra hogy a szöveget alkotó karaktereket is egységesen kezeljük, ez teszi lehetővé hogy igény szerinti formában jelenítsük meg, vagy hasonlítsuk össze az egyes korpuszokat. Ez nem csak az eredmények és adatok megosztását, de feldolgozását is megkönnyíti. Sajnos azonban ez nem mindig volt magától értetődő elv, szerencsénkre azonban a dolog változik és a Unicode szabvány terjedőben van. A posztban nem törekszünk arra hogy bemutassuk teljesen magát a szabvány, csupán a mögötte rejlő elveket vesszük sorra és egy kis eligazítást adunk hol tanulhat többet az érdeklődő olvasó (aki kényes a pontos megfogalmazásra és szeretne komolyabban elmerülni a témában, az inkább csak az ajánlott irodalmat fussa át).

2011. július 13.

Nyelvi modellezés, házilag


Ismeretes, hogy a számítógépek alapvetően még mindig nem értik az emberi nyelveket, de ezt az apró hiányosságot azzal ellensúlyozzák, hogy nagyon gyorsan tudnak számolni. A gépi fordítás, az internetes keresés vagy éppen Watson sikere bizonyítja, hogy a statisztikai alapú megközelítés járható út, nem kell mindenáron “megértetni” a géppel a szövegek jelentését. Ebben a posztban arról lesz szó, hogyan dolgozza fel a gép a szöveget, és egy házi készítésű magyar nyelvi modellt is bemutatok.

2011. június 27.

Korpusznyelvészet - a korpuszkészítés alapjai 1.

Az előző korpusznyelvészeti posztban láthattuk hogy milyen elméleti megfontolásokat kell figyelembe vennünk mielőtt korpuszt használunk. Ezeket figyelembe véve érdemes tudnunk hogy milyen elvek mellett épül fel egy jó korpusz. Most a legalapvetőbb vezérelevekt és ajánlásokat vesszük sorra.

2011. június 21.

Korpusznyelvészet – elméleti megfontolások

Mi is az a korpusznyelvészet? Sokan úgy tekintenek a korpuszokra mint a nyelvi adatok egyetlen lehetséges forrásaira, mások azt hiszik hogy ez valami nagyon új irányzat, de szeretnénk lehűteni a kedélyeket – a korpusznyelvészet ugyanis egy módszertani irányzat, se nem több, se nem kevesebb. Sajnos azonban ezt az irányzatot is „megfertőzte” a szokásos irány és szeretik a korpusznyelvészek is Chomskyval szemben meghatározni magukat. Vizsgáljuk meg egy kicsit közelebbről a két legelterjedtebb ködképet a korpusznyelvészetről.


2011. április 5.

Hogyan kezdtem szófajelemzőt írni?

Tempfli Péter vendégposztja

A probléma

Ahhoz, hogy lehessen valamit mondani egy mondatról, jó tudni, miféle cselekvést vagy történést ír le; egy vagy több alany csinálja-e, megtörtént, történni fog, esetleg csak vágyunk arra, hogy megtörténjen. Egyszóval, az ige és a kapcsolódó elemek számos hasznos információt hordoznak. Ha géppel akarom megkeresni ezeket az adatokat, egy olyan eszközre van szükség, ami felismeri az igéket egy adott szövegben és kinyeri a fenti információkat. Erre való a szófajelemző(felismerő), angolul part-of-speech tagger (POS-tagger). Az NLTK-ról szóló könyv ötödik fejezete ismertet néhány, az NLTK-be beépített eszközt, de ezeket sajnos csak angol nyelvű szövegeken lehet használni. Magyar nyelvű morfológiai elemző is létezik (a HUNMORPH ill. a HUNSPELL), azonban ezek azon túl, hogy nagyon nehezen konfigurálhatók, azt az örömet is elveszik, hogy magam gondolkozzam el a problémán;) (természetesen ezek nagyon jó eszközök, de professzionális felhasználásra készültek, ezért nem nagyon veszik figyelembe a "barkács-programozók" igényeit)


2011. március 9.

Ismét a paradigmákról

Úgy tűnik tegnapi posztomra többen reagáltak, köszönöm szépen a leveleket (de megjegyezném hogy lehet kommentelni is ám!). Ugyanakkor elkövettem egy hibát, adottnak vettem hogy mindenki ismeri az általam csak gondolatindítónak említett vitát. Ezért most rövide összefoglalnám Gibson és Fedorenko érveit a grammatkalitási ítéletek ellene, ill Culicover és Jackendoff ellenérveit, no meg egy kicsit kiegészíteném a saját gondolataimmal a dolgot.


2011. január 29.

Írástudók hajnala: innováció a médiában I. - Wordnik, a 21. század szótára

Sokan temetik a Guttenberg-galaxist, pedig nagy a mozgolódás ezen a téren. Az újmédia telis-tele van innovációval, persze még nem látszik hogy a sok újdonságból mikor marad meg és válik általánosan elfogadottá, azonban vannak olyan irányzatok melyek kijelölik az utat. Sajnos ezekről felénk keveset olvashatunk itthon, az iPad/Kindle és mobil eszközökkel kapcsolatos híreken túl. Sorozatunkban megpróbálunk túllépni ezen és bemutatni pár olyan irányt ami utat mutathat. Az első részben a szavakra fókuszálunk és a szótárra, ami sokak szerint unalmas téma, sokan nagyon egyszerű dolognak tartják az online szótárakat, azonban a kérdés ennél sokkal összetettebb.


2010. december 26.

Google Ngram Viewer - Mi a szösz az?

A Google Labs mostanában indította el Books Ngram Viewer szolgáltatását és megjelntek a legkülönbözőbb "elemzések" mindenhol - még a print HVG-ben is találtam! Arról viszont kevés szó esik hogy mit is takar tkp. ez a szolgáltatás, miért indította el a Google, mi egyáltalán az az ngram (vagy jobban mondva n-gram) és mire jó ez azon kívül hogy szép grafikont rajzolunk.


2010. december 17.

Könyvismertető: Oakes; Statistics for Corpus Linguistics

Az előző posztban bemutatott kötet szervesen kapcsolódik össze a most tárgyalt művel. Azonban előre kell bocsátanom hogy ez a kötet nem egy "bevezetés a statisztikába nyelvészeknek", hanem a statisztikai módszerek alapos és érthető bemutatása a korpusznyelvészet területén. Így elsősorban azoknak ajánlom akik már rendelkeznek a szükséges ismeretekkel megértéséhez.


  • Michael P. Oakes: Statistics for Corpus Linguistics
  • Edinburgh University Press 1998
  • 272 oldal







2010. december 14.

Könyvismertető: McEnry - Wilson; Corpus Linguistics An Introduction

Napjainkban a korpusznyelvészeti módszertan reneszánszát éli, azonban sajnos a hazai felsőoktatásban még nem vált általánossá oktatása (habár vannak biztató jelek). Talán ezért kérték sokan hogy ajánljunk olyan könyveket melyeket önállóan is feldolgozhatnak az érdeklődők. McEnry és Wilson műve egy alapos és átgondolt bevezetés azok számára akik már rendelkeznek egy minimális háttérrel (azaz hallgattak már egy nyelvészeti bevezető tárgyat, vagy olvastak bevezető jellegű műveket - akik ezt még nem tették meg, Nyelvészet - csak röviden posztunkban találhatnak információt arról hol érdemes elkezdeni a témával való ismerkedést). Augusztusban bemutattuk Meyer English Corpus Linguistics művét, ami egy áttekintést ad a témáról, az informatika területéről érkezők számára ajánljuk hogy olvassák el azt a rövid bevezető munkát mielőtt belekezdenek ebbe a komolyabb munkába, nyelvész és egyéb bölcsész olvasóinknak pedig ajánljuk hogy statisztikai ismereteiket elevenítsék fel, vagy ha ezen a téren nem járatosak, olvassák el Statisztikai túlélőkészlet posztunkat ami talán segíthet elindulni a területen.






2010. november 12.

Bohumil Hrabal szótára

Tempfli Péter vendégposztja

František Čermák, Václav Cvrček (eds.)
Nakladatelství  Lidové Noviny / Ústav Českého Národního Korpusu 2009. 

A prágai Károly Egyetem Cseh Nemzeti Korpusz Intézete 2009-ben jelentette meg a tizenhárom éve elhunyt, de már életében legendává vált  Bohumil Hrabal írói nyelvének szótárát (a magyar olvasók a legjobban Hrabal Sörgyári capriccio és A szigorúan ellenőrzött vonatok című könyveit, és Jiří Menzel filmadaptációit ismerik). E kiadvány annak a sorozatnak a második része, mely 2007-ben Karel Čapek nyelvének feldolgozásával indult meg.


2010. október 12.

The life of a computational linguist II. - Interview with Oliver Mason

This week we interviewed Oliver Mason, a computational linguist at the Department of English of University of Birmingham. He holds an MA in Computational Linguistics from the University of Trier, and a PhD in Linguistics from the University of Birmingham. You can find more information on Oliver on his personal webpage. He runs two blogs, Language and Computation and Learning, Teaching, Research. You can find him on twitter as ojmason.


2010. szeptember 14.

Az adatok megmagyarázhatatlan természete

"For those who were hoping that a small number of general rules could explain language, it is worth noting that language is inherently complex, with hundreds of thousands of vocabulary words and a vast variety of grammatical constructions. Every day, new words are coined and old usages are modified. This suggests that we can’t reduce what we want to say to the free combination of a few abstract primitives." Halevy, Norvig, Pereira: The unreasonable Effectiveness of Data

Előző posztjaimban az adatok tudományával foglalkoztam és a visszajelzések alapján sokak érdeklődését felkeltettem. Mielőtt azonban a szögre akasztanánk megszokott eszköztárunkat, egy kicsit gondolkozzunk el az adatok természetéről.

2010. szeptember 10.

A New York Times és a Guardian API-k használata

Ahogy az előző posztokban említettem sokan reménykednek abban hogy a neten összegyűlt hatalmas adat mennyiség betekintést nyújthat abba hogyan is működik a nyelv. Habár sokat segíthet ha rengeteg adattal rendelkezünk, ennek vannak határai - ahogy erre pl Kilgariff is rámutatott. Nem is beszélve a technikai és jogi korlátokról.

2010. szeptember 4.

Az adatok tudománya és a nyelvtudomány - olvasnivaló

Sokan kérdezték az előző poszt kapcsán hogy hogyan is indulhatnak el "data science" ügyben. Itt egy kis összefoglaló következik, mit érdemes olvasni, merre érdemes keresgetni, és egy kicsit ajánlani fogom korábbi posztjaimat is. Tehát most sorra vesszük hogy egy nyelvész mit tehet hogy 1) betekintést nyerhessen az adatok tudományába 2) eszköztárába illeszthesse a nyelvi adatok elemzésére alkalmas módszereket.

2010. július 23.

Szógyakoriság vizualizáció Many Eyes használatával

Legelső szógyakorisági posztomban amúgy ránézésre fedeztük fel egy korpusz tartalmát előre elkészített szógyakorisági táblával. Majd pedig megnéztük hogyan készíthetünk egyszerűen egy gyakorisági táblát, és miképp tehetjük szebbé ábránkat. Ehhez minimális programozásra volt szükség, viszont kaptunk egy szép táblát amiből az IBM Many Eyes rendszerével interaktív vizualizációt készíthetünk könnyen, gyorsan, ingyen.

A program használata annyira egyszerű és magától érthető hogy nem kell magyarázni. Fontos hogy regisztrálnod kell hogy saját adatokat tölthess fel és adataid nyilvánosak lesznek (más is használhatja azokat saját vizualizációhoz) illetve kommentelhetővé válik munkád. Mivel egy kép gyakran többet ér bármennyi szónál, lássuk mit alkottam.

NLP meetup

2013 május 22 - Open Data
2013 május 22 - Szezonzáró

inkLink

Adatújságírás-nap és hackday, 2014-ben folyt.köv.

PRECOGNOX

PRECOGNOX
Ha szükséged van nyelvtechnológiai megoldásokra, fordulj a Precognox-hoz (korábban Weblib)

Nyelv és Tudomány

Keresés ebben a blogban

Creative Commons Licenc
Zoltán Varjú Számítógépes nyelvészet című műve Creative Commons Attribution-NonCommercial-ShareAlike 3.0 Unported Licenc alatt van.
Based on a work at szamitogepesnyelveszet.blogspot.com.
Permissions beyond the scope of this license may be available at http://szamitogepesnyelveszet.blogspot.com/.