Megtisztelő, hogy a CILC 2013 elfogadta absztraktomat. A Corpus and ICT trackben fogok beszélni a korpuszok ipari alkalmazhatóságáról és az adatgondozás (data curation) szerepéről. Szerencsére egyre több remek eszköz áll rendelkezésünkre és az elérhető korpuszok száma is szépen növekszik, azonban az ipar és az akadémia nem igazán talál egymásra eltérő igényeik miatt. Az előadásommal pár ipari példa alapján arra szeretnék ösztönözni mindenkit, hogy az akadémiai kreativitást ötvözze az ipar pragmatikusságával.
A következő címkéjű bejegyzések mutatása: korpusznyelvészet. Összes bejegyzés megjelenítése
A következő címkéjű bejegyzések mutatása: korpusznyelvészet. Összes bejegyzés megjelenítése
2013. február 7.
2012. október 19.
Megújult a Google Ngram Viewer
Posted by
Zoltan Varju
A szimpla frekvenciákon túl immár minden korpusznyelvész szívét megmelengető képességekkel bővült a Google Books Ngram Viewer. A Google Research Blog bejelentése szerint:
Two features of the Ngram Viewer may appeal to users who want to dig a little deeper into phrase usage: part-of-speech tags and ngram compositions.
Az alábbi tag set (azaz POS tagek, magyarán szófaj címkék) áll rendelkezésünkre:
A tagek egy része önmagában is állhat ill. a egy adott szót pontosíthatunk vele, másrészük pedig önmagában áll (stand alone). Egy példa arra hogy mire jó ez:
Lehetőségünk van immár összetett kifejezések keresésére is, ezt fedi az ngram compositions. Az összetételeket a reguláris kifejezések nyelvéhez hasonló operátorokkal építhetjük fel.
Az operátorokkal ilyen összetett query-ket építhetünk fel:
Ben Zimmer posztja a Language Log-on részletesen bemutatja az Ngram Viewer hátterét és linkel két tanulmányt ami a projekt technikai részletei iránt érdeklődőknek ajánlott.
2011. augusztus 3.
Korpusznyelvészet - Unicode; a korpuszkészítés alapjai 2
Posted by
Zoltan Varju
Az előző posztban végig vettük Leech maximáit, melyek segítenek minket abban hogy használható korpuszt készítsünk. Mivel egy korpusz általában szöveges (de nem szükségszerűen, hiszen már vannak audio korpuszok is) szükségünk van arra hogy a szöveget alkotó karaktereket is egységesen kezeljük, ez teszi lehetővé hogy igény szerinti formában jelenítsük meg, vagy hasonlítsuk össze az egyes korpuszokat. Ez nem csak az eredmények és adatok megosztását, de feldolgozását is megkönnyíti. Sajnos azonban ez nem mindig volt magától értetődő elv, szerencsénkre azonban a dolog változik és a Unicode szabvány terjedőben van. A posztban nem törekszünk arra hogy bemutassuk teljesen magát a szabvány, csupán a mögötte rejlő elveket vesszük sorra és egy kis eligazítást adunk hol tanulhat többet az érdeklődő olvasó (aki kényes a pontos megfogalmazásra és szeretne komolyabban elmerülni a témában, az inkább csak az ajánlott irodalmat fussa át).
2011. július 13.
Nyelvi modellezés, házilag
Posted by
Istvan Nagykovacsi
Ismeretes, hogy a számítógépek alapvetően még mindig nem értik az emberi nyelveket, de ezt az apró hiányosságot azzal ellensúlyozzák, hogy nagyon gyorsan tudnak számolni. A gépi fordítás, az internetes keresés vagy éppen Watson sikere bizonyítja, hogy a statisztikai alapú megközelítés járható út, nem kell mindenáron “megértetni” a géppel a szövegek jelentését. Ebben a posztban arról lesz szó, hogyan dolgozza fel a gép a szöveget, és egy házi készítésű magyar nyelvi modellt is bemutatok.
2011. június 27.
Korpusznyelvészet - a korpuszkészítés alapjai 1.
Posted by
Zoltan Varju
Az előző korpusznyelvészeti posztban láthattuk hogy milyen elméleti megfontolásokat kell figyelembe vennünk mielőtt korpuszt használunk. Ezeket figyelembe véve érdemes tudnunk hogy milyen elvek mellett épül fel egy jó korpusz. Most a legalapvetőbb vezérelevekt és ajánlásokat vesszük sorra.
2011. június 21.
Korpusznyelvészet – elméleti megfontolások
Posted by
Zoltan Varju
Mi is az a korpusznyelvészet? Sokan úgy tekintenek a korpuszokra mint a nyelvi adatok egyetlen lehetséges forrásaira, mások azt hiszik hogy ez valami nagyon új irányzat, de szeretnénk lehűteni a kedélyeket – a korpusznyelvészet ugyanis egy módszertani irányzat, se nem több, se nem kevesebb. Sajnos azonban ezt az irányzatot is „megfertőzte” a szokásos irány és szeretik a korpusznyelvészek is Chomskyval szemben meghatározni magukat. Vizsgáljuk meg egy kicsit közelebbről a két legelterjedtebb ködképet a korpusznyelvészetről.
2011. április 5.
Hogyan kezdtem szófajelemzőt írni?
Posted by
Zoltan Varju
Tempfli Péter vendégposztja
A probléma
Ahhoz, hogy lehessen valamit mondani egy mondatról, jó tudni, miféle cselekvést vagy történést ír le; egy vagy több alany csinálja-e, megtörtént, történni fog, esetleg csak vágyunk arra, hogy megtörténjen. Egyszóval, az ige és a kapcsolódó elemek számos hasznos információt hordoznak. Ha géppel akarom megkeresni ezeket az adatokat, egy olyan eszközre van szükség, ami felismeri az igéket egy adott szövegben és kinyeri a fenti információkat. Erre való a szófajelemző(felismerő), angolul part-of-speech tagger (POS-tagger). Az NLTK-ról szóló könyv ötödik fejezete ismertet néhány, az NLTK-be beépített eszközt, de ezeket sajnos csak angol nyelvű szövegeken lehet használni. Magyar nyelvű morfológiai elemző is létezik (a HUNMORPH ill. a HUNSPELL), azonban ezek azon túl, hogy nagyon nehezen konfigurálhatók, azt az örömet is elveszik, hogy magam gondolkozzam el a problémán;) (természetesen ezek nagyon jó eszközök, de professzionális felhasználásra készültek, ezért nem nagyon veszik figyelembe a "barkács-programozók" igényeit)
2011. március 9.
Ismét a paradigmákról
Posted by
Zoltan Varju
Úgy tűnik tegnapi posztomra többen reagáltak, köszönöm szépen a leveleket (de megjegyezném hogy lehet kommentelni is ám!). Ugyanakkor elkövettem egy hibát, adottnak vettem hogy mindenki ismeri az általam csak gondolatindítónak említett vitát. Ezért most rövide összefoglalnám Gibson és Fedorenko érveit a grammatkalitási ítéletek ellene, ill Culicover és Jackendoff ellenérveit, no meg egy kicsit kiegészíteném a saját gondolataimmal a dolgot.
2011. január 29.
Írástudók hajnala: innováció a médiában I. - Wordnik, a 21. század szótára
Posted by
Zoltan Varju
Sokan temetik a Guttenberg-galaxist, pedig nagy a mozgolódás ezen a téren. Az újmédia telis-tele van innovációval, persze még nem látszik hogy a sok újdonságból mikor marad meg és válik általánosan elfogadottá, azonban vannak olyan irányzatok melyek kijelölik az utat. Sajnos ezekről felénk keveset olvashatunk itthon, az iPad/Kindle és mobil eszközökkel kapcsolatos híreken túl. Sorozatunkban megpróbálunk túllépni ezen és bemutatni pár olyan irányt ami utat mutathat. Az első részben a szavakra fókuszálunk és a szótárra, ami sokak szerint unalmas téma, sokan nagyon egyszerű dolognak tartják az online szótárakat, azonban a kérdés ennél sokkal összetettebb.
2010. december 26.
Google Ngram Viewer - Mi a szösz az?
Posted by
Zoltan Varju
A Google Labs mostanában indította el Books Ngram Viewer szolgáltatását és megjelntek a legkülönbözőbb "elemzések" mindenhol - még a print HVG-ben is találtam! Arról viszont kevés szó esik hogy mit is takar tkp. ez a szolgáltatás, miért indította el a Google, mi egyáltalán az az ngram (vagy jobban mondva n-gram) és mire jó ez azon kívül hogy szép grafikont rajzolunk.
2010. december 17.
Könyvismertető: Oakes; Statistics for Corpus Linguistics
Posted by
Zoltan Varju
Az előző posztban bemutatott kötet szervesen kapcsolódik össze a most tárgyalt művel. Azonban előre kell bocsátanom hogy ez a kötet nem egy "bevezetés a statisztikába nyelvészeknek", hanem a statisztikai módszerek alapos és érthető bemutatása a korpusznyelvészet területén. Így elsősorban azoknak ajánlom akik már rendelkeznek a szükséges ismeretekkel megértéséhez.
- Michael P. Oakes: Statistics for Corpus Linguistics
- Edinburgh University Press 1998
- 272 oldal
2010. december 14.
Könyvismertető: McEnry - Wilson; Corpus Linguistics An Introduction
Posted by
Zoltan Varju
Napjainkban a korpusznyelvészeti módszertan reneszánszát éli, azonban sajnos a hazai felsőoktatásban még nem vált általánossá oktatása (habár vannak biztató jelek). Talán ezért kérték sokan hogy ajánljunk olyan könyveket melyeket önállóan is feldolgozhatnak az érdeklődők. McEnry és Wilson műve egy alapos és átgondolt bevezetés azok számára akik már rendelkeznek egy minimális háttérrel (azaz hallgattak már egy nyelvészeti bevezető tárgyat, vagy olvastak bevezető jellegű műveket - akik ezt még nem tették meg, Nyelvészet - csak röviden posztunkban találhatnak információt arról hol érdemes elkezdeni a témával való ismerkedést). Augusztusban bemutattuk Meyer English Corpus Linguistics művét, ami egy áttekintést ad a témáról, az informatika területéről érkezők számára ajánljuk hogy olvassák el azt a rövid bevezető munkát mielőtt belekezdenek ebbe a komolyabb munkába, nyelvész és egyéb bölcsész olvasóinknak pedig ajánljuk hogy statisztikai ismereteiket elevenítsék fel, vagy ha ezen a téren nem járatosak, olvassák el Statisztikai túlélőkészlet posztunkat ami talán segíthet elindulni a területen.
- Tony McEnry - Andrew Wilson: Corpus Linguistics An Introduction
- Edinburgh University Press 2001 (első kiadás 1996)
- honlap: http://www.lancs.ac.uk/fss/courses/ling/corpus/
- 235 oldal
2010. november 12.
Bohumil Hrabal szótára
Posted by
Zoltan Varju
Tempfli Péter vendégposztja
František Čermák, Václav Cvrček (eds.)
Nakladatelství Lidové Noviny / Ústav Českého Národního Korpusu 2009.
A prágai Károly Egyetem Cseh Nemzeti Korpusz Intézete 2009-ben jelentette meg a tizenhárom éve elhunyt, de már életében legendává vált Bohumil Hrabal írói nyelvének szótárát (a magyar olvasók a legjobban Hrabal Sörgyári capriccio és A szigorúan ellenőrzött vonatok című könyveit, és Jiří Menzel filmadaptációit ismerik). E kiadvány annak a sorozatnak a második része, mely 2007-ben Karel Čapek nyelvének feldolgozásával indult meg.
2010. október 12.
The life of a computational linguist II. - Interview with Oliver Mason
Posted by
Zoltan Varju
This week we interviewed Oliver Mason, a computational linguist at the Department of English of University of Birmingham. He holds an MA in Computational Linguistics from the University of Trier, and a PhD in Linguistics from the University of Birmingham. You can find more information on Oliver on his personal webpage. He runs two blogs, Language and Computation and Learning, Teaching, Research. You can find him on twitter as ojmason.
2010. szeptember 14.
Az adatok megmagyarázhatatlan természete
Posted by
Zoltan Varju
"For those who were hoping that a small number of general rules could explain language, it is worth noting that language is inherently complex, with hundreds of thousands of vocabulary words and a vast variety of grammatical constructions. Every day, new words are coined and old usages are modified. This suggests that we can’t reduce what we want to say to the free combination of a few abstract primitives." Halevy, Norvig, Pereira: The unreasonable Effectiveness of Data
Előző posztjaimban az adatok tudományával foglalkoztam és a visszajelzések alapján sokak érdeklődését felkeltettem. Mielőtt azonban a szögre akasztanánk megszokott eszköztárunkat, egy kicsit gondolkozzunk el az adatok természetéről.
Előző posztjaimban az adatok tudományával foglalkoztam és a visszajelzések alapján sokak érdeklődését felkeltettem. Mielőtt azonban a szögre akasztanánk megszokott eszköztárunkat, egy kicsit gondolkozzunk el az adatok természetéről.
2010. szeptember 10.
A New York Times és a Guardian API-k használata
Posted by
Zoltan Varju
Ahogy az előző posztokban említettem sokan reménykednek abban hogy a neten összegyűlt hatalmas adat mennyiség betekintést nyújthat abba hogyan is működik a nyelv. Habár sokat segíthet ha rengeteg adattal rendelkezünk, ennek vannak határai - ahogy erre pl Kilgariff is rámutatott. Nem is beszélve a technikai és jogi korlátokról.
2010. szeptember 4.
Az adatok tudománya és a nyelvtudomány - olvasnivaló
Posted by
Zoltan Varju
Sokan kérdezték az előző poszt kapcsán hogy hogyan is indulhatnak el "data science" ügyben. Itt egy kis összefoglaló következik, mit érdemes olvasni, merre érdemes keresgetni, és egy kicsit ajánlani fogom korábbi posztjaimat is. Tehát most sorra vesszük hogy egy nyelvész mit tehet hogy 1) betekintést nyerhessen az adatok tudományába 2) eszköztárába illeszthesse a nyelvi adatok elemzésére alkalmas módszereket.
2010. július 23.
Szógyakoriság vizualizáció Many Eyes használatával
Posted by
Zoltan Varju
Legelső szógyakorisági posztomban amúgy ránézésre fedeztük fel egy korpusz tartalmát előre elkészített szógyakorisági táblával. Majd pedig megnéztük hogyan készíthetünk egyszerűen egy gyakorisági táblát, és miképp tehetjük szebbé ábránkat. Ehhez minimális programozásra volt szükség, viszont kaptunk egy szép táblát amiből az IBM Many Eyes rendszerével interaktív vizualizációt készíthetünk könnyen, gyorsan, ingyen.
A program használata annyira egyszerű és magától érthető hogy nem kell magyarázni. Fontos hogy regisztrálnod kell hogy saját adatokat tölthess fel és adataid nyilvánosak lesznek (más is használhatja azokat saját vizualizációhoz) illetve kommentelhetővé válik munkád. Mivel egy kép gyakran többet ér bármennyi szónál, lássuk mit alkottam.
Fontos megjegyezni hogy nem kell feltétlenül gyakoriságitáblát feltöltened, elég egy sima szövegfájl, de szexibb ha van saját tábnlánk.

A program használata annyira egyszerű és magától érthető hogy nem kell magyarázni. Fontos hogy regisztrálnod kell hogy saját adatokat tölthess fel és adataid nyilvánosak lesznek (más is használhatja azokat saját vizualizációhoz) illetve kommentelhetővé válik munkád. Mivel egy kép gyakran többet ér bármennyi szónál, lássuk mit alkottam.
Fontos megjegyezni hogy nem kell feltétlenül gyakoriságitáblát feltöltened, elég egy sima szövegfájl, de szexibb ha van saját tábnlánk.

2010. július 14.
Szógyakoriság ismét (de most saját fájlból, R használatával elemezve)
Posted by
Zoltan Varju
Az előző technikai jellegű posztomban a Magyar Webkorpusz alapján vetettünk egy pillantást a szógyakoriságra. Most egy saját szöveges fájlból készítünk szógyakorisági témát.
Eszközök
Egy szövegfájl Keressünk egy szövegfájlt az OSZK MEK honlapján. Válaszd a html formátumot.
HTML "kitisztító" html2text, ha Ubuntu, vagy Linux alapú oprendszered van akkor a szokásos módon telepítheted. Vagy választhatod a python alatt bármikor bárhol futtatható verziót is. Házi feladat, készíts a html fájlból egy "plain text" fájlt. A program man page-e talán segít.
Egy kész szövegfájl letölthető itt, ha lusta vagy (vagy valamiért nem tudod magad megcsinálni).
R Ha még nincs fent a gépeden, akkor telepítsd fel az R statisztikai programozási nyelvet.
A feladat
Arra vagyunk kíváncsiak hogy egy adott szó hányszor fordul elő a fájlban. Gondolkozz egy kicsit milyen problémákat vet ez fel. Mi az hogy szó? Mi neked egy szó és mi a számítógépnek? Mi nagyon egyszerű definíciót adunk itt, szónak egy olyan karaktersort tekintünk amit két nem-karakter között összefüggően fordul elő. Jó mi? (Kicsit gondolkozz el azon hogy ez mennyire jó meghatározás, hogyan kellene finomítani hogy megfeleljen a szó intuitív fogalmának) Elgondolkodtál? Akkor egy kicsit még maradjunk a témánál. Nyilván így egy halandzsa, vagy félreütött karaktersor is szó (pl asAnza), felmerül a kérdés hogy a "tó" "tavak" egy vagy két szó-e (nálunk kettő, mivel technikailag nagyon nehéz lenne morfológiailag elemezni). Mi van a mondat elején nagybetűvel kezdett "Asztal" és a csupa kisbetűs "asztal" esetében? Ezt könnyű megoldani, nem okoz gondot átalakítani a karaktereket. Nyilván figyelembe kell venni ezeket a kérdéseket. De ha eltekintünk ezektől, attól még egy becslést tehetünk.
Vágjunk bele!
Indítsd el az R-t abban a könyvtárban ahol a szövegfájlod található. Először olvassuk be a fájlt hogy tudjunk vele dolgozni.
> textfile<-scan(file.choose(), what="char", sep="\n", quote="", comment.char="")
Figyelem! Mac és Windows használók a file.choose() függvényt cseréljék ki choose,files() -ra.
Alakítsuk át a fájlt csupa kisbetűs karakterek sorává. (Ugye mondtam hogy egyszerű lesz, "Asztal"-ból, "asztal" lesz így)
> textfile<-tolower(textfile)
Abban maradtunk hogy "szónak egy olyan karaktersort tekintünk amit két nem-karakter között összefüggően fordul elő" . Ez R-ben:
> words.list<-strsplit(textfile, "\\W+")
Fent semmi mást nem tettünk mint a fájl tartalmát "feldaraboltuk" a "nem szó-karakterek" mentén. Ezt a \W+ reguláris kifejezéssel értük el (szabályos kifejezéseknek is hívják őket, ha angolul keresed regular expressions).
Egy kicsit bonyolítsuk a dolgot. Tudjuk az előző posztból hogy bizonyos szavak nagyon gyakoriak. Ezeket gyakran töltelékszavaknak hívjuk, vagy angolos szakzsargonnal stop words. Ha kiszűrjük ezeket a szavakat, akkor egy kicsit jobb képet kaphatunk hogy a normális szavak milyen gyakoriak (kontentívumok maradnak, mivel a legtöbb töltelékszó funktor). Tegyük ezt akkor! Először is egy listát készítünk ezekről a faramuci szavakról:
> stop.list<-c("a", "egy", "be", "ki", "le", "fel", "meg", "el", "át", "rá", "ide", "oda", "szét", "össze", "vissza", "de", "hát", "és", "vagy", "hogy", "van", "lesz", "volt", "csak", "nem", "igen", "mint", "én", "te", "ő", "mi", "ti", "ők", "ön", "ez", "az", "ha")
Alakítsuk egy kicsit át a beolvasott szövegfájlt:
> words.vector.h<-unlist(words.list)
Most már egy adat típusba tartozik a beolvasott szöveg és a töltelékszavak listája is, ki is szűrhetjük őket.
> words.vector<-words.vector.h[!(words.vector.h %in% stop.list)]
A következő lépésekben pedig elmentjük a gyakorisági táblázatot egy kimeneti fájlba.
> freq.list<-table(words.vector)
> sorted.freq.list<-sort(freq.list, decreasing=T)
> sorted.freq.list<-sorted.freq.list[sorted.freq.list>1]
> sorted.table<-paste(names(sorted.freq.list), sorted.freq.list, sep="\t")
> cat("WORD\tFREQ", sorted.table, file=file.choose(), sep="\n")
Bónusz gnuplot bütykölés
A gyakorisági adatokat csökkenő sorrendbe tettük és a csak egyszer előforduló elemeket is kiszűrtük (hogy nagyon okos legyél olvasd el mi az a hapax legomenon, na azé' szűrjük ki!). Most hogy elmentettük, gnuplot-tal az előző posztomban leírtak szerint készíthetsz egy szép ábrát hogy lásd arányaiban hányszor fordul elő egy-egy elem. Az enyém így néz ki.

Ha összeveted az előző ábrával láthatod hogy nincsenek kiugró vonalak (hapax legomena!). Nem is kezd olyan magas értéknél, de hát kisebb is a mintánk. A lényeg hogy szebb (lehet hogy csak nekem).
Ha érdekel akkor ezt olvasd
A poszt megírásához Stefan Th. Gries Quantitative Corpus Linguistics with R könyve adott inspirációt, a kódrészleteket pedig minimális változtatással vettem át.

Eszközök
Egy szövegfájl Keressünk egy szövegfájlt az OSZK MEK honlapján. Válaszd a html formátumot.
HTML "kitisztító" html2text, ha Ubuntu, vagy Linux alapú oprendszered van akkor a szokásos módon telepítheted. Vagy választhatod a python alatt bármikor bárhol futtatható verziót is. Házi feladat, készíts a html fájlból egy "plain text" fájlt. A program man page-e talán segít.
Egy kész szövegfájl letölthető itt, ha lusta vagy (vagy valamiért nem tudod magad megcsinálni).
R Ha még nincs fent a gépeden, akkor telepítsd fel az R statisztikai programozási nyelvet.
A feladat
Arra vagyunk kíváncsiak hogy egy adott szó hányszor fordul elő a fájlban. Gondolkozz egy kicsit milyen problémákat vet ez fel. Mi az hogy szó? Mi neked egy szó és mi a számítógépnek? Mi nagyon egyszerű definíciót adunk itt, szónak egy olyan karaktersort tekintünk amit két nem-karakter között összefüggően fordul elő. Jó mi? (Kicsit gondolkozz el azon hogy ez mennyire jó meghatározás, hogyan kellene finomítani hogy megfeleljen a szó intuitív fogalmának) Elgondolkodtál? Akkor egy kicsit még maradjunk a témánál. Nyilván így egy halandzsa, vagy félreütött karaktersor is szó (pl asAnza), felmerül a kérdés hogy a "tó" "tavak" egy vagy két szó-e (nálunk kettő, mivel technikailag nagyon nehéz lenne morfológiailag elemezni). Mi van a mondat elején nagybetűvel kezdett "Asztal" és a csupa kisbetűs "asztal" esetében? Ezt könnyű megoldani, nem okoz gondot átalakítani a karaktereket. Nyilván figyelembe kell venni ezeket a kérdéseket. De ha eltekintünk ezektől, attól még egy becslést tehetünk.
Vágjunk bele!
Indítsd el az R-t abban a könyvtárban ahol a szövegfájlod található. Először olvassuk be a fájlt hogy tudjunk vele dolgozni.
> textfile<-scan(file.choose(), what="char", sep="\n", quote="", comment.char="")
Figyelem! Mac és Windows használók a file.choose() függvényt cseréljék ki choose,files() -ra.
Alakítsuk át a fájlt csupa kisbetűs karakterek sorává. (Ugye mondtam hogy egyszerű lesz, "Asztal"-ból, "asztal" lesz így)
> textfile<-tolower(textfile)
Abban maradtunk hogy "szónak egy olyan karaktersort tekintünk amit két nem-karakter között összefüggően fordul elő" . Ez R-ben:
> words.list<-strsplit(textfile, "\\W+")
Fent semmi mást nem tettünk mint a fájl tartalmát "feldaraboltuk" a "nem szó-karakterek" mentén. Ezt a \W+ reguláris kifejezéssel értük el (szabályos kifejezéseknek is hívják őket, ha angolul keresed regular expressions).
Egy kicsit bonyolítsuk a dolgot. Tudjuk az előző posztból hogy bizonyos szavak nagyon gyakoriak. Ezeket gyakran töltelékszavaknak hívjuk, vagy angolos szakzsargonnal stop words. Ha kiszűrjük ezeket a szavakat, akkor egy kicsit jobb képet kaphatunk hogy a normális szavak milyen gyakoriak (kontentívumok maradnak, mivel a legtöbb töltelékszó funktor). Tegyük ezt akkor! Először is egy listát készítünk ezekről a faramuci szavakról:
> stop.list<-c("a", "egy", "be", "ki", "le", "fel", "meg", "el", "át", "rá", "ide", "oda", "szét", "össze", "vissza", "de", "hát", "és", "vagy", "hogy", "van", "lesz", "volt", "csak", "nem", "igen", "mint", "én", "te", "ő", "mi", "ti", "ők", "ön", "ez", "az", "ha")
Alakítsuk egy kicsit át a beolvasott szövegfájlt:
> words.vector.h<-unlist(words.list)
Most már egy adat típusba tartozik a beolvasott szöveg és a töltelékszavak listája is, ki is szűrhetjük őket.
> words.vector<-words.vector.h[!(words.vector.h %in% stop.list)]
A következő lépésekben pedig elmentjük a gyakorisági táblázatot egy kimeneti fájlba.
> freq.list<-table(words.vector)
> sorted.freq.list<-sort(freq.list, decreasing=T)
> sorted.freq.list<-sorted.freq.list[sorted.freq.list>1]
> sorted.table<-paste(names(sorted.freq.list), sorted.freq.list, sep="\t")
> cat("WORD\tFREQ", sorted.table, file=file.choose(), sep="\n")
Bónusz gnuplot bütykölés
A gyakorisági adatokat csökkenő sorrendbe tettük és a csak egyszer előforduló elemeket is kiszűrtük (hogy nagyon okos legyél olvasd el mi az a hapax legomenon, na azé' szűrjük ki!). Most hogy elmentettük, gnuplot-tal az előző posztomban leírtak szerint készíthetsz egy szép ábrát hogy lásd arányaiban hányszor fordul elő egy-egy elem. Az enyém így néz ki.

Ha összeveted az előző ábrával láthatod hogy nincsenek kiugró vonalak (hapax legomena!). Nem is kezd olyan magas értéknél, de hát kisebb is a mintánk. A lényeg hogy szebb (lehet hogy csak nekem).
Ha érdekel akkor ezt olvasd
A poszt megírásához Stefan Th. Gries Quantitative Corpus Linguistics with R könyve adott inspirációt, a kódrészleteket pedig minimális változtatással vettem át.

Feliratkozás:
Bejegyzések (Atom)





