A következő címkéjű bejegyzések mutatása: szöveg. Összes bejegyzés megjelenítése
A következő címkéjű bejegyzések mutatása: szöveg. Összes bejegyzés megjelenítése

2012. március 11.

Kulcsszavak kinyerése szöveges dokumentumból

Bár ismeretes, hogy már létező megoldást újra megírni nem igazán érdemes, talán alapvető eljárások esetében mégis más a helyzet: tanulni és megérteni szerintem sok dolgot így lehet a legjobban. Tehát, egy klasszikus keyword-extraction eljárással és egy hasznos python könyvtárral való ismerkedésem dokumentálása következik.

2011. augusztus 10.

TeX/LaTeX: írás és feldolgozás II.

A poszt első részében ismertettük, hogy miért és hogyan használjuk a LaTeX dokumentumokat. A TeX leíró nyelvet nem érintettük komolyabban. Ez nem is volt szándékunkban. Helyette az írás miértjét emeltük ki. A második részben pedig a feldolgozás miértjére és a hogyanra keressük a választ és látjuk el tanácsokkal, ötletekkel az olvasót.

2011. július 11.

TeX/LaTeX: írás és feldolgozás I.

Mi ez? Mire való? Én miért használjam? A kérdések után rátérünk az írás módjára, hogy hogyan írjunk latex dokumentumokat. Milyen előnyeink származnak belőle, milyen paradigmaváltás szükséges, ami a más típusú szövegszerkesztőknél is sokat segíthet a dokumentumok helyes szerkesztésében. Illetve a második részben, a József Attila versek felhasználásához hasonlóan egy újabb példát nyújtunk, de most a latex dokumentumok feldolgozására, megtisztítására és nyelvészeti szempontú megmunkálására.

2011. május 23.

Wikipedia API – sok szöveg, gyorsan, tisztán

Már volt szó korábban az API-k használatáról a New York Times és a Guardian adatai kapcsán. Az API (alkalmazásprogramozási interfész) egy olyan szabványosított felület, amin keresztül hozzá lehet férni egy másik program funkcióihoz – anélkül, hogy részletesen ismernünk kéne azok működését. Minket ez elsősorban a webes alkalmazások miatt érdekel : sok oldal lehetővé teszi, hogy megkerülve a webes felületet férjünk hozzá az adatokhoz, vagy akár interakcióba lépjünk velük (közismert példa a facebook-os alkalmazás).
A Wikipedia is szabadon hozzáférhető a web megkerülésével, és ez valójában mindenkinek jó: a fejlesztők pontosan olyan adatokat kapnak, amilyet kívánnak, a Wikipedia szervereinek pedig nem kell azon erőlködniük, hogy emberi fogyasztásra alkalmassá tegyék az adathalmazt (ezzel csökken a terhelés). 

2011. április 27.

A szöveg-osztályozás néhány kérdése

A szöveg-kategorizálás olyan terület, melynek rengeteg igen hasznos gyakorlati felhasználása lehet: internetes keresés, ügyfélszolgálati munka gyorsítása, könyvtári munka hatékonyabbá tétele, nyelvoktatás, egyetemi szféra, orvosi és jogi szövegekből új adatok kinyerése... Az ilyen programok megalkotása során a fő kérdés, hogyan lehet lehetőleg minél egyszerűbb, gép által hatékonyan feldolgozható szövegértelmezési elveket alkotni. Ebben az írásban egyszerűbb példák megoldása során alkalmazható módszerekről lesz szó.