Bár ismeretes, hogy már létező
megoldást újra megírni nem igazán érdemes, talán alapvető
eljárások esetében mégis más a helyzet: tanulni és megérteni
szerintem sok dolgot így lehet a legjobban. Tehát, egy klasszikus
keyword-extraction eljárással és egy hasznos python könyvtárral
való ismerkedésem dokumentálása következik.
A következő címkéjű bejegyzések mutatása: szöveg. Összes bejegyzés megjelenítése
A következő címkéjű bejegyzések mutatása: szöveg. Összes bejegyzés megjelenítése
2012. március 11.
2011. augusztus 10.
TeX/LaTeX: írás és feldolgozás II.
Posted by
Gerő Dávid
A poszt első részében ismertettük, hogy miért és hogyan használjuk a LaTeX dokumentumokat. A TeX leíró nyelvet nem érintettük komolyabban. Ez nem is volt szándékunkban. Helyette az írás miértjét emeltük ki. A második részben pedig a feldolgozás miértjére és a hogyanra keressük a választ és látjuk el tanácsokkal, ötletekkel az olvasót.
2011. július 11.
TeX/LaTeX: írás és feldolgozás I.
Posted by
Gerő Dávid
Mi ez? Mire való? Én miért használjam? A kérdések után rátérünk az írás módjára, hogy hogyan írjunk latex dokumentumokat. Milyen előnyeink származnak belőle, milyen paradigmaváltás szükséges, ami a más típusú szövegszerkesztőknél is sokat segíthet a dokumentumok helyes szerkesztésében. Illetve a második részben, a József Attila versek felhasználásához hasonlóan egy újabb példát nyújtunk, de most a latex dokumentumok feldolgozására, megtisztítására és nyelvészeti szempontú megmunkálására.
2011. május 23.
Wikipedia API – sok szöveg, gyorsan, tisztán
Posted by
Istvan Nagykovacsi
Már volt szó korábban az API-k használatáról a New York Times és a Guardian adatai kapcsán. Az API (alkalmazásprogramozási interfész) egy olyan szabványosított felület, amin keresztül hozzá lehet férni egy másik program funkcióihoz – anélkül, hogy részletesen ismernünk kéne azok működését. Minket ez elsősorban a webes alkalmazások miatt érdekel : sok oldal lehetővé teszi, hogy megkerülve a webes felületet férjünk hozzá az adatokhoz, vagy akár interakcióba lépjünk velük (közismert példa a facebook-os alkalmazás).
A Wikipedia is szabadon hozzáférhető a web megkerülésével, és ez valójában mindenkinek jó: a fejlesztők pontosan olyan adatokat kapnak, amilyet kívánnak, a Wikipedia szervereinek pedig nem kell azon erőlködniük, hogy emberi fogyasztásra alkalmassá tegyék az adathalmazt (ezzel csökken a terhelés). 2011. április 27.
A szöveg-osztályozás néhány kérdése
Posted by
Istvan Nagykovacsi
A szöveg-kategorizálás olyan terület, melynek rengeteg igen hasznos gyakorlati felhasználása lehet: internetes keresés, ügyfélszolgálati munka gyorsítása, könyvtári munka hatékonyabbá tétele, nyelvoktatás, egyetemi szféra, orvosi és jogi szövegekből új adatok kinyerése... Az ilyen programok megalkotása során a fő kérdés, hogyan lehet lehetőleg minél egyszerűbb, gép által hatékonyan feldolgozható szövegértelmezési elveket alkotni. Ebben az írásban egyszerűbb példák megoldása során alkalmazható módszerekről lesz szó.
Feliratkozás:
Bejegyzések (Atom)