2013. február 8.

Neked a divat mondja meg

Peter Elias 1958-as IRE szekesztői írása, Two Famous Papers, remek humorérzékkel mutatja be, mennyire rá tudnak kattani a kutatók egy-egy új elméletre. Ez akkoriban épp az információelmélet volt, de Norvig hírhedt esszéje nyomán tudjuk, ez ma sincs másképp. Persze ne legyünk igazságtalanok, hisz tudjuk, Shannon neves tanulmányában is szerepelnek nyelvi példák. De az adatok tényleg az elméletek végét jelentik, ahogy az Chris Anderson gondolja?

Pókok, zene és kategóriaelmélet

Vegyünk először egy példát teljesen más területről. A pókháló régóta izgatja a tudósok fantáziáját, mivel rendkívül erős anyag. A pókot tekinthetjük egy függvénynek, ami proteineket képez le proteinkre (a bemenete a táplálék, a kimenete a pókháló). A mesterséges pókháló megalkotása során a TR cikke szerint (amit erősen ajánlok az olvasók figyelmébe) általában próba-hiba módszerre alakítják át a proteineket. Gondolom azért a kutatók intuíciója és a kísérleti adatok erősen behatárolják, hogy hol alakítanak a proteineken. Markus Buehler csapata más utat választott. A kategóriaelmélet keretében írja le a pókok működését (a "pók függvényt"). Így katak egy általános absztrakt nyelvet. Ezek után az eddigi megfigyelésekre alapozva kiválasztották a legígéretesebb struktúrákat, majd  arra kértek zenetudományi szakembereket, hogy komponáljanak melódiákat a meghatározott kategóriákra alapozva. Észrevették hogy bizonyos mintázatok erős, mások gyenge mesterséges pókhálóhoz vezetnek és az ezekhez kapcsolódó zenei mintázatokban is szisztematikus különbség fedezhető fel. A következő lépésben arra kérték a zenészeket, hogy az erős hálókra jellemző mintázatok felhasználásával írjanak variációkat. Az eljárástól azt remélik, hogy a művészek kreativitása sok kipróbálásra érdemes mintázatot generál, olyanokat is melyekre a mérnökök és a matematikusok nem is gondolnának. 

"Marginal Improvements"

Az adatok korában hihetetlen dolgok történnek, ez nem kétséges. De vegyük észre, nem történik minőségi változás a felhasznált elméletkben. Persze egyre több terület válik adatvezérelté és ott, ahol ez bekövetkezik ez forradalminak hat. De mennyire jó ma egy POS-tagger, egy NER rendszer? Minden paper min. 85%-os pontosságot ígér, de a 98-99% sem ritka - persze ipari alkalmazás közben gyakran kiderül hogy nem ennyire rózsás a helyzet.

 

A legtöbb fejlesztés ma nem más mint kaparás egy-két százalékért. Ezt nem szabad lebecsülni, az ilyen marginális fejlődések nagyon fontosak. Tim Harford Pop-Up Enconomics podcastjában nagyon szemléletesen mondja el miképp szerzett olimpiai aranyakat a UK-nek Matt Parker és csapata avval, hogy odafigyelt minden kis apróságra ami javíthatja a versenyzők eredményeit. (Kicsit bővebben erről a The Independent-en) De meddig vihető el az ilyen aprólékos munka?

 

Physics envy

A legtöbb tudomány nem tud elszakadni a fizikától. Az az igazi tudomány, ami összekapcsolja az elvont matematikát a való világgal - minden magára adó tudósnak követnie kell ezt az utat. Nincs is ezzel semmi baj, nem árt ha inspirálódunk máshonnét. A manapság divatos data science és úgy általában az adatfüggők azonban le vannak maradva, a mai fizikában nem annyira comme il faut amit ők csinálnak.

Lassan, de biztosan kifejlődőben van egy új irányzat, ami a kvantumfizika és a kategóriaelmélet fogalmi hálójával próbál megmagyarázni bizonyos jelenségeket. Őket még nem fenyegeti az Elias által kifigurázott túláltalánosítás veszélye (de ha sikerül átjutniuk a mainstream-be, akkor lefogadom ez is megtörténik) és rendkívüli kreativitás szabadítanak fel interdiszciplináris megközelítésükkel. A minőségi ugrást most tőlük várjuk.

2013. február 7.

CILC 2013

Megtisztelő, hogy a CILC 2013 elfogadta absztraktomat. A Corpus and ICT trackben fogok beszélni a korpuszok ipari alkalmazhatóságáról és az adatgondozás (data curation) szerepéről. Szerencsére egyre több remek eszköz áll rendelkezésünkre és az elérhető korpuszok száma is szépen növekszik, azonban az ipar és az akadémia nem igazán talál egymásra eltérő igényeik miatt. Az előadásommal pár ipari példa alapján arra szeretnék ösztönözni mindenkit, hogy az akadémiai kreativitást ötvözze az ipar pragmatikusságával.

2013. február 5.

inkLink 2013

Ahogy a Nyelv és Tudomány portálon is megjelent, április 6-án tartjuk az első magyar adatújságírás-napot. Ehhez kapcsolódik egy hack-day, ami remek alkalom egy kis programozásra a köz érdekében. Holnap (2013. február 6-án) 18:30-kor várják bloggertársaim az érdeklődőket egy kis informális meetupra és ötletelésre a Könyvtár Klubba (ELTE, Múzeum krt. 4.) Kérünk mindenkit hogy részvételi szándékát az esemény oldalán jelezze, ezzel is megkönnyítve a szervezők munkáját.
Aki szeretne bekapcsolódni a munkába, az nyugodtan jelentkezzen nálunk. Szponzornak lenni jó! Bármilyen támogatást szívesen fogadunk! Az alábbi felhívásokat nem tudjuk elégszer elismételni:

Szakemberek és újságírók!

Ha szeretné elmondani véleményét, tapasztalatait az adatvezérelt újságírással kapcsolatban, esetleg témaötletet ajánl a beszélgetés résztvevőinek, illetve ha szeretne megjelenni a rendezvényen, kérjük, azt a szerkesztoseg@nyest.hu címen jelezze. Kérjük, az email tárgymezejébe írja be: „inkLink 13” és március 18-ig juttassa el hozzánk jelentkezését.


Fejlesztők!

A hack-day keretében megvalósíható ötleteiket 2013 március 18-ig a zoltan.varju@gmail.com címre kérjük elküldeni (a tárgy mezőbe csak annyit írjon, „inkLink 13”). Maximum egy oldalban írja le a projekt célját, milyen hátterű önkéntesekkel tartja megvalósíthatónak és hogy ön miben tudja segíteni a csapatot a hack-day során (elsősorban szakértelemre gondolunk itt). A bérkezett ötletek közül a szervezők és szakértők csapata választja ki a legjobbakat és reálisan megvalósíthatókat. A nap végén a résztvevők kiválasztják azt a projektet, mely a leghasznosabb és leginkább érdemes arra hogy az OpenNews source programjára jelentkezzen és további fejlesztéséhez támogatást nyerhessen.

2013. február 3.

PhiLang 2013

Az a megtiszteltetés ért, hogy a PhiLang 2013 szervezői elfogadták Compositional and Distributional Theories of Meaning című absztraktomat. A Precognox keretein belül igyekszünk a modern gépi tanulás és a szemantikus web technikáit ötvözni. Aki belekóstolt már ebbe, az tudja mennyire bonyolult is ez, hiszen két, már-már ellentétes elméleti keretben kell egyszerre gondolkodni az ilyen projektek során. Ahogyan már egy korábbi posztomban is kifejtettem, valahogy érezzük hogy ez nincs rendben és egyre többen fordulunk a Widdows és Coecke által lefektetett átfogó modellekhez. A PhiLang remek alkalom arra, hogy bemutassam miképp is gondoltam tovább ezt a kérdést és a téma szakértőitől kapjak visszajelzést. A közeljövőben az ezzel kapcsolatos gyakorlati eredmények bemutatására is törekedni fogok, amint elfogadható állapotba kerül a jelenlegi spagetti kód jellegű implementációm. A konferencia után egy rövid posztban természetesen közzé fogom tenni előadásom főbb pontjait, addig azonban nem szeretném ellőni a puskaporomat.