A következő címkéjű bejegyzések mutatása: big data. Összes bejegyzés megjelenítése
A következő címkéjű bejegyzések mutatása: big data. Összes bejegyzés megjelenítése

2013. március 21.

Funkcionális programozás és big data

Paco Nathan (Concurrent data science director) egy olyan slide-ot csinált, ami önmagában is érthetővé teszi, miért nyer egyre nagyobb teret a funkcionális programozás big data körökben.

 

2013. március 13.

Könyvismertető: A valószínűség interpretációi

Manapság nagyon divatosak a big data-ról és prediktív analitkáról írott ismeretterjesztő könyvek. A négy legsikeresebb ezek közül Gleick: The Information,  Silver: The Signal and the Noise,  McGrayne: The Theory That Would Not Die és Mlodinow Részeg bolyongása. Mindegyik kötet foglalkozik valamennyire a valószínűség interpretációival, de nem jut túl a frekventista vs szubjektivista értelmezés rövid bemutatásán. A valószínűség értelmezése egyre központibb problémát jelent a mai analitka-vezérelt korban, ezt világosan jelzik olyan döntéshozóknak szánt címek mint a Managin Uncertainty. Szabó Gábor kiválló munkája remekül összefoglalja a valószínűség értelmezésével kapcsolatos kérdéseket, méghozzá világos és érthető módon, habár az ismeretterjesztő könyvekkel ellentétben feltételezi, hogy olvasója rendelkezik alapos matematikai előismeretekkel.

 

Hofer-Szabó Gábor a magyar tudományfilozófia egy jeles képviselője. Az ELTE HPS és Logika Tanszékei és a BME Filozófia és Tudománytörténet Tanszéke szakmai körökben világhírű (és nem csak itthon világhírű), rendszeresen kerülnek ki jelentős publikációk az oktatóktól és hosszú évek kitartó munkája árán építettek fel egy nagyon termékeny közösséget, aminek legkézzelfoghatóbb produktuma a Theoretical Philosophy Forum. Így nem meglepő, hogy A valószínűség interpretációi egy nagyon alapos munka, ami kiemelkedik a hasonló művek közül (pl. Mellor Probability: A Philosophical Introduction vagy Gillies Philosophical Theories of Probability). Fontos megjegyezni, hogy ez a könyv nem ismeretterjesztő munka, feltételezi, hogy olvasója nem-triviális matematikai előismeretekkel rendelkezik. A formalizmusok ellenére nagyon gördülékeny a szöveg (már amennyire egy ilyen mű az lehet) és szépen építkezik az anyag menet közben. Ahogy egyre jobban átszövi a prediktív analitika az életünket, érdemes elgondolkodni a valószínűség természetén és ehhez nagyon jó alapot nyújt ez a könyv. Kedvcsinálónak az előszóból (a kiadó oldaláról átvéve):

 

Mit jelent az, hogy egy szabályos dobókockával a hatos dobás valószínűsége egyhatod? A kérdésre az alábbi paradigmatikus válaszok adhatók:

 

Klasszikus válasz: Mivel szabályos kocka esetén mindegyik oldal előfordulása egyenlően lehetséges, és az esetek közül nekünk csak az egyik kedvez, ezért a kedvező esetek és az egyenlően lehetséges esetek számának aránya egyhatod lesz, és ez a hatos dobás valószínűsége. 

Logikai válasz: A hatos dobás valószínűsége azért egyhatod, mert az a kijelentés, hogy az eredmény hatos lesz, egyhatod mértékben következik abból a kijelentésből, hogy a kockát eldobtuk, egy mindkét kijelentést tartalmazó nyelvben.

Szubjektivista válasz: Az, hogy a hatos dobás valószínűsége egyhatod, azt jelenti, hogy egyhatod mértékben hiszünk a hatos dobás eseményében.

Frekventista válasz: A hatos dobás egyhatod valószínűsége semmi mást nem jelent, mint hogy a hatos relatív gyakorisága közel egyhatod lesz a kockadobások egy elegendően hosszú sorozatában.

Propensity válasz: A hatos dobásnak azért egyhatod a valószínűsége, mert a kocka fizikai környezetével együtt rendelkezik azzal az egyhatod mértékű kauzális hajlammal, hogy egy adott dobás során hatos legyen.

 

A fenti válaszok a valószínűség öt legfontosabb filozófiai interpretációjának jegyében születtek. A könyv ezeket az interpretációkat igyekszik bemutatni és értékelni. Ismerteti továbbá a valószínűség fogalmának történeti kialakulását, illetve legjelentősebb paradoxonait, valamint rövid bevezetőt nyújt a filozófiai elemzés számára nélkülözhetetlen matematikai fogalmakba. A könyvet elsősorban a matematika és a fizika filozófiai alapjai iránt érdeklődő olvasóknak ajánljuk.

2013. február 8.

Neked a divat mondja meg

Peter Elias 1958-as IRE szekesztői írása, Two Famous Papers, remek humorérzékkel mutatja be, mennyire rá tudnak kattani a kutatók egy-egy új elméletre. Ez akkoriban épp az információelmélet volt, de Norvig hírhedt esszéje nyomán tudjuk, ez ma sincs másképp. Persze ne legyünk igazságtalanok, hisz tudjuk, Shannon neves tanulmányában is szerepelnek nyelvi példák. De az adatok tényleg az elméletek végét jelentik, ahogy az Chris Anderson gondolja?

Pókok, zene és kategóriaelmélet

Vegyünk először egy példát teljesen más területről. A pókháló régóta izgatja a tudósok fantáziáját, mivel rendkívül erős anyag. A pókot tekinthetjük egy függvénynek, ami proteineket képez le proteinkre (a bemenete a táplálék, a kimenete a pókháló). A mesterséges pókháló megalkotása során a TR cikke szerint (amit erősen ajánlok az olvasók figyelmébe) általában próba-hiba módszerre alakítják át a proteineket. Gondolom azért a kutatók intuíciója és a kísérleti adatok erősen behatárolják, hogy hol alakítanak a proteineken. Markus Buehler csapata más utat választott. A kategóriaelmélet keretében írja le a pókok működését (a "pók függvényt"). Így katak egy általános absztrakt nyelvet. Ezek után az eddigi megfigyelésekre alapozva kiválasztották a legígéretesebb struktúrákat, majd  arra kértek zenetudományi szakembereket, hogy komponáljanak melódiákat a meghatározott kategóriákra alapozva. Észrevették hogy bizonyos mintázatok erős, mások gyenge mesterséges pókhálóhoz vezetnek és az ezekhez kapcsolódó zenei mintázatokban is szisztematikus különbség fedezhető fel. A következő lépésben arra kérték a zenészeket, hogy az erős hálókra jellemző mintázatok felhasználásával írjanak variációkat. Az eljárástól azt remélik, hogy a művészek kreativitása sok kipróbálásra érdemes mintázatot generál, olyanokat is melyekre a mérnökök és a matematikusok nem is gondolnának. 

"Marginal Improvements"

Az adatok korában hihetetlen dolgok történnek, ez nem kétséges. De vegyük észre, nem történik minőségi változás a felhasznált elméletkben. Persze egyre több terület válik adatvezérelté és ott, ahol ez bekövetkezik ez forradalminak hat. De mennyire jó ma egy POS-tagger, egy NER rendszer? Minden paper min. 85%-os pontosságot ígér, de a 98-99% sem ritka - persze ipari alkalmazás közben gyakran kiderül hogy nem ennyire rózsás a helyzet.

 

A legtöbb fejlesztés ma nem más mint kaparás egy-két százalékért. Ezt nem szabad lebecsülni, az ilyen marginális fejlődések nagyon fontosak. Tim Harford Pop-Up Enconomics podcastjában nagyon szemléletesen mondja el miképp szerzett olimpiai aranyakat a UK-nek Matt Parker és csapata avval, hogy odafigyelt minden kis apróságra ami javíthatja a versenyzők eredményeit. (Kicsit bővebben erről a The Independent-en) De meddig vihető el az ilyen aprólékos munka?

 

Physics envy

A legtöbb tudomány nem tud elszakadni a fizikától. Az az igazi tudomány, ami összekapcsolja az elvont matematikát a való világgal - minden magára adó tudósnak követnie kell ezt az utat. Nincs is ezzel semmi baj, nem árt ha inspirálódunk máshonnét. A manapság divatos data science és úgy általában az adatfüggők azonban le vannak maradva, a mai fizikában nem annyira comme il faut amit ők csinálnak.

Lassan, de biztosan kifejlődőben van egy új irányzat, ami a kvantumfizika és a kategóriaelmélet fogalmi hálójával próbál megmagyarázni bizonyos jelenségeket. Őket még nem fenyegeti az Elias által kifigurázott túláltalánosítás veszélye (de ha sikerül átjutniuk a mainstream-be, akkor lefogadom ez is megtörténik) és rendkívüli kreativitás szabadítanak fel interdiszciplináris megközelítésükkel. A minőségi ugrást most tőlük várjuk.

2013. január 19.

Bölcsészek; kulcs a sikerhez

MIközben a magyar ugaron leépítik a humán- és társadalomtudományokat, addig a világ szerencsésebb felén azt láthatjuk, hogy a siker titka pont bennük rejlik. A kontinentális Európában mindenki vakargatja a fejét, ha valaki nem tradícionális háttérrel kerül az IT világába és elterjedt tévhit hogy kell pár jó mérnök, erős sales és marketing csapat, valami kis lean startup izé és veszik majd a terméket mint a cukrot. Érdekes megfigyelni, hogy az igazán sikeres vállalkozásoknál még egy összetevő akad, ez pediglen a bölcsészek.


Kezdjük Marissa Mayer BiblioTech előadásával. Röviden, Mayer a Stanford Symbolic Systems szakán végzett, erről kerül ki a Silicon Valley újítóinak java. A szakot a filozófia tanszék(!) igazgatja, a tantervben a kognitívtudomány, a nyelvészet, a filozófia és a számítástudomány egyenlő arányban jelen az alapozás során, majd lehet szakosodni. Külön érdekesség, hogy itt született meg a HCI mint külön terület. Mayer is kiemeli, hogy különösen hasznosnak bizonyult számára, hogy alapszinten megismerkedett az empirikus adatgyűjtéssel.


Damon Horowitz a Google-nél spéci titulust visel, in-house philosopher és director of engineering egyben. Horowitz egy kiemelkedően sikeres tech karriert hagyott ott, hogy a Stanfordon filozófiából szerezzen PhD fokozatot. Horowitz útja érdekes, hallgató korában kacérkodott a filozófiával, de mivel ott nem igazán találkozhatunk, inkább a konkrét megoldást kínáló mesterséges intelligencia felé indult. Sok sikeres vállalkozás után rájött, a mesterséges intelligencia nagyon behatárolt és nem tud mindent megoldani, ezért visszatért az origóhoz. Horowtiz mára visszatért a technológiához, de úgy látja, alapvetően megváltozott a hozzáállása. Az Aardvark közösségi kereső (social search engine) megalkotását is ezen élménye ihlette.


Ma a big data korában alapvető etikai kérdések is felmerülnek. Horowitz feladata a Google-nél részben az, hogy ezekkel is foglalkozzon.TED előadása rávilágít arra, hogy nem csak az a kérdés hogy mit csinálhatunk meg, hanem hogy meg kell-e tennünk azt amit a technológia lehetővé tesz.


Hamár a big data előjött, akkor érdemes elgondolkodni azon, hogy miről is szoktak szólni ezek az adatok. Általában emberekről - felhasználó és/vagy vásárlók néven is ismertek - akik megértésére bizony régóta törekszenek azok a fránya társadalomtudósok. Vassünk egy pillantást a Microsoft Research vagy a Yahoo! Research oldalaira és vegyük észre hogy a (computational) social science, (experimental) economics témák külön projekteket és kutatócsoportokat is megérnek. A data science közösség meghatározó emberei között sok társadalomtudós akad, gondoljunk pl. Drew Conway-ra és John Miles White-ra (az O'Reilly-nél megjelent Machine Learning for Hackers és Bandit Algorithms for Website Optimization siker könyvek szerzői). Mivel általában struktúrálatlan (szöveges) adatokkal dolgoznak a szakik, megnövekedett az igény az ún. data curation iránt. Ezt általában korpusznyelvészek végzik, jó példa erre a Factual.

A Lajtától nyugatra a Stanford Symbolic Systems programja mellett nagy hangsúlyf fektet az interdiszciplinaritásra többek között a CMU (mind a language technology, mind a philosophy, mind pedig a machine learning department) és az MIT Media Lab. Európai példák is akadnak, mint az amszterdami ILLC, a Saarbrücken-i Department of Computational Linguistics and Phonetics, a leuveni mesterséges intelligencia kutatók és a University of Endinburgh-ön a School of Informatics cognitive science képzése. A "sima" bölcsészeten belül is egyre elterjedtebb a digitális bölcsészet (érdemes megnézni Ted Underwood és Scott Weingart blogjait és a THATCamp mozgalom oldalát), a társadalomtudományok körében pedig megjelent a computational social science irányzat.

Nem szabad megfeledkeznünk az adatújságírásról sem. A Guardian Data blog, a New York Times graphics department, a Prismatic és a Circa mind-mind olyan mixet alkot és teremt valami újat, ami lehetetlen lenne a diszciplináris határok átlépése nélkül. 

A humán tudományokon nevelkedett szakemberek nem törnek a mérnökök és a üzletitudományok művelőinek babérjaira. Ezzel a kis írással csupán arra próbáltam rávilágítani, hogy helyük van minden olyan csapatban ami tényleg nagyra tör. Az igazi innováció átlép a bevett határokon, ebben segíthetnek a bölcsészek. Sajnos az angolszász kultúrkörön kívül nem igazán jellemző ez az interdiszciplinaritás, hazánkban pedig különösen elterjedtt a merev, poroszos tudományfelosztás még az amúgy magát haladónak gondoló tech világban is.

2013. január 16.

Könyvismertető: Facts are Sacred: The power of data

Azok, akik tudni szeretnék mi is az az adatújságírás, Simon Rogers - a The Guradian Datablog szerkesztője - ebben a kis könyvben megadja a választ. 

 

Igazából ott kell kezdenem, hogy ez a könyv, nem is könyv, hanem egy - jó magyar szó híjján - single, amit az Amazon Kindle Singles honosított meg mint műfaj. Tkp. cikknek hosszú, könyvnek meg túl rövid írást fed a szó, olyan mint a novella, de nem az. Minden esetre olcsó (3 dollár), kellemes olvasmány a Facts are Sacred. Első sorban újságíróknak és az érdeklődő közönségnek íródott, így (szerencsére) mellőz minden technikai részletet.

Rogers alapvető állítása szerint az újságíró továbbra is újságíró, azaz mint a negyedik hatalmi ág képviselője fontos kérdésekre hívja fel a figyelmet egy-egy sztorival. Azonban ma, az adatok korában új lehetőségek adódtak, melyeket ki kell használni. A könyvecske definíciók helyett példákat sorol fel arra, miképp lehet hasznosítani az adatokat. Amennyire előnye a példák bemutatása, annyira a hátránya is. Az utolsó "fejezet" nem más, mint linkek halmaza (és ezek között akad szép számmal olyan ami már nem él, vagy elköltözött - ezt egy e-könyvben lehetne frissíteni), amitől úgy érzi az ember hogy romlik a könyv ár/érték aránya. Ennek ellenére úgy gondolom, nem csak újságírók, hanem a big data téma iránt érdeklődők is sok hasznos információt tudhatnak meg gyorsan, emészthető fomában és olcsón a kötet segítségével.

 

 

Akinek 92 oldal sok arra, hogy megismerje az adatújságírást, annak ajánlom Rogers Anyone can do it. Data journalism is the new punk című cikkét, és Data-journalists are the new punks c. előadását (l. fent).

2012. október 29.

Six Provocations for Big Data

Idén történt egy konferencián, hogy két számítástudós lelkesen adta elő "forradalmi" eredményeit egy konferencián és a közönség soraiból többen is mocorogtunk, vártuk a kérdések idejét. Maga az előadás rendben volt, az izgalmat az okozta hogy a bemutatott eredmények nem voltak forradalmiak, tkp. Mark Granovetter elméletét ismételték el az előadók és nem értették miért tesszük szóvá nekik ezt. A big data, data science és business intelligence hármasa egyre többször fut bele ilyen helyzetekbe, hiszen olyan témákról próbál szólni, melyeket más tudományok már régóta vizsgálnak. danah boyd és Kate Crawford Six provocations for big data című tanulmánya arra hívja fel a figyelmet hogy bizony vannak határai és buktatói a nagy adathalmazoknak is. A metodológiai kérdések mellett (pl. jobb-e a több adat, mennyire reprezentatív a Twitter és egyéb közösségi oldalak által szolgáltatott publikus adathalmaz stb.) legalább annyira izgalmasak az etikai kérdések (mennyire egyezik bele a mezei felhasználó abba hogy kutatásokra használjuk adatait, ki férhet hozzá az adatbázisokhoz) is. Érdemes elolvasni a tanulmányt, vagy legalább megnézni az  alábbi videót.


2012. szeptember 26.

Vigyázzunk a big datával

Mostanában big data van mindenol. Most fejeztem be a How Data Science is Transforming Health Care c. rövid (és ingyenes!) könyvet. Arra gondoltam hogy jó lehet technokratának lenni, de ne zárjuk be a bölcsészkarokat, sőt próbáljunk azért pár társadalomtudóst is kinevelni a meglévők pótlására mert nélkülük nagy bajban leszünk. Hogy miért? Attól hogy egyre több adat áll rendelkezésünkre hála az open government data mozgalomnak, egyre nagyobb teret nyerhet az ún. evidence-based policy-making irányzat. Ahogyan arról már megemléketünk a blogon, a pénzügyi szférában egyszer már lejátszódott valami hasonló őrület, és Félix Salmon díjnyertes cikke és  a már szinén ajánlott Quants című film is jól bemutatja (nem beszélve az elhúzódó válságról amit mind nyögünk) hogy akármilyen robusztus, szofisztikált és egyéb trendi jelzővel ellátott modellünk is van, az bizony tévedhet. Scott E. Page Model Thinking kurzusa zseniálisan mutatja be a ma alkalmazott modelleket, az alábbi videó első részében szépen sorba veszi az evidence-based irányzat elleni érveket, ill. beszól a big data modell ellenességének is. 

2012. szeptember 18.

Scientific computing vs software engineering

Az nlp, a gépi tanulás és a legtöbb analitikai perverzió tkp. alapkutatásokból nőtte ki magát és mostanában kezd igazán teret nyeri az iparban. A hagyományos shopokban kialakult egy már nagyon jól működő praktika a software engineering, ami a tervezéstől a minőségbiztosításon át a projektmenedzsmentig mindent lefed. Persze nincs általános csodaszer és vannak metodológiai viták, de a bevett gyakorlatok kialakultak. A scientific computing ellenben nagyon más utat járt be. Az olyan startupok és érettebb cégek sikerei mint pl Prismatic, Factual, Silkapp, Twitter azt sugallják hogy a funkcionális nyelvek segítségével hatékonyan alkalmazhatók az iparban is a scientific computing eredményei. Ez azonban csak a hipotézisem, melyet alábbi olvasmányaimra alapozok. A következő pár hónapban remélem sikerül pár cégnél és kutatóhelynél személyesen is kérdőíveznem, strukturált interjúkat folytatnom a témában. Ha lenne javaslatot további szakirodalomra, vagy ismersz olyan céget/kutatóhelyet ahol funkcionális programozási nyelvet használnak, kérlek írj nekem a zoltan.varju(kukac)gmail.com email címre.

Mitől kutatás-vezérelt valami, hogy kerül a tudományos módszer ide?
Scientific computing vs software engineering
Ellenvetés - avagy a "klasszikus" háttérrel rendelkezők idegenkedése a (kvázi-) funkcionális paradigmától
Proofs are programs - avagy miért a funkcionális nyelvek
Product design, stb.
Hogyan vizsgáljuk meg a helyzetet és készítsünk tervet a jövőre?

2012. szeptember 7.

Filmajánló: Freakonomics: The Movie

Térdig gázolunk a big datában, de sokszor úgy tűnik hogy az adatok begyűjtése mellett elsikkad a kreatív elemzés. A társadalomtudományoktól van mit tanulnunk ezen a téren. Levitt és Dubner sikerkönyve a Freakonomics és annak folytatása a SuperFreakonomics remek példája annak miképp is lehet az adatokból érdekes válaszokat kinyerni. A dokumentumfilm nagyon élvezetesen mutatja be ezt a folyamatot, de természetesen nem megy bele annyira a részletekbe mint a könyv. Hétvégére viszont remek néznivaló a Freakonomics! Nem maradunk nyelvi vonatkozások nélkül sem, a nevek és az éves jövedelem közötti összefüggések vizsgálata minden szociolingvisztika iránt érdeklődő kolléga szívét meg fogja dobogtatni.


2012. június 20.

Kik azok a quantok?

A big data majd megold mindent posztunkban hivatkoztunk a quantokra, de elfelejtettük elmondani kik is ők. Maga a szó a "quantitative analyst" rövidítése, tehát kvantitatív elemzőt takar. Aki ennél hosszabb magyarázatot kíván, forduljon a Wikipedia vonatkozó szócikkéhez. Hogy jobban megértsük miért int minket a quantok tapasztalata óvatosságra, ajánjuk Felix Salmon Recipe for Disaster: The Formula That Killed Wall Street cikkét, mely az American Statistical Society díját is kiérdemelte. Kicsit másképp, de nagyon jól világítja meg a problémát Marije Meerman Quants: The Alchemists of Wall Street című dokumentumfilmje.