Jaroslav Sixta: Jak AI mění hru ve statistice, IT a datové analýze
Pak jsem s krátkou přestávkou, ale poměrně rychle pokračoval a věnoval jsem se doktorskému studiu. Napsal jsem disertační práci, pak jsem navázal a obhájil jsem habilitační práci.
Statistika je disciplína, která mě velmi baví. Tak jak jsi povídala mám některé doktorandy, diplomové práce a i při svém vytíženosti se stále
snažím napsat nějaký článek, abych se udržoval v akademické sféře trochu fresh.
Co tě přivedlo k akademické dráze k vyučování na Unicorn University? Jaké předměty zde vyučuješ?
Rozumím. A jak se podle tebe mění způsob výuky statistiky a datové analýzy s pokrokem v technologiích?
Mění se to významně. Je to úplně nesrovnatelné. Když jsem studoval já, tak jsme vycházeli většinou, u těch složitějších metod, z odborných prací profesora Hebáka, kterého jsem měl velmi rád. Internet nebyl takhle dostupný, pak samozřejmě přišel rozvoj internetu… Dnes jsou možnosti úplně nesrovnatelné, ať už s využitím AI, když potřebuješ naprogramovat nějaký skript a hledáš řešení, tak se stačí vhodně zeptat a ten skript dostaneš. Pak ho stačí jen upravit. Ale nejen, že ti to pomáhá ve skriptu, ale i rozvoj samotné oblasti, ve statistické komunitě. V zásadě to není úplně free, ale je to minimálně do jisté míry dostupné. Věci prostě trvaly. Nejen že trvaly dlouho, ale byly skoro nemyslitelné řešit na počítači. A dnes je vyřešíš s lepším notebookem s lepším pc a je to opravdu nesrovnatelné, co dovedeš sám udělat a zpracovat…Dříve co jsme měli na půl semestru, tak z toho zkoušíme studenty, po dvou hodinách. A pak abych dokončil tu druhou část otázky. Dnes se do velké míry stírá rozdíl mezi IT, datovou analýzou a statistikou. Ta samotná statistika, ta teoretická, samozřejmě zůstane a zůstane to doménou několika vybraných odborníků. Ten zbytek, Mainstream, bude si leccos dělat sám s pomocí AI, případně s pomocí někoho dalšího, ale ty rozdíly mezi programováním a statistikou z hlediska té datový analýzy se do opravdu do velký míry setřely.
Již jsi zmínil umělou inteligenci a vlastně i strojové učení může mít vliv na budoucnost statistiky?
No obrovskou to! Je to je jednak strojové učení, to není úplně nová záležitost, na rozdíl od AI, která je záležitost opravu posledních let. Strojové učení je velice úspěšné i ve statistické praxi. Například na statistickém úřadě používáme některé metody Machine learningu s vysokou mírou úspěšnosti pro klasifikaci neznámých objektů do určitých skupin. Ten stroj to udělá jednou, učí se a nabaluje na sebe. Neříkám, že je to úplně běžná věc, to zase není. Ale není to úplně objevné. Zatímco co AI přinese něco řekněme objevnějšího. Jinými slovy já si to představuju tak, že budeš mít datový set, ten jí pošleš a potom jí řekneš: Najdi mi všechny chyby, které tam jsou, najdi podezřelé pozorování, udělej z toho nějakou závislost a ještě řekněme nějakou složitější, abychom zjistili co teda je ten řídící prvek v té množině…
A jaké jsou podle tebe největší trendy v oblasti statistiky a datové analýzy?
To by se dalo rozdělit na dvě skupiny. Minimálně na dvě skupiny. Ten trend v aplikované statistice je jeden v businessu. Za pomoci Pythonu, za pomoci R řeší složité záležitosti, o kterých se jim dřív ani nesnilo. To se samozřejmě do jisté míry dotýká i oficiální statistiky. Dostáváme se z těch nejlepších firem v oblasti i ke statistikům u nás, ve světě, v Evropě, v Americe…
No a pak je to ta druhá část - mezinárodní pokrok. Na poli oficiální statistiky dochází k utužování některých standardů, ke zesložiťování věcí a k většímu
důrazu na metadata. Další přidružené oblasti ke statistice, které se hodně
diskutují, já to třeba nemám úplně moc rád, protože to trošku odvádí od toho jádra, ale asi je to taky do jisté míry důležitý, a to je třeba etika. Jakým způsobem ta data lze interpretovat, výsledek co jsem dostal - je ta sklenice z půlky plná nebo z půlky prázdná?
Navíc si vezmi, že dnes si můžeš udělat statistiku jak chceš. Můžeš jakýmkoliv způsobem požádat webovou stránku ať ti ji připraví. A teď je otázkou ten výsledek. Je správně? Není nějakým způsobem uhnutý? Jak si udržet důvěru?
V oficiální statistice jsou trendy, které jsou spojeny se standardem, s etikou a řekněme s nějakým legislativním pokrytí. Zatímco v praktické statistice, v tom byznysu, tam se fakt jde po datový analýze. Aby to bylo co nejpřesnější, nejrychlejší a automatické.
Například rozpoznávání značek nebo rozpoznávání obličejů – za tím jsou většinou jednodušší statistické metody, které při dostatečně robustním datovým zpracování vedou ke kýženému výsledku. Pojedeš rychle, dostaneš pokutu za překročení rychlosti. Identifikují tě, propojí a můžou ti to automaticky poslat. A našli bychom určitě i optimističtější příklady:).
Máš k dispozici díky internetu neomezené zdroje. A my studentům, když učíme pokročilé metody, tak necháváme otevřené dveře ať si otevřou internet, googlují si… AI ještě nepovolujeme, to by bylo zatím moc, ale třeba k tomu jednou přijde. Ale aby si to dovedla použít a pochopit, tak znalosti potřebuješ. Není to o tom, že si pamatuješ vzoreček, že si pamatuješ nějakou definici. O tom to vůbec není. Je to o tom se naučit jakým způsobem myslet a vědět kde ten případný problém může být a jakou cestou se vydat. A to je to nejtěžší. Takže já bych řekl, že do jisté míry je to lenost, nepřipravenost, ale samozřejmě někdy i neochota. Ale pokud se překoná lenost, nepřipravenost a rozčarování, že v prvním testu dopadneš špatně, tak pak celkově a statistika se ti může i líbit. My máme poměrně přísně nastavené testy. Na druhou stranu nemáme úplně špatné recenze mezi studenty, a většinou ti studenti nakonec řeknou „Jé, tak já sem se něco nového naučil, to je hezký“. No tak to je milé.
Dám příklad. Máme některé namíchané skupiny. Máme i zahraniční studenty. Přijdou zahraniční studenti, kteří jsou excelentní a přijdou zahraniční studenti, kteří v životě neviděli Excel. Neumějí v něm pracovat. Snažíme se to narovnat a student, který je málo připravený, tak dostane trochu víc naloženo. Snažíme se uplatňovat fér podmínky ke všem. Není to jednoduché, ale snažíme se to držet
A pak mám povinnosti samozřejmě i z toho pohledu vrcholového. K těm náleží strategický plán. Třeba za rozhodnutí o zavedení flash odhadu, tak připravit to pro management úřadu, aby se mohl rozhodnout. To znamená dohled nad tím spíš, než že bych počítal čísla. To si můžu dovolit tady. A to je to, co mě na tom baví. Z toho manažerského hlediska sedíš pouze nad zprávami o kvalitě a nad emaily, kde řešíš, co nefunguje a kde nám nechtějí dát data a věci strategičtějšího charakteru. Plus teda ta kvalita, tak to je spíš operativa.
dalších mezinárodních institucí, tak je potřeba studentům vysvětlit co to je sezónní očištění a proč se dělá. To se málo ví a je to je to velmi důležité. Sezóně neočištěná čísla mezi sebou nesrovnáš.
A tohle děláme se studenty. Očišťuj sezóně HDP pomocí Arima modelu nebo si něco zkoušíme v logistický regres, machine learning na tu na klasifikaci. Takže praktičtější věci. Plus co často děláme, tak jsou Indexy – co to znamená, když něco vzroste o 3 % pak o 2 % klesne a jaký je průměr. To používáme celkem hodně.
Drobné a dílčí projekty kdy s kolegy rozvíjíme buď nějakou metodu nebo třeba zrovna řešíme to sezónní očištění. Ale největší projekt, na kterém jsem se kdy podílel byla rekonstrukce HDP od roku 1970.
V tom byznysu bych řekl, že je to trošku jiné, maličko stabilnější. Pokud máš firmu, kde potřebuješ najít procento těch, kdo podvádí při žádosti o úvěr nebo při pojistné události, je jiný přístup. Není to tak mediálně vypjaté. Zatímco řízení státu je pod větším drobnohledem médií, ale zase se zas tak neřeší ta business stránka.
Pro firmy je daleko důležitější, jestli mají dělat tuhle investici, která stojí tolik a vyděláš na tom nebo na tom proděláš. Je to trošku jiné, ale pro soukromé firmy je mimořádně důležité vědět to, jak si ten trh stojí a jakým způsobem. Protože tam právě záleží, jestli používáš čísla pro svoji vlastní práci, pro svůj vlastní byznys a nebo používáš oficiální čísla pro rozhodování se na trhu. Obojí je důležité. Ale stát k tomu přistupuje trošku jinak než byznys.
A co se týká té druhé stránky, a to je nabídka statistiky- To jsem o něco méně optimistický. Já tedy doufám, že se to změní, ale velký problém sehnat lidi kteří se tou oblastí chtějí zabývat. Ne, že by je ta oblast nebavila, ale většinou finanční hodnocení není tak úplně adekvátní. V řadě případů ti vysokoškoláci, kteří mají nastoupit do státního sektoru jsou kvalifikovaní lidé a nástupní platy nejsou dobré. A to je to je velký problém. Je problém obsadit místa, která nejsou jen ve statistickým úřadu, je to i v řadě jiných státních institucí. Nemůžeme vzít kohokoliv z ulice na jakékoli úřednické místo. Potřebujeme vysoce kvalifikované lidi, kteří něco dovedou. A teď tady platí Paretovo pravidlo, že 20 % lidí udělá 80 % práce. A je to bohužel čím dál tím přísnější. Možná už to bude i 10 % na 90 %. To je největší problém. Výzva jsou lidské zdroje. Udržet je, motivovat je. To je velká výzva pro stát.
Já bych chtěl poděkovat za pozvání a popřát všem příjemný den. Na shledanou.
Hostem dnešního podcastu byl pedagog a statistik Jaroslav Sixta. Jsme rádi že, nás sledujete.