MASARYKOVA UNIVERZITA Ekonomicko-správní fakulta Skóringové modely hodnotenia úverovej spôsobilosti Diplomová práca Brno, 2010 Lucie Vernerová Meno autora: Mgr. Lucie Vernerová Názov diplomovej práce: Skóringové modely hodnotenia úverovej spô- sobilosti Názov diplomovej práce anglicky: Credit Scoring Models Katedra: ekonomie Vedúci diplomovej práce: Ing. Daniel Němec, Ph.D. Anotácia: Hlavným cieľom predkladanej práce je vysvetliť princípy tvorby skóringových modelov, ktoré v praxi slúžia na posúdenie úverovej spôsobilosti. Okrem matematického poňatia logistickej regresie, práca ponúka komplexný obraz o postupoch a aktivitách aj z pohľadu obchodných procesov. V poslednej časti je model odhadujúci pravdepodobnosť zlyhania konštruovaný aj na reálnych dátach o žiadateľoch. Annotation: The main goal of this work is to explain the principles of developing credit scoring models used in practice to evaluate the credit worthiness. In addition to the mathematical concept of logistic regression the work offers a comprehensive picture of the processes and activities from the business point of view. In the last part, the model for prediction the probability of default is constructed on real data sets of applicants. Kľúčové slová: kreditné riziko, pravdepodobnosť zlyhania, skóringový model, logistická regresia, validácia, diskriminačná sila Key words: credit risk, probability of default, credit scoring model, logistic regression, validation, discriminatory power POĎAKOVANIE: Týmto by som rada poďakovala vedúcemu diplomovej práce Ing. Danielovi Němcovi, Ph.D. za odborné vedenie, cenné pripomienky a za ochotu a trpezlivosť prejavenú pri vypracovaní mojej diplomovej práce. PREHLÁSENIE Prehlasujem, že diplomovú prácu na uvedené téma som vypracovala samostatne s použítím uvedenej literatúry a vedomostí nadobudnutých praxou v za- mestnaní. .................. Obsah 1 Kreditné riziko v súvislostiach 8 1.1 Riadenie kreditných rizík . . . . . . . . . . . . . . . . . . . . . 8 1.2 História bankovej regulácie . . . . . . . . . . . . . . . . . . . . 8 1.3 Bazilej II . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 9 1.3.1 Rôzne prístupy k meraniu kreditného rizika . . . . . . 11 1.3.2 Princíp hodnotenia kreditného rizika v rámci Bazilej II 13 1.3.3 Pravdepodobnosť kreditných strát a ich krytie . . . . . 17 2 Skóringové modely 20 2.1 Proces tvorby skóringových modelov pre meranie pravdepodobnosti zlyhania . . . . . . . . . . . . . . . . . . . . . . . . . 21 2.1.1 Zahájenie vývoja . . . . . . . . . . . . . . . . . . . . . 23 2.1.2 Príprava vývojovej vzorky dát . . . . . . . . . . . . . . 24 2.1.3 Počiatočná jednorozmerná analýza . . . . . . . . . . . 25 2.1.4 Viacrozmerná analýza -logistická regresia . . . . . . . . 25 2.1.5 Kalibrácia . . . . . . . . . . . . . . . . . . . . . . . . . 27 2.1.6 Kontrola a implementácia . . . . . . . . . . . . . . . . 28 2.2 Matematický koncept logistickej regresie . . . . . . . . . . . . 28 2.2.1 Model logistickej regresie . . . . . . . . . . . . . . . . . 29 2.2.2 Interpretovanie výsledkov logistického modelu . . . . . 32 2.2.3 Odhad parametrov modelu logistickej regresie . . . . . 33 2.2.4 Testy významnosti logistického modelu a jeho parametrov . . . . . . . . . . . . . . . . . . . . . . . . . . . 36 2.2.5 Miery posúdenia kvality logistického modelu . . . . . . 38 3 Validácia skóringových modelov 40 3.1 Testovanie diskriminačnej sily skóringových modelov . . . . . 41 3.1.1 Gini koeficient, ROC a CAP krivka . . . . . . . . . . . 43 3.1.2 Pietra Index, Kolmogorov-Smirnov test . . . . . . . . . 45 3.1.3 Informačná hodnota . . . . . . . . . . . . . . . . . . . 46 3.2 Testovanie stability . . . . . . . . . . . . . . . . . . . . . . . . 47 5 OBSAH 6 3.2.1 System Stability Index . . . . . . . . . . . . . . . . . . 48 3.3 Testovanie kalibrácie . . . . . . . . . . . . . . . . . . . . . . . 48 3.3.1 Brier score, Reliability diagram . . . . . . . . . . . . . 48 3.3.2 Normálny test . . . . . . . . . . . . . . . . . . . . . . . 49 4 Praktická časť 51 4.1 Popis a príprava dát . . . . . . . . . . . . . . . . . . . . . . . 51 4.2 Tvorba modelu hodnotenia úverovej spôsobilosti -postupy a výsledky . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 54 Príloha 64 Zoznam literatúry 66 Úvod V rukách komerčných bánk je najmä zodpovednosť za primárne vklady a rizikovo vyvážený prístup k ich ďalšiemu úverovaniu. Z tohto dôvodu je pre banky nesmierne doležité, aby pri tvorbe úverových aktív postupovali tak, aby kvalita týchto aktív bola čo najvyššia. Efektívne riadenie rizika v banke si tak vyžaduje kvalitatívnu a kvantitatívnu analýzu klientov a to najmä ich prípadného rizika finančného zlyhania. V mojej práci sa budem zaoberať hodnotením úverovej spôsobilosti prostredníctvom skóringových modelov. V bankovníctve skoringové modely predstavujú aplikáciu osvedčených štatistických metód za účelom kvantifikácie rizika spojeného s určitým portfóliom klientov. V prvej kapitole predstavujem súvislosti, kvôli ktorým je predikcia kreditného rizika pre banky taká dôležitá. Algoritmus výstavby skóringových modelov nielen z obchodného hľadiska ale aj z pohľadu teoretickej koncepcie založenej na logistickej regresii je popísaný v druhej kapitole. Tretia kapitola sa sústredí na štatistické testy overovania kvality používaných modelov. V poslednej praktickej časti sa venujem konštrukcii modelu aplikačného skóringu, ktorý je dôležitý pre odhad pravdepodobnosti zlyhania najmä v rámci akvizície nových úverových klientov. Jeho základnou úlohou je chrániť veriteľa pred nadmerným požičiavaním peňazí a klienta pred prílišným zadĺžením. Tému práce som si zvolila aj s ohľadom na svoju profesiu. Verím preto, že veľkým plusom práce bude, že danú problematiku priblížim priamo z perspektívy bánk. 7 Kapitola 1 Kreditné riziko v súvislostiach 1.1 Riadenie kreditných rizík Problematika riadenia kreditných rizík je ústrednou témou v prostredí moderného bankovníctva a v kontexte globálnej krízy neustále nadobúda na význame. Kreditné riziko, niekedy nazývané tiež úverové, predstavuje riziko, že dlžník alebo zmluvná strana zlyhajú pri plnení záväzkov vyplývajúcich zo zmluvne dohodnutých podmienok. Veriteľovi tým spôsobia stratu, ktorú bude musieť vymáhať alebo sa snažiť dohodnúť s klientom na jemnejších podmienkach splácania (reštrukturalizácia úveru) a v najhoršom prípade bude stratu nutený odpísať. Nečakané pády bánk, ktoré sprevádzali aj súčasnú hospodársku krízu, spôsobujú ostré politické diskusie na medzinárodnej úrovni a tak podlieha banková sféra špeciálnemu zákonodarstvu. Hlavný trend týchto zákonných noriem je inciovaný najmä Bazilejským výborom pre bankový dohľad. 1.2 História bankovej regulácie Pred rokom 1988 kedy vznikol Bazilej I, nemala regulácia bánk jednotnú podobu. Po druhej svetovej vojne sa presadzovali dva prístupy. Prvý bol neformálny a subjektívny prístup, vyrobený na mieru jednotlivým bankám, kedy národný regulátor posudzoval každú banku pomocou rôznych ukazovateľov individuálne. Každá banka sa považovala za špecifickú inštitúciu a nepriaznivý vývoj jedného ukazovateľa mohol byť vyvážený priaznivým vývojom iných charakteristík. Jednoduchá numerická požiadavka kapitálovej primeranosti bola odmietaná a za lepšie ukazovatele sa považovala napríklad úroveň manažérskeho riadenia alebo kvalita portfólia pôžičiek. 8 1. Kreditné riziko v súvislostiach 9 Ukazovatele ako pomer kapitálu a aktív alebo pomer kapitálu a vkladov sa síce testovali, ale boli považované za nie príliš vhodné nástroje regulácie. Druhý prístup v regulácii bánk má počiatky v 80. rokov 20. storočia. Potom , čo padli niektoré veľké banky (Bankhaus Herstatt v Nemecku, Franklin National Bank a First Pensylvania Bank v USA) a po kríze amerických sporiteľní, v priebehu ktorej skrachovalo 1617 bánka a 1300 sporiteľní, sa ukázalo, že aj veľké banky sú zraniteľné a že medzinárodne aktívne bankovné skupiny predstavujú riziko nákazy na finančných trhoch. Bankovný regulátori začali hľadať presnejšie definované kapitálové štandardy, ktoré by boli medzinárodne uznávané. Z tejto iniciatívy vznikol vo Švajčiarsku Bazilejský výbor pre bankový dohľad (Basel Committee on Banking Supervision), ktorý v roku 1988 inicioval dohodu o kapitálovej regulácii známu ako Bazilej I. Bazilej I rozdeľoval banková aktíva do piatich kategórií, z ktorých každá mala fixnú rizikovú váhu. Ďalej definoval, čo je regulatórny kapitál a stanovil kapitálovú požiadavku ako minimálny podiel regulatórneho kapitálu k rizikovo váženým aktívam (Risk Weighted Assets, RWA): Regulatórna požiadavka na kapitál = 8%×RWA = 8%×RW× výška úveru. Rizikové váhy (Risk Weights, RW) pre jednotlivé druhy expozícií (pohľadávok) boli stanovené národným regulátorom. Hlavným kritériom bolo členstvo v Organizácii pre hospodársku spoluprácu a rozvoj (OECD). Pohľadávky voči suverénom (štáty alebo ich centrálne banky, verejnoprávne inštitúcie) v prípade, že daný štát bol členom OECD mali rizikovú váhu 0%, inak 100%. Expozície kde protistanou bola banka sa vážili 20% rizikovou váhou, hypotekárne úvery založené nehnuteľnosťou 50% váhou a ostatné expozície mali 100% rizikovú váhu. Dohoda Bazilej I zjednotila predpisy o minimálnej kapitálovej požiadavke a stala sa dôležitým miľníkom na ceste k posilneniu štruktúry medzinárodného finančného systému. Zmeny na finančných trhoch a najmä postupne rastúca kritika neobjektívnosti tzv. klubového princípu v OECD však viedli k tomu, že tieto opatrenia už nestačili a začal sa používať systém, ktorý priraďoval rizikovú váhu podľa ratingu (bonity alebo úverovej spôsobilosti) klienta. 1.3 Bazilej II Ako odpoveď účastníkom finančného sektora, ktorí opakovane vyjadrovali znepokojenie nad nedostatkami platnej regulácie, spustil Bazilejský vý- 1. Kreditné riziko v súvislostiach 10 bor konzultačný proces zameraný na úplnú revíziu existujúceho rámca na kapitálovú primeranosť (Bazilej I). Jeho konečným cieľom bola konvergencia regulatórnych požiadaviek na kapitál a definovanie moderných metód rozpoznávania, hodnotenia a riadenia kreditných rizík. V januári 2001, Bazilejský výbor pre bankový dohľad vydal druhú verziu (Consultative Paper 2, CP2) pre Novú Bazilejskú dohodu o kapitáli (New Accord, plný názov International Convergence of Capital Measurement and Capital Standard - A Revised Framework), známu tiež pod názvom Bazilej II. Druhá verzia dohody bola finalizovaná v roku 2004 (označovaná ako Consultative Parer 3, CP3) a platí od roku 2008. Cieľom Bazilej II je presnejšie zosúladiť stanovenie kapitálových požiadaviek so základnými rizikami v bankovom sektore. Okrem toho bankám poskytuje stimuly na zlepšenie ich schopností merať a riadiť riziká. Ďalšou úlohou Bazilej II je zlepšenie odolnosti a stability finančného systému. Samotné minimálne kapitálové požiadavky na zabezpečenie tohto cieľa nestačia a preto nová koncepcia kapitálovej primeranosti pozostáva z troch pilierov: • Prvý pilier: Minimálne kapitálové požiadavky • Druhý pilier: Proces pravidelného dohľadu • Tretí pilier: Trhová disciplína Zámerom implementácie týchto troch pilierov je tiež zachovanie úrovne kapitálu v systéme a podpora rovnakých konkurenčných podmienok. Prvý pilier: Minimálne kapitálové požiadavky Minimálne požiadavky na kapitál obsiahnuté v prvom pilieri tvoria najväčšiu časť opatrení Bazilej II. Výpočet kapitálových požiadaviek bol aj základným predmetom diskusií v druhom kole konzultácií. Význačnou novinkou v súvislosti s minimálnymi požiadavkami na kapitál je, že po prvýkrát vstupuje operačné riziko priamo do hodnotenia kapitálovej primeranosti a teda musí byť kvantifikované a pretransformované do nákladov na kapitál. Hoci sú spôsoby merania operačného rizika v porovnaní s trhovými a kreditnými ešte stále len v začiatkoch, Bazilej II zaviedol túto novinku, kedže operačné riziko má potenciál výrazne ovplyvniť celkové výsledky banky. Hlavný princíp kapitálovej primeranosti zostal nezmenený t.j. 8% vo vzťahu k celkovým bankovým rizikám. 1. Kreditné riziko v súvislostiach 11 Druhý pilier: Dohľad regulátora Dohľad regulátora sa pokladá za dôležité doplnenie minimálnych požiadaviek na kapitál a trhovej disciplíny. Cieľom druhého piliera je uistiť sa, že banky zavedú náležité vnútorné metódy na meranie rizík a určenie kapitálovej primeranosti. Očakáva sa, že dohľad posúdi, ako dobre banky určia potrebu kapitálu vo vzťahu k svojim rizikám. Národný dohľad by mal posúdiť aj vnútornú alokáciu kapitálu. Predpokladá sa, že zasiahne uvalením dodatočných požiadaviek na kapitál v prípade, že je riziko banky väčšie ako jej kapitál, alebo v prípade, že riziká nie sú dodatočne riadené. Dohľad by mal usilovať o zásah v ranných štádiách, aby predišiel poklesu kapitálu pod úroveň minimálnych požiadaviek. Kontrola dohľadu neobsahuje iba kontrolu primeranosti kapitálu, ale aj dohliada na to, aby výpočet kapitálových požiadaviek (na trhové, kreditné a operačné riziká) spĺňal kvantitatívne aj kvalitatívne štandardy. Vo všeobecnosti vzrástla právna zodpovednosť bankových dohľadov ako aj ich právomoci pri vykonávaní kontroly a možnosť zasiahnuť v prípade po- treby. Tretí pilier: Trhová disciplína Smernice v treťom pileri nariaďujú bankám zverejňovať aktuálne relevantné informácie o ich finančnej situácii a ich rizikovým expozíciách. Teda výrazne vzrástla informačná hodnota súvah bánk a dovoľuje hráčom na trhu posúdiť primeranosť kapitálu bánk. To zvyšuje transparentnosť vďaka zverejňovaniu údajov, ktorého zámerom bolo posilniť solídnosť a stabilitu finančného systému. Bazilej II má predovšetkým prinútiť banky držať taký objem vlastných zdrojov, ktorý odpovedá ich individuálnemu rizikovému profilu. Vlastný kapitál bánk v neposlednom rade slúži na posilnenie ich stability v krízových situáciách. Je to krycí zdroj pre prípadné budúce neočakávané straty. Každá banka musí podľa nových predpisov držať tým viac vlastných zdrojov, čím väčšie riziká podstupuje svojou účasťou v úverových obchodoch. Aby bolo možné dosiahnuť primeranú vybavenosť vlastným kapitálom musí byť banka schopná odhadnúť svoje riziko čo najpresnejšie. Posúdiť, aký rizikový je určitý úver, umožňujú interné ratingové metódy banky. 1.3.1 Rôzne prístupy k meraniu kreditného rizika Podľa Bazilej II je možné požiadavku na vlastný kapitál banky vypočítať buď podľa štandardizovaného prístupu definovaného dohodou Bazilej II 1. Kreditné riziko v súvislostiach 12 (Standardized Approach, STA), alebo podľa tzv. prístupov interných ratingov (Internal Rating Based Approach, IRB), kde sú metódy ohodnocovania rizika vyvinuté samotnými bankami na základe štatistických dát o rizikách. Štandardizovaný prístup STA prístup je povinne aplikovaný v praxi slovenských aj českých bánk od roku 2008. Na rozdiel od prístupov IRB, pre ktoré sú rozhodujúce interne stanovené ratingy, sa pri štandardizovanom prístupe využívajú výhradne ratingy uznávaných ratingových agentúr (Standard & Poor’s Rating Services, Moody’s Investors Service a Fitch Ratings). Príjemcom úverov, ktorí nedisponujú externým ratingovým ohodnotením, sa jednotne prideľuje riziková váha 100%, ktorá zodpovedá kapitálovej požiadavke 8% z celkovej výšky úveru. Na Slovensku, či v Českej republike existuje pomerne málo podnikov, ktoré majú externý rating (vyjadrený je váhou rizika). Pre väčšinu klientov z podnikovej sféry žiadajúcich o úver to znamená jednotnú rizikovú váhu vo výške 100%. Práve tento fakt je najväčšou slabinou uvedeného prístupu. Kvôli nedostatočnému rozlíšeniu podľa bonity úverových klientov prakticky nie je možné vypočítať primeranú kapitálovú rezervu zodpovedajúcu individuálnemu rizikovému profilu príslušnej banky. Vo výsledku sa výpočet kapitálovej požiadavky podľa štandardizovaného prístupu odlišuje len mierne od výpočtu podľa predpisov Bazilej I. Prístup založený na internom ratingu Existujú dva typy IRB prístupov: • základný IRB prístup (Foundation Internal Rating Based Approach, FIRB) • pokročilý IRB prístup (Advanced Internal Rating Based Approach, AIRB) IRB prístup dovoľuje bankám, ktoré sú schopné štatisticky zmerať určité riziko konkrétneho financovania, aby svoju kapitálovú vybavenosť upravovali adekvátne riziku, ktoré podstupujú. Za predpokladu ”dobrého” úverového portfólia (dobrá bonita klientov, dostatočné zabezpečenie úverov apod.) vyplýva pre banky - v porovnaní so štandardizovaným prístupom nižšia požiadavka na kapitál. Prechod z STA na jednoduchší FIRB či zložitejší AIRB je podmienený schválením centrálnou bankou a čelí mu v súčasnosti veľa bánk. V praxi nemusí byť každá banka ochotná alebo schopná prijať zložitejší IRB prístup. Dôvodmi môžu byť prípiš vysoké vstupné náklady (náklady na ľudské zdroje, externých poradcov, technológie, know-how, implementáciu zmien do 1. Kreditné riziko v súvislostiach 13 procesov a systémov banky apod.) prevyšujúce možný zisk z ušetreného kapitálu. Banky, ktoré majú silnejšie postavenie na trhu, a tým aj väčší obrat a zisk, môžu byť schopné zaviesť IRB prístup bez väčších problémov (podpora a know-how od materských bánk). 1.3.2 Princíp hodnotenia kreditného rizika v rámci Bazilej II Výška kreditného rizika sa posudzuje podľa viacerých rizikových parametrov. Pod pojmom rizikový parameter môžeme chápať určitú premennú, ktorá v sebe nesie informáciu o miere rizika klienta alebo transakcie, ktorému úverová inštitúcia za daných podmienok kontraktu čelí. Hlavné rizikové parametre využívajúce sa v rámci IRB prístupu pre výpočet hodnoty rizikovo vážených expozícií sú: • pravdepodobnosť zlyhania dlžníka (Probability of Default, PD), • strata v prípade zlyhania (Loss Given Default, LGD), • expozícia pri zlyhaní (Exposure at Default, EAD). Pravdepodobnosť zlyhania (PD) je odhadovaná pravdepodobnosť, že dlžník v časovom horizonte nasledujúcich 12 mesiacov zlyhá. Za vznik zlyhania v súvislosti s konkrétnym dlžníkom sa považuje, keď nastane jedna alebo obidve z týchto udalostí1 : • úverová inštitúcia usúdi, že dlžník pravdepodobne nesplatí svoje kreditné záväzky voči úverovej inštitúcii, materskej spoločnosti alebo ktorejkoľvek z jej dcérskych spločností v plnej výške bez toho, aby úverová inštitúcia urobila úkony, akými je napríklad realizácia zabezpečenia (ak bolo poskytnuté), • dlžník je v omeškaní viac ako 90 dní pri splácaní akéhokoľvek kreditného záväzku voči úverovej inštitúcii, materskej spoločnosti alebo ktorejkoľvek z jej dcérskych spoločností. Kedže ide o pravdepodobnosť nadobúda hodnoty od 0 do 1, pričom väčšinou sa vyjadruje v percentách. Banky zväčša využívajú číselnú (napr. 1-10) či znakovú (napr. AAA-D) ratingovú škálu, kde sú klienti zatriedení podľa ich odhadovanej PD. Ako náhle sa dlžník dostane do stavu zlyhania, jeho 1 Smernica Európskeho parlamentu a rady 2006/48/ES, viď [11], str. 113. 1. Kreditné riziko v súvislostiach 14 PD =100% a má teda priradený špeciálny rating, ktorý signalizuje jeho neschopnosť splácať. Dlžnú pohľadávku sa banka snaží vymáhať a úspešnosť vymáhania, resp. stratu, ktorú banka z udalosti zlyhania utrpí reprezentuje ďalší parameter LGD. Strata v prípade zlyhania (LGD) predstavuje pomer straty z expozície z dôvodu zlyhania zmluvnej strany banky k hodnote zodpovedajúcej nesplatenej časti záväzku v momente zlyhania, pričom stratou sa rozumie ekonomická strata vrátane významných diskontných účinkov a priamych a nepriamych nákladov spojených s vymáhaním pohľadávky. Hodnota LGD sa predikuje oddelene pre zabezpečenú a nezabezpečenú časť pohľadávky. LGD pre zabezpečenú časť pohľadávky reprezentuje tzv. ”haircut”. Banka pri založení úveru nehnuteľnosťou zväčša neakcepuje nehnuteľnosť v jej plnej výške (trhovej hodnote), ale časť trhovej ceny neakceptuje -aplikuje haircut. Ten sa odhaduje na základe historických skúsenosti o stratách pri realizáciách jednotlivých druhov zabezpečení (kolaterálov). LGD pre nezabezpečenú časť pohľadávky sa taktiež odhaduje na základe historických skúseností o mierach návratnosti, respektíve stratách aj vrátane nákladov na vymáhanie jednotlivých typov transakcií. Expozícia pri zlyhaní (EAD) je možné definovať ako expozíciu, ktorú banka očakáva, že zostane nesplatená v momente zlyhania klienta. Tento odhad obsahuje nielen súvahovú časť expozície (aktuálne načerpanú pohľadávku), ale aj podsúvahovú časť expozície (nevyužité limity úverových rámcov, podmienené záväzky apod.), ktorá sa váži kreditným konverzným faktorom (Credit Conversion Factor, CCF). Parametere CCF predstavujú očakávané percentuálne čerpanie podsúvahových expozícií v rámci 12 mesačného intervalu a odhadujú sa taktiež s využitím historických dát. Jednoduchší FIRB prístup je podmienený používaním interných matematických modelov založených na vlastných historických dátach banky pre odhad jediného parametra -pravdepodobnosti zlyhania (PD). Pre zvyšné rizikové parametre banka nemusí mať vlastné modely a používa hodnoty parametrov určené Smernicou Európrskeho parlamentu a rady2 (LGD je 45%, u podriadené dlhu 75%; CCF je pre platobné záruky 100%, pre neplatobné záruky a dokumentárne akreditívy 50%, pre tovarové akreditívy 20%, pre ostatné úverové linky je 75% a pre nezáväzné a odvolateľné úverové linky sa môže použiť CCF na úrovni 0%). Zložitejší AIRB prístup vyžaduje od bánk, aby sofistikované modely ap- 2 viď. [11] 1. Kreditné riziko v súvislostiach 15 likovala pri predikcii všetkých rizikových faktorov. V rámci oboch IRB prístupov rizikové váhy už nie sú fixné, ale sú funkciou pravdepodobnosti zlyhania a straty v prípade zlyhania: napr. pre retailové expozície sa riziková váha vypočíta nasledovne3 : RW = LGD · N 1 √ 1 − R · G(PD) + R 1 − R · G(0, 999) − PD · LGD ·12, 5 · 1, 06 N(x) označuje kumulatívnu distribučnú funkciu normovanej normálnej náhodnej premennej (t.j. pravdepodobnosť, že normálna náhodná premenná so strednou hodnotou nula a rozptylom jedna je menšia alebo rovná x); G(x) označuje inverznú kumulatívnu distribučnú funkciu pre normovanú normálnu náhodnú premennú (t.j. hodnotu x takú, že N(x) = z) a R predstavuje koreláciu systémového rizika: R = 0, 15 v prípade retailových expozícií zabezpečených nehnuteľnosťami R = 0, 04 v prípade kvalifikovaných revolvingových retailových expozícií a pre ostatné retailové expozície R = 0, 03 · 1 − e−35·PD 1 − e−35 + 0, 16 · 1 − 1 − e−35·PD 1 − e−35 . Hodnota rizikovo vážených expozícií je RWA = RW · EAD a regulatórna požiadavka na kapitál je opäť minimálne 8% z RWA. Podmienky IRB prístupu banky priamo pobádajú k dôslednému rozlišovaniu medzi dobrými a zlými klientmi. Na úver pre kvalitného, málo rizikového klienta, budú môcť držať menej vlastného kapitálu a uvolnené peniaze môcť využiť efektívnejšie. Navyše rovnaké produkty budú môcť poskytovať lacnejšie, čím si zabezpečia konkurenčnú výhodu. O výhodách dohody Bazilej II však nie sú plne presvedčení všetci a v posledných rokoch sa v tejto oblasti vedie intenzívna a kontroverzná diskusia. Pre niekoho je to ďalší potrebný krok na zaistenie stability na finančných trhoch, pre niekoho práve naopak strašiak, ktorý kvôli zvýšeniu nákladov na firemné financovnie ohrozuje naše národné hospodárstvo. Podľa niektorých odborníkov (napr. Roberta Holmana4 ) má však aj ďalší kritický bod a 3 Opatrenie NBS č. 4/2007, viď [14], str. 58 4 http://www.cnb.cz/cs/verejnost/pro media/clanky rozhovory/media 2009/cl 09 090522a.html, viď [14] 1. Kreditné riziko v súvislostiach 16 tým je jeho procyklický charakter. Problém Bazilej II spočívá v tom, že v porovnaní s inými kapitálovými požiadavkami môže mať procyklický charakter, ktorý spôsobuje príliš veľký rast aktív počas hospodárského boomu. V období prevládajúceho optimizmu bývajú investičné riziká podceňované a dopyt po úveroch je vysoký. Banky a ratingové agentúry taktiež podceňujú kreditné riziká, pretože klienti prosperujú a pravdepodobnosť ich zlyhania je nízka. V priebehu všeobecnej prosperity poskytujú banky často úvery aj na také projekty, ktoré by v ”normálnych” časoch pokladali za priveľmi rizikové. Či už sa banky spoliehajú na vlastné modely kvantifikácie rizík (IRB prístup), alebo na externé ratingy (STA prístup), neexistuje úplne objektívne ocenenie rizík. Modely hodnotenia rizík pracujú s dátami (napríklad o hospodárskych výsledkoch klientov), ktoré v dobe prosperity poskytujú priaznivejší obraz o klientoch a úverovaných projektoch než v časoch recesie. Procyklický charakter tejto kapitálovej regulácie se zvyšuje, ak sú pravdepodobnosti zlyhania prepočítavané z krátkych časových radov historických dát. V tom prípade údaje v dobe dlhšie trvajúceho boomu vyvolávajú tendenciu k podceneniu úverových rizík a v dobe recesie tendenciu k ich nadhodnoteniu. Existujú však aj niektoré protiargumenty, ktoré oslabujú obavy z procyklickosti Bazilej II. So zavedením Bazilej II se správanie bánk môže zmeniť. Riadenie úverových rizík se môže zlepšit s tým, ako sa banky naučia viac rozumieť procylickým prvkom Bazilej II. Banky potom možu riadiť úverové riziká na základe tejto znalosti a skúsenosti obozretnejšie a vytvárať si väčšie kapitálové rezervy na horšie časy. Otázkou však je, či tomu bude skutočne tak? Matematické modely riadenia rizík budú vždy závislé na historických dátach a tieto dáta budú vždy ovplyvnené priebehom hospodárskych cyklov. Pretože Bazilej II začali banky aplikovat až od roku 2008, nie je možné tvrdiť, že sa jeho procyklický charakter podpísal na vzniku súčasnej finančnej krízy. Procyklický charakter Bazilej II nie je možné zatiaľ ani empiricky dokázať, pretože je v platnosti príliš krátke obdobie. Možné je iba špekulovať. To ale neznamená, že by sa malo čakať, pokým bude procyklickosť empiricky dokázaná alebo pokým bude zjavné, že táto kapitálová regulácia prispieva ku vzniku či prehlbovaniu finančných kríz. Existuje viac prístupov k riešeniu tohto problému. Rada odborníkov preto odporúča radšej daľšie zdokonaľovanie Bazilej II (Bazilej III), presnejšie zdokonaľovanie modelov oceňovania rizík a potlačovanie ich procyklického charakteru. Znamená to napríklad konzervativnejšie požiadavky na rizikové parametre modelov interného ratingu bánk, predlžovanie časových radov používaných pri výpočtoch týchto parametrov, spätné testovanie ratingových modelov, pravidelné porovnávanie očakávaných a realizovaných mier zlyhania bankových klientov atď. 1. Kreditné riziko v súvislostiach 17 1.3.3 Pravdepodobnosť kreditných strát a ich krytie Správny spôsob ako naložiť s kreditným rizikom pre banku, nie je vyhnúť sa mu za každú cenu, ale ho cieľavedome riadiť. Meranie kreditného rizika, ako dôležitý aspekt systému riadenia rizík, má za cieľ zachytiť kreditné riziko banky kvantitatívne. Pre tento kvantitatívny odhad možných kreditných strát potom musia v banke existovať zdroje na ich krytie. Podľa konceptu Bazilej II majú straty plynúce z kreditného rizika dva rozmery: • očakávané straty (EL, Expected Loss) a • neočakávané straty (UL, Unexpected Loss). Zatiaľ čo neočakávaná strata predstavuje reálnu hrozbu pre banku, očakávaná strata znamená len náklady, ktoré je potrebné si zarobiť rizikovou maržou. Očakávaná strata je štatistický odhad priemernej možnej straty celého portfólia. Pri úverových obchodoch bánk je zisk obmedzený na úrokový výnos, zatiaľ čo na druhej strane vysoké straty spôsobené zlyhávaním klientov a nesplácaním úverov sú celkom iste možné. To je aj vysvetlením, prečo musia byť pri poskytovaní úverov straty očakávané, teda banka s nimi po- číta. Vyčíslenie očakávanej straty je založené na predpoklade, že priemerné historické straty nastanú aj v budúcnosti. Banky berú tento druh strát do úvahy hneď od začiatku, takže to nemôže byť považované za riziko v pravom zmysle, ale za náklady nazývané aj ako štandardné rizikové náklady. Neočakávané straty sú kreditným rizikom v pravom zmysle slova a primeraný vankúš musí byť vytvorený vlastným kapitálom. Štandardné rizikové náklady slúžia na pokrytie očakávaných strát z celého portfólia banky. Teda banka musí tieto náklady prerozdeliť na celé úverové portfólio a zaťažiť dlžníkov nákladmi na ich krytie. Priradenie štandardných nákladov na riziko pre celé úverové portfólio banky sa zvyčajne robí pomocou primeranosti rizika. To znamená, že štandardné rizikové náklady priradené úveru musia zodpovedať štruktúre rizika daného úveru. Napokon, pravdepodobnosť zlyhania dlžníkov vykazujúcich vynikajúci stupeň úverovej spôsobilosti je nižšia ako pri dlžníkoch s horším ratingom. Nižšia úverová kvalita prispieva k objemu očakávaných strát viac a preto sú tieto expozície zaťažené relatívne vyššími štandardnými rizikovými nákladmi s cieľom pokryť očakávané straty. Tento koncept primeranosti rizika pri štandarných nákladoch na riziko je napokon v súlade s tým, čo je už dlhodobo akceptované v praxi na trhu dlhopisov. Riziková prirážka, nazývaná aj kreditný spread, je tým vyššia, čím je 1. Kreditné riziko v súvislostiach 18 horšia bonita emitenta. Rovnaký princíp by sa mal uplatňovať aj pre klientov banky. V opačnom prípade sa banka vydáva do nebezpečenstva, že bude financovať výlučne dlžníkov so zlým ratingom a teda bude držať v úverovom portfóliu iba úvery s nízkou kvalitou. Ak by banka pri procese oceňovania úverov a priraďovaní rizikových prirážok nezohľadňovala rôznu kvalitu úverov, vysoko bonitní dlžníci by museli platiť vysokú rizikovú prirážku a dlžníci s nízkou bonitou nižšiu prirážku než by zodpovedalo ich riziku. Prirodzene však, dlžníci s dobrým ratingom by hľadali možnosti financovania u konkurencie, zatiaľ čo banka by prilákala ešte viac klientov so slabým ratigom. Podľa prístupu interných ratingov je výška očakávaných strát banky funkciou pravdepodobnosti zlyhania a straty v prípade zlyhania: EL(%) = PD · LGD, (1.1) pričom v nominálnom vyjadrení sú ešte dodatočne vynásobené expozíciou: EL = PD · LGD · EAD. (1.2) Kreditné riziko môže byť kvantifikované na základe rozdelenia pravdepodobnosti úverových strát. Toto pravdepodobnostné rozdelenie priraďuje každej možnej strate, ktorej úverové portfólio môže čeliť, pravdepodobnosť výskytu. Určenie tvaru pravdepodobnostného rozdelenia je kľúčovým momentom všetkých modelov kreditného rizika. Bez ohľadu na výber predpokladaného modelu, môžeme pozorovať dve všeobecné vlastnosti pravdepodobnostného rozdelenia: Rozdelenie pravdepodobnosti úverových strát je ”zošikmené”. To znamené, že nie je symetrické ako v prípade normálneho rozdelenia, ale existuje veľká pravdepodobnosť nízkych strát a zároveň nízka pravdepodobnosť, že straty budú vysoké. Druhou charakteristikou je takzvaný ”široký koniec” (fat tail), čo znamená, že pravdepodobnosť veľmi vysokých strát je síce nízka, ale stále väčšia než v prípade normálneho rozdelenia pravdepodobnosti (viď. obr. č.1.1). Neočakávaná strata označovaná aj ako Value at Risk (VaR). predstavuje stupeň odchýlky skutočne realizovanej straty od očakávanej straty. Value at Risk je teda definovaná ako výška straty, ktorá nebude prekročená počas stanoveného obdobia s určitou pravdepodobnosťou (napr. 99%). Výpočtom očakávanej straty vopred sa banka snaží určiť rizikovú maržu na jednotlivé produkty svojho portfólia, zatiaľ čo cieľom výpočtu VaR je vymedziť výšku potrebného ekonomického kapitálu. VaR úverového portfólia je označovaná ako Credit Value at Risk (CVaR). 1. Kreditné riziko v súvislostiach 19 Obr. 1.1: Rozdelenie pravdepodobnosti kreditných strát a Credit Value at Risk Popísali sme si súvislosti, z dôvodu ktorých je správny odhad rizikových parametrov (PD, LGD, EAD) pre banky skutočne kľúčový. Videli sme, že s ohľadom na požiadavky pre prístup interných ratingov sa používajú nielen pre výpočet rizikovo vážených expozícií, ale sú veľmi dôležité aj pri stanovovaní rizikovej marže (Risk Based Pricing). Tvorbe modelov pre ich predikciu je venovaných množstvo štúdií. Hodnotenie úverovej spôsobilosti prostredníctvom skóringových modelov (Credit Scoring Models) je založené práve na odhade pravdepodobnosti zlyhania klienta. Aktivitám a pricípom využívaným pri výstavbe modelov odhadujúcich pravdepodobnosť zlyhania sa budem detailne venovať v nasledujúcej kapitole. Kapitola 2 Skóringové modely Metódy kreditného skóringu (Credit Scoring) sú štandardnou súčasťou riadenia rizík úverových inštitúcií. Jedná sa o postupy umožňujúce veriteľom na základe odhadu pravdepodobnosti zlyhania ohodnotiť úverovú spôsobilosť (bonitu) svojich potenciálnych klientov s cieľom získania kvalitného úverového portfólia. Úlohou skóringových modelov je rozhodnúť, či danému klientovi úver poskytnúť, a ako áno, s akými podmienkami (výška rizikovej prirážky). K tomu v praxi dochádza na základe porovnania dostupných informácií o klientovi (získaných napríklad z formulára žiadosti o úver alebo zo záznamov o klientovom správaní v minulosti) s informáciami o minulých dlžníkoch, ktorým bol úver poskytnutý v minulosti a ich úverová spôsobilosť je známa. Z historických informácií o bývalých dlžníkoch banky sa konštruuje predikčný skóringový model. Aplikáciou modelu na získané informácie o potenciálnom klientovi je vypočítaná pravdepodobnosť, že u neho dôjde ku kreditnej strate (zlyhaniu). Rozhodnutie je udelené na základe porovnania odhadnutej pravdepodobnosti zlyhania s určitou prahovou hodnotou stanovenou bankou. Existujú dva základné typy skóringových modelov: • Aplikačný skóring (Application Scorecard) - používa sa pri nových klientoch a rozhoduje o tom, ktorým klientom na základe ich žiadosti bude úver schválený. Problémom u aplikačného skóringu je, že sa odlišuje množina hodnotených klientov od vzorky minulých klientov, ktorým bol poskytnutý úver, a z ktorých bol model konštruovaný. • Behaviorálny skóring (Behavioural Scorecard) - odhaduje pravdepodobnosť zlyhania pre už existujúcich klientov na základe ich minulého správania. Podľa výsledkov tohto skóre sa potom klientom posielajú marketigové ponuky na ďalšie úverové produkty, zvýšenia limitov apod. 20 2. Skóringové modely 21 Skóringový model je algoritmus, ktorého výstupom odhad pravdepodobnosti zlyhania (PD) klienta. Ďalej býva výsledkom priradená hodnota limitov na jednotlivé typy produktov a hodnota úrokovej sadzby pokrývajúcej danú výšku kreditného rizika. Skóringová funkcia je zobrazenie f : X → [0, 1] z množiny charakteristík klienta, ktoré čo najlepšie separujú úveruspôsobilých a nespôsobilých klientov. Prvkom z množiny X možu byť: • finančné výkazy klienta v prípade podnikov (fluktuácia aktív, štruktúra kapitálu, súvaha, výkaz ziskov a strát atď.); • socio-demografické údaje zo žiadosti (vek, manželský stav, vzdelanie, druh zamestnania, počet rokov v aktuálnom zamestnaní; informácie o odvetví, ak klient podniká, právnej forme apod.); • informácie o klietom požadovanom produkte v prípade aplikačných modelov (splatnosť úveru, veľkosť splátok apod.); • informácie o minulom správaní klienta v prípade behaviorálnych modelov (splátková disciplína, počty dní omeškania nejakej spátky, počet upomienkových listov, dĺžka vzťahu v banke, priemerné využitie schválených limitov, priemerná výška depozít za určité obdobie apod.); • externé informácie (informácie z úverových registrov); Hlavnou výhodu skóringových modelov je ich konzistentný a automatizovaný proces kvantifikovania úrovne rizika, čím znižujú úroveň subjektivního posudzovania v rámci procesu schvaľovania úverov a sú časovo a tým aj nákladovo efektívnejšie. Ako sme už spomínali, ich správna prediktívnosť je však podmienená rovnakým alebo aspoň podobným správaním klientov v čase. Za nevýhody sa preto radí najmä ich citlivosť na zmeny v správaní sa klientov. Pri modelovaní skóringových funkcií je možné využiť viacero štatistických metód ako napríklad logistickú regresiu, neurónové siete, rozhohovacie stromy alebo expertné systémy. V praxi je najčastejšie používanou metódou práve logistická regresia. Vysvetlenie jej pricípu a aplikácia v praktickej časti budú hlavným predmetom tejto práce. 2.1 Proces tvorby skóringových modelov pre meranie pravdepodobnosti zlyhania Výstavba skóringového modelu predikujúceho pravdepodobnosť zlyhania je pre banku komplexný proces, ktorý okrem samotného vývoja logistického 2. Skóringové modely 22 modelu znamená aj jeho neustály monitoring kvality (pravidelná validácia modelu, zväčša aspoň raz ročne). Proces vývoja modelu a jeho následnej implementácie pozostáva z niekoľkých aktivít vyžadujúcich si spoluprácu viacerých relevantných oddelení banky a neraz aj externých expertov. V tejto kapitole sa pokúsim aj na základe vlastných pracovných skúseností popísať postupy a zodpovednosti súvisiace s vývojom a manažmentom modelov pre meranie pravdepodobnosti zlyhania. Veľmi dobrý prehľad úloh v rámci obchodného procesu tvorby skóringového modelu od počiatkov až po implementáciu do praxe môžeme nájsť aj v [2], kde hneď prvá veta autora Naeema Siddiqi, citujem ”Writing a good book, like developing o good scorecard, is never a one-person show.” vystihuje, že ide o spoluprácu mnohých. Pri vývoji modelov pre meranie pravdepodobnosti zlyhania (PD modelov) je cieľom úverových inštitúcií predovšetkým postupovať s ohľadom na požiadavky pre prístup interných ratingov v rámci Bazilej II, tzn. vyvinúť, zdokumentovať, implementovať a validovať model tak, aby mohol byť použivaný pre výpočet rizikovo vážených expozícií. Okrem požiadaviek v zmysle Bazilej II by mal vo všeobecnosti každý PD model spĺňať nasledovné kritériá: • využité by mali byť všetky dostupné údaje relevantné pre vyhodnotenie úverového rizika klienta alebo transakcie; • z dôvodu kvality by mal model dosahovať najvyššiu možnú diskriminačnú silu (separovať úverusposobilých a nespôsobilých klientov) dosiahnuteľnú v rámci existujúcich obmedzení (napr. dátových obmedzení, obmedzení daných expertnými rozhodnutiami, procesných alebo technických obmedzení); • stabilita vstupov a výstupov v čase; • objektívnosť a možnosť reprodukcie výsledkov, tzn. model by mal ako vstupy v čo najväčšej miere používať objektívne a merateľné údaje, ktoré nie sú závislé na subjektívnom úsudku používateľa; • vierohodnosť vstupov a výstupov, tzn. štruktúra vstupov modelu a ich vplyv na výsledok by mal byť principiálne v súlade s expertným úsudkom, a výstupy modelu by mali byť pre užívateľov zrozumiteľné a akceptovateľné. Proces vývoja PD modelov pozostáva z nasledovných hlavných fáz: 1. Zahájenie vývoja 2. Skóringové modely 23 2. Príprava vývojovej vzorky dát 3. Počiatočná jednorozmerná analýza 4. Viacrozmerná analýza -logistická regresia 5. Kalibrácia 6. Dokumetácia Pre jednotlivé fázy sú stanovené hlavné ciele, pravidlá a kľúčové princípy. 2.1.1 Zahájenie vývoja Prvým veľmi dôležitým krokom pri zahájení vývoja je identifikácia cieľov modelu. Určuje sa cieľové portfólio, pre ktoré bude model použitý a očakávaný prínos modelu (spôsob použitia v procesoch banky apod.). Ďalšou aktivitou je identifikácia kategórií dát, z ktorých by mali pochádzať vstupy modelu a stanovenie základnej štruktúry modelu. V závislosti od cieľového portfólia a očakávaného využitia je zvolená forma modelu, napr. model - so spojitým výstupom PD namapovaným do ratingovej škály alebo skóringový model - vo forme skóre karty. Podľa cieľového portfólia a rozsahu alebo kvality dostupných dát sú zvolené kategórie dát, z ktorých by mali pochádzať vstupy modelu, ako aj celkový dizajn modelu : • finančné výkazy klienta (historické a aktuálne); • kvalitatívne informácie o klientovi (objektívne, subjektívne); • behaviorálne informácie o klientovi (v prípade existujúcich klientov); • informácie o klientom požadovaných úveroch (v prípade aplikačných modelov); • socio-demografické informácie; • informácie o odvetví, v ktorom klient podniká; • makroekonomické informácie. Zoznam potenciálnych faktorov býva vypracovaný najmä na základe návrhu bankových špecialistov pre cieľové portfólio klientov, vstupov do iných 2. Skóringové modely 24 modelov pre cieľové portfólio klientov alebo pre podobné portfóliá. V prípade finančných faktorov by v rámci faktorov s ohľadom na typ účtovníctva mali byť použité pomerové ukazovatele, absolútne ukazovatele, ukazovatele trendov, binárne ukazovatele (napr. má/nemá záporné vlastné imanie) alebo priemerné hodnoty. Použité ukazovatele by mali komplexne pokrývať finančnú analýzu klienta (profitabilita, likvidita, štruktúra aktív, zadĺženosť, produktivita, aktivita). Kvalitatívne faktory sa volia tak, aby príslušné informácie boli v banke dostupné v čase, kedy sa model bude používať, aby boli čo najviac objektívne a merateľné a najmä komplexne pokrývali charakteristiky klienta relevantné pre posúdenie bonity. Často banky nevyužívajú len interné zdroje dát ale aj externé (informácie z úverových registrov, makroekonomické štatistiky, externé ratingy apod.). 2.1.2 Príprava vývojovej vzorky dát Príprava dát zahŕňa aktivity ako kontrolu kvality dát a spracovanie či úpravu chybných dát. Potrebné je rozhodnúť aká sa použije definícia zlyhaných a nezlyhaných klientov. Ďalej sa musia stanoviť hraničné dátumy pre použitie dát a nakoniec sa vytvorí finálna vývojová vzorka. V rámci kontroly kvality dát je nutné identifikovať a určiť spôsob ošetrenia najdených nedostatkov. Pozornosť býva zameriavaná na zjavne nekorektné informácie (napr. hodnota nekonzistentná s typom premennej, nezmyselný dátum, apod.), nevierohodné informácie (napr. nekonzistentný rad čísel, neštandardné pomery medzi položkami finančných výkazov), extrémne hodnoty, chýbajúce hodnoty (spôsob ošetrenia môže byť prípadne určený až na základe výsledkov jednorozmernej analýzy, kde sa zistí, či chýbajúca hodnota sama osebe má predpovedaciu schopnosť) a v relevantných prípadoch nulové hodnoty, viacnásobné či opakované záznamy, javy vyplývajúcie zo zmien v úverovom procese, v spôsobe zberu dát, v zmenách externého prostredia (napr. zmena účtovných štandardov) atď. V závislosti od množstva a kvality dostupných dát a cieľového použitia modelu je stanovená definícia zlyhaných a nezlyhaných klientov, na základe ktorej sa priradia hodnoty binárnej závislej premennej, a časový horizont, pre ktorý sa bude merať pravdepodobnosť zlyhania. Pokiaľ to množstvo a kvalita dostupných dát umožňuje, musí byť použitá definícia zlyhaných klientov zhodná s definíciou zlyhania podľa Bazilej II, s časovým horizontom 12 mesiacov. V prípade nedostatočných dát pre použitie definície zlyhania podľa Bazilej II sa niekedy používa aj striktnejšia definícia (napr. dosiahnutie 60, 45, 30 dní omeškania, preradenie na oddelenie vymáhania - Workout, apod.). V prípade použitia definície zlyhania, ktorá nie je v súlade s definí- 2. Skóringové modely 25 ciou zlyhania podľa Bazilej II, musí banka dôvod použitej definície a obdobie jej aplikácie popísať v dokumentácii, spolu s očakávanými dopadmi na výstup modelu príp. aj so zamýšľaným spôsobom ošetrenia týchto dopadov. Pri definícii nezlyhaných klientov musí byť zvážené zahrnutie alebo vylúčenie ”hraničných” klientov (napr. klienti, ktorí nespĺňajú definíciu zlyhania, ale vykazujú varovné signály) a ”nových” klientov (tzn. takých, ktorí vzhľadom na dobu uplynulú od poskytnutia úveru nemali ani teoretickú možnosť naplniť definíciu zlyhania). Hraničné dátumy pre výber finálnej vývojovej vzorky sa stanovujú s ohľadom na obmedzenia dostupných dát tak, aby bolo použité čo najdlhšie relevantné obdobie (pre implementáciu IRB prístupu je potrebná dĺžka obdobia použitých historických pozorovaní aspoň 5 rokov1 ). Pre vytvorenie vývojovej vzorky by mali byť použití všetci zlyhaní klienti spadajúci do zvoleného časového obdobia a k nim sa následne priradia nezlyhaní klienti podľa zvolenej metodiky. Použité môžu byť napríklad nasledovné možnosti: reprezentatívna vzorka, tzn. pomer zlyhaných a nezlyhaných klientov zodpovedá aktuálnej miere zlyhania pre dané portfólio; umelo zostavená vzorka s pomerom zlyhaných a nezlyhaných klientov 1:2, 1:3 apod. Obzvlášť v prípade umelo navýšeného pomeru zlyhaných a nezlyhaných klientov je nutné skontrolovať vývojovú vzorku z hľadiska reprezentatívnosti cieľového portfólia. V prípade dostatočného počtu defaultov sa vývojová vzorka rozdelí na dve časti. Jedna bude použitá pre vytvorenie modelu a druhá na jeho otestovanie (úvodná validácia). 2.1.3 Počiatočná jednorozmerná analýza Cieľom jednorozmernej analýzy je identifikovať tie faktory z celkového zoznamu, ktoré majú najväčšiu predikčnú schopnosť či diskriminačnú silu a následne budú použité vo viacrozmernej analýze. Vylúčené by mali byť všetky faktory, ktoré majú nízku diskriminačnú silu alebo vykazujú so závislou premennou vzťah, ktorý nie je v súlade s expertným úsudkom alebo s logikou platných pravidiel úverovej politiky. 2.1.4 Viacrozmerná analýza -logistická regresia Cieľom viacrozmernej analýzy je vyvinúť model pozostávajúci z najrelevantnejších faktorov skombinovaných takým spôsobom, aby bola dosiahnutá 1 viď. Smernica Európskeho parlamentu a rady 2006/48/ES, (čl. 2.2.1, bod 66 str. 116) 2. Skóringové modely 26 čo najvyššia diskriminačná sila pri zachovaní požadovanej komplexnosti modelu (počet faktorov, počet submodelov, pokrytie rôznych typov charakteristík). Do viacrozmernej analýzy vstupujú všetky faktory, ktoré neboli vylúčené v štádiu jednorozmernej analýzy. Identifikujú sa tie faktory, ktorých absolútna hodnota vzájomnej korelácie je vysoká (zväčša sa ako nevhodná považuje korelácia ≥ 0, 50). Z každej množiny vzájomne korelovaných faktorov sa na základe výsledkov jednorozmernej analýzy alebo expertného úsudku vyberie najrelevantnejší faktor (napr. faktor s najväčšou diskriminačnou silou na jednorozmernej báze, faktor s najpriamočiarejšou interpretáciou, apod.) a tento bude použitý v ďalšom vývoji spolu s nekorelovanými faktormi (zúžený zoznam faktorov), ostatné faktory z danej množiny vzájomne korelovaných faktorov nebudú použité. Štandardnou metódou modelovania je logistická regresia (matematický koncept je popísaný v kapitole 2.2). V rámci nej je možné použiť rôzne prístupy, s cieľom nájsť najoptimálnejšiu kombináciu faktorov, napr.: • Forward Selection -postupné pridávanie faktorov z finálneho zoznamu do modelu (poradie podľa významnosti jednotlivých faktorov až pokým žiadny zo zostávajúcich faktorov nemá p-hodnotu nižšiu než hladina významnosti). • Backward Elimination -je opakom Forward Selection, najprv sa vytvorí počiatočný model s použitím všetkých faktorov zo zoznamu a postupne sa odoberajú (po jednom) najmenej významné faktory. • Stepwise Regression -je kombináciou predchádzajúcich dvoch metód, postupne sa v každom kroku pridávajú a odoberajú faktory zo zoznamu na základe testovania podmodelu pomerom vierohodnosti až pokým sa nedosiahne najlepšia kombinácia. • Manuálna voľba faktorov zo zoznamu s najväčšou diskriminačnou silou na jednorozmernej báze. • Expertný výber faktorov zo zoznamu. Pri voľbe počtu faktorov je vhodné zohľadniť počet zlyhaných klientov vo vývojovej vzorke (pokiaľ je dostupná dostatočne veľká vývojová vzorka dát). Orientačným pravidlom je, že pri počte n faktorov v modeli, by mal byť dostupný počet zlyhaných klientov 2n . Pri viacerých modeloch s podobnou diskriminačnou silou sa preferujú modely s nižším počtom faktorov. Pokiaľ má výsledný model pozostávať z viacerých samostatných submodelov (napr. finančné hodnotenie, kvalitatívne hodnotenie atď.), mal by byť každý submodel vyvinutý vyššie uvedeným postupom zvlášť. Vhodnými štatistickými 2. Skóringové modely 27 postupmi sa následne stanovia váhy, ktorými sa jednotlivé submodely skombinujú do výsledného modelu. Za predpokladu, že vývojová vzorka pokrýva dostatočné časové obdobie, musí byť otestovaná stabilita užšieho výberu modelov v čase prostredníctvom system stability indexu (pozri 3.2.1). Prvý test sa vykoná na úrovni celkového modelu. V prípade, že populácia vykazuje významný posun, musí byť stabilita otestovaná na ďalšej nižšej úrovni (úroveň submodelov, úroveň jednotlivých faktorov). Ak sa preukáže nestability konkrétneho faktora, zváži jeho použitie v modeli (zachovanie nestabilného faktora musí byť adekvátne zdôvodnené). Výsledkom viacrozmernej analýzy by mali byť minimálne dva modely s najvyššou diskriminačnou silou a stabilitou, ktoré budú následne expertne posúdené s cieľom vybrať najvhodnejší z nich z hľadiska obsiahnutých faktorov a transparentnosti ich interpretácie. 2.1.5 Kalibrácia Cieľom kalibrácie je transformovať výstup modelu na očakávané PD. Transformácia má byť vykonaná tak, aby celkové priemerné PD odhadované modelom bolo zhodné s celkovou pozorovanou mierou zlyhania v cieľovom portfóliu2 . V závislosti od plánovaného využitia modelu sa pozorovaná miera zlyhania v cieľovom portfóliu môže vypočítať ako: • aritmetický priemer jednoročných pozorovaných mier zlyhania za obdobie pokrývajúce celý hospodársky cyklus, resp. aspoň za obdobie, pre ktoré sú dostupné relevantné dáta; • stanoviť na úrovni aktuálnej miery zlyhania; • stanoviť na úrovni očakávanej miery zlyhania pre nadchádzajúci rok (najmä v prípade rastúceho trendu miery zlyhania v danom portfóliu); • vypočítať inou vhodnou metódou (voľba metódy musí byť zdôvodnená). Súčasťou kalibrácie je rozdelenie klientov na základe odhadovaného PD do tried tak, aby nedochádzalo k vysokým koncentráciám klientov v jednej resp. v malom počte tried ,a aby existoval čo najviac monotónny vzťah medzi triedou a odhadovaným PD (horšia trieda = vyššie PD). Pokiaľ kvantita a kvalita dát použitých pre vývoj modelu umožňuje (tzn. odhadované PD je možné považovať za dostatočne vierohodné), môže byť PD odhadované mo- delom3 namapované priamo do ratingovej škály. 2 Miera zlyhania (Default Rate) sa kalkuluje ako pomer počtu klientov, ktorí zlyhali za určité obdobie (zväčša do 1 roka) z celkovému počtu klientov na začiatku tohto obdobia. 3 Pre klientov, ktorí majú aj aplikačné aj behaviorálne PD, sa výsledné PD a teda rating učuje väčšinou ako nejaká kombinácia jednotlivých PD (vážený priemer, maximum apod.) 2. Skóringové modely 28 S ohľadom na kvalitu dát použitých pri vývoji a celkovou očakávanou mierou chybovosti odhadu sa pri kalibrácii aplikuje marža konzervativizmu vedúca ku konzervatívnejšiemu odhadu PD. Kedže marža konzervativizmu by mala zachytávať možné dátové chyby v odhadoch, do jej výpočtu často vstupuje smerodajná odchýlka. Okrem štatistickej marže konzervativizmu sa ešte často používa aj dodatočná expertne stanovená marža navyšujúca odhady PD, nakoľko pridanie miery konzervatizmu ku odhadom je nariadené aj regulátorom4 (dodatočná marža je aj v súvislosti s procyklickým charakterom spomínaným v kap. 1.3.2). 2.1.6 Kontrola a implementácia Prvým krokom po vývoji modelu by mala byť jeho úvodná validácia, ktorej cieľom je nezávislá kontrola správnosti postupov použitých pri vývoji ako aj kvality výsledného modelu. Mal by sa skontrolovať celý postup vývoja. Identifikované potenciálne nedostatky alebo chyby musia prediskutovať s vývojovým tímom. V prípade, že identifikované nedostatky môžu mať významný dopad na kvalitu modelu, musí byť vykonané overenie správnosti postupov resp. prepracovanie príslušných krokov vývoja modelu. Až po vykonaní všetkých týchto aktivít môže banka pristúpiť k implementácii modelu do procesov banky a IT nástrojov. Pričom potrebné je stanovenie pravidiel používania modelu; určenie procesov, v ktorých má byť model použitý; schválenie modelu a spôsobu jeho využitia; technická implementácia modelu do príslušných nástrojov; školenie používateľov modelu; ku každému modelu musia byť stanovené postupy a pravidlá pre celý proces získania výstupu modelu a spracovanie tohto výstupu. Po komplexnom zhrnutí všetkých krokov nevyhnutných pre vývoj skóringového modelu si detailnejšie predstavíme samotný matematický koncept vývoja logistického modelu predikujúceho pravdepodobnosť zlyhania a v ďalšej kapitole potom štatistické testy kvality modelu. 2.2 Matematický koncept logistickej regresie Logistická regresia je najčastejšie využívanou technikou pri tvorbe skóringových modelov úverovej spôsobilosti. Podobne ako lineárna regresia skúma 4 viď. Smernica Európskeho parlamentu a rady 2006/48/ES, (čl. 2.2, bod 54 str. 115),[11] 2. Skóringové modely 29 funkčný vzťah medzi závislou (vysvetľovanou, predikovanou) premennou y a nezávislými (vysvetľujúcimi, predikujúcimi) premennými x1, x2, ..., xk. Na rozdiel od lineárnej regresie, kde vysvetľovaná premenná je spojitá, logistickú regresiu volíme v prípade kategoriálnej (nadobúda obmedzený počet hodnôt) vysvetľovanej premennej. Predikuje podmienenú pravdepodobnosť jednej obmeny kategoriálnej závislej premennej v závislosti od iných vysvetľujúcich premenných, ktoré môžu byť tiež kategoriálne alebo aj spojité. V praxi sa však zvyknú aj spojité vysvetľujúce premenné transformovať do kategórií. Skóringový model potom dovoľuje zostaviť skóre kartu pre všetky premenné zaradené v modeli. Finálna skóre karta umožňuje obodovať každého žiadateľa (pri aplikačnom skóringu) podľa nastavených bodov/skóre za každú kategóriu premennej v modeli (napr. napr. žiadateľ je v rámci premennej príjem v kategórii od 600-1000 EUR a tomu odpovedá napr. 30 bodov). Celkový súčet bodov/finálne skóre potom slúži na posúdenie (porovnanie s prahovou hodnotou), či daný produkt/službu klientovi schváliť. Logistická regresia má uplatnenie v celej rade odvetví, no najmä v bankovníctve, poiťovníctve a ďalších službách (napr. telekomunikáciách). Pokým banky ju používajú pre odhad rizika spojeného s poskytovaním kreditných produktov, poisťovne ju využívajú pre odhad rizika poistných udalostí, napr. automobilových nehôd. V telekomuníkáciách môže nájsť uplatnenie pri tzv. cross-sellingu, napr. pre ponuku nového telefónu. V službách sa používa hlavne v oblasti marketingu pri modelovaní odozvy, napr. šance na ďalšiu objednávku. V tejto práci sa budem ďalej zaoberať viacrozmernou logistickou regresiou pre predikciu binárnej premennej (zlyhá/nezlyhá). V tejto kapitole čerpám najmä z publikácie od priekopníkov logistickej regresie Hosmera a Lemeshowa [1], ďalej z [12] a čiastočne z [9], [8], [3] a [4]. 2.2.1 Model logistickej regresie Našou úlohou je skonštruovať vyhovujúci model pre odhadovanie pravdepodobnosti zlyhania klienta v závislosti na hodnotách viacerých vysvetľujúcich premenných (dostupné dáta o klientoch). Pod pojmom ”dobrý klient” budem označovať klienta, ktorý nezlyhal a preukázal tak svoju úverovú spôsobilosť a ”zlý klient” bude nespôsobilý klient, ktorý v sledovanom období zlyhal. Pri klasickom lineárnom regresnom modeli, v ktorom je náhodná premenná yi pre i-tého klienta vyjadrená ako lineárna funkcia vektoru regresorov 2. Skóringové modely 30 xT i = (1, xi1, . . . , xik) s regresnými koeficientmi βT = (β0, β1, . . . , βk): yi = β0 + β1xi1 + . . . + βkxik = β0 + k j=1 βjxij, i = 1, . . . , n pre n klientov, je výraz β0 + k j=1 βjxij nenáhodný a udáva priemernú očakávanú hodnotu premennej yi, ktorá nadobúda hodnoty z intervalu (−∞, ∞). Uvažujme závislú premennú binárneho typu (alternatívne rozdelenie), ktorá nadobúda hodnotu yi = 1, ak je i-tý klient dobrý a hodnotu yi = 0 v prípade zlého klienta . Potom π(xi) = P(yi = 1|xi) je podmienená pravdepodobnosť, že i-tý klient s vektorom vysvetľujúcich premenných xi nezlyhá. Analogicky (1 − π(xi)) = P(yi = 0|xi) je podmienená pravdepodobnosť zlyhania i-tého klienta s vektorom vysvetľujúcich premenných xi. Pre strednú hodnotu platí: E(yi|xi) = 1 · P(yi = 1|xi) + 0 · P(yi = 0|xi) = P(yi = 1|xi) = π(xi). Z tohto dôvodu je rozumné uvažovať regresný model pre pravdepodobnosť π(xi). Pravdepodobnosť je z intervalu 0, 1 , a to je interval príliš obmedzený, aby obsahoval všetky hodnoty výrazu β0 + k j=1 βjxij. Tento nedostatok sa eliminuje zámenou pravdepodobnosti π(xi) veličinou odds, nazývanou aj šanca javu, ktorá je definovaná ako podiel pravdepodobnosti π(xi) a (1 − π(xi)), teda pravdepodobnosti nastatia daného javu ku pravdepodobnosti jeho nenastatia: odds[π(xi)] = π(xi) 1 − π(xi) = P(yi = 1|xi) P(yi = 0|xi) . (2.1) Hodnota tejto funkcie už leží v intervale 0, ∞). Vzťah medzi pravdepodobnosťou π(x) a vysvetľujúcou premennou x je nelineárny. Grafickým zobrazením tejto závislosti je logistická sigmoidná krivka, tzv. S-krivka (viď. obr. 2.1). Ďalším krokom nutným k prechodu do rovnakého intervalu ako patria 2. Skóringové modely 31 Obr. 2.1: S-krivka hodnoty funkcie β0 + k j=1 βjxij, t.j. (−∞, ∞), je logaritmickú transformáciu. Dostavame premennú nazývanú logit: logit[π(xi)] = ln π(xi) 1 − π(xi) . (2.2) Vzťah medzi logitom a vektorom vysvetľujúcich premenných má už lineárny charakter. Logitová transformácia je znázornená na obrázku 2.2. Obr. 2.2: Logitová transformácia Potom rovnicu logistického modelu môžeme napísať v tomto tvare: logit[π(xi)] = β0 + k j=1 βjxij = βT xi. (2.3) 2. Skóringové modely 32 Rovnica reflektuje základný koncept modelu logistickej regresie. Ten hovorí, že logaritmus šance je lineárnou funkciou vysvetľujúcich premenných. Vzťah medzi pravdepodobnosťou a vektorom vysvetľujúcich premenných má nelineárny charakter typu exponenciálnej funkcie (viď. rovnica 2.4), a preto sa parametre logistického modelu zvyknú interpretovať práve prostredníctvom šancí. π(xi) = e β0+ kP j=1 βjxij 1 + e β0+ kP j=1 βjxij = eβTxi 1 + eβTxi = 1 1 + e−(βTxi) . (2.4) Niekedy sa ešte zvykne využívať probitový model, ktorý využíva distribučnú funkciu normálneho rozdelenia. Potom platí: π(xi) = Φ(β0 + k j=1 βjxij) = Φ(βT xi). (2.5) 2.2.2 Interpretovanie výsledkov logistického modelu Za predpokladu, že modelovaná premenná je binárna (rovná 0, ak nenastala nejaká udalosť a rovná 1 v prípade nastatia danej udalosti), vysvetlíme si výpočet pomerov šancí (Odds Ratios, OR) a ich interpretáciu. Uvažujme najprv len o jednorozmernom modeli yi = β0 + β1xi s jedinou vysvetľujúcou premennou x, ktorá je binárna. Označme π(x) podmienenú pravdepodobnosť nastatia danej udalosti P(y = 1|x), teda hodnotu, ktorú modelujeme. Potom logit[π(x)] zapíšeme v tvare: logit[π(x)] = ln π(x) 1 − π(x) = ln P(y = 1|x) P(y = 0|x) = β0 + β1x Šanca (odds) je definovaná ako π(x) 1−π(x) . Pre x = 0 je šanca: odds(0) = P(y = 1|x = 0) P(y = 0|x = 0) = eβ0 1+eβ0 1 1+eβ0 = eβ0 2. Skóringové modely 33 Paramater β0 je teda rovný logitu pravdepodobnosti sledovanej udalosti pre x = 0: β0 = ln P(y = 1|x = 0) P(y = 0|x = 0) Pre x = 1 je odpovedajúca šanca rovná: odds(1) = P(y = 1|x = 1) P(y = 0|x = 1) = eβ0+β1 1+eβ0+β1 1 1+eβ0+β1 = eβ0+β1 Logaritnus pomeru šancí pre uvažovaný príklad potom zapíšeme takto: ln(OR) = ln odds(1) odds(0) = ln eβ0+β1 eβ0 = ln(eβ1 ) = β1, Hodnotu pomeru šancí získame odlogaritmovaním: OR = eβ1 . Pomer šancí napovedá, ako sa zmení šanca na úspech (pre modelovanú hodnotu y = 1) pri jednotkovej zmene vysvetľujúcej premennej. Napríklad ak OR = 3, šanca na úspech pre x = 1 je trikrát vyššia, ako keď x = 0. Ak zmena vysvetľujúcej premennej nie je jednotková, teda z 0 na 1, ale všeobecne z a na b, teda o c = b − a, tak OR = e(β1)c . 2.2.3 Odhad parametrov modelu logistickej regresie Predpokladáme, že pozorovania náhodnej veličiny yi, i = 1, . . . , n, ktorá vystupuje v logistickej regresii ako vysvetľovaná premenná detekujúca, či je i-tý klient dobrý alebo zlý, sú nezávislé. Parametre modelu β0, β1, . . . , βk udávajú váhy jednotlivých vysvetľujúcich premenných x1, x2, ..., xk. Naším cieľom je nájsť čo najlepší odhad týchto parametrov, teda vektoru β. V štandardnej lineárnej regresii sa používa metóda najmenších štvorcov (Method of Least Squares) založená na minimalizácii súčtu druhých mocnín odchyliek odhadnutých hodnôt od pozorovaných hodnôt. Kedže metóda najmenších štvorcov vyžaduje podmienku normality rozdelenia pre vysvetľujúce premenné, pre logistickú regresiu nie je vhodná. Na odhad parametrov nelineárnych modelov, teda aj logistickej regresie, sa dnes najčastejšie používa metóda maximálnej vierohodnosti (Maximum Likelihood Method). Táto metóda nemá žiadne požiadavky na nezávisle premenné a tie môžu byť nominálne, poradové (ordinálne), alebo intervalové (resp. spojité). Mohla sa začať vyžívať až s rozvojom výpočtovej techniky, lebo je výpočtovo pomerne náročná. 2. Skóringové modely 34 Metóda maximálnej vierohodnosti je založená na konštrukcii tzv. vierohodnostnej funkcie, ktorá predstavuje zjednotenie pravdepodobnosti získaných z pozorovaných dát pre modelovanú hodnotu závisle premennej. Pravdepodobnosť dvoch možných hodnôt yi = 1 a yi = 0 sa dá súhrne zapísať P(yi = m) = π(xi)m (1 − π(xi))1−m , m = 0, 1. Pretože pozorované hodnoty sú podľa predpokladu nezávislé, môžeme definovať vierohodnostnú funkciu l(β) ako súčin podmienených pravdepodobností pre jednotlivé pozorovania l(β) = n i=1 π(xi)yi [1 − π(xi)]1−yi . (2.6) Kedže l(β) je jednoducho funkciou neznámeho parametru β, ktorý je odhadovaný, metóda maximálnej vierohodnosti je založená na získaní takej hodnoty parametru, ktorý maximalizuje l(β). V praxi sa ukázalo ako výhodnejšie maximalizovať skôr funkciu ln[l(β)] namiesto l(β), čo nie je prekážkou, pretože obidve tieto operácie sú ekvivalentné a dávajú rovnaké výsledky. Takouto logaritmickou transformáciou dostaneme L(β) = ln[l(β)] = n i=1 {yi ln[π(xi)] + (1 − yi) ln[1 − π(xi)]}. (2.7) Pri hľadaní vektoru β, ktorý maximalizuje L(β) spočítame parciálne derivácie funkcie L(β) podľa jednotlivých parametrov β0, β1, . . . , βk a položíme rovné nule. Pritom sa na π(xi) pozeráme ako na funkciu β, viď 2.4. Dostaneme takto rovnice známe ako vierohodnostné rovnice n i=1 [yi − π(xi)] = 0 (2.8) a n i=1 xij[yi − π(xi)] = 0. (2.9) Získame teda nelineárnu sústavu rovnic vzhľadom k β, ktorej riešenie vyžaduje špeciálne iteračné metódy. Riešením je vektor ˆβ, odhad vektoru β. 2. Skóringové modely 35 Odhad paramerov logistického modelu metódou maximálnej vierohodnosti umožňuje viacero programových prostredí, napr. procedúra LOGISTIC v systéme SAS. V rámci procedúry LOGISTIC si možeme aj vybrať linkovú funkciu či už logit (príkazom LINK=LOGIT) alebo probit (LINK=PROBIT). Odhad smerodajnej odchýlky odhadov parametrov získame pomocou matice druhých parciálnych derivácií funkcie L(β) podľa β ∂2 L(β) ∂β2 j = − n i=1 x2 ijπ(xi)[1 − π(xi)] (2.10) a ∂2 L(β) ∂βj∂βl = − n i=1 xijxilπ(xi)[1 − π(xi)] (2.11) pre j, l = 0, . . . , k. Matica s rozmermi (k+1)×(k+1) týchto druhých parciálnych derivácií a opačnými znamienkami sa nazýva Fisherova informačná matica a označuje sa I(β). Asymptotická variančná matica je inverzná matica k Fisherovej informačnej matici, teda Var(β) = I−1 (β). Odtiaľ variancia Var(βj) j-tej zložky vektoru β je j-tý diagonálny prvok matice Var(β). Keď za neznáme parametre βj dosadíme odhadnuté parametre ˆβj dostaneme asymptotický odhad variancie ˆVar( ˆβj). Odhad smerodajnej odchýlky j-tého parametru je rovný nezápornej druhej odmocnine z variancie: SE( ˆβj) = ˆVar( ˆβj) (2.12) Pričom ˆI(ˆβ) = XT VX, kde X je n × (k + 1) rozmerná matica dát jednotlivých klientov X =      1 x11 x12 . . . x1k 1 x21 x22 . . . x2k ... ... ... . . . ... 1 xn1 xn2 . . . xnk      a V je n × n rozmerná matica V =      ˆπ(x1)[1 − ˆπ(x1)] 0 . . . 0 0 ˆπ(x2)[1 − ˆπ(x2)] . . . 0 ... 0 ... ... 0 . . . 0 ˆπ(xn)[1 − ˆπ(xn)]      . 2. Skóringové modely 36 2.2.4 Testy významnosti logistického modelu a jeho parametrov Potom, čo sme získali odhady parametrov logistického modelu metódou maximálnej vierohodnosti sa budeme venovať testovaniu významnosti (resp. vhodnosti) logistického modelu ako celku a tiež testovaniu významnosti jeho jednotlivých parametrov. Keď poznáme odhad ˆβj parametru βj a jeho asymptotickú smerodajnú odchýlku SE( ˆβj), môžeme testovať nulovú hypotézu H0 : βj = 0 pomocou Waldovej testovacej štatistiky: Wj = ˆβj SE( ˆβj) , (2.13) ktorá má za platnosti nulovej hypotézy asymptoticky normované normálne rozdelenie N(0, 1). Štvorec Waldovej štatistiky W2 má približne chí-kvadrát rozdelenie s jedným stupňom voľnosti. Waldov 100(1−α)% interval spoľahlivosti pre parameter βj potom vyzerá takto: ˆβj − z(1−α 2 )SE( ˆβj), ˆβj + z(1−α 2 )SE( ˆβj) (2.14) kde z(1−α 2 )SE je príslušný kvantil normálneho rozdelenia. Ak 0 patrí do príslušného intervalu spoľahlivosti, parameter βj nie je významný na zvolenej hladine významnosti α. Práve podľa významnosti na základe Waldovho chí-kvadrát testu sú zaraďované premenné do modelu aj v rámci selekčných metód logistickej regresie -forward, backward a stepwise, pričom máme možnosť nastaviť vstupné či výstupné hladiny významnosti pre zatrieďovanie premenných do modelu. K testovanie hypotézy o významnosti odhadnutého logistického modelu ako celku sa používa test vierohodnostným pomerom (Likelihood Ratio Test). Pre testovaniu submodelu (vylúčenie časti regresorov) je možné použiť test daný rozdielom tzv. deviancií (Deviances), založený na odhadoch ˆβU v modeli bez reštrikcie a ˆβR v modeli s reštrikciou. Uvažujme najprv model, ktorý má práve toľko parametrov, koľko je pozorovaní, t.j. n. Tento najrozsiahlejší model sa nazýva saturovaný (saturated). Označme maximálnu hodnotu vierohodnostnej funkcie v saturovanom modeli LS. Každý iný možný model je submodelom saturovaného modelu. Vhodnosť 2. Skóringové modely 37 nášho modelu môžeme posúdiť pomocou deviancie D definovanej ako: D = 2(LS − L(ˆβ)) = −2 ln l( ˆβ) lS . (2.15) Čím je náš model menej vhodný, tým je hodnota deviancie D väčšia, podobne, ako je väčší reziduálny súčet štvorcov5 v klasickom lineárnom modeli pre menej vhodný model. V súvislosti s logistickou regresiou je hodnota lS triviálna, rovná 1. Saturovaný model má n parametrov π(x1), . . . , π(xn). Odhad ˆπ(xi) je v prípade logistickej regresie priamo yi, takže je lS = n i=1 yyi i [1 − yi]1−yi = 1. Devianciu v modeli logistickej regresie je preto možné vyjadriť ako: D = −2 ln(l(ˆβ)) = n i=1 ˆπ(xi)yi [1 − ˆπ(xi)]1−yi . (2.16) Keď chceme zistiť štatistickú významnosť vysvetľujúcich premenných modelu, zostrojíme testovú štatistiku G danú rozdielom deviancií submodelu s reštrikciou a modelu bez reštrikcie: G = D(ˆβR) − D(ˆβU ) = −2 ln l(ˆβR) l(ˆβU ) = −2 ln(LR). (2.17) Táto testová štatistika má asymptotické rozdelenie χ2 (q), kde q je rovné rozdielu počtu nezávislých parametrov v porovnávaných modeloch. Pomer (l(ˆβR) l(βU ) ) sa nazýva vierohodnostný pomer (LR, Likelihood Ratio). Hypotézu H0 : βj = 0 a podobné hypotézy o nulovosti jednej zložky vektoru β je možné testovať aj týmto testom rozdielu deviancií. Obidve testovacie metódy, Waldov test aj test pomerom vierohodnosti, majú približne rovnaké výsledky pre väčšie vzorky dát, ale pre menšie alebo stredné vzorky sa výsledky môžu odlišovať. Orientačne sa dá povedať, že štatistici preferujú pri malých a stredných vzorkách test pomerom vierohodnosti oproti Waldovmu testu. 5 SSE = n i=1 (yi − ˆyi)2 2. Skóringové modely 38 Ako sme už spomínali, z hľadiska interpretácie logistického modelu nie sú také potrebné parametre a ich intervaly spoľahlivosti, ale skôr sú užitočné pomery šancí a ich intervaly spoľahlivosti. Výstup procedúry LOGISTIC v SAS umožňuje vypočitáť okrem odhadov parametrov modelu aj bodové odhady pomerov šancí, ktoré sú viac vhodné na interpretáciu logistického modelu, a ich intervaly spoľahlivosti. Z intervalov možno posúdiť aj významnosť jednotlivých parametrov modelu. Ak príslušný interval spoľahlivosti pre pomer šancí obsahuje číslo 1, parameter nie je významný. 2.2.5 Miery posúdenia kvality logistického modelu Na hodnotenie kvality logistického modelu sa využívajú dve skupiny mier. Prvá skupina mier vychádza, tak ako test pomerom vierohodnosti, opäť z transformovanej vierohodnostnej funkcie −2 ln(l). Odhad vierohodnostnej funkcie l získame zo vzorky dát podľa vzorca: −2 ln(l) = −2 n i=1 ln[ˆπ(xi)]. Pretože odhadnuté pravdepodobnosti ˆπ(xi) sú z intervalu 0, 1 , po transformácii −2 ln(l) získame hodnoty z intervalu 0, ∞). Požadujeme maximálnu vierohodnostnú funkciu l, a teda opačne upravený logaritmus musí byť −2 ln(l) čo najmenší. Štatistika l logistického modelu je analógiou koeficientu determinácie (R2 ) u klasického lineárneho modelu. Čím jej hodnota vyššia, tým je model kvalitnejší, tzn. lepšie odhaduje danú vzorku dát. Určitú modifikáciu l štatistiky predstavuje aj Akaikovo informačné kritérium (AIC, Akaike Information Criterion), ktorého výpočtový vzorec má takýto tvar: AIC = −2 ln(l) + 2(k + s), (2.18) kde s je počet hodnôt modelovanej premennej znížený o číslo 1 (t. j. v našom prípade binárnej vysvetľovanej premennej je s = 2 − 1 = 1) a k je počet vysvetľujúcich premenných v modeli. Ďalšou mierou kvality založenou na štatitike −2 ln(l) je Schwarzovo-Bayesovo kritérium (SC, Schwarz-Bayes Criterion): SC = −2 ln(l) + (k + s) ln(n), (2.19) kde s je opäť počet hodnôt vysvetľovanej premennej znížený o 1, k počet vysvetľujúcich premenných v modeli a n je rozsah vzorky. Obidve tieto kritériá patria medzi penalizačné miery kvality odhadu regresného modelu. Používajú sa pri porovnávaní viacerých konkurenčných modelov pre danú vzorku dát. Menšie hodnoty týchto mier indikujú vhodnejší 2. Skóringové modely 39 model pre danú vzorku dát. Druhou skupinou mier na zhodnotenie kvality logistického modelu sú miery asociácie, konkrétne Somerovo D (Somer’s D), Goodmanova-Kruskalova gamma (Gama), Kendallovo tau (Tau-a) a štatistika c. Merajú stupeň poradovej korelácie medzi vypočítanou pravdepodobnosťou π(x) (predikciou) a skutočnými pozorovanými hodnotami vysvetľovanej premennej. Čím vyššia asociácia medzi týmito hodnotami, tým kvalitnejší je model pri predikcii závisle premennej. Miery vychádzajú z párovania pozorovaní na základe hodnôt modelovanej premennej. Zo skutočných pozorovaných hodnôt modelovanej premennej a hodnôt predikovaných logistickým modelom môžeme zostaviť asociačnú tabuľku a z nej zistiť nasledujúce počty párov pozorovaní: nc - počet zhodných párov, nd - počet opačných párov, nt - počet ostatných párov, pre ktorý platí nt = t − nc − nd, t - celkový počet párov, pre ktorý platí t = nc + nd + nt, n - počet pozorovaní vo vzorke. Vzorce na výpočet jednotlivých mier poradovej asociácie sú: c = nc + 0, 5(t − nc − nd) t = nc + 0, 5nt t (2.20) Somer s D = nc − nd t (2.21) Goodman − Kruskal Gamma = nc − nd nc + nd (2.22) Kendall s Tau − a = nc − nd 0, 5 n(n − 1) (2.23) V praxi sa najviac používa najmä štatistika c alebo Somerovo D. Model s vyššími hodnotou c štatistiky či Somerovho D je kvalitnejší. Je zrejmé, že predpokladom kvality modelu je vysoký počet zhodných párov nc, teda čím dosahuje vyššie hodnoty c štatistiky či Somerovho D, tým je kvalitnejší. V prípade binárnej vysvetľovanej premennej hodnota c štatistiky predstavuje plochu pod ROC krivkou (ROC, Receiver Operating Characteristic) a Somerovo D je inak nazývaný aj GINI koeficient. Tieto miery sa využívajú aj pri monitoringu kvality modelu počas celej jeho životnosti (pri validácii modelu), preto si ich predstavíme bližšie ešte v nasledujúcej kapitole. Kapitola 3 Validácia skóringových modelov Správanie klientov či charakteristiky poskytovaných bankových produktov sa menia, a preto vytvorený kvalitný model nezaručuje jeho kvalitu v každom čase. Kvalita modelu musí byť na cieľovom portfóliu pravidelne testovaná (validovaná). Cieľom pravidelnej validácie je objektívne a konzistentne overovať výkonnosť a presnosť modelu a jeho jednotlivých komponentov, ako aj bankových procesov súvisiacich s používaním modelu. Za týmto účelom sa používajú kvalitatívne a kvantitatívne nástroje a kontroly (kvalitatívna a kvantitatívna validácia). Štandardne sa validácia vykonáva na ročnej báze. Nutným predpokladom akceptácie modelu je pozitívny výsledok kvalitatívnej validácie. Pozitívny výsledok kvantitatívnej validácie nie je postačujúci. Kvalitatívna validácia zahŕňa tri základné oblasti: dizajn modelu, kvalitu dát a IT systémov, interné využívanie modelu (use test). Validácia dizajnu modelu sa vykoná na základe existujúcej dokumentácie k vytvorenému modelu. Kvalita tejto dokumentácie je sama osebe súčasťou validačných kritérií. Mala by obsahovať predovšetkým popis modelu, jeho celkovej štruktúry a spôsobu používania; definíciu zlyhania použitú pre vývoj modelu; popis dát využitých pri vývoji modelu; postup vývoja modelu (voľba štruktúry modelu, voľba jednotlivých faktorov, použité štatistické metódy a ich výsledky, použité predpoklady, atď.); popis kalibrácie výstupov modelu na PD. Kvantitatívna validácia zhŕňa dve základné oblasti: spätné testovanie (Back-testing), v rámci ktorého sa testuje najmä diskriminačná sila, stabilita či kalibrácia a benchmarking, t.j. porovnanie s iným modelom vhodným pre dané portfólio alebo aspoň s expertným hodnotením klientov. 40 3. Validácia skóringových modelov 41 3.1 Testovanie diskriminačnej sily skóringových modelov Cieľom skóringového modelu je správne oddeliť dobrých a zlých klientov. Táto vlastnosť vyjadruje kvalitu odhadnutej funkcie. Preto základným predpokladom pozitívneho výsledku kvantitatívnej validácie modelu je dostatočná schopnosť modelu separovať medzi klientmi, ktorí počas zvoleného časového horizontu zlyhajú, a klientmi, ktorí nezlyhajú. Ideálna by bola situácia, keby všetkým zlyhaným klientom bola priradená pravdepodobnosť zlyhania 1 a všetkým nezlyhaným 0. K tomu však v praxi nedochádza, pretože kompletné charakteristiky nie sme schopní pozorovať a pracujeme tak s nedokonalými informáciami. Z toho vyplýva, že nemôžeme stopercentne rozlišovať klientov podľa ich úverovej spôsobilosti. Vždy existuje určitá množina zlých klientov, ktorí boli klasifikovaní ako dobrí a naopak. Snahou je, aby týchto prípadov bolo čo najmenej (najvyššia možná diskriminačná sila modelu). Pre zhodnotenie diskriminačnej sily musia byť štandardne použité aspoň dve rôzne kvantitatívne metódy. Pokiaľ je to možné a relevantné, má byť použitých aj viac metód s cieľom získať čo najúplnejší a najobjektívnejší obraz o diskriminačnej sile modelu. Teoretický popis štatistických testov a ich hraničné hodnoty sú uvedené napr. v [6] alebo [10]. Ak to dostupné dáta umožňujú, diskriminačná sila sa okrem úrovne celkového modelu počíta aj na úrovni jednotlivých submodelov a ďalej na úrovni jednotlivých faktorov. Pri validácii modelu merania PD sa skúma predovšetkým rozdelenie počtu zlyhaných a nezlyhaných prípadov na ratingových triedach. Cieľom je preukázať, že sa tieto dve rozdelenia navzájom signifikantne líšia. Pre tento účel sa väčšinou usporiadajú ratingové triedy od najhoršej (najvyššie PD) po najlepšiu (najnižšie PD) a vypočíta sa hustota a distribučné funkcie zlyhaných a nezlyhaných klientov. Zobrazenie zlyhaných a nezlyhaných prípadov slúži ako pomocný nástroj na prvotnú analýzu diskriminačnej sily. Túto vlastnosť je však potrebné ďalej dokázať exaktnými štatistickými testami. Z ilustračného príkladu na obrázku č. 3.1 môžeme vyčítať, že približne 70% zlých prípadov a len 20% z dobrých prípadov patria do ratingových tried 6 až 10. Alebo opačne 20% z dobrých prípadov a len asi 2,3% zo zlých prípadov môžeme nájsť v ratigových triedach 1 až 3. Modelom vypočítaný rating klienta (PD) sa používa ako rozhodovacie kritérium pre schválenie daného produktu. Ak má klient horší rating než je predefinovaná prahová hodnota (cut-off ), úverová žiadosť býva zamietnutá. Ak riziko zlyhania klienta je banka ochotná akceptovať, teda má lepší rating než je cut-off hranica, úverová žiadosť bude schválená. V tomto kontexte sa 3. Validácia skóringových modelov 42 Obr. 3.1: Distribučné funkcie zlyhaných a nezlyhaných prípadov však objavujú dva typy chýb (viď. obr. 3.2): • α error (chyba 1. druhu) - prípad, keď zlý klient nie je zamietnutý • β error (chyba 2. druhu) - prípad, keď dobrý klient je zamietnutý Obr. 3.2: Zobrazenie rozdelenia zlyhaných a nezlyhaných prípadov V realite α error spôsobuje väčšiu škodu z pohľadu kreditného rizika kvôli zlyhaniu než β error, ktorá znamená škodu vo forme straty obchodu. V prípade, ak sa ratingová trieda používa ako rozhodovacie kritérium pri 3. Validácia skóringových modelov 43 schvaľovaní, potom je veľmi dôležité nastaviť cut-off hranicu s dôrazom na náklady vyššie uvedených chýb. Nastavenie prahovej hodnoty závisí na obchodnom cieli danej spoločnosti. Kľúčovú rolu tu zohrávajú náklady na zlých klientov (náklady na vymáhanie, LGD) v porovnaní so ziskom tečúcim z dobrých klientov. Obyčajne sa α a β chyby interpretujú nie v nominálnej hodnote ale v percentách. β error reprezentuje percentuálnu časť dobrých prípadov pod cutoff hranicou z celkového počtu dobrých prípadov, teda distribučnú funkciu dobrých nezlyhaných prípadov (Fgoods) kumulovanú od najhoršej ratingovej triedy. α error na druhej strane korešponduje s percentuálnym pomerom zlých prípadov nad cut-off hranicou ku všetkým zlým, čo je doplnok distribučnej funkcie zlých prípadov (Fbads). 3.1.1 Gini koeficient, ROC a CAP krivka K najbežnejším spôsobom merania diskriminačnej sily patrí ROC krivka (Receiver Operating Characteristic Curve). Konštruuje sa tak, že na os x nanesieme distribučnú funkciu dobrých prípadov a na os y nanesieme distribučnú funkciu zlých prípadov. Každá sekcia ROC krivky odpovedá ratingovej triede začínajúc vľavo najhoršou triedou (viď obr. 3.3). Obr. 3.3: Tvar ROC krivky na ilustračnom príklade V ideálnom prípade by model klasifikoval všetkých skutočne zlyhaných klientov pravdepodobnosťou zlyhania rovnou 1 (najhoršia ratingová trieda). V rámci ROC krivky by ideálny model išiel vertikálne z bodu (0%,0%) hore do bodu (0%,100%) a odtiaľ do prava do bodu (100%,100%). Opačne v prípade 3. Validácia skóringových modelov 44 náhodného modelu, ktorý nedokáže rozlíšiť medzi dobrými a zlými prípadmi by ležal pozdĺž diagonály. Sklon ROC krivky v každej časti reflektuje pomer zlých prípadov ku dobrým prípadov v danej ratingovej triede. Z tohto dôvodu by ROC krivka mala byť konkávna. Ako miera diskriminačnej sily sa používa obsah plochy pod ROC krivkou (Area under Curve, AUC). Pre ideálny model je AUC = 1 a pre náhodný AUC = 1/2. Obsah plochy pod ROC krivkou je rovný už preberanej štatistike c (viď. 2.20), pričom t je celkový počet párov, t. j. počet dobrých klientov vo vzorke vynásobený počtom zlých klientov. Potom nc predstavuje počet takých párov, kde pre dobrého klienta vyšla predikovaná pravdepodobnosť zlyhania nižšia než pre zlého klienta; nd počet opačne predikovaných párov, t.j. dobrému klientovi model predikoval vyššiu pravdepodobnosť zlyhania než zlému, a nt je počet takých párov, kde dobrý klinet má predikovanú rovnakú pravdepodobnosť zlyhania ako zlý. Ďalšia miera diskriminačnej sily modelu podobná ROC krivke je CAP krivka (Powercurve). Rozdiel je v tom, že na os x namiesto distribučnej funkcie nezlyhaných prípadov nanášame distribučnú funkciu všetkých prípadov. CAP krivka môže byť interpretovateľná nasledovne (viď. obr. č. 3.4): y% z prípadov, ktoré skutočne zlyhali počas 12 mesačného horizontu môžeme nájsť medzi najhoršie ohodnotenými x% prípadov v portfóliu. Na našom príklade to znamená, že približne 80% z neskôr zlyhaných prípadov je medzi najhoršie ohodnotenými 30% prípadov v portfóliu (ratingové triedy 5 až 10). Ideálny ratingový model by priradil všetkým zlyhaným klientom (a len tým) najhoršiu ratingovú triedu. Táto ratingová trieda by potom obsahovala presný podiel p zo všetkých prípadov, s p rovným pozorovanej miere zlyhania v celom portfóliu. Pre ideálny ratingový model by CAP krivka išla z bodu (0, 0) do bodu (p, 1) (čiarkovaná čiara na obrázku) a odtiaľ do (1, 1). Geometricky definovaná miera diskriminačnej sily existuje aj pre CAP krivku: Gini koeficient (Gini Coefficient). Gini koeficient vypočítame ako podiel plochy medzi CAP krivkou skúmaného modelu a diagonálou Smodel a plochy medzi CAP krivkou ideálneho modelu a diagonálou Sideal: GINI = Smodel Sideal . Medzi Gini koeficientom a mierou AUC platí nasledujúci vzťah: GINI = 2 ∗ AUC − 1. Hraničné hodnoty pre GINI koeficient sú rôzne a ich hodnota závisí jednak na type modelu (aplikačný skóring, model pre firemných klientov apod.) a tiež 3. Validácia skóringových modelov 45 Obr. 3.4: Tvar CAP krivky na ilustračnom príklade na úrovni, na ktorej Gini koeficient skúmame (na úrovni modelu, submodelu, faktorov). Zväčša sa v praxi požaduje, aby GINI dosahoval aspoň 60%. Podľa [10] by GINI u viacrozmerných modelov logistickej regresie mal dosahovať približne 60-70%1 . GINI koeficient je rovný už popisovanie miere asociácie, a to Somerovmu D. 3.1.2 Pietra Index, Kolmogorov-Smirnov test Pietra Index je definovaný ako maximum rozdielu distribučných funkcií dobrých a zlyhaných prípadov: PietraIndex = max(Fbads − Fgoods) Pietra Index sa využíva pre Kolmogorov-Smirnov test, ktorý testuje zhodnosť dvoch distribučných funkcií Fbads a Fgoods . Testujeme nulovú hypotézu: H0 : Fgoods = Fbads. Ak PietraIndex ≥ Dq Np(1 − p) , potom zamietame H0 na hladine spoľahlivosti q, pričom N značí celkový počet prípadov, p je pozorovaná miera zlyhania a hodnotu Dq na hladine významnosti q získame z tabuľky Kolmogorovho rozdelenia2 . 1 viď. [10] str. 109, (Chart 60) 2 viď napr. [10], str. 110 (Chart 61) 3. Validácia skóringových modelov 46 3.1.3 Informačná hodnota Výpočet informačnej hodnoty (Information Value, IV) pre danú premennú prebieha v dvoch krokoch. V prvom kroku sa počíta WOE (Weight of Evidence), v druhom IV. Predpokladajme, že hodnota premennej patrí vždy do jednej z tried (kategórií) i = 1, . . . , n. Pre každú triedu sa WOEi počíta podľa vzorca: WOEi = ln goodi good badi bad , kde i = 1, . . . , n pričom goodi označuje počet nezlyhaných prípadov v triede i, good počet všetkých nezlyhaných klientov atď. Záporná hodnota WOEi znamená, že klienti s hodnotou premennej v triede i majú väčšiu pravdepodobnosť zlyhania ako priemerní klienti. Vysoká pozitívna hodnota naopak indikuje nízke riziko. Na základe znižujúcej sa pravdepodobnosti zlyhania sa potom jednotlivým kategóriam priraďujú vyššie body (skóre). Dobrú predikčnú schopnosť majú premenné s veľkým rozptylom WOE (viď obr. č. 3.5). V prípade, že dve triedy majú malý rozdiel WOE zvyknú sa zlučovať do jednej (kategória danej premennej je nevýznamná z pohľadu pravdepodobnosti zlyhania). Ak WOE nemá logický tred (viď obr. č. 3.6) premenná s daným rozdelením do kategórií nemá v modeli opodstatnenie. Informačná hodnota danej premennej sa potom vypočíta s využitím WOEi: IV = n i=1 goodi good − badi bad ∗ WOEi. Predikčná sila premennej na základe Informačnej hodnoty sa hodnotí pomocou pravidiel 3 : • menej ako 0,02: premenná nemá predikčnú schopnosť • 0,02-0,1: slabá predikčná schopnosť • 0,1-0,3: stredne dobrá predikčná schopnosť • nad 0,3: silná predikčná schopnosť 3 viď. [2], str. 81 3. Validácia skóringových modelov 47 Obr. 3.5: Logický tred WOE pre premennú vek (ilustračný príklad) Obr. 3.6: Nelogický tred WOE pre premennú vek (ilustračný príklad) 3.2 Testovanie stability Účelom testov stability je identifikovať a vyhodnotiť zmeny v populácii, ktorá je daným modelom hodnotená alebo zmeny v externom prostredí. V prípade identifikovania významných zmien v populácii je potrebné hlbšie skúmať zdroj zmien a pristúpiť na úpravu modelu. V rámci testovania stability sa kontroluje aj korelácia jednotlivých faktorov. V prípade zistenia pretrvávajúcej absolútnej hodnoty vzájomnej korelácie ≥ 0, 50 je indikovaná potreba úpravy modelu. V rámci stability sa skúma rozdelenie počtu prípadov v ratingových triedach, pričom sa zameriava najmä na koncentráciu prípadov v jednotlivých ratingových triedach v porovnaní tohto rozdelenia s normálnym rozdelením. 3. Validácia skóringových modelov 48 Ak je identifikovaná vysoká koncentrácia v niektorej ratingovej triede (najmä ak pretrváva v čase), taktiež býva potrebná úprava modelu. 3.2.1 System Stability Index Zmenu rozdelenia súčasného portfólia a portfólia v predchádzajúcom období meriame pomocou indexu stability, ktorý vypočítame podľa vzorca: K k=1 Nk,t Nt − Nk,t−1 Nt−1 ∗ ln Nk,t Nt Nk,t−1 Nt−1 , kde Nk,t−1 predstavuje počet prípadov v ratingovej triede k (k = 1, . . . , K) v kroku t a Nt počet všetkých prípadov v kroku t. Hodnota indexu menšia alebo rovná 0,1 znamená, že nenastal takmer žiadny posun rozdelenia počtu prípadov v ratingových triedach. Hodnota väčšia ako 0,1 a menšia alebo rovná 0,2 značí určitý posun rozdelenia a hodnota indexu väčšia ako 0,2 hovorí o výraznom posune rozdelenia. 3.3 Testovanie kalibrácie Testy kalibrácie býva potrebné vykonať v prípade, že výstup modelu je resp. má byť použitý priamo pre priradenie pravdepodobnosti zlyhania. Jej účelom je vyhodnotiť zhodu medzi pravdepodobnosťou zlyhania predikovanou modelom a skutočnou pozorovanou mierou zlyhania klientov spadajúcich do danej kategórie hodnotenia. Pre vyhodnotenie správnosti kalibrácie by mala byť použitá aspoň jedna kvantitatívna metóda na úrovni celkovej kalibrácie a aspoň jedna kvantitatívna metóda na úrovni jednotlivých tried hodnotenia. V prípade, že pozorované miery zlyhania sú významne vyššie oproti predpovedaným pravdepodobnostiam zlyhania, musí byť vykonaná rekalibrácia modelu. Rekalibrácia modelu môže byť vykonaná aj v prípade, že pozorované miery zlyhania sú významne nižšie oproti predikovaným pravdepodobnostiam zlyhania. 3.3.1 Brier score, Reliability diagram Priemerná kvadratická odchýlka odhadnutej pravdepodobnosti zlyhania a pozorovaného zlyhania jednotlivých klientov sa kvantifikuje prostredníctvom Brier score: BS = 1 N N j=1 (PDj − yj)2 , kde yj = 1, ak klient j zlyhal yj = 0, ak klient j nezlyhal, 3. Validácia skóringových modelov 49 kde N je počet klientov a PDj odhadovaná pravdepodobnosť zlyhania klienta j. Platí BS ∈ 0, 1 . Čím je hodnota BS bližšie k nule, tým je odhad pravdepodobnosti zlyhania v celej ratingovej škále lepší. Ďalšiu informáciu o kvalite kalibrácie poskytuje Reliability diagram. Krivka kalibrácie (viď obr. č. 3.7) zobrazuje pozorovanú pravdepodobnosť zlyhania oproti odhadovanej pravdepodobnosti zlyhania v každej ratingovej triede. Dobre kalibrovaný model by mal všetky body krivky kalibrácie blízko diagonály. Ak by bol skúmaný model ideálny, potom by všetky body krivky kalibrácie ležali presne na diagonále. Obr. 3.7: Reliability Diagram (ilustračný príklad) 3.3.2 Normálny test Normálny test slúži na overenie zhody pozorovaných pravdepodobností zlyhania v danej ratingovej triede za viac období a odhadnutej pravdepodobností zlyhania v tejto ratingovej triede. Predpokladajme, že zlyhania v jednotlivých ratingových triedach sú navzájom nezávislé. Testuje sa nulová hypotéza: H0 pozorované DRk,t v danej ratingovej triede k sú v rokoch t = 1, . . . , T zhodné s odhadovanou PDk,t . H1 pozorovaná DRk,t v danej ratingovej triede k je v niektorom roku t výrazne väčšia ako odhadovaná PDk,t. 3. Validácia skóringových modelov 50 Ak platí nerovnosť: T t=1 (DRk,t − PDk,t) σk √ T > Φ−1 (1 − α), potom zamietame H0 na hladine spoľahlivosti α. To znamená, že pozorovaná pravdepodobnosť zlyhania je v niektorom období signifikantne väčšia ako odhadnutá pravdepodobnosť zlyhania v tejto ratingovej triede, t.j. odhadnutá pravdepodobnosť zlyhania je podhodnotená a v skutočnosti by mala byť väčšia. Odhad rozptylu vypočítame podľa vzorca: ˆσ2 k = 1 T − 1   T t=1 (DRk,t − PDk,t)2 − 1 T T t=1 (DRk,t − PDk,t) 2   DRk,t značí pozorovanú pravdepodobnosť zlyhania v raingovej triede k v období t, PDk,t odhadnutú pravdepodobnosť zlyhania v ratingovej triede k v období t a Φ−1 (1 − α) je (1 − α) - kvantil štandardného normálneho roz- delenia. Kapitola 4 Praktická časť 4.1 Popis a príprava dát V praktickej časti sa zameriam na aplikáciu logistickej regresie na skutočné dáta. Mojím cieľom bude vytvoriť aplikačný model pre odhadovanie podmienenej pravdepodobnosti zlyhania klienta v závislosti na vyplnených údajoch v žiadosti o úver. Využijem rôzne selekčné metódy a k analýze kvality či diskriminačnej sily modelov použijem testy predstavené v teoretickej časti. Reálne dáta úverových inštitúcií sú pochopiteľne veľmi obtiažne dostupné. Zdrojom dát, ktoré použijem je internet1 . Ide zrejme o dáta nejakej nemeckej úverovej inštitúcie. Dátový súbor obsahuje 30 charakteristík pre 1000 minulých žiadateľov o úver. U každému žiadateľa existuje informácia, či tento klient je dobrý (700 prípadov, kde klient je úverovo spôsobilý) alebo zlý (300 prípadov, kedy klient zlyhal pri splácaní úveru). Niektoré premenné sú numerické, väčšina je však už kategoriálnych. Pôvodné dáta som trochu upravila, a to tak, že 6 povôdne binárnych vysvetľujúcich premenných (typu 1 ak áno, 0 ak nie) týkajúcich sa účelu úveru so spojila do jednej kategoriálnej premennej (PURPOSE). Rovnakú úpravu som urobila aj pri troch premenných ohľadom kombinácie pohlavia a stavu (GENDER+MARITAL STATUS). Zostalo mi teda 23 vysvetľujúcich premenných a modelovaná premenná (RESPONSE). Obsah upraveného dátového súboru je popísaný v tabuľke 4.1. Pre odhad parametrov logistického modelu využijem procedúru LOGIS- TIC2 v systéme SAS Enterprise Guide 4.1 (ďalej len SAS). 1 viď. [15] 2 Syntax procedúry viď. SAS kódy v prílohe. 51 4. Praktická časť 52 Tabuľka 4.1: Popis súboru dát pre aplikačný skóring Názov a popis premennej Hodnota CH ACCT=stav na bež. účte kateg. <0 EUR 0 > 0 < 200 EUR 1 ≥ 200 EUR 2 nezmáme 3 DURATION=dĺžka úveru v mesiacoch numer. HISTORY=úverová história kateg. žiadne úvery 0 všetky úvery splatené riadne 1 existujúce zatiaľ spláca riadne 2 omeškanie v splácaní v minulosti 3 kritický účet 4 PURPOSE=účel úveru kateg. rekvalifikácia 1 vzdelanie 2 elektronika 3 bytové zariadenie 4 použ. auto 5 nové auto 6 AMOUNT=výška úveru numer. SAV ACCT=priem. zostatok depozít kateg. < 100 EUR 0 ≥ 100 < 500 EUR 1 ≥ 500 < 1000 EUR 2 ≥ 1000 EUR 3 nezmáme 4 EMPLOYMENT=doba v súčas. zamestnaní kateg. nezam. 0 < 1rok 1 ≥ 1 < 4 r. 2 ≥ 4 < 7 r. 3 ≥ 7 r. 4 INSTALL RATE=miera splátok (% z príjmu) numer. GENDER+MARITAL STATUS=pohl.+stav kateg. muž rozvedený 0 muž slobodný 1 muž ženatý al. vdovec 2 žena 3 4. Praktická časť 53 CO-APPLICANT=má spolužiadateľa binár. áno/nie 1/0 GUARANTOR=má ručiteľa binár. áno/nie 1/0 TIME RES=doba súčas. bydliska kateg. ≤ 1 rok 0 > 1 ≤ 2 r. 1 > 2 ≤ 3 r. 2 > 4 r. 3 REAL ESTATE=vlastní nehnuteľ. binár. áno/nie 1/0 PROP NONE=nemá majetok binár. áno/nie 1/0 AGE=vek numer. OTHER INSTALL=má ďalšie splátkové úvery binár. áno/nie 1/0 RENT=platí nájomné binár. áno/nie 1/0 OWN RES=má byt binár. áno/nie 1/0 NUM CREDITS=počet exist. úverov numer. JOB=druh zamest. kateg. nezamest. 0 nekvalif. práca 1 kvalif. práca 2 manažment 3 NUM DEPEND=počet vyživ. osôb numer. TELEPHONE=uviedol telef. binár. áno/nie 1/0 FOREIGN=pracuje v cudzine binár. áno/nie 1/0 RESPONSE=úverová spôsobilosť binár. áno/nie 1/0 4. Praktická časť 54 4.2 Tvorba modelu hodnotenia úverovej spôsobilosti -postupy a výsledky Po zahájení vývoja a stanovení cieľov modelu, by sme mali pristúpiť v rámci prípravy dát k identifikácii možných nevieryhodných údajov, nezmyselných hodnôt apod. Problém sa vyskytol u premennej INSTALL RATE. V popise dát sa uvádza, že ide o numerickú premennú, ktorá predstavuje mieru splátok ako percentuálnu časť z disponibilného príjmu. Keby sme sa však pozreli priamo do dát, videli by sme, že nadobúda hodnoty len 1,2,3 alebo 4. Vyzerá to teda skôr, že táto premenná je taktiež zatriedená do kategórií. Aj na úkor straty možných informácií získaných z tejto premennej, ju z dôvodu nevieryhodných informácií vylúčime z modelu. Ďalšie vylučovanie premenných z celkového zoznamu môže nastať v procese jednorozmernej analýzy. Zistíme preto, ktoré vysvetľujúce premenné vykazujú s modelovanou premennou vzťah, ktorý nie je v súlade s logickými očakávaniami. Pre tento účel si ako prvý zostrojíme zjednudušený model, kde budeme predpokladať, že všetky premenné sú kvantitatívne a pozrieme sa na výsledky logistickej regresie (viď. obr. 4.1). Vo výsledkoch nepozorujeme žiadnu výraznú hodnotu šancí, nebudeme preto nič vylučovať. Môžeme konštatovať, že šance klienta zlyhať v porovnaní s možnosťou byť dobrým klientom sa zvyšujú v závislosti od vzrastu premennej RENT v priemere 2,162-krát, resp. sú približne 2:1. Čo je v súlade s očakávaním. Ak klient musí vynakladať finančné prostriedky na nájom, pravdepodobnosť zlyhania rastie. Podobne šance na zlyhanie sa pri vzraste premennej o 1 meraciu jednotku zvyšujú trochu aj napríklad pre splatnosť úveru, počet vyživovaných osôb, počet existujúcich úverov, ak má klient ďalšie splátkové úvery atď. Opačne asi najvýraznejšie sú šance na zlyhanie nižšie, ak klient pracuje v zahraničí, či s rastúcim množstvom peňazí na účte. V nasledujúcom kroku by sme mali skontrolovať, či niektoré faktory nie sú navzájom silne korelované. Po zostrojení korelačnej matice som objavila silnú koreláciu navzájom medzi trojicou premenných PROP NONE, RENT, a OWN RES (PROP NONE vs. OWN RES 0,73 PROP NONE vs. RENT 0,66 a OWN RES vs. RENT 0,87). Rozhodla som sa teda vylúčiť premenné PROP NONE a OWN RES (ozn. x pred názvom na obr. 4.1) nakoľko nie sú podľa logického úsudku významné. Kedže konštruujeme aplikačný model pre nových žiadateľov zrejme o druh spotrebného úveru (na auto, bytové zariadenie atď.) nemalo by zohrávať rolu, či klient má/nemá byt alebo iný majetok. Spotrebné úvery sú zväčša nezabezpečené úvery, klient neručí svojou nehnuteľnosťou, a preto pre nás pri tomto modelovaní nie sú dôležité. To, či klient platí nájom a má teda mesačné výdavky vyššie, môže mať v našom modeli 4. Praktická časť 55 Obr. 4.1: Odhad pomeru šancí pri jednorozmernej analýze význam. Preto, a aj na základe najvyššej významnosti pri teste pomerom šancí, som ponechala v zozname len premennú RENT. Tu sa nám naskytla ukážka nutnosti riadiť sa nielen podľa čísiel, ale predovšetkým je kľúčové poznať obchodné procesy v pozadí. Preto úlohy okolo samotnej prípravy dát zohrávajú veľmi dôležitú rolu a realite zaberajú aj 70-80% času. Analýzou WOE, t.j. či sú dáta vhodne rozdelené do jednolivých kategórií sa zaoberať nebudem, nakoľko pôvodné nominálne hodnoty dát k dispozícii nie sú. Pri nastavení jednotlivých kategórií a prislúchajúcich skóre bodov zohráva takisto veľkú váhu expertná mienka. Ďalším cieľom pri viacrozmernej analýze je vyvinúť model pozostávajúci z najrelevantnejších faktorov skombinovaných takým spôsobom, aby sme dosiahli pokiaľ možno čo najvyššiu diskriminačnú silu. Vytvoríme si model viacnásobnej regresie so zostávajúcimi 20 vysvetľujúcimi premennými. Pre- 4. Praktická časť 56 menné DURATION, AMOUNT, AGE, NUM CREDITS a NUM DEPEND zaradíme ako kvantitatívne premenné (Quantitative Variables), lebo sú spojité a zvyšné kategoriálne premenné ako klasifikačné (Classification Variables). Skúsime postupne použiť všetky selekčné metódy Stepwise, Forward aj Backward. Hladinu významnosti pre zaraďovanie aj odoberanie premenných z modelu som nastavila na štandardne používaných 0,05. Výsledky môžno zhrnúť do nasledovných bodov: Ukazujú, že z 20 premenných je významných 10 (viď. obr. 4.2). Pri Stepwise metóde sa v žiadnom kroku žiadna premenná nevylúčila, preto má výsledky identické s Forward metódou. Zmenu výsledkov nespôsobila ani zmena linkovej funkcie z logitu na probit. Ako najrelevantnejšie premenné pre modelovanie pravdepodobnosti zlyhania u klientov čerpajúcich jeden zo spotrebných úverov sa javia postupne premenné CHK ACCT a DURATION. Boli zaradené do logistického modelu v prvom a druhom kroku selekčnej metódy Forward či Stepwise. Obr. 4.2: Výsledok Stepwise aj Forward selekcie Vzťah nelineárneho charakeru dokazuje vykreslená S-krivka (pre CHK ACCT viď. obr. 4.3). Vidíme, že s rastom peňažných prostriedkov na bežnom účte modelovaná pravdepodobnosť zlyhania klesá. 4. Praktická časť 57 Obr. 4.3: S-krivka pre faktor CHK ACCT Významnosť prvých faktorov zaradených do modelu je možné posúdiť z najvyšších hodnôt Waldových chí-kvadrát štatistík (obr. 4.2). Postup výpočtu Waldových štatistík si ukážeme na jednom príklade pre parameter DURATION (obr. 4.4): Wj = ˆβj SE( ˆβj) = 0, 0448 0, 00709 . = 6, 318 ⇒ W2 j . = 39, 92 Bodový odhad pomeru šancí (obr. 4.5) pre premennú DURATION vypočítame takto: e0,0448 . = 1, 046. Obr. 4.4: Výpočet Waldovej chí-kvadrát štatistiky 4. Praktická časť 58 Obr. 4.5: Výpočet pomerov šancí Bodový odhad šancí je procedúrou LOGISTIC štandardne odhadovaný pri jednotkovej zmene kvantitatívnej nezávisle premennej (spomínané už pri jednorozmernej analýze). Príkazom UNITS je však možné toto aj zmeniť. V mojom prípade som pre splatnosť úveru požadovala zmenu meracej jednotky o 6 mesiacov (obr. 4.6). Podobne u klasifikačných premenných sa s ohľadom na interpretáciu uprednostňuje voliť štýl kódovania Reference. Potom odhadnutý parameter vyjadruje bodový odhad priemernej zmeny modelovaného logitu v dôsledku jednotkovej zmeny úrovne klasifikačnej nezávisle premennej oproti jej základnej, resp. referenčnej úrovni. Na našom príklade to napr. pre klasifikačnú premennú RENT (viď. 4.4) znamená: parameter -0,5299 predstavuje pokles modelového logitu o túto hodnotu pri zmene úrovne RENT z referenčnej 1 na 0. Ak klient neplatí nájom, logit šance, že zlyhá, sa zníži v priemere o -0,5299 (v porovnaní s klientom, ktorý má výdavky na nájom). Obr. 4.6: Bodové odhady pomeru šancí pre rôzne jednotky Backward metóda najprv zaradila do modelu všetky premenné a postupne vyraďovala nevýznamné. Ako najmenej významná premenná bola v prvom kroku vylúčená premenná JOB, pretože p-hodnota pre Waldov chí-kvadrát test nadobudla oveľa vyššiu hodnotu (0,8575) ako α = 0, 05 (viď. obr. č. 4.7). Všetky tri metódy sa zhodli na rovnakom modeli s 10 premennými. Pozrieme sa preto ďalej na jeho kvalitu. Začneme asociáciou medzi predikovanou pravdepodobnosťou zlyhania a pozorovanými hodnotami. Ako sme spomínali, pre kvalitu modelu je dôležité najmä percento zhodných párov (Percent Concordant). Vyjadruje percento takých dvojíc, kde dobrému klientovi (RESPONSE=1) model predikoval nižšiu pravdepodobnosť zlyhania než zlému žiadateľovi. V našom prípade je 81,7% (obr. 4.8). Celková vhod- 4. Praktická časť 59 Obr. 4.7: Sumár vyradených premenných pri Backward selekcii Obr. 4.8: Miery asociácie nosť modelu z hľadiska diskriminačnej sily je daná hodnotou štatistiky c, ktorá dosahuje 81,8%. GINI koefiecient vyčítame z premennej Somerovo D. Dosahuje taktiež požadovanú hladinu 60-70%, konkrétne 63,5%. Počet vysvetľujúcich premenných modelu (10) je pomerne vysoký. Podľa odporúčaní by sme v modeli mali mať asi 8 vysvetľujúcich faktorov (28 = 256). Zaradenie posledných dvoch faktorov by preto bolo najmä na zvážení expertov. Teraz však ich zaradenie kvantitatívne zvyšuje kvalitu modelu, čo môžeme vyčítať z postupne nižších hodnôt mier kvality (AIC a −2 ln(l)) pri pridaní týchto premenných do modelu (viď. obr. 4.9). Kvalitu modelu zhodnotíme aj z klasifikačnej tabuľky (viď. obr. 4.10), kde som ako prahovú hodnotu zvolila predikovanú pravdepodobnosť zlyhania 0,5. Potom by model správne zamietol 149 z 300 klientov (Sensitivity =49,7%) a správne schválil 612 zo 700 (Specifity = 87,4%). Voľba prahovej cut-off hod- 4. Praktická časť 60 Obr. 4.9: Miery kvality v posledných 2 krokoch Stepwise selekcie noty je opäť podmienená najmä obchodným cieľom danej spoločnosti. Obr. 4.10: Klasifikačná tabuľka pre prahovú hodnotu 0,5 Výstupom nášho modelu je pravdepodobnosť zlyhania žiadateľa o spotrebný úver v závislosti od charakteristík tohto klienta a prokuktu. Táto predikovaná pravdepodobnosť nadobúda hodnoty od 0 do 1, je však ovplyvnená zložením vývojovej vzorky dát. Jej priemer cez všetky pozorovania odpovedá pozorovanej miere zlyhania 300/1000 =30%. Z môjho pohľadu je to pomerne vysoká miera zlyhania. U spotrebných úverov, napríklad v porovnaní so zabezpečenými hypotekárnymi úvermi, býva v realite vyššia miera zlyhania, čo sa odzrkadľuje aj na úrokových sadzbách, no nie až toľko. Usudzujem preto, že išlo asi o umelo vytvorenú vzorku. V rámci kalibrácie modelu by tým pádom našou úlohou bolo transformovať PD odhadovanú modelom tak, aby približne odpovedala úrovni skutočne pozorovanej PD v cieľovom portfóliu klientov. Nech skutočné PD v danom portfóliu je napr. 12% (ozn. PDR). K transformácii možno využiť bayesiánske techniky: PDCALIBi = PDLOGi (1 − PDA)PDR (1 − PDLOGi )PDA(1 − PDR) + PDLOGi (1 − PDA)PDR 4. Praktická časť 61 kde PDLOGi je odhadovaná pravdepodobnosť zlyhania pre i-tého klienta (pozorovanie) a PDA je priemerná miera zlyhania cez všetky pozorovania (30%). Na našich dátach to znamená, že napríklad pre 2. klienta vzorky, kde bolo pozorované zlyhanie (RESPONSE=0), vyšla predikovaná pravdepodobnosť zlyhania PDLOG2 . = 66, 65% a modifikovaná PDCALIB2 . = 38, 87% (viď.4.11). Obr. 4.11: Kalibrované PD Záver Cieľom práce bolo priblíženie problematiky skóringových modelov široko používaných v bankovej sfére. Skóring je predovšetkým nástrojom pre riadenie kreditných rizík. Počíta odhad štatistickej pravdepodobnosti zlyhania, tj. že dlžník nebude schopný či ochotný splácať svoje záväzky. V realite ide o predikciu budúceho správania žiadateľa na základe znalostí minulého správania celej skupiny zákazníkov s podobnými vlastnosťami. V práci sme si postupne predstavili všetky kroky dôležité pre proces výstavby skóringových modelov. Nielen počas teoretickej ale aj praktickej časti som dospela k tomu, že kľučovým aspektom pri príprave, analýze a modelovaní dát, či implementácii a interpretácii výsledkov je okrem správnej matematicko-štatistickej koncepcie predovšetkým znalosť obchodnej podstaty dát a bankových procesov v pozadí. V priebehu celej práce som k vysvetleniu postupov používaných pri vývoji kvalitného skóringového modelu pristupovala s ohľadom na pracovné skúsenosti získané v danej oblasti. Verím preto, že cieľ práce sa mi podarilo naplniť a zachytila som podstatu techník a zvyklostí využívaných expertmi v praxi. Praktická časť aplikovala teoreticky preberané poznatky pri vývoji aplikačného modelu pre žiadateľov o spotrebný úver. Poukázala som na to, ako postupovať tak, aby výsledný model bol čo najviac prediktívny, objektívny, konzistentný a profitabilný. 62 Príloha - Syntax SAS kódov použitých pri praktickej časti Model pre jednorozmernú analýzu PROC LOGISTIC DATA=LR.DATA; /* SAS knižnica.názov súboru */ MODEL RESPONSE=CHK_ACCT DURATION HISTORY /* ... atď. všetky premenné */ SELECTION=NONE CORRB /* korelačná matica */ LINK=LOGIT /* nastavenie voľby pre výpočet intervalov spoľahlivosti pre parametre a pomery šancí obidvoma metódami- Likelihood test a Waldov test */ CLPARM=BOTH CLODDS=BOTH ALPHA=0.05; RUN; QUIT; Viacrozmerná analýza PROC LOGISTIC DATA=LR.DATA; CLASS CHK_ACCT (PARAM=REF) /* ... atď. všetky klasifikačné premenné */ MODEL RESPONSE=DURATION AMOUNT AGE NUM_CREDITS NUM_DEPEND CHK_ACCT /* ... atď. všetky klasifikačné premenné */ /* voľba metódy Stepwise so vstupnými a výstupnými hladinami významnosti pre zaraďovanie premenných do modelu 0,05 */ SELECTION=STEPWISE SLE=0.05 SLS=0.05 /* alebo selekčnej metódy Forward so vstupnýnou hladinou 0,05 */ /* SELECTION=FORWARD SLE=0.05 */ /* alebo selekčnej metódy Backward s~výtupnou hladinou 0,05 */ /* SELECTION=BACKWARD SLS=0.05 */ INCLUDE=0 63 4. Praktická časť 64 CTABLE PPROB=(0.5) /* klasifikačná tabuľka */ LINK=LOGIT /* alebo LINK=PROBIT */ CLPARM=BOTH CLODDS=BOTH ALPHA=0.05; UNITS DURATION =6 AGE =5 NUM_CREDITS =1 NUM_DEPEND =1; OUTROC=WORK.EGOUTROC ROCEPS=0.0001 OUTPUT OUT=LR.PREDDATA_STEP /* výstupný súbor s~predikciami PD */ PREDPROBS=INDIVIDUAL; RUN; QUIT; TITLE; TITLE1 ’Regression Analysis Plots’; TITLE4 ’ROC Curve’; /* vykreslenie ROC krivky */ SYMBOL1 I=JOIN V=NONE; GOPTIONS PUBLISH; PROC GPLOT DATA=WORK.EGOUTROC NOCACHE; PLOT _SENSIT_ * _1MSPEC_ = 1 / VAXIS = 0 TO 1 BY 0.1 HAXIS = 0 TO 1 BY 0.1; RUN; QUIT; TITLE; FOOTNOTE; GOPTIONS; /* vykreslenie S-krivky */ SYMBOL1 I=JOIN V=NONE; Axis1 STYLE=1 WIDTH=1 MINOR=NONE; Axis2 STYLE=1 WIDTH=1 MINOR=NONE; TITLE; TITLE1 Scatter Plot; FOOTNOTE; PROC GPLOT DATA=LR.PREDDATA_STEP; PLOT IP_0 * CHK_ACCT / VAXIS=AXIS1 HAXIS=AXIS2 FRAME; MINOR=NONE; RUN; QUIT; TITLE; FOOTNOTE; GOPTIONS RESET=ALL; Zoznam literatúry [1] Hosmer W.D., Lemeshow S.: Applied Logistic Regression 2nd ed.,John Wiley & Sons, Inc. 2000 [2] Siddiqi N.: Credit Risk Scorecards: Developing and Implementing Intelligent Credit Scoring John Wiley & Sons, Inc., 2006 [3] Agresti A.: An Introduction to Categorical Data Analysis John Wiley & Sons, Inc., 1996 [4] Cramer J.S.: Logit Models From Economics and other Fields Cambridge University Press, 2003 [5] Derviz A., Kadlčáková N.: Methodological Problems of Quantitative Credit Risk Modeling in the Czech Economy WP No. 39, Praha, 2001 [6] Basel Committee on Banking Supervision: Studies on the Validation of Internal Rating Systems Working Paper No.14, May 2005, http : //www.bis.org/publ/bcbs wp14.pdf?noframes = 1 [7] Blaha Z.S. Risk Management Techniques: their Use and Applicability in the Banking Sector of the Czech Republic Karolinum Press, Praha 2008 [8] Briš R., Litschmannová N.: Statistika II. Učební text, VŠB Technická univerzita Ostrava, 2007 http : //www.elearn.vsb.cz/archivcd/FEI/STA2/ [9] Stankovičová I., Vojtková M.: Viacrozmerné štatistické metódy s aplikáciami Iura Edition, Bratislava 2007 [10] Rating Models and Validation Oesterreichische Nationalbank http : //www.oenb.at/en/img/rating models tcm16 − 22933.pdf [11] Smernica Európskeho Parlamentu a Rady 2006/48/ES http : //eur − lex.europa.eu/LexUriServ/LexUriServ.do?uri = OJ : L : 2006 : 177 : 0001 : 0200 : SK : PDF [12] Vernerová L.: Matematické modely merania kreditného rizika bánk Diplomová práce, Brno, 2009 [13] Koop G.: Bayesian Econometrics Chichester: Wiley, 2003 [14] Opatrenie NBS č. 4/2007 http : //www.nbs.sk/ img/Documents/LEGS/2007/opat4 − 07.pdf [15] Zdroj dát pre praktickú časť: 65 4. Praktická časť 66 http://iainpardoe.com/teaching/dsc433/data.htm, súbor German.xls [16] http://www.nbs.sk/ [17] http://www.cnb.cz/