V praxi pracujeme s daty nominálními (nabývají pouze dvou hodnot), kategoriálními (nabývají více

Rozměr: px
Začít zobrazení ze stránky:

Download "V praxi pracujeme s daty nominálními (nabývají pouze dvou hodnot), kategoriálními (nabývají více"

Transkript

1 10 Vícerozměrná data - kontingenční tabulky, testy nezávislosti, regresní analýza 10.1 Vícerozměrná data a vícerozměrná rozdělení Při zpracování vícerozměrných dat, hledáme souvislosti mezi dvěma, případně více náhodnými veličinami. V praxi pracujeme s daty nominálními (nabývají pouze dvou hodnot), kategoriálními (nabývají více hodnot bez uspořádání), ordinálními (nabývají více hodnot s uspořádáním) a kardinálními (nabývají více hodnot s uspořádáním a lze měřit rozdíly mezi hodnotami). Pro různé typy dat je třeba používat různé matematické postupy vhodné pro zjišt ování souvislostí a závislostí. Úkolem statistiky je stanovit sílu a druh sledovaných závislostí. Sílu závislosti vyjadřujeme podle různých měr statistických závislostí. Statistická závislost však nevypovídá přímo o kauzalitě. Vysoký stupeň závislosti může ale nemusí odrážet příčinný vztah mezi sledovanými statistickými veličinami. Příčinné souvislosti čistě empirickými prostředky neodhalíme. Ke statistickým výsledkům je třeba přidat odborné znalosti, praktické zkušenosti a účelně kombinovat deduktivní a induktivní způsob uvažování. Existují i jednoznačné funkční závislosti mezi náhodnými veličinami, ty však obvykle nejsou hlavním cílem našeho statistického šetření (např. závislosti založené na fyzikálních zákonech - dodávané teplo zvyšuje energii). Druh statistické závislosti odhadujeme obvykle na základě grafické reprezentace dat. V případě závislosti dvou náhodných proměnných je vyjádřením druhu závislosti křivka, které se nejvíce hodí k napozorovaným hodnotám. Podle typu křivky pak mluvíme o závislosti lineární, logaritmické, exponenciální a podobně. Typ Nominální Ordinální Kardinální proměnné Nominální kontingenční tabulky kontingenční tabulky, probitová, logitová regrese, 2x2, nezávislost, homogenita loglineární modely kontingenční tab- výběru, ulky, kontingenční koefi- symetrie, rezidua, cienty grafická reprezentace, znaménková schémata, míry asociace Ordinální Spearmanův korelační analýza rozptylu koeficient, Kendallovo τ Kardinální korelace, korelační koeficienty, regresní analýza 10.2 Kontingenční tabulky Kontingenční tabulka se užívá k přehledné vizualizaci vzájemného vztahu dvou statistických znaků. V praxi vzniká kontingenční tabulka tak, že se na statistických jednotkách sledují dva znaky. Řádky kontingenční tabulky odpovídají možným hodnotám prvního znaku, sloupce pak možným hodnotám druhého znaku. V příslušné buňce kontingenční tabulky je pak zařazen počet případů, kdy zároveň měl první znak hodnotu odpovídající příslušnému řádku a druhý znak hodnotu odpovídající příslušnému sloupci. 1

2 Je možné, aby jeden řádek či sloupec odpovídal více možným hodnotám znaku. To se děje v případě, kdy znak nabývá některých hodnot příliš zřídka, takže je vhodné spojit více možných hodnot. Součty (mezisoučty) všech hodnot v každém řádku, resp. sloupci nesou informaci o počtu výskytů jevů, při nichž nabyl první (resp. druhý znak) příslušné hodnoty bez ohledu na hodnotu druhého (resp. prvního) znaku. Kromě prostého popisu četností kombinací hodnot dvou znaků nabízí kontingenční tabulka možnost testovat, zda mezi oběma znaky existuje nějaký vztah. K tomu lze užít např. test dobré shody. Znaky užité k zobrazení v kontingenční tabulce pak musí představovat diskrétní hodnoty (je možné tedy využít kvalitativní, diskrétně kvantitativní či spojitě kvantitativní znaky, v posledním případě však pouze s rozdělením jednotlivých znaků do skupin tzv. skupinové třídění). Teoretickým základem kontingenčních tabulek jsou matice pravděpodobností pro dvourozměrné náhodné vektory. Kontingenční tabulka 1... c Σ 1 n n 1c n 1 2 n n 2c n r n r1... n rc n r Σ n 1 n 2 n c n Matice pravděpodobností 1... c Σ 1 p p 1c p 1 2 p p 2c p r p r1... p rc p r Σ p 1 p 2 p c 1 Necht náhodný vektor X = (X 1, X 2 ) má diskrétní rozdělení, přičemž veličina X 1 nabývá hodnot i = 1, 2,..., r a veličina X 2 nabývá hodnot j = 1, 2,..., s. Označme p ij = P (X 1 = i, X 2 = j) ; p i = j p ij ; p j = i p ij. Předpokládejme, že se uskutečnil náhodný výběr rozsahu n z tohoto rozdělení. Necht n ij je počet těch případů, kdy se ve výběru vyskytla dvojice (i, j). Náhodné veličiny n ij mají pak sdružené multinomické rozdělení s parametrem n a s pravděpodobnostmi p ij. Matice (p ij ),2,...,r;j=1,2,...,s se nazývá matice pravděpodobností a matice (n ij ),2,...,r;j=1,2,...,s tvoří základ kontingenční tabulky. Označme n i = n ij ; j n j = n ij. i Číslům p i a p j se říká marginální pravděpodobnosti a hodnotám n i a n j marginální četnosti. Namísto dvou znaků lze sledovat obecně libovolné množství znaků. Kontingenční tabulka se pak tvoří pomocí stejného principu (v každém políčku je počet výskytů kombinací určitých hodnot jednotlivých 2

3 znaků), avšak není již možné ji tak snadno znázornit. Ve vícerozměrné tabulce lze testovat mnohem víc typů závislostí mezi jednotlivými znaky, testování je však technicky mnohem komplikovanější než u dvojrozměrné tabulky V programu Excel máme možnost vytvořit kontingenční tabulku pomocí příkazu COUNTIFS(oblast1;podminka1;obl Testy nezávislosti Nejčastější úlohou při analýze kontingenčních tabulek, je problém testování nezávislosti. Vzhledem k tomu, že dvě veličiny X, Y jsou nezávislé právě tehdy, když platí p ij = p i p j pro všechna i, j, formulujeme nulovou hypotézy testu nezávislosti v kontingenční tabulce ve tvaru H 0 : p ij = p i p j, i = 1, 2,..., r, j = 1, 2,..., s Testovací kritérium má tvar χ 2 = r ( s nij n in j j=1 a při platnosti nulové hypotézy ma asymptoticky rozdělení χ 2, jehož počet stupňů volnosti je roven ν = rs (r + s 2) = (r 1)(s 1). Pokud hodnota testovacího kritéria χ 2 χ 2 (r 1)(s 1)(α). zamítáme hypotézu o nezávislosti veličin X a Y. Ke shodě s limitním rozdělením se požaduje, aby teoretické četnosti n in j byly větší než 5. Není-li n tato podmínka splněna, je nutno sloučit některé sloupce, případně řádky v kontingenční tabulce. Analogicky postupu pro test nezávislosti v kontingenční lze postupovat v případě testování homogenity multinomického rozdělení. Tento přístup uplatníme v okamžiku, kdy marginální řádkové četnosti jsou pevně stanoveny a i t řádek v kontingenční tabulce má multinomické rozdělení s parametry n i, q i1, q i2,..., q is, kde q i1, q i2,... jsou nějaké pravděpodobnosti splňující podmínku q i1 +q i2 + +q is = 1. Hypotéza homogenity pak říká, že pravděpodobnosti q i1, q i2,... nezávisí na řádkovém indexu i. Testovací kritérium a kritické hodnoty jsou pro tento test identické s veličinami pro test nezávislosti Korelační koeficienty Korelační koeficienty se nejčastěji používají k měření síly (těsnosti) závislosti dvou číselných proměnných. Pearsonův korelační koeficient r xy je definován vztahem Spearmanův korelační koeficient rs měří závislost dvou pořadí Regresní analýza Regrese je snad nejčastěji používaná statistická metoda. Regrese se zabývá problémem vysvětlení změn jedné náhodné veličiny (vysvětlovaná, závislá, endogenní proměnná, regresand) na jedné nebo více jiných veličinách (regresory, vysvětlující proměnné, exogenní proměnné). V případě, že závislost je popsána lineárními vztahy, mluvíme o lineárním regresním modelu. Pokud modelujeme chování n i n j n n ) 2 3

4 vysvětlované proměnné pomocí jedné vysvětlující proměnné, mluvíme o jednoduché regresi, v opačném případě se jedná o regresi vícenásobnou. Označme X nezávisle proměnné a Y závislou proměnnou. Regresní funkcí se pak rozumí µ(x) = E (Y X = x). Regresní funkce tedy udává, jaká je střední hodnota náhodné veličiny Y při dané hodnotě x Jednorozměrný lineární regresní model y = β 0 + β 1 x + ε Předpokládejme, že máme k dispozici x i, i = 1, 2,..., n pevných (nenáhodných) hodnot proměnné X. Předpokládejme, že platí y i = f(x i, β 0, β 1,..., β k ) + ε i kde β 0, β 1..., β k jsou neznámé parametry modelu; ε i jsou náhodné veličiny, který modelují nesystematické chyby měření; y i jsou realizace náhodné veličiny Y s podmínkami X = x i. Cílem regresní analýzy je odhadnout parametry β 0, β 1..., β k tak, aby f(x i, β 0, β 1,..., β k ) co nejvíce odpovídala k empiricky naměřeným hodnotám y i. Funkce y i = f(x i, β 0, β 1,..., β k ) se nazývá teoretická regresní funkce závislosti proměnné y na x, její grafické vyjádření se nazývá teoretická regresní křivka. Regresní funkce, v níž jsou nahrazeny neznámé parametry β jejich odhady β (resp. b) se nazývá empirická regresní funkce a její grafické obraz je empirická regresní křivka. Pro hodnoty x i můžeme na základě empirické regresní křivky určit hodnotu ŷ i = f(x i, β 0, β 1,..., β k ), tyto hodnoty nazýváme vyrovnanými hodnotami y i a rozdíl mezi y i ŷ i nazýváme rezidua (značíme e i ). Regresní funkce se nazývá lineární, je-li lineární funkcí neznámých parametrů, tj. pokud y i = β 0 + β 1 ϕ 1 (x) + β 2 ϕ 2 (x) + + β k ϕ k (x) kde ϕ 1 (x), ϕ 2 (x),..., ϕ k (x) jsou funkce proměnné x. Příkladem lineárních regresních modelů jsou přímková regrese tvaru y i = β 0 + β 1 x i + ε i kvadratická regrese tvaru y i = β 0 + β 1 x i + β 2 x 2 i + ε i polynomická regrese tvaru y i = β 0 + β 1 x i + β 2 x 2 i + + β k x k i + ε i hyperbolická regrese tvaru y i = β 0 + β 1 1 x i + ε i 4

5 Metoda nejmenších čtverců Princip metody nejmenších čtverců je založen na jednoduchém volbě optimalizačního kritéria, kdy minimalizuji kvadrát odchylek naměřených y i a vyrovnaných hodnot ŷ i. Y (x i, y i ) (x i, ŷ i ) X Označme funkci Q(β 0, β 1, β 2,..., β k ) = (y i f(x i, β 0, β 1, β 2,..., β k )) 2. Při metodě nejmenších čtverců (MNČ, LSQ) hledáme hodnoty b 0, b 1, b 2,..., b k, ve kterých je funkce Q minimální, tj. b 0, b 1,..., b k = argmin Q (β 0, β 1,..., β k ). β 0,β 1,...,β k V případě lineární regresní funkce má kriteriální funkce Q tvar Q(β 0, β 1,..., β k ) = (y i β 0 β 1 ϕ 1 (x i )... β k ϕ k (x i )) 2 a tato funkce nabývá svého minima v bodech, kdy derivace je rovna nule, tj. při hledání minima řešíme soustavu k + 1 lineárních rovnic tvaru Q β j = 0 pro j = 0, 1, 2,..., k βj =b j Soustava normálních rovnic má tedy tvar b 0 n +b 1 ϕ 1 (x i ) + + b k b 0 ϕ 1 (x i ) +b 1 ϕ 1 (x i )ϕ 1 (x i ) + + b k... ϕ k (x i ) = y i ϕ 1 (x i )ϕ k (x i ) = ϕ 1 (x i )y i b 0 ϕ k (x i ) +b 1 ϕ k (x i )ϕ 1 (x i ) + + b k ϕ k (x i )ϕ k (x i ) = ϕ k (x i )y i 5

6 Přímková regrese Uvažujme tento základní jednoduchý model Y i = β 0 + β 1 x i + ε i. Derivace funkce Q(β 0, β 1 ) (y i β 0 β 1 x i ) 2 mají tvar b 0 n +b 1 b 0 x i +b 1 a řešením výše uvedených soustav dostáváme x i = (x i ) 2 = y i x i y i b 0 = y i b 1 = (x i ) 2 n x i ( n n (x i ) 2 n n n x i y i n ) 2 x i x i y i ( n n (x i ) 2 n x i y i ) 2. x i Vícerozměrný lineární regresní model y = β 0 + β 1 x 1 + β 2 x β k x k + ε a jeho maticový zápis Pro vícerozměrný lineární model je vhodné použít maticový zápis modelu y 1 x (0)1 x (1)1... x (k)1 β 0 y 2. = x (0)2 x (1)2... x (k)2 β ɛ 2. y n x (0)n x (1)n... x (k)n β k ɛ 1 ɛ n y = (y 1, y 2,..., y n ) T je vektor naměřených hodnot vysvětlované proměnné je matice typu n (k + 1) naměřených hodnot vysvětlujících proměn- X = [ x (i)j ]j=1,...,n; i=0,...,k ných β = (β 0, β 2,..., β k ) T je vektor hledaných k + 1 neznámých parametrů ɛ = (ɛ 1, ɛ 2,..., ɛ n ) T je vektor náhodné složky Stejně jako v jednorozměrném případě musíme specifikovat předpoklady řešení modelu pomocí metody nejmenších čtverců E (ɛ) = 0 6

7 E ( ɛɛ T ) = σ 2 I n X je nestochastická matice, takže E ( X T ɛ ) = 0 X má plnou hodnost k + 1 = p Za výše uvedených předpokladů pak neznámé parametry modelu β 0, β 1,..., β k, σ 2 odhadneme následovně b = ( X T X ) 1 X T y ( e T e ) s 2 = n p = (y Xb)T (y Xb) n p Kvalita regresní funkce a intenzita závislosti Jedním z důležitých kroků v regresní analýze je tzv. regresní diagnostika. Ta slouží k hodnocení kvality regresní funkce a k ověřování splnění předpokladů použité metody nejmenších čtverců. V rámci metody nejmenších čtverců pracujeme s následujícími součty čtverců, resp. rozptyly, které v sobě zahrnují variabilitu empirických hodnot, odhadnutých teoretických hodnot a residuí. celkový součet čtverců S 2 T = (y i y) 2 rozptyl empirických (skutečně zjištěných) hodnot s 2 y = vysvětlený součet čtverců S 2 V = (ŷ i y) 2 rozptyl vyrovnaných (teoretických) hodnot s 2 ŷ = residuální součet čtverců RSS = e T e = e 2 = S2 V n 1 rozptyl skutečně zjištěných hodnot kolem regresní čáry, residuální rozptyl s 2 R = RSS n p, kde p = k + 1 Při použití metody nejmenších čtverců platí S 2 T = S 2 V + RSS. Při přímkové regresi (k = 1) platí s 2 y = s 2 ŷ + s 2 R Graficky jsou jednotlivé odchylky znázorněny na obrázku S2 T n 1 (y i ŷ i ) 2 7

8 Y ŷ y ŷ y y i ŷ y i y x Koeficient (index) determinace pro vícenásobnou regresi s absolutním členem Ze vztahu jednotlivých součtů čtverců je odvozen koeficient R 2. Tento koeficient vyjadřuje z kolika procent se nám podařilo vysvětlit veličinu y pomocí veličin x 1, x 2,.... R 2 = S2 V S 2 T = 1 RSS S 2 T Pro koeficient determinace platí následující vlastnosti R 2 0; 1 = 1 (n p) s2 R (n 1) s 2 y pokud x a y jsou deterministicky závislé, pak y i = ŷ i a s 2 R = 0, s 2 y = s 2 ŷ, tedy R 2 = 1 pokud x a y jsou nezávislé, pak s 2 V = 0, s 2 y = s 2 R, tedy R 2 = 0 koeficient (index) korelace R = R 2 pro přímkovou regresi platí ŷ i = y + b 1 (x i x), kde b 1 = s xy, pak s 2 x 1 (ŷ R 2 = s2 n 1 i y) 2 1 b 1 (x n 1 i x) 2 ŷ = = = s2 xy s 2 x = s2 xy s 2 y s 2 y s 2 y s 2 x s 2 x s 2 y s 2 x s 2 y tedy koeficient korelace R = r x y odpovídá výběrovému korelačnímu koeficientu náhodného vektoru (x, y) X Regresní analýza v Excelu 8

9 funkce LINREGRESE (DATA-Y;DATA-X1-DATA-X2-...-DATA-XN;B;STAT), kde DATA-Y je závislá proměnná DATA-X1;DATA-X2;... ;DATA-XN jsou nezávislé proměnné, B =PRAVDA - parametr β 0 se odhaduje, NEPRAVDA - parametr β 0 se neodhaduje (rovnice prochází nulou), STAT=PRAVDA - počítají se doplňující charakteristiky modelu (SE i ;R 2 ;SE y ;F;df;ss(reg);ss(resid)) funkce LINTREND (DATA-Y;DATA-X;DATA-X-NOVA;B), kde DATA-Y je závislá proměnná, DATA- X jsou nezávislé proměnné, DATA-X-NOVA je nezávislá proměnná, nová ( například pokračování data-x) B =PRAVDA - parametr β 0 se odhaduje, NEPRAVDA - parametr β 0 se neodhaduje funkce FORECAST (X;DATA-Y;DATA-X) pro odhad y(x) na základě znalostí DATA-X a DATA-Y funkce INTERCEPT (DATA-Y;DATA-X) pro odhad β 0 na základě znalostí DATA-X a DATA-Y funkce SLOPE (DATA-Y;DATA-X) pro odhad parametru beta 1 lineární regrese funkce STEYX (DATA-Y;DATA-X) pro standardní chybu odhadu y funkce LOGLINREGRESE (DATA-Y;DATA-X1-DATA-X2-...-DATA-XN;B;STAT) pro logaritmický regresní model z grafu : vytvořit XY graf a přidat spojnici trendu pomocí NÁSTROJE=>ANALÝZA DAT=>REGRESE Další vícerozměrné metody a grafy lze v Excelu naprogramovat Zpracování vícerozměrných statistických dat v MATLABu Grafické zpracování a základní deskriptivní statistiky boxplot vícerozměrný histogram hist3 plotmatrix gscatter gplotmatrix souhrnné statistiky [means,sem,counts,name]=grpstats(data,data(:,2)) korelace a kovariance corr, corrcoef, cov Regresní analýza maticově b = ( X T X ) 1 X T y, atd funkce [b,bint,r,rint,stats] = regress(y,x,alpha) regresní diagnostika a grafy - rcoplot robusní odhady - robustfit 9

10 Lze využít též další nástroje pro vícerozměrnou analýzu -ANOVA, MANOVA, shluková analýza - cluster analysis, metoda hlavních komponent, faktorová analýza atd Upravený koeficient determinace (adjusted R 2 ) definice R 2 a = 1 s2 R s 2 T pro běžné situace platí R 2 a R 2 pro přímkovou regresi (resp. pro regresi se dvěma neznámými koeficienty) platí R 2 = R 2 a pro hodnoty R 2 < 10.5 Příklady k n 1 vyjde hodnota R2 a < 0 1. Chceme testovat, zda hrací kostka je korektní. Provedli jsme 600x hod kostkou a získali jsme následující četnosti: Číslo n i Pokud je kostka korektní, měly by se očekávané četnosti řídit diskrétním rovnoměrným rozdělením. Budeme tedy testovat shodu získaných hodnot s diskrétním rovnoměrným rozdělením na hladině významnosti 5%. Řešení: H 0 : Kostka je korektní H 1 : Kostka není korektní Budeme se řídit postupem uvedeným v první části tohoto cvičení: Obor hodnot je již rozdělen na 6 nepřekrývajících se tříd, tedy k = 6. Počty prvků n i jsou uvedeny již v zadání. Není potřeba odhadovat parametry, tj. m = 0. Spočteme očekávané hodnoty v jednotlivých třídách o i = np i = , 2,..., 6 V žádné třídě není o i < 5, nebudeme tedy žádné třídy slučovat. Vypočteme hodnotu testovací statistiky: = 100 pro i = χ 2 = k (n i o i ) 2 = χ 2 = o i 6 (n i 100) = 33 10

11 Kritický obor je dán χ 2 -rozdělením s ν = k 1 = 5 stupni volnosti: W = (χ (5), + ) = (11.1, + ) Jelikož χ 2 W, tak hypotézu o tom, že kostka je korektní zamítáme (na hladině významnosti α = 5%. 2. Po provedení 60 pokusů s diskrétní náhodnou veličinou X, která může nabývat hodnot 0 až 4 (tj. v každém z pokusů nastane bud 0, 1, 2, 3 nebo 4krát sledovaný jev) jsou získány následující četnosti. Hodnota n i Tedy například hodnota 12 znamená, že při 12 pokusech z 60 nabyla náhodná veličina X hodnoty 1. Otestujte na hladině významnosti α = 2.5%, zda se náhodná veličina X řídí binomickým rozdělením. Řešení: H 0 : Náhodná veličina se řídí binomickým rozdělením H 1 : Náhodná veličina se neřídí binomickým rozdělením Budeme se řídit postupem uvedeným v první části tohoto cvičení: Obor hodnot je již rozdělen na 5 nepřekrývajících se tříd, tedy k = 5. Počty prvků n i jsou uvedeny již v zadání. Ze zadání víme, že parametr n binomického rozdělení je 4, ten tedy odhadovat nemusíme. Je ale potřeba odhadnout parametr p binomického rozdělení. Ten lze odhadnout přes střední hodnotu. U binomického rozdělení víme, že E(X) = np. n známe, střední hodnotu lze odhadnout pomocí průměru a pak již jen vyjádříme neznámý parametr p: Dosadíme: A odtud: x = = 4 ˆp ˆp = = Předpokládáme, že náhodná veličina se řídí rozdělením Bi(4, ). Odhadovali jsme jeden parametr, takže m = 1. Spočteme očekávané pravděpodobnosti p i a následně očekávané hodnoty v jednotlivých třídách o i = np i pro i = 0, 1,..., 4: Hodnota p i o i

12 V první třídě je o i < 5, sloučíme tedy tuto třídu se sousední. V poslední třídě je sice n i < 5, ale očekávaná hodnota splňuje podmínku a slučovat tedy nebudeme. Po sloučení obdržíme: Hodnota 0 a n i o i Stejným způsobem musí být sloučeny i naměřené hodnoty. Vypočteme hodnotu testovací statistiky: χ 2 = k (n i o i ) 2 = o i Kritický obor je dán χ 2 -rozdělením s ν = k 1 m = 2 stupni volnosti: W = (χ (2), + ) = (7.38, + ) Jelikož χ 2 W, tak hypotézu o tom, že náhodná veličina se řídí rozdělením Bi(4, ) (na hladině významnosti α = 2.5%) nezamítáme. 3. Z průzkumu provedeného u osob, který měl zjistit efektivnost očkování proti chřipce, byly získány tyto výsledky: Bez očkování Jedno očkování Dvě očkování Celkem Chřipka Bez chřipky Celkem Na hladině významnosti α = 5% testujte, zda má očkování vliv na výskyt chřipky. Řešení: H 0 : Očkování vliv nemá (veličiny jsou nezávislé) H 1 : Očkování vliv má (mezi veličinami existuje závislost) Použijeme tedy test nezávislosti: Hodnoty n, n i. a n.j jsou uvedeny již v tabulce. Pomocí těchto hodnot vypočteme očekávané hodnoty: Např.: o 12 = n 1.n.2 = n Celá tabulka s očekávanými hodnotami: o ij = n i.n.j n = Bez očkování Jedno očkování Dvě očkování Chřipka Bez chřipky

13 Ve všech kategoriích platí o ij 5. Testovací statistika: Obor kritických hodnot W : χ 2 = 2 3 (n ij o ij ) 2 = o ij j=1 W = (χ (1 2), + ) = (5.99; + ) Protože χ 2 W, tak hypotézu o nezávislosti (na hladině významnosti α = 5%) zamítáme a očkování má tedy vliv. 4. Chceme otestovat vliv nové technologie. Máme k dispozici následující výsledky: I. jakost II. jakost III. jakost Zmetek Celkem Stará technologie Nová technologie Celkem Na hladině významnosti α = 5% testujte, zda má nová technologie vliv na výrobu. Řešení: H 0 : Technologie nemá vliv (veličiny jsou nezávislé) H 1 : Technologie má vliv (mezi veličinami existuje závislost) Použijeme tedy test nezávislosti v dvourozměrné kontingenční tabulce: Hodnoty n, n i. a n.j jsou uvedeny již v tabulce. Pomocí těchto hodnot vypočteme očekávané hodnoty: I. jakost II. jakost III. jakost Zmetek Stará technologie Nová technologie Jelikož o 14 < 5, tak musíme sloučit poslední dva sloupce (řádky slučovat nemůžeme, musí platit I, J 2). Máme tedy: I. jakost II. jakost III. jakost + Zmetek Stará technologie Nová technologie Stejným způsobem musí být sloučeny i naměřené hodnoty. Testovací statistika: 2 3 χ 2 (n ij o ij ) 2 = = 1.84 o ij j=1 13

14 Obor kritických hodnot W : W = (χ (1 2), + ) = (5.99; + ) Protože χ 2 W, tak hypotézu o nezávislosti (na hladině významnosti α = 5%) nezamítáme a nová technologie tedy nemá vliv. 5. U 5 lidí byla zjišt ována váha (ozn. X) a výška (ozn. Y ). Výsledky jsou následující: Výška Váha Předpokládáme, že dvourozměrná náhodná veličina (X, Y ) má dvourozměrné normální rozdělení. Otestujte na hladině významnosti α = 10%, zda jsou X a Y nezávislé. Řešení: Jelikož se jedná o dvourozměrné normální rozdělení, tak stačí testovat nulovost korelačního koeficientu. Testujeme tedy: H 0 : ρ = 0 H 1 : ρ 0 Musíme vypočítat průměry, výběrové rozptyly, hodnotu výběrové kovariance a následně výběrové korelace: S XY = 1 n 1 r XY = S 2 x = S 2 y = x = 1 n ȳ = 1 n x i = 181 y i = 74.4 (x i x) 2 = 190 (y i ȳ) 2 = x i y i n n 1 xȳ = = S XY S2 (X) S 2 (Y ) = 138 = Testovací statistika má tvar: r T = n 2 = 5 2 = r Obor kritických hodnot pro test na hladině významnosti α = 10% je: W = (, 2.353) (2.353, + ) Hypotézu o nezávislosti lze zamítnout na hladině významnosti α = 10%, protože T W. Přijmeme tedy alternativní hypotézu, že veličiny jsou závislé. 14

15 6. Pro následující data odhadněte koeficienty regresní přímky y = β 0 +β 1 x, vypočtěte přes soustavu normálních rovnic. x y Pro následující data odhadněte koeficienty regresní funkce y = β 0 +β 1, vypočtěte přes soustavu x normálních rovnic. x y

16 8. Pro data z předchozího příkladu odhadněte koeficienty regresní funkce y = β 0 + β 1 x + β 2 x 2 16

17 9. Pro předchozí příklady spočtěte S 2 V, S 2 T, SSE a R 2. Získané výsledky interpretujte. 17

V praxi pracujeme s daty nominálními (nabývají pouze dvou hodnot), kategoriálními (nabývají více

V praxi pracujeme s daty nominálními (nabývají pouze dvou hodnot), kategoriálními (nabývají více 9 Vícerozměrná data a jejich zpracování 9.1 Vícerozměrná data a vícerozměrná rozdělení Při zpracování vícerozměrných dat, hledáme souvislosti mezi dvěmi, případně více náhodnými veličinami. V praxi pracujeme

Více

5 Vícerozměrná data - kontingenční tabulky, testy nezávislosti, regresní analýza

5 Vícerozměrná data - kontingenční tabulky, testy nezávislosti, regresní analýza 5 Vícerozměrná data - kontingenční tabulky, testy nezávislosti, regresní analýza 5.1 Vícerozměrná data a vícerozměrná rozdělení Při zpracování vícerozměrných dat se hledají souvislosti mezi dvěma, případně

Více

Regresní a korelační analýza

Regresní a korelační analýza Regresní a korelační analýza Mějme dvojici proměnných, které spolu nějak souvisí. x je nezávisle (vysvětlující) proměnná y je závisle (vysvětlovaná) proměnná Chceme zjistit funkční závislost y = f(x).

Více

Statistika. Regresní a korelační analýza Úvod do problému. Roman Biskup

Statistika. Regresní a korelační analýza Úvod do problému. Roman Biskup Statistika Regresní a korelační analýza Úvod do problému Roman Biskup Jihočeská univerzita v Českých Budějovicích Ekonomická fakulta (Zemědělská fakulta) Katedra aplikované matematiky a informatiky 2008/2009

Více

Kontingenční tabulky, korelační koeficienty

Kontingenční tabulky, korelační koeficienty Statistika II Katedra ekonometrie FVL UO Brno kancelář 69a, tel. 973 442029 email:jiri.neubauer@unob.cz Mějme kategoriální proměnné X a Y. Vytvoříme tzv. kontingenční tabulku. Budeme tedy testovat hypotézu

Více

Kontingenční tabulky, korelační koeficienty

Kontingenční tabulky, korelační koeficienty Statistika II Katedra ekonometrie FVL UO Brno kancelář 69a, tel 973 442029 email:jirineubauer@unobcz Budeme předpokládat, že X a Y jsou kvalitativní náhodné veličiny, obor hodnot X obsahuje r hodnot (kategorií,

Více

MĚŘENÍ STATISTICKÝCH ZÁVISLOSTÍ

MĚŘENÍ STATISTICKÝCH ZÁVISLOSTÍ MĚŘENÍ STATISTICKÝCH ZÁVISLOSTÍ v praxi u jednoho prvku souboru se často zkoumá více veličin, které mohou na sobě různě záviset jednorozměrný výběrový soubor VSS X vícerozměrným výběrovým souborem VSS

Více

Regresní a korelační analýza

Regresní a korelační analýza Regresní a korelační analýza Mějme dvojici proměnných, které spolu nějak souvisí. x je nezávisle (vysvětlující) proměnná y je závisle (vysvětlovaná) proměnná Chceme zjistit funkční závislost y = f(x).

Více

11. cvičení z PSI prosince hodnota pozorovaná četnost n i p X (i) = q i (1 q), i N 0.

11. cvičení z PSI prosince hodnota pozorovaná četnost n i p X (i) = q i (1 q), i N 0. 11 cvičení z PSI 12-16 prosince 2016 111 (Test dobré shody - geometrické rozdělení Realizací náhodné veličiny X jsme dostali následující četnosti výsledků: hodnota 0 1 2 3 4 5 6 pozorovaná četnost 29 15

Více

Statistika (KMI/PSTAT)

Statistika (KMI/PSTAT) Statistika (KMI/PSTAT) Cvičení dvanácté aneb Regrese a korelace Statistika (KMI/PSTAT) 1 / 18 V souboru 25 jedinců jsme měřili jejich výšku a hmotnost. Výsledky jsou v tabulce a grafu. Statistika (KMI/PSTAT)

Více

Měření závislosti statistických dat

Měření závislosti statistických dat 5.1 Měření závislosti statistických dat Každý pořádný astronom je schopen vám předpovědět, kde se bude nacházet daná hvězda půl hodiny před půlnocí. Ne každý je však téhož schopen předpovědět v případě

Více

Tomáš Karel LS 2012/2013

Tomáš Karel LS 2012/2013 Tomáš Karel LS 2012/2013 Doplňkový materiál ke cvičení z předmětu 4ST201. Na případné faktické chyby v této presentaci mě prosím upozorněte. Děkuji. Tyto slidy berte pouze jako doplňkový materiál není

Více

INDUKTIVNÍ STATISTIKA

INDUKTIVNÍ STATISTIKA 10. SEMINÁŘ INDUKTIVNÍ STATISTIKA 3. HODNOCENÍ ZÁVISLOSTÍ HODNOCENÍ ZÁVISLOSTÍ KVALITATIVNÍ VELIČINY - Vychází se z kombinační (kontingenční) tabulky, která je výsledkem třídění druhého stupně KVANTITATIVNÍ

Více

MÍRY ZÁVISLOSTI (KORELACE A REGRESE)

MÍRY ZÁVISLOSTI (KORELACE A REGRESE) zhanel@fsps.muni.cz MÍRY ZÁVISLOSTI (KORELACE A REGRESE) 2.5 MÍRY ZÁVISLOSTI 2.5.1 ZÁVISLOST PEVNÁ, VOLNÁ, STATISTICKÁ A KORELAČNÍ Jednorozměrné soubory - charakterizovány jednotlivými statistickými znaky

Více

12. cvičení z PST. 20. prosince 2017

12. cvičení z PST. 20. prosince 2017 1 cvičení z PST 0 prosince 017 11 test rozptylu normálního rozdělení Do laboratoře bylo odesláno n = 5 stejných vzorků krve ke stanovení obsahu alkoholu X v promilích alkoholu Výsledkem byla realizace

Více

Statistická analýza jednorozměrných dat

Statistická analýza jednorozměrných dat Statistická analýza jednorozměrných dat Prof. RNDr. Milan Meloun, DrSc. Univerzita Pardubice, Pardubice 31.ledna 2011 Tato prezentace je spolufinancována Evropským sociálním fondem a státním rozpočtem

Více

KGG/STG Statistika pro geografy

KGG/STG Statistika pro geografy KGG/STG Statistika pro geografy 9. Korelační analýza Mgr. David Fiedor 20. dubna 2015 Analýza závislostí v řadě geografických disciplín studujeme jevy, u kterých vyšetřujeme nikoliv pouze jednu vlastnost

Více

Testování hypotéz o parametrech regresního modelu

Testování hypotéz o parametrech regresního modelu Testování hypotéz o parametrech regresního modelu Ekonometrie Jiří Neubauer Katedra kvantitativních metod FVL UO Brno kancelář 69a, tel. 973 442029 email:jiri.neubauer@unob.cz Jiří Neubauer (Katedra UO

Více

Regresní analýza 1. Regresní analýza

Regresní analýza 1. Regresní analýza Regresní analýza 1 1 Regresní funkce Regresní analýza Důležitou statistickou úlohou je hledání a zkoumání závislostí proměnných, jejichž hodnoty získáme při realizaci experimentů Vzhledem k jejich náhodnému

Více

Testování hypotéz o parametrech regresního modelu

Testování hypotéz o parametrech regresního modelu Statistika II Katedra ekonometrie FVL UO Brno kancelář 69a, tel. 973 442029 email:jiri.neubauer@unob.cz Lineární regresní model kde Y = Xβ + e, y 1 e 1 β y 2 Y =., e = e 2 x 11 x 1 1k., X =....... β 2,

Více

1 Tyto materiály byly vytvořeny za pomoci grantu FRVŠ číslo 1145/2004.

1 Tyto materiály byly vytvořeny za pomoci grantu FRVŠ číslo 1145/2004. Prostá regresní a korelační analýza 1 1 Tyto materiály byly vytvořeny za pomoci grantu FRVŠ číslo 1145/2004. Problematika závislosti V podstatě lze rozlišovat mezi závislostí nepodstatnou, čili náhodnou

Více

PRAVDĚPODOBNOST A STATISTIKA

PRAVDĚPODOBNOST A STATISTIKA PRAVDĚPODOBNOST A STATISTIKA Definice lineárního normálního regresního modelu Lineární normální regresní model Y β ε Matice n,k je matice realizací. Předpoklad: n > k, h() k - tj. matice je plné hodnosti

Více

Náhodné veličiny jsou nekorelované, neexistuje mezi nimi korelační vztah. Když jsou X; Y nekorelované, nemusí být nezávislé.

Náhodné veličiny jsou nekorelované, neexistuje mezi nimi korelační vztah. Když jsou X; Y nekorelované, nemusí být nezávislé. 1. Korelační analýza V životě většinou nesledujeme pouze jeden statistický znak. Sledujeme více statistických znaků zároveň. Kromě vlastností statistických znaků nás zajímá také jejich těsnost (velikost,

Více

Zpracování náhodného vektoru. Ing. Michal Dorda, Ph.D.

Zpracování náhodného vektoru. Ing. Michal Dorda, Ph.D. Ing. Michal Dorda, Ph.D. 1 Př. 1: Cestující na vybraném spoji linky MHD byli dotazováni za účelem zjištění spokojenosti s kvalitou MHD. Legenda 1 Velmi spokojen Spokojen 3 Nespokojen 4 Velmi nespokojen

Více

Poznámky k předmětu Aplikovaná statistika, 11. téma

Poznámky k předmětu Aplikovaná statistika, 11. téma Poznámky k předmětu Aplikovaná statistika, 11. téma Testy založené na χ 2 rozdělení V přehledu významných rozdělení jsme si uvedli, že Poissonovým rozdělením se modeluje počet událostí, které nastanou

Více

Tomáš Karel LS 2012/2013

Tomáš Karel LS 2012/2013 Tomáš Karel LS 2012/2013 Doplňkový materiál ke cvičení z předmětu 4ST201. Na případné faktické chyby v této presentaci mě prosím upozorněte. Děkuji. Tyto slidy berte pouze jako doplňkový materiál není

Více

Regresní analýza. Ekonometrie. Jiří Neubauer. Katedra ekonometrie FVL UO Brno kancelář 69a, tel

Regresní analýza. Ekonometrie. Jiří Neubauer. Katedra ekonometrie FVL UO Brno kancelář 69a, tel Regresní analýza Ekonometrie Jiří Neubauer Katedra ekonometrie FVL UO Brno kancelář 69a, tel. 973 442029 email:jiri.neubauer@unob.cz Jiří Neubauer (Katedra ekonometrie UO Brno) Regresní analýza 1 / 23

Více

Regresní a korelační analýza

Regresní a korelační analýza Regresní a korelační analýza Mějme dvojici proměnných, které spolu nějak souvisí. x je nezávisle (vysvětlující) proměnná y je závisle (vysvětlovaná) proměnná Chceme zjistit funkční závislost y = f(x).

Více

Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc. dohnal@nipax.cz

Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc. dohnal@nipax.cz Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc. dohnal@nipax.cz Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc. dohnal@nipax.cz Pravděpodobnost a matematická

Více

PRAVDĚPODOBNOST A STATISTIKA

PRAVDĚPODOBNOST A STATISTIKA PRAVDĚPODOBNOST A STATISTIKA Testování hypotéz Nechť X je náhodná proměnná, která má distribuční funkci F(x, ϑ). Předpokládejme, že známe tvar distribuční funkce (víme jaké má rozdělení) a neznáme parametr

Více

Jana Vránová, 3. lékařská fakulta UK

Jana Vránová, 3. lékařská fakulta UK Jana Vránová, 3. lékařská fakulta UK Vznikají při zkoumání vztahů kvalitativních resp. diskrétních znaků Jedná se o analogii s korelační analýzou spojitých znaků Přitom předpokládáme, že každý prvek populace

Více

Regresní a korelační analýza

Regresní a korelační analýza Regresní a korelační analýza Mějme dvojici proměnných, které spolu nějak souvisí. x je nezávisle (vysvětlující) proměnná y je závisle (vysvětlovaná) proměnná Chceme zjistit funkční závislost y = f(x).

Více

Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc.

Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc. Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc. dohnal@nipax.cz Pravděpodobnost a matematická statistika 2010 1.týden (20.09.-24.09. ) Data, typy dat, variabilita, frekvenční analýza

Více

Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc.

Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc. Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc. dohnal@nipax.cz Pravděpodobnost a matematická statistika 010 1.týden (0.09.-4.09. ) Data, typy dat, variabilita, frekvenční analýza

Více

RNDr. Eva Janoušová doc. RNDr. Ladislav Dušek, Dr.

RNDr. Eva Janoušová doc. RNDr. Ladislav Dušek, Dr. Analýza dat pro Neurovědy RNDr. Eva Janoušová doc. RNDr. Ladislav Dušek, Dr. Jaro 2014 Institut biostatistiky Janoušová, a analýz Dušek: Analýza dat pro neurovědy Blok 7 Jak hodnotit vztah spojitých proměnných

Více

Příklad 1. Korelační pole. Řešení 1 ŘEŠENÉ PŘÍKLADY Z MV2 ČÁST 13

Příklad 1. Korelační pole. Řešení 1 ŘEŠENÉ PŘÍKLADY Z MV2 ČÁST 13 Příklad 1 Máme k dispozici výsledky prvního a druhého testu deseti sportovců. Na hladině významnosti 0,05 prověřte, zda jsou výsledky testů kladně korelované. 1.test : 7, 8, 10, 4, 14, 9, 6, 2, 13, 5 2.test

Více

Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc.

Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc. Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc. dohnal@nipax.cz Pravděpodobnost a matematická statistika 2010 1.týden (20.09.-24.09. ) Data, typy dat, variabilita, frekvenční analýza

Více

PRAVDĚPODOBNOST A STATISTIKA

PRAVDĚPODOBNOST A STATISTIKA PRAVDĚPODOBNOS A SAISIKA Regresní analýza - motivace Základní úlohou regresní analýzy je nalezení vhodného modelu studované závislosti. Je nutné věnovat velkou pozornost tomu aby byla modelována REÁLNÁ

Více

Regresní a korelační analýza

Regresní a korelační analýza Regresní a korelační analýza Mějme dvojici proměnných, které spolu nějak souvisí. x je nezávisle (vysvětlující) proměnná y je závisle (vysvětlovaná) proměnná Chceme zjistit funkční závislost y = f(x).

Více

Cvičení ze statistiky - 3. Filip Děchtěrenko

Cvičení ze statistiky - 3. Filip Děchtěrenko Cvičení ze statistiky - 3 Filip Děchtěrenko Minule bylo.. Dokončili jsme základní statistiky, typy proměnných a začali analýzu kvalitativních dat Tyhle termíny by měly být známé: Histogram, krabicový graf

Více

Regresní a korelační analýza

Regresní a korelační analýza Přednáška STATISTIKA II - EKONOMETRIE Katedra ekonometrie FEM UO Brno kancelář 69a, tel. 973 442029 email:jiri.neubauer@unob.cz Regresní analýza Cíl regresní analýzy: stanovení formy (trendu, tvaru, průběhu)

Více

6. Lineární regresní modely

6. Lineární regresní modely 6. Lineární regresní modely 6.1 Jednoduchá regrese a validace 6.2 Testy hypotéz v lineární regresi 6.3 Kritika dat v regresním tripletu 6.4 Multikolinearita a polynomy 6.5 Kritika modelu v regresním tripletu

Více

Náhodný vektor. Náhodný vektor. Hustota náhodného vektoru. Hustota náhodného vektoru. Náhodný vektor je dvojice náhodných veličin (X, Y ) T = ( X

Náhodný vektor. Náhodný vektor. Hustota náhodného vektoru. Hustota náhodného vektoru. Náhodný vektor je dvojice náhodných veličin (X, Y ) T = ( X Náhodný vektor Náhodný vektor zatím jsme sledovali jednu náhodnou veličinu, její rozdělení a charakteristiky často potřebujeme vyšetřovat vzájemný vztah několika náhodných veličin musíme sledovat jejich

Více

Úvodem Dříve les než stromy 3 Operace s maticemi

Úvodem Dříve les než stromy 3 Operace s maticemi Obsah 1 Úvodem 13 2 Dříve les než stromy 17 2.1 Nejednoznačnost terminologie 17 2.2 Volba metody analýzy dat 23 2.3 Přehled vybraných vícerozměrných metod 25 2.3.1 Metoda hlavních komponent 26 2.3.2 Faktorová

Více

Korelační a regresní analýza

Korelační a regresní analýza Korelační a regresní analýza Analýza závislosti v normálním rozdělení Pearsonův (výběrový) korelační koeficient: r = s XY s X s Y, kde s XY = 1 n (x n 1 i=0 i x )(y i y ), s X (s Y ) je výběrová směrodatná

Více

Pravděpodobnost a aplikovaná statistika

Pravděpodobnost a aplikovaná statistika Pravděpodobnost a aplikovaná statistika MGR. JANA SEKNIČKOVÁ, PH.D. 2. KAPITOLA PODMÍNĚNÁ PRAVDĚPODOBNOST 3. KAPITOLA NÁHODNÁ VELIČINA 9.11.2017 Opakování Uveďte příklad aplikace geometrické definice pravděpodobnosti

Více

Parametry hledáme tak, aby součet čtverců odchylek byl minimální. Řešením podle teorie je =

Parametry hledáme tak, aby součet čtverců odchylek byl minimální. Řešením podle teorie je = Příklad 1 Metodou nejmenších čtverců nalezněte odhad lineární regresní funkce popisující závislost mezi výnosy pšenice a množstvím použitého hnojiva na základě hodnot výběrového souboru uvedeného v tabulce.

Více

odpovídá jedna a jen jedna hodnota jiných

odpovídá jedna a jen jedna hodnota jiných 8. Regresní a korelační analýza Problém: hledání, zkoumání a hodnocení souvislostí, závislostí mezi dvěma a více statistickými znaky (veličinami). Typy závislostí: pevné a volné Pevná závislost každé hodnotě

Více

PRAVDĚPODOBNOST A STATISTIKA. Neparametrické testy hypotéz čast 1

PRAVDĚPODOBNOST A STATISTIKA. Neparametrické testy hypotéz čast 1 PRAVDĚPODOBNOST A STATISTIKA Neparametrické testy hypotéz čast 1 Neparametrické testy hypotéz - úvod Neparametrické testy statistických hypotéz se používají v případech, kdy neznáme rozdělení pozorované

Více

PRAVDĚPODOBNOST A STATISTIKA

PRAVDĚPODOBNOST A STATISTIKA PRAVDĚPODOBNOST A STATISTIKA Definice lineárního normálního regresního modelu Lineární normální regresní model Y Xβ ε Předpoklady: Matice X X n,k je matice realizací. Předpoklad: n > k, h(x) k - tj. matice

Více

Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc.

Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc. Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc. dohnal@nipax.cz Pravděpodobnost a matematická statistika 2010 1.týden (20.09.-24.09. ) Data, typy dat, variabilita, frekvenční analýza

Více

Mnohorozměrná statistická data

Mnohorozměrná statistická data Statistika II Katedra ekonometrie FVL UO Brno kancelář 69a, tel. 973 442029 email:jiri.neubauer@unob.cz Statistický znak, statistický soubor Jednotlivé objekty nebo subjekty, které jsou při statistickém

Více

Příklad 1. Řešení 1 ŘEŠENÉ PŘÍKLADY Z MV2 ČÁST 11

Příklad 1. Řešení 1 ŘEŠENÉ PŘÍKLADY Z MV2 ČÁST 11 Příklad 1 Vyhláška Ministerstva zdravotnictví předpokládala, že doba dojezdu k pacientovi od nahlášení požadavku nepřekročí 17 minut. Hodnoty deseti náhodně vybraných dob příjezdu sanitky k nemocnému byly:

Více

Náhodný vektor. Náhodný vektor. Hustota náhodného vektoru. Hustota náhodného vektoru. Náhodný vektor je dvojice náhodných veličin (X, Y ) T = ( X

Náhodný vektor. Náhodný vektor. Hustota náhodného vektoru. Hustota náhodného vektoru. Náhodný vektor je dvojice náhodných veličin (X, Y ) T = ( X Náhodný vektor Náhodný vektor zatím jsme sledovali jednu náhodnou veličinu, její rozdělení a charakteristik často potřebujeme všetřovat vzájemný vztah několika náhodných veličin musíme sledovat jejich

Více

676 + 4 + 100 + 196 + 0 + 484 + 196 + 324 + 64 + 324 = = 2368

676 + 4 + 100 + 196 + 0 + 484 + 196 + 324 + 64 + 324 = = 2368 Příklad 1 Je třeba prověřit, zda lze na 5% hladině významnosti pokládat za prokázanou hypotézu, že střední doba výroby výlisku je 30 sekund. Přitom 10 náhodně vybraných výlisků bylo vyráběno celkem 540

Více

1. Číselné posloupnosti - Definice posloupnosti, základní vlastnosti, operace s posloupnostmi, limita posloupnosti, vlastnosti limit posloupností,

1. Číselné posloupnosti - Definice posloupnosti, základní vlastnosti, operace s posloupnostmi, limita posloupnosti, vlastnosti limit posloupností, KMA/SZZS1 Matematika 1. Číselné posloupnosti - Definice posloupnosti, základní vlastnosti, operace s posloupnostmi, limita posloupnosti, vlastnosti limit posloupností, operace s limitami. 2. Limita funkce

Více

You created this PDF from an application that is not licensed to print to novapdf printer (http://www.novapdf.com)

You created this PDF from an application that is not licensed to print to novapdf printer (http://www.novapdf.com) Závislost náhodných veličin Úvod Předchozí přednášky: - statistické charakteristiky jednoho výběrového nebo základního souboru - vztahy mezi výběrovým a základním souborem - vztahy statistických charakteristik

Více

LINEÁRNÍ REGRESE. Lineární regresní model

LINEÁRNÍ REGRESE. Lineární regresní model LINEÁRNÍ REGRESE Chemometrie I, David MILDE Lineární regresní model 1 Typy závislosti 2 proměnných FUNKČNÍ VZTAH: 2 závisle proměnné: určité hodnotě x odpovídá jediná hodnota y. KORELACE: 2 náhodné (nezávislé)

Více

ANALÝZA DAT V R 7. KONTINGENČNÍ TABULKA. Mgr. Markéta Pavlíková Katedra pravděpodobnosti a matematické statistiky MFF UK.

ANALÝZA DAT V R 7. KONTINGENČNÍ TABULKA. Mgr. Markéta Pavlíková Katedra pravděpodobnosti a matematické statistiky MFF UK. ANALÝZA DAT V R 7. KONTINGENČNÍ TABULKA Mgr. Markéta Pavlíková Katedra pravděpodobnosti a matematické statistiky MFF UK www.biostatisticka.cz PŘEHLED TESTŮ rozdělení normální spojité alternativní / diskrétní

Více

2 ) 4, Φ 1 (1 0,005)

2 ) 4, Φ 1 (1 0,005) Příklad 1 Ze zásilky velkého rozsahu byl náhodně vybrán soubor obsahující 1000 kusů. V tomto souboru bylo zjištěno 26 kusů nekvalitních. Rozhodněte, zda je možné s 99% jistotou tvrdit, že zásilka obsahuje

Více

Sever Jih Západ Plechovka Točené Sever Jih Západ Součty Plechovka Točené Součty

Sever Jih Západ Plechovka Točené Sever Jih Západ Součty Plechovka Točené Součty Neparametrické testy (motto: Hypotézy jsou lešením, které se staví před budovu a pak se strhává, je-li budova postavena. Jsou nutné pro vědeckou práci, avšak skutečný vědec nepokládá hypotézy za předmětnou

Více

{ } ( 2) Příklad: Test nezávislosti kategoriálních znaků

{ } ( 2) Příklad: Test nezávislosti kategoriálních znaků Příklad: Test nezávislosti kategoriálních znaků Určete na hladině významnosti 5 % na základě dat zjištěných v rámci dotazníkového šetření ve Šluknově, zda existuje závislost mezi pohlavím respondenta a

Více

Testy dobré shody Máme dvě veličiny, u kterých bychom chtěli prokázat závislost, TESTY DOBRÉ SHODY (angl. goodness-of-fit tests)

Testy dobré shody Máme dvě veličiny, u kterých bychom chtěli prokázat závislost, TESTY DOBRÉ SHODY (angl. goodness-of-fit tests) Testy dobré shody Máme dvě veličiny, u kterých bychom chtěli prokázat závislost, např. hmotnost a pohlaví narozených dětí. Běžný statistický postup pro ověření závislosti dvou veličin je zamítnutí jejich

Více

Cvičení 12: Binární logistická regrese

Cvičení 12: Binární logistická regrese Cvičení 12: Binární logistická regrese Příklad: V roce 2014 konalo státní závěrečné zkoušky bakalářského studia na jisté fakultě 167 studentů. U každého studenta bylo zaznamenáno jeho pohlaví (0 žena,

Více

II. Statistické metody vyhodnocení kvantitativních dat Gejza Dohnal

II. Statistické metody vyhodnocení kvantitativních dat Gejza Dohnal Základy navrhování průmyslových experimentů DOE II. Statistické metody vyhodnocení kvantitativních dat Gejza Dohnal! Testování statistických hypotéz kvalitativní odezva kvantitativní chí-kvadrát test homogenity,

Více

PRAVDĚPODOBNOST A STATISTIKA. Testování hypotéz o rozdělení

PRAVDĚPODOBNOST A STATISTIKA. Testování hypotéz o rozdělení PRAVDĚPODOBNOST A STATISTIKA Testování hypotéz o rozdělení Testování hypotéz o rozdělení Nechť X e náhodná proměnná, která má distribuční funkci F(x, ϑ). Předpokládeme, že neznáme tvar distribuční funkce

Více

ANALÝZA DAT V R 3. POPISNÉ STATISTIKY, NÁHODNÁ VELIČINA. Mgr. Markéta Pavlíková Katedra pravděpodobnosti a matematické statistiky MFF UK

ANALÝZA DAT V R 3. POPISNÉ STATISTIKY, NÁHODNÁ VELIČINA. Mgr. Markéta Pavlíková Katedra pravděpodobnosti a matematické statistiky MFF UK ANALÝZA DAT V R 3. POPISNÉ STATISTIKY, NÁHODNÁ VELIČINA Mgr. Markéta Pavlíková Katedra pravděpodobnosti a matematické statistiky MFF UK www.biostatisticka.cz POPISNÉ STATISTIKY - OPAKOVÁNÍ jedna kvalitativní

Více

TESTOVÁNÍ HYPOTÉZ STATISTICKÁ HYPOTÉZA Statistické testy Testovací kritérium = B B > B < B B - B - B < 0 - B > 0 oboustranný test = B > B

TESTOVÁNÍ HYPOTÉZ STATISTICKÁ HYPOTÉZA Statistické testy Testovací kritérium = B B > B < B B - B - B < 0 - B > 0 oboustranný test = B > B TESTOVÁNÍ HYPOTÉZ Od statistického šetření neočekáváme pouze elementární informace o velikosti některých statistických ukazatelů. Používáme je i k ověřování našich očekávání o výsledcích nějakého procesu,

Více

Cvičící Kuba Kubina Kubinčák Body u závěrečného testu

Cvičící Kuba Kubina Kubinčák Body u závěrečného testu 1. Příklad U 12 studentů jsme sledovali počet dosažených bodů na závěrečném testu (od 0 do 60). Vždy 4 z těchto studentů chodili k jednomu ze 3 cvičících panu Kubovi, panu Kubinovi, nebo panu Kubinčákovi.

Více

Náhodný vektor a jeho charakteristiky

Náhodný vektor a jeho charakteristiky Náhodný vektor a jeho číselné charakteristiky 1 Náhodný vektor a jeho charakteristiky V následující kapitole budeme věnovat pozornost pouze dvourozměřnému náhodnému vektoru, i když uvedené pojmy a jejich

Více

2 Zpracování naměřených dat. 2.1 Gaussův zákon chyb. 2.2 Náhodná veličina a její rozdělení

2 Zpracování naměřených dat. 2.1 Gaussův zákon chyb. 2.2 Náhodná veličina a její rozdělení 2 Zpracování naměřených dat Důležitou součástí každé experimentální práce je statistické zpracování naměřených dat. V této krátké kapitole se budeme věnovat určení intervalů spolehlivosti získaných výsledků

Více

Technická univerzita v Liberci

Technická univerzita v Liberci Technická univerzita v Liberci Ekonomická fakulta Analýza výsledků z dotazníkového šetření Jména studentů: Adam Pavlíček Michal Karlas Tomáš Vávra Anna Votavová Ročník: 2015/2016 Datum odevzdání: 13/05/2016

Více

Obsah Úvod Kapitola 1 Než začneme Kapitola 2 Práce s hromadnými daty před analýzou

Obsah Úvod Kapitola 1 Než začneme Kapitola 2 Práce s hromadnými daty před analýzou Úvod.................................................................. 11 Kapitola 1 Než začneme.................................................................. 17 1.1 Logika kvantitativního výzkumu...........................................

Více

Základy biostatistiky II. Veřejné zdravotnictví 3.LF UK - II

Základy biostatistiky II. Veřejné zdravotnictví 3.LF UK - II Základy biostatistiky II Veřejné zdravotnictví 3.LF UK - II Teoretické rozložení-matematické modely rozložení Naměřená data Výběrové rozložení Teoretické rozložení 1 e 2 x 2 Teoretické rozložení-matematické

Více

AVDAT Klasický lineární model, metoda nejmenších

AVDAT Klasický lineární model, metoda nejmenších AVDAT Klasický lineární model, metoda nejmenších čtverců Josef Tvrdík Katedra informatiky Přírodovědecká fakulta Ostravská univerzita Lineární model y i = β 0 + β 1 x i1 + + β k x ik + ε i (1) kde y i

Více

Test dobré shody v KONTINGENČNÍCH TABULKÁCH

Test dobré shody v KONTINGENČNÍCH TABULKÁCH Test dobré shody v KONTINGENČNÍCH TABULKÁCH Opakování: Mějme náhodné veličiny X a Y uspořádané do kontingenční tabulky. Řekli jsme, že nulovou hypotézu H 0 : veličiny X, Y jsou nezávislé zamítneme, když

Více

Přednáška X. Testování hypotéz o kvantitativních proměnných

Přednáška X. Testování hypotéz o kvantitativních proměnných Přednáška X. Testování hypotéz o kvantitativních proměnných Testování hypotéz o podílech Kontingenční tabulka, čtyřpolní tabulka Testy nezávislosti, Fisherůvexaktní test, McNemarůvtest Testy dobré shody

Více

letní semestr Katedra pravděpodobnosti a matematické statistiky Matematicko-fyzikální fakulta Univerzity Karlovy Matematická statistika vektory

letní semestr Katedra pravděpodobnosti a matematické statistiky Matematicko-fyzikální fakulta Univerzity Karlovy Matematická statistika vektory Šárka Hudecová Katedra pravděpodobnosti a matematické statistiky Matematicko-fyzikální fakulta Univerzity Karlovy letní semestr 202 Založeno na materiálech doc. Michala Kulicha Náhodný vektor často potřebujeme

Více

Informační technologie a statistika 1

Informační technologie a statistika 1 Informační technologie a statistika 1 přednášející: konzul. hodiny: e-mail: Martin Schindler KAP, tel. 48 535 2836, budova G po dohodě martin.schindler@tul.cz naposledy upraveno: 21. září 2015, 1/33 Požadavek

Více

Testování statistických hypotéz

Testování statistických hypotéz Testování statistických hypotéz 1 Testování statistických hypotéz 1 Statistická hypotéza a její test V praxi jsme nuceni rozhodnout, zda nějaké tvrzeni o parametrech náhodných veličin nebo o veličině samotné

Více

JEDNOVÝBĚROVÉ TESTY. Komentované řešení pomocí programu Statistica

JEDNOVÝBĚROVÉ TESTY. Komentované řešení pomocí programu Statistica JEDNOVÝBĚROVÉ TESTY Komentované řešení pomocí programu Statistica Vstupní data Data umístěná v excelovském souboru překopírujeme do tabulky ve Statistice a pojmenujeme proměnné, viz prezentace k tématu

Více

Mnohorozměrná statistická data

Mnohorozměrná statistická data Mnohorozměrná statistická data Ekonometrie Jiří Neubauer Katedra ekonometrie FVL UO Brno kancelář 69a, tel. 973 442029 email:jiri.neubauer@unob.cz Jiří Neubauer (Katedra ekonometrie UO Brno) Mnohorozměrná

Více

Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc.

Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc. Pravděpodobnost a matematická statistika Doc. RNDr. Gejza Dohnal, CSc. dohnal@nipax.cz Pravděpodobnost a matematická statistika 2010 1.týden (20.09.-24.09. ) Data, typy dat, variabilita, frekvenční analýza

Více

4EK211 Základy ekonometrie

4EK211 Základy ekonometrie 4EK211 Základy ekonometrie ZS 2015/16 Cvičení 7: Časově řady, autokorelace LENKA FIŘTOVÁ KATEDRA EKONOMETRIE, FAKULTA INFORMATIKY A STATISTIKY VYSOKÁ ŠKOLA EKONOMICKÁ V PRAZE 1. Časové řady Data: HDP.wf1

Více

Grafický a číselný popis rozložení dat 3.1 Způsoby zobrazení dat Metody zobrazení kvalitativních a ordinálních dat Metody zobrazení kvan

Grafický a číselný popis rozložení dat 3.1 Způsoby zobrazení dat Metody zobrazení kvalitativních a ordinálních dat Metody zobrazení kvan 1 Úvod 1.1 Empirický výzkum a jeho etapy 1.2 Význam teorie pro výzkum 1.2.1 Konstrukty a jejich operacionalizace 1.2.2 Role teorie ve výzkumu 1.2.3 Proces ověření hypotéz a teorií 1.3 Etika vědecké práce

Více

Název testu Předpoklady testu Testová statistika Nulové rozdělení. ( ) (p počet odhadovaných parametrů)

Název testu Předpoklady testu Testová statistika Nulové rozdělení. ( ) (p počet odhadovaných parametrů) VYBRANÉ TESTY NEPARAMETRICKÝCH HYPOTÉZ TESTY DOBRÉ SHODY Název testu Předpoklady testu Testová statistika Nulové rozdělení test dobré shody Očekávané četnosti, alespoň 80% očekávaných četností >5 ( ) (p

Více

Testování hypotéz testy o tvaru rozdělení. Jiří Neubauer. Katedra ekonometrie, FVL, UO Brno kancelář 69a, tel

Testování hypotéz testy o tvaru rozdělení. Jiří Neubauer. Katedra ekonometrie, FVL, UO Brno kancelář 69a, tel Katedra ekonometrie, FVL, UO Brno kancelář 69a, tel. 973 442029 email:jiri.neubauer@unob.cz Statistickou hypotézou se rozumí určité tvrzení o parametrech rozdělení zkoumané náhodné veličiny (µ, σ 2, π,

Více

4EK211 Základy ekonometrie

4EK211 Základy ekonometrie 4EK Základy ekonometrie Odhad klasického lineárního regresního modelu II Cvičení 3 Zuzana Dlouhá Klasický lineární regresní model - zadání příkladu Soubor: CV3_PR.xls Data: y = maloobchodní obrat potřeb

Více

Aplikovaná statistika v R - cvičení 2

Aplikovaná statistika v R - cvičení 2 Aplikovaná statistika v R - cvičení 2 Filip Děchtěrenko Matematicko-fyzikální fakulta filip.dechterenko@gmail.com 5.6.2014 Filip Děchtěrenko (MFF UK) Aplikovaná statistika v R 5.6.2014 1 / 18 Přehled Rkových

Více

4ST201 STATISTIKA CVIČENÍ Č. 7

4ST201 STATISTIKA CVIČENÍ Č. 7 4ST201 STATISTIKA CVIČENÍ Č. 7 testování hypotéz parametrické testy test hypotézy o střední hodnotě test hypotézy o relativní četnosti test o shodě středních hodnot testování hypotéz v MS Excel neparametrické

Více

You created this PDF from an application that is not licensed to print to novapdf printer (http://www.novapdf.com)

You created this PDF from an application that is not licensed to print to novapdf printer (http://www.novapdf.com) Testování statistických hypotéz Testování statistických hypotéz Princip: Ověřování určitého předpokladu zjišťujeme, zda zkoumaný výběr pochází ze základního souboru, který má určité rozdělení zjišťujeme,

Více

Statgraphics v. 5.0 STATISTICKÁ INDUKCE PRO JEDNOROZMĚRNÁ DATA. Martina Litschmannová 1. Typ proměnné. Požadovaný typ analýzy

Statgraphics v. 5.0 STATISTICKÁ INDUKCE PRO JEDNOROZMĚRNÁ DATA. Martina Litschmannová 1. Typ proměnné. Požadovaný typ analýzy Dichotomická proměnná (0-1) Spojitá proměnná STATISTICKÁ INDUKCE PRO JEDNOROZMĚRNÁ DATA Typ proměnné Požadovaný typ analýzy Ověření variability Předpoklady Testy, resp. intervalové odhad Test o rozptylu

Více

SEMESTRÁLNÍ PRÁCE. Leptání plasmou. Ing. Pavel Bouchalík

SEMESTRÁLNÍ PRÁCE. Leptání plasmou. Ing. Pavel Bouchalík SEMESTRÁLNÍ PRÁCE Leptání plasmou Ing. Pavel Bouchalík 1. ÚVOD Tato semestrální práce obsahuje písemné vypracování řešení příkladu Leptání plasmou. Jde o praktickou zkoušku znalostí získaných při přednáškách

Více

Statistické metody - nástroj poznání a rozhodování anebo zdroj omylů a lží

Statistické metody - nástroj poznání a rozhodování anebo zdroj omylů a lží Statistické metody - nástroj poznání a rozhodování anebo zdroj omylů a lží Zdeněk Karpíšek Jsou tři druhy lží: lži, odsouzeníhodné lži a statistiky. Statistika je logická a přesná metoda, jak nepřesně

Více

UNIVERZITA OBRANY Fakulta ekonomiky a managementu. Aplikace STAT1. Výsledek řešení projektu PRO HORR2011 a PRO GRAM2011 3. 11.

UNIVERZITA OBRANY Fakulta ekonomiky a managementu. Aplikace STAT1. Výsledek řešení projektu PRO HORR2011 a PRO GRAM2011 3. 11. UNIVERZITA OBRANY Fakulta ekonomiky a managementu Aplikace STAT1 Výsledek řešení projektu PRO HORR2011 a PRO GRAM2011 Jiří Neubauer, Marek Sedlačík, Oldřich Kříž 3. 11. 2012 Popis a návod k použití aplikace

Více

Matematické modelování Náhled do ekonometrie. Lukáš Frýd

Matematické modelování Náhled do ekonometrie. Lukáš Frýd Matematické modelování Náhled do ekonometrie Lukáš Frýd Výnos akcie vs. Výnos celého trhu - CAPM model r it = r ft + β 1. (r mt r ft ) r it r ft = α 0 + β 1. (r mt r ft ) + ε it Ekonomický (finanční model)

Více

STATISTIKA A INFORMATIKA - bc studium OZW, 1.roč. (zkušební otázky)

STATISTIKA A INFORMATIKA - bc studium OZW, 1.roč. (zkušební otázky) STATISTIKA A INFORMATIKA - bc studium OZW, 1.roč. (zkušební otázky) 1) Význam a využití statistiky v biologických vědách a veterinárním lékařství ) Rozdělení znaků (veličin) ve statistice 3) Základní a

Více

4EK211 Základy ekonometrie

4EK211 Základy ekonometrie 4EK211 Základy ekonometrie LS 2014/15 Cvičení 7: Autokorelace LENKA FIŘTOVÁ KATEDRA EKONOMETRIE, FAKULTA INFORMATIKY A STATISTIKY VYSOKÁ ŠKOLA EKONOMICKÁ V PRAZE 1. Autokorelace - teorie Zopakujte si G-M

Více