Example: air traffic controller

REGRESION Y CORRELACION - uca.edu.sv

Nav Estad stica (complementos) 1 REGRESION Y CORRELACION F rmulas b sicas en la regresi n lineal simple Como ejemplo de an lisis de regresi n, describiremos el caso de Pizzer a Armand, cadena de restaurantes de comida italiana. Los lugares donde sus establecimientos han tenido m s xito est n cercanos a establecimientos de educaci n superior. Se cree que las ventas trimestrales (representadas por y) en esos restaurantes, se relacionan en forma positiva con la poblaci n estudiantil (representada por x). Es decir, que los restaurantes cercanos a centros escolares con gran poblaci n tienden a generar m s ventas que los que est n cerca de centros con poblaci n peque a. Aplicando el an lisis de regresi n podremos plantear una ecuaci n que muestre c mo se relaciona la variable dependiente y con la variable independiente x . El modelo de regresi n y la ecuaci n de regresi n En el ejemplo, cada restaurante est asociado con un valor de x (poblaci n estudiantil en miles de estudiantes) y un valor correspondiente de y (ventas trimestrales en miles de $).

nav 3Estadística (complementos) Diagrama de dispersión (y línea de regresión estimada) población estud. (miles) 0 2 4 6 8 10 12 14 16 18 20 22 24 26 28 30

Information

Domain:

Source:

Link to this page:

Please notify us if you found a problem with this document:

Other abuse

Advertisement

Transcription of REGRESION Y CORRELACION - uca.edu.sv

1 Nav Estad stica (complementos) 1 REGRESION Y CORRELACION F rmulas b sicas en la regresi n lineal simple Como ejemplo de an lisis de regresi n, describiremos el caso de Pizzer a Armand, cadena de restaurantes de comida italiana. Los lugares donde sus establecimientos han tenido m s xito est n cercanos a establecimientos de educaci n superior. Se cree que las ventas trimestrales (representadas por y) en esos restaurantes, se relacionan en forma positiva con la poblaci n estudiantil (representada por x). Es decir, que los restaurantes cercanos a centros escolares con gran poblaci n tienden a generar m s ventas que los que est n cerca de centros con poblaci n peque a. Aplicando el an lisis de regresi n podremos plantear una ecuaci n que muestre c mo se relaciona la variable dependiente y con la variable independiente x . El modelo de regresi n y la ecuaci n de regresi n En el ejemplo, cada restaurante est asociado con un valor de x (poblaci n estudiantil en miles de estudiantes) y un valor correspondiente de y (ventas trimestrales en miles de $).

2 La ecuaci n que describe c mo se relaciona y con x y con un t rmino de error se llama modelo de regresi n. ste usado en la regresi n lineal simple es el siguiente: Modelo de regresi n lineal simple: y = 0 + 1 x + 0 y 1 son los par metros del modelo. es una variable aleatoria, llamada error, que explica la variabilidad en y que no se puede explicar con la relaci n lineal entre x y y. Los errores, , se consideran variables aleatorias independientes distribuidas normalmente con media cero y desviaci n est ndar . Esto implica que el valor medio o valor esperado de y, denotado por E(Y/x), es igual a 0 + 1 x. Ecuaci n de regresi n lineal simple: E(y/x) = 0 + 1 x ( Y/x=E(Y/x) ) 1 <0 1 >0 1 =0 nav Estad stica (complementos) 2 La ecuaci n estimada de regresi n (lineal simple) Los par metros, 0 y 1, del modelo se estiman por los estad sticos muestrales b0 y b1, los cuales se calculan usando el m todo de m nimos cuadrados.

3 Ecuaci n Estimada de regresi n lineal simple: = b0 + b1 x En la regresi n lineal simple, la gr fica de la ecuaci n de regresi n se llama l nea de regresi n estimada. es el valor estimado de y para un valor espec fico de x. Datos de poblaci n estudiantil y ventas trimestrales para una muestra de 10 restaurantes: restaurante Poblac. estudiantil (en miles) xi Ventas trimestrales (miles de $) yi 1 2 58 2 6 105 3 8 88 4 8 118 5 12 117 6 16 137 7 20 157 8 20 169 9 22 149 10 26 202 Diagrama de dispersi npoblaci n estud. (miles)302826242220181614121086420 Ventas trimestr (miles $)220200180160140120100806040 nav Estad stica (complementos) 3 Diagrama de dispersi n(y l nea de regresi n estimada)poblaci n estud. (miles)302826242220181614121086420 Ventas trimestr (miles $)220200180160140120100806040 El m todo de m nimos cuadrados consiste en hallar los valores b0 y b1 que hacen m nima la suma de los cuadrados de las desviaciones entre los valores observados de la variable dependiente, yi, y los valores estimados de la misma, i.

4 Es decir se minimiza la suma: (yi i)2. Al aplicar el m todo se llega al siguiente sistema de ecuaciones simult neas (llamadas ecuaciones normales de la recta de regresi n de y en x), cuya soluci n da los valores de b0 y b1: iii iiiynbx bx yx bx b01201()( ) ( ) Las soluciones son las siguientes: n)x(nyxiiiiii_x_yxb221 que tambi n es ii2i( x x)(y y )iin 1XY122( x x)Xin1(x x)(y y)SbS(x x) y xbyb10 Determine la ecuaci n de regresi n con los datos dados. b1= b0= = = b0 + b1 x nav Estad stica (complementos) 4 restaurante xi yi xiyi 2ix 1 2 58 2 6 105 3 8 88 4 8 118 5 12 117 6 16 137 7 20 157 8 20 169 9 22 149 10 26 202 140 1300 21040 2528 El coeficiente de determinaci n (r2) El coeficiente de determinaci n en la regresi n lineal simple es una medida de la bondad de ajuste de la recta estimada a los datos reales. Suma de cuadrados debida al error: SCE = (yi i )2 Suma de cuadrados total: SCT = (yi y)2 Suma de cuadrados debida a la regresi n: SCR = ( i - y)2 Relaci n entre SCT, SCR y SCE: SCT = SCR + SCE Coeficiente de determinaci n : SCTSCRr 2=SCT SCESCE1 SCTSCT Expresado r2 en porcentaje, se puede interpretar como el porcentaje de la variabilidad total de Y que se puede explicar aplicando la ecuaci n de regresi n.

5 Poblaci n estud. (miles)302826242220181614121086420 Ventas trimestr (miles $)220200180160140120100806040 130 y = b0 + b1 x =60 + 5x nav Estad stica (complementos) 5 c lculo de SCE y SCT restaurante xi (poblac. estud) Yi (ventas trimest.) i = 60 + 5 xi Residuales yi i (yi i)2 yi y = (yi 130) (yi y)2 = (yi 130)2 1 2 58 2 6 105 3 8 88 4 8 118 5 12 117 6 16 137 7 20 157 8 20 169 9 22 149 10 26 202 TOTALES 140 1,300 SCE=1,530 SCT=15,730 La suma de cuadrados debida a la regresi n se calcula por diferencia: SCR = SCT SCE = 15,730 1,530 = 14,200 El coeficiente de determinaci n es entonces: SCTSCRr 2= 14,200/15,730 = El de la variaci n en las ventas se puede explicar con la relaci n lineal entre la poblaci n estudiantil y las ventas. El coeficiente de correlaci n lineal (r) Es una medida descriptiva que mide la intensidad de asociaci n lineal entre las dos variables, x y y.

6 Los valores del coeficiente de correlaci n lineal siempre est n entre 1 y +1. 1 significa una relaci n lineal negativa perfecta, +1 significa una relaci n lineal positiva perfecta. Los valores cercanos a cero indican que las variables x y y no tiene relaci n lineal. El coeficiente de correlaci n lineal se relaciona con el coeficiente de determinaci n as : r = (signo de b1)2r (1) b1 es la pendiente la recta de regresi n de y en x. El coeficiente de determinaci n es m s general que el coeficiente de correlaci n lineal. PRUEBAS DE SIGNIFICACI N PARA LA REGRESI N LINEAL La ecuaci n de regresi n lineal simple indica que el valor medio o valor esperado de y es una funci n lineal de x: E(y/x) = 0 + 1 x. Si 1=0 entonces E(y/x) = 0 y en este caso el valor medio no depende del valor de x, y concluimos que x y y no tienen relaci n lineal. En forma alternativa, si el valor 1 0 llegamos a la conclusi n que las dos variables se relacionan ( m s espec ficamente, que hay una componente lineal en el modelo).

7 Existen dos pruebas, por lo menos, que se pueden utilizar para tal fin. En ambas se requiere una estimaci n de 2, la varianza de en el modelo de regresi n. (1) El coeficiente de correlaci n se define como XYxYSrSS ; SXY es la covarianza muestral y el denominador es el producto de las desviaciones t picas. nav Estad stica (complementos) 6 Cuadrados medios del error CME ( es una estimaci n de 2) S2 = CME = SCE/(n-2) n-2 son los grados de libertad asociados a SCE. 2 son los par metros estimados en la regresi n lineal ( 0 y 1 ) y n es el n mero de pares de datos. Error est ndar de estimaci n (s) Es la ra z cuadrada de s2, 2nSCECMEs y es el estimador de la desviaci n est ndar . Distribuci n muestral de b1 b1 es un estad stico con distribuci n normal de media b1 = 1 y desviaci n est ndar b1=2i)xx( . Si sustituimos por su estimaci n muestral, s, obtenemos un estimador de b1 que denotaremos por sb1.

8 Sb1=2i)xx(s . Con esta informaci n podemos construir un estad stico t. 1b11sbt el cual se distribuye con =n-2 Prueba t de significaci n en la regresi n H0: 1 = 0 H1: 1 0 Estad stico de contraste bajo H0, 1b1cs0bt Decisi n: Se rechaza H0 en favor de H1 si |tc |> t 2 o si p-valor < ( Realizar la prueba con los datos del ejm propuesto). Prueba de significancia usando el estad stico F (es una prueba m s general) Se usan dos estimaciones de 2, una basada en CME y la otra basada en CMR. 2nSCECME y 1 SCRntesindependieiablesvarden meroSCRCMR . CME es un estimador insesgado de 2, mientras que CMR lo es s lo si H0 es cierta. Si H0 es falsa, CMR tiende a sobreestimar 2. El estad stico de contraste, bajo H0 es una F. F=CMR/CME con 1 gl en el numerador y n-2 en el denominador. Los datos se acomodan en una tabla ANOVA. Se rechaza H0 en favor de H1 si Fc>F o tambi n si el p-valor correspondiente es menor que el nivel de significancia nav Estad stica (complementos) 7 Tabla ANOVA Fuente de variaci n Suma de cuadrados Grados de libertad Cuadrados medios F p-valor o sig.

9 Regresi n SCR 1 CMR F=CMR/CME Error SCE n-2 CME total SCT n-1 Realiza la prueba del ejemplo usando ANOVA. Fuente de variaci n Suma de cuadrados Grados de libertad Cuadrados medios F p-valor o sig. Uso de la ecuaci n de regresi n lineal para evaluar y predecir. El modelo de regresi n lineal simple es un supuesto acerca de la relaci n entre x y y. Si los resultados tienen una relaci n estad sticamente significativa entre x y y, y si el ajuste que proporciona la ecuaci n de regresi n parece bueno, sta podr a utilizarse para estimaciones y predicciones. Intervalo de confianza para estimar la media de y para un valor dado xp de x. Y /X p =E(y/xp): p t /2 s pixxnxx22()1() Intervalo de predicci n para estimar un valor individual de Y para un valor dado xp de x: Yp: p t /2 s pixxnxx22()11() PO BLAC302826242220181614121086420 VENTAS220200180160140120100806040 nav Estad stica (complementos) 8 Ejercicio: a) Se desea estimar, mediante un intervalo del 95% de confianza, el promedio de venta trimestral para todos los restaurantes cercanos a centros escolares con 10,000 estudiantes: Y: p t /2 s xp= 10 ; p=60+5(10)=110 ; x=140/10 = 14 ; 2i)xx( = 568 ; n=10 ; 2p)xx( =(10 14)2 =16 ; ; t /2= Y/x=10 : 110 miles de d lares.

10 B) Se desea predecir, mediante un intervalo del 95% de confianza, las ventas trimestrales para un restaurante que se construir cercano a un centro estudiantil de 10,000 estudiantes : Yp: p t /2 spixxnxx22()11() Yp: 110 miles de d lares An lisis de residuales: validaci n de los supuestos del modelo Como ya se dijo, el residual en la observaci n i es la diferencia entre el valor observado de la variable dependiente (yi) y el valor estimado de esa variable (iy ). Residual en observaci n i: iiyy El an lisis de residuales es la principal herramienta para determinar si es adecuado el modelo de regresi n supuesto. y = 0 + 1x + ; es el t rmino del error en el modelo, y se hacen los siguientes supuestos para l: 1. E( ) = 0 2. La varianza de , representada por 2, es igual para todos los valores de x. 3. Los valores de son independientes. 4. El t rmino del error, , tiene tendencia normal de probabilidad.


Related search queries