📊 Estadística y Análisis de Datos para 8.º Grado

Domina los datos bivariados, diagramas de dispersión, líneas de ajuste, tablas de contingencia y diagramas de caja con solucionadores matemáticos paso a paso.

Guía de Estudio de Estadística de 8.º Grado

1. Diagramas de dispersión y valores atípicos

🚀 ✍️ ✍️ Comenzar práctica →

1. ¿Qué son los datos bivariados y los diagramas de dispersión?

Los datos bivariados corresponden a dos variables numéricas medidas para cada elemento u observación de una muestra, representadas como pares ordenados (x,y)(x, y). Un diagrama de dispersión grafica estos puntos en el plano cartesiano, permitiendo a los investigadores identificar si existe una conexión real, dependencia o correlación entre ambas variables (p. ej., horas de estudio vs. calificación, temperatura vs. presión de un gas).
🔬Descubriendo conexiones reales a partir de datos experimentales
En experimentos científicos y trabajos de laboratorio, las mediciones brutas pueden parecer una lista caótica de números. Graficar los datos en un diagrama de dispersión transforma esas mediciones en un patrón visual claro, permitiendo a los científicos descubrir leyes matemáticas, probar hipótesis y validar teorías.

2. Patrones de asociación (positiva, negativa, no lineal, sin asociación)

📈 Asociación lineal positiva

Al aumentar x, y aumenta.

📉 Asociación lineal negativa

Al aumentar x, y disminuye.

🔄 Asociación no lineal

Patrón curvo definido.

⚪ Sin asociación

Puntos dispersos al azar.

3. Agrupaciones y valores atípicos

  • Agrupación: Un grupo denso de puntos que se concentran en una región específica del plano.
  • Valor atípico: Un punto individual que se aleja notablemente del patrón general formado por la mayoría de los datos.

🎯 Agrupaciones

Grupo 1Grupo 2

Puntos concentrados en grupos densos y separados.

📍 Valor atípico

¡Atípico!

Punto aislado que se aparta del patrón general.

4. Pioneros de la ciencia: cómo los experimentos y los datos construyeron el conocimiento actual

La mayoría de las leyes físicas y modelos matemáticos fundamentales surgieron porque los científicos realizaron experimentos rigurosos, recolectaron pares de datos (x,y)(x, y), graficaron diagramas de dispersión e identificaron tendencias matemáticas. Algunos ejemplos históricos destacados:
🔭
Galileo Galilei (1564–1642)
Cinemática y caída libre
  • Experimento y datos: Galileo rodó esferas por planos inclinados y midió distancia (y)(y) vs. tiempo (x)(x).
  • Descubrimiento: El gráfico reveló una curva cuadrática no lineal (dt2d \propto t^2), probando aceleración constante.
Distancia vs. Tiempo ($d \propto t^2$)
Tiempo t (s)Distancia d
📊 Datos reconstruidos de los experimentos de planos inclinados de Galileo (1604)
📐
Carl Friedrich Gauss (1777–1855)
Estadística y astronomía
  • Experimento y datos: Gauss analizó observaciones astronómicas de Ceres y errores de medición.
  • Descubrimiento: Desarrolló una forma temprana del método de mínimos cuadrados (línea de ajuste) para modelar datos reales con dispersión.
Línea de Ajuste por Mínimos Cuadrados (Órbita de Ceres)
Tiempo de ObservaciónPosición
📊 Modelo de mínimos cuadrados ajustado a las observaciones de Ceres (Gauss, 1801)
🌌
Edwin Hubble (1889–1953)
Cosmología y expansión del universo
  • Experimento y datos: Midió la distancia a galaxias (x)(x) vs. su velocidad de recesión (y)(y) (corrimiento al rojo).
  • Descubrimiento: Correlación lineal positiva (v=H0dv = H_0 \cdot d, ley de Hubble) aportó evidencia observacional de la expansión del universo.
Diagrama de Hubble ($v = H_0 \cdot d$)
Distancia d (Mpc)Velocidad v (km/s)
✓ Datos históricos reales (artículo de Edwin Hubble, 1929 PNAS)
☢️
Marie Curie (1867–1934)
Física y radiactividad
  • Experimento y datos: Curie midió la corriente de ionización (y)(y) frente a la masa de uranio (x)(x).
  • Descubrimiento: La proporcionalidad directa demostró que la radiactividad es una propiedad intrínseca del átomo de uranio.
Corriente de Radiación vs. Masa de Uranio
Masa de Uranio (g)Corriente (pA)
📊 Datos reconstruidos de laboratorio (registros del electrómetro de Curie, 1898)

1. ¿Qué es una línea de mejor ajuste (línea de tendencia)?

Una línea de mejor ajuste (línea de tendencia) es una línea recta trazada a través del centro de una nube de datos bivariados lineales. Se traza de modo que minimiza la suma de los residuos verticales al cuadrado de los puntos a la recta, proporcionando un modelo de ecuación lineal y=mx+by = mx + b para cuantificar tasas de cambio y realizar estimaciones y predicciones.
🎯 Balance de puntos por encima y por debajo de la línea de ajuste
Variable independiente (x)Variable dependiente (y)Puntos por encimaPuntos por debajo
La recta pasa por el centro de los datos: 4 puntos por encima y 3 por debajo, minimizando desviaciones verticales (líneas rojas discontinuas).
📝Ejemplo práctico completo: horas de estudio vs. calificación
Supongamos datos recolectados de 5 estudiantes sobre horas semanales de estudio (xx) y calificación en el examen (yy):
  • Puntos observados: (1,63),(2,68),(3,80),(4,84),(5,95)(1, 63),\, (2, 68),\, (3, 80),\, (4, 84),\, (5, 95)
  • Ecuación de la línea de ajuste: y^=8x+54\hat{y} = 8x + 54


Interpretación del modelo:
1. Pendiente (m=+8m = +8): Por cada hora adicional de estudio (+1 h+1\text{ h}), la calificación esperada aumenta en 88 puntos (tasa de cambio).
2. Intersección (b=54b = 54): Sin estudiar (x=0x = 0), la calificación base estimada es de 5454 puntos.
3. Hacer una predicción (interpolación): Para un estudiante que estudia 3.53.5 horas:
y^=8(3.5)+54=28+54=82 puntos\hat{y} = 8(3.5) + 54 = 28 + 54 = 82\text{ puntos}
✔️ Criterios para una correcta línea de mejor ajuste:
  • Sigue la dirección: La recta debe seguir la inclinación general de la nube (creciente para positiva, decreciente para negativa).
  • Distribución balanceada: Cantidad similar de puntos por encima y por debajo de la recta en todo el dominio.
  • No requiere pasar por el origen: La recta no tiene que pasar obligatoriamente por (0,0)(0, 0) ni tocar todos los puntos.

2. Fórmulas de pendiente y ecuación de la línea de ajuste

3. Interpretación de la pendiente y la intersección en contexto

En el modelo lineal y=mx+by = mx + b:
  • Pendiente mm (Tasa de cambio): Representa cuánto cambia yy por cada incremento de 1 unidad en xx (p. ej., $15 por cada hora adicional de trabajo).
  • Intersección con el eje y (bb, Valor inicial): El valor de yy cuando x=0x = 0 (p. ej., una tarifa base de suscripción de $50).

4. Interpolación vs. extrapolación

  • Interpolación: Predecir un valor de yy para un valor de xx que se encuentra dentro del rango observado de datos (xminxxmaxx_{\min} \le x \le x_{\max}). Esta estimación suele ser altamente confiable.
  • Extrapolación: Predecir un valor de yy para un valor de xx que se encuentra fuera del rango original (x>xmaxx > x_{\max} o x<xminx < x_{\min}). Es menos confiable debido a que la tendencia lineal puede no mantenerse.

1. ¿Qué es una tabla de frecuencias de doble entrada?

Una tabla de frecuencias de doble entrada (contingencia) organiza datos categóricos recolectados sobre dos variables cualitativas para un mismo grupo de sujetos (p. ej., grado escolar vs. práctica de deportes).

2. Estructura de la tabla: frecuencias conjuntas y marginales

CategoríaPractica deportesSin deporteTotal fila (marginal)
7.º Grado241640
8.º Grado362460
Total columna6040100 (N)

3. Fórmula de frecuencia relativa y porcentajes

  • Frecuencia relativa conjunta: Divide el valor de la celda entre el tamaño total de la muestra NN (p. ej., 24100=24%\frac{24}{100} = 24\%).
  • Frecuencia relativa condicional por fila: Divide el valor de la celda entre el total de su respectiva fila (p. ej., estudiantes de 8.º que hacen deporte 3660=60%\frac{36}{60} = 60\%).

4. Diagramas de caja y cuartiles

🚀 ✍️ ✍️ Comenzar práctica →

1. ¿Qué es un diagrama de caja y bigotes?

Un diagrama de caja y bigotes, ideado por el estadístico John Tukey en 1977, es un método gráfico estandarizado para visualizar la distribución, dispersión y tendencia central de datos numéricos.

Divide un conjunto ordenado de datos en cuatro cuartiles, cada uno representando aproximadamente el 25%25\% de las observaciones, utilizando el resumen de los cinco números:
  • Mínimo (Mıˊnimo\text{Mínimo}): El valor más pequeño en el conjunto de datos.
  • Primer cuartil (Q1Q_1): La mediana de la mitad inferior (25%25\% de los datos por debajo).
  • Mediana (Q2Q_2): El valor central del conjunto (50%50\% por debajo y 50%50\% por encima).
  • Tercer cuartil (Q3Q_3): La mediana de la mitad superior (75%75\% de los datos por debajo).
  • Máximo (Maˊximo\text{Máximo}): El valor más grande en el conjunto de datos.

2. Estructura del diagrama de caja

01020304050607080Mín (0%)Q₁ (25%)Mediana / Q₂Q₃ (75%)Máx (100%)IQR = Q₃ - Q₁

3. Fórmulas de cuartiles y valores atípicos

Resumen de los cinco números

Summary={Mıˊnimo,Q1,Mediana,Q3,Maˊximo}\text{Summary} = \{\text{Mínimo},\, Q_1,\, \text{Mediana},\, Q_3,\, \text{Máximo}\}
Mıˊnimo\text{Mínimo} es el mínimo, Q1Q_1 es el primer cuartil, Mediana\text{Mediana} es la mediana, Q3Q_3 es el tercer cuartil, Maˊximo\text{Máximo} es el máximo

Rango Intercuartílico (IQR)

IQR=Q3Q1\text{IQR} = Q_3 - Q_1
Q1Q_1 es el primer cuartil, Q3Q_3 es el tercer cuartil

Regla de identificación de valores atípicos (regla de 1.5 × IQR)

Outlier<Q11.5×IQRorOutlier>Q3+1.5×IQR\begin{gathered} \text{Outlier} < Q_1 - 1.5 \times \text{IQR} \\[4pt] \text{or} \\[4pt] \text{Outlier} > Q_3 + 1.5 \times \text{IQR} \end{gathered}

4. Ejemplos numéricos paso a paso

📝Ejemplo 1: Calcular el resumen de cinco números y el IQR (n=11n = 11)
Consideremos las calificaciones de 1111 estudiantes:
[72,85,90,64,78,92,88,70,82,95,80][72, 85, 90, 64, 78, 92, 88, 70, 82, 95, 80]

Procedimiento paso a paso:
1. Ordenar de menor a mayor: [64,70,72,78,80,82,85,88,90,92,95][64, 70, 72, 78, 80, \mathbf{82}, 85, 88, 90, 92, 95]
2. Mediana (Q2Q_2): El 6.o6.^{\text{o}} valor (centro exacto de los 1111 datos)     82\implies \mathbf{82}
3. Primer cuartil (Q1Q_1): Mediana de la mitad inferior [64,70,72,78,80]    72[64, 70, \mathbf{72}, 78, 80] \implies \mathbf{72}
4. Tercer cuartil (Q3Q_3): Mediana de la mitad superior [85,88,90,92,95]    90[85, 88, \mathbf{90}, 92, 95] \implies \mathbf{90}
5. Extremos: Mıˊnimo=64,  Maˊximo=95\text{Mínimo} = 64,\; \text{Máximo} = 95
6. Rango intercuartílico (IQR\text{IQR}):
IQR=Q3Q1=9072=18\text{IQR} = Q_3 - Q_1 = 90 - 72 = 18
⚠️Ejemplo 2: Detección de valores atípicos con la regla 1.5×IQR1.5 \times \text{IQR}
Consideremos las temperaturas diarias registradas durante 1212 días:
[60,62,65,68,70,72,74,75,78,80,82,108][60, 62, 65, 68, 70, 72, 74, 75, 78, 80, 82, 108]

Procedimiento para detectar valores atípicos:
1. Calcular los cuartiles (n=12n = 12):
  • Q1=65+682=66.5Q_1 = \frac{65 + 68}{2} = 66.5
  • Q2=72+742=73Q_2 = \frac{72 + 74}{2} = 73
  • Q3=78+802=79Q_3 = \frac{78 + 80}{2} = 79
    2. Calcular IQR y umbral:
    IQR=7966.5=12.5    1.5×IQR=1.5×12.5=18.75\text{IQR} = 79 - 66.5 = 12.5 \implies 1.5 \times \text{IQR} = 1.5 \times 12.5 = 18.75

    3. Comprobación de límites:
  • Límite superior: Q3+1.5×IQR=79+18.75=97.75Q_3 + 1.5 \times \text{IQR} = 79 + 18.75 = 97.75
  • Dado que 108>97.75108 > 97.75, el número 108108 es un valor atípico.
    4. Dibujo en el diagrama: El bigote derecho termina en el mayor valor no atípico (8282), mientras que el 108108 se marca como un punto aislado (*).

5. Interpretación de la forma de la distribución (simetría y asimetría)

⚖️ Simétrica
La mediana se ubica en el centro de la caja y ambos bigotes tienen longitudes similares. Datos equilibrados.
➡️ Asimetría positiva (derecha)
El bigote derecho es notablemente más largo y la mediana está más cerca de Q1Q_1. La cola apunta a valores altos.
⬅️ Asimetría negativa (izquierda)
El bigote izquierdo es notablemente más largo y la mediana está más cerca de Q3Q_3. La cola apunta a valores bajos.

Preguntas frecuentes

¿Cuál es la diferencia entre una asociación positiva, negativa y nula en un diagrama de dispersión?
En una asociación positiva, yy aumenta a medida que xx aumenta (los puntos suben de izquierda a derecha). En una asociación negativa, yy disminuye a medida que xx aumenta (los puntos bajan). Cuando los puntos están dispersos sin un patrón definido, no hay asociación.
¿Cómo se encuentra la ecuación de la línea de mejor ajuste?
Elige dos puntos en la línea de tendencia (x1,y1)({x}_1, {y}_1) y (x2,y2)({x}_2, {y}_2). Calcula la pendiente m=y2y1x2x1m = \frac{y_2 - y_1}{x_2 - x_1}. Luego sustituye uno de los puntos y la pendiente en y=mx+by = mx + b para despejar la intersección con el eje y (bb).
¿Qué son las frecuencias conjuntas, marginales y relativas en una tabla de doble entrada?
Las frecuencias conjuntas son los conteos dentro del cuerpo de la tabla. Las frecuencias marginales son las sumas de filas y columnas en los márgenes. Las frecuencias relativas son proporciones que se obtienen al dividir una frecuencia entre el total de la fila, columna o total general NN.
¿Cómo se determina si un dato es un valor atípico en un diagrama de caja?
Calcula el rango intercuartílico IQR=Q3Q1\text{IQR} = Q_3 - Q_1. Un valor se clasifica como atípico si es estrictamente menor que el límite inferior Q11.5×IQRQ_1 - 1.5 \times \text{IQR} o estrictamente mayor que el límite superior Q3+1.5×IQRQ_3 + 1.5 \times \text{IQR}.

¡Protege tu tecnología con SealBags! 🛡️

Organizador impermeable IP67 para electrónica, marca fundada por un veterano de los Marines (USMC). TPU duradero con cremallera resistente al agua.

Comprar bolsa SealBags#ad

Como Asociado de Amazon, recibo comisiones por compras que cumplen los requisitos.