Mostrando entradas con la etiqueta estadística. Mostrar todas las entradas
Mostrando entradas con la etiqueta estadística. Mostrar todas las entradas

viernes, 24 de septiembre de 2021

La técnica de marcaje y recaptura para estimar el número total de individuos de una población

    La técnica de marcaje y recaptura se suele emplear en ecología para estimar el número total de individuos, $N$, de una cierta especie que habitan en un área delimitada, y consiste en extraer una primera muestra de tamañó $n$, marcando con algún tipo de señal todos los individuos de la misma, liberando después a dichos individuos. Pasado un tiempo razonable, al objeto de que la población se redistribuya de manera homogénea, se extrae una segunda muestra de $m$ individuos, de los cuales, se espera que encontaremos entre ellos $m'$ individuos marcados (que ya formaban parte de la primera muestra). Entonces, teniendo en cuenta que la razón aritmética entre el número de individuos marcados y el número total de individuos en cada muestra debería ser aproximadamente constante, tandrá que cumplirse de manera aproximada la siguiente proporción:
$\dfrac{m'}{m} \sim \dfrac{n}{N}$, y por tanto, el número total de individuos de dicha especie que se estima que hay en el área en la que realizamos el estudio es $N \sim \dfrac{n\,m}{m'}$

Ejemplo del tipo que puede encontrarse en (Yates, 2020):   Queremos estimar el número de caracoles que hay en un jardín. Para ello, capturamos ( en una primera muestra ) 23 individuos ( $n=:23$ ) y los marcamos pegándoles una discreta etiqueta adhesiva en la concha antes de soltarlos. Unos días después, realizamos capturamos otro grupo de caracoles, esta vez fueron ($m=:18$), de los cuales $m'=:3$ tenían la marca que pusimos a los individuos de la primera muestra. Estimemos el número de caracoles, $N$, que hay en el jardín: como
$\dfrac{3}{18} \sim \dfrac{23}{N}$, de donde se obtiene que el número estimado de caracoles que hay en el jardín es $N \sim \dfrac{23\cdot 18}{3} = 138$ individuos en total.
-oOo-

Referencias:
  [1] Yates, K., Los números de la vida, Blackie Books, 2020
  [2] Piñol, J.; Martínez-Vilalta, J., Ecología con números, Lynx, Barcelona, 2006

$\square$

miércoles, 28 de abril de 2021

Sobre la estadística inferencial: población y muestreo

Estadística inferencial. Sobre la población y el muestreo de la misma.

    Consideremos una determinada característica de una población a la cual asociamos una variable aleatoria $X$, observable, con una distribución de probabilidad supuesta (de la cual conocemos algunos o ninguno de sus parámetros) o, quizá, incluso podría darse el caso que la distribución de probabilidad de dicha variable fuese desconocida. Uno de los objetivos de la Inferencia Estadística es el de estimar el valor de los parámetros desconocidos, ya sea de forma puntual o bien mediante el cálculo de intervalos de confianza; otro objetivo igualmente importante es el de realizar contrastes de hipótesis.

La fiabilidad de los resultados de los estudios de inferencia estadística -- que pasa por medir/observar el valor de la característica ( en estudio ) en un subconjunto de la población -- requiere que la elección de la muestra se haya hecho de tal manera que sea representativa y, por tanto, debe contemplarse la independencia de elección de sus diversos elementos y, además, ésto tiene que hacerse de forma aleatoria, de tal manera que todos los individuos de la población tengan la misma probabilidad de ser elegidos para formar parte de la muestra. Si la muestra no es representativa, ésta contendrá sesgo con lo cual toda conclusión que se extraiga del estudio no será razonablemente correcta.

Por lo que se acaba de exponer, el tipo de muestreo ideal es el que denominamos muestreo aleatorio simple, que describimos a continuación. Este tipo de muestreo es el que se supondrá en todos los ejercicios que realizaremos en este curso. Sin embargo, en la práctica, es a menudo difícil llevar a cabo este muestreo ideal; por ello, y solamente a nivel informativo debemos citar también tres tipos más de muestreo en los que el sesgo, si bien será pequeño, no será nulo ( habrá que ir con cuidado ): el muestreo aleatorio sistemático ( se escogen los individuos siguiendo una pauta repetitiva a partir de un primer individuo elegido al azar ), el muestreo aleatorio estratificado ( deben mantenerse unas proporciones si la población está formada por varias subpoblaciones con rasgos diferenciales ), y el muestreo aleatorio por conglomerados o áreas ( en el que el muestreo tiene en cuenta los distintos bloques/zonas/áreas en los que se ubican los individuos de la población). Has otros tipos de muestreo, con menor aleatorización que los anteriores, que, si duda introducirán sesgo y, por tanto, habrá que tener muy en cuenta ésto a la hora de emitir conclusiones: el muestreo de tipo errático o casual ( encuestas en la cola de un cine, por ejemplo), el muestreo de efecto bola de nieve ( sondeos en las redes sociales, por ejemplo, en los que un formulario se difunde a través de los servicios de mensajería de la red ), el muestreo por cuotas ( en los que los individuos de la muestra son seleccionados si y solo si cumplen determinados condiciones ) y el muestreo intencionado ( en los que los individuos de la muestra son seleccionados con una fuerte presencia de criterios no aleatorios y, por tanto, suponen un sesgo muy importante ). Vamos a profundizar ahora en algunos detalles.

Muestreo aleatorio simple
    Una muestra aleatoria simple de la población está formada por $n$ observaciones independientes $x_1,x_2,\ldots,x_n$ de la variable aleatoria $X$, entendiéndose por cada $x_i$, ( $i=1,\ldots,n$ ) el valor de la variable aleatoria $X$ observada/medida en el individuo seleccionado al azar y que ocupa el lugar $i$-ésimo, de tal manera que todos los individuos de la población tengan las misma probabilidad de ser elegidos para formar parte de la muestra.

Dicho ésto, podemos ahora interpretar/entender de manera más formal el muestreo aleatorio simple (m.a.s.) de la variable aleatoria $X$ como uno una sucesión de variables aleatorias independientes y del mismo tipo, $X_1,\ldots,X_n$, con la misma distribución de probabilidad que la variable $X$.

Teorema Central del Límite
Dada un muestreo aleatorio simple formado por una sucesión de variables aleatorias independientes $X_1,\ldots\,X_n$ con la misma varianza y la misma media que la variable aleatoria $X$ que sirve de modelo a una cierta característica de la población, entonces la variable aleatoria $(X_1+\ldots+X_n)/n$, que corresponde al estimador $\overline{x}$ de la media $\mu$, sigue una distribución de probabilidad normal $N(\mu\,,\,\sqrt{n}\,\sigma$, por tanto la variable tipificada
    $\dfrac{(X_1+\ldots+X_n)/n - \mu}{\sigma / \sqrt{n}}$
sigue una distribución normal $N(0,1)$.

Observación/comentario:
En muchos problemas de estimación de la media $\mu$ mediante el estimador $\overline{x}$ de la misma, cuya variable aleatoria (en el muestreo) tipificada es
    $\dfrac{\overline{x} - \mu}{\sigma / \sqrt{n}} \sim N(0,1)$
nos toparemos, no obstante, con dos dificultades a la hora de aplicar el TCL: una de ellas será debido a que las muestras puedan ser demasiado pequeñas con lo cual deja deja de tener validez, y, por otra parte, también es muy frecuente no conocer la varianza $\sigma^2$ de la población y, por tanto, tampoco la desviación típica $\sigma$ con lo cual deberemos estimarla, por medio del estimador insesgado de la misma, que es la cuasivarianza, es decir, mediante
    $\displaystyle S^2=\dfrac{1}{n-1}\,\sum_{i=1}^{n}\,(x-\mu)^2$
y de aquí obtener la cuasidesviación típica
    $\displaystyle S=\sqrt{\dfrac{1}{n-1}\,\sum_{i=1}^{n}\,(x-\mu)^2}$
ello nos permitirá operar con otro estimador de la media poblacional:
    $t_{n-1}=\dfrac{\overline{x} - \mu}{S / \sqrt{n}}$
cuya distribución no es $N(0,1)$ sino otra d. conocida como distribución de Student ( debida a William Gosset ) -- con $n-1$ grados de libertad, tal como se anota arriba --, además, funciona también bastante bien para muestras pequeñas. Por supuesto, encontraremos tabulados sus valores en los libros de tablas estadísticas.

Conceptos básicos empleados en el contraste de hipótesis

Dado el contraste de hipótesis $H_0$ ( hipótesis nula, que se toma como hipótesis estándar ) frente a $H_1$ ( hipótesis alternativa ), y dado un estadístico ( que es una variable aleatoria dependiente de las variables aleatorias del muestreo aleatorio simple ) $X_1,\ldots,X_n$, y un valor observado de éste en la muestra, es importante recordar los conceptos básicos que aparecen en escena en cualquier problema de contraste de dichas hipótesis a partir de la inferencia de parámetros de la población (mediante la distribución de probabilidad del estadístico del contraste) y del valor del mismo observado en la muestra seleccionada. Son los siguientes:

  • Error de tipo I:

    Se define como la siguiente probabilidad
    $\text{Error de tipo I}:=P( \text{rechazar} \; H_0 \; | \; H_0 \; \text{cierta} )$
        Un valor fijado de antemano para dicha probabilidad, pongamos que del $0'01$ o del $0'05$ ( pues debe ser pequeña para no rechazar sin razón suficiente la hipótesis estándar o nula ), se denota por $\alpha$ y se denomina coeficiente de significación del test. El nivel de significación observado o la probabilidad observada en la muestra de rechazar la hipótesis nula siendo ésta cierta se conoce como p-valor, y representa el menor coeficiente de significación, $\alpha$, con el que poder rechazar la hipótesis nula.

    Dependiendo del tipo de contraste ( bilateral o unilateral ), y denotando por: $\hat{\theta}$ al estadístico del contraste, por $\theta$ a la variable de la población, y por $\theta_0$ al valor de referencia de dicha variable que nos sirve para discriminar la hipótesis nula de la alternativa, el cálculo del p-valor se realiza como sigue:

    Test bilateral:
    Contrastamos $H_0:\,\theta=\theta_0$ frente a a $H_1:\,\theta \neq \theta_0$
    $\text{p-valor}:=P(\text{rechazar H_0 | H_0 cierta})$
          $=P\{|\hat{\theta}|\ge \theta_0 | H_0 \}$

    Test unilateral con la región crítica a la derecha:
    Contrastamos $H_0:\,\theta=\theta_0$ frente a a $H_1:\,\theta \neq \theta_0$
    $\text{p-valor}:=P(\text{rechazar H_0 | H_0 cierta})$
          $=P\{\hat{\theta} \ge \theta_0 | H_0 \}$

    Test unilateral con la región crítica a la izquierda:
    Contrastamos $H_0:\,\theta=\theta_0$ frente a a $H_1:\,\theta \neq \theta_0$
    $\text{p-valor}:=P(\text{rechazar H_0 | H_0 cierta})$
          $=P\{\hat{\theta} \le \theta_0 | H_0 \}$

    En muchos casos, como ya se ha comentado, se fija de antemano el nivel de significación del test $\alpha$ y se realiza el contraste a partir de si el valor observado del estadístico de contraste pertenece o no al intervalo de aceptación de la hipótesis nula, aceptando ésta si es así, y rechazándola en caso contrario. No obstante, suele calcularse también el p-valor, para ratificar la decisión tomada al disponer de una medida más real del error de tipo I, que en definitiva es de lo que se está hablando; así, si $\text{p-valor} \ge \alpha$, podremos enunciar con más garantía la decisión tomada de aceptar $H_0$, valorando la determinación o fuerza de nuestra decisión según sea el p-valor mucho mayor o casi igual al nivel de significación que, en un principio, se creyó que podría tomarse ante la naturaleza del problema. Por supuesto, si el p-valor fuese menor que el nivel de significación fijado o bien fuese claramente pequeño, pongamos por ejemplo que inferior a $0'01$ - y ya no digamos si fuese mucho menor que ese valor -, deberíamos rechazarnos la hipótesis nula.

  • Nivel de confianza del contraste:

    Se define como la siguiente probabilidad
    $P( \text{aceptar} \; H_0 \; | \; H_0 \; \text{cierta} )=1-P( \text{rechazar} \; H_0 \; | \; H_0 \; \text{cierta} )$
        Por lo tanto, fijado de antemano el coeficiente de significación, $\alpha$, del test, entonces el coeficiente de confianza es el complemento a $1$ del mismo, es decir, $1-\alpha$; así, si, por ejemplo, el coeficiente de significación del test es de $0'01$, el coeficiente de confianza es de $0'99$.

  • Error de tipo II:

    Se define como la siguiente probabilidad y se suele denotar por el símbolo $\beta$
    $\beta:=P( \text{aceptar} \; H_0 \; | \; H_0 \; \text{falsa} )$
       

  • Potencia del test (o del contraste):

    Se define como la probabilidad
    $\text{Potencia del contraste}:=P( \text{rechazar} \; H_0 \; | \; H_0 \; \text{falsa} )$
          $=1-P( \text{aceptar} \; H_0 \; | \; H_0 \; \text{falsa} )=1-\beta$
        Dada su definición, es evidente que es deseable que el test de contraste tenga un potencia alta, pongamos que mayor que $0'9$.



Contrastes bilaterales y unilaterales con estadísticos que sigan una distribución en el muestreo aproximadamente normal

En lo que sigue, supondremos que el estadístico $\hat{\theta}$ - que es una variable aleatoria con la cual planteamos los contrastes de hipótesis y con el que podemos estimar el valor del parámetro $\theta$ de la varibale $X$ en estudio de la población a partir de un muestreo aleatorio simple - tiene una distribución en el muestreo $N(\theta\,,\,\sigma(\hat{\theta}))$, es decir es una distribución normal o aproximadamente normal, y, por tanto, su variable tipificada es $(\hat{\theta} - \theta) / \sigma(\hat{\theta}) \approx N(0,1)$.

En todo contraste, nos proponemos caracterizar los intervalos de aceptación y rechazo de una hipótesis estándar ( que denominamos hipótesis nula ), $H_0$, frente a una hipótesis alternativa, $H_1$, donde supondremos que una y otra se formulan a partir de un valor supuesto $\theta_0$ del parámetro $\theta$ de la variable aleatoria de la población. Ésto se hará suponiendo un coeficiente de confianza de $1-\alpha$ y, por tant, con un coeficiente de singificación $\alpha$.

Una vez hayamos establecido los valores críticos del estadístico que determinan dichos intervalos, decidiremos aceptar la hipótesis nula si el valor observado del estadístico en la muestra seleccionada cae dentro del intervalo de aceptación de dicha hipótesis, y la rechazaremos si cae fuera del mismo.

Según la disposición ( en la recta numérica en la que representamos los valores del estadístico ) de las zonas/intervalos de aceptación y rechazo de la hipótesis nula, describiremos a continuación los tres casos posibles que pueden aparecer, que denominaremos: test bilateral; test unilateral derecho; o bien, test unilateral izquierdo. Para ello, deberemos encontrar los puntos críticos ( puntos de separación de dichas zonas/intervalos ), por tanto describiremos también la condición que se debe cumplir para tomar la decisión de aceptar ( respectivamente, rechazar ) la hipótesis nula de acuerdo con la ubicación del valor observado del estadístico ( medido en la muestra seleccionada ) dentro ( o fuera ) de la zona de aceptación de la hipótesis nula.

Test bilateral a nivel de significación $\alpha$
    Dado un valor supuesto, $\theta_0$, del parámetro $\theta$ de la población ( que es desconocido ), consideremos el siguiente contraste de la hipótesis nula ( fundamental o estándar ) $H_{0}:\,\theta=\theta_0$ frente a la hipótesis alternativa $H_{1}:\,\theta \neq \theta_0$.

El intervalo de aceptación de la hipótesis nula será tal que $\theta_0 - c \le \hat{\theta} \le \theta_0 + c$ con un nivel de confianza $1-\alpha$, donde $c$ es un número real que dependerá del margen de error de la estimación. Como queremos determinar dicho intervalo el objetivo es, precisamente, obtener el valor de $c$ a nivel de significación $\alpha$ ( o en otras palabras, con un nivel de confianza $1-\alpha$ ). Entonces, si se cumple la hipótesis nula a nivel de confianza $1-\alpha$ podremos expresarlo de la siguiente forma:
    $P\{\theta_0 - c \le \hat{\theta} \le \theta_0 + c\}=1-\alpha$
que es lo mismo que
    $P\{\theta_0 - c - \theta_0 \le \hat{\theta} - \theta_0 \le \theta_0 + c - \theta_0\}=1-\alpha$
es decir
    $P\{- c \le \hat{\theta} - \theta_0 \le c \}=1-\alpha$
y, dividiendo por la desviación típica del estadístico en cada miembro de la doble desigualdad del argumento de la probabilidad, podemos también escribir
    $P\{\dfrac{- c}{\sigma({\hat{\theta}})} \le \dfrac{\hat{\theta} - \theta_0}{\sigma({\hat{\theta}})} \le \dfrac{c}{\sigma({\hat{\theta}})}\}=1-\alpha$
y por la tipificación de la variable aleatoria del estadístico $\hat{\theta}$:
    $Z:=\dfrac{\hat{\theta} - \theta_0}{\sigma({\hat{\theta}})} \approx N(0,1)$
podemos expresar la última línea de la forma
    $P\{\dfrac{- c}{\sigma({\hat{\theta}})} \le Z \le \dfrac{c}{\sigma({\hat{\theta}})}\}=1-\alpha$
y operando con la d. normal se obtiene
    $P\{Z \ge \dfrac{c}{\sigma({\hat{\theta}})}\}=\alpha / 2$
denotando por $z_{\alpha /2}$ a la abscisa de la función de densidad de probabilidad $f(z)$ que deja a su derecha el $(\alpha / 2)\cdot 100 \, \% $ de probabilidad ( valor que encontramos en las tablas de $Z \sim N(0,1)$, podemos escribir
    $P\{ Z \ge z_{\alpha / 2} \}=\alpha / 2$
y por tanto, al ser
    $z_{\alpha / 2} = \dfrac{c}{\sigma({\hat{\theta}})}$
obtenemos el valor de $c$
    $c=z_{\alpha / 2} \cdot \sigma({\hat{\theta}})$
Con lo cual, los valores críticos ( extremos del intervalo de aceptación de $H_0$ ) son
    $\theta_0-z_{\alpha / 2} \cdot \sigma({\hat{\theta}})$
y
    $\theta_0+z_{\alpha / 2} \cdot \sigma({\hat{\theta}})$
respectivamente.

Es decir, el intervalo de aceptación de $H_0$, que denotamos por $C^{*}$, es
    $C^{*}=[\;\theta_0-z_{\alpha / 2} \cdot \sigma({\hat{\theta}})\,,\,\theta_0+z_{\alpha / 2} \cdot \sigma({\hat{\theta}})\;]$

Por tanto, si el valor observado del estimador de $\theta$, $\hat{\theta}$, en la muestra seleccionada pertenece a $C^{*}$, decidiremos aceptar $H_0$ a un nivel de significación $\alpha$. En otras palabras, aceptaremos $H_0$ si $\dfrac{|\hat{\theta}_{\text{observado}}-\theta_0|}{\sigma(\hat{\theta})} \le z_{\alpha / 2}$; en caso contrario, rechazaremos $H_0$, aceptando la hipótesis alternativa $H_1$.

Test unilateral a la izquierda a nivel de significación $\alpha$
Sea el siguiente contraste de hipótesis:
$H_0:\,\theta \le \theta_0$ ( hipótesis nula ) frente a $H_1:\,\theta \succ \theta_0$ ( hipótesis alternativa ).
Aceptamos $H_0$ a nivel de significación $\alpha$ - esto es, a nivel de confianza $1-\alpha$ - si $P\{\hat{\theta} \le \theta_0-c\}=1-\alpha$, es decir, si $P\{\dfrac{\theta-\theta_0}{\sigma(\hat{\theta})} \le -\dfrac{c}{\sigma(\hat{\theta})} \}=1-\alpha \Leftrightarrow P\{\dfrac{\theta-\theta_0}{\sigma(\hat{\theta})} \ge -\dfrac{c}{\sigma(\hat{\theta})} \}=\alpha$ siendo $-\dfrac{c}{\sigma(\hat{\theta})}$ el punto crítico $z_{\alpha}$ ( que es la abscisa de $f(z)$ que deja a su derecha el $\alpha \cdot 100 \, \%$ de la distribución ) y que obtenemos de las tablas $Z \sim N(0,1)$.

Por tanto, el intervalo de aceptación de $H_0$ es $C^{*}=(-\infty \,,\, \theta_0-(-z_{\alpha} \cdot \sigma(\hat{\theta})\,]$, es decir, $C^{*}=(-\infty \,,\, \theta_0+z_{\alpha} \cdot \sigma(\hat{\theta}\,]$. Luego, si $\hat{\theta}_{\text{observado}} \in C^{*}$, entonces aceptaremos $H_0$; o lo que es lo mismo, aceptamos $H_0$ si el valor del estadístico en su variable tipificada es tal que $\dfrac{\hat{\theta}_{\text{observado}}-\theta_0}{\sigma(\hat{\theta})} \le z_{\alpha}$; en caso contrario, rechazaremos $H_0$, aceptando la hipótesis alternativa $H_1$.


Test unilateral a la derecha a nivel de significación $\alpha$
Sea el siguiente contraste de hipótesis:
$H_0:\,\theta \ge \theta_0$ ( hipótesis nula ) frente a $H_1:\,\theta \prec \theta_0$ ( hipótesis alternativa ).
Aceptamos $H_0$ a nivel de significación $\alpha$ - esto es, a nivel de confianza $1-\alpha$ - si $P\{\hat{\theta} \ge \theta_0+c\}=1-\alpha$, es decir, si $P\{\dfrac{\theta-\theta_0}{\sigma(\hat{\theta})} \ge \dfrac{c}{\sigma(\hat{\theta})} \}=1-\alpha$, siendo $\dfrac{c}{\sigma(\hat{\theta})}$ el punto crítico $z_{1-\alpha}$ ( que es la abscisa de $f(z)$ que deja a su derecha el $\alpha \cdot 100 \, \%$ de la distribución ) y que obtenemos de las tablas $Z \sim N(0,1)$.

Por tanto, el intervalo de aceptación de $H_0$ es $C^{*}=[\,\theta_0+z_{\alpha} \cdot \sigma(\hat{\theta})\,,\,\infty\,)$. Luego, si $\hat{\theta}_{\text{observado}} \in C^{*}$, entonces aceptaremos $H_0$; en otras palabras, aceptamos $H_0$ si el valor del estadístico en su variable tipificada es tal que $\dfrac{\hat{\theta}_{\text{observado}}-\theta_0}{\sigma(\hat{\theta})} \ge z_{1-\alpha}$; en caso contrario, rechazaremos $H_0$, aceptando la hipótesis alternativa $H_1$.

$\square$


martes, 20 de abril de 2021

Un artículo acerca de la llamada Ley de Benford en la Revista de Física de la RSEF

En muchos (?) resgistros experimentales aparecen confirmaciones de este controvertido y extraño comportamiento de los datos. Referencia:
BURGOS, A.; SANTOS, A.: "Newcomb, Benford y la aristrocracia del primer dígito", Revista Española de Física 35, 11-14, (2021)