¿Qué es el muestreo?

Una parteque hablapor el total.

El muestreo es la forma de elegir una parte de la población para estudiarla y sacar conclusiones del total. Tipos, tamaño de muestra y margen de error.

Volver al glosario
Definición

Muestreo

El muestreo es el procedimiento para elegir, dentro de una población, un grupo más pequeño que se pueda estudiar y cuyos resultados sirvan para sacar conclusiones sobre el total. En investigación de mercado se usa porque medir a los más de 6,5 millones de hogares de Chile es imposible: se mide a unos cientos o miles bien elegidos y se habla por todos. Un buen muestreo parte por definir a quién se quiere representar, y después decide cómo elegir los casos y cuántos hacen falta. De esas decisiones dependen la representatividad y el margen de error de cualquier encuesta o estudio de investigación cuantitativa.

¿Cuál es la diferencia entre muestra y muestreo?

La muestra es el grupo que se estudia; el muestreo es el procedimiento con que se eligió ese grupo. Dos encuestas del mismo tamaño pueden valer muy distinto si una se sorteó entre hogares de todo Chile y la otra se hizo en un mall un sábado.

Funciona como probar la cazuela: si la olla está bien revuelta, una cucharada basta para saber si le falta sal, y si no lo está, diez cucharadas sacadas del mismo lado dan la misma respuesta equivocada. Revolver es sortear bien. Son cuatro piezas:

  • Población: todos los que interesan para la pregunta, como los hogares que compran detergente, no todos los chilenos.
  • Marco muestral: la lista o el mapa desde donde se sortea, como un directorio de viviendas, una base de clientes o un panel. Lo que no está en el marco no puede salir en la muestra, y ese suele ser el error más caro.
  • Unidad de muestreo: lo que se elige, sea un hogar, una persona, una sala de venta o un acto de compra.
  • Muestra: los casos que de verdad se midieron, casi siempre menos que los seleccionados, porque siempre hay quien no responde.

¿Cuáles son los tipos de muestreo?

Los tipos de muestreo se dividen en dos familias. En el probabilístico, cada unidad de la población tiene una probabilidad conocida y mayor que cero de ser elegida, porque se sortea. En el no probabilístico, la selección depende del criterio del investigador o de quién está disponible. Solo el primero permite calcular un margen de error en sentido estricto.

En la práctica se combinan. La Casen 2024, la encuesta de hogares del Ministerio de Desarrollo Social y Familia, divide el país en estratos por comuna, zona urbana o rural y nivel socioeconómico; dentro de cada estrato sortea grupos de viviendas y después viviendas dentro de esos grupos. Es un muestreo estratificado y por conglomerados a la vez. De la lista, los cuatro primeros tipos son probabilísticos y los otros cuatro, no probabilísticos:

  • Aleatorio simple: se sortean casos de una lista completa, como la base de clientes de un programa de fidelización. En terreno, una lista así pocas veces existe.
  • Sistemático: uno de cada k casos desde un inicio al azar, como una de cada diez personas que salen de la sala de venta.
  • Estratificado: la población se divide en grupos, como región o zona urbana y rural, y se sortea dentro de cada uno. Asegura casos en cada grupo y suele mejorar la precisión.
  • Por conglomerados: se sortean grupos completos, como manzanas, y luego casos dentro de ellos. Baja el costo de terreno a cambio de precisión, porque los vecinos se parecen entre sí.
  • Por conveniencia: se encuesta a quien está a mano, como los seguidores de la marca en Instagram o quienes pasan por una degustación. Es barato y no permite generalizar.
  • Por cuotas: se fija cuántos casos debe haber por sexo, edad o grupo socioeconómico y se llenan sin sorteo. Es común en encuestas online.
  • Intencional: el investigador elige casos con un perfil, como en un focus group.
  • Bola de nieve: cada participante recomienda al siguiente. Sirve para grupos difíciles de ubicar, como dueños de almacenes de barrio.

¿Cómo se hace un muestreo paso a paso?

Un muestreo se hace en seis pasos, que van de definir a quién se quiere representar hasta ponderar y reportar el resultado. Los dos primeros pesan más en la calidad del estudio que el tamaño de la muestra:

  • Definir la población desde la pregunta de negocio. Si la pregunta es por qué la marca pierde compradores, la población son quienes la compraban, no todos los hogares.
  • Elegir el marco y ver a quién deja fuera, como a quienes no usan internet en una encuesta online.
  • Elegir el método de selección según el presupuesto y cuánto hay que generalizar.
  • Calcular el tamaño para el total y para cada subgrupo que se leerá por separado.
  • Seleccionar y salir a terreno, sumando casos extra por los que no van a responder.
  • Ponderar y reportar el método, el tamaño y el margen de error.

¿Cómo se calcula el tamaño de muestra?

El tamaño de muestra depende de tres datos: la confianza que se exige, que casi siempre es 95%, el margen de error que se acepta y cuánto varía lo que se mide. Para un porcentaje, n = z² × p × (1 − p) / e², con z = 1,96 para 95% de confianza. Si no hay una estimación previa se usa p = 0,5, el caso más exigente. Para un promedio, como el ticket promedio, se usa la desviación estándar, que mide cuánto se alejan los datos de ese promedio.

El margen manda porque va al cuadrado: bajarlo a la mitad exige cuatro veces más casos. Medir con ±1 punto y 95% de confianza pide 9.604 casos, el ejemplo clásico de los manuales, y por eso los estudios comerciales rara vez bajan tanto.

El tamaño de la población casi no influye mientras la muestra sea menos del 5% de ella: 1.000 casos dan casi el mismo margen en una comuna grande que en todo el país. Chile tiene 6.596.527 hogares según el Censo 2024, y 1.000 son menos del 0,02%. Solo cuando la muestra es una parte grande del total, como al medir las salas de venta de una cadena, se aplica la corrección por población finita de la fórmula.

En consumo masivo, el tamaño que manda casi nunca es el de encuestas, sino el de compradores de la categoría o de la marca. Ejemplo ilustrativo: si una categoría tiene 8% de penetración, juntar 400 compradores exige contactar a unos 5.000 hogares, y el costo del estudio lo pone ese filtro, no la fórmula. Por eso elegir el marco es una decisión de presupuesto antes que de estadística.

¿Qué es el margen de error y cómo se lee?

El margen de error es el rango, en puntos porcentuales, donde probablemente está el valor real de la población. Si una encuesta con ±3 puntos y 95% de confianza dice 58%, el valor real debería estar entre 55% y 61%. El 95% quiere decir que, si se repitiera la encuesta 100 veces con muestras distintas, en unas 95 ese rango contendría el valor real. El margen es mayor cuando el resultado ronda el 50%. Al leerlo hay que mirar cinco cosas:

  • No vale para los subgrupos: con 1.000 personas el total tiene cerca de ±3 puntos, pero un grupo de 200 dentro de ellas tiene ±6,9.
  • Baja lento: pasar de 1.000 a 2.000 casos lo reduce en cerca de un punto.
  • Una diferencia tiene su propio error, más grande que el de cada medición. Ejemplo ilustrativo: con 1.000 casos en cada medición, si el conocimiento de una marca pasa de 30% a 33%, no se puede afirmar que subió: la diferencia entre dos muestras independientes así tiene un margen cercano a ±4 puntos.
  • Engaña con porcentajes chicos. Ejemplo ilustrativo: una penetración de 5% medida en 1.000 hogares tiene cerca de ±1,4 puntos. Suena preciso, pero el valor real puede estar entre 3,6% y 6,4%, más de un cuarto hacia arriba o hacia abajo.
  • Solo mide el azar del muestreo: no incluye preguntas mal hechas, personas que no responden ni fallas de memoria.

¿Qué es una muestra representativa y para qué sirve ponderar?

Una muestra representativa reproduce la composición de la población en las variables que importan para la pregunta: región, edad, nivel socioeconómico, tamaño del hogar y, en consumo masivo, el canal de compra. No depende del tamaño sino del muestreo: una muestra grande y mal elegida repite su sesgo con más precisión.

Ponderar es darle un peso a cada caso para que la muestra vuelva a parecerse a la población cuando un grupo quedó sobre o subrepresentado.

Ejemplo ilustrativo: una encuesta online junta 60% de sus respuestas en la Región Metropolitana, que según el Censo 2024 tiene el 40% de la población. Cada caso de la región pesa 40/60 = 0,67 y cada caso del resto del país, 60/40 = 1,5.

En la Casen 2024, cada vivienda pesa según el inverso de su probabilidad de selección, con ajustes por no respuesta y por las proyecciones de población. Aun así, ningún peso recupera a un grupo que casi no está en la muestra.

Ponderar y sortear por conglomerados también agrandan el error. La Casen 2024 llama efecto del diseño a cuánto habría que agrandar la muestra para igualar la precisión de un muestreo aleatorio simple, y según la AAPOR, la asociación estadounidense de investigadores de opinión pública, la mayoría de las encuestas de buena calidad lo incluye en el margen que informa.

Ejemplo ilustrativo: con un efecto del diseño de 1,5, una encuesta de 1.200 casos rinde como una de 800 sorteados al azar, y su margen real pasa de ±2,8 a ±3,5 puntos.

¿Qué errores de muestreo son comunes en consumo masivo?

Los errores de muestreo que más se repiten en consumo masivo no vienen de una muestra total chica, sino de cómo se leen y se comparan sus partes:

  • Leer marcas chicas con la muestra del total. Ejemplo ilustrativo: con 8% de penetración, una encuesta de 1.000 hogares trae unos 80 compradores de la marca, y cualquier porcentaje leído entre ellos, como cuántos la recomendarían, tiene un margen cercano a ±11 puntos.
  • Filtrar por lo declarado: preguntar si compró la marca el último mes depende de la memoria, y ese error no se cancela al promediar, como explica el artículo compra real vs. encuesta declarada. Las encuestas a compradores verificados eligen a quién preguntar con un registro de la compra.
  • Comparar oleadas con muestras distintas: si cambian el marco o las cuotas entre una medición y otra, parte de la variación viene de la muestra y no del mercado. Un panel de hogares mide a los mismos hogares en el tiempo, así que cada hogar se compara consigo mismo.
Cómo se calcula

La fórmula

Tamaño de muestra para un porcentaje: n = z² × p × (1 − p) / e². Margen de error: e = z × √(p × (1 − p) / n). Tamaño para un promedio: n = (z × σ / e)². Donde z = 1,96 para 95% de confianza, p = porcentaje esperado (0,5 si no se conoce), e = margen de error aceptado y σ = desviación estándar. Si la muestra supera el 5% de una población N, el margen se multiplica por √((N − n) / (N − 1)). Con un diseño complejo, el tamaño efectivo es n dividido por el efecto del diseño.

Ejemplo ilustrativo: una marca de galletas quiere saber qué porcentaje de los hogares que compran galletas conoce su nuevo sabor. Con 95% de confianza y p = 0,5, un margen de ±5 puntos exige 385 encuestas y uno de ±3 puntos, 1.068. A $3.500 por encuesta completa, el estudio sube de $1.347.500 a $3.738.000, casi el triple, por 2 puntos de precisión. Leer aparte la Región Metropolitana y el resto del país con ±5 puntos en cada zona pide 770 casos, $2.695.000: cada grupo que se lee por separado cuesta como un estudio propio.

Cómo lo mide Kobai

Medido con boletas reales

En Kobai, la unidad de muestreo es el hogar y el dato es su compra real, leída de la boleta. Entrar al panel continuo exige subir boletas todos los meses, y los indicadores del Shopper Panel se abren por generación, grupo socioeconómico y zona para ver qué hogares hay detrás de cada cifra. La boleta quita el error de recuerdo, pero no el de muestreo ni lo que queda fuera del marco: lo que se compra sin boleta, como buena parte de la feria, no entra, y los análisis de marca se calculan sobre el canal supermercado. En Panel Target, el marco de la encuesta son solo los compradores que su boleta prueba.

Más sobre qué se mide con boletas de compra.

Ver Panel Target

Preguntas frecuentes

Lo que más se pregunta

¿Qué es el muestreo en una investigación de mercado?

Es la forma de elegir a los hogares, compradores o tiendas que se van a medir en un estudio, para que lo encontrado en ellos se pueda extender a todo el mercado. En consumo masivo define, por ejemplo, si una encuesta representa a los compradores de una categoría en todo Chile o solo a quienes respondieron en una comuna.

¿Qué diferencia hay entre el muestreo probabilístico y no probabilístico?

En el probabilístico cada unidad de la población tiene una probabilidad conocida de ser elegida por sorteo, y eso permite calcular un margen de error. En el no probabilístico la selección depende del criterio del investigador, de cuotas o de quién está disponible, y en rigor describe a quienes respondieron. Es más barato y sirve si se pondera y se declaran sus límites.

¿Cuál es el tamaño de muestra mínimo para una encuesta?

No hay un mínimo universal: depende del margen de error que se acepta y de los grupos que se quieren leer por separado. Como referencia, 1.000 personas dan cerca de ±3 puntos con 95% de confianza, y un grupo de 200 dentro de ellas, ±6,9 puntos. Cada segmento que necesite su propia lectura necesita su propio tamaño.

¿Una muestra más grande siempre es más representativa?

No. El tamaño reduce el error aleatorio, pero no corrige un sesgo: si la muestra deja fuera a los hogares de regiones o a quienes no usan internet, agrandarla solo repite el mismo sesgo con más precisión. La representatividad depende del marco y del método de selección, así que una muestra chica y bien diseñada puede superar a una grande reunida por conveniencia.

¿Se puede calcular el margen de error de una encuesta online?

Si es una encuesta abierta, en la que responde quien quiere, en sentido estricto no. Según la AAPOR, el margen de error solo se aplica a muestras probabilísticas, donde cada persona tiene una probabilidad conocida de ser elegida. Para las encuestas online abiertas a veces se informa un intervalo de credibilidad, que depende de supuestos difíciles de validar.

¿Quieres medir esto en tu categoría?

Te mostramos cómo se ve con datos reales en una reunión de quince minutos.

Agendar 15 minutos