¿Qué es el efecto de diseño?
El Efecto de Diseño (DEFF) es un valor numérico que cuantifica la pérdida de precisión estadística al emplear un diseño de muestreo complejo en lugar de un muestreo aleatorio simple. Actúa como un factor de corrección esencial para asegurar la validez del tamaño de su muestra, especialmente cuando el trabajo de campo no permite una selección aleatoria perfecta de la población objetivo.
En términos prácticos: si su DEFF es 1.8, cada entrevista obtenida mediante muestreo por conglomerados contribuye con aproximadamente el 55% de la información que aportaría una entrevista de muestreo aleatorio simple. Para lograr la misma precisión que una muestra aleatoria simple de 300, necesitará 540 entrevistas por conglomerados. Si se omite esta corrección, la encuesta resultante no tendrá la capacidad de responder a la pregunta para la cual fue diseñada.
El Efecto de Diseño no debe verse como una penalización por el muestreo por conglomerados. De hecho, el muestreo por conglomerados es a menudo la única opción práctica cuando no se dispone de una lista de hogares utilizable, la dispersión geográfica hace que el recorrido sea demasiado costoso, o los límites de la población coinciden con conglomerados administrativos. La corrección simplemente asegura que el cálculo del tamaño de la muestra se ajuste adecuadamente al diseño de campo.
¿Cuándo se aplica?
El Efecto de Diseño se aplica siempre que el diseño de muestreo agrupa a los encuestados de tal forma que las observaciones dentro de un grupo son más similares entre sí que las observaciones entre grupos. En la práctica de monitoreo y evaluación, esta situación es más frecuente en el muestreo por conglomerados, donde primero se seleccionan unidades como aldeas o escuelas, y luego hogares o estudiantes dentro de estas.
| Diseño de muestreo | ¿Aplica DEFF? | Rango típico |
|---|---|---|
| Muestreo aleatorio simple | No | 1.0 |
| Muestreo aleatorio estratificado | No, puede ser ligeramente inferior a 1.0 | 0.9-1.0 |
| Muestreo por conglomerados (una etapa) | Sí | 1.3-2.5 |
| Muestreo por conglomerados (multietapa) | Sí, se acumula en las etapas | 1.5-3.0 |
| Muestreo sistemático en marcos homogéneos | Usualmente no | ~1.0 |
El muestreo estratificado, que implica dividir la población en subgrupos antes de la selección de la muestra, puede incluso generar un DEFF ligeramente inferior a 1.0, ya que la estructura del subgrupo tiende a reducir la varianza. Sin embargo, la mayoría de los programas de monitoreo y evaluación no suelen aprovechar esta ventaja; en su lugar, utilizan el muestreo por conglomerados para facilitar la logística y, a menudo, omiten la aplicación del ajuste DEFF correspondiente. Esto conduce a una tendencia sistemática al submuestreo.
Para definiciones de los enfoques de muestreo, consulte muestreo por conglomerados, muestreo aleatorio y métodos de muestreo.
La fórmula y su significado
La fórmula estándar para calcular el Efecto de Diseño es:
DEFF = 1 + (m - 1) x ICC
Se requieren tres elementos:
- m: el número promedio de entrevistas completadas por conglomerado (también conocido como tamaño del conglomerado).
- ICC: el coeficiente de correlación intraclase, un valor entre 0 y 1 que cuantifica la similitud de las observaciones dentro de un conglomerado en comparación con las observaciones entre conglomerados.
- El valor 1 representa el DEFF de referencia para el muestreo aleatorio simple.
Por ejemplo, si se planea encuestar 20 hogares en cada una de 30 aldeas, y el ICC para los resultados de seguridad alimentaria en contextos similares es 0.05, el DEFF se calcularía como 1 + (20 - 1) x 0.05 = 1 + 0.95 = 1.95. Si el tamaño de muestra requerido bajo muestreo aleatorio simple es 350, al multiplicarlo por el DEFF, la muestra real necesaria ascendería a 682 entrevistas, distribuidas en las 30 aldeas a aproximadamente 23 por aldea, en lugar de 20.
La fórmula revela que conglomerados más grandes implican una mayor similitud interna y, por ende, un DEFF más elevado. Por el contrario, conglomerados más pequeños resultan en menor similitud y un DEFF menor. Si el ICC fuera cero (es decir, las observaciones dentro de los conglomerados no son más similares que entre ellos), el DEFF sería exactamente 1.0, independientemente del tamaño del conglomerado.
La mayoría de los profesionales de monitoreo y evaluación no suelen calcular el ICC desde cero. En su lugar, recurren a valores empíricos de DEFF obtenidos de encuestas previas en contextos similares. Encuestas como DHS, MICS y evaluaciones financiadas por donantes en el mismo sector y geografía a menudo publican sus valores de DEFF, los cuales constituyen un punto de partida razonable.
Valores típicos de DEFF en monitoreo y evaluación
| Tipo de encuesta | DEFF típico | ICC típico |
|---|---|---|
| Resultados de seguridad alimentaria de los hogares | 1.5-2.0 | 0.03-0.08 |
| Comportamientos y acceso a WASH | 1.5-2.5 | 0.05-0.12 |
| Cobertura de inmunización y servicios de salud | 2.0-3.0 | 0.10-0.15 |
| Resultados educativos en encuestas por conglomerados (escuelas) | 2.0-3.5 | 0.10-0.20 |
| Medios de vida e ingresos | 1.3-1.8 | 0.03-0.06 |
| Violencia de género (altamente específica del contexto) | 2.0-4.0 | 0.10-0.25 |
El patrón observado es que los resultados fuertemente influenciados por el propio conglomerado (como la calidad de la enseñanza de una escuela, los protocolos de un centro de salud o la fuente de agua de una aldea) presentan ICCs y, por consiguiente, DEFFs más elevados que aquellos resultados que varían más según las circunstancias individuales. En caso de duda y ante la ausencia de valores empíricos específicos para su contexto, un DEFF de 2.0 es una suposición de planificación justificable para encuestas de hogares por conglomerados. Es importante destacar que el subajuste conlleva un riesgo mayor que el sobreajuste, ya que el primero no puede corregirse una vez finalizado el trabajo de campo.
Cuatro pasos para aplicar el efecto de diseño
El Efecto de Diseño debe integrarse en el cálculo del tamaño de la muestra antes de la aprobación final del cronograma de campo. A continuación, se describen cuatro pasos clave:
Paso 1: calcule el tamaño de la muestra aleatoria simple. Comience aplicando la fórmula estándar del tamaño de la muestra adecuada para su tipo de indicador: ya sea una proporción (por ejemplo, el 40% de los hogares que almacenan agua de forma segura), una media (como el ingreso promedio mensual) o un objetivo de detección de cambios (por ejemplo, identificar una variación de 10 puntos porcentuales en el indicador X). Este cálculo se basa en su margen de error, nivel de confianza y variabilidad esperada, y establece su línea de base para el muestreo aleatorio simple (SRS).
Paso 2: seleccione un valor de DEFF. Priorice los valores empíricos de encuestas previas en su sector y geografía, si están disponibles. En su ausencia, utilice 1.5-2.0 para encuestas de hogares, 2.0-2.5 para encuestas en escuelas o centros de salud, y 2.5-3.0 para resultados muy heterogéneos o dependientes de la prestación de servicios. Es crucial documentar su elección y el razonamiento detrás de ella, ya que los revisores lo solicitarán.
Paso 3: multiplique. El tamaño de muestra requerido para el muestreo por conglomerados se obtiene multiplicando el tamaño de muestra SRS por el DEFF. Por ejemplo, si el SRS es 400 y el DEFF es 1.8, el tamaño de muestra por conglomerados será 720.
Paso 4: aplique el margen por no respuesta. Una vez ajustada la muestra por el DEFF, incorpore el margen por no respuesta. Si la tasa de no respuesta esperada es del 15%, divida la 'n' ajustada por DEFF entre 0.85. Así, 720 / 0.85 = 847 hogares seleccionados. Este será su objetivo final para el trabajo de campo. Para entender por qué omitir el margen por no respuesta agrava el problema del efecto de diseño, consulte errores comunes de muestreo.
La Calculadora de Muestreo realiza los cuatro pasos automáticamente: ingrese el tamaño de su población, la precisión requerida, el nivel de confianza, el DEFF y la tasa de no respuesta, y le devolverá su objetivo final de campo junto con un plan de asignación de conglomerados.
De dónde vienen los números
Los valores para el DEFF no exigen un cálculo complejo del ICC en cada nueva encuesta. La mayoría de los programas de monitoreo y evaluación suelen reutilizar valores empíricos de encuestas previas y referencias estándar.
Encuestas anteriores en el mismo contexto: Constituyen la evidencia más sólida. Si su área de programa ha sido objeto de encuestas previas (DHS, MICS, SMART, KAP, estudios de línea de base), los DEFF de dichas encuestas son directamente aplicables. La sección de metodología del informe suele mencionarlos.
Tablas de referencia publicadas: El Manual de Muestreo y Listado de Hogares de DHS, la guía de diseño de encuestas MICS y los manuales de muestreo por conglomerados EPI de la OMS publican valores típicos de ICC y DEFF desglosados por dominio de resultados. Estos son valores predeterminados de carácter general, menos precisos que un valor de encuesta local previa, pero más fiables que una estimación a ciegas.
Cálculo post-hoc a partir de datos piloto: Si se realiza un estudio piloto con 3-5 conglomerados antes de escalar a la encuesta completa, es posible calcular un ICC empírico a partir de los datos piloto y utilizarlo para ajustar el cálculo final del tamaño de la muestra. Este enfoque es el más específico para el contexto, aunque añade de 2 a 4 semanas al cronograma.
Suposición predeterminada cuando no hay datos disponibles: DEFF = 2.0 para encuestas de hogares por conglomerados; DEFF = 2.5 para encuestas en escuelas o instalaciones por conglomerados; DEFF = 3.0 para resultados de prestación de servicios con alta heterogeneidad. Estos son valores predeterminados conservadores que priorizan el sobremuestreo frente al submuestreo.
Es fundamental documentar la fuente utilizada. Por ejemplo, "DEFF de 1.8 basado en el DHS de 2022 en [país] para indicadores de cobertura comparables" constituye un rastro de auditoría justificable. En cambio, "DEFF = 1.5 asumido" no lo es.
Ejemplos por sector
Salud: encuesta de cobertura de vacunación en África Oriental
Un equipo de salud distrital diseñó una encuesta de cobertura de vacunación empleando un diseño estándar de 30 por 7 conglomerados (30 conglomerados, 7 entrevistas cada uno). El equipo calculó un tamaño de muestra de n = 210 utilizando fórmulas de muestreo aleatorio simple, y luego lo consideró como el tamaño de muestra para el muestreo por conglomerados. El ICC post-análisis resultó ser de 0.13, lo que generó un DEFF de 1.78. El tamaño de muestra efectivo fue de solo 118 entrevistas, no 210. Los intervalos de confianza en la estimación de la cobertura fueron de ±9 puntos porcentuales. El programa requería una precisión de 5 puntos para determinar la efectividad de una nueva estrategia de divulgación. La encuesta no logró confirmar ni refutar el efecto de la estrategia, lo que obligó al programa a realizar una segunda encuesta tres meses después, con una asignación de conglomerados de tamaño adecuado, a un costo 1.6 veces superior al original.
WASH: encuesta de almacenamiento de agua en hogares en África Occidental
Un programa WASH diseñó una encuesta de hogares para evaluar las prácticas de almacenamiento seguro de agua en 40 aldeas, con 15 entrevistas planificadas por aldea. El tamaño de muestra SRS fue de 380. El equipo aplicó un DEFF de 2.0, fundamentado en una encuesta MICS publicada en la misma región, lo que resultó en una muestra objetivo de 760. Tras aplicar un margen por no respuesta del 15%, el objetivo de campo se fijó en 894 hogares, es decir, 22 por aldea. La muestra final completada fue de 746. Los intervalos de confianza en la estimación del almacenamiento seguro fueron de ±3.8 puntos con un 95% de confianza, lo cual fue suficiente para detectar la mejora de 7 puntos que el programa se había propuesto. El programa confirmó que su objetivo se alcanzó con una precisión justificable.
Educación: encuesta de resultados de aprendizaje en el sur de Asia
Una evaluación de resultados de aprendizaje, con base en escuelas, se llevó a cabo en 25 centros educativos dentro del área de influencia de un programa, encuestando a 40 estudiantes por escuela. El equipo de educación empleó un ICC de 0.18, basado en un ensayo aleatorizado por conglomerados previo en una geografía similar. El DEFF resultante fue 1 + (39 x 0.18) = 8.02, un valor excepcionalmente alto que evidencia la fuerte agrupación de los resultados de aprendizaje por escuela. El cálculo inicial de SRS del equipo, de n = 400, se tradujo en una muestra por conglomerados requerida de 3,200 estudiantes. El equipo reconoció la inviabilidad de este número con el presupuesto disponible y rediseñó el estudio para incluir 60 escuelas con 25 estudiantes cada una (n = 1,500), lo que, según la fórmula del DEFF, resultó en una muestra efectiva equivalente a 320 entrevistas SRS. Este rediseño permitió al programa llevar a cabo un estudio viable, aunque a un costo 2.5 veces superior al presupuesto original, pero con la capacidad real de responder a la pregunta sobre el aprendizaje.
Seguridad alimentaria: encuesta de consumo en el Sahel
Un programa de seguridad alimentaria llevó a cabo una encuesta trimestral de consumo en 20 comunidades pastoriles, con 12 hogares por comunidad. El ICC para los puntajes de consumo de alimentos en contextos pastoriles, según encuestas previas, fue de 0.04, lo que generó un DEFF de 1 + (11 x 0.04) = 1.44. El equipo aplicó este DEFF a su línea de base SRS de 280 para obtener una muestra requerida de 403, y posteriormente añadió un margen por no respuesta del 20% (considerando la dispersión de las comunidades durante la migración en la estación seca), alcanzando un objetivo de campo de 504 hogares. La encuesta se completó en 472 hogares, satisfaciendo el requisito de precisión de ±4 puntos en el puntaje de consumo de alimentos.
Errores comunes
Error 1: usar un tamaño de muestra SRS para el trabajo de campo por conglomerados. Calcular el tamaño de la muestra asumiendo que las observaciones son independientes, cuando en realidad están agrupadas en conglomerados, es el error más frecuente relacionado con el DEFF en la práctica de monitoreo y evaluación. Por ejemplo, un equipo de campo selecciona 30 aldeas con 15 hogares cada una y luego reporta 450 entrevistas como si cada una aportara información completa de un muestreo aleatorio simple. Esto conduce a intervalos de confianza engañosamente estrechos, resultados que parecen más precisos de lo que realmente son, y, en última instancia, la presión de los revisores puede forzar un reanálisis. Es crucial aplicar el multiplicador DEFF antes de definir el tamaño de la muestra.
Error 2: aplicar el DEFF en la etapa de análisis en lugar de la etapa de diseño. Algunos equipos solo identifican el problema de la agrupación durante la fase de análisis y aplican la estimación ponderada por encuesta. Si bien esto genera intervalos de confianza correctos, no puede compensar la falta de entrevistas que nunca se realizaron. Los intervalos de confianza resultan más amplios, la precisión disminuye y el programa no logra confirmar si se cumplió su objetivo. Aunque la corrección en la etapa de análisis es preferible a no corregir, no puede salvar un estudio que, de base, carece de potencia estadística.
Error 3: elegir un valor de DEFF sin evidencia. Un DEFF de 1.2 puede parecer razonable, pero sin una referencia de una encuesta previa o una fuente publicada, podría ser incorrecto. La mayoría de las encuestas de hogares por conglomerados en monitoreo y evaluación suelen arrojar DEFF empíricos entre 1.5 y 2.0. Subestimar el DEFF resulta en una muestra insuficiente; sobrestimarlo, aunque desperdicia recursos, es una opción más segura. En caso de duda, utilice 2.0 y documente su justificación.
Error 4: olvidar que el DEFF se acumula en diseños multietapa. Una muestra por conglomerados de dos etapas (por ejemplo, selección de aldeas y luego hogares dentro de ellas) presenta un efecto de diseño compuesto, no un DEFF de una sola etapa. La acumulación depende de los ICC de cada etapa, pero una regla general útil es que los DEFF multietapa suelen ser entre un 20% y un 40% más altos que los DEFF de una sola etapa comparables. Considere esto cuando el diseño de la encuesta implique conglomerados anidados (como distritos, luego aldeas, y finalmente hogares).
Error 5: no documentar la fuente del DEFF. El valor del DEFF debe figurar en la metodología de la encuesta, acompañado de una cita que indique su origen: ya sea una encuesta previa, una referencia publicada o la justificación de la suposición. Este rastro es indispensable para revisores externos, futuras replicaciones y comparaciones de líneas de base. Una encuesta que no documenta la fuente de su DEFF es más difícil de defender y de comparar.
Lista de verificación del efecto de diseño
Revise esta lista antes de comprometerse con su plan de trabajo de campo para encuestas por conglomerados.
Etapa de diseño:
- Valor de DEFF seleccionado y su fuente documentada (encuesta previa, referencia publicada o valor predeterminado conservador).
- Multiplicador DEFF aplicado al tamaño de muestra SRS durante la planificación.
- Agrupación multietapa considerada si el diseño incluye conglomerados anidados.
- Plan de asignación de conglomerados elaborado (especificando el número de conglomerados y de entrevistas por conglomerado).
Etapa de trabajo de campo:
- Asignaciones de conglomerados documentadas antes del inicio del trabajo de campo.
- La capacitación de los encuestadores incluye el diseño por conglomerados, no solo el cuestionario.
- Tamaño real del conglomerado por aldea registrado en los diarios de campo (el valor 'm' puede diferir del 'm' planificado).
Etapa de análisis:
- Estimación ponderada por encuesta especificada en el plan de análisis antes de la recopilación de datos.
- Unidad de muestreo primaria y variables de estratos incluidas en el conjunto de datos.
- Intervalos de confianza reportados utilizando errores estándar corregidos por el diseño, no errores estándar SRS ingenuos.
Para el cálculo del tamaño de la muestra con efecto de diseño y margen por no respuesta, ejecute la Calculadora de Muestreo. Para decisiones relacionadas con el diseño de muestreo, consulte muestreo por conglomerados vs. estratificado y muestreo probabilístico vs. no probabilístico. Para el flujo de trabajo completo de muestreo previo al trabajo de campo, consulte errores comunes de muestreo.