Los 7 modos de fallo de los resultados de la IA
La inteligencia artificial (IA) genera contenido de M&E que, aunque fluido y aparentemente correcto a primera vista, suele fallar en la inspección de siete maneras predecibles. Cada fallo tiene un método de detección y una solución específicos.
| # | Modo de fallo | Manifestación | Frecuencia |
|---|---|---|---|
| 1 | Estadísticas inventadas | Valores de línea de base, metas o citas que suenan específicos pero carecen de fuente | La mayoría de los resultados de IA con campos numéricos |
| 2 | Afirmaciones de marcos de referencia alucinadas | Cumplimiento afirmado con un estándar que la IA nunca verificó realmente | Común cuando las indicaciones piden resultados alineados con el donante |
| 3 | Fallos lógicos | Productos etiquetados como resultados; resultados intermedios que no producen el resultado a largo plazo declarado | Común en borradores de marcos lógicos y Teorías del Cambio |
| 4 | Especificaciones imprecisas | "Encuesta" como medio de verificación; lenguaje de marcador de posición como "capacitación apropiada" | Común en el plan de M&E y el contenido de recopilación de datos |
| 5 | Contenido genérico y desconectado | Texto que se lee bien pero no refleja la Teoría del Cambio específica de su programa | Moderado en borradores narrativos y de propuestas |
| 6 | Errores de cumplimiento con el donante | Versión incorrecta de ADS, indicadores MER desactualizados, requisitos de donantes inventados | Moderado en contenido dirigido a donantes |
| 7 | Desajustes contextuales | Suposiciones culturales, geográficas o estacionales que no se ajustan al programa | Común en contextos pastoriles, de conflicto, frágiles |
Una verificación sistemática para cada modo de fallo requiere entre el 30% y el 40% del tiempo que la IA ahorró en la redacción. Omitir este paso es la principal causa de que el trabajo de M&E asistido por IA sea rechazado. Para un flujo de trabajo asistido por IA más amplio, consulte cómo redactar un marco lógico para una propuesta con IA.
Cuándo la verificación es crucial
La verificación de los resultados de la IA es innegociable para:
Presentaciones a donantes. Las propuestas, los planes de M&E, los informes de evaluación y los entregables de cumplimiento son rechazados en la revisión del donante cuando contienen estadísticas inventadas, lógica defectuosa o afirmaciones de marcos alucinadas. Los revisores los detectan rápidamente porque reconocen el patrón de la IA.
Metodología de evaluación. Las secciones de metodología con contrafactuales, diseños de muestreo o enfoques analíticos sugeridos por la IA deben verificarse con la viabilidad real del estudio. La IA propondrá alegremente RCTs para programas que no pueden ejecutarlos.
Documentos de cumplimiento. Cualquier documento que afirme alineación con ADS 201, MER, JMP, INEE o marcos similares debe verificarse con la versión actual y real del marco. Los datos de entrenamiento de la IA se retrasan; las versiones de los marcos cambian.
Entregables publicados. Las publicaciones de blog, los estudios de caso, el contenido del sitio web y los resúmenes de evaluación publicados conllevan riesgo para la reputación. Las cifras inventadas en el contenido público dañan la credibilidad.
Una verificación más ligera es aceptable para borradores internos, sesiones de lluvia de ideas y exploraciones iniciales, donde nadie actuará sobre el contenido sin una revisión humana previa.
Verificación 1: estadísticas inventadas
La IA rellena los campos numéricos con cifras que suenan plausibles. Este patrón se observa en valores de línea de base, metas, tasas de prevalencia, citas de investigación y estimaciones presupuestarias.
Manifestación. Un plan de M&E generado dice "el 38% de los hogares en la región objetivo practica el almacenamiento seguro de agua en la línea de base". Suena específico. Suena defendible. Fue inventado. Si la IA no tuvo acceso a sus datos de línea de base, no tuvo la línea de base. Si no tuvo acceso a los datos de referencia actuales del donante, no tuvo la tasa de línea de base actual.
Cómo detectarlo. Cualquier afirmación numérica específica en los resultados de la IA necesita una cita de fuente o es sospechosa. Pregunte: ¿de dónde viene este número? Si no puede rastrear el número a un archivo que cargó, una URL a la que la IA hizo referencia o una estadística ampliamente publicada, trátelo como inventado.
Cómo solucionarlo. Reemplace cada número inventado por la IA con uno de: (a) sus datos reales, (b) una fuente citada de una referencia publicada, o (c) un marcador de posición explícito ("línea de base: por determinar, a recopilar en el año 1 del programa mediante encuesta KAP"). Nunca presente cifras generadas por IA como si fueran reales.
Verificación 2: afirmaciones de marcos de referencia alucinadas
La IA puede afirmar que un indicador "se alinea con USAID MER PREV_FP_ACCEPT" o "cumple con los criterios de gestión segura de JMP" sin haberlo verificado realmente. Los nombres de los marcos son lo suficientemente comunes en los datos de entrenamiento como para que la IA los reconozca, pero no así sus definiciones específicas y actualizadas.
Manifestación. Un borrador de marco lógico incluye "Indicador: Número de hombres y mujeres con mejor utilización de los servicios de planificación familiar (MER PREV_FP_ACCEPT)". El número del indicador parece real. La descripción coincide con un patrón. El indicador MER real no existe con ese código.
Cómo detectarlo. Busque el documento del marco real (ADS 201, Manual de Indicadores MER, escalas de servicios JMP, criterios OCDE DAC, etc.) y verifique cada código de indicador, nombre y definición declarados. Toma de 2 a 5 minutos por alineación declarada.
Cómo solucionarlo. Elimine o corrija cualquier afirmación de marco que no se verifique. Si un indicador es personalizado, etiquételo como tal. Si se mapea aproximadamente a un indicador de marco estándar, anote la aproximación en lugar de afirmar la alineación.
Verificación 3: fallos lógicos
Las Teorías del Cambio y los marcos lógicos generados por IA a menudo presentan fallos en su lógica vertical: productos etiquetados como resultados, resultados que no contribuyen plausiblemente al objetivo a largo plazo declarado, o actividades agrupadas de forma extraña en productos.
Manifestación. La fila de resultados dice "500 mujeres capacitadas en habilidades empresariales". Eso es un producto (un recuento de entregables), no un resultado (un cambio aplicado). El resultado debería decir algo como "Mujeres capacitadas aplican habilidades empresariales para iniciar o hacer crecer empresas en 6 meses".
Cómo detectarlo. Recorra la matriz de abajo hacia arriba. ¿Las actividades producen productos? ¿Los productos producen resultados? ¿Los resultados contribuyen al objetivo? Donde cualquier paso falla (o donde los productos y resultados se confunden), la matriz necesita revisión. Consulte cómo escribir un marco lógico para la prueba completa de lógica vertical.
Cómo solucionarlo. Reescriba manualmente las filas confusas. No pida a la IA que corrija la lógica sin antes articular qué está roto; la IA tiende a producir un segundo borrador con el mismo error estructural en una redacción ligeramente diferente.
Verificación 4: especificaciones imprecisas
La IA genera especificidades con calidad de marcador de posición donde se requieren detalles precisos. Lo más común: medios de verificación descritos como "encuesta" o "datos de monitoreo" sin especificar el instrumento, la frecuencia o la responsabilidad.
Manifestación. La columna 3 del marco lógico dice "Encuesta". La suposición del marco lógico dice "Las condiciones externas siguen siendo favorables". La descripción de la capacitación dice "Capacitación apropiada para los beneficiarios". Todo suena razonable. Nada es ejecutable.
Cómo detectarlo. Para cada campo específico en los resultados de la IA, pregunte: ¿es esto lo suficientemente detallado como para que alguien que tome el documento en 6 meses pueda ejecutarlo? Si la respuesta es no, es un marcador de posición, no una especificación.
Cómo solucionarlo. Reemplace el lenguaje vago con instrumentos nombrados, frecuencias específicas y responsabilidades nombradas. "Encuesta" se convierte en "Encuesta anual de hogares (módulo KAP, septiembre) administrada por el equipo de encuestadores de campo, revisada por el gerente de M&E". Consulte medios de verificación para el nivel de especificidad.
Verificación 5: contenido genérico y desconectado
La IA genera texto fluido que podría describir muchos programas, pero no el suyo de manera específica. La señal de advertencia: leer el resultado de la IA y sentir que podría haber sido escrito para un programa diferente con una edición mínima.
Manifestación. Una narrativa de un plan de M&E describe una "iniciativa de salud comunitaria" genérica con métodos estándar, riesgos estándar y mitigación estándar. Nada en el texto se relaciona con su geografía específica, relaciones con socios, modelo de entrega o Teoría del Cambio. El programa podría cambiar el nombre y encajaría en otro programa.
Cómo detectarlo. Lea el borrador de la IA preguntando: ¿qué es específico de este programa? Si la respuesta es "el nombre y la ubicación del programa", el contenido está desconectado. Compare el borrador de la IA con su Teoría del Cambio, la descripción de su programa y su conjunto de socios. Si el borrador de la IA no refleja esas especificidades, es genérico.
Cómo solucionarlo. Reescriba para vincular cada sección a las características distintivas de su programa. Esto no es opcional; el contenido genérico se lee como inexperiencia para los revisores de los donantes y no pasa una planificación de evaluación rigurosa.
Verificación 6: errores de cumplimiento con los requisitos del donante
Los datos de entrenamiento de la IA reflejan las versiones de los marcos de referencia hasta su fecha de corte. Sin embargo, los marcos de los donantes se actualizan regularmente: los capítulos de ADS 201 se revisan, los indicadores MER se actualizan anualmente, los estándares SPHERE se revisaron en 2018 y 2024, y los indicadores ODS reciben revisiones técnicas la mayoría de los años. La IA suele citar versiones desactualizadas con confianza.
Manifestación. Una sección de M&E de una propuesta cita "ADS 201.3.2.4 requiere..." pero la estructura actual del capítulo tiene una numeración diferente. O una plantilla PIRS incluye campos que USAID ya no requiere. O un indicador alineado con SPHERE utiliza una redacción anterior a 2018.
Cómo detectarlo. Para cualquier cita de marco, busque el documento del marco actual (sitio web del donante, organismo de la ONU, plataforma de coordinación sectorial) y verifique la versión, el número de capítulo y el requisito específico. Particularmente importante para las presentaciones de donantes bilaterales donde los revisores conocen el marco actual a fondo.
Cómo solucionarlo. Actualice las citas a las versiones actuales. Si los resultados de la IA reflejan una guía desactualizada, reescriba las secciones afectadas. Verifique la actualidad en cada ciclo de presentación, no solo la primera vez.
Verificación 7: desajustes contextuales
La IA tiende a recurrir a suposiciones genéricas del sector de desarrollo. Contextos como las comunidades pastoriles, las zonas afectadas por conflictos, los asentamientos informales urbanos y los programas en países con estructuras administrativas no estándar, suelen confundir a la IA de maneras predecibles.
Manifestación. Un plan de M&E de seguridad alimentaria para comunidades pastoriles asume rondas mensuales de recopilación de datos vinculadas a los meses calendario. Los pastores son trashumantes; los meses calendario no se corresponden con sus ciclos de seguridad alimentaria. O un programa de gobernanza en un área afectada por conflictos utiliza métodos de "consulta comunitaria" que asumen un espacio cívico estable que el contexto no tiene.
Cómo detectarlo. Para cada método, frecuencia y suposición en los resultados de la IA, verifique: ¿esto se ajusta al contexto en el que realmente trabaja? Si la IA ha aplicado una plantilla genérica del sector de desarrollo a un contexto no estándar, necesita revisión.
Cómo solucionarlo. Reescriba los métodos, frecuencias y suposiciones para que se ajusten a su contexto. Revise las secciones revisadas con un asesor de M&E local o un especialista del sector antes de finalizar.
Ejemplos sectoriales
Salud: encuesta de cobertura de vacunación, África Oriental
Un programa de salud utilizó la IA para redactar la sección de metodología para una encuesta de cobertura de vacunación. La IA produjo una metodología limpia citando el muestreo por conglomerados EPI de la OMS y cálculos específicos del efecto de diseño. La verificación detectó dos problemas: (a) el valor específico de DEFF citado (1.6) no tenía fuente, y el DEFF típico para la geografía del programa es de 1.8-2.0; (b) la IA afirmó que la metodología "se alinea con la metodología de muestreo por conglomerados EPI de la OMS" pero el manual EPI real de la OMS revisó su guía en 2020 y los resultados de la IA reflejaban convenciones anteriores a 2020. La revisión tomó 45 minutos, mientras que el borrador original se generó en 20 minutos. La metodología final fue defendible en la revisión del donante.
Educación: evaluación de resultados de aprendizaje, Asia Meridional
Un programa redactó una sección de evaluación de resultados de aprendizaje utilizando IA. La IA produjo una metodología alineada con los "estándares INEE" y citó instrumentos de evaluación específicos. La verificación encontró que dos instrumentos citados eran reales pero para grupos de edad diferentes a los que el programa se dirigía, una cita de "estándar mínimo INEE" era de una versión desactualizada, y el diseño de muestreo propuesto asumía tamaños de escuela iguales cuando las escuelas reales variaban de 50 a 400 estudiantes. La revisión de los tres problemas requirió aproximadamente 90 minutos. El diseño final fue apropiado para el contexto.
WASH: programa de agua rural, África Occidental
Un programa WASH redactó una sección del plan de M&E utilizando IA. La IA propuso encuestas trimestrales de hogares en 80 aldeas con una muestra de 2,000 hogares por ronda. La verificación detectó que (a) el tamaño de muestra propuesto no estaba respaldado por el presupuesto de M&E (que cubriría aproximadamente 800 hogares por ronda a tasas locales), (b) la IA afirmó la alineación con la escala de servicios JMP pero utilizó definiciones de categorías anteriores a la revisión de JMP, y (c) el medio de verificación se enumeró como "encuesta" sin especificar ningún instrumento. La revisión redujo la muestra a niveles factibles, actualizó las definiciones de JMP y especificó el instrumento real. Este proceso tomó aproximadamente 60 minutos.
Seguridad alimentaria: medios de vida pastoriles, sahel
Un programa de medios de vida utilizó la IA para redactar el cronograma de recopilación de datos estacionales. La IA produjo un cronograma trimestral estándar vinculado a los trimestres calendario. La verificación con un asesor de M&E local detectó el desajuste contextual: las comunidades siguen un patrón de trashumancia con fases de migración que no se corresponden con los trimestres calendario. El segundo trimestre (abril-junio) corresponde a la estación seca tardía y al inicio de la migración, no a una ventana estable de recopilación de datos. La revisión reestructuró el cronograma en torno a las fases de migración (pre-migración, migración, post-migración, estación húmeda) y reescribió las especificaciones de los indicadores para apoyar la desagregación estacional. Este proceso tomó aproximadamente 2 horas, incluyendo la consulta con el asesor.
Errores frecuentes
Error 1: omitir la verificación bajo presión de plazos. Cuando la propuesta vence en 48 horas, la tentación es enviar los resultados de la IA con una revisión mínima. Este es el hábito más perjudicial; el tiempo de verificación no es opcional. Intégrelo en el flujo de trabajo desde el principio.
Error 2: considerar los resultados de la IA como 'mayormente correctos'. Los resultados de la IA no son mayormente correctos. Son fluidos. Esas son cualidades diferentes. Un marco lógico redactado por IA puede tener la estructura correcta y el 40% de los detalles correctos. La verificación no es pulir; es un control de calidad sustantivo.
Error 3: no aplicar la verificación SMART a los indicadores sugeridos por la IA. Cada indicador sugerido por la IA debe pasar por la validación SMART antes de ser aceptado. Consulte profundización en indicadores SMART. Omitir este paso significa que los indicadores con verbos vagos se cuelan en el plan de M&E.
Error 4: aceptar metas generadas por IA sin validación. Las metas en los resultados de la IA son marcadores de posición. Cada meta debe validarse con su línea de base y la capacidad real de su programa. Las metas copiadas sin verificar de los borradores de la IA son la forma en que los programas se comprometen con entregables inalcanzables.
Error 5: confiar ciegamente en las citas de marcos de referencia. La IA cita marcos con confianza y a menudo incorrectamente. Cada afirmación de marco (capítulo ADS, código de indicador MER, categoría JMP, criterio DAC, estándar INEE, mínimo SPHERE) debe verificarse con el documento del marco actual.
Error 6: no verificar las afirmaciones cuantitativas. Porcentajes, tamaños de muestra, asignaciones presupuestarias y cronogramas, todos son inventados por la IA. Cada número necesita una fuente o una bandera que indique que es un marcador de posición.
Error 7: utilizar los resultados de la IA para la presentación final al donante sin una reescritura humana. Incluso los resultados de la IA verificados se leen como resultados de la IA. Para la presentación final al donante, una revisión humana que ajuste el tono, agregue textura específica del programa y suavice las peculiaridades estructurales no es opcional.
Error 8: confundir la fluidez de la IA con su precisión. La IA escribe con fluidez. Los revisores de los donantes leen rápidamente. La combinación crea una falsa confianza de que el documento es correcto. Reduzca la velocidad y verifique; la fluidez no es una señal de calidad.
Lista de verificación para resultados de IA
Revise esta lista para cualquier entregable de M&E asistido por IA antes de su presentación.
Para indicadores generados por IA:
- Cada indicador cumple con la validación SMART (específico, medible, alcanzable, relevante, con plazos definidos)
- Cada alineación de marco de referencia declarada (USAID F, MER, JMP, SPHERE, ODS, etc.) verificada con el documento del marco actual
- Cada valor de línea de base verificado con datos reales o explícitamente marcado como marcador de posición
- Cada meta verificada en función de la línea de base y la capacidad del programa
- Cada fuente de datos es factible considerando el presupuesto del programa
Para marcos lógicos y teorías del Cambio generados por IA:
- Lógica vertical revisada de abajo hacia arriba; cada fila contribuye plausiblemente a la fila superior
- Productos y resultados claramente diferenciados
- Cada medio de verificación especifica un instrumento real, su frecuencia y la responsabilidad asociada
- Cada suposición es verificable durante la implementación
- La Teoría del Cambio y el marco lógico son internamente consistentes
Para narrativas e informes generados por IA:
- El texto es específico de este programa, no genérico
- Las especificidades del programa (geografía, Teoría del Cambio, socios, modelo de entrega) se reflejan en todo el documento
- Cada afirmación cuantitativa tiene una fuente o está explícitamente marcada
- Las citas de marcos de referencia verificadas con las versiones actuales
- La coherencia de la voz verificada con los estándares de la organización
Para planes de recopilación de datos generados por IA:
- Métodos factibles considerando el presupuesto y la capacidad del programa
- Tamaños de muestra calculados correctamente (efecto de diseño aplicado, margen para no respuesta incluido)
- El enfoque de muestreo se adapta al contexto del programa (pastoril, conflicto, urbano informal, etc.)
- Instrumentos nombrados específicamente, no 'encuesta' o 'cuestionario' genéricos
Puntos de control previos al envío:
- Documento completo releído por un humano, no solo revisado de forma puntual
- Idoneidad del contexto confirmada con un asesor local si el contexto es no estándar
- Requisitos de cumplimiento del donante confirmados con el marco actual del donante
- Reescritura humana completada para contenido dirigido a donantes (tono, pulido, especificidad del programa)
Para un flujo de trabajo de redacción asistida por IA más amplio, consulte cómo redactar un marco lógico para una propuesta con IA y cómo escribir un plan de M&E. Para el marco de control de calidad en el que se integra la verificación de la IA, consulte aseguramiento de la calidad de los datos y las 5 dimensiones de la calidad de los datos. Para los manuales paso a paso asistidos por IA cuya producción se verifica aquí, consulte la biblioteca de manuales.