Comparación entre salir a campo sin equipo y usar una base de datos secundaria como ENDES, ENAHO o Niños del Milenio

Casi todas las tesis de nutrición empiezan con la misma imagen mental: el tesista con su tablero, su formulario impreso y su balanza, tocando puertas en un centro de salud. Es la forma que todos tenemos de imaginar «recolectar datos». Y está bien: el campo enseña cosas que no se aprenden de ninguna otra manera. Pero rara vez alguien le pregunta al estudiante lo importante antes de que salga: ¿tienes el tiempo, el instrumento y las manos que ese diseño necesita?

Porque cuando la respuesta es no —y en pregrado suele ser no—, el resultado no es una tesis heroica. Es una base de datos pequeña, sesgada y difícil de defender. Existe una alternativa que casi nadie menciona en el curso de metodología: analizar una base de datos secundaria. No es un atajo. Es una decisión metodológica con sus propias exigencias, y en muchos casos es la que produce mejor investigación.

Lo que realmente implica salir a campo sin experiencia

Recolectar datos primarios es una operación logística, no solo un capítulo de la tesis. Estos son los cuatro puntos donde se rompe con más frecuencia:

  • El formulario mal construido. Preguntas de doble cañón («¿consume frutas y verduras a diario?»), opciones que se superponen, categorías sin «no sabe / no responde», escalas inventadas en lugar de instrumentos validados, saltos lógicos que nadie probó. El error no aparece en el campo: aparece meses después, cuando la variable que ibas a analizar no se puede analizar porque nunca se midió como creías.
  • El consentimiento informado que no informa. Una hoja de dos páginas en lenguaje técnico, firmada de pie y con prisa, sin explicar riesgos, sin decir qué pasará con los datos, sin asentimiento cuando hay menores de edad. Eso no es un trámite mal hecho: es una falla ética, y es motivo suficiente para que un comité observe el trabajo o para que una revista lo rechace después.
  • El tiempo y las herramientas que no existen. Permisos institucionales que tardan meses, un comité de ética con sus propios plazos, una balanza y un tallímetro que hay que conseguir prestados, sin calibración documentada, sin estandarización antropométrica del que mide, sin presupuesto para transporte ni para una segunda visita. Todo eso consume el ciclo académico completo antes de tener una sola fila de datos.
  • La muestra que nunca llega. El cálculo decía 384 participantes. A la semana seis van 90, la mitad con datos incompletos. La solución improvisada —muestreo por conveniencia entre los que aceptaron— se convierte en la limitación principal del estudio y en la primera pregunta del jurado.

Y aun así, el campo enseña lo que ningún archivo enseña

Hay que decirlo con la misma claridad: trabajar en campo es una de las experiencias formativas más potentes que puede tener un investigador joven, y no la voy a despreciar. Aplicar tú mismo un formulario te enseña que la gente no responde como el manual predice. Te obliga a descubrir que la variable que diseñaste en tu escritorio no se puede medir en la vida real, y a corregirla. Te enseña a explicar un consentimiento en palabras que una madre en una sala de espera entienda de verdad. Te enseña a mirar un dato raro y saber si es un error de digitación o si el participante realmente pesa eso.

Ese criterio de campo es lo que después distingue a quien interpreta datos con sentido de quien solo corre comandos. Quien nunca recolectó no sabe cuánto se pierde entre la pregunta y la respuesta.

La conclusión, entonces, no es «no vayas a campo». Es más incómoda y más útil: el campo es una escuela excelente cuando tienes equipo, tiempo y alguien que te supervise; es una trampa cuando estás solo y con un ciclo académico encima. Si tienes esas condiciones, ve. Si no las tienes, hay un camino que también produce investigación real.

Qué es una base de datos secundaria y cuáles tienes a la mano

Una base secundaria es un conjunto de datos recolectado por otros —normalmente una institución estadística o un proyecto de investigación— que se pone a disposición pública para que cualquiera lo analice. Tú no recolectas: tú formulas una pregunta nueva y la respondes con datos que ya existen. En el Perú y en la región tienes, entre otras:

  • ENDES (Encuesta Demográfica y de Salud Familiar, INEI). La mina de oro para nutrición materno-infantil: antropometría de niños y mujeres, anemia con hemoglobina medida, lactancia, prácticas de alimentación infantil, salud reproductiva, programas sociales. Es la versión peruana de las encuestas DHS, con metodología comparable internacionalmente.
  • ENAHO (Encuesta Nacional de Hogares, INEI). Gasto y consumo de alimentos del hogar, pobreza, educación, empleo, acceso a servicios. El complemento natural cuando tu pregunta involucra determinantes sociales o inseguridad alimentaria.
  • Niños del Milenio / Young Lives. Estudio de cohorte que sigue a dos grupos de niños peruanos desde 2002, con rondas sucesivas. Permite algo que una encuesta transversal no permite: mirar trayectorias en el tiempo, con antropometría, educación, salud mental y condiciones del hogar en la misma persona a distintas edades.
  • Encuestas de otros países. Las DHS de más de 90 países, las MICS de UNICEF, la ENSANUT mexicana, la ENSIN colombiana, NHANES en Estados Unidos. Comparar dos o tres países con instrumentos armonizados es un diseño perfectamente publicable y bastante poco explotado desde el Perú.

En el caso del INEI, todo esto se descarga gratis y sin permisos especiales desde el portal de microdatos, en formato Stata, SPSS o CSV, junto con los diccionarios de variables y la ficha técnica.

Las cuatro ventajas que cambian el resultado de tu tesis

  • Son datos validados. Los instrumentos pasaron por prueba piloto y validación, el personal de campo fue capacitado y estandarizado, la antropometría se tomó con equipos calibrados y procedimientos documentados, la hemoglobina se midió con protocolo. Ese nivel de control de calidad está fuera del alcance de cualquier tesista trabajando solo.
  • Son datos limpios y documentados. Vienen con diccionario de variables, códigos de valores perdidos, etiquetas y manual metodológico. No desaparece la depuración —sigue habiendo valores implausibles y decisiones que tomar—, pero empiezas desde una base ordenada en lugar de desde un Excel improvisado.
  • Tienen inferencia nacional. Esta es la ventaja decisiva y la más subestimada. Con el diseño muestral y los factores de ponderación, tus resultados no describen a 90 personas de un centro de salud: describen a la población peruana, con desagregación por región, área urbana o rural y nivel socioeconómico. Pasas de «en nuestra muestra observamos» a «en el Perú, la prevalencia es».
  • Ahorran meses y tienen más impacto. Sin permisos, sin trabajo de campo, sin presupuesto. El tiempo que se habría ido en logística se invierte donde de verdad cuenta: en afinar la pregunta, en el análisis y en la discusión. Y el producto es más citable, porque un resultado con representatividad nacional le sirve a mucha más gente que un estudio local con muestreo por conveniencia.

Tabla rápida: campo propio frente a base secundaria

 Recolección propiaBase secundaria
Tiempo hasta tener datos4 a 12 mesesEl mismo día
CostoTransporte, equipos, impresionesCero
Control del instrumentoTotal (y ese es el riesgo)Ninguno (y esa es la limitación)
Calidad de la mediciónDepende de tu estandarizaciónProtocolo institucional
Alcance de las conclusionesTu muestra localInferencia nacional
Exigencia estadísticaAnálisis convencionalDiseño muestral complejo
Lo que aprendesCriterio de campoManejo y análisis de datos

El error más caro: tratar la ENDES como si fuera un Excel

Aquí es donde se cae la mayoría de las tesis que usan bases secundarias, y conviene decirlo sin rodeos: la ENDES no es una muestra aleatoria simple. Tiene un diseño muestral complejo, por conglomerados, estratificado y en varias etapas, con factores de ponderación que reconstruyen la estructura de la población.

Si abres la base, corres una prevalencia sin declarar ese diseño y reportas el resultado, tus porcentajes están sesgados y tus intervalos de confianza son más angostos de lo que deberían. El análisis se ve impecable y está mal. Antes de la primera tabla hay que declarar el conglomerado, el estrato y el ponderador —en ENDES, las variables HV001, HV022 y HV005 dividido entre un millón— y usar los comandos de encuestas complejas de tu paquete estadístico, no los comandos habituales.

Usar una base secundaria te ahorra el trabajo de campo, no el trabajo estadístico. Cambias la dificultad de lugar: de la logística al análisis.

Tres confusiones frecuentes

  • «Es investigación de segunda.» No lo es. Análisis secundario no significa revisión de literatura: estás trabajando con datos individuales, planteando una hipótesis nueva y generando evidencia original. Buena parte de lo que se publica en epidemiología nutricional en revistas de alto impacto son análisis secundarios. Y a diferencia de una revisión mal hecha, aquí sí desarrollas competencias de manejo y análisis de datos.
  • «Como los datos ya existen, no necesito ética.» Cuidado. Aunque los microdatos sean públicos y anonimizados, la mayoría de universidades y revistas exige igual el pronunciamiento del comité —muchas veces como exención, no como aprobación plena—. Averígualo antes de empezar, no al final.
  • «Busco qué variables hay y de ahí saco la pregunta.» Es el orden inverso y se nota en el resultado. Primero la pregunta, después verificar si la base la puede responder. Si la variable que necesitas no está, o está medida de una forma que no sirve para tu objetivo, cambia de base o cambia de pregunta: no fuerces la interpretación de una variable para que diga lo que quieres.

Cinco pasos para empezar esta semana

  1. Escribe tu pregunta en una sola oración, con población, exposición y desenlace.
  2. Abre la ficha técnica y el diccionario de variables de la encuesta, y confirma que las tres cosas están medidas.
  3. Identifica los módulos que necesitas y cómo se unen entre sí; casi siempre tendrás que fusionar más de uno por un identificador común.
  4. Declara el diseño muestral complejo antes de calcular nada.
  5. Revisa qué se publicó ya con esa base y ese desenlace, para que tu pregunta aporte algo y no repita lo hecho.

¿Quieres usar una base de datos secundaria en tu investigación?

Si estás evaluando esta ruta para tu tesis o para un artículo y no sabes por dónde empezar —qué encuesta elegir, qué módulos necesitas, cómo fusionarlos o cómo declarar el diseño muestral—, escríbenos. Podemos ayudarte a definir la pregunta, ubicar la base adecuada y acompañarte en el análisis.

Escríbenos por Instagram o desde la web y conversamos sobre tu caso.


Referencias y accesos

  • INEI. Sistema de Microdatos: descarga de bases de datos y documentación técnica de ENDES, ENAHO y otras encuestas. Portal de microdatos
  • INEI. Encuesta Demográfica y de Salud Familiar (ENDES). Sitio oficial · Documento de diseño muestral
  • Young Lives / Niños del Milenio. Acceso a los datos de la cohorte peruana. Use our data
  • The DHS Program. Encuestas demográficas y de salud de más de 90 países, comparables con la ENDES. Sitio oficial · UNICEF MICS: mics.unicef.org
  • Manipulación, análisis y visualización de datos de la Encuesta Demográfica y de Salud Familiar con el programa R. Rev Peru Med Exp Salud Publica 2019;36(1). Texto completo
  • Benchimol EI, et al. The REporting of studies Conducted using Observational Routinely-collected health Data (RECORD) Statement. PLoS Medicine 2015;12(10):e1001885. Texto completo
  • STROBE Statement: guía de reporte para estudios observacionales. strobe-statement.org

Publicamos un artículo como este cada semana. Si quieres contenido diario sobre bioestadística, metodología y lectura crítica aplicada a la nutrición, síguenos en Instagram y TikTok: @nutricion.epidemiologica.

Deja un comentario


Tu primera parada gratuita en este viaje académico para evaluar si somos el apoyo que necesitas