Todos los temas › Lagunas en la evidencia y controversias
¿Por qué los estudios sobre crianza discrepan tan a menudo, y cómo debe un padre sopesar los hallazgos contradictorios?
Una semana la lactancia «hace a los bebés más listos», a la siguiente «no cambia nada». El entrenamiento del sueño es «inofensivo» en un estudio e «inunda a los bebés de cortisol» en otro. ¿Por qué los estudios sobre crianza discrepan tan a menudo —y cuando lo hacen, cómo debes sopesar los hallazgos contradictorios?
Los estudios sobre crianza discrepan por motivos ordinarios y conocibles: los padres que toman decisiones distintas difieren también en otros aspectos (confusión); tienden a publicarse solo los resultados llamativos (sesgo de publicación); los investigadores tienen muchas opciones de análisis y suelen informar las que «funcionaron» (p-hacking); los estudios pequeños producen resultados ruidosos y exagerados; y los estudios difieren en a quién se estudió, qué se midió y cuándo. El desacuerdo suele ser la ciencia convergiendo, no la ciencia fallando —los estudios posteriores, más grandes y preregistrados tienden a asentarse en estimaciones más pequeñas y honestas. Cuando los estudios se contradicen, confía en el cuerpo de evidencia más que en un estudio aislado, en los ensayos aleatorizados más que en los observacionales, y en los hallazgos preregistrados más que en los post hoc [1][2][5][8].
La mayoría de los hallazgos sobre crianza nacen como observaciones: los padres que hacen X tienen hijos con más Y. Pero los padres que dan el pecho más tiempo, por ejemplo, también tienden a tener más estudios y más dinero —y los estudios y el dinero predicen por sí solos los resultados de los hijos. Esto es la confusión: una tercera variable que impulsa tanto la decisión como el resultado. El tema de este libro sobre lactancia muestra el mecanismo en acción: un gran ensayo aleatorizado por conglomerados de un programa de promoción de la lactancia (PROBIT) encontró +7,5 puntos de CI verbal, mientras que los estudios de hermanos —que comparan niños amamantados y no amamantados de la misma madre, manteniendo constante el entorno familiar— no encontraron diferencia tras ajustar por el CI materno [9]. Distintos diseños, distintas respuestas; la explicación probable es que las características maternas, no solo la leche, explican gran parte de la asociación observada. Cada vez que veas una afirmación observacional sobre crianza, pregunta: ¿qué tipo de padre toma esta decisión, y podría ser eso —más que la decisión— lo que explica el resultado?
La confusión también funciona al revés. La causalidad inversa abunda en la investigación sobre crianza: el bebé «difícil» recibe más intervención, el padre ansioso busca más consejo, la madre con dificultades para alimentar prueba más productos. Una asociación entre una conducta parental y un resultado del niño puede ir fácilmente de hijo → padre en lugar de padre → hijo. Los diseños de hermanos y los ensayos aleatorizados son las principales defensas; los estudios de cohortes ordinarios casi nunca pueden separar las direcciones [9].
Las revistas prefieren resultados llamativos y positivos, así que los estudios negativos nunca llegan a publicarse en silencio —el problema del «cajón». La demostración más limpia viene de los ensayos de antidepresivos, donde los reguladores conservan el conjunto completo de datos: de 74 ensayos registrados en la FDA, el 31 % nunca se publicó, y que un ensayo llegara a imprenta dependía de su resultado. La literatura publicada hacía parecer que el 94 % de los ensayos eran positivos; los datos completos de la FDA mostraban un 51 %. Los tamaños de efecto agrupados estaban inflados en aproximadamente un tercio [2]. La investigación sobre crianza no tiene una FDA que obligue a publicar, así que el cajón probablemente es más profundo: los pequeños ensayos nulos de intervenciones de crianza simplemente desaparecen, y el registro publicado parece más positivo que la realidad. Esta es una razón por la que los primeros hallazgos de un campo casi siempre parecen más grandes que los posteriores —el primer estudio publicado suele ser el golpe de suerte, no el más fiel [5].
Un investigador que analiza un conjunto de datos se enfrenta a decenas de pequeñas decisiones: qué desenlaces informar, qué subgrupos examinar, cuándo dejar de recoger datos, qué covariables ajustar. Simmons y sus colegas mostraron, con simulaciones y experimentos reales, que esta flexibilidad no declarada infla drásticamente las tasas de falsos positivos —puede llegar a ser más fácil «encontrar» un efecto falso que no encontrar correctamente ninguno [3]. En la investigación sobre crianza los grados de libertad son enormes: decenas de desenlaces infantiles plausibles, muchas formas de definir «amamantado» o «entrenado para dormir», muchos subgrupos. Un único resultado significativo en un mar de análisis no informados debe tratarse como un rumor, no como un hallazgo.
El matiz importante —y la razón por la que este tema no es nihilista: cuando Head y sus colegas rastrearon textualmente miles de artículos de distintas disciplinas, encontraron que el p-hacking está efectivamente extendido, pero que su distorsión de las conclusiones metaanalíticas parece débil frente a los tamaños de efecto reales [4]. Los estudios aislados son frágiles; los cuerpos de evidencia son más robustos. El p-hacking corrompe más los ladrillos que el edificio.
Los estudios pequeños son ruidosos, y el ruido más el sesgo de publicación produce una distorsión específica: solo se publican los estudios pequeños que tuvieron «suerte» con efectos grandes, así que la literatura se llena de estimaciones tempranas exageradas que luego se encogen. Button y sus colegas mostraron que la baja potencia estadística no solo hace más probables los falsos positivos, sino que infla los tamaños de efecto de los hallazgos «significativos» que aparecen —la «maldición del ganador» [6]. Este libro tiene un caso de manual: la afirmación viral de que el entrenamiento del sueño «inunda a los bebés de cortisol» viene de Middlemiss et al. 2012 —25 bebés, sin grupo de control, saliva tomada dos veces por noche, en un hospital donde eran las enfermeras quienes acostaban a los bebés. El único ensayo aleatorizado que midió el cortisol con grupo de control (Gradisar et al. 2016) encontró que el cortisol disminuyó ligeramente en los grupos de entrenamiento del sueño [9]. El estudio pequeño y sin control llegó a los titulares; el más grande y controlado hizo la corrección.
A veces los estudios discrepan porque responden a preguntas distintas. El tema de este libro sobre el parto en casa es el ejemplo: Países Bajos, Inglaterra y EE. UU. obtienen resultados distintos porque sus sistemas de maternidad son genuinamente distintos —la integración de la matronería, las vías de traslado y la calidad de los datos varían [9]. La literatura sobre entrenamiento del sueño coincide en que los métodos conductuales tienen efectos pequeños antes de los 6 meses, pero dos revisiones «discrepan» porque midieron desenlaces distintos (Douglas y Hill 2013 frente a Kempler et al. 2016) [9]. Y un metaanálisis de 2010 que afirmaba que el parto en casa duplicaba o triplicaba la mortalidad neonatal (Wax et al.) se derrumbó bajo escrutinio: mezclaba partos en casa planificados y no planificados, usaba denominadores no comparables, y su hallazgo desapareció al excluir los estudios de mala calidad [9]. Antes de concluir «la ciencia no se pone de acuerdo», comprueba si los estudios medían alguna vez lo mismo en el mismo tipo de personas.
La historia de la vitamina D en el embarazo, del tema prenatal de este libro, es la ilustración perfecta de la convergencia: una revisión anterior sugería que la vitamina D podría prevenir complicaciones; la actualización de 2024 aplicó una comprobación de fiabilidad, descartó 21 estudios por poco fiables, y concluyó que la evidencia es ahora muy incierta [9]. La «contradicción» entre la revisión antigua y la nueva no es la ciencia cambiando de opinión —es la ciencia sacando la basura. De forma similar, la historia del hierro: una revisión de 2012 encontró que el hierro reducía significativamente el bajo peso al nacer; la revisión actualizada encontró una estimación casi idéntica (riesgo relativo 0,84 frente a 0,81) que ya no era estadísticamente significativa con más datos [9]. El efecto no desapareció; cambió la precisión. Que una revisión antigua y una nueva discrepen suele ser simplemente la base de evidencia madurando.
El famoso ensayo de 2005 de Ioannidis argumentaba, mediante simulaciones, que la mayoría de los hallazgos de investigación publicados son probablemente falsos —sobre todo cuando los estudios son pequeños, los efectos son pequeños, se prueban muchas hipótesis y los análisis son flexibles [1]. Los supuestos detrás de ese modelo son discutidos [10], pero los seguimientos empíricos rimaron con él: un esfuerzo masivo que replicó 100 estudios de psicología encontró que solo el 36 % de las replicaciones fueron estadísticamente significativas (frente al 97 % de los originales), y los tamaños de efecto medios se redujeron aproximadamente a la mitad [5]. Incluso el propio proyecto de replicación fue discutido —los críticos argumentaron que sus estadísticas eran defectuosas y que la reproducibilidad era en realidad alta [11]— lo cual es en sí el punto: la ciencia discute, en público, con datos, y converge despacio.
La solución estructural es el preregistro: los investigadores declaran públicamente sus hipótesis, desenlaces y plan de análisis antes de recoger datos, eliminando la libertad de informar solo lo que «funcionó». La evidencia de que importa es llamativa: entre los grandes ensayos de cardiopatía de EE. UU., el 57 % informó resultados positivos antes de que el registro de ensayos se convirtiera en la norma hacia el año 2000, frente al 8 % después —y el registro estuvo fuertemente asociado con el giro hacia hallazgos nulos [7]. El preregistro no hace la ciencia pesimista; hace honesto el registro publicado.
Y la herramienta práctica es la jerarquía de la evidencia: las revisiones sistemáticas de ensayos aleatorizados superan a los ensayos aislados, que superan a los estudios observacionales, que superan a la opinión de expertos —con la calidad del estudio importando dentro de cada nivel [8]. Las calificaciones A–D de este libro se construyen sobre la misma idea. Cuando dos estudios sobre crianza se contradicen, no los promedies: pondéralos. Un gran ECA preregistrado supera a cinco pequeños estudios observacionales; una revisión sistemática supera a un ensayo aislado; y un único estudio observacional presentado como un gran avance merece un encogimiento de hombros hasta que se replique.
Permiso, no parálisis. La lección parental más útil: cuando la evidencia discrepa de verdad, cualquiera de las dos decisiones es defendible. Si los estudios sobre lactancia frente a biberón discrepan sobre el CI, o los estudios sobre parto en casa frente a hospital discrepan sobre desenlaces raros, ese desacuerdo es en sí información —significa que el efecto, si existe, es lo bastante pequeño como para esconderse. Los efectos pequeños no merecen grandes culpas. «La ciencia está dividida» no es un fracaso de la ciencia; es una licencia para decidir por otros motivos: tus valores, tus circunstancias, el consejo de tu médico.
No reformes tu vida por un artículo. La regla más práctica: ninguna decisión de crianza debería depender jamás de un único estudio. Espera a la revisión, a la replicación, al segundo diseño. La alarma del cortisol de Middlemiss, la alarma del parto en casa de Wax —ambas fueron estudios aislados frágiles que la evidencia posterior corrigió [9]. Los titulares informan del primer estudio; la sabiduría espera al segundo.
Una mejor forma de discutir sobre crianza. Las parejas, los abuelos y los foros de internet libran guerras de poder con estudios aislados («pero este estudio dice…»). La jerarquía te da un movimiento más calmado: «ese es un pequeño estudio observacional; esto es lo que dice la revisión de los ensayos». Despersonaliza el desacuerdo —no estás despreciando su preocupación, estás ponderando la evidencia.
Una laguna honesta: si entender estos conceptos reduce de verdad la ansiedad parental o cambia las decisiones no se ha probado en ensayos —la base de evidencia es metainvestigación en psicología y medicina, no intervenciones de crianza [1][4][5]. La afirmación aquí es modesta: estas son las preguntas que se hacen los propios investigadores cuando los estudios se contradicen, así que también son las preguntas adecuadas para ti. Si aprender por qué los estudios discrepan hace que el ruido parezca menos amenazante, es una expectativa razonable, no un resultado probado.
(Adaptada para este tema: cuatro desacuerdos de este libro, qué explica probablemente cada uno, y en qué confiar.)
| Desacuerdo | Estudio A | Estudio B | Explicación probable | Qué sopesar más |
|---|---|---|---|---|
| Lactancia y CI | PROBIT (ECA por conglomerados de un programa de promoción): +7,5 puntos de CI verbal | Estudios de hermanos: sin diferencia tras ajustar por CI materno | Confusión por características maternas; PROBIT aleatorizó hospitales, no bebés [9] | Los estudios de hermanos para la pregunta causal —pero con la honesta incertidumbre residual en mente |
| Entrenamiento del sueño y cortisol infantil | Middlemiss 2012 (n=25, sin control): cortisol «elevado» | Gradisar 2016 (ECA con control): el cortisol disminuyó ligeramente | Estudio pequeño, sin control y en un entorno inusual frente a ensayo controlado [9] | El ECA —con diferencia |
| Seguridad del parto en casa | Metaanálisis de Wax 2010: mortalidad neonatal duplicada/triplicada | Birthplace, de Jonge, Hutton: poca o ninguna diferencia en sistemas integrados | Síntesis defectuosa (mezcló partos planificados y no planificados, malos denominadores); distintos sistemas/poblaciones [9] | Los grandes estudios prospectivos y los análisis agrupados de datos de buena calidad |
| Vitamina D en el embarazo | Revisiones previas a 2020: posibles beneficios | Cochrane 2024: 21 estudios excluidos por poco fiables → muy incierta | Ensayos poco fiables contaminando el registro, luego depurados [9] | La revisión con comprobación de fiabilidad |
| Hierro y bajo peso al nacer | Revisión de 2012: RR 0,81, significativo | Actualización de 2015: RR 0,84 (0,69–1,03), no significativo | Base de evidencia creciente; estimación estable, precisión cambiada —no es una contradicción [9] | La revisión actualizada (y nota: «no significativo» ≠ «sin efecto») |
Sopesar dos estudios en conflicto — la lista de comprobación: