Todos los temas › Lagunas en la evidencia y controversias

Por qué los estudios sobre crianza se contradicen entre sí

¿Por qué los estudios sobre crianza discrepan tan a menudo, y cómo debe un padre sopesar los hallazgos contradictorios?

Evidencia: C — Evidencia débil o mixta Última revisión: 2026-09-09 Discusión ↓

La pregunta

Una semana la lactancia «hace a los bebés más listos», a la siguiente «no cambia nada». El entrenamiento del sueño es «inofensivo» en un estudio e «inunda a los bebés de cortisol» en otro. ¿Por qué los estudios sobre crianza discrepan tan a menudo —y cuando lo hacen, cómo debes sopesar los hallazgos contradictorios?

En resumen

Los estudios sobre crianza discrepan por motivos ordinarios y conocibles: los padres que toman decisiones distintas difieren también en otros aspectos (confusión); tienden a publicarse solo los resultados llamativos (sesgo de publicación); los investigadores tienen muchas opciones de análisis y suelen informar las que «funcionaron» (p-hacking); los estudios pequeños producen resultados ruidosos y exagerados; y los estudios difieren en a quién se estudió, qué se midió y cuándo. El desacuerdo suele ser la ciencia convergiendo, no la ciencia fallando —los estudios posteriores, más grandes y preregistrados tienden a asentarse en estimaciones más pequeñas y honestas. Cuando los estudios se contradicen, confía en el cuerpo de evidencia más que en un estudio aislado, en los ensayos aleatorizados más que en los observacionales, y en los hallazgos preregistrados más que en los post hoc [1][2][5][8].

Lo que dice la evidencia más sólida

1. Confusión: la tercera variable oculta

La mayoría de los hallazgos sobre crianza nacen como observaciones: los padres que hacen X tienen hijos con más Y. Pero los padres que dan el pecho más tiempo, por ejemplo, también tienden a tener más estudios y más dinero —y los estudios y el dinero predicen por sí solos los resultados de los hijos. Esto es la confusión: una tercera variable que impulsa tanto la decisión como el resultado. El tema de este libro sobre lactancia muestra el mecanismo en acción: un gran ensayo aleatorizado por conglomerados de un programa de promoción de la lactancia (PROBIT) encontró +7,5 puntos de CI verbal, mientras que los estudios de hermanos —que comparan niños amamantados y no amamantados de la misma madre, manteniendo constante el entorno familiar— no encontraron diferencia tras ajustar por el CI materno [9]. Distintos diseños, distintas respuestas; la explicación probable es que las características maternas, no solo la leche, explican gran parte de la asociación observada. Cada vez que veas una afirmación observacional sobre crianza, pregunta: ¿qué tipo de padre toma esta decisión, y podría ser eso —más que la decisión— lo que explica el resultado?

La confusión también funciona al revés. La causalidad inversa abunda en la investigación sobre crianza: el bebé «difícil» recibe más intervención, el padre ansioso busca más consejo, la madre con dificultades para alimentar prueba más productos. Una asociación entre una conducta parental y un resultado del niño puede ir fácilmente de hijo → padre en lugar de padre → hijo. Los diseños de hermanos y los ensayos aleatorizados son las principales defensas; los estudios de cohortes ordinarios casi nunca pueden separar las direcciones [9].

2. Sesgo de publicación: el cajón de los estudios

Las revistas prefieren resultados llamativos y positivos, así que los estudios negativos nunca llegan a publicarse en silencio —el problema del «cajón». La demostración más limpia viene de los ensayos de antidepresivos, donde los reguladores conservan el conjunto completo de datos: de 74 ensayos registrados en la FDA, el 31 % nunca se publicó, y que un ensayo llegara a imprenta dependía de su resultado. La literatura publicada hacía parecer que el 94 % de los ensayos eran positivos; los datos completos de la FDA mostraban un 51 %. Los tamaños de efecto agrupados estaban inflados en aproximadamente un tercio [2]. La investigación sobre crianza no tiene una FDA que obligue a publicar, así que el cajón probablemente es más profundo: los pequeños ensayos nulos de intervenciones de crianza simplemente desaparecen, y el registro publicado parece más positivo que la realidad. Esta es una razón por la que los primeros hallazgos de un campo casi siempre parecen más grandes que los posteriores —el primer estudio publicado suele ser el golpe de suerte, no el más fiel [5].

3. P-hacking: muchas decisiones, una sola publicada

Un investigador que analiza un conjunto de datos se enfrenta a decenas de pequeñas decisiones: qué desenlaces informar, qué subgrupos examinar, cuándo dejar de recoger datos, qué covariables ajustar. Simmons y sus colegas mostraron, con simulaciones y experimentos reales, que esta flexibilidad no declarada infla drásticamente las tasas de falsos positivos —puede llegar a ser más fácil «encontrar» un efecto falso que no encontrar correctamente ninguno [3]. En la investigación sobre crianza los grados de libertad son enormes: decenas de desenlaces infantiles plausibles, muchas formas de definir «amamantado» o «entrenado para dormir», muchos subgrupos. Un único resultado significativo en un mar de análisis no informados debe tratarse como un rumor, no como un hallazgo.

El matiz importante —y la razón por la que este tema no es nihilista: cuando Head y sus colegas rastrearon textualmente miles de artículos de distintas disciplinas, encontraron que el p-hacking está efectivamente extendido, pero que su distorsión de las conclusiones metaanalíticas parece débil frente a los tamaños de efecto reales [4]. Los estudios aislados son frágiles; los cuerpos de evidencia son más robustos. El p-hacking corrompe más los ladrillos que el edificio.

4. Estudios pequeños, efectos exagerados

Los estudios pequeños son ruidosos, y el ruido más el sesgo de publicación produce una distorsión específica: solo se publican los estudios pequeños que tuvieron «suerte» con efectos grandes, así que la literatura se llena de estimaciones tempranas exageradas que luego se encogen. Button y sus colegas mostraron que la baja potencia estadística no solo hace más probables los falsos positivos, sino que infla los tamaños de efecto de los hallazgos «significativos» que aparecen —la «maldición del ganador» [6]. Este libro tiene un caso de manual: la afirmación viral de que el entrenamiento del sueño «inunda a los bebés de cortisol» viene de Middlemiss et al. 2012 —25 bebés, sin grupo de control, saliva tomada dos veces por noche, en un hospital donde eran las enfermeras quienes acostaban a los bebés. El único ensayo aleatorizado que midió el cortisol con grupo de control (Gradisar et al. 2016) encontró que el cortisol disminuyó ligeramente en los grupos de entrenamiento del sueño [9]. El estudio pequeño y sin control llegó a los titulares; el más grande y controlado hizo la corrección.

5. Estudios distintos, respuestas distintas: poblaciones, mediciones, épocas

A veces los estudios discrepan porque responden a preguntas distintas. El tema de este libro sobre el parto en casa es el ejemplo: Países Bajos, Inglaterra y EE. UU. obtienen resultados distintos porque sus sistemas de maternidad son genuinamente distintos —la integración de la matronería, las vías de traslado y la calidad de los datos varían [9]. La literatura sobre entrenamiento del sueño coincide en que los métodos conductuales tienen efectos pequeños antes de los 6 meses, pero dos revisiones «discrepan» porque midieron desenlaces distintos (Douglas y Hill 2013 frente a Kempler et al. 2016) [9]. Y un metaanálisis de 2010 que afirmaba que el parto en casa duplicaba o triplicaba la mortalidad neonatal (Wax et al.) se derrumbó bajo escrutinio: mezclaba partos en casa planificados y no planificados, usaba denominadores no comparables, y su hallazgo desapareció al excluir los estudios de mala calidad [9]. Antes de concluir «la ciencia no se pone de acuerdo», comprueba si los estudios medían alguna vez lo mismo en el mismo tipo de personas.

6. Los estudios poco fiables contaminan el registro — y luego se depuran

La historia de la vitamina D en el embarazo, del tema prenatal de este libro, es la ilustración perfecta de la convergencia: una revisión anterior sugería que la vitamina D podría prevenir complicaciones; la actualización de 2024 aplicó una comprobación de fiabilidad, descartó 21 estudios por poco fiables, y concluyó que la evidencia es ahora muy incierta [9]. La «contradicción» entre la revisión antigua y la nueva no es la ciencia cambiando de opinión —es la ciencia sacando la basura. De forma similar, la historia del hierro: una revisión de 2012 encontró que el hierro reducía significativamente el bajo peso al nacer; la revisión actualizada encontró una estimación casi idéntica (riesgo relativo 0,84 frente a 0,81) que ya no era estadísticamente significativa con más datos [9]. El efecto no desapareció; cambió la precisión. Que una revisión antigua y una nueva discrepen suele ser simplemente la base de evidencia madurando.

7. La crisis de la replicación, y por qué en realidad es tranquilizadora

El famoso ensayo de 2005 de Ioannidis argumentaba, mediante simulaciones, que la mayoría de los hallazgos de investigación publicados son probablemente falsos —sobre todo cuando los estudios son pequeños, los efectos son pequeños, se prueban muchas hipótesis y los análisis son flexibles [1]. Los supuestos detrás de ese modelo son discutidos [10], pero los seguimientos empíricos rimaron con él: un esfuerzo masivo que replicó 100 estudios de psicología encontró que solo el 36 % de las replicaciones fueron estadísticamente significativas (frente al 97 % de los originales), y los tamaños de efecto medios se redujeron aproximadamente a la mitad [5]. Incluso el propio proyecto de replicación fue discutido —los críticos argumentaron que sus estadísticas eran defectuosas y que la reproducibilidad era en realidad alta [11]— lo cual es en sí el punto: la ciencia discute, en público, con datos, y converge despacio.

8. Las soluciones: preregistro y la jerarquía de la evidencia

La solución estructural es el preregistro: los investigadores declaran públicamente sus hipótesis, desenlaces y plan de análisis antes de recoger datos, eliminando la libertad de informar solo lo que «funcionó». La evidencia de que importa es llamativa: entre los grandes ensayos de cardiopatía de EE. UU., el 57 % informó resultados positivos antes de que el registro de ensayos se convirtiera en la norma hacia el año 2000, frente al 8 % después —y el registro estuvo fuertemente asociado con el giro hacia hallazgos nulos [7]. El preregistro no hace la ciencia pesimista; hace honesto el registro publicado.

Y la herramienta práctica es la jerarquía de la evidencia: las revisiones sistemáticas de ensayos aleatorizados superan a los ensayos aislados, que superan a los estudios observacionales, que superan a la opinión de expertos —con la calidad del estudio importando dentro de cada nivel [8]. Las calificaciones A–D de este libro se construyen sobre la misma idea. Cuando dos estudios sobre crianza se contradicen, no los promedies: pondéralos. Un gran ECA preregistrado supera a cinco pequeños estudios observacionales; una revisión sistemática supera a un ensayo aislado; y un único estudio observacional presentado como un gran avance merece un encogimiento de hombros hasta que se replique.

Qué significa para los padres

Permiso, no parálisis. La lección parental más útil: cuando la evidencia discrepa de verdad, cualquiera de las dos decisiones es defendible. Si los estudios sobre lactancia frente a biberón discrepan sobre el CI, o los estudios sobre parto en casa frente a hospital discrepan sobre desenlaces raros, ese desacuerdo es en sí información —significa que el efecto, si existe, es lo bastante pequeño como para esconderse. Los efectos pequeños no merecen grandes culpas. «La ciencia está dividida» no es un fracaso de la ciencia; es una licencia para decidir por otros motivos: tus valores, tus circunstancias, el consejo de tu médico.

No reformes tu vida por un artículo. La regla más práctica: ninguna decisión de crianza debería depender jamás de un único estudio. Espera a la revisión, a la replicación, al segundo diseño. La alarma del cortisol de Middlemiss, la alarma del parto en casa de Wax —ambas fueron estudios aislados frágiles que la evidencia posterior corrigió [9]. Los titulares informan del primer estudio; la sabiduría espera al segundo.

Una mejor forma de discutir sobre crianza. Las parejas, los abuelos y los foros de internet libran guerras de poder con estudios aislados («pero este estudio dice…»). La jerarquía te da un movimiento más calmado: «ese es un pequeño estudio observacional; esto es lo que dice la revisión de los ensayos». Despersonaliza el desacuerdo —no estás despreciando su preocupación, estás ponderando la evidencia.

Una laguna honesta: si entender estos conceptos reduce de verdad la ansiedad parental o cambia las decisiones no se ha probado en ensayos —la base de evidencia es metainvestigación en psicología y medicina, no intervenciones de crianza [1][4][5]. La afirmación aquí es modesta: estas son las preguntas que se hacen los propios investigadores cuando los estudios se contradicen, así que también son las preguntas adecuadas para ti. Si aprender por qué los estudios discrepan hace que el ruido parezca menos amenazante, es una expectativa razonable, no un resultado probado.

Lo que sigue sin estar claro

Beneficios y riesgos en términos absolutos

(Adaptada para este tema: cuatro desacuerdos de este libro, qué explica probablemente cada uno, y en qué confiar.)

DesacuerdoEstudio AEstudio BExplicación probableQué sopesar más
Lactancia y CIPROBIT (ECA por conglomerados de un programa de promoción): +7,5 puntos de CI verbalEstudios de hermanos: sin diferencia tras ajustar por CI maternoConfusión por características maternas; PROBIT aleatorizó hospitales, no bebés [9]Los estudios de hermanos para la pregunta causal —pero con la honesta incertidumbre residual en mente
Entrenamiento del sueño y cortisol infantilMiddlemiss 2012 (n=25, sin control): cortisol «elevado»Gradisar 2016 (ECA con control): el cortisol disminuyó ligeramenteEstudio pequeño, sin control y en un entorno inusual frente a ensayo controlado [9]El ECA —con diferencia
Seguridad del parto en casaMetaanálisis de Wax 2010: mortalidad neonatal duplicada/triplicadaBirthplace, de Jonge, Hutton: poca o ninguna diferencia en sistemas integradosSíntesis defectuosa (mezcló partos planificados y no planificados, malos denominadores); distintos sistemas/poblaciones [9]Los grandes estudios prospectivos y los análisis agrupados de datos de buena calidad
Vitamina D en el embarazoRevisiones previas a 2020: posibles beneficiosCochrane 2024: 21 estudios excluidos por poco fiables → muy inciertaEnsayos poco fiables contaminando el registro, luego depurados [9]La revisión con comprobación de fiabilidad
Hierro y bajo peso al nacerRevisión de 2012: RR 0,81, significativoActualización de 2015: RR 0,84 (0,69–1,03), no significativoBase de evidencia creciente; estimación estable, precisión cambiada —no es una contradicción [9]La revisión actualizada (y nota: «no significativo» ≠ «sin efecto»)

Consideraciones prácticas

Sopesar dos estudios en conflicto — la lista de comprobación:

  1. El diseño primero. ECA > cohorte prospectiva > retrospectivo/transversal > opinión de expertos [8]. Un ensayo aleatorizado supera a cinco estudios observacionales sobre la misma pregunta.
  2. Tamaño y precisión. Los estudios pequeños son ruidosos y sus efectos publicados suelen estar exagerados [6]. Busca el intervalo de confianza, no solo el resultado del titular.
  3. ¿Estaba preregistrado? Un ensayo preregistrado o un plan de análisis preregistrado vale más que uno post hoc —el registro se asocia con muchos menos hallazgos «positivos» [7].
  4. ¿A quién se estudió, cuándo, dónde? Distintas poblaciones, mediciones y épocas explican muchas «contradicciones» que no son contradicciones [9].
  5. ¿Un estudio o una revisión? Confía en la revisión sistemática más que en el estudio aislado; confía en la revisión actualizada más que en la antigua [9].
  6. ¿Quién lo financió, y qué midió? Los conflictos de interés y el cambio de desenlaces merecen un vistazo —el preregistro es la defensa [3][7].
  7. ¿La «contradicción» sobrevive a la lista de comprobación? A menudo se disuelve: diseños distintos, poblaciones distintas, o un estudio frágil frente a uno sólido.

Cuándo hablar con tu médico, matrona o pediatra

Referencias

  1. Ioannidis JPA. Why most published research findings are false. PLoS Medicine. 2005;2(8):e124. — [C] https://doi.org/10.1371/journal.pmed.0020124
  2. Turner EH, Matthews AM, Linardatos E, Tell RA, Rosenthal R. Selective publication of antidepressant trials and its influence on apparent efficacy. New England Journal of Medicine. 2008;358(3):252–260. — [B] https://doi.org/10.1056/NEJMsa065779
  3. Simmons JP, Nelson LD, Simonsohn U. False-positive psychology: undisclosed flexibility in data collection and analysis allows presenting anything as significant. Psychological Science. 2011;22(11):1359–1366. — [C] https://doi.org/10.1177/0956797611417632
  4. Head ML, Holman L, Lanfear R, Kahn AT, Jennions MD. The extent and consequences of p-hacking in science. PLoS Biology. 2015;13(3):e1002106. — [C] https://doi.org/10.1371/journal.pbio.1002106
  5. Open Science Collaboration. Estimating the reproducibility of psychological science. Science. 2015;349(6251):aac4716. — [B] https://doi.org/10.1126/science.aac4716
  6. Button KS, Ioannidis JPA, Mokrysz C, Nosek BA, Flint J, Robinson ESJ, Munafò MR. Power failure: why small sample size undermines the reliability of neuroscience. Nature Reviews Neuroscience. 2013;14(5):365–376. — [C] https://doi.org/10.1038/nrn3475
  7. Kaplan RM, Irvin VL. Likelihood of null effects of large NHLBI clinical trials has increased over time. PLoS One. 2015;10(8):e0132382. — [C] https://doi.org/10.1371/journal.pone.0132382
  8. Evans D. Hierarchy of evidence: a framework for ranking evidence evaluating healthcare interventions. Journal of Clinical Nursing. 2003;12(1):77–84. — [framework] https://doi.org/10.1046/j.1365-2702.2003.00662.x
  9. Case studies from this book's topics (full primary citations; case-study analysis lives in each topic): - Breastfeeding/IQ: Kramer MS et al. Promotion of Breastfeeding Intervention Trial (PROBIT): a randomized trial in the Republic of Belarus. JAMA. 2001;285(4):413–420; and Kramer MS et al. Breastfeeding and child cognitive development: new evidence from a large randomized trial. Arch Gen Psychiatry. 2008;65(5):578–584 — [B] (cluster RCT of promotion programme; +7.5 verbal IQ points at age 6.5; maternal IQ not directly measured). Vs sibling studies: Colen CG, Ramey DM. Is breast truly best? Soc Sci Med. 2014;109:55–65 — [B]; Der G, Batty GD, Deary IJ. Effect of breast feeding on intelligence in children: prospective study, sibling pairs analysis, and meta-analysis. BMJ. 2006;333(7575):945 — [B] (no difference after maternal-IQ adjustment). Analysis in this book's breastmilk-vs-formula-outcomes topic. - Sleep-training cortisol: Middlemiss W et al. Asynchrony of mother–infant HPA axis activity following extinction of infant crying responses. Early Hum Dev. 2012;88(4):227–232 — [C] (n=25, no control group, two saliva samples per night, residential hospital with nurses settling). Vs Gradisar M et al. Behavioral interventions for infant sleep problems: a randomized controlled trial. Pediatrics. 2016;137(6):e20151486 — [B] (RCT with control; cortisol declined slightly in intervention groups). Analysis in this book's sleep-training-attachment topic. - Iron and low birthweight: Peña-Rosas JP et al. Daily oral iron supplementation during pregnancy. Cochrane Database Syst Rev. 2015 (updated from the 2012 version) — [B] (2012: RR 0.81, significant; 2015: RR 0.84, 95% CI 0.69–1.03, not significant). Vitamin D: Palacios C et al. Vitamin D supplementation for women during pregnancy. Cochrane Database Syst Rev. 2024 — [C] (21 studies excluded after trustworthiness assessment; evidence very uncertain). Calcium funnel-plot asymmetry: Hofmeyr GJ et al. Calcium supplementation during pregnancy for preventing hypertensive disorders and related problems. Cochrane Database Syst Rev. 2014 — [B]. Analysis in this book's prenatal-vitamins-folic-acid topic. - Home-birth disagreements: Wax JR et al. Maternal and newborn outcomes in planned home birth vs planned hospital births: a metaanalysis. Am J Obstet Gynecol. 2010;203:243.e1–8 — [C] (critiqued in Michal CA et al. Planned home vs hospital birth: a meta-analysis gone wrong. Medscape Ob/Gyn. 2011); vs Brocklehurst P et al. BMJ. 2011;343:d7400, de Jonge A et al. BJOG. 2009;116:1177–1184, and Hutton EK et al. EClinicalMedicine. 2019;14:59–70 — [B] (integrated systems: little/no difference). Analysis in this book's home-birth-vs-hospital-safety topic. - Sleep training under 6 months: Douglas PS, Hill PS. J Dev Behav Pediatr. 2013;34(7):497–507 vs Kempler L et al. Sleep Med Rev. 2016;29:15–22 — [B] (different outcomes measured; both agree effects are small at best). Analysis in this book's sleep-training-attachment topic.
  10. Goodman S, Greenland S. Assessing the unreliability of the medical literature: a response to "Why most published research findings are false". Johns Hopkins University, Department of Biostatistics. 2007 (Working Paper 135). — [working paper] https://biostats.bepress.com/jhubiostat/paper135/ (disputes Ioannidis's assumptions — low prior probabilities, dichotomised p-values, bias factor — and his "hot fields" claim; see evidence log.)
  11. Gilbert DT, King G, Pettigrew S, Wilson TD. Comment on "Estimating the reproducibility of psychological science". Science. 2016;351(6277):1037. — [C] https://doi.org/10.1126/science.aad7243

Registro de cambios

← Todos los temas