Cada regresión logística que corres, cada curva de Kaplan–Meier que interpretas y cada valor p que discutes tienen un artículo fundacional con nombre y fecha. Aquí están los 220 hitos que construyeron la investigación clínica moderna, de la probabilidad de Bayes a las guías de reporte para modelos con inteligencia artificial: qué aportó cada uno y el enlace al original.
Filtrar por área
Filtrar por época
1763–1899Los cimientosAntes de que existiera la bioestadística como disciplina: la probabilidad, el ajuste de curvas, el mapa del cólera y los primeros gráficos que cambiaron una política sanitaria.6 hitos
- 1763
Thomas Bayes — An Essay Towards Solving a Problem in the Doctrine of Chances
Fundamento del teorema de Bayes y de la idea de actualizar una probabilidad conforme llega evidencia nueva. Todo el razonamiento diagnóstico bayesiano sale de aquí.
Inferencia y estadísticaVer el original → - 1805–1809
Legendre y Gauss — mínimos cuadrados
Estimar parámetros minimizando el error al cuadrado. Es el ancestro directo de la regresión lineal y de casi todo el modelamiento estadístico posterior.
Modelamiento y regresiónSin enlace abierto - 1835
Pierre Charles Alexandre Louis — Recherches sur les effets de la saignée
El método numérico contra la sangría: contar desenlaces en lugar de fiarse de la impresión clínica. La primera vez que una terapia consagrada se cae por aritmética.
Ensayos clínicosVer el original → - 1855
John Snow — On the Mode of Communication of Cholera
El acta de nacimiento de la epidemiología de campo: investigar un brote, mapear casos y razonar la relación exposición–enfermedad sin conocer todavía el agente.
EpidemiologíaVer el original → - 1858
Florence Nightingale — diagramas de mortalidad del ejército británico
La demostración más temprana de que un gráfico bien hecho cambia una política sanitaria. Visualización de datos como instrumento de persuasión, no como adorno.
Datos, software y reproducibilidadVer el original → - 1886
Francis Galton — Regression Towards Mediocrity in Hereditary Stature
Origina el concepto de regresión a la media y, de paso, le da nombre a toda una familia de métodos.
Modelamiento y regresiónVer el original →
1900–1949Nace la estadística modernaPearson, Gosset, Fisher y Neyman construyen el aparato que todavía usamos: pruebas, likelihood, aleatorización, potencia. Y al final del periodo, el primer ensayo aleatorizado y el primer código de ética.15 hitos
- 1900
Karl Pearson — prueba de χ²
La primera prueba general de bondad de ajuste y la base del análisis de tablas de contingencia.
Inferencia y estadísticaVer el original → - 1901
Karl Pearson — On Lines and Planes of Closest Fit
El origen del análisis de componentes principales (PCA), la técnica de reducción de dimensiones más usada durante un siglo.
Machine learning e IAVer el original → - 1908
William Gosset, «Student» — The Probable Error of a Mean
Introduce la distribución t y hace posible la inferencia con muestras pequeñas, que es la situación habitual en investigación clínica.
Inferencia y estadísticaVer el original → - 1922
R. A. Fisher — On the Mathematical Foundations of Theoretical Statistics
Formaliza likelihood, suficiencia, eficiencia y estimación: el vocabulario básico de la estadística teórica.
Inferencia y estadísticaVer el original → - 1925
R. A. Fisher — Statistical Methods for Research Workers
Saca la estadística del departamento de matemáticas y la pone en manos del investigador aplicado: ANOVA, correlación y pruebas t explicadas para quien hace experimentos.
Inferencia y estadísticaSin enlace abierto - 1927
Kermack y McKendrick — teoría matemática de las epidemias
Fundamento de los modelos SIR de transmisión. Un siglo después seguíamos hablando de esas ecuaciones todos los días en 2020.
EpidemiologíaVer el original → - 1933
Neyman y Pearson — pruebas de hipótesis más eficientes
Formaliza H₀/H₁, errores tipo I y II, potencia y regiones críticas. Es el andamiaje del contraste de hipótesis frecuentista.
Inferencia y estadísticaVer el original → - 1935
R. A. Fisher — The Design of Experiments
Consolida aleatorización, replicación y bloqueo. Sin este libro no existe el ensayo clínico tal como lo conocemos.
Ensayos clínicosSin enlace abierto - 1937
Jerzy Neyman — teoría de la estimación estadística
Define el intervalo de confianza como procedimiento de cobertura repetida. La definición que casi todos citamos mal.
Inferencia y estadísticaVer el original → - 1938
John R. Paul — Clinical Epidemiology
El discurso donde se acuña el término epidemiología clínica: llevar el razonamiento poblacional a la cabecera del enfermo y no solo al mapa de la comunidad.
EpidemiologíaVer el original → - 1938
Ley federal de Alimentos, Medicamentos y Cosméticos (EE. UU.)
Después de las muertes por el elixir de sulfanilamida, un fármaco nuevo debe demostrar que es seguro antes de venderse. El primer filtro regulatorio de verdad.
Ética, integridad y ciencia abiertaVer el original → - 1946
Joseph Berkson — sesgo en datos hospitalarios
Describe el sesgo de Berkson: por qué dos enfermedades pueden parecer asociadas solo porque se estudian en pacientes hospitalizados.
EpidemiologíaVer el original → - 1947
Código de Núremberg
El consentimiento voluntario deja de ser una cortesía y pasa a ser condición de la investigación en seres humanos.
Ética, integridad y ciencia abiertaVer el original → - 1948
Medical Research Council — ensayo de estreptomicina en tuberculosis pulmonar
Uno de los primeros ensayos aleatorizados modernos: comparación concurrente, asignación al azar y evaluación sistemática del desenlace.
Ensayos clínicosVer el original → - 1948
Claude Shannon — A Mathematical Theory of Communication
Entropía e información. La base matemática de la compresión, del aprendizaje automático y de buena parte de las métricas modernas.
Datos, software y reproducibilidadVer el original →
1950–1979La epidemiología clínicaEl tabaco, Framingham y los grandes estudios observacionales obligan a formalizar confusión, sesgo y causalidad. Kaplan–Meier, Cox y el marco contrafactual aparecen en veinte años.50 hitos
- 1950
Doll y Hill — tabaco y carcinoma de pulmón
El caso–control que cambió la salud pública del siglo XX y demostró de lo que era capaz la epidemiología observacional.
EpidemiologíaVer el original → - 1950
W. S. Robinson — correlaciones ecológicas
Formaliza la falacia ecológica: lo que es cierto para los países no tiene por qué serlo para las personas.
EpidemiologíaVer el original → - 1950
Glenn Brier — verificación de pronósticos probabilísticos
Introduce el Brier score, que setenta años después sigue siendo la mejor forma simple de evaluar una predicción de riesgo.
Predicción, diagnóstico y mediciónVer el original → - 1951
Jerome Cornfield — tasas comparativas a partir de datos clínicos
Establece por qué y cuándo el odds ratio de un caso–control aproxima el riesgo relativo. La justificación teórica del diseño.
EpidemiologíaVer el original → - 1951
Lee Cronbach — coeficiente alfa
La medida clásica de consistencia interna. Imprescindible cuando se valida un cuestionario o una escala.
Predicción, diagnóstico y mediciónVer el original → - 1951
E. H. Simpson — interacción en tablas de contingencia
El origen de la paradoja de Simpson: la asociación global puede invertirse dentro de cada estrato.
Inferencia y estadísticaVer el original → - 1952
Horvitz y Thompson — muestreo sin reemplazo
El estimador Horvitz–Thompson y la idea de ponderar por la inversa de la probabilidad, que reaparece cincuenta años después en el IPTW.
Inferencia y estadísticaVer el original → - 1953
Morton Levin — cáncer de pulmón
Desarrolla el concepto de fracción atribuible poblacional: cuánto de la enfermedad desaparecería si elimináramos la exposición.
EpidemiologíaVer el original → - 1953
Metropolis y cols. — cálculo por métodos de Monte Carlo
El algoritmo de Metropolis, origen del MCMC y de toda la computación bayesiana moderna.
Inferencia y estadísticaVer el original → - 1954
Doll y Hill — estudio de los médicos británicos
La cohorte prospectiva por antonomasia: cincuenta años de seguimiento y la confirmación definitiva del daño del tabaco.
EpidemiologíaVer el original → - 1955
Evelyn Kitagawa — componentes de la diferencia entre dos tasas
El trabajo clásico sobre descomposición y estandarización de tasas. Por qué dos poblaciones no se comparan en crudo.
EpidemiologíaVer el original → - 1958
D. R. Cox — análisis de regresión de secuencias binarias
El antecedente directo de la regresión logística, el caballo de batalla de la investigación clínica.
Modelamiento y regresiónVer el original → - 1958
Kaplan y Meier — estimación no paramétrica con observaciones incompletas
Resuelve con elegancia el problema de la censura y nos da la curva que aparece en cada ensayo oncológico y cardiovascular.
Modelamiento y regresiónVer el original → - 1959
Mantel y Haenszel — análisis de estudios retrospectivos
El estimador Mantel–Haenszel y la formalización del ajuste estratificado por confusión.
EpidemiologíaVer el original → - 1959
Cornfield y cols. — tabaco y cáncer de pulmón
El primer análisis de sensibilidad de la historia: qué tan fuerte tendría que ser un confusor no medido para explicar la asociación observada.
Inferencia causalVer el original → - 1960
Jacob Cohen — coeficiente kappa
Mide concordancia descontando el acuerdo que se daría por puro azar. Obligatorio en estudios de observadores.
Predicción, diagnóstico y mediciónVer el original → - 1960
Thistlethwaite y Campbell — regresión discontinua
Origina el diseño de regresión discontinua: aprovechar un punto de corte administrativo como si fuera una asignación al azar.
Inferencia causalVer el original → - 1960
Georg Rasch — modelos probabilísticos de test
Fundamento de los modelos Rasch y de la teoría de respuesta al ítem, base de la psicometría moderna.
Predicción, diagnóstico y mediciónSin enlace abierto - 1961
Kannel y cols. — estudio Framingham
Consolida el concepto mismo de factor de riesgo cardiovascular. Sin Framingham no hay tablas de riesgo ni prevención primaria.
EpidemiologíaVer el original → - 1962
Enmiendas Kefauver–Harris
Ya no basta con probar que un fármaco es seguro: hay que probar que sirve, y con investigaciones adecuadas y controladas. El ensayo clínico se vuelve obligatorio por ley.
Ensayos clínicosVer el original → - 1964
Box y Cox — análisis de transformaciones
La familia Box–Cox: cómo buscar la transformación que arregla linealidad, homocedasticidad y normalidad a la vez.
Modelamiento y regresiónVer el original → - 1964
Declaración de Helsinki
El marco ético internacional de la investigación médica en seres humanos, revisado desde entonces una y otra vez.
Ética, integridad y ciencia abiertaVer el original → - 1965
Austin Bradford Hill — ¿asociación o causalidad?
Las nueve consideraciones de Bradford Hill. No son una lista de cotejo, pero cambiaron para siempre cómo se argumenta la causalidad en medicina.
Inferencia causalVer el original → - 1967
James MacQueen — k-means
Populariza el algoritmo de agrupamiento más usado de la historia. La puerta de entrada al aprendizaje no supervisado.
Machine learning e IAVer el original → - 1967
McMaster — Departamento de Epidemiología Clínica y Bioestadística
La epidemiología clínica deja de ser una idea y pasa a tener departamento, presupuesto y alumnos. David Sackett lo dirige desde el primer día.
EpidemiologíaVer el original → - 1968
Wilson y Jungner — principios del tamizaje
Los diez criterios de la OMS que todavía deciden si un programa de cribado poblacional tiene sentido o solo genera sobrediagnóstico.
EpidemiologíaVer el original → - 1968
SPSS
El primer gran software estadístico de uso masivo. Puso el análisis multivariable al alcance de quien no programaba.
Datos, software y reproducibilidadVer el original → - 1968
Alvan Feinstein — serie Clinical Epidemiology
Feinstein mete los métodos epidemiológicos dentro del diagnóstico, el pronóstico y la decisión terapéutica de un paciente concreto. La disciplina moderna tomando forma.
EpidemiologíaVer el original → - 1970
W. K. Hastings — Metropolis–Hastings
Generaliza el algoritmo de Metropolis y deja lista la maquinaria del MCMC que haría viable la estadística bayesiana aplicada.
Inferencia y estadísticaVer el original → - 1970
Hoerl y Kennard — regresión ridge
Introduce la penalización L2: aceptar un poco de sesgo a cambio de mucha menos varianza. El primer paso hacia el ML regularizado.
Machine learning e IAVer el original → - 1970
E. F. Codd — modelo relacional de datos
El fundamento de las bases de datos relacionales y de SQL. Cada historia clínica electrónica descansa sobre esta idea.
Datos, software y reproducibilidadVer el original → - 1970
Fanshel y Bush — índice de estado de salud
Uno de los antecedentes conceptuales del QALY y de la valoración cuantitativa de estados de salud.
Implementación y economía de la saludSin enlace abierto - 1971
MEDLINE
La literatura médica se vuelve buscable a distancia. Hasta entonces había que caminar hasta la hemeroteca y confiar en el Index Medicus impreso.
Datos, software y reproducibilidadVer el original → - 1972
Nelder y Wedderburn — modelos lineales generalizados
Los GLM unifican regresión lineal, logística y de Poisson bajo una sola estructura. Una de las grandes síntesis del siglo.
Modelamiento y regresiónVer el original → - 1972
D. R. Cox — modelos de regresión y tablas de vida
El modelo de riesgos proporcionales: análisis multivariable de tiempo a evento sin necesidad de especificar el hazard basal.
Modelamiento y regresiónVer el original → - 1972
Fin del estudio de sífilis de Tuskegee
Cuarenta años observando sífilis sin tratar en hombres negros de Alabama. Cuando la prensa lo destapa, Estados Unidos se ve forzado a rehacer sus reglas de protección de participantes.
Ética, integridad y ciencia abiertaVer el original → - 1972
Archie Cochrane — Effectiveness and Efficiency
La pregunta incómoda que sigue vigente: de todo lo que hacemos a diario, ¿qué está realmente probado? El libro que le puso nombre al problema que la MBE vendría a resolver.
MBE y síntesis de evidenciaVer el original → - 1974
Hirotugu Akaike — criterio AIC
Formaliza el equilibrio entre ajuste y complejidad. El primer criterio de selección de modelos de uso general.
Modelamiento y regresiónVer el original → - 1974
Mervyn Stone — validación cruzada
El fundamento formal de la cross-validation, hoy el estándar para estimar el desempeño fuera de la muestra.
Modelamiento y regresiónVer el original → - 1974
Donald Rubin — efectos causales en estudios aleatorizados y no aleatorizados
El marco de resultados potenciales: Y(1), Y(0) y el problema fundamental de la inferencia causal.
Inferencia causalVer el original → - 1974
National Research Act
La protección de los participantes deja de depender de la buena voluntad del investigador: comités de ética por ley y una comisión nacional que cinco años después firmaría el Informe Belmont.
Ética, integridad y ciencia abiertaVer el original → - 1976
Donald Rubin — Inference and Missing Data
Define MCAR, MAR y MNAR, y explica cuándo se puede ignorar el mecanismo de pérdida de datos y cuándo no.
Modelamiento y regresiónVer el original → - 1976
Olli Miettinen — estudios de caso y referente
Fundamenta el muestreo por densidad de incidencia y ordena conceptualmente el diseño caso–control.
EpidemiologíaVer el original → - 1976
Kenneth Rothman — Causes
Causas suficientes y componentes: los «pasteles causales» que explican por qué casi ninguna enfermedad tiene una sola causa.
Inferencia causalVer el original → - 1977
Dempster, Laird y Rubin — algoritmo EM
Expectation–Maximization: cómo estimar cuando hay datos incompletos o variables latentes. Motor silencioso de muchísimos métodos.
Modelamiento y regresiónVer el original → - 1977
John Tukey — Exploratory Data Analysis
Reivindica mirar los datos antes de modelarlos. De aquí salen el boxplot y la cultura de explorar antes de confirmar.
Inferencia y estadísticaSin enlace abierto - 1979
Bradley Efron — bootstrap
Estimar la incertidumbre remuestreando los propios datos. Revoluciona los intervalos de confianza cuando la fórmula no existe.
Inferencia y estadísticaVer el original → - 1979
David Sackett — sesgos en investigación analítica
El catálogo clásico de sesgos. Sigue siendo una lectura incómoda y necesaria antes de diseñar un estudio.
EpidemiologíaVer el original → - 1979
Informe Belmont
Autonomía, beneficencia y justicia: los tres principios sobre los que se construyeron los comités de ética actuales.
Ética, integridad y ciencia abiertaVer el original → - 1979
Shrout y Fleiss — correlaciones intraclase
Ordena los distintos ICC y para qué sirve cada uno. La referencia cuando se estudia confiabilidad de una medición.
Predicción, diagnóstico y mediciónVer el original →
1980–1999Modelos, computación y evidenciaLlegan los modelos mixtos, el bootstrap, el MCMC y la regularización. Al mismo tiempo nacen la MBE, Cochrane, los DAG y el software que hoy damos por sentado.57 hitos
- 1980
Hosmer y Lemeshow — bondad de ajuste en regresión logística
La prueba que popularizó evaluar la calibración de un modelo logístico, con todas sus limitaciones conocidas.
Predicción, diagnóstico y mediciónVer el original → - 1980
Pauker y Kassirer — enfoque del umbral en la decisión clínica
Introduce los umbrales diagnóstico y terapéutico: cuándo no vale la pena pedir otra prueba y cuándo hay que tratar sin ella.
MBE y síntesis de evidenciaVer el original → - 1981
John Lachin — tamaño muestral y análisis de potencia
Sistematiza el cálculo de potencia y tamaño de muestra para ensayos. El capítulo que más se improvisa en las tesis.
Ensayos clínicosVer el original → - 1981
McMaster — How to read clinical journals
La serie que convirtió la lectura crítica en un procedimiento con criterios explícitos para diagnóstico, pronóstico, causa y tratamiento. El puente directo hacia la MBE.
MBE y síntesis de evidenciaVer el original → - 1982
Laird y Ware — modelos de efectos aleatorios para datos longitudinales
La base de los modelos mixtos: medidas repetidas y estructuras jerárquicas sin violar el supuesto de independencia.
Modelamiento y regresiónVer el original → - 1982
Hanley y McNeil — significado y uso del área bajo la curva ROC
Le da interpretación estadística al AUC y lo instala como lenguaje común del rendimiento diagnóstico.
Predicción, diagnóstico y mediciónVer el original → - 1983
Rosenbaum y Rubin — el papel central del propensity score
Reduce decenas de covariables a un solo número para balancear grupos en estudios no aleatorizados.
Inferencia causalVer el original → - 1984
MATLAB
Lleva el cálculo matricial y los métodos numéricos a un entorno interactivo. Cambia cómo se prototipan los métodos.
Datos, software y reproducibilidadVer el original → - 1984
Geman y Geman — muestreo de Gibbs
Hace computacionalmente práctico el Gibbs sampler y prepara la revolución bayesiana de los años noventa.
Inferencia y estadísticaVer el original → - 1984
Breiman, Friedman, Olshen y Stone — CART
Consolida los árboles de clasificación y regresión. De aquí salen random forest y todo el boosting posterior.
Machine learning e IASin enlace abierto - 1984
Donald Knuth — Literate Programming
Código y explicación en un mismo documento. La idea que treinta años después se llama R Markdown o Jupyter.
Datos, software y reproducibilidadVer el original → - 1985
Stata 1.0
Integra análisis, gestión de datos y scripting reproducible. Su cultura de do-files marcó a la epidemiología entera.
Datos, software y reproducibilidadVer el original → - 1985
Epi Info — CDC
Lleva el análisis de brotes y encuestas a la computadora personal, gratis y en campo. Un antes y un después en salud pública.
Datos, software y reproducibilidadVer el original → - 1985
Geoffrey Rose — Sick Individuals and Sick Populations
Distingue las causas de los casos de las causas de la incidencia. La paradoja de la prevención explicada en doce páginas.
EpidemiologíaVer el original → - 1985
Sackett, Haynes y Tugwell — Clinical Epidemiology: A Basic Science for Clinical Medicine
El texto que le reclama a la epidemiología clínica el estatus de ciencia básica de la práctica: tan necesaria en el consultorio como la fisiología.
EpidemiologíaVer el original → - 1986
Bland y Altman — concordancia entre dos métodos de medición
Deja claro de una vez que correlación no es concordancia, y da el gráfico con el que hoy se comparan dos métodos.
Predicción, diagnóstico y mediciónVer el original → - 1986
DerSimonian y Laird — metaanálisis en ensayos clínicos
El modelo de efectos aleatorios que aparece por defecto en casi todos los metaanálisis publicados desde entonces.
MBE y síntesis de evidenciaVer el original → - 1986
Liang y Zeger — ecuaciones de estimación generalizadas
Las GEE permiten modelos marginales con observaciones correlacionadas: clústeres, medidas repetidas, datos de conglomerados.
Modelamiento y regresiónVer el original → - 1986
Rumelhart, Hinton y Williams — retropropagación
Populariza el algoritmo que hace entrenable una red neuronal profunda. Tardó treinta años en dar sus frutos.
Machine learning e IAVer el original → - 1986
James Robins — efecto del trabajador sano superviviente
El problema que obligó a inventar los métodos g: cuando la exposición futura depende de la salud presente, ajustar de la manera clásica hace daño.
Inferencia causalSin enlace abierto - 1986
Martijn Katan — apolipoproteína E y el germen de la aleatorización mendeliana
Una carta breve que propone usar los genes como instrumento natural. Diecisiete años después sería un campo entero.
Inferencia causalSin enlace abierto - 1987
Donald Rubin — imputación múltiple
Sistematiza cómo imputar datos faltantes varias veces y combinar los resultados sin subestimar la incertidumbre.
Modelamiento y regresiónSin enlace abierto - 1988
Laupacis, Sackett y Roberts — medidas clínicamente útiles
Populariza el NNT y las medidas absolutas de beneficio. La mejor vacuna contra el riesgo relativo mal contado.
MBE y síntesis de evidenciaVer el original → - 1988
Jacob Cohen — Statistical Power Analysis
Instala en la práctica los conceptos de tamaño del efecto y potencia, y la idea de planificar el estudio antes de correrlo.
Inferencia y estadísticaSin enlace abierto - 1991
Python
Nace como lenguaje de propósito general. Décadas después sería la columna vertebral del cómputo científico y de la IA.
Datos, software y reproducibilidadVer el original → - 1991
Malcolm Maclure — diseño case-crossover
Cada paciente es su propio control. Ideal para exposiciones transitorias y desenlaces agudos, como un infarto tras un esfuerzo.
EpidemiologíaVer el original → - 1991
Besag, York y Mollié — modelo BYM
El modelo bayesiano de referencia para mapear enfermedades y suavizar tasas en áreas pequeñas.
EpidemiologíaVer el original → - 1991
Gordon Guyatt — el término «medicina basada en evidencia»
Un editorial de una página bautiza el movimiento. El nombre pegó antes que el método.
MBE y síntesis de evidenciaVer el original → - 1992
Evidence-Based Medicine Working Group
Formaliza la medicina basada en evidencia como paradigma de enseñanza y de práctica. El artículo que fundó una escuela.
MBE y síntesis de evidenciaVer el original → - 1992
Wacholder y cols. — selección de controles
Define correctamente la población fuente. El error más caro de un caso–control se comete al elegir los controles.
EpidemiologíaVer el original → - 1992
Robins y Greenland — efectos directos e indirectos
Da fundamento contrafactual al análisis de mediación y muestra por qué el método clásico de Baron y Kenny se queda corto.
Inferencia causalVer el original → - 1992
Gelman y Rubin — diagnóstico de convergencia
El R-hat: cómo saber si las cadenas de un modelo bayesiano ya convergieron o si estamos leyendo ruido.
Inferencia y estadísticaVer el original → - 1993
Clarice Weinberg — hacia una definición más clara de confusión
Refina la definición causal de confusión y anticipa por qué ajustar por todo lo que se pueda medir es mala idea.
Inferencia causalVer el original → - 1993
Sonnenberg y Beck — modelos de Markov en decisión médica
Populariza los modelos de Markov para evaluar estrategias clínicas y costo-efectividad a lo largo del tiempo.
Implementación y economía de la saludVer el original → - 1993
Colaboración Cochrane
Institucionaliza la revisión sistemática rigurosa y la idea de mantener la evidencia actualizada en lugar de publicarla y olvidarla.
MBE y síntesis de evidenciaVer el original → - 1993
Oxman, Sackett y Guyatt — Users’ Guides to the Medical Literature
La serie de JAMA que enseñó a preguntarle a un artículo tres cosas en orden: si es válido, qué mide y si sirve para el paciente que uno tiene enfrente.
MBE y síntesis de evidenciaVer el original → - 1995
Benjamini y Hochberg — tasa de falsos descubrimientos
El FDR: una forma sensata de controlar la multiplicidad cuando se prueban miles de hipótesis, sin la brutalidad de Bonferroni.
Inferencia y estadísticaVer el original → - 1995
Cortes y Vapnik — support-vector networks
Consolida las SVM, el algoritmo dominante del machine learning durante la década anterior al deep learning.
Machine learning e IAVer el original → - 1995
Schena y cols. — monitorización cuantitativa de expresión génica
El hito temprano de los microarrays: por primera vez, miles de mediciones por muestra y el problema de la multiplicidad en serio.
Genómica y ómicasVer el original → - 1995
Kass y Raftery — factores de Bayes
Sistematiza cómo comparar hipótesis de forma bayesiana y cómo interpretar la magnitud de la evidencia.
Inferencia y estadísticaVer el original → - 1996
Ihaka y Gentleman — R
Presenta formalmente R: un lenguaje diseñado alrededor del análisis estadístico y los gráficos, y además libre.
Datos, software y reproducibilidadVer el original → - 1996
Robert Tibshirani — LASSO
Penalización L1: encoge coeficientes y además selecciona variables. Indispensable cuando hay más predictores que pacientes.
Machine learning e IAVer el original → - 1996
Harrell, Lee y Mark — modelos pronósticos multivariables
Ordena el sobreajuste, la validación y la regla de los diez eventos por variable. Lectura obligatoria antes de construir un score.
Predicción, diagnóstico y mediciónVer el original → - 1996
Angrist, Imbens y Rubin — variables instrumentales
Conecta las variables instrumentales con el marco contrafactual y define qué efecto se está estimando realmente (el LATE).
Inferencia causalVer el original → - 1996
ICH-GCP E6 — Buenas Prácticas Clínicas
Estandariza internacionalmente cómo se conduce, monitoriza y documenta un ensayo clínico.
Ética, integridad y ciencia abiertaVer el original → - 1996
Declaración CONSORT
La lista de cotejo y el diagrama de flujo que obligaron a rendir cuentas de cada paciente aleatorizado. Todo lo que vino después son extensiones de esto.
Guías de reporteVer el original → - 1996
Sackett y cols. — Evidence based medicine: what it is and what it isn’t
El editorial que salió a desmentir la caricatura: la MBE no es recetario ni estadística contra clínica, sino evidencia, experiencia y valores del paciente a la vez.
MBE y síntesis de evidenciaVer el original → - 1997
Egger y cols. — sesgo en metaanálisis
Populariza la prueba de asimetría del funnel plot y la sospecha sistemática sobre los estudios pequeños con efectos grandes.
MBE y síntesis de evidenciaVer el original → - 1997
Martin Kulldorff — spatial scan statistic
El método estándar para detectar clústeres espaciales de enfermedad sin decidir de antemano dónde mirar.
EpidemiologíaSin enlace abierto - 1997
PubMed
MEDLINE gratis y por Internet. Buscar evidencia deja de ser un privilegio de quien tenía biblioteca con suscripción.
Datos, software y reproducibilidadVer el original → - 1998
Norbert Kerr — HARKing
Acuña Hypothesizing After the Results are Known: presentar como hipótesis previa lo que en realidad se encontró después.
Ética, integridad y ciencia abiertaVer el original → - 1998
ICH E9 — principios estadísticos de los ensayos clínicos
Pone por escrito lo que hasta entonces era costumbre: intención de tratar, manejo de la multiplicidad, análisis interinos y un plan estadístico firmado antes de mirar los datos.
Ensayos clínicosVer el original → - 1999
Greenland, Pearl y Robins — diagramas causales
Introduce los DAG en epidemiología: confusores, mediadores, colliders y el conjunto mínimo de ajuste. Cambia cómo se decide qué variables entran al modelo.
Inferencia causalVer el original → - 1999
Fine y Gray — riesgos competitivos
El modelo de subdistribución: qué hacer cuando morir por otra causa impide observar el desenlace de interés.
Modelamiento y regresiónVer el original → - 1999
Leland Wilkinson — The Grammar of Graphics
La gramática que hay detrás de ggplot2 y de casi todas las herramientas gráficas modernas.
Datos, software y reproducibilidadSin enlace abierto - 1999
Glasgow y cols. — RE-AIM
Alcance, efectividad, adopción, implementación y mantenimiento: por qué una intervención eficaz puede fracasar en el mundo real.
Implementación y economía de la saludVer el original → - 1999
Declaración QUOROM
El primer estándar de reporte para metaanálisis y el abuelo directo de PRISMA, diagrama de flujo incluido.
Guías de reporteVer el original →
2000–2014Datos masivos y causalidadLos métodos g de Robins, el propensity score aplicado a bases administrativas, el ecosistema Python y R, y la primera gran crisis de confianza en los resultados publicados.59 hitos
- 2000
R 1.0.0
R alcanza su primera versión estable el 29 de febrero de 2000 y se convierte en el ecosistema abierto de referencia.
Datos, software y reproducibilidadVer el original → - 2000
Robins, Hernán y Brumback — modelos estructurales marginales
IPTW y MSM para confusión dependiente del tiempo, el problema clásico de los estudios de tratamiento prolongado.
Inferencia causalVer el original → - 2000
ClinicalTrials.gov
Un registro público donde el ensayo queda anotado antes de reclutar. Sin esta infraestructura no existía la exigencia de registro prospectivo que llegaría cuatro años después.
Ética, integridad y ciencia abiertaVer el original → - 2000
Declaración MOOSE
El equivalente de QUOROM para los metaanálisis de estudios observacionales, donde la heterogeneidad y el sesgo pesan todavía más.
Guías de reporteVer el original → - 2001
Leo Breiman — Statistical Modeling: The Two Cultures
Contrapone el modelamiento explicativo con la predicción algorítmica. Sigue siendo el mejor mapa del malentendido entre estadísticos y gente de ML.
Machine learning e IAVer el original → - 2001
Leo Breiman — random forests
Bagging más selección aleatoria de predictores. Durante veinte años, el algoritmo por defecto para datos tabulares.
Machine learning e IAVer el original → - 2001
Jerome Friedman — gradient boosting
Formaliza el boosting por gradiente, antecesor directo de XGBoost, LightGBM y CatBoost.
Machine learning e IAVer el original → - 2001
SciPy
Optimización, álgebra lineal, integración y estadística en Python. La pieza que faltaba para el cómputo científico.
Datos, software y reproducibilidadVer el original → - 2002
Higgins y Thompson — cuantificación de la heterogeneidad
Introduce I², la medida más usada (y más malinterpretada) para describir heterogeneidad en un metaanálisis.
MBE y síntesis de evidenciaVer el original → - 2002
Thomas Lumley — metaanálisis en red
Formaliza las comparaciones indirectas: cómo comparar A con C cuando solo hay ensayos de A frente a B y de B frente a C.
MBE y síntesis de evidenciaVer el original → - 2002
Wagner y cols. — series temporales interrumpidas
Populariza la regresión segmentada para evaluar el efecto de una política o una intervención poblacional.
Inferencia causalVer el original → - 2003
Davey Smith y Ebrahim — aleatorización mendeliana
Consolida el uso de variantes genéticas como instrumento para estimar efectos causales sin ensayo clínico.
Inferencia causalVer el original → - 2003
Wayne Ray — diseño de nuevos usuarios
Comparar solo a quienes recién inician el fármaco. La forma más simple de evitar el sesgo del usuario prevalente.
EpidemiologíaVer el original → - 2003
STARD
Estándar de reporte para estudios de exactitud diagnóstica: qué hay que contar para que otro pueda juzgar una prueba.
Guías de reporteVer el original → - 2003
Colaboración AGREE
Introduce la evaluación estructurada de la calidad de una guía de práctica clínica. Útil para decidir a qué guía hacerle caso.
MBE y síntesis de evidenciaSin enlace abierto - 2004
Hernán, Hernández-Díaz y Robins — sesgo de selección estructural
Explica el sesgo de selección con colliders y DAG, y muestra que ajustar por la variable equivocada puede crear la asociación de la nada.
Inferencia causalVer el original → - 2004
Dean y Ghemawat — MapReduce
Hace posible procesar conjuntos de datos masivos en clústeres de máquinas comunes. El inicio práctico del big data.
Datos, software y reproducibilidadVer el original → - 2004
ICMJE — registro prospectivo de ensayos
Los editores exigen registrar el ensayo antes de reclutar. El golpe más efectivo contra el sesgo de publicación selectiva.
Ética, integridad y ciencia abiertaSin enlace abierto - 2005
Zou y Hastie — elastic net
Combina penalización L1 y L2. La opción sensata cuando hay muchos predictores correlacionados entre sí.
Machine learning e IAVer el original → - 2005
John Ioannidis — Why Most Published Research Findings Are False
Cambia la conversación: potencia, sesgo, multiplicidad y probabilidad previa determinan cuánto podemos creerle a un hallazgo.
Ética, integridad y ciencia abiertaVer el original → - 2005
Git
Control de versiones distribuido. Sin él, la reproducibilidad del análisis clínico sigue siendo una carpeta con archivos numerados a mano.
Datos, software y reproducibilidadVer el original → - 2006
NumPy
Estandariza los arreglos multidimensionales y el cálculo vectorizado en Python. Todo el ecosistema científico se apoya aquí.
Datos, software y reproducibilidadVer el original → - 2006
Vickers y Elkin — decision curve analysis
El beneficio neto: conecta el desempeño estadístico de un modelo con la decisión clínica real de tratar o no tratar.
Predicción, diagnóstico y mediciónVer el original → - 2006
Altman y Royston — el costo de dicotomizar variables continuas
Demuestra cuánta información se pierde al partir en dos una variable continua. El argumento definitivo contra los puntos de corte arbitrarios.
Modelamiento y regresiónVer el original → - 2006
Piaggio y cols. — CONSORT para no inferioridad y equivalencia
Estandariza el reporte de los ensayos que buscan demostrar que un tratamiento no es peor, no que es mejor.
Ensayos clínicosVer el original → - 2006
Donald Berry — ensayos clínicos bayesianos
Impulsa los diseños bayesianos y adaptativos, que permiten aprender durante el ensayo en vez de esperar al final.
Ensayos clínicosVer el original → - 2007
STROBE
El estándar de reporte para cohortes, caso–control y estudios transversales. La lista que los revisores usan sin decirlo.
Guías de reporteVer el original → - 2007
Wellcome Trust Case Control Consortium — GWAS
El estudio que estableció el formato moderno de asociación a escala del genoma, con su umbral de 5×10⁻⁸.
Genómica y ómicasVer el original → - 2007
FDAAA 801
Registrar el ensayo ya no basta: la ley obliga a publicar los resultados. El sesgo de publicación pasa a ser, en Estados Unidos, un incumplimiento legal.
Ética, integridad y ciencia abiertaVer el original → - 2008
Guyatt y cols. — GRADE
Separa la certeza de la evidencia de la fuerza de la recomendación. Por eso una recomendación fuerte puede apoyarse en evidencia débil.
MBE y síntesis de evidenciaVer el original → - 2008
pandas
El DataFrame llega a Python y con él la manipulación de datos tabulares deja de ser un ejercicio de paciencia.
Datos, software y reproducibilidadVer el original → - 2008
Van der Maaten y Hinton — t-SNE
Permite ver estructuras de datos de altísima dimensión en dos ejes. Omnipresente en ómicas y en citometría.
Machine learning e IAVer el original → - 2008
Samy Suissa — immortal time bias
Explica el sesgo de tiempo inmortal, responsable de muchos «efectos protectores» que en realidad son un error de diseño.
EpidemiologíaVer el original → - 2008
Red EQUATOR
Un solo lugar donde encontrar la guía de reporte que toca: CONSORT, STROBE, PRISMA, STARD, TRIPOD y varios cientos más. Antes había que saber que existían.
Guías de reporteVer el original → - 2009
PRISMA
El estándar de reporte de revisiones sistemáticas y metaanálisis, con el diagrama de flujo que todos hemos dibujado.
Guías de reporteVer el original → - 2009
Damschroder y cols. — CFIR
El marco consolidado para investigar por qué una intervención se implementa bien en un hospital y fracasa en el de al lado.
Implementación y economía de la saludVer el original → - 2009
Schneeweiss y cols. — propensity score de alta dimensión
Automatiza la selección de covariables en bases administrativas enormes, donde nadie puede revisar variable por variable.
EpidemiologíaVer el original → - 2009
Hadley Wickham — ggplot2
Lleva la gramática de los gráficos a R y cambia el aspecto de las figuras publicadas en toda la literatura biomédica.
Datos, software y reproducibilidadVer el original → - 2009
Purcell y cols. — puntajes poligénicos
El hito temprano de los polygenic risk scores: sumar miles de variantes de efecto pequeño en un solo predictor.
Genómica y ómicasVer el original → - 2010
scikit-learn
Unifica clasificación, regresión, clustering, preprocesamiento y validación bajo una sola API. Democratizó el machine learning aplicado.
Machine learning e IAVer el original → - 2010
CONSORT 2010
La versión moderna del estándar de reporte de ensayos aleatorizados. Exigida por prácticamente toda revista seria.
Guías de reporteVer el original → - 2010
Steyerberg y cols. — desempeño de modelos de predicción
Sistematiza la evaluación con discriminación, calibración, Brier score y utilidad clínica. El AUC solo nunca alcanza.
Predicción, diagnóstico y mediciónVer el original → - 2010
Lipsitch y cols. — controles negativos
Usar un desenlace o una exposición que no debería tener efecto para detectar confusión residual. Detección de sesgo con los datos que ya se tienen.
Inferencia causalVer el original → - 2010
Abadie, Diamond y Hainmueller — control sintético
Construye una comparación creíble a partir de otras unidades cuando la intervención ocurrió en un solo país, región u hospital.
Inferencia causalVer el original → - 2010
Gasparrini y cols. — modelos DLNM
Modelos de retardo distribuido no lineales, hoy estándar en clima, contaminación y epidemiología ambiental.
EpidemiologíaVer el original → - 2011
Simmons, Nelson y Simonsohn — False-Positive Psychology
Demuestra experimentalmente cómo los grados de libertad del investigador producen resultados significativos a voluntad. El acta de nacimiento del término p-hacking.
Ética, integridad y ciencia abiertaVer el original → - 2011
QUADAS-2
La herramienta estándar para evaluar riesgo de sesgo en estudios de exactitud diagnóstica.
Guías de reporteVer el original → - 2011
Proctor y cols. — desenlaces de implementación
Define adopción, aceptabilidad, fidelidad y sostenibilidad como desenlaces medibles, distintos de la efectividad clínica.
Implementación y economía de la saludVer el original → - 2011
Roger Peng — investigación reproducible en ciencia computacional
Instala la reproducibilidad computacional como requisito, no como virtud opcional del autor ordenado.
Datos, software y reproducibilidadVer el original → - 2011
Higgins y cols. — herramienta Cochrane de riesgo de sesgo
Cambia el puntaje de calidad por dominios explícitos: aleatorización, ocultamiento, cegamiento, datos incompletos. Se juzga el estudio, no la revista donde salió.
MBE y síntesis de evidenciaVer el original → - 2012
Stan 1.0
Lleva Hamiltonian Monte Carlo y NUTS a un lenguaje de programación probabilística. Hace viables modelos bayesianos que antes no compilaban.
Datos, software y reproducibilidadVer el original → - 2012
CONSORT para ensayos aleatorizados por clústeres
Extiende CONSORT a los ensayos donde se aleatoriza un centro, un consultorio o una comunidad, no un paciente.
Guías de reporteVer el original → - 2012
Curran y cols. — diseños híbridos
Evaluar efectividad e implementación en el mismo estudio, en vez de esperar diez años entre una cosa y la otra.
Implementación y economía de la saludVer el original → - 2013
SPIRIT
El estándar internacional para protocolos de ensayos clínicos. Lo que hay que escribir antes de reclutar al primer paciente.
Guías de reporteVer el original → - 2013
Registered Reports
La revista acepta el estudio por su pregunta y su método, antes de conocer los resultados. Ataca de raíz el sesgo de publicación y el HARKing.
Ética, integridad y ciencia abiertaSin enlace abierto - 2013
Docker
Contenedores reproducibles: el análisis corre igual en tu máquina, en la del revisor y dentro de cinco años.
Datos, software y reproducibilidadVer el original → - 2013
CHEERS
El estándar de reporte de las evaluaciones económicas: qué costos entran, qué horizonte temporal y qué tasa de descuento. Sin eso, un costo–efectividad no se puede comparar.
Implementación y economía de la saludVer el original → - 2014
Project Jupyter
Integra código, resultados, figuras y narrativa en un mismo documento. El cuaderno de laboratorio de la ciencia de datos.
Datos, software y reproducibilidadVer el original → - 2014
TIDieR
Describir la intervención con el detalle suficiente para que otro pueda repetirla: qué, quién, cuánto, con qué frecuencia y cuánto se cumplió de verdad.
Guías de reporteVer el original →
2015–2025IA, predicción y transparenciaEl deep learning entra a la clínica y la comunidad responde con estándares: TRIPOD, PROBAST, CONSORT-AI, target trial emulation y el debate abierto sobre el valor p.33 hitos
- 2015
LeCun, Bengio y Hinton — Deep Learning
La síntesis que consolida conceptualmente la revolución de las redes neuronales profundas.
Machine learning e IAVer el original → - 2015
TRIPOD
Establece cómo se reporta el desarrollo y la validación de un modelo diagnóstico o pronóstico. El antídoto contra los scores publicados a medias.
Guías de reporteVer el original → - 2015
RECORD
Extiende STROBE a los estudios con historias clínicas electrónicas, registros y datos administrativos.
Guías de reporteVer el original → - 2015
Open Science Collaboration — Reproducibility Project
Mide empíricamente cuántos hallazgos publicados se replican. El resultado incomodó a disciplinas enteras.
Ética, integridad y ciencia abiertaVer el original → - 2015
TensorFlow
Populariza los frameworks escalables de deep learning y lleva el entrenamiento de modelos grandes fuera de los laboratorios especializados.
Machine learning e IAVer el original → - 2016
ASA — declaración sobre los valores p
La sociedad estadística estadounidense pone por escrito lo que un valor p no dice: ni la probabilidad de que H₀ sea cierta, ni la importancia del hallazgo.
Inferencia y estadísticaVer el original → - 2016
Chen y Guestrin — XGBoost
Hace el gradient boosting rápido, regularizado y escalable. Durante años, el que ganó casi todas las competencias con datos tabulares.
Machine learning e IAVer el original → - 2016
Principios FAIR
Findable, Accessible, Interoperable, Reusable: el estándar conceptual de la gestión moderna de datos científicos.
Datos, software y reproducibilidadVer el original → - 2016
Hernán y Robins — target trial emulation
Primero se diseña el ensayo que uno quisiera haber hecho; después se analizan los datos observacionales imitando ese diseño. Elimina de un golpe varios sesgos clásicos.
Inferencia causalVer el original → - 2016
Ribeiro, Singh y Guestrin — LIME
Explicaciones locales para modelos de caja negra: por qué este paciente en concreto recibió esta predicción.
Machine learning e IAVer el original → - 2016
PyTorch
Grafos de cómputo dinámicos. Hace el deep learning mucho más cómodo de investigar y termina dominando el campo.
Machine learning e IAVer el original → - 2016
GRADE — marcos de la evidencia a la decisión
Formaliza el salto que casi nunca se explicita: cómo se pasa de la evidencia a una recomendación o a una política sanitaria.
MBE y síntesis de evidenciaSin enlace abierto - 2016
ROBINS-I
Evalúa el riesgo de sesgo de un estudio no aleatorizado comparándolo con el ensayo hipotético que habría respondido la misma pregunta. Dominios en lugar de impresiones.
MBE y síntesis de evidenciaVer el original → - 2017
Lundberg y Lee — SHAP
Aplica los valores de Shapley a la interpretabilidad y da una atribución coherente de la contribución de cada predictor.
Machine learning e IAVer el original → - 2017
VanderWeele y Ding — E-value
Cuantifica qué tan fuerte tendría que ser un confusor no medido para anular el resultado. Un párrafo que debería estar en toda discusión observacional.
Inferencia causalVer el original → - 2017
Woodcock y LaVange — protocolos maestros
Consolida los ensayos umbrella, basket y de plataforma: una sola infraestructura para evaluar varias preguntas a la vez.
Ensayos clínicosVer el original → - 2017
AMSTAR 2
Lectura crítica de revisiones sistemáticas con dominios críticos: si falla uno, la revisión no se salva por tener buena discusión.
MBE y síntesis de evidenciaVer el original → - 2018
Chernozhukov y cols. — double machine learning
Combina modelos flexibles de ML con inferencia causal válida mediante ortogonalización y cross-fitting.
Inferencia causalVer el original → - 2018
Wager y Athey — causal forests
Estima efectos heterogéneos del tratamiento: no cuánto funciona en promedio, sino en quién funciona.
Inferencia causalVer el original → - 2018
McInnes, Healy y Melville — UMAP
Alternativa a t-SNE, más rápida y que preserva mejor la estructura global. Estándar en single-cell y datos ómicos.
Machine learning e IAVer el original → - 2019
PROBAST
Herramienta específica para evaluar riesgo de sesgo y aplicabilidad de un modelo de predicción. Revela que la mayoría tiene alto riesgo.
Guías de reporteVer el original → - 2019
Wasserstein, Schirm y Lazar — más allá de p < 0,05
Propone abandonar la dicotomía automática de la significación estadística y hablar de magnitud, precisión y contexto.
Inferencia y estadísticaVer el original → - 2019
RoB 2
La versión revisada de la herramienta Cochrane para ensayos: cinco dominios, preguntas guiadas y un juicio por desenlace, no uno global por estudio.
MBE y síntesis de evidenciaVer el original → - 2019
ICH E9(R1) — estimandos
Obliga a decir con precisión qué efecto se pretende estimar y qué se hace con los eventos intercurrentes: abandonos, rescates, muertes. En Europa rige desde 2020.
Ensayos clínicosVer el original → - 2020
CONSORT-AI
Extiende CONSORT a los ensayos que evalúan intervenciones con inteligencia artificial.
Guías de reporteVer el original → - 2020
SPIRIT-AI
La contraparte de CONSORT-AI para los protocolos de esos mismos ensayos.
Guías de reporteVer el original → - 2020
Hernán y Robins — Causal Inference: What If
La síntesis moderna del enfoque contrafactual: métodos g, target trials y DAG en un libro gratuito. Hoy es el texto de referencia.
Inferencia causalVer el original → - 2021
PRISMA 2020
Actualiza PRISMA para revisiones modernas: nuevas fuentes, automatización de la búsqueda y más transparencia.
Guías de reporteVer el original → - 2024
TRIPOD+AI
Adapta TRIPOD a modelos desarrollados con regresión o con machine learning, bajo un solo estándar de reporte.
Guías de reporteVer el original → - 2025
PROBAST+AI
Actualiza la evaluación de riesgo de sesgo para modelos de predicción basados en regresión y en IA.
Guías de reporteVer el original → - 2025
CONSORT 2025
La primera revisión mayor del estándar en quince años: menos ítems ambiguos y más peso al reporte de daños, a los datos disponibles y a la participación de pacientes.
Guías de reporteVer el original → - 2025
SPIRIT 2025
La actualización gemela para protocolos, publicada dos semanas después y alineada ítem por ítem con CONSORT 2025.
Guías de reporteVer el original → - 2025
ICH E6(R3) — Buenas Prácticas Clínicas
Reescribe las BPC alrededor de la calidad por diseño y la proporcionalidad al riesgo, y admite por fin la descentralización, las fuentes de datos diversas y las herramientas digitales. En Europa rige desde julio de 2025.
Ética, integridad y ciencia abiertaVer el original →