Torneo de IAs, cinco semanas: ninguna bate a la volatilidad, y un error nuestro falseaba el A/B
Desde el 3 de septiembre, cinco modelos de lenguaje predicen en público la bolsa antes de que abra. Haiku 4.5, Sonnet 5 y Opus 5, de Anthropic, y DeepSeek V4.1 Flash y Qwen 3.8 Flash, que entraron el 25 de septiembre. Cada mañana, a las 12:30 UTC y una hora antes de la apertura de Nueva York, reciben el mismo paquete de datos sobre diez acciones del S&P 500, sin buscador y sin titulares, y devuelven la probabilidad de que cada una suba ese día y cuánto se va a mover. Al cierre se puntúa con Brier y CRPS y el marcador se publica salga como salga. Llevamos unas 24 sesiones puntuadas: entre 235 y 245 predicciones por modelo en los tres de Anthropic, y 90 y 80 en los otros dos.
La dirección, primero. Ningún modelo se distingue de decir siempre la tasa media de subidas. No es una sorpresa: lo dejamos escrito antes de empezar. Lo que conviene añadir es lo que eso no significa. Con unas 240 predicciones solo se puede detectar una correlación entre probabilidad y resultado de 0,18 o más (80 % de potencia, p < 0,05). Los efectos pequeños que se publican para este tipo de señales, de 0,02 a 0,05, necesitan entre 2.500 y 20.000 predicciones: entre uno y ocho años al ritmo actual. Que nadie discrimine hoy no demuestra que no se pueda; demuestra que aún no tenemos con qué verlo. Además, Opus contesta exactamente 0,50 en cuatro de cada cinco nombres, que es una forma educada de no apostar.
Donde había más recorrido era en cuánto se mueve cada acción, y ahí comparamos cada modelo con un pronóstico mecánico de tres líneas: la volatilidad reciente de la acción multiplicada por tres cuantiles medidos antes de que se jugara la mayor parte de la muestra. Con el CRPS, que es mejor cuanto menor: Haiku 1,62 % frente a 1,19 % del pronóstico mecánico; Sonnet 1,32 frente a 1,19; Opus 1,21 frente a 1,17; DeepSeek 1,34 frente a 1,16; Qwen 1,29 frente a 0,90. Opus empata. Los otros cuatro quedan por detrás. Con tan pocas sesiones no pondríamos la mano en el fuego por la significación estadística, pero el signo es el mismo en los cinco.
Hay una explicación sencilla y la medimos. Lo que cada modelo añade sobre la volatilidad es ruido: la correlación entre el movimiento que anuncia (relativo a la volatilidad de la acción) y el que ocurre va de −0,03 a +0,09 según el modelo, con intervalos que incluyen el cero en todos. Y el paquete no contiene nada que el pronóstico mecánico no tenga: precios, volatilidad, un recuento de noticias con catalizador. Un modelo que no sabe nada que el baseline no sepa solo puede igualarlo o estropearlo.
Hasta aquí, lo esperable. Lo que no lo era estaba en el segundo experimento. Junto a la prueba principal corre un A/B pre-registrado: ¿ayuda dar al modelo el contexto de resultados trimestrales de cada acción, es decir, si anuncia hoy, si ya ha reaccionado y cuánto suele moverse en resultados? Cada modelo recibe el mismo paquete con y sin ese bloque. Durante semanas, el marcador público decía que el bloque empeoraba la predicción entre un 17 % y un 43 % según el modelo.
Un resultado que dice que más información empeora la predicción merece desconfianza antes que titular. Recalculamos desde las filas crudas las cifras de magnitud que publicábamos (coincidían) y después miramos de dónde salían las fechas de los anuncios. Cuando el calendario de resultados no tenía ningún anuncio cerca de una empresa, el sistema tomaba como fecha del anuncio la primera noticia clasificada como «earnings». Las contrastamos con el registro real de informes de resultados: de 35 fechas sacadas de noticias, ninguna coincidía (a tres días o menos) con un informe de verdad. De 28 fechas de calendario, coincidían las 28.
Miramos qué noticias habían fabricado esas fechas. Un artículo sobre las ganancias de los repartidores de una plataforma de reparto. Un producto de software con «eps» en el nombre. Las ventas trimestrales de un fabricante de coches. La transcripción, publicada semanas después, de la llamada del trimestre anterior. Una nota sobre los resultados de otra empresa que arrastraba a la primera. Nuestro clasificador de catalizadores trabaja solo con el titular y busca palabras sueltas —«earnings», «eps», «Q3»— que aparecen en muchas más noticias que los informes de resultados. Con esa fecha falsa, el paquete le decía al modelo «hoy es el día de la reacción, espera un movimiento de resultados». El modelo obedecía, inflaba su pronóstico, y la acción no se movía.
Separadas por el origen de la fecha, las cifras cuentan otra historia. Con fecha de calendario (74 parejas) el bloque mejora el CRPS un 2,2 %, sin significación en ningún sentido. Con fecha de noticia (144 parejas) lo empeora un 121 %. El 74 % de las filas del subconjunto que habíamos pre-registrado como «con evento» eran de este segundo tipo. El titular que publicábamos medía un error nuestro, no la utilidad del contexto de resultados.
Nuestro propio pre-registro lo preveía: si la tasa de estados mal etiquetados superaba el 10 %, el A/B se congelaba hasta arreglar la fuente de fechas. Era el 74 %. Así que hemos hecho lo que decía: el código ya no deja que una noticia fije la fecha de un anuncio, la mitad «con evento» de la muestra da prioridad a los anuncios de calendario, y el contador de parejas con evento vuelve a cero desde la sesión del 9 de octubre. El texto del re-registro quedó en el repositorio antes de la primera vuelta afectada. Lo medido antes sigue publicado en la página del torneo, plegado y etiquetado como época anterior que no cuenta para el criterio. Con anuncios reales, fuera de temporada de resultados, entran entre una y cuatro filas por sesión; llegar a las 200 parejas por modelo que exige el criterio nos llevará hasta febrero de 2027, aproximadamente.
Qué no concluimos. No que los modelos de lenguaje sean inútiles para pronosticar mercados: el paquete que reciben no les da ninguna información que el pronóstico mecánico no tenga, y así no hay mucho que esperar. La prueba con más sentido sería darles información nueva y pública, como el texto de los informes de resultados que las empresas presentan ante la SEC, y medirlos contra el mismo baseline. Si se hace, se pre-registrará antes de empezar. Y el mismo clasificador alimenta el mapa de eventos y el boletín semanal, así que revisaremos cuánto de su efecto medido sale de anuncios de calendario y cuánto de ruido.
Nada de esto es una recomendación de inversión ni una señal: es un experimento de calibración en simulado. Los números, las predicciones por sesión y el A/B completo, con sus épocas, están en soberquant.com/es/ai-tournament y en la API pública del torneo.
Calendario semanal de eventos
Esta misma página es el boletín: se regenera cada domingo con la semana que viene. No se envía por correo y no pedimos tu dirección. Si algún día lo enviamos, se podrá pedir desde aquí.