Google Research presentó TimesFM-3, un modelo fundacional de 330 millones de parámetros diseñado para pronosticar varias series temporales relacionadas en una sola pasada. La herramienta incorpora señales históricas y variables futuras conocidas sin ajuste fino, pero sus pesos mantienen restricciones que impiden el uso comercial y productivo.
***
- TimesFM-3 fue preentrenado con más de 1 billón de puntos temporales reales y sintéticos.
- El modelo combina atención temporal causal con atención entre variables para detectar correlaciones.
- Sus pesos tienen licencia no comercial y no productiva, mientras TimesFM 2.5 conserva la licencia Apache-2.0.
Google Research presentó TimesFM-3, un modelo fundacional de inteligencia artificial con 330 millones de parámetros que amplía el alcance de su familia de herramientas para pronósticos. A diferencia de las versiones anteriores, el sistema fue diseñado desde el inicio para analizar múltiples series temporales relacionadas y producir sus predicciones en una sola pasada, un cambio que busca reducir la latencia, el costo computacional y la acumulación de errores.
El modelo fue preentrenado con más de 1 billón de puntos temporales procedentes de series reales y sintéticas, según la información publicada por Google Research. TimesFM-3 puede recibir varios objetivos, covariables conocidas únicamente en el pasado y covariables cuyos valores futuros ya están disponibles, todo ello sin un ajuste fino específico para cada tarea.
Un modelo pensado para datos conectados
Hasta TimesFM 2.5, los puntos de control de TimesFM trabajaban con un enfoque univariante: cada serie se pronosticaba a partir de su propio historial, sin incorporar directamente otras secuencias relacionadas. Ese diseño podía resultar suficiente para ciertos casos, pero no representaba muchas situaciones empresariales en las que la demanda depende simultáneamente de varias señales.
El ejemplo utilizado para explicar el cambio es el de las ventas de helados, cuyos movimientos pueden relacionarse con las ventas de productos similares, el tráfico de personas, el clima, las promociones y los días festivos. TimesFM-3 intenta capturar esas conexiones al pronosticar múltiples objetivos de forma conjunta, en lugar de tratar cada serie como una isla estadística.
La herramienta también acepta covariables pasadas, como el tráfico histórico de visitantes, que solo están disponibles hasta el momento actual. Además, puede incorporar covariables pasado-futuro, una categoría que incluye calendarios de promociones u otros eventos programados cuyos valores futuros se conocen antes de que ocurran.
Esta capacidad funciona en modalidad zero-shot, es decir, el modelo puede aplicarse a una tarea nueva sin un proceso de ajuste fino creado específicamente para ese conjunto de datos. Para los usuarios, la promesa central consiste en reutilizar un modelo preentrenado y entregarle las series relevantes, aunque el rendimiento final seguirá dependiendo de la calidad, la escala y la estructura de la información suministrada.
La arquitectura combina tiempo y variables
El núcleo de TimesFM-3 mantiene una arquitectura de transformer solo decodificador, pero organiza la información de una manera adaptada a las series temporales. Los puntos contiguos se agrupan en parches de 32 pasos y después se normalizan por serie, una operación orientada a evitar que las diferencias de escala entre variables dominen el cálculo.
Los tokens correspondientes a los objetivos y a las covariables pasadas se construyen a partir de un solo parche. En el caso de las covariables pasado-futuro, el modelo utiliza un mecanismo de anticipación o lookahead: concatena el parche actual con parches posteriores para que los eventos programados puedan influir en el pronóstico antes de su llegada.
Después, los tokens se organizan en una cuadrícula bidimensional y atraviesan dos mecanismos de atención que se alternan. La atención temporal causal avanza horizontalmente y solo permite consultar tokens anteriores dentro de la misma serie, una restricción que bloquea filtraciones de información futura durante el proceso.
La segunda operación es una atención completa por variable que se desplaza verticalmente. En un paso temporal determinado, cada token puede leer las demás series disponibles en ese instante, lo que permite al modelo aprender dependencias y correlaciones entre variables sin abandonar la causalidad temporal de cada secuencia.
Pronósticos completos en una sola pasada
Las versiones previas de TimesFM generaban un parche por vez, un procedimiento que podía incrementar la latencia y el costo de cómputo, además de introducir errores acumulativos a medida que el horizonte se extendía. TimesFM-3 cambia ese proceso mediante Contiguous Patch Masking, una estrategia de enmascaramiento durante el entrenamiento que también fue introducida con TiRex.
Durante el entrenamiento, el sistema recibe tokens de marcador de posición enmascarados para todo el horizonte que debe pronosticar. Los objetivos y las covariables pasadas permanecen ocultos en esa zona, mientras que las covariables pasado-futuro siguen visibles para que la información programada, como una promoción, pueda llegar al modelo aun cuando corresponda a fechas posteriores.
Las capas de atención alternantes completan simultáneamente todos los parches enmascarados del horizonte. De acuerdo con la descripción técnica, este diseño evita la necesidad de encadenar numerosas predicciones intermedias y busca ofrecer una inferencia más eficiente, aunque la información disponible no establece un tiempo de respuesta concreto para cada despliegue.
El modelo entrega nueve cuantiles para cada objetivo y cada paso del horizonte, desde el percentil 10 hasta el percentil 90. Esa salida no se limita a una cifra puntual, porque también representa distintos niveles de incertidumbre que pueden resultar útiles al planificar inventarios, evaluar demanda o comparar escenarios de riesgo.
Resultados en evaluaciones comparativas
Google comparó TimesFM-3 con Chronos-2, la familia Toto 2.0 y TimesFM-2.5 en tres referencias de evaluación: GIFT-Eval, fev-bench y el leaderboard TIME. La empresa informó que el nuevo modelo consiguió el mejor rango promedio entre los modelos fundacionales preentrenados en las tres pruebas, tanto para métricas puntuales como para métricas probabilísticas.
Las notas de lanzamiento del paquete registran el primer puesto general en fev-bench, que reúne 100 tareas del mundo real. También señalan el primer puesto general en TIME, con 50 conjuntos de datos de distintos dominios y 98 tareas de evaluación, además del primer lugar entre los modelos fundacionales en GIFT-Eval.
Estos resultados deben leerse como una comparación dentro de los conjuntos de datos, métricas y configuraciones utilizadas por esas evaluaciones, no como una garantía universal para cualquier operación de pronóstico. El rango promedio indica una posición agregada frente a los modelos incluidos, mientras que la utilidad práctica dependerá de factores como las variables disponibles, el horizonte elegido y la estabilidad de cada serie.
La evaluación incluye modos univariantes y multivariantes, de acuerdo con el material de lanzamiento. El interés de TimesFM-3, sin embargo, se concentra especialmente en su capacidad para modelar varias señales a la vez, porque esa es la diferencia estructural que separa a esta versión de los puntos de control anteriores de la familia.
La licencia limita el despliegue
El código del repositorio TimesFM se distribuye bajo Apache-2.0, una licencia que facilita su inspección y reutilización dentro de los términos correspondientes. Sin embargo, esa condición no se extiende automáticamente a los pesos de TimesFM 3.0, que se ofrecen bajo la licencia timesfm-non-commercial-license-v1.0.
La restricción significa que los usuarios pueden evaluar el modelo actualmente, pero no desplegar sus pesos detrás de una API de pronóstico comercial ni utilizarlos en un entorno productivo. La diferencia entre código abierto y pesos con uso restringido es especialmente relevante para empresas que necesitan convertir un prototipo en un servicio permanente.
La propia documentación identifica a TimesFM 2.5 como la alternativa Apache-2.0 para despliegue. Por tanto, la nueva versión puede ser atractiva para investigadores, equipos de datos y desarrolladores que quieran probar el enfoque multivariante, aunque las organizaciones con necesidades comerciales deberán revisar la licencia antes de integrarla en sus operaciones.
El repositorio de GitHub y los pesos alojados en Hugging Face ofrecen los recursos para comenzar la evaluación, mientras que la publicación técnica explica la arquitectura y el método de entrenamiento. Esa separación entre disponibilidad para experimentar y autorización para producir será uno de los principales factores que determinarán cuánto se adopta TimesFM-3 fuera de los entornos de investigación.
Qué aporta a los pronósticos con inteligencia artificial
TimesFM-3 representa un intento de llevar los modelos fundacionales más allá del pronóstico de una serie aislada. Al combinar objetivos múltiples, señales históricas y variables futuras conocidas, el sistema aborda una estructura de datos más cercana a la que aparece en operaciones comerciales, planificación y análisis de demanda.
La atención temporal causal protege el orden de los acontecimientos, mientras la atención por variable permite relacionar secuencias distintas en un mismo momento. Esa combinación ofrece una respuesta arquitectónica a un problema habitual: aprovechar correlaciones entre series sin utilizar accidentalmente información que, en una situación real, todavía no estaría disponible.
La generación simultánea de todo el horizonte y la entrega de nueve cuantiles por paso también modifican la forma de consumir el resultado. En lugar de recibir únicamente una trayectoria esperada, el usuario obtiene una representación más amplia de posibles niveles de incertidumbre, aunque la noticia no proporciona cifras independientes de mejora para cada sector o aplicación.
Por ahora, la principal cautela no está en la disponibilidad para experimentar, sino en las condiciones de uso de los pesos. TimesFM-3 llega con una arquitectura multivariante, una escala de preentrenamiento superior a 1 billón de puntos y resultados destacados en tres benchmarks, pero su impacto comercial dependerá de futuras condiciones de licencia y de validaciones independientes en escenarios reales.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Empresas
Sony prioriza monetizar a los usuarios actuales de PS5 antes que impulsar sus ventas
Energía
El reciclaje de imanes busca rescatar tierras raras de los residuos con USD $75 millones
Noticias
Ofrecen supuestos 5,5 millones de registros de MyVete por USD $4.000
Estados Unidos