View a markdown version of this page

Apéndice A: Preguntas frecuentes - Principios de la previsión de serie temporal con Amazon Forecast

Apéndice A: Preguntas frecuentes

P: ¿Cómo puedo comenzar a utilizar Amazon Forecast?

  1. Primero, necesitará una Cuenta de AWS.

  2. A continuación, abra el servicio de previsión en la AWS Management Console, cree un grupo de conjuntos de datos e importe un archivo .csv en el conjunto de datos de la serie temporal objetivo (obligatorio). Los datos mínimos necesarios para empezar son los datos históricos de la cantidad que quiera predecir, como la electricidad por marca temporal y hogar.

  3. Por último, cree un modelo ejecutando CreatePredictor y genere resultados ejecutando CreateForecast. Consulte la página de documentación de Introducción para obtener más detalles.

Además, consulte la Introducción a GitHub y la Guía de prácticas recomendadas.

P: ¿Amazon Forecast es una buena opción para mí?

No todos los problemas del machine learning son problemas de previsión. La primera pregunta que hay que plantearse es: "¿Mi problema empresarial incluye series temporales en su planteamiento?" Por ejemplo, ¿necesita un valor concreto solo en una fecha y hora determinadas en el futuro? La previsión no es idónea para problemas generales y estáticos (en los que la fecha y la hora en particular no importan), como la detección de fraudes o la recomendación de títulos de películas a los usuarios. Hay soluciones mucho más rápidas para esos problemas estáticos.

Además de tener datos de series temporales, los datos en sí deben ser "densos" y tener historiales nutridos. Esto se resume en la siguiente tabla:

Tabla 2: Criterios y clases de algoritmos de Amazon Forecast

Criterios Clase de algoritmo de Amazon Forecast
Amplio conjunto de datos con hasta cinco millones de series temporales con patrones subyacentes similares, efectos estacionales y datos relacionados. Cada serie temporal debe tener un historial nutrido, idealmente de más de dos años si se intenta capturar eventos anuales, y cada serie temporal debe tener más de 300 puntos de datos, 1000 en casos ideales. Productos de aprendizaje profundo propiedad de Amazon Forecast: DeepAR+ y CNN-QR
Conjunto de datos pequeño con entre 1 y varios cientos de series temporales, donde la mayoría de las series temporales tienen más de 300 puntos de datos, efectos estacionales y datos relacionados. Prophet
Conjunto de datos pequeño con entre 1 y varias decenas de series temporales, donde la mayoría de las series temporales tienen más de 300 puntos de datos y efectos estacionales. ETS, ARIMA
Intermitente (dispersa con muchos ceros) con entre 1 y varias decenas de series temporales, donde la mayoría de las series temporales tienen más de 300 puntos de datos. NPTS propiedad de Amazon Forecast
Conjunto de datos pequeño (regular o disperso) con entre 1 y varias decenas de series temporales, donde la mayoría de las series temporales tienen menos de 300 puntos de datos. Los datos son demasiado pequeños para Amazon Forecast. Pruebe ETS en Excel o los modelos estadísticos tradicionales ARIMA y Prophet en su lugar.

Lo recomendable es entrenar con el modo AutoML en su Predictor la primera vez que utilice sus datos. AutoML ejecutará automáticamente todos los algoritmos (los algoritmos de DL se ejecutan con HPO activado) para averiguar qué algoritmo funciona mejor con sus datos.

P: ¿Cómo me planteo la carencia de datos? ¿Cuándo es demasiado importante como para generar previsiones razonables?

Puede darse el caso de que haya problemas en el registro de los datos o que el nivel de agregación de los datos sea demasiado bajo o demasiado alto. La regla general es que la duración de la previsión no puede superar un tercio de los datos de entrenamiento.

Además de la cantidad de datos que falten, también hay que plantearse cómo imputar los datos que no tengamos. Puede convertir todos los 0 en valores nulos y dejar que Amazon Forecast se encargue de imputar automáticamente los valores faltantes. Amazon Forecast detectará automáticamente si los valores faltantes se deben a la introducción de nuevos productos (arranques en frío) o a productos que han llegado al final de su vida útil. Puede utilizar varias lógicas para los valores faltantes, como el valor, la mediana, el mínimo, el máximo, el cero, la media y los valores NaN (solo series temporales objetivo). Consulte la documentación para conocer la sintaxis de relleno de valores nulos.

  • "frontfill" (rellenado frontal): (solo TTS) hace referencia a los elementos nuevos o de arranque en frío y a la forma en que se quieran tratar los valores nulos antes de que el elemento comience a tener un historial

  • "middlefill" (rellenado medio): se refiere a valores nulos en la mitad de los valores de las series temporales

  • "backfill" (rellenado retroactivo): hace referencia a los productos que han llegado al final de su vida útil y a la forma en que se quieran tratar los valores nulos cuando un producto ha dejado de venderse

  • "futurefill" (rellenado a futuro): (solo RTS) se refiere a los valores nulos que se producen una vez finalizados los datos de entrenamiento

P: Mis datos históricos de entrada no tienen valores negativos, pero veo valores negativos en las previsiones de demanda. ¿Por qué ocurre esto? ¿Qué puedo hacer para evitar esto?

No hay ninguna garantía de generar números positivos en ninguno de los modelos, excepto NPTS (que está entrenado con datos no negativos) y DeepAR (que tiene una función de verosimilitud binomial negativa). La solución consiste en cambiar a uno de los modelos mencionados o en limitar los valores de previsión a valores no negativos.

P: ¿Por qué las métricas de precisión difieren en los cuantiles? ¿El error no debería ser el mismo, ya que el modelo es el mismo?

Consulte la Pérdida cuantil ponderada (wQL) para obtener más información sobre cómo la ponderación depende del cuantil.

Imagine que tienes todas las previsiones en tres cuantiles diferentes: p10, p50, p90. Las tres predicciones en sí mismas son variables aleatorias. Los niveles de precisión se calculan por separado entre los datos reales y las previsiones en el nivel de cada cuantil. Es posible que vea una tabla de "wQL", pérdidas cuantiles ponderadas, como la que se muestra a continuación. Los valores de las wQL no tienen una relación determinista entre sí. (Las pérdidas por retirada implican un error, por lo que no están ordenadas; sin embargo, las previsiones de cuantiles están ordenadas). Por lo tanto, no hay ninguna razón por la que la wQL del p90 deba ser mayor que la wQL del p50, por ejemplo. 

Tabla 3 — Ejemplo de cuantiles de previsión

A B C
1 wQL del p10 wQL del p50 wQL del p90
2 0,18647 0,50879 0,30428

P: ¿Cómo puedo mejorar la precisión de las previsiones?

La precisión de la previsión depende de si los datos correctos están disponibles en la cantidad y calidad adecuadas. Si la precisión no es satisfactoria, puede ser recomendable intentar comprender cómo de predecible es el problema (o cómo de aleatorios / imprecisos / estacionarios son los datos). Otros factores que se deben tener en cuenta incluyen la evaluación de diferentes modelos, la configuración de los hiperparámetros y la incorporación de funciones adicionales mediante el uso de los conjuntos de datos de metadatos de elementos y las series temporales relacionados. Para obtener sugerencias específicas, consulte este documento de prácticas recomendadas en GitHub.

P: Tengo un algoritmo que funciona muy bien en mi caso práctico pero no está en Amazon Forecast. ¿Qué tengo que hacer?

El equipo de Amazon Forecast estará encantado de ayudarle con este caso práctico. Póngase en contacto con el equipo de servicio de Amazon Forecast por correo electrónico: .