Apêndice A: Perguntas frequentes
P: Como posso começar a usar o Amazon Forecast?
-
Primeiro, você precisará de uma Conta da AWS.
-
Em seguida, abra o serviço Forecast no AWS Management Console
, crie um grupo de conjuntos de dados e importe um arquivo .csvpara o conjunto de dados da série temporal alvo (obrigatório). Os dados mínimos necessários para começar são os dados históricos da quantidade que você deseja prever, como eletricidade por data e hora por residência. -
Por fim, crie um modelo executando CreatePredictor e gerando resultados executando CreateForecast. Consulte a página de documentação Conceitos básicos para obter mais detalhes.
Além disso, consulte o GitHub Introduction and Best Practices guide
P: O Amazon Forecast é uma boa opção para mim?
Nem todos os problemas de machine learning são problemas de previsão. A primeira pergunta a ser feita é: “Meu problema comercial inclui séries temporais na declaração?”. Por exemplo, você precisa de determinado valor somente em uma data e hora específicas no futuro? A previsão não é uma boa opção para problemas gerais e estáticos (em que a data/hora específica não importa), como detecção de fraudes ou recomendação de filmes aos usuários. Existem soluções muito mais rápidas para problemas estáticos.
Além de ter dados de séries temporais, os dados em si devem ser “densos” e ter um longo histórico. Isso é resumido na seguinte tabela:
Tabela 2: Critérios e classes de algoritmo do Amazon Forecast
| Critérios | Classe de algoritmo do Amazon Forecast |
|---|---|
| Grande conjunto de dados com até cinco milhões de séries temporais com padrões subjacentes similares + efeitos sazonais + dados relacionados. Cada série temporal deve ter um longo histórico, de preferência mais de dois anos se o objetivo for capturar eventos anuais, e ter mais de trezentos pontos de dados, de preferência pelo menos mil. | Aprendizado profundo proprietário do Amazon Forecast DeepAR+, CNN-QR |
| Pequeno conjunto de dados com 1-100s de séries temporais, em que a maioria das séries tem mais de 300 pontos de dados + efeitos sazonais + dados relacionados. | Prophet |
| Pequeno conjunto de dados com 1-10s de séries temporais, em que a maioria das séries tem mais de 300 pontos de dados + efeitos sazonais. | ETS, ARIMA |
| Intermitente (esparsa contendo muitos zeros) com 1-10s de séries temporais, em que a maioria das séries tem mais de 300 pontos de dados. | NPTS proprietário do Amazon Forecast |
| Conjunto de dados pequeno (regular ou esparso) com 1-10s de séries temporais, em que a maioria das séries tem menos de 300 pontos de dados. | Os dados são muito pequenos para o Amazon Forecast. Em vez disso, experimente o ETS no Excel ou os modelos estatísticos tradicionais ARIMA e Prophet. |
A prática recomendada é treinar com o modo AutoML no previsor, logo na primeira vez em seus dados. O AutoML executará automaticamente todos os algoritmos (os algoritmos DL são executados com a HPO ativada) para saber qual algoritmo funciona melhor em seus dados.
P: Como pensar sobre dados ausentes? Quando é demais gerar previsões razoáveis?
Pode ser que haja problemas no registro de dados ou que o nível de agregação dos dados seja muito baixo ou muito alto. A regra geral é que a duração da previsão não pode ser superior a 1/3 dos dados de treinamento.
Além da quantidade de dados ausentes, outra consideração é a imputação de dados ausentes. É possível converter todos os zeros em nulos e deixar que o Amazon Forecast faça o trabalho pesado de imputar automaticamente os valores ausentes. O Amazon Forecast detectará automaticamente se os valores ausentes ocorrem devido à introdução de novos produtos (partidas a frio) ou produtos no fim da vida útil. É possível usar várias lógicas de valores ausentes, incluindo valor, mediana, mínimo, máximo, zero, média e NaN (somente para séries temporais alvo). Consulte a documentação de sintaxe de preenchimento nulo.
-
“frontfill”: (somente TTS) refere-se a itens novos ou de partida a frio e à forma como você deseja tratar os nulos antes que o item comece a ter algum histórico.
-
“middlefill”: refere-se a nulos no meio dos valores de séries temporais.
-
“backfill”: refere-se aos itens no fim da vida útil e à forma como você deseja tratar os nulos após a interrupção da venda de um item.
-
“futurefill”: (somente RTS) refere-se a nulos que ocorrem após o final dos dados de treinamento.
P: Meus dados históricos de entrada não têm valores negativos, mas vejo valores negativos nas previsões de demanda. Por que isso acontece? Como posso evitar isso?
Para todos os modelos, exceto NPTS (treinada em dados não negativos) e DeepAR (com função de verossimilhança binomial negativa), não há garantia de gerar números positivos. A solução é mudar para um dos modelos mencionados acima ou truncar os valores da previsão para valores não negativos.
P: Por que as métricas de precisão diferem em quantis? O erro não deveria ser o mesmo, já que o modelo é o mesmo?
Consulte Perda quantil ponderada (wQL) para obter mais explicações sobre como a ponderação depende do quantil.
Imagine que você tenha todas as previsões em três quantis diferentes: p10, p50, p90. As três previsões são variáveis aleatórias. As precisões são calculadas separadamente entre os valores reais e as previsões em cada nível de quantil. É possível que você veja uma tabela de “wQL”, perdas quantis ponderadas, como abaixo. Os valores de wQL não têm relação determinística entre si. (A perda de recuperação significa erro e, por isso, não é ordenada; as previsões quantis, no entanto, são ordenadas.) Portanto, não há razão para que p90 wQL seja maior do que p50 wQL, por exemplo.
Tabela 3: Exemplos de quantis de previsão
| A | B | C | |
|---|---|---|---|
| 1 | P10 wQL | P50 wQL | P90 wQL |
| 2 | 0,18647 | 0,50879 | 0,30428 |
P: Como posso melhorar a precisão da previsão?
A precisão da previsão depende de se os dados certos estão disponíveis na quantidade e qualidade certas. Se a precisão não for satisfatória, fará sentido entender quão previsível é o problema (ou quão aleatórios/ruidosos/estacionários são os dados). Outros fatores a serem considerados incluem avaliar diferentes modelos, configurações de hiperparâmetros e incorporar recursos adicionais usando as séries temporais relacionadas e os conjuntos de dados de metadados de itens. Para obter sugestões específicas, consulte este documento de práticas recomendadas no GitHub
P: Eu tenho um algoritmo que funciona muito bem para meu caso de uso e não é oferecido no Amazon Forecast. O que devo fazer?
A equipe do Amazon Forecast ficará feliz em ajudar você com este caso de uso. Entre em contato com a equipe de serviço do Amazon Forecast no e-mail <amazonforecast-poc@amazon.com>.