Um projeto típico dura entre quatro e doze semanas, dependendo da complexidade dos dados e do modelo. Abaixo, detalhamos o que acontece em cada fase e quanto tempo ela costuma levar.
1
Diagnóstico e escopo
Começamos com uma reunião de 90 minutos (presencial em São Paulo ou por vídeo). Nessa conversa, mapeamos o problema que você quer resolver, identificamos as fontes de dados existentes e definimos a métrica de sucesso. Ao final, entregamos um documento de escopo com estimativa de prazo, investimento e riscos conhecidos. Essa etapa leva de dois a cinco dias úteis.
Se os dados disponíveis forem insuficientes, indicamos exatamente o que precisa ser coletado e por quanto tempo antes de iniciar a modelagem. Preferimos adiar o projeto a treinar um modelo sobre dados precários.
2
Preparação de dados
Recebemos acesso (leitura) aos seus bancos de dados, APIs ou arquivos CSV. Nossos engenheiros de dados fazem a limpeza: removem duplicatas, tratam valores ausentes, normalizam formatos de data e moeda, cruzam tabelas. Esse trabalho é documentado em um caderno Jupyter que fica no repositório do projeto.
Se necessário, enriquecemos os dados com fontes públicas. Por exemplo, num projeto de logística, cruzamos CEPs com tabelas do IBGE para incluir renda média e densidade populacional como variáveis preditoras. Essa fase consome de uma a três semanas, e é a que mais influencia a qualidade do resultado final.
3
Modelagem e validação
Testamos de dois a cinco algoritmos diferentes sobre os dados preparados. Para problemas de classificação, por exemplo, comparamos regressão logística, gradient boosting e redes neurais rasas. Cada modelo é avaliado com validação cruzada (k-fold) e métricas específicas do problema: acurácia, F1-score, RMSE ou a métrica que definimos no diagnóstico.
Entregamos um relatório técnico com os resultados de cada modelo, incluindo matrizes de confusão e curvas ROC quando aplicável. Você não precisa entender os detalhes estatísticos: traduzimos tudo em linguagem de negócio. "O modelo acerta 92% das previsões de churn e erra mais nos clientes com menos de três meses de histórico" é o tipo de frase que usamos.
4
Integração e deploy
O modelo escolhido é empacotado em uma API REST hospedada na nuvem (AWS, GCP ou Azure, conforme sua preferência). Configuramos autenticação, limites de taxa e logs de uso. Se o modelo precisa rodar dentro da sua infraestrutura por questões de compliance, fazemos o deploy em container Docker no seu servidor.
Criamos também um painel de monitoramento que mostra a performance do modelo em tempo real: latência das respostas, volume de requisições e drift nos dados de entrada. Se os dados começarem a mudar de padrão, o painel emite um alerta para que possamos retreinar o modelo antes que a acurácia caia.
5
Acompanhamento e retreinamento
Nos primeiros seis meses após o deploy, fazemos reuniões quinzenais de acompanhamento. Analisamos as métricas de produção, comparamos com as métricas de validação e decidimos se é hora de retreinar. O retreinamento usa os dados novos acumulados desde o último ciclo, e o modelo atualizado passa pelos mesmos testes de validação antes de substituir o anterior.
Após o período inicial, oferecemos contratos de manutenção mensal que incluem monitoramento, retreinamento trimestral e suporte técnico por e-mail com resposta em até oito horas úteis.