Alerta de Desvio: Identificando Data Drift em Produção
2026-10-16 , Paralela 3

Modelos de ML sofrem com dados dinâmicos. Aprenda a detectar o Data Drift em produção usando Python, garantindo a saúde das previsões antes que elas impactem silenciosamente o seu negócio.


Esta palestra abordará os desafios técnicos de manter modelos de machine learning confiáveis após o deploy, focando especificamente no fenômeno do Data Drift (deslocamento de covariáveis nas distribuições de entrada). Diferente do Concept Drift, onde as regras de negócio mudam, o Data Drift ocorre quando o perfil do público ou a natureza dos dados coletados se transforma, fazendo com que o modelo precise operar em cenários para os quais nunca foi treinado. O principal objetivo é instrumentalizar a comunidade a criar sistemas de monitoramento proativos e automatizados usando Python.
Apresentaremos como implementar testes estatísticos não paramétricos — como Kolmogorov-Smirnov (KS) para variáveis numéricas e Qui-Quadrado para variáveis categóricas — para comparar dados históricos de treino com os dados reais de produção em tempo real. Discutiremos a arquitetura para integrar essas validações de forma assíncrona nas esteiras de MLOps, utilizando ferramentas de código aberto como Evidently ou Alibi-detect. Ao final, o público entenderá como configurar gatilhos de alerta baseados em relatórios estatísticos visuais, permitindo que as equipes de dados intervenham (retreinando ou pausando o modelo) antes que a degradação silenciosa dos dados de entrada cause prejuízos financeiros ou decisões de negócios desatualizadas.


What prior knowledge is necessary to be able to follow your activity well?:

A palestra foi projetada para um público de nível Intermediário.
Para acompanhar o conteúdo de forma fluida, é importante que os participantes possuam:
Fundamentos de Data Science: Familiaridade com o ciclo básico de desenvolvimento de modelos preditivos (treino, teste e deploy).
Conceitos de Estatística: Noções básicas sobre distribuições de dados e métricas de tendência central (média e mediana).
Ecossistema Python: Conhecimento em bibliotecas de manipulação de dados, como pandas.
Contexto de Produção: Noções iniciais sobre o que é uma API de inferência ou um ambiente de produção (MLOps).
Não é necessário conhecimento prévio em monitoramento avançado de modelos, pois as abordagens de detecção de desvios serão explicadas visualmente durante a apresentação.

What can participants expect to learn from your activity?:

Quem assistir a esta palestra deve esperar uma abordagem pragmática e voltada para a engenharia de machine learning real. A expectativa é desmistificar o monitoramento de modelos, saindo de teorias estatísticas densas para a aplicação prática de código que resolve problemas do dia a dia em produção.
O público aprenderá a olhar para logs de inferência não apenas como dados salvos, mas como um fluxo contínuo de informação que precisa de validação constante. As pessoas sairão da apresentação com uma visão clara de como desenhar arquiteturas de MLOps mais resilientes e preparadas para falhas silenciosas. A meta é que cada participante saiba exatamente por onde começar a implementar ferramentas open-source para detectar desvios em suas empresas, evitando previsões incorretas causadas por mudanças abruptas ou graduais no comportamento dos dados.

Choose one or more areas where this proposal fits.: Data Science and Data Analysis, Machine Learning and Artificial Intelligence, DevOps and Infrastructure Automation

Engenheira Ambiental, migrou para tecnologia aos 34 anos. Dev/Analista de Sistemas, faz MBA em Dados na USP/ESALQ. Paulista em Fortaleza, mãe de 2 jovens, tutora de 3 pets e amante de plantas.

This speaker also appears in: