Logo do curso
Curso

Observabilidade inteligente:

integrando métricas, logs e traces com OpenTelemetry

Quero estudar na alura

10h

Para conclusão

75

Pessoas nesse curso

Certificado

De participação

Introdução_

O que você aprenderá_

  • Integre métricas, logs e traces para correlacionar sinais operacionais e identificar a causa raiz de incidentes.
  • Implemente pipelines de telemetria com OpenTelemetry, Prometheus e Grafana para coletar, processar e visualizar dados.
  • Configure thresholds dinâmicos e alertas contextuais para reduzir ruídos, falsos positivos e fadiga de alerta.
  • Analise séries históricas e desenvolva previsões de capacidade para antecipar a saturação de serviços.
  • Automatize post-mortems e crie runbooks com técnicas de AIOps para acelerar a investigação e a resolução de incidentes.
  • Adote estratégias como Canary Deployment para acompanhar novos lançamentos e reduzir riscos em produção.
  • Estruture dashboards, SLOs e error budgets para apoiar a gestão de incidentes e a comunicação com diferentes áreas do negócio.

Público alvo_

Engenheiros de software, profissionais de SRE/DevOps, líderes técnicos e estudantes que desejam aplicar práticas modernas de observabilidade para diagnosticar incidentes, reduzir ruído de alertas e automatizar análises operacionais em ambientes de microserviços.

Camilla Martins

Camilla Martins

linkedin

Docker Community Leader, Senior Site Reliability Engineer e atualmente trabalho na Storyblok, com pós em Forense Computacional e Mestre em Operação, Avaliação e Gerenciamento Avançado de Redes de Computadores na Universidade Federal do Estado do Rio de Janeiro. Doutoranda também pela Federal do Estado do Rio de Janeiro. Sou Docker Community Leader premiada três vezes pela Docker Inc, Docker Captain, DevOpsDays Core Organizer, Google Developer Expert em Cloud, IBM Champion, organizadora de diversos eventos.

Curso atualizado em 15/09/2026

Ementa

  1. Diagnóstico e mitigação de falhas

    • Introdução
    • Do monitoramento Black Box à observabilidade moderna
    • Correlacionando métricas, logs e traces
    • Monitoramento de saúde de sistemas médicos na Clínica Médica Voll
    • Correlacionando mudanças operacionais e falhas
    • Para saber mais: Canary deployment e observabilidade inteligente
    • Padronizando a telemetria com OpenTelemetry
    • Otimizando a experiência do usuário na WaveCast
    • Investigando incidentes com múltiplos sinais
    • Faça como eu fiz: analisar observabilidade
    • O que aprendemos?
  2. Previsão de capacidade e detecção de anomalias

    • Identificando tendências de consumo na infraestrutura
    • Antecipando a saturação de recursos e serviços
    • Prevenindo problemas de desempenho na Screen Match
    • Analisando padrões sazonais e anomalias operacionais
    • Detectando desvios em métricas operacionais
    • Analisando tendências e prevendo a saturação de recursos
    • Para saber mais: entendendo o método CUSUM
    • Previsão de saturação de recursos na Organo
    • Faça como eu fiz: previsão operacional
    • O que aprendemos?
  3. Alertas dinâmicos e redução de ruído operacional

    • Entendendo os problemas dos thresholds estáticos
    • Ajustando alertas de segurança na Techsafe
    • Detectando anomalias com baselines dinâmicos
    • Reduzindo a fadiga de alertas
    • Otimizando alertas
    • Criando alertas contextuais com dependências de serviços
    • Para saber mais: composição de alertas
    • Configurando monitores com limites inteligentes
    • Faça como eu fiz: alertas inteligentes
    • O que aprendemos?
  4. Automação de incidentes e análise inteligente de logs

    • Criando post-mortems assistidos por IA
    • Identificando padrões recorrentes em incidentes
    • Gerenciamento de crises na Indexa com post-mortem assistido por IA
    • Agrupando logs para identificar anomalias
    • Para saber mais: clusterização de logs para detecção de anomalias
    • Detectando sequências anormais em logs operacionais
    • Identificando a causa raiz de falhas no streaming de vídeos
    • Investigando incidentes com IA e análise de logs
    • Faça como eu fiz: investigar incidentes
    • O que aprendemos?
  5. Gestão de incidentes e comunicação operacional

    • Centralizando sinais operacionais em ambientes modernos
    • Centralizando sinais operacionais no Listin
    • Apoiando decisões operacionais com observabilidade
    • Criando dashboards orientados à investigação operacional
    • Reduzindo a carga cognitiva em operações complexas
    • Para saber mais: circuit breaker em microserviços
    • Simulando uma crise com observabilidade inteligente
    • Gerenciando crises operacionais no SwiftBank
    • Implementando observabilidade com Prometheus, Grafana e Jaeger
    • Faça como eu fiz: centralizar sinais
    • O que aprendemos?

Descubra se esse curso é pra você! Leia as primeiras aulas

Comece essa formação agora mesmo e capacite-se para seu próximo projeto!

Conheça os planos
Escola

DevOps

Conheça o movimento que preza pela automação e monitoramento das construções de softwares. Explore a Internet das Coisas, desenvolva infraestruturas completas e crie um pipeline de construção de software. Tudo isso com a ajuda de ferramentas poderosas, como o Terraform e o Kubernetes.

Conheça a escola

Faça parte da nossa comunidade no discord!

Troque conhecimentos com a comunidade da Alura

Aprenda Confiabilidade & SRE com esse e outros cursos, comece agora!

Conheça os Planos para Empresas