Curso de 16h · Integrado ao ITIL 5 e HDI SCC
Observabilidade Aplicada à Gestão de Serviços de TI
Uma operação observável detecta mais cedo, aprende mais rápido, planeja melhor e demonstra valor de forma mensurável.
Em 16 horas, você sai do monitoramento que só avisa para a Observabilidade que explica: alertas acionáveis, dashboards de decisão, runbooks, indicadores e maturidade, integrados a ITIL 5, HDI SCC, SRE, NOC/SOC, GRC e FinOps.
CPU acima de 75% em qualquer servidor, sem impacto, sem dono e sem runbook.
- impacto
- não definido
- dono
- não definido
- runbook
- não definido
Latência P99 da API de autenticação acima de 1,5 segundo por 10 minutos, afetando a jornada de login, com runbook e dono definidos.
- jornada
- login
- dono
- definido
- runbook
- definido
- recuperação
- P99 abaixo do limite por 15 min
Sua operação vive isso?
Sintomas de uma operação que ainda só monitora
Se você reconheceu pelo menos um, este curso foi feito para a sua realidade.
“O usuário reclama antes do monitoramento avisar.”
→ Módulos 10 e 14
“Centenas de alertas, e ninguém sabe qual importa.”
→ Módulos 4 e 7
“A infraestrutura está verde e o usuário continua sofrendo.”
→ Módulos 1 e 3
“No incidente, cada analista improvisa.”
→ Módulo 6
“Logs guardando CPF e token de sessão.”
→ Módulo 8
“O custo de nuvem e IA sobe sem explicação.”
→ Módulo 16
Quando tudo parece crítico, nada é crítico.
— Módulo 4, sobre alert fatigue
A virada
Da operação reativa à operação preditiva
Casos que você vai analisar
Do sintoma ao aprendizado
A média escondia o problema
Cliente relata lentidão na consulta de saldo, mas a média de resposta está normal.
A média escondia a cauda de latência. A Observabilidade localizou a dependência que afetava parte dos usuários.
Dezenas de alertas, um único incidente
Timeouts em três APIs, queda no checkout e alertas de fila disparam ao mesmo tempo.
Um único incidente correlacionado, com causa provável no banco de dados saturado.
A IA errou sem nenhuma falha técnica
Um modelo de priorização passa a classificar incidentes de uma nova aplicação como baixa prioridade. Tudo está no ar.
Um sistema pode estar disponível e ainda gerar dano operacional se consumir dados incompletos ou inconsistentes.
Custo de IA +40% em um mês
Disponibilidade normal e satisfação em alta, mas o custo da plataforma de atendimento com IA cresce 40%.
Roteamento entre modelos, cache semântico e limite de contexto: eficiência sem perder qualidade nem experiência.
Quer levar esse raciocínio para a sua operação?
A venda ainda não abriu. Garanta seu lugar na pré-inscrição.
Indicadores
Prove valor com números que a liderança entende
MTTD
Tempo médio para detectar
Se está alto, a equipe descobre tarde. Revise alertas e cobertura.
MTTA
Tempo médio para reconhecer
Se está alto, há fila, falta de dono ou excesso de alertas.
MTTR
Tempo médio para restaurar
Se está alto, runbooks, automação, escalonamento ou arquitetura precisam evoluir.
P95 / P99
Experiência no pior caso
Se o P99 piora e a média está normal, parte dos usuários está sofrendo.
% antes do usuário
Detecção proativa
Mostra se a operação está saindo do modelo dependente de chamado.
Reincidência
Taxa de reincidência
Se está alta, Problem Management e correção estrutural estão fracos.
Régua de maturidade
Em que nível está a sua operação?
Você aprende a identificar o próximo passo viável e a montar um plano de 30-60-90 dias.
Nível 1
Básico e reativo
Monitoramento pontual, pouca padronização e dependência individual.
Nível 2
Estruturado
Alertas e dashboards, com NOC e Suporte atuantes em eventos e incidentes.
Nível 3
Integrado
ITSM, SRE e automação, com problemas, mudanças e SLO e times integrados.
Nível 4
Preditivo e governado
AIOps, experiência e auto-healing, com melhoria contínua avançada.
Conteúdo programático
Módulo a módulo
01Fundamentos de ObservabilidadeO que é Observabilidade?
Compreender o conceito, diferenciar Monitoramento de Observabilidade e reconhecer métricas, logs, traces, eventos e sintomas.
Produto de aprendizagemMapa de sinais
02Observabilidade no contexto do ITIL 5Como ela se conecta ao ITIL 5?
Conectar Observabilidade às práticas de Gestão de Serviços, incluindo eventos, incidentes, problemas, mudanças e melhoria contínua.
Produto de aprendizagemFluxo evento → incidente → problema → mudança
03Conexão com HDI Support Center CertificationComo apoia o HDI SCC?
Explicar como Observabilidade apoia excelência operacional, experiência do usuário, incidentes e problemas no contexto HDI SCC.
Produto de aprendizagemEvidências por item HDI
04Modelagem de alertasComo criar alertas úteis?
Aprender a criar alertas acionáveis, com prioridade baseada em impacto, urgência, serviço, experiência e risco.
Produto de aprendizagemModelo de qualidade de alertas
05Dashboards para tomada de decisãoComo desenhar dashboards?
Projetar dashboards adequados para liderança, NOC, SOC, SRE, aplicações, capacidade e experiência do usuário.
Produto de aprendizagemPainéis por público e decisão
06Runbooks e playbooksComo responder melhor?
Padronizar diagnóstico, mitigação, comunicação, escalonamento e pós-incidente.
Produto de aprendizagemRunbook e playbook
07Correlação, filtragem e redução de ruídoComo reduzir ruído?
Entender como eventos de várias camadas podem ser agrupados em incidentes correlacionados.
Produto de aprendizagemRegras de correlação e deduplicação
08Segurança, GRC e Compliance em ObservabilidadeComo proteger dados?
Entender os riscos dos dados de Observabilidade e aplicar controles de privacidade, segurança, retenção, acesso, auditoria e LGPD.
Produto de aprendizagemControles GRC/LGPD
09Responsabilidades entre equipesQuem faz o quê?
Definir papéis de Suporte, NOC, SOC, SRE, Engenharia, Governança, Segurança e donos de serviço.
Produto de aprendizagemRACI operacional
10Indicadores de Observabilidade e Gestão de ServiçosComo medir valor?
Medir detecção, resposta, restauração, reincidência, automação, experiência e confiabilidade.
Produto de aprendizagemKPIs e interpretação
11Fluxos integrados práticosComo aplicar em cenários reais?
Aplicar Observabilidade em cenários completos envolvendo API crítica, jornada digital e anomalia de segurança.
Produto de aprendizagemFluxo integrado
12Maturidade em ObservabilidadeComo evoluir maturidade?
Avaliar o estágio atual e construir plano de evolução com foco em pessoas, processos, tecnologia, dados e governança.
Produto de aprendizagemRoadmap 30-60-90 dias
13Observabilidade integrada a Capacity Management e Availability ManagementComo apoiar capacidade e disponibilidade?
Conectar Observabilidade às práticas de Capacity and Performance Management e Availability Management, com telemetria, tendências, SLIs, SLOs e dados históricos.
Produto de aprendizagemMapa capacidade-disponibilidade-confiabilidade
14Indicadores de proatividade e maturidade operacionalComo medir proatividade operacional?
Complementar os indicadores tradicionais com métricas que mostrem a evolução para uma operação preventiva, preditiva e orientada por confiabilidade.
Produto de aprendizagemIndicadores de proatividade e maturidade
15Evolução para Observabilidade de Dados e Inteligência ArtificialComo aplicar Observabilidade em dados e IA?
Introduzir Data Observability, Data Reliability Engineering e Observabilidade aplicada à IA, conectando qualidade, linhagem, freshness, Data SLAs, métricas de modelo, riscos e governança.
Produto de aprendizagemModelo introdutório para Data Observability, DRE e AI RMF
16Observabilidade, FinOps e eficiência operacional em nuvem e IAComo conectar Observabilidade e FinOps?
Relacionar Observabilidade ao monitoramento de consumo, custos, desperdícios, eficiência, unit economics e tomada de decisão em nuvem, dados e IA.
Produto de aprendizagemIndicadores de consumo, custo e eficiência operacional
Integrado ao ITIL 5 e ao HDI SCC
A camada de evidências das suas práticas
Observabilidade não substitui ITIL 5 nem HDI SCC: fornece dados, evidências e indicadores que fortalecem essas práticas.
Práticas ITIL 5 trabalhadas
- Monitoring and Event Management
- Incident Management
- Problem Management
- Change Enablement
- Capacity and Performance Management
- Availability Management
- Continual Improvement
Itens HDI Support Center Certification
- 5.010 Gestão de Eventos
- 5.020 Experiência do Cliente/Usuário
- 5.060 Gerenciamento de Incidentes
- 5.130 Gerenciamento de Problemas
O que você leva
Você sai com material para aplicar na sua operação
Modelo de runbook
Os 8 campos de um runbook pronto para incidente real, do nome do alerta às evidências.
Checklist de qualidade de alertas
8 critérios para decidir se um alerta merece existir.
Checklist de governança de logs
Política, inventário, mascaramento, retenção, menor privilégio, auditoria e descarte seguro.
Matriz RACI operacional
Quem executa, aprova, é consultado e informado entre Suporte, NOC, SOC, SRE, Engenharia, Governança, Segurança e dono do serviço.
Catálogo de indicadores
Fórmula e interpretação de MTTD, MTTA, MTTR, reincidência, P95/P99, alertas acionáveis, DEX e automação.
Roteiro de aplicação em serviço crítico
8 passos para aplicar tudo em um serviço da sua empresa e sair com três ações preventivas para os próximos 30 dias.
Para quem é · treinamento técnico e gerencial
Perguntas frequentes
Dúvidas sobre o curso
Qual a carga horária?
16 horas, distribuídas em 16 módulos que vão dos fundamentos à Observabilidade de dados, IA e FinOps.
Qual a diferença entre monitoramento e Observabilidade?
O monitoramento avisa que um serviço está lento. A Observabilidade ajuda a entender por que ele está lento, a partir dos sinais que o sistema emite — métricas, logs, traces e eventos — conectados entre si.
O curso é técnico ou gerencial?
Os dois. Ele foi desenhado para Centro de Suporte, NOC, SOC, SRE, Engenharia, Governança, Segurança e Gestão de Serviços, e vai de alertas e runbooks até dashboards executivos, maturidade e FinOps.
Vou sair com algo aplicável na minha empresa?
Sim. Cada módulo entrega um produto de aprendizagem, e o curso inclui modelo de runbook, checklists de alertas e de governança de logs, matriz RACI, catálogo de indicadores e um roteiro para aplicar tudo em um serviço crítico.
Pré-inscrição aberta
Cada incidente deixa de ser apenas interrupção e passa a ser fonte de evidência para melhorar serviços, processos, segurança e experiência.
- 16 horas e 16 módulos, do conceito à aplicação
- Integrado ao ITIL 5, HDI SCC, SRE, NOC/SOC, GRC e FinOps
- Modelo de runbook, checklists, matriz RACI e catálogo de indicadores
- Roteiro para aplicar em um serviço crítico da sua empresa
Ficha de interesse
A venda deste curso ainda não abriu. Preencha seus dados e nosso time entra em contato para confirmar turma e forma de pagamento.
Obrigado pelo envio, entraremos em contato!