HDI Brasil· Gestão de Serviços de TI

Curso de 16h · Integrado ao ITIL 5 e HDI SCC

Observabilidade Aplicada à Gestão de Serviços de TI

Uma operação observável detecta mais cedo, aprende mais rápido, planeja melhor e demonstra valor de forma mensurável.

Em 16 horas, você sai do monitoramento que só avisa para a Observabilidade que explica: alertas acionáveis, dashboards de decisão, runbooks, indicadores e maturidade, integrados a ITIL 5, HDI SCC, SRE, NOC/SOC, GRC e FinOps.

Módulo 4 · modelagem de alertas
Alerta ruim

CPU acima de 75% em qualquer servidor, sem impacto, sem dono e sem runbook.

impacto
não definido
dono
não definido
runbook
não definido
Alerta acionávelAlta

Latência P99 da API de autenticação acima de 1,5 segundo por 10 minutos, afetando a jornada de login, com runbook e dono definidos.

jornada
login
dono
definido
runbook
definido
recuperação
P99 abaixo do limite por 15 min
O segundo alerta conecta sinal técnico a impacto e ação.
16h
Carga horária
16
Módulos
8
Áreas atendidas
4
Itens HDI SCC

Sua operação vive isso?

Sintomas de uma operação que ainda só monitora

Se você reconheceu pelo menos um, este curso foi feito para a sua realidade.

“O usuário reclama antes do monitoramento avisar.”

→ Módulos 10 e 14

“Centenas de alertas, e ninguém sabe qual importa.”

→ Módulos 4 e 7

“A infraestrutura está verde e o usuário continua sofrendo.”

→ Módulos 1 e 3

“No incidente, cada analista improvisa.”

→ Módulo 6

“Logs guardando CPF e token de sessão.”

→ Módulo 8

“O custo de nuvem e IA sobe sem explicação.”

→ Módulo 16

Quando tudo parece crítico, nada é crítico.

— Módulo 4, sobre alert fatigue

A virada

Da operação reativa à operação preditiva

Dimensão
Operação reativa
Operação proativa
Operação preditiva
Incidentes
ReativaUsuário reclama primeiro.
ProativaTelemetria detecta antes do usuário.
PreditivaModelo identifica risco antes do impacto.
Capacidade
ReativaEscala após saturação.
ProativaForecast por tendência e sazonalidade.
PreditivaPlanejamento baseado em simulação e demanda futura.
Dados
ReativaProblema aparece no relatório.
ProativaTeste detecta falha de pipeline.
PreditivaAnomalia prevê quebra de Data SLA.
IA
ReativaModelo é avaliado pontualmente.
ProativaMétricas monitoram produção.
PreditivaDrift e risco são antecipados.

Casos que você vai analisar

Do sintoma ao aprendizado

Módulo 1caso 01

A média escondia o problema

Cliente relata lentidão na consulta de saldo, mas a média de resposta está normal.

Aprendizado

A média escondia a cauda de latência. A Observabilidade localizou a dependência que afetava parte dos usuários.

Módulo 7caso 02

Dezenas de alertas, um único incidente

Timeouts em três APIs, queda no checkout e alertas de fila disparam ao mesmo tempo.

Aprendizado

Um único incidente correlacionado, com causa provável no banco de dados saturado.

Módulo 15caso 03

A IA errou sem nenhuma falha técnica

Um modelo de priorização passa a classificar incidentes de uma nova aplicação como baixa prioridade. Tudo está no ar.

Aprendizado

Um sistema pode estar disponível e ainda gerar dano operacional se consumir dados incompletos ou inconsistentes.

Módulo 16caso 04

Custo de IA +40% em um mês

Disponibilidade normal e satisfação em alta, mas o custo da plataforma de atendimento com IA cresce 40%.

Aprendizado

Roteamento entre modelos, cache semântico e limite de contexto: eficiência sem perder qualidade nem experiência.

Quer levar esse raciocínio para a sua operação?

A venda ainda não abriu. Garanta seu lugar na pré-inscrição.

Quero me pré-inscrever

Indicadores

Prove valor com números que a liderança entende

MTTD

Tempo médio para detectar

Se está alto, a equipe descobre tarde. Revise alertas e cobertura.

MTTA

Tempo médio para reconhecer

Se está alto, há fila, falta de dono ou excesso de alertas.

MTTR

Tempo médio para restaurar

Se está alto, runbooks, automação, escalonamento ou arquitetura precisam evoluir.

P95 / P99

Experiência no pior caso

Se o P99 piora e a média está normal, parte dos usuários está sofrendo.

% antes do usuário

Detecção proativa

Mostra se a operação está saindo do modelo dependente de chamado.

Reincidência

Taxa de reincidência

Se está alta, Problem Management e correção estrutural estão fracos.

Régua de maturidade

Em que nível está a sua operação?

Você aprende a identificar o próximo passo viável e a montar um plano de 30-60-90 dias.

Nível 1

Básico e reativo

Monitoramento pontual, pouca padronização e dependência individual.

Nível 2

Estruturado

Alertas e dashboards, com NOC e Suporte atuantes em eventos e incidentes.

Nível 3

Integrado

ITSM, SRE e automação, com problemas, mudanças e SLO e times integrados.

Nível 4

Preditivo e governado

AIOps, experiência e auto-healing, com melhoria contínua avançada.

Conteúdo programático

Módulo a módulo

16 horas · 16 módulos · clique para ver objetivo e produto de aprendizagem
01Fundamentos de ObservabilidadeO que é Observabilidade?

Compreender o conceito, diferenciar Monitoramento de Observabilidade e reconhecer métricas, logs, traces, eventos e sintomas.

Produto de aprendizagemMapa de sinais

02Observabilidade no contexto do ITIL 5Como ela se conecta ao ITIL 5?

Conectar Observabilidade às práticas de Gestão de Serviços, incluindo eventos, incidentes, problemas, mudanças e melhoria contínua.

Produto de aprendizagemFluxo evento → incidente → problema → mudança

03Conexão com HDI Support Center CertificationComo apoia o HDI SCC?

Explicar como Observabilidade apoia excelência operacional, experiência do usuário, incidentes e problemas no contexto HDI SCC.

Produto de aprendizagemEvidências por item HDI

04Modelagem de alertasComo criar alertas úteis?

Aprender a criar alertas acionáveis, com prioridade baseada em impacto, urgência, serviço, experiência e risco.

Produto de aprendizagemModelo de qualidade de alertas

05Dashboards para tomada de decisãoComo desenhar dashboards?

Projetar dashboards adequados para liderança, NOC, SOC, SRE, aplicações, capacidade e experiência do usuário.

Produto de aprendizagemPainéis por público e decisão

06Runbooks e playbooksComo responder melhor?

Padronizar diagnóstico, mitigação, comunicação, escalonamento e pós-incidente.

Produto de aprendizagemRunbook e playbook

07Correlação, filtragem e redução de ruídoComo reduzir ruído?

Entender como eventos de várias camadas podem ser agrupados em incidentes correlacionados.

Produto de aprendizagemRegras de correlação e deduplicação

08Segurança, GRC e Compliance em ObservabilidadeComo proteger dados?

Entender os riscos dos dados de Observabilidade e aplicar controles de privacidade, segurança, retenção, acesso, auditoria e LGPD.

Produto de aprendizagemControles GRC/LGPD

09Responsabilidades entre equipesQuem faz o quê?

Definir papéis de Suporte, NOC, SOC, SRE, Engenharia, Governança, Segurança e donos de serviço.

Produto de aprendizagemRACI operacional

10Indicadores de Observabilidade e Gestão de ServiçosComo medir valor?

Medir detecção, resposta, restauração, reincidência, automação, experiência e confiabilidade.

Produto de aprendizagemKPIs e interpretação

11Fluxos integrados práticosComo aplicar em cenários reais?

Aplicar Observabilidade em cenários completos envolvendo API crítica, jornada digital e anomalia de segurança.

Produto de aprendizagemFluxo integrado

12Maturidade em ObservabilidadeComo evoluir maturidade?

Avaliar o estágio atual e construir plano de evolução com foco em pessoas, processos, tecnologia, dados e governança.

Produto de aprendizagemRoadmap 30-60-90 dias

13Observabilidade integrada a Capacity Management e Availability ManagementComo apoiar capacidade e disponibilidade?

Conectar Observabilidade às práticas de Capacity and Performance Management e Availability Management, com telemetria, tendências, SLIs, SLOs e dados históricos.

Produto de aprendizagemMapa capacidade-disponibilidade-confiabilidade

14Indicadores de proatividade e maturidade operacionalComo medir proatividade operacional?

Complementar os indicadores tradicionais com métricas que mostrem a evolução para uma operação preventiva, preditiva e orientada por confiabilidade.

Produto de aprendizagemIndicadores de proatividade e maturidade

15Evolução para Observabilidade de Dados e Inteligência ArtificialComo aplicar Observabilidade em dados e IA?

Introduzir Data Observability, Data Reliability Engineering e Observabilidade aplicada à IA, conectando qualidade, linhagem, freshness, Data SLAs, métricas de modelo, riscos e governança.

Produto de aprendizagemModelo introdutório para Data Observability, DRE e AI RMF

16Observabilidade, FinOps e eficiência operacional em nuvem e IAComo conectar Observabilidade e FinOps?

Relacionar Observabilidade ao monitoramento de consumo, custos, desperdícios, eficiência, unit economics e tomada de decisão em nuvem, dados e IA.

Produto de aprendizagemIndicadores de consumo, custo e eficiência operacional

Integrado ao ITIL 5 e ao HDI SCC

A camada de evidências das suas práticas

Observabilidade não substitui ITIL 5 nem HDI SCC: fornece dados, evidências e indicadores que fortalecem essas práticas.

EventoAlertaIncidenteProblemaErro conhecidoMudançaMelhoria contínua

Práticas ITIL 5 trabalhadas

  • Monitoring and Event Management
  • Incident Management
  • Problem Management
  • Change Enablement
  • Capacity and Performance Management
  • Availability Management
  • Continual Improvement

Itens HDI Support Center Certification

  • 5.010 Gestão de Eventos
  • 5.020 Experiência do Cliente/Usuário
  • 5.060 Gerenciamento de Incidentes
  • 5.130 Gerenciamento de Problemas

O que você leva

Você sai com material para aplicar na sua operação

Modelo de runbook

Os 8 campos de um runbook pronto para incidente real, do nome do alerta às evidências.

Checklist de qualidade de alertas

8 critérios para decidir se um alerta merece existir.

Checklist de governança de logs

Política, inventário, mascaramento, retenção, menor privilégio, auditoria e descarte seguro.

Matriz RACI operacional

Quem executa, aprova, é consultado e informado entre Suporte, NOC, SOC, SRE, Engenharia, Governança, Segurança e dono do serviço.

Catálogo de indicadores

Fórmula e interpretação de MTTD, MTTA, MTTR, reincidência, P95/P99, alertas acionáveis, DEX e automação.

Roteiro de aplicação em serviço crítico

8 passos para aplicar tudo em um serviço da sua empresa e sair com três ações preventivas para os próximos 30 dias.

Para quem é · treinamento técnico e gerencial

Centro de SuporteNOCSOCSREEngenhariaGovernançaSegurançaGestão de Serviços

Perguntas frequentes

Dúvidas sobre o curso

Qual a carga horária?

16 horas, distribuídas em 16 módulos que vão dos fundamentos à Observabilidade de dados, IA e FinOps.

Qual a diferença entre monitoramento e Observabilidade?

O monitoramento avisa que um serviço está lento. A Observabilidade ajuda a entender por que ele está lento, a partir dos sinais que o sistema emite — métricas, logs, traces e eventos — conectados entre si.

O curso é técnico ou gerencial?

Os dois. Ele foi desenhado para Centro de Suporte, NOC, SOC, SRE, Engenharia, Governança, Segurança e Gestão de Serviços, e vai de alertas e runbooks até dashboards executivos, maturidade e FinOps.

Vou sair com algo aplicável na minha empresa?

Sim. Cada módulo entrega um produto de aprendizagem, e o curso inclui modelo de runbook, checklists de alertas e de governança de logs, matriz RACI, catálogo de indicadores e um roteiro para aplicar tudo em um serviço crítico.

Pré-inscrição aberta

Cada incidente deixa de ser apenas interrupção e passa a ser fonte de evidência para melhorar serviços, processos, segurança e experiência.

  • 16 horas e 16 módulos, do conceito à aplicação
  • Integrado ao ITIL 5, HDI SCC, SRE, NOC/SOC, GRC e FinOps
  • Modelo de runbook, checklists, matriz RACI e catálogo de indicadores
  • Roteiro para aplicar em um serviço crítico da sua empresa

Ficha de interesse

A venda deste curso ainda não abriu. Preencha seus dados e nosso time entra em contato para confirmar turma e forma de pagamento.

Seus dados são usados apenas para o contato sobre este curso.

Se tiver problema com o formulário, mande por email direto para falecom@hdibrasil.com.br.

Entre em contato com o HDI

Siga o HDI Brasil