Escrever a definição antes de calcular
Um indicador precisa de população, condição de sucesso, janela, fonte de dados e tratamento de exceções. Se o negócio quer reconciliação pontual e completa, medir apenas servidor disponível responde a outra pergunta. Acorda quem é responsável pelo compromisso e que evidência o suporta. Um SLA contém o compromisso de serviço; indicadores e objetivos ajudam a acompanhá-lo. Os cálculos seguintes são regras fictícias fornecidas no exercício. A orientação SRE serve de apoio operacional e não é apresentada como fórmula obrigatória ou novo objetivo oficial do ITIL.
Contar o resultado que o consumidor recebe
Em 20 dias, um ficheiro atrasado e outro incompleto deixam 18 dias que cumprem simultaneamente prazo e qualidade: 90%. Não substituas esse valor pelos 99,99% de disponibilidade da infraestrutura. Os dois indicadores podem estar corretos e medir realidades diferentes. Conserva o indicador técnico para diagnóstico e mostra o resultado do serviço. Se cada região tiver volume distinto, agrega contagens quando a definição é por pedido: 900/1000 e 9990/10000 resultam em 10890/11000, ou 99%. Mostra também as regiões para não esconder os 90% de A.
Intervalos sobrepostos contam uma vez
O acordo fictício exclui 120 minutos de manutenção de uma janela de 43200, deixando 43080 elegíveis. Interrupções entre 20–50 e 40–70 partilham dez minutos, logo a união ocupa 50, não 60. A disponibilidade calculada é cerca de 99,884%, abaixo do alvo de 99,9%. Noutro exercício, só 02:00–02:30 é manutenção excluída: uma falha entre 02:10 e 02:45 deixa 15 minutos elegíveis. Começar durante a manutenção não estende automaticamente a exclusão. Regista a regra, o relógio e os limites dos intervalos.
Mostrar desconhecidos e a cauda da distribuição
Se 100 dos 1000 resultados elegíveis ficaram sem observação, a cobertura é 90%. Não declares todos bons por falta de erro nem todos falhados sem evidência; mostra a lacuna e define o tratamento acordado. Percentis também têm limites. Para 19 pedidos de 100 ms e um de 1000 ms, o método nearest-rank definido como ceil(0,95×20) escolhe o elemento 19: p95 é 100 ms. Isso não apaga o pedido lento. A definição do percentil pertence ao fixture; ferramentas reais podem usar outros métodos. Conserva contagem, janela e distribuição.
Seguir o tempo através das transferências
O pedido espera 90 minutos, recebe dez de trabalho, espera outros 60, recebe 20 de trabalho e dez de validação. O total sequencial é 190 minutos: 150 de espera e 40 de atividade. Automatizar metade da atividade poupa 20 minutos, deixando 170, cerca de 10,5% de melhoria total. Antes de prometer 50%, observa as filas, horários e transferências entre equipas. Uma aprovação pode ter finalidade necessária e ainda assim esperar por informação em falta ou cobertura inadequada. Melhora o fluxo com evidência em vez de remover controlos pela sua duração.
Comparar melhoria com qualidade e risco
Um piloto com menor mediana de fecho pode gerar mais reaberturas. Compara populações equivalentes e uma janela de acompanhamento suficiente para observar o resultado. Se permissões erradas aumentarem de 1% para 6%, conter o automatismo afetado e rever exceções pode ser necessário antes de expandir. Define critérios prévios de aceitação, responsável e feedback dos utilizadores. Se um fornecedor só promete resposta em quatro horas, não uses os 20 minutos da equipa interna como garantia de recuperação em 60. O resultado depende do fluxo completo.
Prática guiada e relatório de serviço
Recalcula os quatro resultados do fixture: 90% de dias bons, 99% de pedidos bons agregados, 50 minutos de indisponibilidade sem dupla contagem e 170 minutos após automatização parcial. Depois escreve o que cada número não prova. O indicador global não valida todas as regiões; disponibilidade não garante ficheiro correto; tempo menor não prova autorização correta. Um relatório útil liga definição, valor, qualidade dos dados, impacto e próxima decisão. Os modelos locais validam contas e premissas fornecidas, não contratos reais, causas de incidentes ou desempenho de produção.
Synthetic agreed rules, not universal ITIL formulas
good_days: 18 / 20
regional_good_requests: 900 / 1000 and 9990 / 10000
window_minutes: 43200; excluded_maintenance: 120
outage_intervals_minutes: [20,50), [40,70)
flow: wait90 + work10 + wait60 + work20 + validation10
automation: halves work and validation, leaves waits unchangedUm painel técnico está verde, mas só 18 de 20 dias permitem o fecho pontual e completo. A reunião de serviço trata a lacuna do consumidor e as dependências que precisam de melhoria.
Armadilhas comuns
Somar interrupções sobrepostas; mudar denominadores após falhas; esconder desconhecidos; tratar p95 como máximo; prometer redução total igual à redução de trabalho.
Tópicos relacionados: Gestão de incidentes · Níveis de serviço e melhoria
Uma métrica útil conserva definição, população e limitações, e ajuda a decidir como melhorar o serviço.
Referência: Service Level Management practice overview · ITIL 4 Foundation; syllabus v4.2.0 (March 2025)