Acordo de Nível de Serviço (SLA) Infraestrutura e Aplicação SISMETRO Versão: 1.0 Data de Vigência: Setembro de 2026 Escopo: Plataforma SISMETRO (APIs, Web e Arquitetura AWS) 1. Visão Geral e Objetivos Este documento define os níveis formais de serviço, disponibilidade, metas de recuperação e responsabilidades de suporte técnico para a infraestrutura e ecossistema de software da plataforma SISMETRO. O objetivo é garantir a continuidade do negócio, prever mitigação de riscos operacionais e estabelecer clareza sobre métricas chave de disponibilidade (Uptime), Tempo de Recuperação (RTO) e Ponto de Recuperação (RPO). 2. Métricas Globais de Disponibilidade (Uptime) A infraestrutura core do SISMETRO opera em alta disponibilidade na nuvem Amazon Web Services (AWS). O SLA global de disponibilidade da aplicação é estruturado da seguinte forma: Componente / Serviço Meta de SLA (Uptime) Janela de Indisponibilidade Máxima Estimada   Infraestrutura AWS (ECS Fargate / RDS / CloudFront) 99,9% ~43 minutos/mês Aplicações Web & APIs (Laravel / Angular) 99,5% ~3,6 horas/mês Serviços de Terceiros e Integrações (Protheus / Provedores) 99,0% ~7,2 horas/mês Nota: Janelas de manutenção programada precedidas de aviso prévio não contabilizam como indisponibilidade não planejada. 3. Continuidades e Tolerância a Desastres (RPO e RTO) Os procedimentos de tolerância a falhas e planos de mitigação e contingência são apoiados por snapshots automáticos e rotinas do AWS Backup e replicação de dados no MySQL / RDS. Métrica Definição Meta Garantida   RPO (Recovery Point Objective) Quantidade máxima tolerável de perda de dados expressa em tempo. ≤ 1 hora (Backups contínuos / Transaction logs & Snapshots) RTO (Recovery Time Objective) Tempo máximo para restauração completa dos serviços após desastre. ≤ 2 horas (Ambiente multi-az / Fargate auto-recovery) 4. Classificação de Incidentes e Matriz de Resposta Os chamados e incidentes reportados no SISMETRO são categorizados pelo seu nível de severidade e impacto no negócio: Nível de Severidade Descrição / Critério de Impacto Tempo de Primeira Resposta Tempo de Resolução / Solução Contorno   P1 - Crítico (Urgent) Sistema totalmente inoperante para todos os usuários ou perda crítica de dados sem solução de contorno. Até 15 minutos Até 2 horas P2 - Alto (High) Funcionalidade principal afetada (ex: falhas em rotas cruciais de sincronização ou ordens de serviço), com impacto significativo. Até 1 hora Até 8 horas P3 - Médio (Normal) Problema parcial em funcionalidades secundárias ou degradação leve de performance sem paralisação. Até 4 horas Até 24 horas P4 - Baixo (Low) Dúvidas técnicas, solicitações de melhorias, bugs estéticos ou pequenos ajustes visuais. Até 8 horas (dias úteis) A combinar conforme Sprint 5. Procedimentos de Manutenção e Janelas Programadas Manutenções Preventivas / Deployments: Realizados preferencialmente fora do horário de pico comercial (22h às 05h - BRT). Notificação Prévia: Comunicados com pelo menos 48 horas de antecedência aos gestores técnicos em caso de impactos previstos superior a 15 minutos. Deploy Contínuo (CI/CD): Atualizações transparentes via pipeline GitHub / ECS sem downtime para correções pontuais. 6. Exclusões de Cobertura do SLA O presente SLA não se aplica a indisponibilidades decorrentes de: Interrupção em provedores locais de internet do cliente ou falhas de hardware e rede local das unidades de atendimento. Integrações com APIs de terceiros que estejam inoperantes fora do controle do SISMETRO. Ações fraudulentas, mau uso deliberado do sistema ou violações de segurança originadas por credenciais comprometidas do próprio cliente. Eventos de Força Maior ou desastres naturais que afetem regiões inteiras de datacenters da AWS.