Erro em manutenção automatizada cortou acesso à região West US do Azure e afetou o Microsoft 365
Em 23/7, um reparo automático mal dimensionado cortou a ligação de um datacenter do Azure com a rede externa; o impacto durou quase cinco horas.
Uma falha em um sistema automatizado de manutenção de rede da Microsoft deixou parte dos clientes do Azure sem acesso a serviços hospedados na região West US, nos Estados Unidos, em 23 de julho de 2026. O problema durou das 14h44 às 19h41 UTC (10h44 às 15h41 no horário de Manaus) e atingiu também o Microsoft 365. Segundo a análise pós-incidente publicada pela Microsoft, mais de 20 serviços do Azure foram afetados, entre eles App Service, Azure Kubernetes Service, Cosmos DB, Azure Virtual Desktop, ExpressRoute e VPN Gateway.
Como um reparo simples virou uma pane regional
Os datacenters do Azure se conectam à rede de longa distância da empresa (WAN) por caminhos redundantes. Reparos não planejados em um único equipamento óptico costumam ser processados automaticamente, sem intervenção humana, porque não deveriam afetar o tráfego. Naquele dia, um reparo desse tipo foi aberto para um equipamento, mas um defeito no sistema que calcula o alcance da intervenção ampliou o pedido para todos os equipamentos ópticos de saída de um datacenter.
A verificação de segurança, feita para garantir que ao menos um dos dois caminhos redundantes continue ativo, chegou a rodar, mas avaliou cada equipamento isoladamente, e não o efeito de desligar todos ao mesmo tempo. Com isso, as rotas foram retiradas de vários equipamentos simultaneamente, e o tráfego que entrava ou saía da região foi interrompido. O tráfego interno à região não foi afetado.
Por que a recuperação demorou
Os links físicos continuaram parecendo saudáveis, e o problema se manifestou como uma anomalia de roteamento na WAN, o que levou parte da investigação para a direção errada. Só às 17h19 UTC os engenheiros associaram a pane ao reparo. O sistema automático de recuperação tentou restaurar os equipamentos várias vezes, mas dependia justamente da conectividade perdida. A reversão manual começou às 17h45 e foi concluída às 18h26 UTC; os últimos serviços se normalizaram às 19h41.
Efeito no Microsoft 365
De acordo com o BleepingComputer, o incidente do Microsoft 365, registrado como MO1437424, afetou OneDrive, SharePoint Online, Teams, o centro de administração, Power Automate, Copilot Chat e Loop, entre outros. O site registrou que o Downdetector chegou a 2.403 relatos de falha às 11h11 no horário de Nova York, ante uma média normal de 29, com o SharePoint concentrando 78% das queixas.
O que a Microsoft promete mudar
A empresa diz ter corrigido o defeito, impedido que os dois caminhos de um datacenter passem por reparo ao mesmo tempo e revisado pedidos já existentes em busca de situações parecidas. Outras medidas tinham previsão de conclusão entre agosto e outubro de 2026: registrar esses reparos no histórico padrão de mudanças do Azure, detectar mais rápido anomalias de tráfego, impedir o isolamento simultâneo de vários equipamentos e fazer o sistema de recuperação desistir mais cedo e acionar engenheiros. A análise publicada não informa se essas etapas já foram concluídas.
Para clientes, a Microsoft repete a recomendação de distribuir cargas críticas em mais de uma região. O episódio mostra que a automação de rotinas de infraestrutura reduz trabalho manual, mas pode multiplicar o impacto de um erro quando as verificações não consideram o efeito combinado das ações.
Fontes
- Microsoft Azure (Status History) — Post Incident Review (PIR) – Network connectivity – Issues accessing resources in West US (ZJV6-SGG) (23/07/2026)
- BleepingComputer — Microsoft blames massive Microsoft 365 outage on maintenance bug (24/07/2026)
Imagem destacada: ilustração gerada por computador, sem valor documental.


