Site Local

Portal de notícias de tecnologia

Erro em manutenção automatizada cortou acesso à região West US do Azure e afetou o Microsoft 365

Em 23/7, um reparo automático mal dimensionado cortou a ligação de um datacenter do Azure com a rede externa; o impacto durou quase cinco horas.

Erro em manutenção automatizada cortou acesso à região West US do Azure e afetou o Microsoft 365

Uma falha em um sistema automatizado de manutenção de rede da Microsoft deixou parte dos clientes do Azure sem acesso a serviços hospedados na região West US, nos Estados Unidos, em 23 de julho de 2026. O problema durou das 14h44 às 19h41 UTC (10h44 às 15h41 no horário de Manaus) e atingiu também o Microsoft 365. Segundo a análise pós-incidente publicada pela Microsoft, mais de 20 serviços do Azure foram afetados, entre eles App Service, Azure Kubernetes Service, Cosmos DB, Azure Virtual Desktop, ExpressRoute e VPN Gateway.

Como um reparo simples virou uma pane regional

Os datacenters do Azure se conectam à rede de longa distância da empresa (WAN) por caminhos redundantes. Reparos não planejados em um único equipamento óptico costumam ser processados automaticamente, sem intervenção humana, porque não deveriam afetar o tráfego. Naquele dia, um reparo desse tipo foi aberto para um equipamento, mas um defeito no sistema que calcula o alcance da intervenção ampliou o pedido para todos os equipamentos ópticos de saída de um datacenter.

A verificação de segurança, feita para garantir que ao menos um dos dois caminhos redundantes continue ativo, chegou a rodar, mas avaliou cada equipamento isoladamente, e não o efeito de desligar todos ao mesmo tempo. Com isso, as rotas foram retiradas de vários equipamentos simultaneamente, e o tráfego que entrava ou saía da região foi interrompido. O tráfego interno à região não foi afetado.

Por que a recuperação demorou

Os links físicos continuaram parecendo saudáveis, e o problema se manifestou como uma anomalia de roteamento na WAN, o que levou parte da investigação para a direção errada. Só às 17h19 UTC os engenheiros associaram a pane ao reparo. O sistema automático de recuperação tentou restaurar os equipamentos várias vezes, mas dependia justamente da conectividade perdida. A reversão manual começou às 17h45 e foi concluída às 18h26 UTC; os últimos serviços se normalizaram às 19h41.

Efeito no Microsoft 365

De acordo com o BleepingComputer, o incidente do Microsoft 365, registrado como MO1437424, afetou OneDrive, SharePoint Online, Teams, o centro de administração, Power Automate, Copilot Chat e Loop, entre outros. O site registrou que o Downdetector chegou a 2.403 relatos de falha às 11h11 no horário de Nova York, ante uma média normal de 29, com o SharePoint concentrando 78% das queixas.

O que a Microsoft promete mudar

A empresa diz ter corrigido o defeito, impedido que os dois caminhos de um datacenter passem por reparo ao mesmo tempo e revisado pedidos já existentes em busca de situações parecidas. Outras medidas tinham previsão de conclusão entre agosto e outubro de 2026: registrar esses reparos no histórico padrão de mudanças do Azure, detectar mais rápido anomalias de tráfego, impedir o isolamento simultâneo de vários equipamentos e fazer o sistema de recuperação desistir mais cedo e acionar engenheiros. A análise publicada não informa se essas etapas já foram concluídas.

Para clientes, a Microsoft repete a recomendação de distribuir cargas críticas em mais de uma região. O episódio mostra que a automação de rotinas de infraestrutura reduz trabalho manual, mas pode multiplicar o impacto de um erro quando as verificações não consideram o efeito combinado das ações.

Fontes

Imagem destacada: ilustração gerada por computador, sem valor documental.

Deixe comentário

Seu endereço de e-mail não será publicado. Os campos necessários são marcados com *.

Fique por dentro

As principais notícias de tecnologia, todos os dias

Siga o portal nas redes sociais e acompanhe IA, cibersegurança, cloud, hardware e o mercado de tecnologia em primeira mão.