Falha de energia e de resfriamento derrubou serviços do Google Cloud na Holanda por quase 15 horas
Em 15/7, uma oscilação na rede elétrica e falhas no backup e na refrigeração levaram o Google a desligar máquinas na zona europe-west4-a.
Em 15 de julho de 2026, uma oscilação de 3 milissegundos na rede elétrica que abastece um data center da zona europe-west4-a do Google Cloud, na Holanda, desencadeou uma sequência de falhas de energia e de refrigeração que interrompeu três serviços por 14 horas e 55 minutos. Segundo o relatório de incidente publicado pelo Google em 25 de julho, Google Cloud VMware Engine (GCVE), Bare Metal Solution (BMS) e Google Cloud NetApp Volumes ficaram indisponíveis entre 19h39 de 15 de julho e 10h34 de 16 de julho, no horário de Manaus (16h39 e 7h34 no horário do Pacífico dos EUA).
Como uma oscilação virou apagão
O Google afirma que o transiente de tensão atingiu as duas alimentações da concessionária, A e B. Os disjuntores desarmaram e a carga deveria passar para o sistema de reserva DRUPS, um no-break rotativo a diesel. No lado B, a transição funcionou sem interrupção. No lado A, o DRUPS não assumiu a carga por falha de componentes elétricos. A transferência automática levou duas das três fileiras afetadas para a alimentação B, mas a terceira sofreu sobrecarga, teve o disjuntor de proteção desarmado e perdeu as duas alimentações redundantes. A causa dessa falha, descrita como uma discrepância na distribuição de carga, ainda estava sob investigação quando o relatório saiu.
Ao mesmo tempo, o controlador dos chillers caiu durante a oscilação e não sinalizou o religamento das bombas de água gelada, o que desligou o sistema de refrigeração A. A fonte redundante de resfriamento não estava disponível por causa de obras em andamento no local, de acordo com o relatório. A temperatura do salão de servidores chegou a 44 °C, e as equipes iniciaram o desligamento das máquinas para evitar danos ao equipamento. A refrigeração só se normalizou às 21h05 (Pacífico), cerca de 4h40 após a oscilação, depois que as bombas foram passadas para acionamento manual.
Quem foi afetado
O relatório informa que a queda atingiu 24 nuvens privadas de 20 clientes do GCVE e 9 clientes do BMS, que perderam acesso a servidores de banco de dados e a equipamentos de storage. No NetApp Volumes, os seis clusters foram desligados automaticamente por temperatura; clientes dos níveis Standard, Premium e Extreme ficaram sem acesso aos volumes, e operações de controle, como criação de pools e de backups, falharam na região. No relatório preliminar de 17 de julho, a duração variou por serviço: 9h24 no GCVE, 8h31 no NetApp Volumes e 12h57 no BMS. O DCD relatou o caso em 21 de julho com base no documento do Google.
O que muda na operação
O episódio expõe um limite conhecido dos projetos de alta disponibilidade: redundâncias de energia e de refrigeração que existem no projeto podem falhar juntas, sobretudo quando parte delas está fora de operação por manutenção ou obra. Os três serviços atingidos são justamente os que reproduzem ambientes tradicionais na nuvem, como VMware, servidores físicos dedicados e storage NetApp, e dependem de hardware alocado em uma zona específica. Para cargas desse tipo, manter réplicas em mais de uma zona e testar o failover periodicamente reduz a dependência de um único prédio.
O Google listou ações corretivas com prazos entre agosto e outubro de 2026. Entre elas estão investigar por que o DRUPS não assumiu a carga, resolver a sobrecarga da terceira fileira, revisar a redundância do controle das bombas, antecipar alertas de energia e temperatura, automatizar o desligamento de emergência do GCVE em aquecimentos rápidos e fazer simulações mensais conjuntas com a equipe do data center para o NetApp Volumes.
O que ainda não se sabe
O relatório menciona o provedor do data center, mas não o identifica, e não informa créditos de SLA concedidos aos clientes. Também não foi localizada atualização pública sobre a conclusão das ações previstas. Há ainda uma diferença de horários na própria página: o cabeçalho do incidente registra início às 16h57 e fim às 5h25 (Pacífico), enquanto o relatório detalhado usa o intervalo de 16h39 a 7h34, que corresponde às 14 horas e 55 minutos informadas como duração total.
Fontes
- Google Cloud Service Health — Incident Report: GCVE, Bare Metal Solution e NetApp Volumes em europe-west4-a (relatório final; preliminar em 17/07) (25/07/2026)
- DCD (DatacenterDynamics) — Google Cloud experiences outage after power and cooling failure in Netherlands data center (21/07/2026)
Imagem destacada: ilustração gerada por computador, sem valor documental.


