Site Local

Portal de notícias de tecnologia

Apache Spark 4.2 traz busca vetorial, CDC nativo e camada de métricas ao motor de dados

Lançado em 14 de julho, o Spark 4.2 adiciona funções vetoriais, captura de mudanças (CDC), tipos geoespaciais e métricas governadas ao motor open source.

Apache Spark 4.2 traz busca vetorial, CDC nativo e camada de métricas ao motor de dados

A Apache Software Foundation anunciou em 14 de julho de 2026 o lançamento do Apache Spark 4.2.0, nova versão da linha 4.x do motor open source de processamento distribuído usado em engenharia de dados e analytics. Segundo as notas de lançamento, a versão resolveu mais de 1.700 tickets no Jira, com contribuições de mais de 250 pessoas, e tem como destaques captura de mudanças de dados (CDC), funções vetoriais, tipos geoespaciais nativos e uma camada de métricas governadas.

O que muda para pipelines e análises

Para pipelines, a principal novidade é o suporte de primeira classe a CDC (change data capture). Uma nova cláusula SQL CHANGES, com APIs equivalentes em DataFrame, PySpark e Spark Connect, permite ler alterações linha a linha em lote e em streaming. Nos Spark Declarative Pipelines, o recurso Auto CDC aplica essas mudanças em tabelas do tipo SCD 1, que guardam só a versão mais recente de cada registro, sem a lógica de merge escrita à mão.

As metric views (CREATE VIEW ... WITH METRICS) trazem para o motor uma camada semântica: dimensões e medidas são definidas uma vez e reutilizadas por SQL, ferramentas de BI e aplicações. O objetivo é evitar que métricas não aditivas, como razões e contagens distintas, deem resultados diferentes quando cada consumidor recalcula a fórmula por conta própria.

Para cargas de IA, a versão inclui funções de distância e similaridade entre vetores, normalização e agregação, além do NEAREST BY, uma junção de ranqueamento que retorna os K vizinhos mais próximos. Os tipos GEOMETRY e GEOGRAPHY, com funções ST_* e leitura e escrita em Parquet, passam a vir habilitados por padrão.

Python, streaming e operação

No PySpark, UDFs otimizadas com Apache Arrow viram o padrão, o que, segundo a Databricks, leva funções existentes ao caminho colunar sem reescrita de código. O suporte à interface C Data do Arrow permite trocar DataFrames com ferramentas como Polars e DuckDB sem cópia de dados, quando os dois lados suportam o padrão. O Real-Time Mode do Structured Streaming chega ao PySpark, por enquanto só para consultas sem estado e sem UDFs Python; a Databricks diz que o suporte a consultas com estado ainda está em desenvolvimento. A interface web ganhou modo escuro e visualização de planos SQL, e o Spark passa a rodar em Java 25.

Contexto e limites

A Databricks, fundada pelos criadores do Spark, publicou sua apresentação da versão em 16 de julho e a disponibiliza no Databricks Runtime 19. O The New Stack, em 19 de julho, avaliou que a busca vetorial dentro do Spark pode reduzir a necessidade de copiar dados para um banco vetorial separado em parte dos casos. É uma possibilidade de arquitetura, não um resultado medido: nem as notas oficiais nem as análises consultadas trazem testes independentes de desempenho dos novos recursos.

Os números de participação variam conforme a fonte. As notas da Apache falam em mais de 250 contribuidores e 1.700 tickets; o texto da Databricks cita mais de 1.900 commits de mais de 260 contribuidores. Para equipes que operam clusters, mudanças de comportamento padrão, como as UDFs com Arrow ativadas por default, recomendam testes com as cargas atuais antes da atualização em produção. Também vale conferir a compatibilidade com formatos de tabela e conectores usados no ambiente, que seguem cronogramas próprios de suporte a novas versões do Spark.

Fontes

Imagem destacada: ilustração gerada por computador, sem valor documental.

Deixe comentário

Seu endereço de e-mail não será publicado. Os campos necessários são marcados com *.

Fique por dentro

As principais notícias de tecnologia, todos os dias

Siga o portal nas redes sociais e acompanhe IA, cibersegurança, cloud, hardware e o mercado de tecnologia em primeira mão.