Cloudera heeft GPU-acceleratie voor Apache Spark 4.1 in Cloudera Data Engineering aangekondigd, met behulp van de NVIDIA CUDA-X-bibliotheek, cuDF. De NVIDIA cuDF-plug-in voor Apache Spark ondersteunt Cloudera Anywhere Cloud, die is ontworpen om Spark-workloads te kunnen versnellen zonder PySpark- of SQL-code te hoeven herschrijven. Dit helpt datateams om sneller AI-geschikte data voor te bereiden en tevens de kosten voor cloudinfrastructuur in hybride omgevingen te verlagen.
Datavoorbereiding
Naarmate organisaties hun AI-initiatieven uitbreiden, wordt de snelheid van datavoorbereiding een cruciale uitdaging. Grootschalige Spark-workloads duren vaak uren, wat de analyses en AI-toepassingen vertraagt en de kosten voor cloudcomputing opdrijft. Door GPU-acceleratie in Cloudera Data Engineering te integreren, kunnen organisaties de verwerkingstijden met hun bestaande Spark-toepassingen drastisch verkorten, zonder code of operationele workflows te hoeven wijzigen.
Spark versnellen voor AI-workloads
Apache Spark vormt de basis van veel datapipelines. Dankzij de ingebouwde GPU-acceleratie in Cloudera Data Engineering kunnen organisaties de prestaties verbeteren en tegelijkertijd de security en governance behouden die nodig zijn voor productieworkloads. Door NVIDIA cuDF voor Spark-workloads te benutten, biedt Cloudera tot wel 4x snellere workloadverwerking op NVIDIA GPU’s, in vergelijking met traditionele CPU-infrastructuren. Hierdoor kunnen organisaties hun cycli voor dataverwerking drastisch verkorten.
Cloudera Data Engineering, versneld door NVIDIA CUDA-X-bibliotheken, biedt samengevat:
- GPU-acceleratie zonder code voor Apache Spark 4.1‑workloads
- Snellere ETL en datavoorbereiding voor analyses en AI
- Lagere kosten voor cloudinfrastructuur dankzij kortere rekentijden
- Ingebouwde implementatie zonder handmatige driverconfiguratie
- Bedrijfsbrede security en governance via Cloudera Unified Data Fabric
- Consistente prestaties in publieke cloud‑, private cloud‑, soevereine cloud- en on-premises omgevingen
In tegenstelling tot oplossingen voor GPU-acceleratie die beperkt zijn tot één cloudprovider, breidt Cloudera deze mogelijkheden uit naar hybride omgevingen met behoud van consistente governance en operationele processen. Organisaties kunnen Spark-workloads versnellen, waar hun data zich ook bevindt – on-premises, in de cloud of aan de edge – zonder in te leveren op beveiliging of flexibiliteit.
Snellere datapipelines, lagere infrastructuurkosten
Het snel en tegen redelijke kosten voorbereiden van betrouwbare data is essentieel voor analyses en AI. Data uit Cloudera’s The Great Re-Architecture Survey toont aan dat de overgrote meerderheid (84%) van de respondenten aangeeft dat AI-workloads de infrastructuurkosten laten stijgen. Door de Spark-verwerking te versnellen, kunnen organisaties sneller schone, modelklare data leveren, waardoor de infrastructuurkosten worden verlaagd en de productiviteit van data-engineering‑, AI- en analyseteams wordt verbeterd.
“Voor veel organisaties wordt AI niet beperkt door modellen, maar door hoe snel ze ruwe data kunnen omzetten in betrouwbare, bruikbare inzichten”, aldus Leo Brunnick, Chief Product Officer bij Cloudera. “Het versnellen van Spark binnen Cloudera Data Engineering helpt deze bottleneck weg te nemen, zodat klanten sneller van datavoorbereiding naar analyses en AI kunnen overstappen. Daarbij blijven de governance, beveiliging en operationele consistentie centraal staan in hun strategie.”
“De beste manier om AI-implementaties te versnellen is de weg die aansluit bij de wijze waarop bedrijven vandaag de dag al werken”, zegt Pat Lee, vice president Strategic Enterprise Partnerships bij NVIDIA. “Met de NVIDIA AI-infrastructuur en CUDA-X-bibliotheken die native zijn geïntegreerd in Cloudera Data Engineering, kunnen bedrijven de kosten verlagen en Apache Spark-pipelines versnellen zonder ook maar één regel PySpark- of SQL-code te hoeven aanpassen. Zo vormen ze bedrijfsdata tot een basis voor AI.”
De GPU-acceleratie voor Apache Spark is beschikbaar in Cloudera Data Engineering als onderdeel van Cloudera Anywhere Cloud, zoals aangekondigd tijdens EVOLVE Singapore 2026. Aanvullende demonstraties en technische sessies vinden later dit jaar plaats tijdens NVIDIA GTC Berlijn en Cloudera EVOLVE New York.
