Contexte et enjeux
Apache Iceberg stocke les versions de table sous forme de snapshots qui ne sont que des pointeurs vers des fichiers de métadonnées. Cette approche réduit le coût d’écriture mais rend les tables vulnérables : la suppression accidentelle, un ransomware ou un agent d’IA mal configuré peuvent éliminer l’historique des snapshots, laissant les fichiers de données orphelins. Dans ce scénario, la restauration des fichiers bruts ne recrée pas l’entrée du catalogue, obligeant les équipes à reconstruire manuellement la structure avant toute requête.
Rubrik identifie ce « gap » comme une lacune des outils natifs d’AWS et propose Rubrik Apache Iceberg Protection, une couche de sauvegarde et de récupération qui cible spécifiquement les tables Iceberg hébergées sur Amazon Web Services.
Fonctionnement de Rubrik Apache Iceberg Protection
Le service copie à la fois les fichiers de données (généralement du Parquet) et les métadonnées du catalogue. Lors d’une restauration, Rubrik ré‑enregistre la table dans le AWS Glue Data Catalog, ce qui rend immédiatement la table interrogeable via Amazon Athena, Apache Spark ou Trino sans intervention manuelle. Cette double copie contraste avec une restauration « fichiers‑seuls » qui ne produit qu’un jeu de Parquet nécessitant une réparation manuelle du catalogue.
Les sauvegardes couvrent les tables référencées dans le Glue Data Catalog ainsi que les tables stockées directement dans Amazon S3. Rubrik garantit l’immutabilité des sauvegardes, que le client les conserve dans son propre compte AWS ou dans le Rubrik Cloud Vault, une zone air‑gappée.
Gestion des sauvegardes et restauration
Après un copie complète initiale, le moteur n’enregistre que les snapshots compactés les plus récents. Cette stratégie limite la durée des fenêtres de sauvegarde, même lorsque les tables atteignent l’échelle du pétaoctet, car seules les modifications incrémentales sont traitées. Le client choisit la classe de stockage S3 (Standard, Infrequent Access, Glacier, etc.) ; les données rarement consultées peuvent ainsi être placées dans une classe à moindre coût.
Rubrik propose également des sauvegardes on‑demand avant des opérations à risque, comme un changement de schéma ou un gros batch d’écriture. Les restaurations peuvent être dirigées vers une branche Iceberg isolée, permettant aux équipes de valider le schéma et le contenu avant de promouvoir la table en production.
Implications et limites
Le service se positionne comme la seule offre Iceberg‑aware avec une option de stockage « in‑account », ce qui simplifie la conformité aux politiques de souveraineté des données. Cependant, la protection dépend de la capacité de Rubrik à capturer les snapshots compactés ; des configurations Iceberg très fragmentées pourraient augmenter la taille des sauvegardes incrémentielles. De plus, la disponibilité du Cloud Vault introduit une dépendance supplémentaire au réseau entre le compte client et l’infrastructure Rubrik.
Rubrik Apache Iceberg Protection sera disponible en version générale d’ici la fin du mois, s’inscrivant dans la stratégie plus large de Rubrik d’étendre la protection aux charges de travail cloud‑native, notamment les bases de données SQL sur Google Cloud et les agents d’IA d’entreprise.