Présentation du service

Perforce Software a introduit Delphix Synthetic Data, une plateforme qui exploite le machine learning pour générer des jeux de données synthétiques destinés aux tests d’applications. Le produit se veut une alternative aux jeux de données de production, souvent sensibles, en proposant une génération automatisée à partir de multiples sources de données.

Architecture et mécanismes d’apprentissage

Le cœur du service repose sur des algorithmes d’apprentissage supervisé capables d’identifier les structures de données, leurs relations et le contexte métier à travers les bases exploitées. Cette analyse multi‑source alimente un modèle qui crée des enregistrements respectant les contraintes de clé étrangère et les distributions statistiques observées. Le modèle est exposé via trois points d’accès : une interface graphique (GUI), des API REST et le Model Context Protocol (MCP), permettant ainsi l’intégration directe dans des pipelines CI/CD ou des agents d’IA.

Impacts sur les flux DevOps

Selon le responsable produit Mayank Ahluwalia, la plateforme vise à supprimer le besoin d’accès aux données de production pour les équipes de développement, un goulot d’étranglement fréquent dans les environnements de test. En pratique, les développeurs peuvent choisir un mélange de données synthétiques et de données masquées, améliorant la référentialité et la réalisme des scénarios de test. Une enquête interne de Perforce indique toutefois que seulement 34 % des répondants estiment que les données synthétiques offrent une intégrité référentielle et 36 % jugent leur réalisme satisfaisant, soulignant les limites actuelles de la technologie.

Analyse des contraintes et perspectives

L’utilisation de données synthétiques soulève deux enjeux majeurs. Premièrement, la qualité du modèle dépend de la richesse des jeux de données d’entraînement ; des bases hétérogènes ou mal documentées peuvent conduire à des violations de contraintes ou à des distributions biaisées. Deuxièmement, le chargement des jeux synthétiques dans un large language model (LLM) pour la génération de tests introduit un coût supplémentaire de calcul, que les équipes doivent maîtriser. Malgré ces limites, la capacité à automatiser la création de jeux de données adaptés à des scénarios spécifiques représente un pas important vers la réduction des risques de fuite de données sensibles et l’accélération des cycles de test dans un contexte où les agents d’IA génèrent de plus en plus de code.