Article

Qu’est-ce que l’ETL (extraire, transformer, charger) ?

Découvrez ce que signifie extraire, transformer et charger, comment fonctionne le processus ETL, comment l’ETL se compare à l’ELT, et pourquoi il est important dans le data warehousing.

Oui — l’ETL reste au cœur du travail moderne sur les données, bien que son rôle ait évolué. Bien que l’ELT soit devenu le modèle par défaut pour les charges de travail d’analytique et de data science natives du cloud, l’ETL reste le bon choix pour les charges de travail réglementées, gouvernées et sur site où un contrôle strict de la qualité des données avant le chargement est nécessaire. De nombreuses entreprises exécutent les deux modèles côte à côte, utilisant l’ETL pour les pipelines financiers sensibles ou critiques pour la conformité et l’ELT pour des analyses flexibles à haut volume et des cas d’utilisation de l’IA.

Un pipeline ETL est l’ensemble des processus et outils connectés qui transplacent les données des systèmes sources à travers les étapes d’extraction, de transformation et de chargement vers un système cible. Un pipeline ETL unique peut gérer un flux de données spécifique — par exemple, extraire des registres de ventes quotidiens d’un système de point de vente, les nettoyer et les charger dans un entrepôt de reporting commercial — tandis qu’une grande entreprise gère généralement des dizaines voire des centaines de pipelines à travers différents domaines de données.

L’intégration des données est la catégorie plus large — tout processus qui combine des données provenant de plusieurs sources en une vue unifiée. L’ETL est une approche spécifique de l’intégration des données, caractérisée par la séquence d’extraction, de transformation et de charge en trois étapes. D’autres approches d’intégration des données incluent l’ELT, la virtualisation des données, la capture de données de modification (CDC) et la réplication des données. L’ETL est le plus établi d’entre eux et est particulièrement adapté aux charges d’analyse orientées batch où les données transformées et sélectionnées sont la cible.

Un développeur ETL conçoit, construit et maintient les pipelines qui transmettent les données des systèmes sources vers les systèmes cibles. Le poste consiste à écrire de la logique d’extraction, à définir des règles de transformation, à optimiser les performances, à surveiller l’état de la conduite et à dépanner les défaillances. Les développeurs ETL travaillent généralement avec des outils comme Informatica, Talend, SSIS, dbt ou des services cloud-natives, et collaborent étroitement avec les ingénieurs de données, les analystes de données et les parties prenantes métier pour garantir que les pipelines livrent des données précises dans les délais.

Restez au courant

Abonnez-vous au blog de Teradata pour recevoir des informations hebdomadaires



J'accepte que Teradata Corporation, hébergeur de ce site, m'envoie occasionnellement des communications marketing Teradata par e-mail sur lesquelles figurent des informations relatives à ses produits, des analyses de données et des invitations à des événements et webinaires. J'ai pris connaissance du fait que je peux me désabonner à tout moment en suivant le lien de désabonnement présent au bas des e-mails que je reçois.

Votre confidentialité est importante. Vos informations personnelles seront collectées, stockées et traitées conformément à la politique de confidentialité globale de Teradata.