Article

Qu’est-ce que la statistique descriptive ? Analyse avancée 101

Transformer les pétaoctets en performance : le moteur de l’intelligence d’entreprise

La statistique descriptive est la branche de la statistique qui résume et décrit les principales caractéristiques d’un ensemble de données sans en tirer de conclusions au-delà de cela. Elle condense de grands volumes d’enregistrements bruts en mesures de tendance centrale, de dispersion et de forme de distribution — moyenne, médiane, écart-type, percentiles — afin que les équipes puissent voir ce que contient réellement un jeu de données avant de le modéliser.

Il existe trois principaux types de statistiques descriptives : 1. Les mesures de tendance centrale (moyenne, médiane, mode) identifient une valeur représentative. 2. Les mesures de dispersion (plage, variance, écart-type, plage interquartile) décrivent la distance des valeurs depuis ce centre. 3. Les mesures de position et de fréquence (percentiles, quartiles, distributions fréquentielles, asietrie, kurtose) décrivent où se situent les valeurs dans l’ensemble ordonné et la forme de la distribution.

Le but principal des statistiques descriptives est de remplacer l’intuition par des preuves. Résumer les données opérationnelles en bases de référence stables permet aux dirigeants d’évaluer la performance, de détecter les anomalies avant qu’elles ne s’accumulent, et d’auditer la qualité des données avant qu’elles n’atteignent un rapport ou un modèle d’IA. C’est la porte de qualité qui détermine si tout ce qui se passe en aval peut être fiable.

Des exemples de statistiques descriptives dans l’entreprise incluent la valeur moyenne des commandes et le taux de retour dans le commerce de détail ; les taux de réadmission et les délais de traitement dans le secteur de la santé ; les volumes de transactions et les distributions des scores de crédit dans les services financiers ; les tolérances des composants et les délais d’expédition dans la fabrication. Chacune est une mesure sommaire calculée sur une population complète de dossiers plutôt qu’un échantillon.

La statistique descriptive organise et résume les données que vous détenez réellement et ne fait aucune affirmation au-delà de celles-ci. La statistique inférentielle prend un échantillon et applique la théorie des probabilités pour tirer des conclusions sur une population plus large, produisant des estimations avec un niveau de confiance déclaré. Les statistiques descriptives répondent à ce qui s’est passé ; les statistiques inférentielles estiment ce qui est probablement vrai ailleurs.

Teradata Cloud exécute des fonctions de résumé via les capacités analytiques intégrées à la base de données de Teradata Database, effectuant des calculs là où les données résident déjà au lieu de les extraire. Le traitement massivement parallèle calcule des résumés univariés, des distributions de fréquence, des matrices de variance et de corrélation sur des milliards de lignes en utilisant le calcul actif ou le calcul élastique, sans coûts d’évacuation ni surface d’attaque supplémentaire.

Restez au courant

Abonnez-vous au blog de Teradata pour recevoir des informations hebdomadaires



J'accepte que Teradata Corporation, hébergeur de ce site, m'envoie occasionnellement des communications marketing Teradata par e-mail sur lesquelles figurent des informations relatives à ses produits, des analyses de données et des invitations à des événements et webinaires. J'ai pris connaissance du fait que je peux me désabonner à tout moment en suivant le lien de désabonnement présent au bas des e-mails que je reçois.

Votre confidentialité est importante. Vos informations personnelles seront collectées, stockées et traitées conformément à la politique de confidentialité globale de Teradata.