- les cardinalités des valeurs (nombre de valeurs distinctes) pour chaque colonne et chaque tuple de colonnes ;
- les cardinalités conditionnelles : le nombre de valeurs distinctes d’une colonne sous condition sur la valeur d’une autre colonne ;
- les distributions de probabilité de la valeur absolue des entiers ; du signe des entiers signés ; de l’exposant et du signe des flottants ;
- les distributions de probabilité de la longueur des chaînes ;
-
la probabilité que les nombres valent zéro, ainsi que celle des chaînes et des tableaux vides, et des
NULL; - le ratio de compression des données lorsqu’elles sont compressées avec LZ77 et la famille des codecs entropiques ;
- la continuité (ampleur des écarts) des valeurs temporelles dans la table ; la continuité des valeurs à virgule flottante ;
-
la composante date des valeurs
DateTime; - la validité UTF-8 des valeurs de chaîne ;
- les valeurs de chaîne paraissent naturelles.
IsMobile dans votre table avec les valeurs 0 et 1, elle aura la même valeur dans les données transformées.
Ainsi, l’utilisateur pourra calculer la proportion exacte du trafic mobile.
Prenons un autre exemple. Si vous avez dans votre table des données privées, comme l’adresse e-mail d’un utilisateur, et que vous ne voulez publier aucune adresse e-mail.
Si votre table est suffisamment grande, contient plusieurs e-mails différents, et qu’aucun e-mail n’a une fréquence bien plus élevée que les autres, l’outil anonymisera toutes les données. Mais si vous avez un petit nombre de valeurs différentes dans une colonne, il peut en reproduire certaines.
Vous devriez examiner le fonctionnement de l’algorithme de cet outil et ajuster finement ses paramètres de ligne de commande.
Cet outil ne fonctionne correctement qu’avec au moins une quantité modérée de données (au moins des milliers de lignes).