- cardinalidades de valores (número de valores distintos) para cada columna y cada tupla de columnas;
- cardinalidades condicionales: número de valores distintos de una columna en función del valor de otra columna;
- distribuciones de probabilidad del valor absoluto de los enteros; del signo de los enteros con signo; y del exponente y el signo en los flotantes;
- distribuciones de probabilidad de la longitud de las cadenas;
-
probabilidad de valores numéricos cero; cadenas y arrays vacíos; valores
NULL; - ratio de compresión de los datos al comprimirse con LZ77 y con la familia de códec entropy;
- continuidad (magnitud de la diferencia) de los valores temporales en toda la tabla; continuidad de los valores de coma flotante;
-
componente de fecha de los valores
DateTime; - validez UTF-8 de los valores de cadena;
- los valores de cadena tienen un aspecto natural.
IsMobile en su tabla con valores 0 y 1, en los datos transformados tendrá el mismo valor.
Así, el usuario podrá calcular la ratio exacta del tráfico móvil.
Veamos otro ejemplo. Si tiene datos privados en su tabla, como el correo electrónico de un usuario, y no quiere publicar ninguna dirección de correo concreta.
Si su tabla es lo bastante grande y contiene varios correos electrónicos distintos, y ninguno de ellos tiene una frecuencia mucho mayor que la de los demás, anonimizará todos los datos. Pero si tiene un número reducido de valores distintos en una columna, puede reproducir algunos de ellos.
Debería revisar cómo funciona el algoritmo de esta herramienta y ajustar con precisión sus parámetros de línea de comandos.
Esta herramienta solo funciona bien con al menos una cantidad moderada de datos (como mínimo, miles de filas).