- кардинальностей значений (числа различных значений) для каждого столбца и каждого кортежа столбцов;
- условных кардинальностей: числа различных значений одного столбца при условии на значение другого столбца;
- распределений вероятностей абсолютных значений целых чисел; знака целых чисел со знаком; экспоненты и знака чисел с плавающей точкой;
- распределений вероятностей длины строк;
-
вероятности нулевых значений чисел; пустых строк и массивов;
NULL; - коэффициента сжатия данных при сжатии с помощью LZ77 и кодеков семейства entropy;
- непрерывности (величины разности) значений времени по таблице; непрерывности значений с плавающей точкой;
-
компонента даты значений
DateTime; - корректности UTF-8 в строковых значениях;
- естественного вида строковых значений.
IsMobile со значениями 0 и 1, то в преобразованных данных он будет иметь те же значения.
Таким образом, пользователь сможет точно подсчитать долю мобильного трафика.
Рассмотрим еще один пример. Если в вашей таблице есть приватные данные, например email пользователя, и вы не хотите публиковать ни один конкретный адрес электронной почты.
Если таблица достаточно велика, содержит много разных email и ни один из них не встречается значительно чаще остальных, инструмент анонимизирует все данные. Но если в столбце небольшое число разных значений, он может воспроизвести некоторые из них.
Вам следует изучить алгоритм работы этого инструмента и точно настроить его параметры командной строки.
Этот инструмент хорошо работает только при хотя бы умеренном объеме данных (не менее тысяч строк).