- 모든 컬럼과 모든 컬럼 튜플에 대한 값의 카디널리티(서로 다른 값의 개수)
- 조건부 카디널리티: 다른 컬럼 값에 대한 조건하에서 특정 컬럼의 서로 다른 값 개수
- 정수 절댓값의 확률 분포, 부호 있는 정수의 부호, 부동소수점 수의 지수와 부호
- 문자열 길이의 확률 분포
-
숫자에서 0이 나올 확률, 빈 문자열과 빈 배열,
NULL값의 확률 - LZ77 및 엔트로피 계열 코덱으로 압축했을 때의 데이터 압축률
- 테이블 전체에서 시간값의 연속성(값 차이의 크기), 부동소수점 값의 연속성
-
DateTime값의 날짜 구성 요소 - 문자열 값의 UTF-8 유효성
- 문자열 값이 자연스럽게 보이는 특성
IsMobile 컬럼이 있다면, 변환된 데이터에서도 해당 값은 그대로 유지됩니다.
따라서 사용자는 모바일 트래픽의 정확한 비율을 계산할 수 있습니다.
다른 예를 들어보겠습니다. 테이블에 사용자 이메일처럼 비공개 데이터가 있고, 어떤 개별 이메일 주소도 공개하고 싶지 않다고 가정해 보겠습니다.
테이블이 충분히 크고 서로 다른 이메일을 여러 개 포함하고 있으며, 특정 이메일 하나의 빈도가 다른 값들보다 지나치게 높지 않다면 모든 데이터가 익명화됩니다. 하지만 한 컬럼의 서로 다른 값 개수가 적으면 그중 일부가 재현될 수 있습니다.
이 도구의 동작 알고리즘을 살펴보고 명령줄 매개변수를 세부 조정해야 합니다.
이 도구는 적어도 어느 정도 이상의 데이터 양(최소 수천 개의 행)이 있을 때만 제대로 동작합니다.