The University of Southampton
University of Southampton Institutional Repository

Statistical disclosure control methods for census frequency tables

Statistical disclosure control methods for census frequency tables
Statistical disclosure control methods for census frequency tables
This paper provides a review of common statistical disclosure control (SDC) methods implemented at statistical agencies for standard tabular outputs containing whole population counts from a census (either enumerated or based on a register). These methods include record swapping on the microdata prior to its tabulation and rounding of entries in the tables after they are produced. The approach for assessing SDC methods is based on a disclosure risk–data utility framework and the need to find a balance between managing disclosure risk while maximizing the amount of information that can be released to users and ensuring high quality outputs. To carry out the analysis, quantitative measures of disclosure risk and data utility are defined and methods compared. Conclusions from the analysis show that record swapping as a sole SDC method leaves high probabilities of disclosure risk. Targeted record swapping lowers the disclosure risk, but there is more distortion of distributions. Small cell adjustments (rounding) give protection to census tables by eliminating small cells but only one set of variables and geographies can be disseminated in order to avoid disclosure by differencing nested tables. Full random rounding offers more protection against disclosure by differencing, but margins are typically rounded separately from the internal cells and tables are not additive. Rounding procedures protect against the perception of disclosure risk compared to record swapping since no small cells appear in the tables. Combining rounding with record swapping raises the level of protection but increases the loss of utility to census tabular outputs. For some statistical analysis, the combination of record swapping and rounding balances to some degree opposing effects that the methods have on the utility of the tables.
Résumé
Cet article propose une revue des méthodes de contrôle de la divulgation statistique (CDS) mises en place par les agences statistiques lors de production de tableaux statistiques dérivés de données des recensements. Ceci inclue des techniques de pré-traitements du type hybridation—échange partiel d'information entre individus—ou des méthodes d'arrondis effectuées après la production des tableaux. L'approche des méthodes CDS présentée insiste sur la nécessité de trouver un équilibre entre la gestion du risque de divulgation tout en maximisant la quantité d'information qui peut être fournie aux utilisateurs. Des mesures quantitatives de risques et de degré d'utilité sont proposés et comparées. Les conclusions des analyses montrent que la technique d'hybridation peut conduire à des cas de divulgations pour les tableaux présentant des cellules à faibles effectifs. La même technique utilisée sur des individus "ciblés" diminue le risque mais au détriment des distributions statistiques. La méthode de l'arrondi protége les tableaux en éliminant les cellules à faibles effectifs mais un seul type de variables et géographie doivent être publiés pour éviter le risque de divulgation par différenciation quand les tableaux sont liés les uns aux autres. L'arrondi aléatoire donne plus de protection contre le risque par différenciation mais certaines cellules peuvent être reconstruites par comparaison avec les marges. Les techniques d'arrondis protègent contre la perception du risque mieux que l'hybridation. Combiner hybridation et arrondi augmente le niveau de protection mais augmente la perte de qualité quant à l'utilité des sorties statistiques. Dans certaines analyses statistiques, les deux approches utilisées simultanément peuvent cependant produire un effet équilibré.
0306-7734
199-217
Shlomo, Natalie
e749febc-b7b9-4017-be48-96d59dd03215
Shlomo, Natalie
e749febc-b7b9-4017-be48-96d59dd03215

Shlomo, Natalie (2007) Statistical disclosure control methods for census frequency tables. International Statistical Review, 75 (2), 199-217. (doi:10.1111/j.1751-5823.2007.00010.x).

Record type: Article

Abstract

This paper provides a review of common statistical disclosure control (SDC) methods implemented at statistical agencies for standard tabular outputs containing whole population counts from a census (either enumerated or based on a register). These methods include record swapping on the microdata prior to its tabulation and rounding of entries in the tables after they are produced. The approach for assessing SDC methods is based on a disclosure risk–data utility framework and the need to find a balance between managing disclosure risk while maximizing the amount of information that can be released to users and ensuring high quality outputs. To carry out the analysis, quantitative measures of disclosure risk and data utility are defined and methods compared. Conclusions from the analysis show that record swapping as a sole SDC method leaves high probabilities of disclosure risk. Targeted record swapping lowers the disclosure risk, but there is more distortion of distributions. Small cell adjustments (rounding) give protection to census tables by eliminating small cells but only one set of variables and geographies can be disseminated in order to avoid disclosure by differencing nested tables. Full random rounding offers more protection against disclosure by differencing, but margins are typically rounded separately from the internal cells and tables are not additive. Rounding procedures protect against the perception of disclosure risk compared to record swapping since no small cells appear in the tables. Combining rounding with record swapping raises the level of protection but increases the loss of utility to census tabular outputs. For some statistical analysis, the combination of record swapping and rounding balances to some degree opposing effects that the methods have on the utility of the tables.
Résumé
Cet article propose une revue des méthodes de contrôle de la divulgation statistique (CDS) mises en place par les agences statistiques lors de production de tableaux statistiques dérivés de données des recensements. Ceci inclue des techniques de pré-traitements du type hybridation—échange partiel d'information entre individus—ou des méthodes d'arrondis effectuées après la production des tableaux. L'approche des méthodes CDS présentée insiste sur la nécessité de trouver un équilibre entre la gestion du risque de divulgation tout en maximisant la quantité d'information qui peut être fournie aux utilisateurs. Des mesures quantitatives de risques et de degré d'utilité sont proposés et comparées. Les conclusions des analyses montrent que la technique d'hybridation peut conduire à des cas de divulgations pour les tableaux présentant des cellules à faibles effectifs. La même technique utilisée sur des individus "ciblés" diminue le risque mais au détriment des distributions statistiques. La méthode de l'arrondi protége les tableaux en éliminant les cellules à faibles effectifs mais un seul type de variables et géographie doivent être publiés pour éviter le risque de divulgation par différenciation quand les tableaux sont liés les uns aux autres. L'arrondi aléatoire donne plus de protection contre le risque par différenciation mais certaines cellules peuvent être reconstruites par comparaison avec les marges. Les techniques d'arrondis protègent contre la perception du risque mieux que l'hybridation. Combiner hybridation et arrondi augmente le niveau de protection mais augmente la perte de qualité quant à l'utilité des sorties statistiques. Dans certaines analyses statistiques, les deux approches utilisées simultanément peuvent cependant produire un effet équilibré.

This record has no associated files available for download.

More information

Published date: August 2007

Identifiers

Local EPrints ID: 51965
URI: http://eprints.soton.ac.uk/id/eprint/51965
ISSN: 0306-7734
PURE UUID: 51e28425-0bc8-4433-a30a-0150af3e3f75

Catalogue record

Date deposited: 13 Jun 2008
Last modified: 15 Mar 2024 10:19

Export record

Altmetrics

Contributors

Author: Natalie Shlomo

Download statistics

Downloads from ePrints over the past year. Other digital versions may also be available to download e.g. from the publisher's website.

View more statistics

Atom RSS 1.0 RSS 2.0

Contact ePrints Soton: eprints@soton.ac.uk

ePrints Soton supports OAI 2.0 with a base URL of http://eprints.soton.ac.uk/cgi/oai2

This repository has been built using EPrints software, developed at the University of Southampton, but available to everyone to use.

We use cookies to ensure that we give you the best experience on our website. If you continue without changing your settings, we will assume that you are happy to receive cookies on the University of Southampton website.

×