Data quality is emerging as an essential characteristics of all data driven processes. The implications that data quality issues in computing health or vital statistics may have on government intervention policies and distribution of financial resources highlight the relevance of the problem. In this paper, we deal with the issue of underreporting, paying particular attention to its effects on the estimation of the prevalence of a phenomenon. We propose a non parametric compound Poisson model that allows for the estimation of the reporting probabilities. The proposed model will be applied to a data set concerning early neonatal mortality in Minas Gerais, Brazil. Comparisons of the estimates obtained under several alternative models reveal that the proposed approach is accurate and particularly suitable when there is no prior information about the reporting probability. Abstract Negli ultimi anni e durante la pandemia, si ´e confermato il fatto che i dati di qualit`a sono l’elemento fondamentale per tutti i processi di decisione basati sui dati. Infatti, dati collezionati in modo viziato portano a decisioni distorte con conseguenze su azioni politiche e distribuzioni di fondi. Ci´o `e particolarmente importante se si tratta di sanit´a e salute pubblica. In questo lavoro, consideriamo il problema della distorsione dei dati con particolare interesse agli effetti che questo ha sulla stima della prevalenza di un fenomeno. Proponiamo un modello non parametrico di Poisson per la stima delle probabilit´a di tale distorsione. Il modello `e applicato a dati relativi alla mortalit´neonatale in Minas Gerais, Brasile. Le stime verranno confrontante con modelli alternativi e l’applicazione evidenzia che il metodo proposto ´e particolarmente promettente laddove non ci sono informazioni a-priori circa la qualit`a del dato raccolto
A Bayesian non parametric approach for bias correction for underreported data.
S. Arima
;
2022-01-01
Abstract
Data quality is emerging as an essential characteristics of all data driven processes. The implications that data quality issues in computing health or vital statistics may have on government intervention policies and distribution of financial resources highlight the relevance of the problem. In this paper, we deal with the issue of underreporting, paying particular attention to its effects on the estimation of the prevalence of a phenomenon. We propose a non parametric compound Poisson model that allows for the estimation of the reporting probabilities. The proposed model will be applied to a data set concerning early neonatal mortality in Minas Gerais, Brazil. Comparisons of the estimates obtained under several alternative models reveal that the proposed approach is accurate and particularly suitable when there is no prior information about the reporting probability. Abstract Negli ultimi anni e durante la pandemia, si ´e confermato il fatto che i dati di qualit`a sono l’elemento fondamentale per tutti i processi di decisione basati sui dati. Infatti, dati collezionati in modo viziato portano a decisioni distorte con conseguenze su azioni politiche e distribuzioni di fondi. Ci´o `e particolarmente importante se si tratta di sanit´a e salute pubblica. In questo lavoro, consideriamo il problema della distorsione dei dati con particolare interesse agli effetti che questo ha sulla stima della prevalenza di un fenomeno. Proponiamo un modello non parametrico di Poisson per la stima delle probabilit´a di tale distorsione. Il modello `e applicato a dati relativi alla mortalit´neonatale in Minas Gerais, Brasile. Le stime verranno confrontante con modelli alternativi e l’applicazione evidenzia che il metodo proposto ´e particolarmente promettente laddove non ci sono informazioni a-priori circa la qualit`a del dato raccoltoI documenti in IRIS sono protetti da copyright e tutti i diritti sono riservati, salvo diversa indicazione.


