私下收集敏感調查回覆 ||數學∩編程

私下收集敏感調查回覆 ||數學∩編程


這是我正在寫的書中的一章草稿, 程式設計師實用數學:生產軟體中的數學之旅

提示: 當調查受訪者不相信他們的回答會被保密時,確定有關敏感問題的總結統計數據。

解決方案:

import random

def respond_privately(true_answer: bool) -> bool:
    '''Respond to a survey with plausible deniability about your answer.'''
    be_honest = random.random() < 0.5
    random_answer = random.random() < 0.5
    return true_answer if be_honest else random_answer

def aggregate_responses(responses: List(bool)) -> Tuple(float, float):
    '''Return the estimated fraction of survey respondents that have a truthful
    Yes answer to the survey question.
    '''
    yes_response_count = sum(responses)
    n = len(responses)
    mean = 2 * yes_response_count / n - 0.5
    # Use n-1 when estimating variance, as per Bessel's correction.
    variance = 3 / (4 * (n - 1))
    return (mean, variance)

20 世紀 60 年代末,美國的大多數墮胎都是非法的。丹尼爾·G·霍維茨 (Daniel G. Horvitz) 是北卡羅來納州三角研究所的統計學家,也是社會科學調查設計的領導者,他的任務是估計北卡羅來納州有多少婦女正在接受非法墮胎。目的是向州和聯邦政策制定者通報有關墮胎的數據數據,其中許多墮胎即使是合法進行的,也沒有報告。

障礙是顯而易見的。正如霍維茲所說,「一個謹慎的女人不會向陌生人透露她參與了可能被起訴的犯罪活動的事實。」(Abernathy70) 這導致調查回應存在強烈偏差。類似的問題也困擾著對各種非法活動的調查,包括藥物濫用和暴力犯罪。由於缺乏對非法行為基本統計數據的認識,導致了各種誤解,例如墮胎並不經常被尋求。

霍維茲與生物統計學家詹姆斯·阿伯內西(James Abernathy)和伯納德·格林伯格(Bernard Greenberg)合作,測試了一種克服這一障礙的新方法,而不會侵犯受訪者的隱私或合理否認非法行為的能力。此方法稱為 隨機反應,是由 Stanley Warner 於 1965 年發明的,就在幾年前。 (Warner65) Warner 的方法與我們在本提示中介紹的方法略有不同,但 Warner 的方法和上面的程式碼範例都使用相同的策略,即在調查中添加隨機化。

如上面代碼所示,機制要求受訪者從擲硬幣開始。如果是正面的話,他們會如實回答敏感問題。如果是反面,他們會拋第二枚硬幣來決定如何回答問題——正面是「是」的答案,反面是「否」的答案。當然,拋硬幣是私人的,由受訪者控制。因此,如果受訪者對這個問題回答“是”,他們可能會合理地聲稱“是”是由硬幣決定的,從而保護了他們的隱私。下圖以圖表的形式描述了這個過程。

私下收集敏感調查回覆 ||數學∩編程

顯示調查受訪者記錄其回應的過程的分支圖。

描述結果的另一種方法是,每個受訪者的答案都是以 1/4 機率翻轉的單一資訊位元。這是隱私/準確性權衡曲線上兩個極端之間的中間位置。第一個極端是「完全誠實」的回應,其中該位永遠不會翻轉並且所有資訊都被保留。第二個極端是以 1/2 的機率翻轉位,這相當於忽略問題並完全隨機選擇答案,從而丟失聚合回應中的所有資訊。從這個角度來看,整體調查回應可以被視為數位訊號,而隱私機制會為該訊號添加雜訊。

仍有待確定如何從這些噪音響應中恢復聚合訊號。換句話說,調查員無法知道任何個人的真實答案,但他們可以透過一些額外的工作,透過修正統計偏差來估計有關基礎人口的統計數據。這是可能的,因為隨機化是很好理解的。 「是」答案的預期分數可以寫為「是」答案的真實分數的函數,因此可以求解真實分數。在這種情況下,如果隨機硬幣是公平的,則該公式如下(其中 $ \mathbf{P}$ 代表「機率」)。

$$\displaystyle \mathbf{P}(\textup{是的答案}) = \frac{1}{2} \mathbf{P}(\textup{真實的是的答案}) + \frac{1}{4}$$

所以我們解 $ \mathbf{P}(\textup{Truthful yes answer})$

$$\displaystyle \mathbf{P}(\textup{真的是答案}) = 2 \mathbf{P}(\textup{是答案}) – \frac{1}{2}$$

我們可以用調查中回答「是」的比例來取代上面的真實機率 $ \mathbf{P}(\textup{是的答案})$,結果是 $ \mathbf{P}(\textup{真實的是的答案})$ 的估計 $ \hat{p}$。此估計是無偏的,但具有額外的方差,超出了由隨機化機制引入的從感興趣的總體中選取有限隨機樣本引起的通常方差。

經過一點努力,我們可以計算出估計的變異數是

$$\displaystyle \textup{Var}(\hat{p}) = \frac{3}{4n}$$

透過切比雪夫不等式(它限制了估計量遠離其期望的可能性),我們可以設計一個置信區間並確定所需的樣本量。具體來說,估計 $ \hat{p}$ 的附加誤差最多為 $ q$,機率最多為 $ \textup{Var}(\hat{p}) / q^2$。這表示對於 $ 1-c$ 的置信度,至少需要 $ n \geq 3 / (4 cq^2)$ 個樣本。例如,要以 90% 的置信度 ($ c=0.1$) 實現誤差 0.01,需要 7,500 個回應。

霍維茲的隨機化機制沒有使用拋硬幣。相反,他們使用了一個帶有紅色或藍色球的不透明盒子,與測量員在同一房間的受訪者會搖晃該盒子,並透過背對測量員的小窗口私下顯示隨機顏色。統計原理是一樣的。霍維茲和他的同事對這些女性進行了調查,以了解她們對這項機制隱私保護的看法。當被問及他們的朋友是否會誠實地直接回答有關墮胎的問題時,超過 80% 的人要么認為他們的朋友會撒謊,要么不確定。 (註腳:調查方法中詢問某人是否會不誠實時的一個常見技巧是詢問他們是否會不誠實) 朋友們 會是不誠實的。這往往會引發更多的誠實,因為人們不太可能對他人的道德操守抱持錯誤的看法,而且人們也沒有意識到他們對朋友的看法與他們自己的個人行為和態度有關。換句話說,說謊者不承認說謊,但他們認為說謊比實際情況要普遍得多。 ) 但 60% 的人確信隨機化中沒有任何技巧,而 20% 的人不確定,20% 的人認為其中有技巧。這表明許多人相信霍維茨的隨機化機制提供了誠實回答所需的安全保證。

霍維茲的調查無論是在隨機反應方法還是在衡量墮胎率方面都取得了巨大成功。 (Abernathy70) 他們估計墮胎率約為每 100 次受孕就有 22 例,其中存在明顯的種族偏見——少數族裔接受墮胎的可能性是白人的兩倍。將他們的發現與 1955 年之前的一項全國性研究(所謂的 Arden House 估計)進行比較,該研究得出的每年墮胎數量在 20 萬到 120 萬起之間,Horvitz 的團隊更準確地估計,1955 年美國有 699,000 起墮胎,報告的標準偏差約為 6,000 百分之一。他們的研究年份 1967 年估計為 829,000 人。

由於公眾對該主題的興趣高漲,他們的估計在隨後的一系列墮胎法和法庭案件中被廣泛引用。例如,1970年加州最高法院對此案的意見中引用了這一點 巴拉德訴安德森案,其中涉及未成年人是否需要父母同意才能接受合法墮胎。 (Ballard71,Roemer71)它也被引用於 法庭之友 1971 年提交給美國最高法院的案情摘要 羅伊訴韋德案,這個著名的案例使美國大多數墮胎非法的法律無效。一份這樣的簡報是由全國婦女組織等該國主要婦女權利組織共同提交的。這段經文引用了霍維茲的話,寫道:(Womens71)

雖然執法的現實、墮胎法帶來的社會和公共衛生問題僅在不超過過去十年的時間內被公開討論(…),但有一個事實似乎不可否認,儘管無法透過統計數據證實。美國每年至少有一百萬例非法墮胎。事實上,研究表明,如果當地法律仍然有資格要求,那麼法律的放鬆並沒有在很大程度上減少婦女非法墮胎的數量。

目前還不清楚作者是如何得到這個 100 萬的數字(Horvitz 的估計比 1967 年減少了 20%),也不清楚他們所說的「無法驗證的統計數據」是什麼意思。這可能是對隨機反應技術的誤解。無論如何,隨機反應在為政治辯論提供基礎方面發揮了至關重要的作用。

儘管霍維茨取得了成功,並且對犯罪、藥物和其他敏感主題進行了數十年的額外研究,但隨機反應機制的應用卻很差。在某些情況下,所需的隨機化非常複雜,例如需要連續隨機數時。在這些情況下,手動隨機化機制過於複雜,受訪者無法準確使用。嘗試使用軟體輔助設備會有所幫助,但也會引起受訪者的不信任。請參閱 (Rueda16) 以了解這些陷阱的更多討論以及存在哪些軟體包可協助使用隨機回應。請參閱 (Fox16),以了解 1970 年至 2010 年間所使用的各種方法之間的統計差異分析。

在其他情況下,隨機反應的類似物可能不會產生預期的效果。 1950年代,猶他州採用行刑隊死刑作為死刑。為了避免槍手感到內疚,五名神槍手中的一名被隨機給了一個空白,這為他提供了一些合理的否認,讓他知道自己已經發出了致命一槍。然而,這種方法在兩方面失敗了。首先,一旦射擊,射手可以根據後座力判斷子彈是否是真的。其次,20% 的空彈幾率並不足以阻止有罪的射手故意失手。 1951 年處決埃利西奧·馬雷斯時,四顆真正的子彈全部擊中了死刑犯的心臟,擊中了他的胸部、腹部和臀部。他死了,但既不是無痛的,也不是瞬間的。

人們可以從失敗的執行中學到許多教訓,其中之一就是隨機化機制必須考慮參與者的心理以及失敗結果的嚴重性。

參考

@book{Fox16,
  title = {{Randomized Response and Related Methods: Surveying Sensitive Data}},
  author = {James Alan Fox},
  edition = {2nd},
  year = {2016},
  doi = {10.4135/9781506300122},
}

@article{Abernathy70,
  author = {Abernathy, James R. and Greenberg, Bernard G. and Horvitz, Daniel G.
            },
  title = {{Estimates of induced abortion in urban North Carolina}},
  journal = {Demography},
  volume = {7},
  number = {1},
  pages = {19-29},
  year = {1970},
  month = {02},
  issn = {0070-3370},
  doi = {10.2307/2060019},
  url = {https://doi.org/10.2307/2060019},
}

@article{Warner65,
  author = {Stanley L. Warner},
  journal = {Journal of the American Statistical Association},
  number = {309},
  pages = {63--69},
  publisher = {{American Statistical Association, Taylor \& Francis, Ltd.}},
  title = {Randomized Response: A Survey Technique for Eliminating Evasive
           Answer Bias},
  volume = {60},
  year = {1965},
}

@article{Ballard71,
  title = {{Ballard v. Anderson}},
  journal = {California Supreme Court L.A. 29834},
  year = {1971},
  url = {https://caselaw.findlaw.com/ca-supreme-court/1826726.html},
}

@misc{Womens71,
  title = {{Motion for Leave to File Brief Amici Curiae on Behalf of Women’s
           Organizations and Named Women in Support of Appellants in Each Case,
           and Brief Amici Curiae.}},
  booktitle = {{Appellate Briefs for the case of Roe v. Wade}},
  number = {WL 128048},
  year = {1971},
  publisher = {Supreme Court of the United States},
}

@article{Roemer71,
  author = {R. Roemer},
  journal = {Am J Public Health},
  pages = {500--509},
  title = {Abortion law reform and repeal: legislative and judicial developments
           },
  volume = {61},
  number = {3},
  year = {1971},
}

@incollection{Rueda16,
  title = {Chapter 10 - Software for Randomized Response Techniques},
  editor = {Arijit Chaudhuri and Tasos C. Christofides and C.R. Rao},
  series = {Handbook of Statistics},
  publisher = {Elsevier},
  volume = {34},
  pages = {155-167},
  year = {2016},
  booktitle = {Data Gathering, Analysis and Protection of Privacy Through
               Randomized Response Techniques: Qualitative and Quantitative Human
               Traits},
  doi = {https://doi.org/10.1016/bs.host.2016.01.009},
  author = {M. Rueda and B. Cobo and A. Arcos and R. Arnab},
}




Source link

Postagens Similares

  • অ্যাপল দুর্ঘটনাক্রমে ‘ম্যাকবুক নিও’ ফাঁস করেছে

    অ্যাপল তার গুজব কম দামের ম্যাকবুক মডেলের নাম অকালে প্রকাশ করেছে বলে মনে হচ্ছে, যা এই বুধবার ঘোষণা করা হবে বলে আশা করা হচ্ছে। অ্যাপলের ওয়েবসাইটে “ম্যাকবুক নিও” (মডেল A3404) এর জন্য একটি নিয়ন্ত্রক নথি হাজির হয়েছে৷ দুর্ভাগ্যবশত, এখনও কোন বিস্তারিত বা ছবি উপলব্ধ নেই. যদিও পিডিএফ ফাইলটিতে “ম্যাকবুক নিও” নাম নেই, এটি সংক্ষিপ্তভাবে EU…

  • Covid-19 预估更新 2020 年 8 月 23 日 – CDC 预测中包含预估

    估计感染死亡人数和死亡率 如果我们知道感染人数,并且知道感染死亡率(IFR),那么从感染人数预测死亡人数就会非常简单。然而,在整个大流行期间,我们一直在估计感染人数和 IFR,但在许多情况下做得很糟糕。各州的数字似乎也有很大差异。 IFR 约为 0.5% 我在 Medium 上的一篇文章中解释了我是如何得出这个结论的。超级快速的解释是,这个数字至少可以根据纽约州 4 月下旬进行的抗体测试,结合纽约州因 Covid-19 死亡的信息来计算出来。一旦我们知道了大概的 IFR,我们就可以引导根据死亡人数估计感染人数的方法,这有助于我们将阳性检测与感染之间的关系归零。 检测呈阳性并不等于感染 阳性检测和感染不是一回事。阳性检测是感染数量的有用指标,但它们并不相同。这个简单的概念似乎阻碍了许多所做的估计。 随着时间的推移,阳性检测与感染之间的关系一直在发生变化。在大流行初期,感染与阳性检测的比例似乎在 10:1 到 20:1 之间。现在这个比例似乎在 3:1 到 5:1 的范围内。 单纯病死率 我的估计方法的基石是跟踪 Naive CFR 的变化,作为感染与阳性检测比率的指标。 单纯病死率 计算方法是今天的死亡人数除以 14 天前的阳性检测人数。由于死亡滞后于阳性检测,因此阳性检测是未来死亡的有用先行指标。 我仍然对许多广为人知的短期死亡率估计的巨大错误感到惊讶。如果您仅采用过去 7 天的平均初始病死率 (naive CFR),并根据 14 天滞后的阳性检测结果,用它来估计未来 14 天的死亡人数,那么您可以对未来 14 天的死亡人数做出比已发布的绝大多数估计更准确的估计。 对于截至 8 月 1 日左右的估计,我使用了阳性测试百分比(阳性率)和幼稚 CFR 之间的强相关性。因为我们在报告测试数据时知道测试阳性率,所以它作为死亡率的领先指标非常有用,而且我使用最近的阳性率以及阳性测试的数量来估计近期未来的死亡率。 但自大流行开始以来,单纯病死率已大幅下降。一开始超过50%,8月初一度跌至1.4%。随着 Naive CFR…

  • Instalador CLI – AuthKit – Documentos de WorkOS

    Agregue AuthKit a su proyecto en minutos con un solo comando. WorkOS CLI utiliza IA para detectar su marco, instalar el SDK correcto y escribir el código de integración automáticamente. Copiar página Introducción Ejecute un comando, la CLI se encarga del resto: detección del marco, instalación del SDK, creación de rutas, configuración del entorno y…

  • Video: el programa de entrevistas nocturno de Jimmy Kimmel en el aire

    El ABC de Disney está tomando el programa de entrevistas nocturno de Jimmy Kimmel en el aire indefinidamente en medio de una controversia sobre sus recientes comentarios sobre el presunto asesino de Charlie Kirk. El presidente de Trump de la Comisión Federal de Comunicaciones, alineado el miércoles por “tomar medidas” contra Disney y ABC sobre…

  • Відповідь на питання про упряж

    Мартін Касадо опублікував щось про джгути штучного інтелекту, які показують, де зараз застрягли багато розумних людей. Щодо упряжів я вагаюся між трьома переконаннями: чим менше упряжів, тим краще. Моделі – це магія. Післятренування моделі та упряжі значно кращі, а постачальники моделей виграють. Ремені мають реальну незалежну від моделі цінність. Я не знаю, що правильно. Мартін…

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *