Benford Lab 班佛定律對照實驗台

不只問「這組資料正不正常」,更問「A 和 B 為什麼不一樣、差在哪個數字、有沒有替代解釋」。上傳一份 CSV、選一個分組欄,就得到對照組。首位、第二位、前兩位、尾兩位四種檢定,附 95% 上下界、Z 值、MAD、卡方 p 值、數量級分層與時間趨勢,並自動寫出診斷。資料只在你的瀏覽器裡計算,不會上傳。

01資料

三種方式建立「分析組」:上傳表格並選欄位自動分組、直接貼數字、或點範例。可以同時有多組,互相對照。

上傳檔案

拖曳檔案到這裡,或點此選擇
支援 .csv / .txt / .xlsx / .xls。有表頭的表格會進入欄位選擇;純數字檔直接成為一組。

貼上數字

範例資料

模擬對照組

用產生的資料當正/負對照。對數均勻=自然型(符合);均勻亂數=不符合;績效灌水=四成數值被推到剛跨過 10、100、1,000 的位置。

目前的分析組

07導覽

原理、判讀與限制。

班佛定律是什麼

自然生成、跨越多個數量級的數值,首位數字不是均勻分布,而是:

P(d) = log₁₀(1 + 1/d),d = 1…9

1 約佔 30.1%、2 佔 17.6%、…、9 只佔 4.6%。直覺:從 1 長到 2 要翻倍,從 9 長到 10 只要 +11%,所以數值「停留」在 1 開頭的時間最久。第二位數與前兩位數的期望值由同一條公式推得;尾兩位數則期望均勻(各 1%)。

1881 Newcomb 發現對數表前幾頁磨損較重;1938 Benford 用兩萬多筆資料驗證;2002 Znetix 案首次大規模用於司法。

統計量怎麼看

95% 上下界pexp ± 1.96 √(pexp(1−pexp)/n)。落在外面=該數字顯著偏離(|Z| > 1.96)。n 越大區間越窄。
Z 值(pobs − pexp) / 標準誤。大樣本時幾乎每個數字都會顯著,這是 Z 的性質,不是資料異常。
MAD各數字 |pobs − pexp| 的平均,與 n 無關,是 Nigrini 建議的主要判定依據。首位:<0.006 高度符合、<0.012 可接受、<0.015 邊緣;第二位:0.008/0.010/0.012;前兩位:0.0012/0.0018/0.0022。
卡方 p 值整體是否偏離的檢定。p 很小=整體顯著偏離;同樣受大樣本影響。

看到這個型態,該怎麼想

1、2 偏多,4–9 偏少數值集中在剛跨過 10、100、1,000 的位置 → 目標值/關卡型態。用「04 分層」確認是否每個數量級都如此。
1 偏少,5–7 偏多人工填寫偏好中間值。
各數字幾乎一樣多均勻亂數、流水號、編碼型資料。
1 極高但只跨 1–2 個數量級上限效應:數值被範圍框住(例如每個里的得票被里的人口限制),不是人為。
第二位 0 多 9 少數字被推過整數關卡(拉高)。
第二位 0 少 9 多數字停在關卡之下(壓低)。
第二位 0 與 5 偏高四捨五入或以 5 為單位填報。
尾兩位 00、50 尖峰整數偏好,人填數字的痕跡。

什麼資料適合、不適合

✅ 適合交易金額、發票、營收、人口、GDP、得票數、查獲數量、件數統計——自然生成、無固定上下限、跨多個數量級,建議 ≥ 1,000 筆。
❌ 不適合身分證號、電話、流水號(編碼);身高、體重、年齡、百分比(範圍窄);真隨機亂數;心理定價(.99);被固定額度框住的數字。
⚠ 對照組最有價值的用法不是單組檢驗,而是對照:同一指標的不同來源(機器 vs 人填)、不同時期(事件前 vs 後)、不同類別。生成機制不同,班佛檢驗才照得出差異。

經典案例

Enron2000 年財報數字偏離班佛分布,成為史上最大企業舞弊案的線索之一。
瑞幸咖啡2020 年財報首位數分布與造假型態吻合,隨後爆出大規模造假。
伊朗 2009 大選候選人得票數的數字 7 顯著偏多(p < 0.15%),且 50 個選區投票率超過 100%。
CPBL 假球年代1997–2009 年得分、安打、失分不符合,同期投手用球數符合——同一場比賽,被操作的與沒被操作的指標分得開。
毒品查緝查緝重量符合,每週上報人數不符合——秤出來的數字與人填的數字。

重要提醒

班佛定律是異常篩檢工具,不是舞弊證明。偏離可能來自舞弊,也可能來自資料特性、業務規則或制度變動。正確流程:確認資料適合 → 找出偏離的數字與區間 → 分層排除替代解釋 → 回查原始憑證與業務背景 → 才寫進查核報告。