01資料
三種方式建立「分析組」:上傳表格並選欄位自動分組、直接貼數字、或點範例。可以同時有多組,互相對照。
上傳檔案
支援 .csv / .txt / .xlsx / .xls。有表頭的表格會進入欄位選擇;純數字檔直接成為一組。
貼上數字
欄位選擇
範例資料
模擬對照組
用產生的資料當正/負對照。對數均勻=自然型(符合);均勻亂數=不符合;績效灌水=四成數值被推到剛跨過 10、100、1,000 的位置。
目前的分析組
02體檢
先確認資料適不適合班佛定律。紅燈不代表資料有問題,而是提醒:這種資料的偏離,優先用資料特性解釋。
03分布
四種檢定。疊圖用來比較各組,小圖用來看每組是否落在 95% 上下界內(超出的數字標紅)。
各組小圖(含 95% 上下界)
逐數字表
04分層與趨勢
兩個排除替代解釋的工具:數量級分層(偏離是不是「數字大小」造成的?)與時間趨勢(型態是一直如此,還是某個時期才出現?)。
數量級分層:各層的首位數 1 比例
時間趨勢:各期間的首位數 MAD
05診斷
把數字翻譯成文字。每組一張卡,再加一段對照結論。班佛定律是篩選工具,偏離只代表「值得查核」,不是舞弊證據。
對照結論
接下來怎麼查
06匯出
圖表、表格與可列印的報告。
列印版會隱藏輸入區,保留體檢、分布、分層、診斷四個區塊。
07導覽
原理、判讀與限制。
班佛定律是什麼
自然生成、跨越多個數量級的數值,首位數字不是均勻分布,而是:
1 約佔 30.1%、2 佔 17.6%、…、9 只佔 4.6%。直覺:從 1 長到 2 要翻倍,從 9 長到 10 只要 +11%,所以數值「停留」在 1 開頭的時間最久。第二位數與前兩位數的期望值由同一條公式推得;尾兩位數則期望均勻(各 1%)。
1881 Newcomb 發現對數表前幾頁磨損較重;1938 Benford 用兩萬多筆資料驗證;2002 Znetix 案首次大規模用於司法。
統計量怎麼看
| 95% 上下界 | pexp ± 1.96 √(pexp(1−pexp)/n)。落在外面=該數字顯著偏離(|Z| > 1.96)。n 越大區間越窄。 |
| Z 值 | (pobs − pexp) / 標準誤。大樣本時幾乎每個數字都會顯著,這是 Z 的性質,不是資料異常。 |
| MAD | 各數字 |pobs − pexp| 的平均,與 n 無關,是 Nigrini 建議的主要判定依據。首位:<0.006 高度符合、<0.012 可接受、<0.015 邊緣;第二位:0.008/0.010/0.012;前兩位:0.0012/0.0018/0.0022。 |
| 卡方 p 值 | 整體是否偏離的檢定。p 很小=整體顯著偏離;同樣受大樣本影響。 |
看到這個型態,該怎麼想
| 1、2 偏多,4–9 偏少 | 數值集中在剛跨過 10、100、1,000 的位置 → 目標值/關卡型態。用「04 分層」確認是否每個數量級都如此。 |
| 1 偏少,5–7 偏多 | 人工填寫偏好中間值。 |
| 各數字幾乎一樣多 | 均勻亂數、流水號、編碼型資料。 |
| 1 極高但只跨 1–2 個數量級 | 上限效應:數值被範圍框住(例如每個里的得票被里的人口限制),不是人為。 |
| 第二位 0 多 9 少 | 數字被推過整數關卡(拉高)。 |
| 第二位 0 少 9 多 | 數字停在關卡之下(壓低)。 |
| 第二位 0 與 5 偏高 | 四捨五入或以 5 為單位填報。 |
| 尾兩位 00、50 尖峰 | 整數偏好,人填數字的痕跡。 |
什麼資料適合、不適合
| ✅ 適合 | 交易金額、發票、營收、人口、GDP、得票數、查獲數量、件數統計——自然生成、無固定上下限、跨多個數量級,建議 ≥ 1,000 筆。 |
| ❌ 不適合 | 身分證號、電話、流水號(編碼);身高、體重、年齡、百分比(範圍窄);真隨機亂數;心理定價(.99);被固定額度框住的數字。 |
| ⚠ 對照組 | 最有價值的用法不是單組檢驗,而是對照:同一指標的不同來源(機器 vs 人填)、不同時期(事件前 vs 後)、不同類別。生成機制不同,班佛檢驗才照得出差異。 |
經典案例
| Enron | 2000 年財報數字偏離班佛分布,成為史上最大企業舞弊案的線索之一。 |
| 瑞幸咖啡 | 2020 年財報首位數分布與造假型態吻合,隨後爆出大規模造假。 |
| 伊朗 2009 大選 | 候選人得票數的數字 7 顯著偏多(p < 0.15%),且 50 個選區投票率超過 100%。 |
| CPBL 假球年代 | 1997–2009 年得分、安打、失分不符合,同期投手用球數符合——同一場比賽,被操作的與沒被操作的指標分得開。 |
| 毒品查緝 | 查緝重量符合,每週上報人數不符合——秤出來的數字與人填的數字。 |
重要提醒
班佛定律是異常篩檢工具,不是舞弊證明。偏離可能來自舞弊,也可能來自資料特性、業務規則或制度變動。正確流程:確認資料適合 → 找出偏離的數字與區間 → 分層排除替代解釋 → 回查原始憑證與業務背景 → 才寫進查核報告。