IQRは「真ん中50%」から距離を見ます
IQRでは第1四分位点Q1と第3四分位点Q3の差を使い、Q1−1.5×IQRより小さい値、Q3+1.5×IQRより大きい値を候補にします。分布が少し歪んでいても使いやすい方法です。
データ件数が少ないと四分位点そのものが不安定になります。5件しかない列と5万件ある列では、同じIQR判定でも信頼の置き方が違います。件数が少ないときは、抽出結果より元データを直接見る方が早いこともあります。
無料Webツール
数値列の外れ値をIQRまたはz-scoreで検出し、該当行を抽出します。
平均から離れている値を探したい。でも「大きい値=間違い」とは限りません。このツールはIQRまたはz-scoreで、まず“外れて見える行”を候補として抜き出します。削除を決めるツールではなく、確認する行を減らすためのツールです。
IQRでは第1四分位点Q1と第3四分位点Q3の差を使い、Q1−1.5×IQRより小さい値、Q3+1.5×IQRより大きい値を候補にします。分布が少し歪んでいても使いやすい方法です。
データ件数が少ないと四分位点そのものが不安定になります。5件しかない列と5万件ある列では、同じIQR判定でも信頼の置き方が違います。件数が少ないときは、抽出結果より元データを直接見る方が早いこともあります。
z-scoreでは平均から何標準偏差離れているかを見ます。このツールは標本標準偏差を使い、指定したしきい値以上を抽出します。平均や標準偏差自体が外れ値の影響を受けるので、分布によってはIQRと結果が変わります。
標準偏差が0、つまり有効な数値が全部同じ場合はz-scoreで外れ値は出ません。しきい値を下げれば何でも拾えるわけではなく、そもそも散らばりがない列では「平均から離れている」という基準自体が成立しないためです。
空欄や文字列は外れ値にも正常値にも数えません。結果の「数値行」は、実際に判定へ使えた行数です。元CSVの行数と違っていたら、対象列に非数値が混ざっていないか見てみると原因が分かります。
ここがいちばん大事です。月商が普段10万円の中で100万円の行があっても、大口注文なら正しいデータです。統計的に珍しいことと、業務上間違っていることは別なんですよ。抽出後に元データへ戻って意味を確認します。
元データ全体にフラグ列を追加する方式ではなく、外れ値候補だけをCSVとして保存します。レビュー用の短いリストを作る用途に向いています。