無料Webツール

CSVランダムサンプリング

CSVから指定件数を重複なしでランダム抽出します。シード指定にも対応します。

入力と設定

使い方

大きなCSVから確認用に50行だけ抜く、レビュー対象を100件だけ無作為に選ぶ。そんな「重複なしのランダム抽出」に使います。再現したいときだけシードを入れます。

  1. CSVを貼り付け、抽出件数を指定します。
  2. 同じ抽出結果を再現したい場合はシードを入力します。毎回変えたいなら空欄にします。
  3. 抽出された行を確認し、CSVを保存します。

一度選んだ行は、同じ抽出内では重複しません

データ行をFisher–Yates方式でシャッフルして先頭N件を取るので、1回のサンプル内で同じ行を二重に選びません。指定件数が元の行数より多い場合は、存在する行までで止まります。

シードは「同じくじを引き直す」ためのものです

シードに同じ文字列を入れると、同じCSV・同じ条件なら同じ並びを再現できます。監査やレビューで「昨日選んだ100件をもう一度出したい」というときに便利です。

逆にシードを空欄にすると、新しい乱数を使って毎回サンプルを作ります。単に欄が空いているだけで固定結果になるわけではありません。

シードは暗号用途の秘密値ではありません。抽出結果を再現するための目印です。同じseedを使う場合でも、元CSVの行が増減したり順番が変われば結果も変わります。

ランダム=各グループを均等に残す、ではありません

ここは大事です。部署Aが90%、部署Bが10%のCSVから10件取れば、Bが1件前後になることは期待できますが、0件になることもあります。このツールは層化抽出ではなく、全行から同じように抽選します。

ヘッダーは残して、データ行だけを抽選します

1行目のヘッダーは常に先頭に残り、その下のデータ行だけを混ぜます。元CSVの並び順は抽出結果では保持されません。元の行順自体に意味がある場合は、行番号列を先に足しておくと後で追跡しやすくなります。

例えば、目視レビュー用なら

10万行の全件を目で見るのは現実的ではありません。まずseedを空欄にして100件をざっと見る。問題が見つかって共有が必要になったら、その時点の抽出条件を再現できるよう次回はseedを固定する――という使い分けができます。

この抽出は「偏りが絶対にないこと」を証明する機能ではありません。品質監査で母集団の比率を必ず維持したいなら、カテゴリごとに分けてから各群で抽出するなど、層化した手順が必要です。