Statistics タブ

Statistics タブは、アクティブなデータセットの全列の概観を表示します。タブは 2 つのセクションで構成されます。Columns セクションは 1 列 1 行のサマリーテーブルで、行をクリックするとその列の詳細を直下に展開します。Relationships セクションは列ペアのグリッドで、セルをクリックするとそのペアの詳細を表示します。各セクションは見出しのクリックで折りたたみできます。

ヘッダーにはデータセット名と、行数(rows)、列数(cols)、選択列数(sel.)、選択行数(rows sel.)が表示されます。フィルタが有効な場合、行数は「フィルタ後の行数 / 全体の行数」の形式になり、統計はフィルタ後の行に対して計算されます。

基本的な使い方 の「基本統計量を見る」セクションもご覧ください。

Columns セクション

サマリーテーブルは全列を 1 列 1 行で表示します。

Columns セクションの全列サマリーテーブル

テーブルの列内容
Column列名
Typeデータ型と測定尺度
Distribution分布のスパークライン
n非 null の値数
miss欠損値数
Summary型に応じた 1 行要約

Distribution 列のスパークラインは、軸も目盛りも持たない行内サイズのグラフです。数値列と日時列はビン度数のヒストグラム、それ以外の列は件数の多いカテゴリの構成比バーを描きます。

Summary 列の内容はデータ型で変わります。interval / ratio 尺度の数値列は「平均 ±標準偏差 [最小, 最大]」、nominal / ordinal 尺度の数値列は最頻値、文字列と Enum の列は値の種類数と最頻値の割合、ブール列は true / false の件数と割合、日時列は最古と最新の日時です。

行数と列数の多いデータセットでは、統計量は列ごとに順に計算されます。まだ計算していない列の n・miss・Summary には「…」が表示され、計算が終わった列から順に値へ置き換わります。全列をまとめて計算する間は画面が操作を受け付けなくなるため、計算を区切って途中でも表を読めるようにしています。

列詳細の展開

サマリー行をクリックすると、その列の詳細(分布グラフと統計量)が行の直下に展開されます。もう一度クリックすると閉じます。

展開した数値列の詳細:ヒストグラムと Moments、Spread、Quantiles

行の展開は列の選択と一体です。展開した列は Data Table の列選択と連動してハイライトされ、逆に Data Table の列ヘッダーで選択した列は Statistics タブでも展開されます。展開した詳細をペインの幅いっぱいに表示したい場合は Selected Columns タブを使います。

データ型別の統計量

展開した詳細に表示される内容は、列のデータ型に応じて異なります。

数値型(int64, float64)

測定尺度と表示される統計量

数値型では、列の測定尺度(Nominal、Ordinal、Interval、Ratio)に応じて、統計的に意味のある項目のみを表示します。

統計量NominalOrdinalIntervalRatio
カテゴリ別件数(Most frequent)oo
min / maxooo
分位点(median 等)ooo
mean / stdoo
skewness / ex. kurtoo
iqr / rangeoo

たとえば、郵便番号は Nominal(名義尺度)として扱うのが適切です。名義尺度として扱うと、平均や標準偏差は表示されません。これは、名義尺度では数値の大小関係に意味がないためです。

測定尺度の変更方法については データの準備と読み込み をご覧ください。

Nominal または Ordinal 尺度の数値列では、値ごとの件数(Most frequent)が表示されます。

Data Distribution(ヒストグラム)

データの分布を視覚的に確認できます。Nominal または Ordinal 尺度の数値列では、ヒストグラムの代わりに値ごとの件数を棒グラフで示す Category Distribution が表示されます。

  • Bin count: ヒストグラムのビン(区間)数を調整できます
  • Y: 棒の高さが表す量を Count と Proportion から選べます。Count は件数、Proportion は相対頻度で、Proportion では棒の高さの合計が 1 になります
  • Show density: チェックすると、ヒストグラムにカーネル密度推定の曲線を重ねて表示します

グラフ右上のボタンで操作モードを切り替えられます:

  • Pan mode: ドラッグでグラフを移動
  • Select mode: ドラッグで範囲を選択し、該当する行を選択状態にします

Moments(モーメント統計量)

  • mean: 平均値 xˉ\bar{x}
  • std: 標本標準偏差 s=1n−1∑(xi−xˉ)2s = \sqrt{\frac{1}{n-1}\sum(x_i - \bar{x})^2}(n≥2n \geq 2)
  • skewness: 歪度 G1=n(n−1)(n−2)∑ ⁣(xi−xˉs)3G_1 = \frac{n}{(n-1)(n-2)} \sum\!\left(\frac{x_i - \bar{x}}{s}\right)^3、ss は上記の標本標準偏差(バイアス補正、n≥3n \geq 3)。左右対称な分布では 0 になり、正なら右に裾が長く、負なら左に裾が長い傾向を示す
  • ex. kurt: 超過尖度 G2=n(n+1)(n−1)(n−2)(n−3)∑ ⁣(xi−xˉs)4−3(n−1)2(n−2)(n−3)G_2 = \frac{n(n+1)}{(n-1)(n-2)(n-3)} \sum\!\left(\frac{x_i - \bar{x}}{s}\right)^4 - \frac{3(n-1)^2}{(n-2)(n-3)}、ss は上記の標本標準偏差(バイアス補正、n≥4n \geq 4)。正規分布では 0 になり、正なら正規分布より裾が重い(平均から大きく離れた値が生じやすい)、負なら裾が軽い分布であることを示す

比率尺度の列では、以下の統計量も表示されます:

  • cv: 変動係数 CV=s/xˉ×100%\text{CV} = s / \bar{x} \times 100\%。平均に対するばらつきの相対的な大きさを表す。平均が正のときのみ表示される(xˉ≤0\bar{x} \leq 0 では未表示)
  • geo mean: 幾何平均 (∏ixi)1/n\left(\prod_i x_i\right)^{1/n}。すべての値が正のときのみ定義される。ゼロや負値を含む列では表示されない

値域が広く倍精度で統計量を計算できない列では、その統計量が "N/A" と表示されます。モーメント、散布度、補間による分位数が対象です。値を得るには列のスケールを変えてください。データに対して定義されない統計量は、"N/A" ではなく非表示になります。std は n≥2n \geq 2、skewness は n≥3n \geq 3、ex. kurt は n≥4n \geq 4 の列で表示し、分散が 0 の定数列では skewness と ex. kurt を表示しません。

Spread(散布度)

  • iqr: 四分位範囲(75パーセンタイル - 25パーセンタイル)
  • range: 範囲(最大値 - 最小値)

Quantiles(分位点)

interval 尺度または ratio 尺度の数値列では、昇順ソート済みデータ x(1)≤x(2)≤…≤x(n)x_{(1)} \le x_{(2)} \le \ldots \le x_{(n)} に対して h=(n−1)p+1h = (n-1)p + 1 を求め、Qp=x(⌊h⌋)+(h−⌊h⌋)(x(⌊h⌋+1)−x(⌊h⌋))Q_p = x_{(\lfloor h \rfloor)} + (h - \lfloor h \rfloor)\bigl(x_{(\lfloor h \rfloor + 1)} - x_{(\lfloor h \rfloor)}\bigr) と線形補間して計算します(R type 7)。ordinal 尺度の列(数値列・Enum 列とも)では、ソート済みデータの max⁡(1,⌈np⌉)\max(1, \lceil np \rceil) 番目の値を補間なしで返します(R type 1、p=0p=0 のときは x(1)x_{(1)})。結果は常にデータ中の既存の観測値です。データを昇順に並べたときの位置を示します:

  • 0%(min): 最小値
  • 1%, 5%, 10%: 下位パーセンタイル
  • 25%: 第1四分位点
  • 50%: 中央値
  • 75%: 第3四分位点
  • 90%, 95%, 99%: 上位パーセンタイル
  • 100%(max): 最大値

文字列型(string)と Enum 型

文字列または Enum 型の列を展開すると、以下が表示されます:

  • Category Distribution: カテゴリごとの件数を棒グラフで表示
  • Unique values: ユニークな値の種類数
  • Most frequent: 頻度が高い値とその件数(クリックで該当行を選択可能)

Enum 型の列の測定尺度を順序尺度に変更すると、上記の度数集計に加えて Enum 定義の位置順序に基づく min / max / median / Q1 / Q3 が計算されます。mean / std / skewness / ex. kurt は値間の距離が定義されないため計算できません。iqr(= Q3 − Q1)はカテゴリ値同士の減算を必要とするため、同様に計算しません。詳細は Manage Enums タブ を参照してください。

ブール型(boolean)

True/False の列を展開すると、以下が表示されます:

  • True: True の件数と割合(%)
  • False: False の件数と割合(%)

日時型(datetime)

日時の列を展開すると、以下が表示されます:

  • Date Distribution: 時系列でのデータ分布をグラフ表示
    • Interval: 集計間隔を選択(Auto、1 minute、1 hour、1 day、1 week、1 month など)
    • Show trend: トレンドラインを表示
  • Earliest: 最も古い日時
  • Latest: 最も新しい日時
  • Time span: 期間(例:「29 days, 22 hours」)

Relationships セクション

Relationships セクションは、列ペアのグリッドを表示します。数値どうしのペアのセルには Pearson の相関係数 rr が数値と背景色で表示されます。背景色は赤(負の相関)から青(正の相関)への配色で、グリッドの下に凡例が表示されます。カテゴリが絡むペアと、日時×数値のペアのセルには記号が表示されます。日時どうし、または日時×カテゴリのペアは対象外で「-」と表示されます。

Relationships セクションのペアグリッドとペア詳細

列数が 20 を超えるデータセットでは、グリッドは先頭 20 列に限定され、その旨がグリッドの下に表示されます。相関の計算とセルの数が列数の 2 乗で増えるためです。20 列を超える列の組を見るには、Selected Columns タブで対象の列だけを選択します。

行数と列数の多いデータセットでは、相関の計算は画面の描画と並行して進みます。計算中のセルには「…」が表示され、グリッドの下に「Computing correlations…」と出ます。ペア数は列数の 2 乗で増えるため、計算を待つ間も他の操作を続けられるようにしています。計算が失敗した場合はグリッドの下に「Correlations could not be computed.」と表示され、数値どうしのセルは「-」になります。この場合もセルをクリックすればペア詳細で相関係数を確認できます。

相関係数は、両方の列がともに欠損していない行だけを使って計算します(ペアワイズ除外)。計算に使った行数はセルのツールチップとペア詳細に n として表示されます。欠損の位置が列によって異なる場合、ペアごとに n も異なります。

ペアワイズ除外で得られる相関は、両方の列が観測できた行だけの相関です。たとえば測定上限を超えた値が欠損として記録される場合のように、欠損の生じ方が値と関連しているときは、全行を観測できた場合の相関から系統的にずれることがあります。

Pearson の相関係数は2変数間の線形な関係の強さを [−1,1][-1, 1] の範囲で示す指標であり、非線形な関係(例:U 字型の関係)は捉えられない点に注意してください。また、外れ値の影響を受けやすい指標です。

ペア詳細

グリッドのセルをクリックすると、そのペアの詳細がグリッドの直下に表示されます。同じセルをもう一度クリックすると閉じます。表示内容は列の組み合わせで決まります。このセクションでは、Interval または Ratio 尺度の列を数値列、Nominal または Ordinal 尺度の列をカテゴリ列として扱います。

数値 × 数値 -- 散布図と Pearson の相関係数を表示します。相関係数には計算に使った行数が n として併記されます。

カテゴリ × 数値 -- カテゴリ別の数値のグラフを表示します。グラフ上部の Chart ドロップダウンで、カテゴリ間の分布を比較する箱ひげ図(既定)と集計値の棒グラフを切り替えられます。箱ひげ図は中央値・四分位・ひげを表示し、ひげは四分位から 1.5 × IQR 以内にある最も遠い値まで伸び、その外側の値は個別の点で表示します。棒グラフでは集計方法(Sum、Average、Median、Min、Max、既定値は Average)を選択できます。向き(Horizontal、Vertical、既定値は Horizontal)はどちらのグラフにも適用されます。

カテゴリ × カテゴリ -- クロス集計(行数の表)を表示します。

日時 × 数値 -- 日時を横軸にした折れ線グラフを表示します。各行は折れ線上の点として描かれ、点をクリックするとその行を選択できます。

グループ化

Show stats by ドロップダウンから列を選択すると、タブ全体がその列の値でグループ別の表示になります。

species でグループ化した Statistics タブ:重ね描きのヒストグラムとグループ比較テーブル

  • スパークラインは、グループ化中も列の種別によらず全体の集計のまま変わりません。グループ別の内訳は行を展開して確認します
  • 展開した数値列のヒストグラムは、グループ別の重ね描きになります。棒の高さは既定では各グループの件数そのもので、グループ間で行数が異なる場合、高さの差には行数の差が含まれます。Y を Proportion にすると、棒の高さが各グループ内の相対頻度になり、行数の差に影響されずに分布の形を比べられます。ただし行数の少ないグループでは 1 行あたりの比率の変化が大きいため、棒の高さも大きく振れます。比較テーブルの n とあわせて読んでください
  • 展開したカテゴリ列(文字列・Enum・Nominal / Ordinal 尺度の数値列)の Category Distribution は全体の集計のまま変わりません。グループ別の内訳は、同じ展開行に表示されるその列とグループ列のクロス集計で確認できます
  • 展開した日時列の Date Distribution のヒストグラムも全体の集計のまま変わりません。グループ別の earliest・latest・span は、展開行の比較テーブルに表示されます
  • 展開行の統計量は、グループを列に並べた比較テーブルになります
  • ペア詳細の散布図はグループ別に色分けされます。併記される相関係数はグループを無視した全行の値で、"Pearson r (all rows, ignoring groups)" と表示されます
  • グループ列の値が欠損している行は、どのグループにも含まれません。その行数は比較テーブルの下に表示されます
  • グループ列が Enum の場合、グループの並び順と配色は Enum 定義の順序に従います

グループ化に指定できるのは float64 型以外の列で、値の種類数が 20 以下のものです。20 を超える列はドロップダウンに表示されますが選択できません。重ね描きと比較テーブルはグループ数がこの程度を超えると判読できなくなるためです。

活用例

Iris データセットで sepal_length 列を展開し、species でグループ化すると、Iris-setosa、Iris-versicolor、Iris-virginica の分布が 1 つのヒストグラムに重ねて描かれ、mean や std などの統計量が品種を列にしたテーブルで並びます。品種間の分布の重なりと統計量の違いを 1 画面で比較できます。

行選択との連携

Statistics タブのグラフから、データの行を選択できます。行選択の全体的な仕組みについては行選択の連動を参照してください。

ヒストグラムからの行選択

ヒストグラムから選択

バーをクリック: ヒストグラムのバーをクリックすると、そのビン(区間)に該当する行が選択されます。

矩形選択: Select mode に切り替えてドラッグで範囲を指定すると、その範囲内のデータが選択されます。

追加選択: Ctrl(Mac: Cmd)キーを押しながらクリックすると、既存の選択に追加できます。

選択した行は Data Table でハイライトされ、ヘッダーの rows sel. に件数が表示されます。

散布図から選択

ペア詳細の散布図では、点をクリックすると行を選択できます。ヒストグラムと同じく、グラフ右上のボタンで Select mode に切り替えると、ドラッグで矩形範囲の点を選択できます。

時系列プロットから選択

日時×数値のペア詳細に表示される時系列プロットでは、点をクリックすると行を選択できます。

カテゴリ×数値のグラフから選択

カテゴリ×数値のペア詳細に表示される棒グラフと箱ひげ図では、棒または箱をクリックすると、そのカテゴリの全行が選択されます。箱ひげ図の箱はカテゴリ全体の要約なので、ひげの外に描かれた点の行も選択に含まれます。ひげの外の点は個々の値を表すため、点をクリックした場合はその値を持つ行だけが選択されます。

クロス集計から選択

カテゴリ×カテゴリのペア詳細と、グループ化中にカテゴリ列の展開行に表示されるクロス集計では、セルをクリックすると該当する行が選択されます。

Filtered Data タブを開く

グラフ上のデータポイントやバー、カテゴリ件数の値をダブルクリックすると、該当する行を表示する Filtered Data タブが自動的に開きます。

レポートへの追加

展開した詳細の右上の ⋮ ボタンから、列の統計量とヒストグラムをレポートへ追加できます。ペア詳細のカテゴリ×数値グラフと日時×数値の時系列プロットは、グラフの右クリックから追加できます。グループ化中は、重ね描きのままレポート要素になるヒストグラムだけを追加できます。

See also