OLS の基礎

このページは、Linear Regression タブが表示する結果の背後にある数理を説明します。中心となる主題は、OLS が誤差に置く仮定と、各仮定のもとで結果のどの性質が保証されるかです。タブの操作と結果画面の読み方は Linear Regression タブ を参照してください。

モデルの定式化と OLS 推定量

線形回帰モデルは、応答変数を説明変数の線形結合と誤差の和として表します:

Y=Xβ+εY = X\beta + \varepsilon

YY は nn 件の観測の応答変数を並べたベクトル、XX は n×pn \times p の計画行列(design matrix)です。β\beta は係数ベクトル、ε\varepsilon は誤差ベクトルです。切片を含むモデルでは XX の第 1 列はすべて 1 の定数列で、pp は切片を含む列数です。誤差 ε\varepsilon は観測できない量で、応答の変動のうち説明変数の線形結合で表せない部分です。

OLS(Ordinary Least Squares、最小二乗法)は、残差平方和 ∥Y−Xb∥2\|Y - Xb\|^2 を最小にする bb を係数の推定値とします。残差平方和は bb の 2 次式なので、XX の列が線形独立であれば最小点はただ 1 つに定まり、微分が 0 になる点として閉形式(closed form)で書けます:

β^=(X′X)−1X′Y\hat\beta = (X'X)^{-1}X'Y

これが OLS 推定量です1。以降の節の性質はすべてこの β^\hat\beta についての主張です。

誤差の仮定と保証される性質

OLS の結果が持つ統計的な性質は、誤差に置く仮定を強めるほど段階的に増えます。外生性だけで係数の不偏性が成立します。等分散・無相関を加えると Gauss-Markov の定理が成立し、標準誤差が係数推定値の実際の変動を反映するようになります。さらに正規性を加えると区間推定が有限標本で正確になります。どの結果がどの仮定に依存するかを区別しておくと、仮定の成立が疑わしいときに、結果のどこまでが信頼できるかを判断できます。

外生性と係数の不偏性

外生性の仮定 E[ε∣X]=0E[\varepsilon \mid X] = 0 のもとで、OLS 推定量は 不偏 です。推定量を β^=β+(X′X)−1X′ε\hat\beta = \beta + (X'X)^{-1}X'\varepsilon と変形すると、説明変数で条件付けた期待値は E[β^∣X]=β+(X′X)−1X′ E[ε∣X]=βE[\hat\beta \mid X] = \beta + (X'X)^{-1}X'\,E[\varepsilon \mid X] = \beta となり、真の係数と一致します。個々の推定値は誤差由来の項 (X′X)−1X′ε(X'X)^{-1}X'\varepsilon の分だけ真の係数から乖離しますが、この乖離は特定の方向に偏りません。不偏性が保証するのは、この偏りのなさだけです。

応答に影響する変数のうち、モデルに含めた説明変数と相関するものを説明変数に含めていない場合や、応答と説明変数との関係が非線形である場合には、外生性が成立しません。応答に影響し、かつモデルに含めた説明変数とも相関する変数がモデルから欠落していると、その変数の効果が相関する説明変数の係数に混入します。この偏りを欠落変数バイアスと呼びます。このバイアスは係数そのものの偏りで、標本を増やしても解消しません。応答の条件付き期待値が説明変数の線形結合で表現できない場合も、線形結合との差が誤差に残るため、同じ形で外生性が成立しません。外生性が成立しない状況は、残差と予測値の系統的なパターンとして現れることがあり、Residuals vs Fitted プロット で確認できます。

等分散・無相関と標準誤差

等分散・無相関の仮定 Var⁡(ε∣X)=σ2I\operatorname{Var}(\varepsilon \mid X) = \sigma^2 I は、誤差の分散が観測によらず一定で、誤差どうしに相関がないことを要求します。外生性に加えてこの仮定が成立すると、Gauss-Markov の定理により、OLS 推定量は YY の線形変換で表せる不偏推定量の中で分散が最小になります2。この定理は誤差の正規性を必要としません。

等分散・無相関は、係数の標準誤差の計算式の前提でもあります。この仮定のもとで係数の分散は、一般形 (X′X)−1X′Var⁡(ε∣X)X(X′X)−1(X'X)^{-1}X'\operatorname{Var}(\varepsilon \mid X)X(X'X)^{-1} から σ2(X′X)−1\sigma^2 (X'X)^{-1} に単純化できます。標準誤差 SE⁡(β^j)=s2[(X′X)−1]jj\operatorname{SE}(\hat\beta_j) = \sqrt{s^2 [(X'X)^{-1}]_{jj}} は、この式の σ2\sigma^2 を 次節 で定義する推定値 s2s^2 で置き換えたものです。誤差の分散が観測ごとに異なる場合や誤差どうしに相関がある場合、この単純化が成立しません。係数は外生性だけで不偏のままですが、標準誤差とそれにもとづく信頼区間は係数推定値の実際の変動を反映しなくなります。分散の不均一は Scale-Location プロット で確認できます。

正規性と区間推定

さらに誤差の正規性 ε∣X∼N(0,σ2I)\varepsilon \mid X \sim N(0, \sigma^2 I) を仮定すると、t 分布にもとづく区間推定が有限標本で正確になります。この仮定のもとで (β^j−βj)/SE⁡(β^j)(\hat\beta_j - \beta_j) / \operatorname{SE}(\hat\beta_j) は自由度 n−pn-p の t 分布に厳密に従います。区間が真の係数を含む確率を被覆確率、信頼水準として設定した値(1−α1 - \alpha)を名目水準と呼びます。信頼区間 β^j±tα/2, n−pSE⁡(β^j)\hat\beta_j \pm t_{\alpha/2,\,n-p} \operatorname{SE}(\hat\beta_j) の被覆確率は、観測数によらず名目水準に一致します。残差の正規性は Normal Q-Q プロット で確認できます。

同じ仮定から、予測値の区間も t 分布で書けます。てこ比 hih_i は 標準化残差と診断統計量 で定義する量で、これを使うと平均応答の信頼区間(CI)と個々の観測の 予測区間(PI)は次のとおりです:

CI: y^i±tα/2, n−p shi,PI: y^i±tα/2, n−p s1+hi\text{CI:}\ \hat y_i \pm t_{\alpha/2,\,n-p}\, s\sqrt{h_i}, \qquad \text{PI:}\ \hat y_i \pm t_{\alpha/2,\,n-p}\, s\sqrt{1 + h_i}

平方根の中の hih_i と 1+hi1 + h_i は、予測値 y^i=xi′β^\hat y_i = x_i'\hat\beta とそれぞれの区間の対象との誤差の分散に対応します。信頼区間の対象は平均応答 xi′βx_i'\beta で、推定誤差 y^i−xi′β\hat y_i - x_i'\beta の分散は σ2hi\sigma^2 h_i です。予測区間の対象は、同じ説明変数の値での新しい観測 ynew=xi′β+εnewy_\text{new} = x_i'\beta + \varepsilon_\text{new} です。新しい観測の誤差 εnew\varepsilon_\text{new} は β^\hat\beta の推定に使った誤差と独立なので、予測誤差 ynew−y^iy_\text{new} - \hat y_i の分散は、推定誤差の分散 σ2hi\sigma^2 h_i と新しい誤差の分散 σ2\sigma^2 の和 σ2(1+hi)\sigma^2(1 + h_i) になります。

係数の信頼区間の被覆確率は、正規性が成立しなくても、大標本では名目水準に近づきます。誤差が互いに独立に同一の分布に従い、分散が有限で、X′X/nX'X/n が正則な行列に収束するとします。このとき中心極限定理により n(β^−β)\sqrt{n}(\hat\beta - \beta) は正規分布に 分布収束 します。このように分布収束するとき、β^\hat\beta は 漸近正規性 を持つといいます。t 分布にもとづく信頼区間の被覆確率は、この漸近正規性によって標本の増加とともに名目水準へ近づきます。

予測区間の被覆確率は、正規性が成立しない場合、標本を増やしても名目水準に近づきません。係数の信頼区間が推定量 β^\hat\beta の分布に関する区間であるのに対し、予測区間は新しい観測の誤差 εnew\varepsilon_\text{new} そのものの分布の裾に依存します。この誤差の分布は標本を増やしても変わらないため、大標本の正規近似は予測区間には有効ではありません。

残差自由度と誤差分散推定値の変動

誤差分散 σ2\sigma^2 は、残差平方和(RSS)を残差自由度 n−pn-p で割った s2=RSS/(n−p)s^2 = \mathrm{RSS}/(n-p) で推定します。外生性と等分散・無相関のもとで s2s^2 は σ2\sigma^2 の不偏推定量です。Linear Regression タブが残差標準誤差(Residual Std. Error)として表示する値はその平方根 ss です。

s2s^2 が真の値のまわりでどの程度変動するかは、残差自由度で決まります。正規性のもとで RSS/σ2\mathrm{RSS}/\sigma^2 は自由度 n−pn-p のカイ二乗分布に従い、s2s^2 の変動係数(標準偏差を平均で割った値)は 2/(n−p)\sqrt{2/(n-p)} です。残差自由度 50 なら変動係数は 0.2 で、推定値は真の値の 2 割程度の幅で変動します。残差自由度 2 では変動係数が 1 に達します。カイ二乗分布の分位点から、残差自由度 2 のとき s2/σ2s^2/\sigma^2 の 90% 区間はおよそ [0.05, 3.0][0.05,\ 3.0] です。この自由度では、データを取り直したときの誤差分散の推定値が 9 割の確率で真の値の 20 分の 1 から 3 倍の間の値になります。

s2s^2 を使うすべての量が、この不確かさの影響を受けます。標準誤差・信頼区間・予測区間の幅は ss に比例し、分散分析(ANOVA)の効果量の計算にも誤差分散の推定値が入ります。正規性が正確に成立する場合、t 分布は ss の変動を反映しているため、信頼区間の被覆確率自体は名目水準に一致したままです。しかし区間の幅は ss に比例してデータごとに大きく変動します。

ss の変動の伝播とは別に、小さい残差自由度は t 分布の分位点も大きくします。自由度 2 の 97.5% 分位点は 4.30 で、正規分布の 1.96 の 2 倍以上です。さらに、正規性が成立しない場合にそれを補う前節の大標本近似も、小さい自由度では有効ではありません。

残差自由度を増やす方法は、観測を増やすことと、推定するパラメータを減らすことの 2 つです。外す候補になるのは、理論的に効果がないことが確かな交互作用項や、応答との関連が想定できない説明変数です。これらをモデルから外すと、そのぶん残差自由度が増え、誤差分散の推定が安定します。

標準化残差と診断統計量

誤差は観測できないため、仮定の診断には残差 e=Y−Xβ^e = Y - X\hat\beta を使いますが、残差は誤差と同じ性質を持ちません。残差ベクトルは e=(I−H)εe = (I - H)\varepsilon と書けるため(HH は てこ比 で定義するハット行列)、外生性と等分散・無相関のもとでも Var⁡(ei)=σ2(1−hi)\operatorname{Var}(e_i) = \sigma^2(1 - h_i) となり、生の残差の分散は観測ごとに異なります。この節では、この不均一を補正した標準化残差と、そこから導く影響度の指標を定義します。これらの量を使った診断プロットの読み方は Linear Regression タブ を参照してください。

てこ比

てこ比(leverage)hih_i は、観測 ii の説明変数の値が説明変数空間の中で外れた位置にあるほど大きくなる指標です。予測値のベクトルは Y^=X(X′X)−1X′Y=HY\hat Y = X(X'X)^{-1}X'Y = HY と書け、この HH をハット行列と呼びます。てこ比はその対角要素 hi=xi′(X′X)−1xih_i = x_i'(X'X)^{-1}x_i で、観測 ii 自身の観測値 yiy_i がその予測値 y^i\hat y_i に寄与する重みにあたります。切片を含むモデルでは hi=1/n+x~i′(X~′X~)−1x~ih_i = 1/n + \tilde x_i'(\tilde X'\tilde X)^{-1}\tilde x_i と分解でき(x~i\tilde x_i は観測 ii の切片を除いた説明変数から各説明変数の平均を引いたベクトル、X~\tilde X はそれを全観測分並べた行列)、説明変数の平均から離れた観測ほどてこ比が大きくなります。切片を含まないモデルでは、平均ではなく原点からの離れ方を測ります。

てこ比の取りうる値には制約があり、0≤hi≤10 \le h_i \le 1 かつ ∑ihi=p\sum_i h_i = p が常に成立します。したがって平均は p/np/n です。

てこ比が大きい観測では、当てはめの結果がその観測自身の値に強く依存します。hih_i は yiy_i が y^i\hat y_i に寄与する重みなので、hih_i が 1 に近い観測では予測値がほぼ yiy_i そのものになり、残差の分散 σ2(1−hi)\sigma^2(1 - h_i) は 0 に近づきます。その位置での当てはまりの悪さは生の残差にほとんど現れないため、残差の大きさだけを見てもこの依存は検出できません。続く標準化残差は残差の分散の不均一を補正し、Cook's Distance はこの依存を影響度として数値化します。

標準化残差

標準化残差は、生の残差をその標準偏差の推定値で割り、観測どうしを同じ尺度で比較できるようにした残差です:

ri=eis1−hir_i = \frac{e_i}{s\sqrt{1 - h_i}}

分散の不均一 Var⁡(ei)=σ2(1−hi)\operatorname{Var}(e_i) = \sigma^2(1 - h_i) を補正した標準化残差は、仮定がすべて成立すればどの観測でも平均 0・分散 1 になります。分散の推定に全観測を使うこの定義を internally studentized residual と呼びます3。

Cook's Distance

Cook's Distance DiD_i は、観測 ii を 1 つ除外して推定し直したときに係数推定値がどれだけ変化するかを、1 つの数値にまとめた影響度の指標です(Cook, 1977)。定義は除外前後の係数の差 β^(i)−β^\hat\beta_{(i)} - \hat\beta にもとづきますが、標準化残差とてこ比だけで計算できる形に変形できます:

Di=ri2p⋅hi1−hiD_i = \frac{r_i^2}{p} \cdot \frac{h_i}{1 - h_i}

影響度は、残差の大きさ ri2r_i^2 とてこ比の項 hi/(1−hi)h_i/(1-h_i) の積で決まります。残差が 0 の観測(ri=0r_i = 0)は、てこ比がどれだけ高くても、除外前後で係数を変えません。説明変数空間の中心付近の観測(hi≈0h_i \approx 0)は、残差が大きくても係数をほとんど変えません。一方、てこ比の項は hih_i が 1 に近づくと際限なく大きくなるため、標準化残差が平均的な大きさでも、てこ比が 1 に近い観測の DiD_i は大きくなりえます。

てこ比が 1 の観測では、標準化残差と Cook's Distance のどちらも定義できません。1−hi=01 - h_i = 0 となり、両者の分母が 0 になるためです。てこ比が 1 とは、yiy_i がどんな値であっても予測値が観測値に一致する(y^i=yi\hat y_i = y_i)、つまり回帰が必ずこの観測を通る状況です。たとえば、ある説明変数がこの 1 観測でだけ 0 以外の値を取るとします。その係数はこの観測をちょうど再現する値に決まり、他の観測の当てはめには影響しません。その結果、この観測の残差は yiy_i の値によらず必ず 0 になり、残差にもとづく標準化残差と Cook's Distance は情報を失います。計算できないことは影響が小さいことを意味しません。係数の一部がこの 1 観測だけで決まるという、依存の最も極端な形を示します。

多重共線性と VIF

多重共線性は、説明変数間に強い線形の相関がある状態を指します。この状態は、係数推定量の分散、つまりデータを取り直したときに係数推定値がどれだけ変動するかを拡大します。相関した説明変数どうしでは、応答の変動をどちらの係数に割り当てるかをデータからほとんど区別できず、係数の組み合わせがデータのわずかな違いで大きく入れ替わります。

VIF(Variance Inflation Factor、分散拡大係数)は、説明変数 XjX_j の変動のうち、係数 β^j\hat\beta_j の推定に使える部分がどれだけ残っているかを測る指標です。XjX_j を、切片を含めて残りの説明変数に回帰したときの決定係数を Rj2R_j^2 とすると、VIFj=1/(1−Rj2)\mathrm{VIF}_j = 1/(1 - R_j^2) です。Rj2R_j^2 は XjX_j の変動のうち他の説明変数で説明できる割合なので、1/VIFj=1−Rj21/\mathrm{VIF}_j = 1 - R_j^2 は説明できずに残る割合にあたります。

β^j\hat\beta_j の推定に使えるのは、XjX_j の変動のうち他の説明変数と連動しない部分、つまり XjX_j を残りの説明変数に回帰したときの残差だけです。係数 βj\beta_j が表すのは、他の説明変数を固定して XjX_j を動かしたときの応答の変化だからです。重回帰の β^j\hat\beta_j は、この残差だけを説明変数とする単回帰の係数と一致し、切片を含むモデルではその分散が

Var⁡(β^j)=σ2(1−Rj2)∑i(xij−xˉj)2\operatorname{Var}(\hat\beta_j) = \frac{\sigma^2}{(1 - R_j^2) \sum_i (x_{ij} - \bar x_j)^2}

と書けます。分母は XjX_j の全変動 ∑i(xij−xˉj)2\sum_i (x_{ij} - \bar x_j)^2 のうち、推定に使える残りの部分そのものです。VIFj=4\mathrm{VIF}_j = 4 なら XjX_j の変動の 4 分の 1 だけが β^j\hat\beta_j の推定に寄与し、標準誤差はこの使える変動の平方根に反比例します4。

多重共線性が拡大するのは個々の係数推定量の分散であって、モデル全体の予測が同じ程度に不安定になるわけではありません。予測値は説明変数の張る空間上で決まるため、相関した 2 つの説明変数のどちらに係数を割り振っても、予測値はほとんど変わりません。このためモデル全体の決定係数や予測値が安定していても、個々の係数と標準誤差だけが不安定という状態が起こります。多重共線性の深刻さは、係数の解釈が目的か予測が目的かで変わります。

切片を含まないモデルでは、この定義の VIF は適用できません。VIFj\mathrm{VIF}_j の定義に使う Rj2R_j^2 が、切片を含む回帰の決定係数だからです。

多重共線性は、係数の統計的な不確かさだけでなく、数値計算の精度も悪化させます。説明変数間の相関が強いほど計画行列の条件数が大きくなり、丸め誤差の影響が拡大します。仕組みと対処は 数値計算の基礎 を参照してください。

See also

参考文献

脚注

  1. MIDAS は β^\hat\beta の数値をこの式のとおりには計算せず、計画行列の QR 分解から求めます。X′XX'X を作ると条件数が 2 乗になり、丸め誤差の影響が拡大するためです。計算結果は丸め誤差の範囲で上の式と一致します。条件数と丸め誤差の関係は 数値計算の基礎 を参照してください。 ↩

  2. この性質を持つ推定量を BLUE(Best Linear Unbiased Estimator、最良線形不偏推定量)と呼びます。定理の比較対象は線形かつ不偏な推定量に限られ、分散の絶対的な大きさについては何も主張しません。 ↩

  3. 分散の推定から観測 ii 自身を除いた定義(externally studentized residual)もあります。MIDAS の診断プロットと診断データセットが使うのは internally studentized の値です。 ↩

  4. 「分散拡大係数」という名前は、同じ式を「XjX_j が他の説明変数と無相関(Rj2=0R_j^2 = 0)だった場合の分散 σ2/∑i(xij−xˉj)2\sigma^2 / \sum_i (x_{ij} - \bar x_j)^2 の何倍か」と読むことに由来します。 ↩