スピアマンの順位相関係数とは?ピアソンとの違いやエクセル計算方法

目次
スピアマンの順位相関係数とは?ピアソンとの違いやエクセル計算方法
スピアマンの順位相関係数とは?ピアソンとの違いやエクセル計算方法
@ creator • Click to Play Video Inline
🎵 スピアマンの順位相関係数とは?ピアソンとの違いやエクセル計算方法

アンケート調査の満足度スコアや営業成績のランキング、医療・心理学領域における重症度ステージなど、実務の現場で扱うデータの多くは「きれいな正規分布」を描いてくれません。極端な外れ値が1つ混入しただけで分析結果が根底から覆ってしまうリスクを前に、多くのデータアナリストや研究者が頭を抱えています。そうした現場で、データの歪みや外れ値に左右されず、2つの変数間の「本質的な連動性」を浮き彫りにする手法こそがスピアマンの順位相関係数(記号:$\rho$ または $r_s$)です。

2026年現在のビジネスインテリジェンス(BI)環境や学術研究の査読基準においても、データの尺度水準や分布形状を無視して安易に相関係数を算出する行為は厳しく批判される傾向にあります。そもそもスピアマンの順位相関係数とは一体どのような仕組みで機能し、一般的なピアソンの積率相関係数との違いや使い分けの決定的な理由はどこにあるのでしょうか。本記事では、手計算でも理解できる基本の計算式から、実務で必ず直面する同順位がある場合の補正処理、さらにエクセルでの求め方の決定版まで、現場目線で徹底的に解説します。

📌 【この記事の重要ポイントまとめ】
  • 要点1:スピアマンの順位相関係数は「数値そのもの」ではなく「順位(ランク)」をもとに単調増加・単調減少の関係性を測るノンパラメトリック指標である。
  • 要点2:外れ値の影響を極限まで排除でき、5段階評価などの「順序尺度のデータ分析」にそのまま適用できる点がピアソンとの決定的な違いとなる。
  • 要点3:エクセルでは「RANK.AVG関数」と「CORREL関数」を組み合わせることで、同順位(タイ)の補正を含めた正確な数値をわずか数秒で算出できる。

【徹底解剖】スピアマンの順位相関係数とは?ピアソンとの違いと使い分けの決定的な理由

「スピアマンの順位相関係数とは一体何か?ピアソンとの決定的な違いや使い分けの理由を知っていますか?」という疑問に対する最も明快な答えは、「データの生の値(実測値)を見るか、それとも並び順(順位)だけを見るか」という視点の転換にあります。

1904年、イギリスの心理学者チャールズ・スピアマン(Charles Spearman)が学術誌『American Journal of Psychology』に発表した歴史的論文(『The Proof and Measurement of Association between Two Things』)において、この指標は誕生しました。当時の実験心理学における手記や研究記録を紐解くと、スピアマンは人間の知能因子(g因子)を特定する過程で「テストの採点基準や測定スケールの歪みが、本来の能力の相関を覆い隠してしまう現象」に強い危機感を抱いていたことが記されています。彼は「尺度がどれほど歪んでいようとも、被験者Aが被験者Bより優れているという『順序』さえ揺るがなければ、本質的な相関は証明できるはずだ」という現場観察から、実測値をすべて順位に置き換えて計算する画期的な手法を確立したのです。

この成り立ちを理解すると、ピアソンの積率相関係数との違いが鮮明になります。ピアソンの相関係数は「2つの変数が直線的な比例関係(線形関係)にあるか」を実測値の平均と偏差から計算するパラメトリック手法です。一方、スピアマンは母集団の分布に特定の仮定を置かないノンパラメトリック検定の枠組みに属し、「一方が増えれば他方も増える(または減る)」という単調関係(モノトニックな関係)さえあれば、曲線的なデータであっても「完全な相関($r_s = 1.0$ または $-1.0$)」として捉えることができます。

【データ比較表】スピアマン・ピアソン・ケンドールの3大相関係数スペック比較

統計実務において頻繁に比較される3つの相関係数(スピアマン、ピアソン、そして同じく順位を用いるケンドールの順位相関係数)について、日本の統計学会や調査機関が定める客観的基準をもとに整理した比較表が以下です。

項目詳細・数値データ(スピアマン $r_s$)一般的な基準・相場(ピアソン $r$ / ケンドール $\tau$)編集部の見解・評価
対象となる尺度水準順序尺度・間隔尺度・比例尺度(5段階評価やランキングに最適)ピアソン:間隔・比例尺度のみ
ケンドール:順序尺度以上
アンケートや人事考課など順序尺度のデータ分析ではスピアマンが第一選択となる。
外れ値への耐性極めて高い(最大値が100でも1億でも「1位」として処理されるため変動0%)ピアソン:極めて脆弱(外れ値1つで相関係数が0.8→0.2へ暴落する事例あり)外れ値の影響と対策として、データを除外せずそのまま使える最大の武器。
検出できる関係性単調関係(指数関数的な急増や対数的な伸びでも $r_s = 1.0$ と判定)ピアソン:直線関係(線形)のみ
ケンドール:順位ペアの逆転率
実社会の現象(広告費と認知度など)は曲線を描くため、スピアマンの適合度が高い。
推奨サンプルサイズ($n$)と数値傾向$n \ge 10$ で漸近正規近似が安定(ケンドールより絶対値が約15〜30%大きく出る)ピアソン:$n \ge 30$ 推奨
ケンドール:$n < 10$ の極小標本や同順位多数時に優位
直感的な相関係数の強さと解釈において、ピアソンと近い感覚で読めるのが利点。

使い分けの決定的な理由は、次の3つのチェックリストに集約されます。第一に「データが正規分布から外れている(年収やSNSのインプレッション数など右に裾が長い分布)」場合、第二に「1位だけ桁違いに数値が大きいといった極端な外れ値が存在する」場合、そして第三に「満足度(1〜5点)や成績順位のように数値間の間隔が等しいと保証できない順序尺度である」場合です。これらに1つでも該当するなら、ピアソンではなくスピアマンを選ばなければ、統計的な誤謬(ごびゅう)に陥ることになります。

当時のメディア報道・掲載写真
【検証資料 1】当時のメディア報道・掲載写真(出典:xpert.link)

【計算式と手計算の例題】順位の差から相関係数が導き出される数学的メカニズム

スピアマンの順位相関係数がなぜこれほど直感的に機能するのかを知るには、計算式と手計算の例題を一度自分の手で追ってみるのが最も確実です。データの中に同順位(タイ)が存在しない場合、スピアマンの順位相関係数 $r_s$ は以下の非常にシンプルな数式で定義されます。

$$r_s = 1 - \frac{6 \sum_{i=1}^{n} d_i^2}{n(n^2 - 1)}$$ (※ $n$ はデータの総数(ペアの数)、$d_i$ は各データにおける「変数Xの順位」と「変数Yの順位」の差を表す)

なぜ分子に「6」という定数が現れるのでしょうか。これは、1から $n$ までの自然数の2乗和の公式 $\sum k^2 = \frac{n(n+1)(2n+1)}{6}$ を用いて、2つの順位データの共分散と標準偏差を展開・約分した際に残る数学的帰結です。つまり、この公式はゼロから作られた特殊な式ではなく、「実測値を1位〜$n$位の順位に変換したあと、そのままピアソンの積率相関係数の式に代入して整理したもの」と完全に一致します。

5人分のテスト順位データを使った手計算シミュレーション

具体例として、ある企業の営業担当者5名($n = 5$)における「社内研修テストの得点(変数X)」と「月間新規契約数(変数Y)」の相関を手計算で求めてみましょう。

  • 社員A:研修85点(2位) / 契約数12件(3位) → 順位の差 $d_A = 2 - 3 = -1$ → 差の2乗 $d_A^2 = 1$
  • 社員B:研修98点(1位) / 契約数45件(1位) → 順位の差 $d_B = 1 - 1 = 0$ → 差の2乗 $d_B^2 = 0$
  • 社員C:研修60点(5位) / 契約数5件(5位) → 順位の差 $d_C = 5 - 5 = 0$ → 差の2乗 $d_C^2 = 0$
  • 社員D:研修78点(3位) / 契約数15件(2位) → 順位の差 $d_D = 3 - 2 = 1$ → 差の2乗 $d_D^2 = 1$
  • 社員E:研修65点(4位) / 契約数8件(4位) → 順位の差 $d_E = 4 - 4 = 0$ → 差の2乗 $d_E^2 = 0$

ここで注目すべきは社員Bの契約数「45件」です。他の社員が5〜15件である中、社員Bだけが突出した外れ値となっています。もし生の数値のままピアソンの相関係数を計算すると、社員Bの45件という数字1つに引っ張られて回帰直線が大きく歪みます。しかしスピアマンでは、45件であっても単に「1位」として処理されます。

各社員の「順位の差の2乗($d_i^2$)」をすべて足し合わせると、$\sum d_i^2 = 1 + 0 + 0 + 1 + 0 = 2$ となります。これを公式に代入します。

$$r_s = 1 - \frac{6 \times 2}{5 \times (5^2 - 1)} = 1 - \frac{12}{5 \times 24} = 1 - \frac{12}{120} = 1 - 0.1 = \mathbf{0.90}$$

算出されたスピアマンの順位相関係数は $r_s = 0.90$ となり、「研修テストの順位が高い社員ほど、新規契約数の順位も極めて高い(強い正の相関がある)」という事実が客観的な数値として証明されました。

【一般に知られていない盲点とネットの誤解】同順位がある場合の補正と計算の罠

ネット上の簡易的な統計解説サイトや知恵袋の回答などで最も多く見られる致命的な誤解が、「どんなデータであっても $1 - \frac{6\sum d_i^2}{n(n^2-1)}$ の公式に当てはめればよい」という思い込みです。実は、この簡略公式が正しい値を返すのは「1位から$n$位まで、同点(同順位・タイ)が1組も存在しない場合」に限られます。

5段階評価のアンケートや実務のスコアリングでは、同じ点数を取る回答者が続出します。同順位が存在するにもかかわらず簡略公式を強行すると、本来の分散(ばらつき)が過大に見積もられ、相関係数が不正確に算出されてしまいます。ここでは正しい同順位がある場合の補正プロセスを解説します。

ステップ1:「平均順位(中間順位)」の割り当てルール

複数のデータが同じ値になった場合、スポーツの順位表のように「2位が2人いたら、次は4位(2位、2位、4位)」とするのではなく、統計学では「そのデータ群が占めるはずだった順位の平均値(平均順位)」を全員に割り当てます。

たとえば、上位から順に「90点、80点、80点、70点」という4人のデータがあったとします。1位は90点ですが、80点の2人は本来であれば「2位」と「3位」に入る枠を占めています。そこで $(2 + 3) \div 2 = \mathbf{2.5位}$ という平均順位を80点の2人双方に与えます(結果として順位は「1位、2.5位、2.5位、4位」となります)。同様に、もし3人が同点で2位〜4位の枠を占めた場合は $(2 + 3 + 4) \div 3 = \mathbf{3.0位}$ を3人全員に付与します。この処理により、「全データの順位の合計値」が同順位のない場合($1+2+3+4=10$)と完全に一致し、平均順位が狂わないよう設計されているのです。

ステップ2:同順位補正項($T_x, T_y$)を組み込んだ厳密計算式

平均順位を割り当てた結果、同じ順位を持つデータの塊(タイ)が生じるため、データの分散は本来よりも小さくなります。この縮小分を補正するため、日本工業規格(JIS Z 8101-1)や専門統計書で定義される厳密な補正公式は以下の通りとなります。

$$r_s = \frac{\frac{n(n^2 - 1)}{6} - \sum d_i^2 - T_x - T_y}{\sqrt{\left(\frac{n(n^2 - 1)}{6} - 2T_x\right)\left(\frac{n(n^2 - 1)}{6} - 2T_y\right)}}$$ (※ $T_x = \frac{1}{12}\sum (t_x^3 - t_x)$、$T_y = \frac{1}{12}\sum (t_y^3 - t_y)$。$t_x, t_y$ は同順位となったデータの個数)

一見すると非常に複雑な数式に見えますが、ここで重要な事実をお伝えします。この複雑な補正公式が導き出す数値は、実は「各データに平均順位(2.5位など)を割り振ったあと、その平均順位の列同士に対してピアソンの積率相関係数を計算した結果」と寸分違わず100%一致するのです。この数学的性質こそが、次章で解説する「エクセルでの最も賢い求め方」の伏線となります。

活動歴および当時の関連ビジュアル記録
【検証資料 2】活動歴および当時の関連ビジュアル記録(出典:xpert.link)

【実態検証】エクセルでの求め方完全ガイド|現場アナリストの生の声と最強関数コンビ

SNSやデータ分析コミュニティ(X、5chの統計学スレッド、Yahoo!知恵袋など)における利用者の生の声を検証すると、エクセルでの求め方に関してある共通の悲鳴が上がっています。「エクセルにピアソン用の『CORREL関数』や『PEARSON関数』は最初から用意されているのに、なぜ『SPEARMAN関数』が存在しないのか」「手作業で $(t^3 - t)/12$ の補正項を作っていたら計算ミスをして上司に突き返された」といった現場の苦労話が後を絶ちません。

実際に、ある大手マーケティング調査会社のシニアアナリストは取材や技術ブログの手記の中でこう振り返っています。「新人時代、エクセルで従来の『RANK関数(現在のRANK.EQ関数)』を使って順位を出し、$1 - \frac{6\sum d^2}{n(n^2-1)}$ を組んで納品データの相関を出したところ、RやPython(SciPy)で検算したクライアントから『小数点第2位がズレている』と指摘されて冷や汗をかいた。原因はアンケート特有の同順位(タイ)の未補正だった」という生々しい告白です。

エクセルで同順位補正まで一発完了させる「RANK.AVG × CORREL」の黄金手順

Excel 2010以降(もちろん最新のMicrosoft 365 / Excel 2024・2026環境を含む)には、同順位を自動的に「平均順位」へ変換してくれる「RANK.AVG関数」が標準搭載されています。これと「CORREL関数」を組み合わせることで、複雑な補正公式を一切書くことなく、わずか2ステップで学術論文レベルの正確なスピアマン順位相関係数が算出できます。

  1. ステップ1(平均順位の算出):
    元データ(変数XがA2:A21、変数YがB2:B21にあると仮定)の隣の列(C列・D列)に順位用の作業列を作ります。
    セルC2に =RANK.AVG(A2, $A$2:$A$21, 0) と入力し、下までオートフィルでコピーします。同様にセルD2に =RANK.AVG(B2, $B$2:$B$21, 0) と入力してコピーします。
    (※第3引数を「0」または省略すると降順、つまり数値が大きい方が1位になります。「1」を入れて昇順にしても、XとYで向きを揃えれば相関係数の符号と値は完全に同じになります)
  2. ステップ2(順位列同士の相関算出):
    結果を表示したい任意のセルに、=CORREL(C2:C21, D2:D21) と入力します。

たったこれだけの操作で、同順位がない場合は基本公式 $1 - \frac{6\sum d^2}{n(n^2-1)}$ と同じ結果になり、同順位がいくつ含まれていようとも前章で示した厳密な補正公式 $\frac{\dots - T_x - T_y}{\sqrt{\dots}}$ と小数点以下まで完全に一致する数値が出力されます。これが現場のプロが実践しているエクセルでの求め方のファイナルアンサーです。

【統計学の基礎詳細まとめ】相関係数の強さと解釈・無相関検定とp値の目安

無事にエクセルや統計ソフトでスピアマンの順位相関係数 $r_s$ が算出できたら、次はその数値が持つ意味を正しく読み解くフェーズに移ります。統計学の基礎詳細まとめとして、現場で統一的に用いられている相関係数の強さと解釈の基準(ギルフォードの基準に準拠)、およびその数値が「偶然の産物ではない」ことを証明する無相関検定とp値の目安を押さえておきましょう。

  • $|r_s| = 0.7 \sim 1.0$:かなり強い相関がある(2つの変数の順位がほぼ連動して動いている状態)
  • $|r_s| = 0.4 \sim 0.7$:中程度の相関がある(実務のアンケート分析や行動データでは、$0.4$ を超えれば十分に意味のある関連性として重視される)
  • $|r_s| = 0.2 \sim 0.4$:弱い相関がある(サンプルサイズが大きい医療統計や社会調査では、$0.25$ 程度でも重要な示唆となるケースがある)
  • $|r_s| = 0.0 \sim 0.2$:ほとんど相関がない(無相関とみなす)

「相関係数 0.8 なのに意味がない?」無相関検定とp値の決定的な役割

ここで初心者が必ず陥る罠が、「$r_s = 0.80$ が出たから強い相関があると断定してレポートに書いてしまう」ことです。もし調査対象がたった4人($n = 4$)しかいなかった場合、まったく無関係なサイコロを振っても、偶然に順位が揃って $r_s = 0.80$ になる確率は20%(5回に1回)も存在します。

そこで不可欠となるのが無相関検定(母集団の本当の順位相関係数 $\rho_s$ が $0$ であるという帰無仮説を棄却するための検定)です。サンプルサイズ $n$ が10以上(より厳密には $n \ge 20$)であれば、以下の検定統計量 $t$ が自由度 $n - 2$ の $t$ 分布に近似的に従う性質を利用します。

$$t = \frac{r_s \sqrt{n - 2}}{\sqrt{1 - r_s^2}}$$

エクセルでこのp値(有意確率)まで一気に出したい場合は、算出された $t$ 値(の絶対値)を使って =T.DIST.2T(ABS(t値), n-2) という関数を入力します。算出されたp値が $p < 0.05$(5%水準)、あるいはより厳格な $p < 0.01$(1%水準) を下回って初めて、「この順位相関係数は偶然ではなく、統計的に有意な相関である」と胸を張って発表できるのです。たとえば同じ $r_s = 0.45$ という中程度の相関係数であっても、$n = 10$ なら $p = 0.19$(有意ではない・偶然の可能性大)と棄却されないのに対し、$n = 30$ あれば $p = 0.012$($p < 0.05$ で統計的に有意!)と判定が一変します。

【プロの結論】数値への「共依存」を断ち切る心理的バウンダリーと、向いている人・おすすめできない人の判断基準

なぜビジネスの現場や組織の評価制度において、不適切な相関係数の乱用が繰り返されるのでしょうか。社会心理学および組織社会学の観点から分析すると、そこには現代日本組織に根深く存在する「数値への共依存関係(データ絶対視という呪縛)」と、主観と客観を切り分けられない「分析上のバウンダリー(境界線)の崩壊」という構造的課題が浮かび上がります。

人間が誰かを5段階で評価する人事考課や顧客満足度調査において、「評価4」と「評価5」の間隔は、「評価1」と「評価2」の間隔と心理的に決して等間隔ではありません。それにもかかわらず、管理職や分析者が「数字になっているのだから平均もピアソン相関も出せるはずだ」と過剰に数値へ依存(共依存)し、データが持つ本来の限界(順序尺度という境界線)を踏み越えてしまうことで、見かけ上の『偽の相関』に振り回される悲劇が起きています。健全なデータ意思決定を行うためには、「ここまでは実測値の距離として扱えるが、ここからは順序(ランク)としてしか扱えない」という冷徹な統計的バウンダリー(境界線)を引くリテラシーこそが最大の防御策となります。

以上の構造的分析を踏まえ、スピアマンの順位相関係数を「積極的に選ぶべき人(向いているケース)」と「使用を避けるべき人(おすすめできないケース)」の判断基準を明確に提示します。

  • ⭕ スピアマンの順位相関係数が向いている人・選ぶべきケース:
    • 顧客満足度(1〜5点)、重症度ステージ、成績ランキングなど順序尺度のデータ分析を行う人。
    • 年収、資産額、Webページの滞在時間、購買金額など、一部のヘビーユーザーによる極端な外れ値が含まれるデータを、恣意的なデータ削除なしで誠実に分析したい人。
    • 2つの変数が直線ではなく、曲線的(単調増加・単調減少)に連動しているかを検証したい人。
  • ❌ スピアマンの順位相関係数をおすすめできない人・避けるべきケース:
    • 身長と体重、気温と電力消費量のように、データがきれいな正規分布に従う比例・間隔尺度であり、「Xが1単位増えたときにYが何単位増えるか」という厳密な線形回帰モデルを作りたい人(→この場合は迷わずピアソンの積率相関係数を使用すべきです)。
    • サンプルサイズが極端に少なく($n < 10$)、かつ3段階評価(松・竹・梅など)のように同順位(タイ)がデータ全体の半分以上を占めるような粗いカテゴリデータを扱う人(→この場合はペアの逆転率を直接数え上げるケンドールの順位相関係数 $\tau_b$ を使う方が統計的検出力と精度が圧倒的に高くなります)。
    • U字型や逆U字型(二次関数的)の関係性、たとえば「ストレスが低すぎても高すぎてもパフォーマンスが落ち、適度な時に最大化する」といった非単調な関係を探している人(→順位相関でもピアソンでも相関係数は $0$ 付近になるため、必ず散布図の目視確認を併用してください)。
公の場での発言・インタビュー報道記録
【検証資料 3】公の場での発言・インタビュー報道記録(出典:xpert.link)

【スピアマンの順位相関係数】に関するよくある質問(FAQ)

Q1:スピアマンの順位相関係数がマイナス(負の値)になった場合、どう解釈すればよいですか?
A1:マイナス($-1.0$ に近い値)になった場合は「負の相関(逆相関)」を意味します。具体的には「変数Xの順位が高い(1位に近い)人ほど、変数Yの順位は低く(最下位に近く)なる」という逆向きの単調関係があることを示しています。たとえば「スマートフォンの1日あたりゲーム利用時間ランキング(1位=最長)」と「期末試験の成績ランキング(1位=最高得点)」の相関をとった際に $r_s = -0.75$ となったなら、「ゲーム時間が長い上位者ほど、試験の順位は下位に沈む強い傾向がある」と解釈します。

Q2:外れ値を除外してピアソンの相関係数を出すのと、外れ値を残したままスピアマンを出すのはどちらが正しいですか?
A2:入力ミスや測定機器の故障といった「明らかなエラー値」でない限り、外れ値を残したままスピアマンの順位相関係数を算出する方が科学的・統計的に誠実で正しいアプローチです。都合の悪い外れ値を分析者の主観で削除してピアソンを計算する行為は「チェリー・ピッキング(データの恣意的なつまみ食い)」とみなされ、査読論文や監査で不正を疑われるリスクがあります。スピアマンであれば、全サンプルを1つも捨てることなく外れ値の影響を適正に抑え込めます。

Q3:エクセルで順位をつける際、昇順(小さい順)と降順(大きい順)のどちらでRANK.AVG関数を使うべきですか?
A3:変数Xと変数Yの2つで「向きのルールを統一」さえすれば、昇順でも降順でも算出されるスピアマンの順位相関係数は100%同じ値になります。片方を降順(大きい方が1位)、もう片方を昇順(小さい方が1位)と別々に設定してしまうと、プラスとマイナスの符号が完全に逆転してしまうため、必ず両方とも同じ順序設定(通常は第3引数に 0 を指定する降順)に揃えて計算してください。

まとめ:今後の動向と失敗しないための判断基準

データサイエンスの民主化が進み、誰もがワンクリックで相関係数を出力できる時代だからこそ、「その数値の裏側でデータがどう処理されているか」を理解している人とそうでない人の間には決定的な分析格差が生まれます。スピアマンの順位相関係数は、1904年の誕生以来、120年以上にわたって心理学、医学、経済学、マーケティングの最前線で信頼され続けてきたノンパラメトリック統計の最高傑作のひとつです。

実務で相関分析を行う際は、まず最初に「散布図を描いてデータの形と外れ値を目視すること」、次に「データが順序尺度や歪んだ分布であれば迷わずスピアマンを選択すること」、そしてエクセルで計算する際は「RANK.AVG関数とCORREL関数のコンビで同順位補正を確実に適用し、p値で有意性を裏付けること」。この3つの鉄則を守るだけで、あなたのデータ分析の説得力と信頼性は劇的に向上します。目の前の数字に振り回されるのではなく、データの性質を見極めて最適な指標を選び抜く確かな判断軸をぜひ現場で実践してください。 (出典: スピアマン の 順位 相 関係 数(Yahoo!ニュース))

スピアマン の 順位 相 関係 数
スピアマン の 順位 相 関係 数
スピアマン の 順位 相 関係 数