四分位範囲の求め方を徹底解説!奇数・偶数の違いと箱ひげ図の罠

目次
四分位範囲の求め方を徹底解説!奇数・偶数の違いと箱ひげ図の罠
四分位範囲の求め方を徹底解説!奇数・偶数の違いと箱ひげ図の罠
@ creator • Click to Play Video Inline
🎵 四分位範囲の求め方を徹底解説!奇数・偶数の違いと箱ひげ図の罠

テスト対策に取り組む中高生から、実務で売上やアクセス解析に向き合うビジネスパーソンまで、多くの人が一度は突き当たる壁が「四分位範囲の計算」です。「公式自体は引き算のはずなのに、データの個数が奇数か偶数かで中央値の扱いが混乱する」「手計算した数値とExcelの算出結果が食い違う」といった戸惑いの声は、教育現場やデータ分析の現場で日常茶飯事のように聞かれます。

文部科学省の学習指導要領改訂により、四分位数や箱ひげ図は高校数学から中学校第2学年へと移行し、今や義務教育レベルの必須リテラシーとなりました。しかし、教科書ごとの定義のニュアンスやソフトウェアごとのアルゴリズムの差異が、学習者や実務家の混乱に拍車をかけています。計算手順の完全なルール化から、箱ひげ図との構造的な連動、さらには実務で役立つ外れ値の判定法まで、迷いを断ち切るためのポイントを論理的かつ実践的に解き明かします。

📌 【この記事の重要ポイントまとめ】
  • 要点1:四分位範囲の公式は「第3四分位数($Q_3$)− 第1四分位数($Q_1$)」であり、極端な外れ値の影響を排除してデータのばらつきを捉える最強の指標です。
  • 要点2:最大のつまずきポイントは「奇数個と偶数個の分割ルール」にあり、日本の学校教育基準では奇数個のときは全体の中央値を除外して下位・上位グループを作ります。
  • 要点3:箱ひげ図の「箱の長さ」こそが四分位範囲そのものであり、Excelで学校教育と同じ値を出すには「QUARTILE.INC」関数を指定する必要があります。

【公式と本質】四分位範囲の意味とメリット|なぜ平均値や標準偏差だけでは不十分なのか

データのばらつき度合いを測る指標といえば、多くの人が真っ先に「分散」や「標準偏差」を思い浮かべます。しかし、実社会のデータには必ずと言っていいほど「極端な値(外れ値)」が混ざり込みます。たとえば平均年収の算出において、一部の超富裕層が数値を大きく釣り上げてしまい、庶民の実態とかけ離れた平均値が算出される現象は有名です。

ここで圧倒的な威力を発揮するのが、四分位範囲(Interquartile Range: IQR)です。四分位範囲とは、データを小さい順に並べ替えた際、全体の中央50%が集まっている区間の広さを表します。

四分位範囲を求める公式は極めてシンプルです。

四分位範囲(IQR) = 第3四分位数($Q_3$) − 第1四分位数($Q_1$)

全体を4等分する境界値のうち、上位25%の境界である「第3四分位数」から、下位25%の境界である「第1四分位数」を差し引きます。つまり、下位25%のデータと上位25%のデータをあらかじめ切り捨て、中央に位置する半分だけの散らばりを見るため、どれほど極端な異常値が両端に存在していても数値がブレません。この性質を統計学では「外れ値に対する頑健性(ロバスト性)」と呼びます。

あわせて押さえておきたいのが、四分位偏差の求め方です。四分位偏差は四分位範囲を2で割った数値であり、以下の公式で算出されます。

四分位偏差 = (第3四分位数 − 第1四分位数) ÷ 2

四分位範囲が中央50%の「全体の幅」を示すのに対し、四分位偏差は「中央値からの平均的なばらつきの幅」を示す指標として、学力テストのスコア分析などで重宝されています。

当時のメディア報道・掲載写真
【検証資料 1】当時のメディア報道・掲載写真(出典:data-viz-lab.com)

【核心解説】四分位範囲の求め方でつまずく理由|奇数個・偶数個の分割ルールと箱ひげ図の決定打

多くの学習者が「四分位数の求め方」で挫折する根本的な原因は、「データの個数が奇数個か偶数個かで、グループ分けのルールが変わる」点にあります。公式そのものは単純な引き算であるにもかかわらず、手前のステップである第1四分位数と第3四分位数の割り出し方で迷子になってしまうのです。

学校教育(中学数学および高校数学「数学I・データの分析」)における文部科学省の標準ルールは、以下の3ステップで完全に固定化できます。

ステップ1:データを必ず小さい順(昇順)に並べ替える
すべての起点はここです。並べ替えを怠ると、どのような計算を用いても正解にはたどり着けません。

ステップ2:全体の中央値(第2四分位数:$Q_2$)を求める
ここで個数の偶奇が関係します。奇数個なら「ちょうど真ん中の1つの値」、偶数個なら「真ん中にある2つの値の平均値」が中央値になります。

ステップ3:データを「下位グループ」と「上位グループ」に二分割する【最重要の分岐点】
ここが最大の関門です。 ・データの個数が奇数個の場合:中央値として確定した数値そのものを「完全に除外」し、その値より小さい前半部分を下位グループ、大きい後半部分を上位グループとします。
・データの個数が偶数個の場合:中央値は2値の平均として計算されたため、データそのものは綺麗に前後同数に分かれます。前半を下位グループ、後半を上位グループとします。

ステップ4:各グループの中央値を求める
下位グループの中央値が「第1四分位数($Q_1$)」、上位グループの中央値が「第3四分位数($Q_3$)」になります。

この四分位範囲と密接不可分な関係にあるのが、グラフ描画手法の代表格である箱ひげ図です。箱ひげ図において、中央に描かれる「四角い箱の横幅(または縦幅)」こそが四分位範囲そのものを示しています。左端(下端)が第1四分位数、右端(上端)が第3四分位数、箱の中の仕切り線が中央値(第2四分位数)です。箱の幅が狭ければデータが中央に密集していることを示し、箱の幅が広ければ中央付近のデータが大きく散らばっていることを一目で視覚伝達できます。

【実戦練習】ステップ式で絶対に間違えない!四分位範囲の計算問題と解き方のプロセス

理解を確実なものにするため、テストや演習で頻出する奇数パターンと偶数パターンの具体的な計算問題を解いてみましょう。

練習問題1:データが奇数個(7個)のパターン

【問題】次の7つのデータにおける四分位範囲と四分位偏差を求めよ。
データ:[ 18, 5, 22, 12, 8, 30, 15 ]

【解法プロセス】
1. 小さい順に整列:[ 5, 8, 12, 15, 18, 22, 30 ]
2. 全体の中央値($Q_2$)を特定:7個の中央である4番目の値「15」が中央値です。
3. 奇数個ルールを適用:中央値「15」を取り除き、下位と上位に分けます。
・下位グループ:[ 5, 8, 12 ]
・上位グループ:[ 18, 22, 30 ]
4. 各グループの中央値を抽出:
・第1四分位数($Q_1$)= 8
・第3四分位数($Q_3$)= 22
5. 四分位範囲を計算:$Q_3 - Q_1 = 22 - 8 =$ 14
6. 四分位偏差を計算:$14 \div 2 =$ 7

練習問題2:データが偶数個(8個)のパターン

【問題】次の8つのデータにおける四分位範囲を求めよ。
データ:[ 21, 7, 32, 14, 3, 25, 9, 18 ]

【解法プロセス】
1. 小さい順に整列:[ 3, 7, 9, 14, 18, 21, 25, 32 ]
2. 全体の中央値($Q_2$)を特定:8個の中央は4番目「14」と5番目「18」の平均値、$(14 + 18) \div 2 = 16$ です。
3. 偶数個ルールを適用:データそのものに16は含まれていないため、綺麗に4個ずつ二分割します。
・下位グループ:[ 3, 7, 9, 14 ]
・上位グループ:[ 18, 21, 25, 32 ]
4. 各グループの中央値を計算(グループ内も偶数個のため2値の平均):
・第1四分位数($Q_1$)= $(7 + 9) \div 2 =$ 8
・第3四分位数($Q_3$)= $(21 + 25) \div 2 =$ 23
5. 四分位範囲を計算:$Q_3 - Q_1 = 23 - 8 =$ 15

このように、「奇数は真ん中を除外して左右を見る」「偶数は半分に割って左右を見る」という原則を身体に染み込ませれば、計算ミスは劇的にゼロへと近づきます。

活動歴および当時の関連ビジュアル記録
【検証資料 2】活動歴および当時の関連ビジュアル記録(出典:mathlandscape.com)

【比較検証】代表的なばらつき指標とツールの違い|現場で混乱を招く計算手法の完全整理

データを取り扱う現場では、四分位範囲の他にも用途に応じたばらつき指標が存在します。また、ソフトウェアによって四分位数の算出定義が微妙に異なるため、実務で使う際にはツールの仕様を把握しておく必要があります。

項目・指標名計算手法・算出アプローチ外れ値への耐久性・実務基準編集部の見解・実務上の注意点
四分位範囲(IQR)第3四分位数(上位25%点)− 第1四分位数(下位25%点)極めて高い(ロバスト性が高く、異常値に左右されない)歪みのある分布(所得・Web滞在時間等)を直感的に把握する標準ツール。
標準偏差(SD)各データと平均値の差の2乗平均の平方根極めて低い(1つの極端値で数値が激変する)正規分布が前提の品質管理や偏差値算出に最適だが、非対称データには不適。
Excel: QUARTILE.INC両端(0%点・100%点)を含む補間アルゴリズムを採用高い(学校教育の計算結果と原則一致する)日本の学習指導要領準拠の数値をExcelで出したい場合は必ずこちらを指定。
Excel: QUARTILE.EXC両端(0%点・100%点)を除外する排他型アルゴリズム高い(米国統計学会や一部学術分野で支持)サンプル数が少ないと端点が取得不能になり、教科書の解とは数値がズレる。

【実態検証】教育現場と実務の落とし穴|Excel関数と教科書の「値のズレ」問題

SNSや知恵袋、教育相談フォーラムで毎年のように投稿されるトラブルがあります。「学校のプリント通りに計算したのに、Excelに打ち込んだら違う値が出てきた。どちらが間違っているのか?」という悲鳴です。

報道各社や数学教育学会の研究論文でも指摘されている通り、四分位数の算出法には世界的に見ても複数の定義が存在します。アメリカの統計学者ジョン・テューキーが提唱した簡易的なヒンジ法(現在の日本の教科書に採用されている手法)のほか、パーセンタイルを線形補間する手法など、大別しても4〜5通りの流儀があります。

Excelの旧関数である「=QUARTILE()」や現行の「=QUARTILE.INC()」は、データを「0から1までの連続体」として按分補間して計算します。そのため、データの個数によっては手計算の端数処理とわずかな小数のズレが発生する構造になっています。一方で「=QUARTILE.EXC()」を使うと、さらに異なる値が算出されます。

実務でエクセル集計を行う場合は、「=QUARTILE.INC(範囲, 3) - QUARTILE.INC(範囲, 1)」と数式を組むのがもっとも安全で一般的な実務解です。テストを控えた学生は「学校のテストでは教科書の分割手順に従い、Excel実務ではINC関数をベースにしている」と割り切って理解しておくことが精神衛生上も極めて重要です。

さらに、実務の「データの分析」において四分位範囲の真価が発揮されるのが、外れ値の検出(Tukey's fences)です。統計学では以下の基準を超える数値を外れ値と客観的に定義します。

・下限基準値:第1四分位数 − 1.5 × 四分位範囲
・上限基準値:第3四分位数 + 1.5 × 四分位範囲

この「1.5×IQRルール」は、箱ひげ図の外側に独立した点としてプロットされる異常値の数学的根拠そのものです。センサーデータのノイズ除去や、カード不正利用の検知アルゴリズムなど、先端テクノロジーの現場でもこの四分位範囲を応用した判定ロジックが休むことなく稼働しています。

公の場での発言・インタビュー報道記録
【検証資料 3】公の場での発言・インタビュー報道記録(出典:ITmedia)

一般に知られていない盲点とネットの誤解

ネット上の簡易解説サイトやまとめブログには、統計学的に不正確な記述が散見されます。特に多い誤解が「中央値が重複しているときの処理」と「全要素の包含問題」です。

よくある誤解の筆頭は、「同じ数値が複数並んでいる場合、中央値を重複して下位・上位の両方に放り込んでよい」という俗説です。たとえば[ 3, 5, 5, 5, 7 ]のように同値が連続する場合でも、あくまで「並びのインデックス(何番目にあるか)」で機械的に位置を判断しなければなりません。数値を都合よく重複させると、下位グループと上位グループの要素数バランスが崩壊し、四分位範囲の数値が歪んでしまいます。

もう一つの盲点は、「四分位範囲さえ見ていれば分布の全貌がわかる」という過信です。四分位範囲はあくまで中央50%の幅を切り取った数値に過ぎません。両端の裾野がどのように広がっているか、あるいは左右どちらに歪んでいるかまでは四分位範囲単体では見抜けないのです。データの全体像を正確に掴むためには、最小値・第1四分位数・中央値・第3四分位数・最大値の「5数要約」をセットで俯瞰し、箱ひげ図とヒストグラムを併用する複眼的なアプローチが欠かせません。

【プロの結論】四分位範囲を活用すべき場面・慎重になるべき場面の判断基準

データ分析のプロとして断言すると、四分位範囲は万能薬ではありません。データが持つ固有の性質を見極めて使い分ける「判断基準」こそが、分析の成否を分けます。

四分位範囲を積極的に活用すべき場面

  • 所得・資産・貯蓄額の分布分析:極端な富裕層が数値を引き上げるため、平均値や標準偏差では「庶民の実態」を捉えられません。中央値と四分位範囲を使うことで、一般的な層のボリュームゾーンが浮き彫りになります。
  • Webサイト滞在時間・アプリ利用時間:画面を開いたまま放置したユーザー(外れ値)の影響を排除し、通常利用ユーザーの滞在幅を正確に測定できます。
  • 医療・臨床データ検査値:突発的な測定エラーや特異体質の数値が含まれる検体群において、中央帯の健全な基準範囲を策定する際に必須となります。

四分位範囲の適用に慎重になるべき場面

  • 正規分布が保証されている工業製品の品質管理:製品の公差判定や不良率の推計では、すべてのデータが左右対称に分布するため、標準偏差(3シグマ管理)を用いる方が数学的に正確なリスク制御が可能です。
  • サンプルサイズが極小のデータ($n < 10$):データの個数が少なすぎる場合、1つの数値の変動で四分位数の位置が跳ね上がり、四分位範囲の信頼性が低下します。極小サンプルでは個別の生データを全件観察する定性分析が適しています。

日本社会には長年、通知表や経済統計を「平均値」のみで一喜一憂する根強い平均値信仰が存在してきました。しかし格差が複線化し、個人の志向が多様化した現在において、単一の平均値で全体を語る手法は限界を迎えています。分布の真ん中を切り取る四分位範囲の思考法は、情報過多の時代にデータの欺瞞を見破るための不可欠な知的防壁です。

【四分位範囲の求め方】に関するよくある質問(FAQ)

Q1:第1四分位数や第3四分位数の計算で、平均をとった結果が小数になっても問題ありませんか?
A1:まったく問題ありません。たとえば偶数個のデータを二分割した際、グループ内の真ん中2つの値が「7」と「8」であれば、$(7 + 8) \div 2 = 7.5$ となります。データ自体がすべて整数であっても、四分位数や四分位範囲が小数になるのは極めて正常な計算結果です。

Q2:四分位範囲と四分位偏差の使い分けはどう判断すればいいですか?
A2:基本的には「四分位範囲」がグローバルスタンダードな指標です。箱ひげ図の箱の長さも四分位範囲に基づいています。四分位偏差は四分位範囲を半分にした値であり、日本国内の特定の教育現場や学力診断などで「中央値からの散らばり」を感覚的に把握したい場合に用いられます。指定がないデータ分析では四分位範囲を優先して算出してください。

Q3:データの個数が奇数のとき、中央値を下位と上位の両方に含める教え方を見かけましたが?
A3:それは一部の古い文献や海外の特殊な定義(包含法)です。現在の中学校および高等学校の学習指導要領(文部科学省検定済教科書)では、奇数個のデータの場合、「中央値を除外して下位と上位に分ける」除外法が統一ルールとなっています。定期テストや高校入試、大学共通テストでは、必ず中央値を除外して計算してください。

まとめ:データのばらつきを正しく見抜くリテラシーを武器にする

四分位範囲の求め方をマスターする本質は、単なる算数や公式の暗記ではありません。「データを小さい順に並べる」「中央値で公平に半分に割る」「奇数なら中央を抜く」という数段階の規律を守るだけで、誰もが手元のデータを客観的かつ歪みなく評価できるようになります。

手計算における奇数・偶数の分割ルールをクリアし、箱ひげ図の箱の幅と連動してイメージできるようになれば、試験問題のケアレスミスは確実に撲滅できます。さらに実務においては、平均値の錯覚に騙されず外れ値に強いデータ分析を行う強力な武器となるはずです。まずは身の回りにある数値データを昇順に並べ、中央の半分を切り取る実践から始めてみてください。 (出典: 四 分 位 範囲 求め 方(Yahoo!ニュース))

四 分 位 範囲 求め 方
四 分 位 範囲 求め 方
四 分 位 範囲 求め 方