スクリーニングが終わったら、まず「記述統計」で全体像をつかむ

学業・レポート・研究

前回までの記事で、集めたデータから欠損値・不正回答・外れ値をスクリーニングし、逆転項目の反転や合成得点の作成まで終わらせました。次にやりたくなるのは、t検定や回帰分析といった「本題」の分析かもしれません。しかし、その前に必ず通っておくべき工程があります。それが「記述統計」です。

「記述統計くらい知ってるし、すぐ終わるでしょ」と軽視されがちな工程ですが、実はここでデータの性質をきちんと把握しておかないと、後の分析で選ぶべき手法を間違えたり、結果を誤って解釈したりするリスクが高まります。この記事では、記述統計で何を見るべきか、その基礎知識を整理したうえで、AIをどう活用できるかを解説します。

1. なぜ、分析の前に記述統計が必要なのか

記述統計とは、集めたデータの特徴を、平均や分布といった形で要約する作業です。これには大きく2つの役割があります。

一つは、データ全体の「顔」を知ることです。回答者の年齢層、性別の割合、動画視聴時間の平均や幅など、これから分析しようとしているデータが、そもそもどんな集団のものなのかを把握しないまま高度な分析に進むのは、地図を見ずに知らない土地を歩き出すようなものです。

もう一つは、その後の分析手法を選ぶための判断材料になることです。以前の記事でも触れた通り、t検定や回帰分析など多くの分析手法には、「データが正規分布に近い形をしているか」といった前提条件があります。この前提が大きく崩れている場合は、別の手法を検討する必要があります。記述統計は、その前提条件を確認するための最初のチェックポイントでもあるのです。

2. 「代表値」でデータの中心を掴む

データ全体が、おおよそどのあたりの値に集まっているかを示す指標を「代表値」と呼びます。代表的なものは以下の3つです。

平均値(Mean)

すべての値を合計し、件数で割った値です。最もよく使われる代表値ですが、極端に大きい・小さい値(外れ値)の影響を強く受けるという弱点があります。前回の記事で扱った「動画視聴時間900分」のような外れ値が残ったままだと、平均値は実態よりも大きく引っ張られてしまいます。

中央値(Median)

すべての値を小さい順に並べたとき、ちょうど真ん中にくる値です。外れ値の影響を受けにくいという特徴があるため、平均値と中央値を並べて見ることで、データに極端な偏りがないかを確認できます。両者が大きく離れている場合、外れ値や分布の歪みが疑われます。

最頻値(Mode)

最も多く出現する値です。リッカート尺度のような、選択肢が限られたデータの傾向を見るのに向いています。

3. 「散布度」でデータのばらつきを掴む

代表値だけでは、データが「どれくらいバラついているか」までは分かりません。平均が同じでも、全員がほぼ同じ値に集まっている集団と、値が大きくバラついている集団とでは、データの意味がまったく異なります。この「バラつき具合」を表す指標が「散布度」です。

標準偏差(SD:Standard Deviation)

平均からどれくらい離れた値が多いかを表す指標です。標準偏差が小さいほど、データは平均の近くに集まっており、大きいほどバラつきが大きいことを意味します。前回の記事で外れ値の判定に使った「平均±3SD」も、この標準偏差をもとにした基準でした。

範囲(Range)

最大値から最小値を引いた値です。データ全体がどれくらいの幅に収まっているかをざっくり掴むのに使えます。

四分位範囲(IQR:Interquartile Range)

データを小さい順に並べて4等分したとき、25%地点(第1四分位数)から75%地点(第3四分位数)までの範囲です。標準偏差と同様にバラつきを表しますが、外れ値の影響を受けにくいという特徴があります。データに極端な外れ値が残っている可能性がある場合は、標準偏差だけでなく四分位範囲も併せて確認すると安心です。

4. 分布の形を掴む(正規性の確認)

代表値・散布度に加えて、データが「どんな形に分布しているか」を確認することも重要です。特に、多くの統計手法(t検定や回帰分析など)が前提としている「正規分布(左右対称の釣鐘型の分布)」に近い形をしているかどうかは、必ずチェックしておきたいポイントです。

ヒストグラムで視覚的に確認する

データを一定の幅(階級)で区切り、それぞれの階級に含まれる件数を棒グラフで表したものがヒストグラムです。分布の形を視覚的に確認する最も基本的な方法で、左右対称に近い形をしているか、偏りがないか、山が2つ以上あるような不自然な形(多峰性)になっていないかを確認します。

歪度(わいど)・尖度(せんど)で数値的に確認する

分布の形を数値で表す指標として、「歪度(分布が左右どちらに偏っているか)」と「尖度(分布の山がどれくらい尖っているか、または平べったいか)」があります。目安として、歪度・尖度がともに±1〜2の範囲に収まっていれば、正規分布から大きく外れていないと判断されることが多いですが、この基準は分野や分析手法によっても幅があるため、指導教授やゼミの慣習も確認しておくと安心です。

分布の歪みが大きい場合は、対数変換などでデータを変換したり、正規分布を前提としない分析手法(ノンパラメトリックな手法)に切り替えたりすることを検討します。

5. カテゴリデータは度数分布で把握する

性別や学部、SNS利用頻度のような、数値ではなくカテゴリで回答されたデータについては、平均値や標準偏差ではなく「度数分布」で全体像を把握します。

各カテゴリに何人(何件)が該当するか、そしてその割合(%)を一覧にした表を作ります。例えば「性別:男性28名(46.7%)、女性30名(50.0%)、その他2名(3.3%)」というように示します。度数分布を作ることで、特定のカテゴリに極端に人数が偏っていないか(例:ある学年の回答者が極端に少ない)を事前に把握でき、後の分析でグループ比較を行う際に、十分なサンプルサイズが確保できているかの判断材料にもなります。

6. 記述統計を卒論にどう書くか

記述統計の結果は、卒論の「第4章:結果」の冒頭部分で、分析対象者の属性(デモグラフィック情報)として記述するのが一般的です。

  • 回答者数(有効回答数、スクリーニングで除外した件数も含めて)
  • 性別・学年などの属性の内訳(度数分布)
  • 主要な変数(今回であれば動画視聴時間、学習集中力の合成得点など)の平均値・標準偏差

これらを表としてまとめ、簡潔な文章で補足する、という形が卒論では一般的です。この段階ではまだ「なぜそうなったか」という解釈(考察)には踏み込まず、事実を客観的に記述することに徹します。

7. ここでAIをどう活用するか

記述統計そのものの計算は、ExcelやR、SPSSなどのツールで機械的に行える部分が多いため、AIの役割は主に「結果の解釈」と「文章化」の補助に絞られます。

活用①:分布の形についての解釈を相談する

ヒストグラムや歪度・尖度の数値をもとに、その分布が分析に与える影響について相談することができます。

以下は、私が集めたアンケートデータの記述統計の結果です。
この分布の形について、正規性の観点からどう評価できるか、
また、もし正規性から外れている場合、
その後の分析(回帰分析を予定)にどのような影響が
考えられるか教えてください。

# 記述統計の結果:
・平均:[数値]
・標準偏差:[数値]
・歪度:[数値]
・尖度:[数値]
・最小値・最大値:[数値]

活用②:記述統計の結果を卒論の文章に整えてもらう

Excelやツールで計算した数値を渡し、卒論の「結果」の章にふさわしい客観的な文章に整形してもらいます。

以下は、アンケート調査の記述統計の結果です。
これを卒業論文の「結果」の章で使う、
客観的な記述の文章に整えてください。
まだ解釈や考察は含めず、事実の記述にとどめてください。

# 記述統計の結果:
・有効回答数:[数値]件(スクリーニングにより[数値]件を除外)
・性別内訳:[内訳]
・学年内訳:[内訳]
・動画視聴時間:平均[数値]分、標準偏差[数値]
・学習集中力(合成得点):平均[数値]、標準偏差[数値]

活用③:表の見せ方(デザイン・構成)を相談する

複数の変数の記述統計をまとめて一つの表にする際、どのようなレイアウト・項目構成にすると読みやすいか、卒論で一般的に使われる表の形式について相談することもできます。

使う上での注意点

記述統計の数値そのものの計算は、AIに任せるよりも、ExcelやR/Pythonなどのツールで直接計算したほうが確実です。AIに数値の計算をそのまま依頼すると、誤った数値を出してしまうことがあるため、計算はツールで行い、AIはその結果の解釈や文章化に使う、という役割分担を意識しましょう。

8. まとめ

記述統計は、本格的な分析に入る前の「地図を確認する」工程です。平均値・中央値・最頻値といった代表値、標準偏差・範囲といった散布度、そしてヒストグラムや歪度・尖度による分布の形の確認を通じて、データ全体の性質を把握することが、その後の分析手法の選択や、結果の正しい解釈につながります。

AIは、記述統計の結果の解釈や、卒論の文章としての整形において力を発揮しますが、数値そのものの計算はツールに任せ、AIとの役割分担を意識することが重要です。

次回は、記述統計で把握した全体像をもとに、実際にt検定や相関分析といった仮説検証の分析に進む際のポイントを解説する予定です。

コメント

タイトルとURLをコピーしました