「集計したけどどう分析すれば…?」卒論のデータ分析でつまずかないための基礎知識

学業・レポート・研究

これまでの記事で、テーマ決めから先行研究の洗い出し、独自性の見つけ方、研究計画書の作成、そしてアンケート調査の設計までを解説してきました。回答が集まったら、いよいよ卒論の中核である「データ分析」の段階に入ります。

「集計はしたけど、この先どう分析すればいいのか分からない」「とりあえず平均値を出してグラフにしたけど、これで考察が書けるのか不安」。この段階でつまずく学生は非常に多くいます。

この記事では、なぜ分析という工程が必要なのか、どんな分析手法があるのか、どんなツールを使えばいいのかという基礎知識を先に整理し、そのうえでAIをどう活用できるかを解説します。

1. なぜ「分析」という工程が必要なのか

アンケートで集まった回答は、そのままでは単なる「数字の羅列」に過ぎません。分析とは、その数字の羅列から、研究計画書で立てた仮説(例:「〇〇が高いほど〇〇は低下する」)が実際に支持されるのかどうかを、客観的な根拠をもって判断するための工程です。

ここで重要なのは、分析はあくまで仮説を検証するための手段であって、目的ではないということです。「とりあえず色々な分析をかけてみる」というやり方では、都合の良い結果だけを拾ってしまう危険があります。研究計画書で立てた仮説に対して、「この仮説を検証するには、どの分析手法が適切か」という順番で考えることが大切です。

2. 分析手法の全体像:何が分かるかで手法を選ぶ

分析手法は無数にありますが、卒論で使うものは大きく以下の目的別に整理できます。

知りたいこと対応する分析の方向性
データ全体の傾向・特徴を把握したい記述統計(平均・標準偏差など)、単純集計
2つのグループの間に差があるか知りたいt検定、分散分析(ANOVA)
2つの変数の間に関係があるか知りたい相関分析
ある変数が別の変数にどの程度影響するか知りたい回帰分析
複数の質問項目の背後にある共通の概念を見つけたい因子分析
カテゴリ同士の関連を知りたいクロス集計、カイ二乗検定

自分の仮説が「差を見たいのか」「関係性を見たいのか」「影響度を見たいのか」を最初に整理すると、使うべき手法が自然と絞られてきます。

3. 代表的な分析手法とその使いどころ

記述統計・単純集計

平均値、標準偏差、最大値・最小値、度数分布など、データ全体の基本的な特徴をつかむための、すべての分析の出発点です。本格的な分析に入る前に、必ずこの段階で異常な値がないか、回答の分布に極端な偏りがないかを確認します。

t検定

2つのグループ間で、ある数値の平均に統計的に意味のある差があるかどうかを検証する手法です。例えば「サークルに加入している学生」と「加入していない学生」で、学習時間の平均に差があるかを見る場合などに使います。

分散分析(ANOVA)

3つ以上のグループ間で平均に差があるかを検証する手法です。t検定を3グループ以上に拡張したイメージです。「1年生・2年生・3年生・4年生」で比較したい場合など、グループが3つ以上になるときに使います。

相関分析

2つの数値データの間に、どの程度の関連性があるかを見る手法です。「SNS利用時間」と「学習集中力」のように、2つの変数が同じ方向に動くのか、逆方向に動くのか、それとも無関係なのかを、相関係数という数値で表します。ただし相関関係は「関係があること」しか示せず、「どちらが原因でどちらが結果か」までは分からない点に注意が必要です。

回帰分析

ある変数(独立変数)が、別の変数(従属変数)にどの程度影響を与えているかを数値的に検証する手法です。「短尺動画の視聴時間(独立変数)が、学習集中力(従属変数)にどの程度影響するか」というように、多くの卒論のリサーチクエスチョンに直結する手法のため、量的な卒論では最も頻繁に使われる分析の一つです。独立変数が複数ある場合は「重回帰分析」と呼ばれます。

因子分析

複数の質問項目(例:アンケートの20項目)の回答パターンから、その背後にある共通の概念(因子)をあぶり出す手法です。例えば「授業に集中できる」「課題を計画的に進められる」など複数の質問が、実は「自己管理能力」という一つの共通概念でまとまっている、といったことを統計的に確認する際に使います。多くの質問項目を、少数の意味のあるまとまり(因子)に整理し直したいときに有効です。

クロス集計・カイ二乗検定

「学部」と「SNS利用頻度が高いかどうか」のように、カテゴリ同士(数値ではなく分類)の関連を見たいときに使います。クロス集計で傾向を表にし、カイ二乗検定でその関連が統計的に意味のあるものかを確認します。

4. 分析に使うツール・アプリ

分析手法が決まったら、実際にそれを計算するツールが必要です。それぞれ特徴が異なるため、自分のスキルや分析の複雑さに応じて選びましょう。

Excel

大学生に最もなじみのあるツールです。分析ツールアドインを使えば、記述統計、t検定、相関分析、回帰分析程度までは対応できます。手軽に扱える一方、因子分析のような複雑な多変量解析には不向きです。まず全体の傾向をつかみたい、という初期段階の分析に向いています。

SPSS

社会科学系の学部で広く使われている統計ソフトです。メニュー操作(GUI)で分析を実行できるため、プログラミングの知識がなくても直感的に使えます。多くの大学で教育用ライセンスが提供されているため、所属する大学・学部で使えるか確認してみる価値があります。

R/Python

無料で使える統計解析・プログラミング言語です。因子分析や重回帰分析など、複雑な分析にも柔軟に対応でき、再現性の高い分析(同じコードを実行すれば同じ結果が得られる)が可能な点が強みです。多少のコードの読み書きが必要になりますが、統計・データ分析を専門的に学んでいる学生であれば、最も自由度の高い選択肢になります。

jamovi/HAD

jamoviは無料で使えるオープンソースの統計ソフトで、SPSSに近い感覚のメニュー操作で本格的な分析ができます。HAD(Excelベースの無料統計ソフト)は、日本語で開発されており、心理学・社会科学系の卒論で広く使われています。どちらも無料でありながら因子分析や重回帰分析に対応しており、「プログラミングは避けたいが、Excelだけでは物足りない」という学生に向いています。

選び方の目安

状況おすすめ
まず全体の傾向だけざっくり見たいExcel
大学でSPSSのライセンスが使えるSPSS
R・Pythonを使ったことがある、または専門的に学んでいるR/Python
無料で本格的な分析をしたいが、コードは書きたくないjamovi、HAD

5. 分析前後で必ず押さえておくべきポイント

分析の前提条件を確認する

多くの分析手法(t検定や回帰分析など)には、「正規性(データが正規分布に近い形をしているか)」といった前提条件があります。この前提が大きく崩れている場合、別の手法(ノンパラメトリックな手法など)を検討する必要があります。使う手法の前提条件がどのようなものかは、事前に確認しておきましょう。

サンプルサイズを確認する

回答数が極端に少ない場合、統計的に意味のある結果(有意な差や関連)が出にくくなります。特にグループ分けをして比較する分析では、各グループの人数が十分に確保できているかを確認する必要があります。

外れ値・異常値をチェックする

明らかに現実的ではない回答(極端に大きい・小さい数値、矛盾した回答など)が含まれていないか、分析前に必ず確認します。こうした値を分析にそのまま含めると、結果が大きく歪んでしまうことがあります。

「統計的に有意」の意味を正しく理解する

分析結果に出てくる「p値」や「有意差」という言葉は、「その差や関連が偶然によるものとは考えにくい」ということを示すものであり、「差の大きさ」や「実生活での重要度」を直接示すものではありません。有意差が出たからといって、それがどれほど意味のある差なのか(効果量)も合わせて確認する視点を持つと、より説得力のある考察につながります。

分析結果と仮説の対応を明確にする

分析をかけた結果が、研究計画書で立てた仮説を「支持する」のか「支持しない」のかを、一つひとつ明確に対応づけながら整理していきましょう。ここが曖昧なまま考察に進むと、論文全体の論理が崩れてしまいます。

6. ここでAIをどう活用するか

分析手法とツールの基礎を押さえたところで、AIの出番です。ここでも大切なのは、AIに「分析して結論を出して」と丸投げするのではなく、自分が理解した手法・ツールを前提に、実行や解釈の部分をサポートしてもらうという使い方です。

活用①:どの分析手法が適切かを相談する

自分の仮説とデータの形式をAIに伝え、どの分析手法が適切かの候補を挙げてもらいます。

以下の仮説と、集めたアンケートデータの形式をもとに、
どのような分析手法が適切か、候補とその理由を教えてください。

# 仮説:
[例:短尺動画の視聴時間が長いほど、学習時の集中力が低下する]

# データの形式:
・視聴時間:1日あたりの分数(数値)
・学習集中力:5段階のリッカート尺度を用いた4項目の合計得点
・サンプルサイズ:250名

活用②:分析コードの作成を手伝ってもらう

R・Pythonを使う場合、AIに分析コードのたたき台を作成してもらうと、作業時間を大きく短縮できます。ただし、出力されたコードが自分のデータ構造(列名など)に正しく対応しているかは必ず自分で確認しましょう。

以下のデータを使って、R(またはPython)で重回帰分析を行うコードを
作成してください。

# 従属変数:
学習集中力(4項目の合計得点、列名:concentration)

# 独立変数:
・視聴時間(分数、列名:watch_time)
・性別(列名:gender)
・学年(列名:grade)

# データファイル:
CSV形式、列名は上記の通り

活用③:分析結果の解釈を手伝ってもらう

出力された分析結果(数値やp値など)を貼り付け、それがどういう意味を持つのかを解説してもらうことができます。ただし、AIの解釈をそのまま考察としてコピーするのではなく、自分の仮説や先行研究と照らし合わせながら、自分の言葉で意味づけをすることが重要です。

以下は重回帰分析の出力結果です。
この結果が何を示しているのか、統計に詳しくない人にも
分かるように解説してください。
また、この結果は当初の仮説を支持していると言えるかどうかも
併せて教えてください。

# 分析結果:
[出力結果を貼り付け]

# 検証したかった仮説:
[仮説を記載]

使う上での注意点

分析結果の解釈や統計手法の妥当性については、AIの説明を鵜呑みにせず、必ず指導教授やゼミでの確認を挟みましょう。統計は「正しい手順を踏めば誰がやっても同じ結論になる」という性質のものですが、その手順の妥当性(この手法を選んで良かったのか、前提条件は満たされていたのか)を最終的に判断するのは、AIではなく自分自身と指導教授です。

7. まとめ

データ分析は、集めたアンケート結果を「仮説を検証する根拠」に変える工程です。まず自分の仮説が「差を見たいのか」「関係性を見たいのか」「影響度を見たいのか」を整理し、それに対応する分析手法を選ぶこと。そして、Excel・SPSS・R/Python・jamovi/HADといった自分のスキルに合ったツールを選び、前提条件やサンプルサイズ、外れ値といった基本的な注意点を押さえて分析を行うことが、説得力のある考察への土台になります。

AIは、手法選びの相談や分析コードの作成、結果の解釈の補助において強力な武器になりますが、最終的な妥当性の判断と、自分の言葉での意味づけは、自分自身の理解に基づいて行う必要があります。

次回は、実際に分析した結果をどう考察につなげていくかを解説していきます。

【卒論】分析結果からどうやって「考察」につなげるのか

関連記事

【卒論】「集まったから即分析」はNG!データクリーニングで落とし穴を回避する方法

コメント

タイトルとURLをコピーしました