データ分析へ

教育 × AI / 公開研究の数値検証

AIで解けた問題は、自力でも解けるか2本の研究から学習効果を確かめる

· 約8分 · 公開値の再計算

AIに聞けば解けても、画面を閉じたあとに同じ考え方を使えるでしょうか。教育にAIを取り入れるとき、確かめたいのは、この違いです。

今回は、教育AIを扱った2本の実験研究を読み、論文に載った数値を計算し直しました。対象は高校数学と大学物理で、どちらも、AIを使った学習と、比較対象となる学習を調べています。

答えを出せることと、学んだことは同じではありません。 ただし、AIは学習に役立たない、と片づけるのも早いところ。結果が出た場面と、まだ確かめられていない場面を分けて読みます。

主張|AIを使うだけで、学力は上がるのか

ここで確かめるのは、特定の投稿ではなく、AIがあれば学びやすくなる、という考えをどこまで広げられるかです。すべての教科や年齢で成り立つかは、別に確かめる必要があります。

ペンシルベニア大学のBastani氏らは、トルコの高校で約1,000人を対象に研究しました。2023〜2024年度の秋学期に90分の授業を4回実施し、GPT-4を使える練習のあとに、AIを使えない試験を置いた設計です。原論文

ハーバード大学のKestin氏らの研究は大学の物理授業が対象で、参加条件を満たした学生は194人で、2回の授業でAIによる学習と教室での学習を入れ替えています。2023年秋の授業を対象に、授業前後の得点を比べたものです。原論文

どちらも、学習条件を無作為に割り付ける比較試験(RCT)です。高校数学では学級単位の割付、大学物理では2つのグループが条件を交代する設計で、同じ割付方法ではありません。

ただし、この2本を一緒に平均しても、教育AI全体の効果にはなりません。年齢も科目も、教え方も異なるためです。今回は、何を測ったときに、どんな差が出たかを比較の軸にしました。

再現手順|公開された数値の単位と分母をそろえる

今回の作業は、論文の公開値を使った計算の確認です。生徒にAIを使ってもらう追試や、個票からの回帰分析は行っていません。新たなモデル実験の成功率としては扱いません。

確認日は2026年9月21日で、計算にはPythonの標準機能を使い、4つの改善率と、大学物理の得点差の比を求めました。モデル名やプロンプトは元の実験の条件であり、今回新しく動かした条件ではありません。

  • 元の表から、比較対象の平均と、調整後の得点差を取り出す。
  • 得点差に100を掛け、0〜100点換算の差として表示する。
  • 得点差を比較対象の平均で割り、相対的な増減率を求める。
  • 丸める前の値を残し、記事では小数第1位まで表示する。
  • 人数と観測数、平均と中央値を混ぜていないか確かめる。

高校数学の表1では、練習の比較対象平均は0.284、試験では0.321でした。どちらも満点を1にそろえた得点であり、調整後の差を使うので、単純な各群の平均差とは区別します。

たとえば、0.137÷0.284×100は約48.2%です。一方で、0.137×100は13.7点差。48.2%の改善を、48.2点上昇と読み替えないことが、最初の確認になります。

入力値と計算結果はCSV、式は再計算用Pythonで確認できます。原著者が公開するデータとコードも併記しましたが、本記事では個票を再分析していません。

結果|練習中の改善と、AIなしの試験を分ける

高校数学では、通常の対話型をGPT Base、答えを直接渡さずヒントを中心に返す設計をGPT Tutorとして比較しています。下表は原論文の係数から再計算した値であり、元の実験結果そのものを新たに再現したわけではありません。

高校数学:調整後の差と相対増減率
条件測った場面調整後の差(100点換算)比較対象平均に対する増減
GPT BaseAIありの練習+13.7点+48.2%
GPT TutorAIありの練習+36.1点+127.1%
GPT BaseAIなしの試験−5.4点−16.8%
GPT TutorAIなしの試験−0.4点−1.2%

原論文では、GPT Baseの試験得点低下は統計的に有意でした。GPT Tutorの試験得点は、比較対象との差を統計的に確認できていません。差が確認できないことは、同じだと証明できたことではない、という読み方です。表1と結果の説明

この表の観測数は2,848ですが、2,848人の生徒を調べたという意味ではありません。同じ生徒が複数回の授業に参加する設計です。得点の行数と、参加した人の数は別のもの。

大学物理では、授業後の得点の中央値はAI側4.5、教室側3.5、共通の授業前の中央値は2.75でした。差を取ると1.75と0.75で、その比は約2.33倍。論文の「伸び」の見せ方を確認する計算です。

ただし、4.5÷3.5は約1.29倍です。得点の比と、基準からの伸びの比は違います。 また、中央値同士の差は、一人ずつの得点の伸びを求めたときの中央値とも一致するとは限りません。数値を掲載した本文PDF

どこまで言えるか|好結果を、そのまま自分の教室へ運ばない

2本から読み取れるのは、AIの有無だけでは、学習の結果を説明しきれないということです。どんな支援を返し、いつ、何を使わずに解かせたか。その条件ごとに結果を確認する必要があります。

今回の比較は、関連する研究を網羅したメタ分析ではありません。選んだ2本を読む範囲であり、教育AI全体の平均効果は推定していません。 同じモデルを使えば同じ成果が出る、という保証にもなりません。

  • 確かめられたこと:公開値から計算した改善率と、分母の対応。
  • 元の研究で分かること:各実験の対象と条件における得点差。
  • まだ分からないこと:自分の教室での効果と、長期間の定着。
  • 今回測っていないこと:運用費、準備時間、個別の生徒への影響。

大学物理の結果には、事前知識のある学生と、授業に合わせて設計されたAIという条件があります。高校数学の結果も、当時のGPT-4と特定の教材によるもの。現在の製品や日本の小学生へ、そのまま当てはめる読み方は避けます。ヒントを返す以外にも教材の与え方が違うため、ヒントだけの効果とも言えません。

なお、高校数学の論文には著者所属の訂正が出ています。確認した訂正文は所属表記についてのもので、ここで使った表1の数値を訂正する内容ではありません。出版社の訂正

使うなら|終わった課題の数より、自力でできる範囲を見る

教育の現場で目指したいのは、AIを使った課題が増えることだけではありません。助けがなくても説明できる、別の問題でも考え方を使える。 その変化を確かめられる形で、小さく試すのが出発点です。

以下は、今回の読み取りから考えた運用案であり、効果を実証した手順ではありません。もともと残している小テストや教材を使えば、確認のための作業を増やしすぎずに始められます。

  1. 「何を自力でできるようにしたいか」を、単元ごとに一つ決める。
  2. AIを使う練習と、使わずに解く確認問題を分けて用意する。
  3. 同じ問題の暗記だけを見ないよう、別の数値や場面でも確かめる。
  4. 得点に加え、教員の確認時間と、誤った説明の有無を記録する。
  5. 続ける条件と見直す条件を決め、結果を見て対象を広げる。

答えの正しさを確認できない題材や、評価方法を用意できない場面では、成績向上をうたう導入は見送ります。まず教材の確認や、授業で使う資料の整理から取り組む、という選択もあります。

学習時間と得点の関係を読むときにも、同じ切り分けが役立ちます。旅する書斎の学習行動の公開データ分析では、集団の差と、時間を増やした効果を区別しています。

旅する書斎では、散らばった数値や資料を、判断に使えるレポートへ整えます。今回のように、数字の出所、計算、言える範囲を並べることで、導入するかどうかを話し合える材料にします。教育データの相談