AIに質問すると、分からないところを説明してくれる。間違えれば理由を教えてくれるし、理解度に合わせて問題を作ることもできる。ここまでは、もう珍しい話ではない。
でも、
「実際に人間の家庭教師と比べて、どれくらい学習効果があるの?」
となると話は別だ。
2026年9月23日に公開された研究「StudentBench」は、その疑問を実際の参加者を使って検証した。結果はかなり面白い。
AI家庭教師によるGRE対策の学習効果は、全体として専門家の人間家庭教師と統計的に同等だった。
2,383人でAIと人間を直接比較
StudentBenchでは、2,383人の参加者がGREのQuantitative Reasoning、つまり数学系と、Verbal Reasoning、つまり言語系の問題に取り組んだ。
参加者はAI家庭教師、人間の専門家家庭教師、家庭教師なしなどの条件に分けられ、事前テストのあと約1時間学習し、別問題のテストで学習効果を測定した。
全体として見ると、AI家庭教師の学習効果は人間の専門家家庭教師と統計的に同等。さらに細かく見ると、7つのGRE分野のうち5分野で、その分野で最も成績の良かったAIが人間家庭教師の平均を上回ったと報告されている。
ただ、この研究でもうひとつ驚くのが、
値段だ。
同じ学習効果を、約918分の1のコストで
研究では、Gemma 4 31Bを使ったAI家庭教師のひとつが、人間家庭教師と統計的に同等の学習効果を示した。そのうえで、学習効果1ポイントあたりの推定コストは、
AI:0.0052ドル
人間:4.81ドル
その差は約918倍だった。人間家庭教師側は時給75ドルを基準に計算されている。
もちろん、これは「世の中の家庭教師はAIより必ず918倍高い」という意味ではない。API料金や人間家庭教師の時給など、この研究が置いた条件で比較した数字だ。
それでも、AIには大きな特徴がある。1人に付きっきりで説明を変え、問題を作り、何度質問されても対応する先生を、ほぼ追加人件費なしで増やせる。
教育とAIの相性が注目される理由が、このコスト差を見るとよく分かる。
でも、言葉を教える分野ではまだ人間が強い?
ここで、英会話を考えるうえで気になる結果がある。
StudentBenchでは、Quantitative全体ではAIと人間の同等性が確認された一方、Verbal全体では人間家庭教師の平均学習効果が最も高かった。
ただし、これだけで「言語系は全部人間の勝ち」と考えるのも正確ではない。Verbalの3分野を個別に見ると、Text CompletionとReading Comprehensionでは、その分野で最も成績の良かったAIが人間家庭教師の平均を上回っている。つまり、
言葉を扱う分野でもAIはかなり強い。ただし、Verbal全体としてはまだ人間家庭教師に優位性が残った。
くらいに見るのがよさそうだ。
なお、GRE Verbalは英会話そのものを測る試験ではない。読解や語彙、文章理解などを扱うため、今回の結果から直接「AIと人間、どちらが英会話教師として優秀か」までは判断できない。
そして大問題。「そもそも使ってくれない」
AI家庭教師がどれだけ高性能でも、ひとつ大きな問題がある。
使ってもらえなければ、学習効果はゼロだ。
StanfordのSCALE Initiativeなどによる別の研究では、小学1〜5年生355人を対象に、AI読解家庭教師を利用できる環境を用意した。
ところがAIを自分で利用する条件では、約40〜47%の児童が一度もAI家庭教師を使わなかった。平均利用時間も週にわずか2〜5分程度。
人間が横について利用を促すと利用時間は週1〜4分ほど増えたものの、読解成績の明確な改善は確認されなかった。研究側は、AI家庭教師自体の能力以前に、十分使われなかったことを大きな課題としている。
もちろんStudentBenchとこの研究では、対象年齢も教材も環境も違う。単純に結果を比較することはできない。
でも2つの研究を並べると、AI教育の次の課題が見えてくる。
AI家庭教師の勝負は「教えられるか」から「続けたくなるか」へ
AIは人間並みに教えられるのか。StudentBenchを見る限り、少なくとも限定されたGRE対策では、かなり近いところまで来ている。
そこで次に重要になりそうなのが、
「毎日そのAIを使いたいと思うか」
という問題だ。英会話なら、なおさらだろう。
一度だけ完璧な解説を聞くより、
毎日5分でも話す。
間違えても恥ずかしくない。
昨日話した内容を覚えている。
好きなゲームや映画の話から自然に英語へつなげてくれる。
「勉強するぞ」と構えなくても、つい話してしまう。
そういう仕組みの方が、長期的には効いてくるかもしれない。
じゃあ、ゆな英会話をやってみよう
StudentBenchは面白い研究だが、万能な結論ではない。今回検証されたのは、GRE対策の約1時間の学習と、その直後のテストだ。
長期間使ったときに知識が定着するのか。学校教育全体でも同じ結果になるのか。英会話でも人間と同じ学習効果が出るのか。そこまでは分からない。
またStudentBenchは現時点で査読前のプレプリントで、Handshake AI Researchによる研究だ。データやコードは公開されているが、この背景も含めて結果を見る必要がある。
研究チーム自身も、StudentBenchをAIが人間の知性を置き換えるのではなく、引き上げられるかを測るものと位置づけている。1時間のGRE対策と、人間同士で長期間学ぶ教育は同じものではない。
それでも、
「AIに人を教える能力があるのか?」
という問いには、かなり面白いデータが出てきた。
だったらYuna Orbitでは、その次を試してみたい。
AIと毎日話したくなる仕組みを作ったら、本当に英会話は続くのか。
ということで、
ゆな英会話、始めます。
AI家庭教師は人間を超えるのか。その前にまず、
毎日ちゃんと続けられるのか。
そこから実験してみよう。😊📚🎧
※2026年9月28日時点の論文・公開情報をもとにしています。StudentBenchは査読前のプレプリントです。
※記事中の画像はイメージです。
※この記事はAIとの対話をもとに作成しています。
参考・出典