Notes ・ updated 2026-07-19
AIと教育学・学習科学の研究潮流:生成AIと学習の実証(2024–2026)
生成AIを使った学生ほど、練習ではよく解けるようになった。 なのに、AIを取り上げた試験ではかえって点が下がった。 2023年のトルコの高校でおよそ千人を対象に行われた無作為化実験が、この落差を数字で示している(Bastani et al. 2025)。
この一件を、生成AIの学習効果をめぐる研究の縮図として読める。 効果はある。 ただし、どういう設計でAIを使わせたかによって、効果の符号すら反転する。
2024年から2026年半ばにかけて、生成AIと教育学・学習科学の交差を扱う査読研究は、事例報告の段階を抜けてメタ分析とレビューが可能な体系へ移った。
本ノートは、この期間の査読文献39件を軽量スコーピングで集めた統合要約である。
対象は一般教育学と学習科学であり、デザイン教育に特化した文献は別ノート(design-education-ai-adaptation)に譲る。
各文献の完全な書誌は末尾「参照文献」に、出典追跡つきの内部台帳は source/review/ai-education-learning-sciences-trends/papers.md(非公開)に置く。
効果量の数値はすべて論文著者の報告として記し、断定しない。
出版社サイトがペイウォールの文献では、DOIの実在をCrossref、PubMed、ERIC、PMC等のメタデータで確認し、本文で直接確認できなかった数値には内部台帳で [要一次検証] を付けた。
効果はあるのか、どのくらいか
まず、平均するとどうなるか。 2024年から2026年にかけて、生成AIの学習効果を集計したメタ分析が相次いで出た。 それぞれ対象研究も学習者層も違うのに、報告される効果量はおおむね中程度の正の値に収まる。
Ma & Zhong(2025)は34件の実験と準実験を統合し、学習成果全体で g=0.68(p<0.001)と報告した。 Liu, Zuo & Lu(2025)はChatGPTに絞って37件から g=0.577、Sun & Zhou(2024)は大学生28論文から g=0.533 を得ている。 高次思考に限っても、Zhao et al.(2025)は29件59効果量から g=0.609 とし、その内訳を問題解決 g=0.745、批判的思考 g=0.691、創造性 g=0.444 と分けている。
この一致は心強い。 ただし、心強さを額面どおり受け取る前に、確認しておくことが二つある。
一つは、撤回である。 2025年に発表され48万回以上閲覧されたメタ分析(Wang & Fan 2025、学習パフォーマンス g=0.867 等を報告)は、データの不整合により2026年4月に撤回された。 大きな効果量ほど引用されやすく、引用された後に撤回されると、その値だけが独り歩きする。 本ノートはこの論文を主張の根拠に使わない。
もう一つは、平均が隠すものである。 Zhao et al.(2025)の同じデータで、自己調整学習能力の高い学習者では g=0.863、低い学習者では g=0.284 と、効果は三倍近く開いていた。 平均の g がプラスであることは、誰にとってもプラスであることを意味しない。
AIチューターは教室を超えたのか
ここで、平均から離れて、方法論の質が最も高い個別の実験を見たくなる。 2025年に、その象徴になる論文が出た。
Kestin et al.(2025)は、ハーバード大学の物理の授業で、研究ベースに設計したAIチューターと、同じ内容の教室内アクティブラーニングを比べた。
クロスオーバー無作為化比較試験で、AIチューター条件の後テストが有意に高く、しかも学習時間は短かった。
効果量は中程度から大(論文報告、正確な範囲は本文ペイウォールのため内部台帳で [要一次検証])。
「AIは人間の教育者と同等」ではなく「上回った」という主張が、この論文で研究の議論の基点になった。
うまく設計すればAIチューターは強い。 これは確からしい。 問題は、「うまく設計すれば」の中身である。
冒頭のBastani et al.(2025)に戻ると、その中身が見えてくる。 回答を直接与えるGPTへのアクセスは練習成績を+48%改善したが、AIを取り上げた筆記試験のスコアはむしろ−17%下がった(対照群比、論文報告)。 同じ実験で、ヒントを段階的に出すよう設計したGPT Tutor条件では、この負の転移が緩和された。 効果を分けたのは、AIの有無ではなく、AIが答えを渡すか足場を渡すかである。
だから、AIフィードバックの効果も一律ではない。 Bauer et al.(2025)の統計課題のfield experimentでは、手順が高度に構造化された課題で、LLM生成の適応フィードバックは静的な専門家解答に対して優位を示さず、LLM条件ではむしろ学習者の興味が下がった。 一方でLu et al.(2026)は、AIが教師アシスタントに提案を提示する「AI介在」の設計で、学生の修正品質を d=0.50 改善した(大学入門経済学、学生354名、エッセイ1,366本)。 AIが教師を置き換える設計ではなく、教師の判断を補助する設計が効いている。
K-12の知的教育システム(ITS)を集めたシステマティックレビュー(Létourneau et al. 2025、28研究)も、同じ慎重さに着地する。 効果はおおむね正だが、人間によるチュータリングと比べると差は縮まり、長期にわたる大規模で多様な標本での追試が要るという。
点が伸びても、理解は伸びていないかもしれない
ここまでの効果量は、たいてい成果物のスコアで測られている。 では、スコアが伸びたとき、学習者の頭の中でも同じだけ何かが伸びているのだろうか。 そう問い直した研究が、この期間の学習科学側で最も注目された。
Fan et al.(2024/2025)は、大学生を4条件(ChatGPT、人間専門家、ライティング分析ツール、統制)に無作為に割り付けた。 ChatGPT群はエッセイのスコアを他条件より改善した。 ところが、知識の獲得と転移には条件間で有意差がなかった。 著者はこれを「メタ認知的怠惰(metacognitive laziness)」と名づけ、AIに依存すると学習者が自分で計画し監視し評価するプロセスを手放しやすくなると論じた。
この「点は伸びるが理解は伸びない」という乖離が、後続研究の共通の出発点になった。 乖離を認知の言葉で説明したのが、認知的オフロードの系列である。
Gerlich(2025)は666名の混合法調査で、AI利用の頻度と批判的思考のあいだに有意な負の相関を見いだし、認知的オフロードがその媒介になると報告した(若年層で顕著)。 学習の場に限らない証拠として、Lee et al.(2025)は319名の知識労働者を調べ、生成AIへの信頼が高い人ほど批判的思考への従事が減り、逆に自分の判断への自信が高い人ほど増えることを示した。 どちらも、AIが思考の一部を肩代わりするとき、肩代わりされた側の能力が使われずに済む、という筋を描く。
ここで、負の話に傾きすぎないよう譲歩を一つ置く。 足場かけの設計しだいで、この筋は変えられるという証拠もある。
Xu et al.(2025)のRCTでは、メタ認知支援を加えた群は達成スコアそのものに有意差を出さなかったが、課題方略と自己評価という自己調整学習の側面では改善した。 Melanou(2026)の準実験は、目標と文脈と制約を書かせる構造化プロンプトを足場にすると、AI利用時の知識獲得と省察が向上したと報告する。 自己調整学習へのAI支援を10年分集めたメタ分析(Xu et al. 2025)は全体効果を g=0.507 とし、準備フェーズ(g=0.401)より実行フェーズ(g=0.574)で効果が大きいとした。 支援を「答えを出す」ではなく「進め方を支える」側に置いたとき、メタ認知的怠惰の逆をたどれる余地がある。
譲歩を踏まえても、乖離そのものは消えない。 だからこそ、成果物のスコアだけを効果の指標にすると、AIが学習の外注を促している場合を見落とす。
誰が書いたか分からないとき、何を評価するのか
理解とスコアが乖離するなら、スコアを取る評価の側も揺らぐ。 生成AIは、学生が提出した文章を「誰が書いたか」を曖昧にした。 この揺らぎに、教育機関はまず検出で応えようとした。
検出は、思ったほど頼れない。 Liang et al.(2023)は、GPT検出器7種が非ネイティブ英語話者のTOEFLエッセイの平均61.3%をAI生成と誤判定する一方、米国の8年生が書いた英語では誤判定が少ないことを示した。 検出器は、AIらしさではなく、英語の単純さに反応していた。 Hadra et al.(2026)が192テキストで市販検出器を評価しても、AIと人間が混ざった文、EFL学習者の文、長文で精度が落ち、検出器は補助にとどめ不正の単独根拠にすべきでないと結論している。
検出が頼れないなら、課題そのものを「AIで代替しにくいもの」に作り替えればよい、という発想が次に来た。 ここにも留保がつく。 Kofinas, Tsay & Pike(2025)は探索的実験で、authentic assessment(実務に近い本物の課題)だけでは学術的誠実性を保証できず、GenAIを使った作品は採点過程で見分けにくいことを示した。
学生の実態も、単純な「不正か否か」に収まらない。 リバプール大学の2,555名調査(Johnston et al. 2024)では、生成AIを知らない学生はわずか7%で、論文全体をChatGPTに書かせることには70.4%が否定的だった一方、文法支援ツールには半数以上が肯定的だった。 オーストラリアの337名調査(Gruenhagen et al. 2024)では、3分の1強がチャットボットを課題補助に使い、その多くが誠実性違反とは認識していなかった。 線を引くべき場所について、学生の直感は割れている。
この状況で、全面禁止か全面許可かという二分法が実務で広まった。 Curtis(2025)はこれを退ける。 全面許可は学習プロセスを損ない、全面禁止は制限つき利用の教育的価値を無視する。 必要なのは、どちらでもない中間の設計だという。 評価設計の研究は、検出への依存から、AIの関与を前提に置いた課題と誠実性の設計へ重心を移している(Xia et al. 2024 のスコーピングレビューも同じ方向を示す)。
底上げか、格差の拡大か
効果と評価をここまで見てきたが、平均の話は「誰の平均か」を問わない。 生成AIは、参入障壁を下げて学習を底上げするのか、それとも使える者と使えない者の差を広げるのか。
両方の証拠が並んでいる。 包括教育の側では、視覚障害のあるパレスチナの学部生21名を追ったKhlaif et al.(2025)が、生成AIが格差を縮める支援ツールになりうると記述する。 一方でCapraro et al.(2024)は、生成AIが社会経済的不平等に与える影響を検討し、教育ではジェンダー差(女性のChatGPT利用率の低さ)やデジタルデバイドの拡大リスクを指摘する。 アクセスの平等が保証されない限り、底上げの効果は不均等に分配される。
分配を左右するのが、現場の教師である。 米国アイダホ州のK-12教員89名調査(Cheah et al. 2025)では、61%が「ほぼ準備できていない」と答え、地区ポリシーの不在・倫理懸念・インフラ格差を障壁に挙げた。 教員の役割変容を43研究から整理したスコーピングレビュー(Tan 2025)は、生成AIを用いた専門能力開発が授業設計・自己効力感・AIリテラシーなど7つの成果につながりうるとする。 機関の側では、世界の大学戦略文書98件を分析したJin et al.(2025)が、試行可能性の強調・AIリテラシー推進・人間中心のコンピテンシー重視という共通のパターンを見いだしている。
制度の設計にも、素朴な期待を裏切る発見がある。 米国のR1大学2校を調べたJiang et al.(2025)では、AIポリシーを認識している学生ほど、執筆や研究でのAI利用率がむしろ低かった。 ポリシーは、書いてあるだけでは伝わらない。 どう伝えるかまで含めて設計しないと、機関の意図は現場の行動に届かない。
潮流をどう読むか
冒頭のトルコの高校に戻る。 生成AIが練習を助けながら試験を下げたのは、AIが優れていたからでも劣っていたからでもない。 答えを渡す設計が、学習者から自分で考える機会を取り上げたからである。
この期間の研究を貫く像は、二つの水準の緊張として立ち上がる。 個人の成果物スコアはおおむね上がるが(メタ分析の g は中程度の正)、理解・転移・批判的思考・メタ認知という深い層では、設計しだいで上下する。 そして集団の水準では、底上げと格差拡大が同じ技術から同時に生じうる。
だから研究の重心は、「AIは効くか」から「どういう設計なら、どの学習者の、どの能力に効くか」へ移った。 足場を渡す設計と答えを渡す設計を分け、成果物スコアと理解を分け、平均と分布を分けて測ること。 残された最大の問いは、大学の統制された実験で見えた効果が、リソースも準備も不均等なK-12の教室で、格差を広げずに再現できるかである。 この問いは、まだ開いたままにしておく。
参照文献
全39件。DOIまたはarXiv/公式URLで追跡可能。数値はすべて各論文著者の報告であり、本文では断定していない。撤回論文は末尾に別記し、本ノートの主張根拠には使用していない。内部の作業台帳は source/review/ai-education-learning-sciences-trends/papers.md。
チュータリング・フィードバック・ITS・メタ分析
- Kestin, G., Miller, K., Klales, A., Milbourne, T., & Ponti, G. (2025). AI tutoring outperforms in-class active learning: an RCT introducing a novel research-based design in an authentic educational setting. Scientific Reports 15. https://doi.org/10.1038/s41598-025-97652-6
- Bastani, H., Bastani, O., Sungu, A., Ge, H., Kabakçı, Ö., & Mariman, R. (2025). Generative AI without guardrails can harm learning: Evidence from high school mathematics. PNAS 122. https://doi.org/10.1073/pnas.2422633122 (訂正: https://doi.org/10.1073/pnas.2518204122)
- Ma, N., & Zhong, Z. (2025). A Meta-Analysis of the Impact of Generative Artificial Intelligence on Learning Outcomes. Journal of Computer Assisted Learning. https://doi.org/10.1111/jcal.70117
- Liu, Z., Zuo, H., & Lu, Y. (2025). The Impact of ChatGPT on Students’ Academic Achievement: A Meta-Analysis. Journal of Computer Assisted Learning. https://doi.org/10.1111/jcal.70096
- Sun, L., & Zhou, L. (2024). Does Generative Artificial Intelligence Improve the Academic Achievement of College Students? A Meta-Analysis. Journal of Educational Computing Research. https://doi.org/10.1177/07356331241277937
- Liu, X., Guo, B., He, W., & Hu, X. (2025). Effects of Generative Artificial Intelligence on K-12 and Higher Education Students’ Learning Outcomes: A Meta-Analysis. Journal of Educational Computing Research 63(5). https://doi.org/10.1177/07356331251329185
- Zhao, Y., Yue, Y., Sun, Z., Jiang, Q., & Li, G. (2025). Does Generative Artificial Intelligence Improve Students’ Higher-Order Thinking? A Meta-Analysis Based on 29 Experiments and Quasi-Experiments. Journal of Intelligence 13(12). https://doi.org/10.3390/jintelligence13120160
- Mo, F., Huang, J., Yang, Y., Özen, Z., Maeda, Y., & Olenchak, F. R. (2025). Undergraduate students’ learning outcomes with ChatGPT: A meta-analytic study. Computers in Human Behavior Open. https://www.sciencedirect.com/science/article/pii/S2666920X25001766
- Bauer, E., Greiff, S., Graesser, A. C., Scheiter, K., & Sailer, M. (2025). Looking beyond the Hype: Understanding the Effects of AI on Learning. Educational Psychology Review. https://doi.org/10.1007/s10648-025-10020-8
- Bauer, E., et al. (2025). Effects of Artificial Intelligence on Educational Functioning: A Review and Meta-Analysis. Educational Psychology Review. https://doi.org/10.1007/s10648-025-10085-5
- Létourneau, A., Deslandes Martineau, M., Charland, P., Karran, J. A., Boasen, J., & Léger, P. M. (2025). A systematic review of AI-driven intelligent tutoring systems (ITS) in K-12 education. npj Science of Learning. https://doi.org/10.1038/s41539-025-00320-7
- Bauer, E., Greiff, S., Scheiter, K., & Sailer, M. (2025). Effects of AI-generated adaptive feedback on statistical skills and interest in statistics: A field experiment in higher education. British Journal of Educational Technology. https://doi.org/10.1111/bjet.13609
- Lu, X., Ju, K. P., Dudley, M., Sano, L., & Wang, X. (2026). AI-Mediated Feedback Improves Student Revisions: A Randomized Trial with FeedbackWriter in a Large Undergraduate Course. CHI 2026. https://doi.org/10.1145/3772318.3791121
- LearnLM Team (Google DeepMind). (2025). AI tutoring can safely and effectively support students: An exploratory RCT in UK classrooms. arXiv:2512.23633 [未査読]. https://arxiv.org/abs/2512.23633
学習科学の理論(自己調整学習・認知的オフロード・足場かけ)
- Fan, Y., Tang, L., Le, H., Shen, K., Tan, S., Zhao, Y., Shen, Y., Li, X., & Gašević, D. (2024/2025). Beware of metacognitive laziness: Effects of generative artificial intelligence on learning motivation, processes, and performance. British Journal of Educational Technology 56. https://doi.org/10.1111/bjet.13544
- Gerlich, M. (2025). AI Tools in Society: Impacts on Cognitive Offloading and the Future of Critical Thinking. Societies 15(1). https://doi.org/10.3390/soc15010006
- Lee, H.-P., Sarkar, A., Tankelevitch, L., Drosos, I., Rintel, S., Banks, R., & Wilson, N. (2025). The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers. CHI 2025. https://doi.org/10.1145/3706598.3713778
- Xu, X., Qiao, L., Cheng, N., Liu, H., & Zhao, W. (2025). Enhancing Self-Regulated Learning and Learning Experience in Generative AI Environments: The Critical Role of Metacognitive Support. British Journal of Educational Technology. https://doi.org/10.1111/bjet.13599
- Xu, J., Luo, Y., et al. (2025). AI Support in Self-Regulated Learning: A Decade of Technological Evolution and Meta-Analysis. British Journal of Educational Technology. https://doi.org/10.1111/bjet.70058
- Fütterer, T., Bardach, L., Kuhn, J., Keller, S. D., & Gerjets, P. (2026). Enhancing School Students’ Self-Regulated Learning through Generative AI Support: A Randomized Controlled Trial. Educational Psychology Review. https://doi.org/10.1007/s10648-026-10133-8
- Ng, D.T.K., Tan, C.W., & Leung, J.K.L. (2024). Empowering Student Self-Regulated Learning and Science Education through ChatGPT: A Pioneering Pilot Study. British Journal of Educational Technology. https://doi.org/10.1111/bjet.13454
- Melanou, C. (2026). Scaffolding Generative AI as a Tutor: A Quasi-Experimental Study of Learning Outcomes and Motivational, Cognitive and Metacognitive Processes. Education Sciences 16(4). https://doi.org/10.3390/educsci16040651
- Lan, M., & Zhou, X. (2025). A Qualitative Systematic Review on AI Empowered Self-Regulated Learning in Higher Education. npj Science of Learning. https://doi.org/10.1038/s41539-025-00319-0
評価・学術的誠実性
- Liang, W., Yuksekgonul, M., Mao, Y., Wu, E., & Zou, J. (2023). GPT detectors are biased against non-native English writers. Patterns (Cell Press) 4. https://doi.org/10.1016/j.patter.2023.100779
- Xia, Q., Weng, X., Ouyang, F., Lin, T. J., & Chiu, T. K. F. (2024). A scoping review on how generative artificial intelligence transforms assessment in higher education. International Journal of Educational Technology in Higher Education. https://doi.org/10.1186/s41239-024-00468-z
- Kofinas, A. K., Tsay, C. H.-H., & Pike, D. (2025). The impact of generative AI on academic integrity of authentic assessments within a higher education context. British Journal of Educational Technology 56(6). https://doi.org/10.1111/bjet.13585
- Johnston, H., Wells, R. F., Shanks, E. M., Boey, T., & Parsons, B. N. (2024). Student perspectives on the use of generative artificial intelligence technologies in higher education. International Journal for Educational Integrity. https://doi.org/10.1007/s40979-024-00149-4
- Gruenhagen, J. H., Sinclair, P. M., Carroll, J.-A., Baker, P. R. A., Wilson, A., & Demant, D. (2024). The rapid rise of generative AI and its implications for academic integrity: Students’ perceptions and use of chatbots for assistance with assessments. Computers and Education: Artificial Intelligence. https://doi.org/10.1016/j.caeai.2024.100273
- Curtis, G. J. (2025). The two-lane road to hell is paved with good intentions: why an all-or-none approach to generative AI, integrity, and assessment is insupportable. Higher Education Research & Development 44(8). https://doi.org/10.1080/07294360.2025.2476516
- Hadra, M. G., Cambridge, K., & Mesbah, M. (2026). Evaluating the accuracy and reliability of AI content detectors in academic contexts. International Journal for Educational Integrity. https://doi.org/10.1007/s40979-026-00213-1
公平性・教師の役割変容・制度的対応
- Yusuf, A., Pervin, N., Román-González, M., & Noor, N.M. (2024). Generative AI in education and research: A systematic mapping review. Review of Education 12, e3489. https://doi.org/10.1002/rev3.3489
- Lin, X., & Tan, H. (2025). A Systematic Review of Generative AI in K–12: Mapping Goals, Activities, Roles, and Outcomes via the 3P Model. Systems 13(10), 840. https://doi.org/10.3390/systems13100840
- Jin, Y., Yan, L., Echeverria, V., Gašević, D., & Martinez-Maldonado, R. (2025). Generative AI in higher education: A global perspective of institutional adoption policies and guidelines. Computers and Education: Artificial Intelligence 8, 100348. https://doi.org/10.1016/j.caeai.2024.100348
- Tan, Q. (2025). Reimagining teacher development in the era of generative AI: A scoping review. Teaching and Teacher Education 168, 105236. https://doi.org/10.1016/j.tate.2025.105236
- Cheah, Y.H., Lu, J., & Kim, J. (2025). Integrating generative artificial intelligence in K-12 education: Examining teachers’ preparedness, practices, and barriers. Computers and Education: Artificial Intelligence 8, 100363. https://doi.org/10.1016/j.caeai.2025.100363
- Capraro, V., Lentsch, A., Acemoglu, D., et al. (2024). The impact of generative artificial intelligence on socioeconomic inequalities and policy making. PNAS Nexus 3(6), pgae191. https://doi.org/10.1093/pnasnexus/pgae191
- Khlaif, Z.N., Alshakhshir, R., Hamamra, B., & Joma, A. (2025). Reimagining inclusive education: The assistive power of generative AI in promoting accessibility and equity. British Journal of Visual Impairment. https://doi.org/10.1177/02646196251382469
- Jiang, Y., Xie, L., & Cao, X. (2025). Exploring the Effectiveness of Institutional Policies and Regulations for Generative AI Usage in Higher Education. Higher Education Quarterly 79(4). https://doi.org/10.1111/hequ.70054
- UNESCO (Miao, F., & Holmes, W.). (2023). Guidance for Generative AI in Education and Research. UNESCO. https://www.unesco.org/en/articles/guidance-generative-ai-education-and-research
撤回論文(本ノートの根拠に使用せず・注意喚起)
- [撤回] Wang, J., & Fan, W. (2025). The effect of ChatGPT on students’ learning performance, learning perception, and higher-order thinking: insights from a meta-analysis. Humanities and Social Sciences Communications. https://doi.org/10.1057/s41599-025-04787-y (2026-04-22 撤回。データ不整合。撤回ノート: https://doi.org/10.1057/s41599-026-07310-z)
関連ノート
ai-psychology-cognitive-science-trends / ai-humanities-digital-humanities-trends / design-education-ai-adaptation