日本語教師の教材制作ノート
AIでJLPT教材を作ろうとして、
分析ばかり増えてしまった話
レッスンで使う練習問題を、もう少し増やしたい。そのためにAIを使い始めたはずが、いつの間にか、問題を作ることよりも分析や検証を続けることが中心になっていました。
これは、ChatGPTとCodexを使ってJLPTの追加問題を作ろうとした、一人の日本語教師の振り返りです。何が分かり、どこで目的から離れたのかを整理して、他の先生方に進め方を相談したいと思います。
本来は、授業の練習量を補いたかった
公式JLPT問題を基準にしつつ、文法Buddyその他の市販問題集を横断的に参照し、公式で実際に出題される問題に近い追加問題を作る。
目指していたのは、レッスンで使う練習量を補うことでした。AI作問の理論を作ることでも、問題形式の一般理論を研究することでも、JLPT全級の作問原理を解明することでもありません。
公式と市販教材を見比べるのも、授業に合う問題を作るためです。最後に評価したかったのは「どれだけ詳しく説明できたか」ではなく、「教師が使いたい問題が、負担に見合う形でできたか」でした。
実際には、N1〜N5の分析と検証へ
対象にしたのは、四つの語句を並べ替え、★の位置に入るものを選ぶ問題です。作業はN1〜N5の公式問題の分析と市販教材との比較へ広がりました。参照した教材には、文法Buddy、ベスト総合問題集、日本語総まとめなどがあります。
合計17問を試作し、四つの語句の並べ方をすべて調べる「24順列」の監査も行いました。さらに、級をまたいだ成功・失敗パターンの比較、自然さ判定の再検証、N1〜N5の総括へと続きました。
| 判定 | 問題数 |
|---|---|
| 採用候補 | 8問 |
| 要修正 | 3問 |
| 不採用 | 6問 |
採用候補はAI側の判定であり、教師が正式採用した問題数を意味しません。候補数の増加には、問題を改善した結果ではなく、AIの判定を修正した結果も含まれます。授業での有効性や実際の難度を実証した数でもありません。
その過程で、分析や引継ぎのためのMarkdown文書が多数作られました。最後には参照資料が増えすぎたため、普段読むものと必要時だけ読むアーカイブを整理する作業まで必要になりました。
途中で、調べること自体が中心になった
- 本来の目的追加問題で
練習量を補う - 作業の拡大分析・検証の
対象が増える - 目的からのずれ教材制作より
研究作業が中心に - 最後の作業参照資料の
整理まで必要に
別解が見つかれば、その原因を調べる。ある級で分かったことがあれば、別の級でも確かめる。自然さの判定が変われば、以前の結論を見直す。一つずつを見ると理由のある作業でも、積み重なるうちに、本来の目的より大きくなっていました。
成功条件、失敗条件、級差、自然さ、24順列、横断比較。その説明は増えていきました。しかし、「分析できること」と「今回、分析する価値があること」を、AI側が十分に区別できていませんでした。
分かったことは、確かにあった
今回確認した範囲では、並べ替え問題を考えるうえで役立つ点もありました。語句同士が強く結びつくだけでは足りず、そのまとまり全体が別の位置へ動かないように、固定部分や意味関係で配置を制約する必要があることです。
また、助詞や機能語を細かく分けても、必ずしも難しくなるわけではありませんでした。語彙や語の組み合わせは正答を支える一方で、自然な別解を生むこともありました。
24通りを見ることで、本当に自然な別解を発見できた例もあります。そして、AIの自然さ判定を教師が疑ったことで、判定基準そのものの問題にも気づけました。
ただし、これらは確認した問題の範囲で得た知見です。知見が残ったことだけで、教材制作全体が成功だったとは評価できません。
教材制作として、うまくいかなかったこと
目的を伝えていても、AIが局所的な課題へ進んだ
教師側からは、大局的に目的を見ること、直前の論点だけに引っ張られないこと、目的をずらさないことを繰り返し伝えていました。
それでも、ChatGPT側の提案は「次はN2」「次はN3」「横断比較」「再判定」「総括」と広がっていきました。教師の指示不足というより、明示された目的に照らして作業範囲を抑えることを、AI側が十分にできなかった問題だと考えています。
詳しい説明が、次の問題の質につながりきらなかった
失敗原因や成功条件は大量に記録されました。しかし、それを使えば教師が使いたい問題を安定して作れる、というところまでは確認できませんでした。説明が増えることと、教材制作能力が上がることは別です。
教師が二つのAIの間を往復した
ChatGPTで指示文を作る
↓ 教師がCodexへコピー
↓ Codexの長い回答を教師がChatGPTへコピー
↓ ChatGPTが次の指示を作る
この手作業を何度も繰り返しました。作業中は5時間単位の使用量も気にしながら進めており、問題の質を判断する以外にも負担がかかっていました。
多数のMarkdown文書は、後にはそれ自体がCodexの参照負荷になりました。制作を助けるために残した記録を、今度は読みすぎないように整理する必要が生じたのです。
具体例:「意味が作れる」と「自然」は違った
自作の試作問題で、Codexは次の並びを一度「通常の自然な競合別解」と判定しました。
わたしは、父がすわって作った小さいいすにいます。
父が座ったまま椅子を作り、今、自分がその椅子にいる——そういう状況を想像することはできます。しかし、座って製作したという情報の唐突さや、「小さいいすにいます」という言い方まで含めて、普通の完成文として自然に受け取れるかは別の問題でした。
教師の指摘を受け、「文法的に解析できる」「意味を想像できる」と「普通の日本語として自然」を分けて再判定し、この並びは○から△へ変更されました。△は、特定の状況なら意味を理解できても、通常の自然な競合別解としては扱わない、という判定です。
これは単に好みの語順でないものを排除するという話ではありません。元の文にない事情を補って、ようやく自然に見える文まで○にしていたことが問題でした。
24通りすべてを確認しても、自然さ判定の基準がずれていれば、精密に間違えるだけ。
並べ方を漏れなく調べることと、一つ一つを正しく判断することは、分けて考える必要がありました。
なぜ、途中で止まれなかったのか
「教師がもっと早く止めればよかった」とだけ整理すると、今回起きたことを取り落とします。教師側は大局的な目的を守るよう何度も指示していました。
また、途中からは「ここで局所的な指摘をすると、AIがまた直前の指摘だけに引っ張られ、別方向へぶれるのではないか」と考え、あえて見守った部分もありました。監督していなかったわけではありません。
振り返ると、目の前の疑問を解消する提案が続き、「この作業を足すことで、授業に使える問題に近づくのか」という問いへ戻る機会が足りませんでした。目的を伝えていてもAI側が局所課題へ引っ張られ続けたことが、今回の難しさでした。
今後は、教師の監督を際限なく増やすのではなく、少数試作の時点で「この方向で本当に授業に使えそうか」を判断する区切りを置きたいと考えています。
残ったものと、負担に見合ったかは別
試作や分析記録が残り、判定上の注意点も分かりました。全く何も残らなかったわけではありません。一方、今回の教師側の評価は、次のとおりです。
教材制作という本来の目的から見ると、投入した時間・使用量・確認負担に対して成果が小さく、作業全体はほとんど意味をなさなかった。
これは、今回の進め方に対する評価です。記録が増えたことや採用候補が残ったことを理由に、後から成果を美化したくはありません。必要だったのは、詳しい分析報告より、授業の練習量を補える問題でした。
この経験だけで、AIは教材制作に使えないとも言い切れません。ただ、検証を重ねれば自然に実用的な成果へ近づく、とは考えられなくなりました。
今なら、少数試作から確かめる
今後は、★並べ替えで行った工程を、漢字・語彙・読解などへそのまま展開しない方針です。最初に大量の分析Markdownを作ることも、標準工程にはしません。
- 必要な範囲だけ参照する。
公式問題と複数の市販教材を、今回作りたい問題に必要な範囲で見比べる。 - 少数の追加問題を作る。
大きな分析へ広げる前に、具体的な問題案を出す。 - 教師が実際に見る。
「この方向で授業に使えそうか」を、少数の段階で判断する。 - 問題があった箇所だけ追加分析する。
自然さ、別解、級への適合など、改善したい点に範囲を絞る。 - 改善しなければ、方法を変えるか打ち切る。
分析の追加を自動的な次の一手にしない。
検証量も問題形式に応じて変えます。並べ替えで残す候補の別解確認と、読解で本文と解答の対応を確かめる作業は同じではありません。検証を省くのではなく、何を確かめる必要があるかを、その都度決める方針です。
この進め方で負担や質がどの程度改善するかは、まだ確かめていません。次は、少数の問題で実用性を見ながら判断したいと思います。
他の先生方に、相談したいこと
AIを使った教材制作で、皆さんはどこに区切りを置いていますか。うまくいった経験だけでなく、途中で方法を変えた経験も伺いたいです。
- 公式問題と複数の市販教材から追加問題を作るとき、どこまで事前分析をしますか。数問作り始める目安はありますか。
- AIが作った問題の「自然さ」や「級への適合」は、どこまでAIに任せていますか。
- 教師が必ず見る部分と、AIに任せられる部分を、どう分けていますか。
- 数問試して質が上がらないとき、さらに分析しますか。教師が直接直しますか。それとも、その作問にはAIを使わないと判断しますか。
- 時間や確認負担に見合わないと判断する基準はありますか。問題数、修正回数、所要時間など、実際の目安があれば知りたいです。
すべてへの回答でなくても、一つの問いへの経験談だけでもありがたいです。「自分の場合はここで止めた」「この確認だけは教師がしている」といった具体的なお話を、意見交換の場で共有していただければと思います。