
定期テスト作成、3つのAIを並べてみたら1つ余った|比較まとめ編
定期テストづくりをAIに手伝わせる実験を、これまで3回やってきた。
NotebookLMで作り、Claudeで作り、ChatGPTでも作った。
前回の記事で「いずれ比較を整理する」と書いたので、今回はその回収です。
どれが一番優秀かを決めるというより、実際に使ってみて、どの工程にどのAIが合ったのか。
今のところの正直な感触をまとめておきます。
先に結論
私の今のやり方では、定期テスト作成はNotebookLMとClaudeの2つで、ほぼ一通り終わりそうです。
ChatGPTも、問題、解答、配点案、解答用紙まで一通り作れました。
できることの幅は、むしろ一番広いと思います。
ただ、今回のように「授業資料の範囲から外れず、決まった形式でテストを作る」という仕事では、その自由度の高さが、かえって扱いにくさにもなりました。
何でもできるのに、今回は置く場所が見つけにくかった。
タイトルの「1つ余った」は、そんな意味です。
工程別に並べてみた
3回の実験を、工程ごとに表にしてみました。
◎=向いていた
○=できる
△=今回の使い方では少し手間がかかった

キャプション案:私の使い方では、前半はNotebookLM、後半はClaudeに寄った
表を眺めると、役割の分かれ方はかなりはっきりしています。
授業プリントや授業原稿など、資料を読ませて問題を作る工程はNotebookLM。
解答用紙、模範解答、採点基準、配点案など、形を整える工程はClaude。
ChatGPTが一番向いていると感じたのは、資料がない状態から問題の切り口を考えるような場面でした。
ChatGPTの席が見つかりにくかった理由
ChatGPT編では、問題から解答用紙まで、約40分でたたき台を作ることができました。
万能なのは本当です。
ただ、授業で扱っていない内容が少し混ざったり、語句の使い方がこちらの授業と微妙にずれたりすることがありました。
もちろん、指示を細かくすれば修正できます。
ただし、そのためには、
「資料の外に出ない」
「この難易度にする」
「この問題形式を繰り返す」
「余計な発展を入れない」
といった枠を、こちらでかなり丁寧に作る必要があります。
NotebookLMは、最初から「入れた資料の中で考える」ことを前提にしています。
授業プリントや教科書の該当部分を入れておけば、そこから大きく離れにくい。
定期テスト作成では、この狭さがむしろ使いやすさになりました。
テスト前の立て込んだ時期に助かるのは、単純な賢さだけではありません。
「この問題、本当に授業で扱ったかな」と一問ずつ疑いながら確認する、その気疲れが少ないこともかなり大きいです。
「アイデア出しはChatGPT」も少し揺らいだ
最後までChatGPTの席として残ると思っていたのが、論述問題や選択問題のアイデア出しでした。
発想の速さや自由さは、ChatGPTの得意なところです。
ただ、手元の問題例や入試問題の傾向をNotebookLMに読ませると、問題の切り口もかなり出せました。
考えてみれば、問題集や入試問題は、すでに誰かが考え抜いた問いの集まりです。
何もないところからAIに発想させるより、良い問題例を参考にさせた方が早く、外れにくいこともあります。
発散させる作業まで、資料の中である程度できてしまいました。
それでもChatGPTに戻る場面
もちろん、ChatGPTが不要になったわけではありません。
読ませる資料がまだ存在しない問題では、やはり出番があります。
たとえば時事問題、単元をまたぐ論述テーマ、既存の教材にはまだ載っていない切り口です。
公民では、直近のニュースや社会の動きを扱いたい場面もあります。
そういうときは、資料の中だけで考えるNotebookLMより、自由に発想できるChatGPTの方が使いやすいこともある。
今回は先発ではなかったけれど、ベンチにはいる。
今のところは、そんな位置づけです。
Claudeの席は動かなかった
解答用紙、模範解答、採点基準、配点案。
この一式をWordで整えて出す仕事は、3回試した中ではClaudeが一番安定していました。
配点も、「100点満点になるように提案して」と頼むと、大問ごとの表にして出してくれます。
そのまま採用しなくても、たたき台があるだけで決めるのがかなり早くなります。
誤植や表記ゆれの確認も、どのAIでもできます。
ただ、私の感覚ではClaudeが細かいところまで拾いやすかった。
問題を作るのはNotebookLM。
仕上げるのはClaude。
この分業は、今のところ変わっていません。
最後は好みと慣れ
とはいえ、これはAIの絶対的な順位ではありません。
最後は、使う人の好みと慣れもかなり大きいと思います。
ChatGPTに細かく条件を与えることに慣れている人なら、今回よりもっと効率よく使えるはずです。
逆に、私は定期テスト作成では、自由度の高い道具を細かく制御するより、最初から資料の中にとどまるNotebookLMの方が楽でした。
Claudeについても、Wordでの出力や文章の整え方が自分の好みに合っていた、という面があります。
3つの優劣というより、仕事との相性です。
定期テスト作成は、扱う範囲や参考資料が最初から決まっている仕事です。
そのため今回は、自由に考えるAIよりも、資料に沿って作るAIと、形を整えるAIの組み合わせが使いやすかったのだと思います。
まとめ
今のところ、私の中では次の分業に落ち着いています。
・資料がある問題作成はNotebookLM
・解答用紙、配点、採点基準などの仕上げはClaude
・資料がない時事問題や新しい切り口はChatGPT
3つ全部を、毎回使う必要はありませんでした。
ただし、これはあくまで私の授業、私の作り方、今回使った資料での結果です。
使い慣れているAIや、作りたいテストの形式によって、結論は変わると思います。
そして最後は、必ず自分で見る。
ここだけは、3つ試しても変わらなかった唯一の固定項です。
これまでの3回はこちら。
🔗 NotebookLM編
https://note.com/chic_quokka9423/n/nd83d2ee10a45
🔗 Claude編
https://note.com/chic_quokka9423/n/n87bdb2c88f04
🔗 ChatGPT編
https://note.com/chic_quokka9423/n/n86af53b7ebb8