TutorMomentsとは:Ai2が公開した7モデル×3指標×2条件の全スコア
Ai2が2026年8月7日に公開した評価フレームワーク TutorMoments の42個のスコアを1枚の表に整理。素のプロンプトでは7モデルすべてが適切な負荷かけ0.223以下、評価内容を明示したプロンプトでは指標ごとの首位も入れ替わります。人間チューターの数値の読み方も原典で確認しました。
答え 素のプロンプト・適切な負荷かけ 0.223 以下 7モデル全て(Ai2)
この記事は、海外の一次情報をAIエージェントが調査・検証・翻訳して整理したものです。実際に製品やサービスを試した体験談ではありません。
結論:同じモデルでも、プロンプトの条件でスコアが別物になる
Ai2(Allen Institute for AI)が2026年8月7日に公開した TutorMoments は、AIチューターが「手を貸す場面」と「あえて手を貸さない場面」を見分けられるかを測る評価フレームワークです。Ai2 の発表によると、素のプロンプトでは7モデルすべてが「適切な負荷かけ」で0.223以下にとどまり、評価内容を明示したプロンプトに変えると全モデル・全指標でスコアが上がります。
| 項目 | 内容 |
|---|---|
| 公開日 | 2026年8月7日(preview) |
| 発行元 | Ai2(Allen Institute for AI) |
| 掲載先 | allenai.org と Hugging Face Blog(同一本文) |
| データセット | 米国 grades 2-7 の1対1数学個別指導の書き起こし462件 |
| 注釈 | 27名の米国在住の教員注釈者。注釈対象は122件 |
| 評価対象 | 7モデル×3指標×2プロンプト条件 |
本記事の数値と引用はすべて Ai2 自身の発表(公式ブログとテクニカルレポート)が根拠です。2026年8月10日時点で、TutorMoments を扱った独立した第三者の検証・追試は見つかりませんでした。
42個のスコアの全表(7モデル×3指標×2条件)
Ai2 のテクニカルレポート Table 8 と公式ブログの表に載っている数値です。左3列が素のプロンプト(plain)、右3列が評価内容を明示したプロンプト(evaluation-aware)。数値が大きいほど良いとされる指標です。
| モデル | 素:足場かけ | 素:負荷かけ | 素:過剰回避 | 明示:足場かけ | 明示:負荷かけ | 明示:過剰回避 |
|---|---|---|---|---|---|---|
| Claude Opus 4.8 | 0.615 | 0.208 | 0.462 | 0.858 | 0.831 | 0.896 |
| Claude Sonnet 4.6 | 0.573 | 0.085 | 0.437 | 0.831 | 0.792 | 0.913 |
| DeepSeek V4 Pro | 0.485 | 0.088 | 0.379 | 0.712 | 0.492 | 0.623 |
| Gemini 2.5 Pro | 0.727 | 0.223 | 0.546 | 0.896 | 0.712 | 0.854 |
| Gemini 3.5 Flash | 0.723 | 0.158 | 0.598 | 0.885 | 0.646 | 0.817 |
| GPT 5.5 | 0.269 | 0.046 | 0.173 | 0.773 | 0.531 | 0.665 |
| GPT 5.4 mini | 0.181 | 0.023 | 0.188 | 0.738 | 0.404 | 0.598 |
3指標は、生徒が支えを必要としているときに足場をかけたか(適切な足場かけ)、もっと挑戦できる状態のときに負荷をかけたか(適切な負荷かけ / rigor)、場面が求める以上に難度を下げなかったか(過剰な足場かけの回避)です。
素のプロンプトの中身
素のプロンプトで与えられている指示は「良いチューティングについて知っていることをすべて使って、生徒に適切に応答せよ」だけです。Ai2 はテクニカルレポートで、この条件では LM チューターが負荷をかけそこね、しばしば過剰に足場をかけ、「親切なアシスタント」のベースラインに落ち着くと述べています。GPT 5.5 でさえ、素のプロンプトで適切に負荷をかけたのは4.6%の場面だとされています。
明示プロンプトで動く幅
Ai2 が公開した表から本記事が2例を取り出すと、「適切な負荷かけ」の GPT 5.4 mini が0.023から0.404へ、「適切な足場かけ」の GPT 5.5 が0.269から0.773へです。前者を倍率にすると約17.6倍になりますが、この倍率は原典に無く、本記事が公開値から計算したものです。原典が示しているのは絶対値のほうです。
条件別:指標ごとの首位が入れ替わる
以下は Ai2 が書いた文ではなく、Ai2 が公開した表を本記事が指標ごとに並べ替えて確認した結果です。Ai2 は指標ごとに別々の表を出しており、総合順位を定義していません。
| 指標 | 素のプロンプトの首位 | 明示プロンプトの首位 |
|---|---|---|
| 適切な足場かけ | Gemini 2.5 Pro 0.727 | Gemini 2.5 Pro 0.896 |
| 適切な負荷かけ | Gemini 2.5 Pro 0.223 | Claude Opus 4.8 0.831 |
| 過剰な足場かけの回避 | Gemini 3.5 Flash 0.598 | Claude Sonnet 4.6 0.913 |
機械的に確認できた順位の入れ替わりは、3つの指標にまたがる次の5件です。
| 指標 | モデル | 素の順位 | 明示の順位 |
|---|---|---|---|
| 適切な足場かけ | DeepSeek V4 Pro | 5位 | 7位 |
| 適切な負荷かけ | Claude Sonnet 4.6 | 5位 | 2位 |
| 適切な負荷かけ | Gemini 2.5 Pro | 1位 | 3位 |
| 過剰な足場かけの回避 | Gemini 3.5 Flash | 1位 | 4位 |
| 過剰な足場かけの回避 | Claude Sonnet 4.6 | 4位 | 1位 |
手順:このスコア表を自分の判断に使うとき
- どちらのプロンプト条件の数値かを必ず確認する。 同じモデルでも「適切な負荷かけ」は条件で大きく動きます(GPT 5.4 mini は0.023と0.404、Claude Sonnet 4.6 は0.085と0.792)
- 指標を1本に丸めない。 明示プロンプトの首位は指標ごとに Gemini 2.5 Pro / Claude Opus 4.8 / Claude Sonnet 4.6 と分かれます
- rigor の低さを単独で結論にしない。 Ai2 自身が採点の信頼性に留保を付けています
- 応答速度と並べて見る。 高スコアのモデルは平均10秒超だとされています
- 教科・学年・国の範囲を確認する。 対象は米国の小中学校の算数・数学です
評価の仕組み(replay 方式)
Ai2 の説明では、教員が指定した key moment で書き起こしを止め、そこから LLM がチューター役を引き継ぎます。生成されるのは合計5ターンで、内訳はモデル3ターン+合成生徒2ターン。5往復ではありません。合成生徒を演じるのは Claude Opus 4.6 で、元の書き起こしを見られる「オラクル生徒」だとテクニカルレポートに明記されています。評価対象は520件の key moment で、足場かけが適切な場面と負荷かけが適切な場面が半々の構成とされています。
注意点
人間チューターの数値をどう扱うか
Ai2 は書き起こしの中の人間チューターについて、モデルと同じ採点パイプラインを、同じ判断地点で、カット後5ターンに適用した値として、適切な足場かけ0.458、適切な負荷かけ0.182、過剰な足場かけの回避0.496を併記しています。
一方で Ai2 は同じ箇所で「これはAIチューターが人間の教師を上回るという主張ではない」と明記しています。Ai2 が挙げる理由は、注釈者が改善の余地のある場面を選ぶよう指示されており、データが人間側の取りこぼしに寄っていることです。Ai2 は人間チューターを、理想の実践のモデルではなく自然な参照点だと位置づけています。
加えて、採点の相手が両者で異なります。人間チューターは実在の生徒とのやりとりの続き5ターン、モデルは合成オラクル生徒との replay です。Ai2 はパイロット実行の観察として、オラクルの合成生徒でさえ不自然に成功しやすい学習行動を生みがちだと書いています。
rigor には Ai2 自身の留保が付いている
Ai2 は、負荷かけは足場かけよりノイズが多く採点パイプラインの検出の信頼性が相対的に低いこと、注釈中の負荷かけの場面が260件で足場かけの738件より少ないことを挙げています。
462件すべてに注釈が付いているわけではない
公式ブログは462件の書き起こしと1,500件超の教員注釈を続けて書いていますが、テクニカルレポートによれば注釈対象は462件のうち122件で、そこに含まれる固有の key moment が1,536件です。
高スコアのモデルは応答が遅い
Ai2 はテクニカルレポートで、明示プロンプトで高いスコアを出した Gemini 2.5 Pro と Claude Opus 4.8 が1応答あたり平均10秒を超えており、これは教育向けの実運用には現実的でない可能性があると述べています。可能性の形の記述であり、運用できないと断定はしていません。
Ai2 が挙げている限界
TutorMoments は preview 段階の公開です。Ai2 は、自動評価は判断地点での振る舞いの手がかりにはなるが実際の生徒と学習成果を伴う研究の代わりにはならないこと、データセットが米国中心で主に小中学校の算数・数学であり単一の教員プールによる注釈であること、知見が他の教科・学年・環境に一般化できるとは限らないことを明記しています。
評価の条件がスコアの意味を変える論点は、隔離データによる評価プログラム AITE を整理した記事と、トークン予算でスコアが動く AISI の指摘の記事もあわせて参照してください。本記事の数値と引用は2026年8月10日に原典で照合したものです。更新の有無は Ai2 の公式ページでご確認ください。
参考にした情報源
全6件のうち0件 が公的機関の公開資料です。
- TutorMoments: Do AI tutors know when to help and when to hold back?(Ai2 公式ブログ)
- TutorMoments: Do AI tutors know when to help and when to hold back?(Hugging Face Blog)
- When Help is Unhelpful: Evaluating AI Tutors for Productive Struggle(テクニカルレポート PDF)
- TutorMoments-Preview プロジェクトサイト
- allenai/tutormoments-preview(データセットカード)
- allenai/tutormoments README(replay パイプラインのコード)