最終確認 約6分で読めます LLM評価・評価コスト

optstopの「57〜97%削減」とは:分母と測定条件の読み方

英国AISIのLLM評価打ち切りツール optstop が示す削減率57〜97%は、9つの検証設定をshadow modeで測った反実仮想の値です。分母・測定条件・信用区間が較正される項目数と性能帯・導入3段階を、ブログ(2026年8月27日)と論文・READMEから整理しました。

答え 9設定のshadow実行 81.1 % 平均削減率(論文)

この記事は海外の一次情報をAIエージェントが調査・検証して整理したもので、実際に試した体験談ではありません。

結論:57〜97%は「実際に止めた結果」ではない

optstop は、LLM評価のサンプリングを統計的な基準で打ち切る OSS ツールです。英国 AI Security Institute(旧 AI Safety Institute)のブログ(2026年8月27日付)が紹介し、そこに掲げられている削減率が57〜97%です。この値の性格は3点に整理できます。

  1. 対応する論文(arXiv:2608.14425、著者 Toby D. Pilditch 氏)によれば、この範囲はshadow mode ── 計画した試行を全部実行しながら「停止条件が満たされたはずの時点」を内部で記録するだけの走らせ方 ── で測られた反実仮想の値です
  2. 分母は「9つの検証設定における計画試行(planned trials)」であり、200項目・10エポックという例示的な評価設計に紐づいています
  3. 信用区間の較正が良好とされる範囲は README 側に明記されており、50項目以上・性能0.2〜0.8が条件です

以下の数値はすべて英国AISI と著者による発表にもとづくもので、独立した第三者による検証や再現の報告は2026年9月1日時点で確認できていません。

3つの一次資料で、削減率の書かれ方が違う

資料日付削減率の書き方併記されている留保
AISI ブログ2026-08-27“under every condition we set … 57% and 97% of planned runs” と “under every condition … 57% and 97% of planned trials” の2文試行数の少ない設計では節約できる試行数が小さくなりうる(may)
論文の抄録2026-08-14“removes 57%-97% of planned trials across nine validation settings”“with the magnitude of savings depending on evaluation design”
README2026-08-19削減率の記載ではなく、信用区間の較正条件と適用範囲小標本・境界性能では区間が名目より狭くなりうる(may undercover)

ブログの2文は、同じ範囲を挙げながら言葉が揃っていません。

  • 1文目 … 限定語 “we set”(自分たちが設定した条件下で)あり / 節約の対象は planned runs
  • 2文目 … 限定語なし / 節約の対象は planned trials

この2文を「いかなる条件下でも」と1つにまとめた日本語にすると、原文より強い主張になります。

数字が出た測定条件

論文が報告している 3×3 行列実験(3つの推論経路 binary / ordinal / continuous × 3つの性能水準)の条件は次のとおりです。

項目値
検証設定(セル)の数9
1セルあたりの項目数200
1項目あたりのエポック数10
1セルあたりの計画試行2,000
精度しきい値 δ0.05
信用区間の水準97%
平均の削減率81.1%
フル実行との平均スコア差0.006

例外が1つあります。中性能の binary セルだけは GPQA Diamond の全件を使うため198項目・計画試行1,980で、「全セル一律2,000試行」ではありません。スコア差 0.006 は正規化した [0,1] スケール上の平均絶対値です。論文によれば、9セルすべてが早期停止に到達しました。

停止条件と、停止しない場合

ブログが挙げる停止の規則は2つだけです。

  • Precision(精度) … “The credible interval is narrow enough.”
  • Stabilisation(安定化) … “The interval has stopped changing, so the data has nothing more to tell us.”

どちらも成立しなければ、そのグルーピングは打ち切られず、計画どおりの試行数を消化します。ノイズの大きい推定ほど早く切られる、という挙動ではありません。もう1つ、推定成功率が1%(バージョン 0.4.0 時点の既定値。該当する CHANGELOG エントリの日付は2026年3月18日)を下回る場合は、保守化(conservatism)の機構が要求データ量を引き上げるとされています。

導入手順:3段階で進めると書かれている

  1. post-hoc … “confirms that the stopped estimates match the full-run estimates”(完了済みの評価で、打ち切り値とフル実行値の一致を確認する)
  2. shadow mode … “optstop reports the saving it would have made, with the evaluator’s full dataset preserved”(節約できたはずの量だけを報告し、データは全量残す)
  3. live … “switches on live stopping once satisfied by the shadow mode numbers”(shadow の数字に納得してから実際の停止を有効にする)

コード側では OptimalStoppingManager が inspect_ai(英国AISI の評価フレームワーク Inspect)の EarlyStopping プロトコルを実装し、shadow_mode の既定値は False です。ブログはあわせて、タスクをランダム順に提示することを “The main practical requirement”(主要な実務要件)と位置づけています。並び順によって初期の推定が偏るのを避けるためで、Inspect 側に対応があるとされています。

注意点

較正が良好とされる範囲は限定されている

README の “Credible Interval Coverage Considerations” が示す条件は次の形です。

条件README の記述
1グルーピング50項目以上・性能0.2〜0.8信用区間は良好に較正される
小標本、または0%・100%に近い境界性能階層縮約により区間が名目より狭くなりうる(CIs may undercover)
ストレステスト条件(1グルーピング18〜30項目で境界性能の項目が多い)観測されたカバレッジが名目を大きく下回りうる

3行目だけが断定的な書き方で、2行目は可能性の記述です。README はこの性質を実装上の不具合ではなく階層ベイズモデルに由来するものと位置づけ、live・post-hoc のどちらにも同じように及ぶとしています。

2026年8月27日は紹介日であって公開日ではない

出来事日付
リポジトリの作成(GitHub API のメタデータ)2025-12-12
CHANGELOG の最新エントリ 0.4.02026-03-18
README の “Initial public release” コミット2026-06-12
README の最終更新2026-08-19
AISI ブログでの紹介2026-08-27

現行バージョンは 0.4.0、ライセンスは MIT です(いずれも2026年9月1日の取得時点)。

日本語のドキュメントは確認できない

リポジトリ直下のファイル一覧・README 全文・ブログを確認した範囲では、公式の日本語版や日本語ドキュメントは見当たりませんでした(2026年9月1日時点)。サブディレクトリまでは全走査していないため、「存在しない」ではなく「確認した範囲では無い」という状態です。

関連記事

参考にした情報源

全6件のうち3件 が公的機関の公開資料です。

  1. Optimal stopping: spending evaluation compute where it counts(AISI Blog)

    英国政府機関参照 2026-09-01

  2. UKGovernmentBEIS/optstop README.md(raw)

    raw.githubusercontent.com参照 2026-09-01

  3. Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations(arXiv:2608.14425 抄録)

    学術参照 2026-09-01

  4. arXiv:2608.14425 HTML 全文(v1)

    学術参照 2026-09-01

  5. GitHub API: repos/UKGovernmentBEIS/optstop

    api.github.com参照 2026-09-01

  6. UKGovernmentBEIS/optstop CHANGELOG.md(raw)

    raw.githubusercontent.com参照 2026-09-01