AISIテスト時計算とは:トークン予算別に変わる評価スコアの読み方
英国AI Security Instituteが2026年7月2日に公開したブログの要点を一次資料から整理。予算100万→1000万で約25%、狭義サイバーの約8%は1000万トークン超で初めて解決、過去1年公開のモデルでは50M推定でトレンドが約60%急。効く条件と効かない条件も。
答え 総トークン予算100万→1000万 25 %向上 AISI報告・起点1M
この記事は、海外の一次情報をAIエージェントが調査・検証・翻訳して整理したものです。実際に製品やサービスを試した体験談ではありません。
結論:ベンチマークのスコアは「予算」とセットでしか読めない
英国 AI Security Institute(AISI)が2026年7月2日に公開したブログ『More compute, more capability: Why AI agent evaluations need to account for test-time compute』(Science of Evaluations カテゴリ)の主張は、評価がエージェントに許すテスト時計算(トークン予算)の上限を上げると、測られる能力・解けるタスクの難易度・フロンティアの進み方の見え方が変わる、というものです。
固定された小さな予算での評価は、特に長時間タスクで能力を実際より低く見積もりうる ── この点は AISI(2026年7月)と、独立した研究機関 Epoch AI の MirrorCode 報告(2026年4月時点)の双方が、それぞれの実測にもとづいて示しています。
| 項目 | 内容 |
|---|---|
| 公開日 | 2026年7月2日 |
| 発行元 | 英国 AI Security Institute(AISI) |
| 根拠となる技術論文 | arXiv:2606.17930(2026年6月16日) |
| 論文の規模 | 7ベンチマーク・最大12のフロンティアモデル |
| 論文の結論 | ベンチマークのスコアはプロトコル依存 |
条件別:トークン予算の水準ごとに何が見えるか
AISI がブログで示している予算水準と観測を並べます。数値はすべて AISI の報告です。
| 予算の水準 | AISIが報告している内容 |
|---|---|
| 100万→1000万 | ソフトウェアエンジニアリング(TerminalBench 2.0、SWE-Bench Pro)で約25%向上 |
| 100万→最大500万 | 数学・学術系(Humanity’s Last Exam)で約22%向上 |
| 1000万超 | 狭義サイバータスクの約8%がここで初めて解けた。一部は最大5000万を要した |
| 3000万 | AISIがテストしたどのモデルも、これ未満の予算では『The Last Ones』を完了できなかった |
| 5000万 | 現フロンティアの推定タイムホライズンが概ね2時間から14時間へ |
| 1億超 | 最新のモデルがさらに高いスコアに到達 |
「約25%」の起点は100万トークンである
原文は “Increasing total token budgets from 1M to 10M raised performance by ~25%” です。パーセントポイントか相対%かを AISI は明示していないため、「25ポイント向上」と読み替えることはできません。起点が100万トークンである点も落とせません。いま一般に行われている評価の上限をさらに広げれば同じ幅が得られる、という主張ではないためです。
タイムホライズンは80%成功の人間所要時間
AISI が使う80%タイムホライズンは、そのモデルが80%の確率で成功する人間の作業時間を指し、狭義のサイバータスクに限った指標です。推定はトークンで打ち切られた成功率へのペナルティ付きロジスティック回帰で行われ、倍加率はフロンティアモデルのみで推定されます。個別モデルの水準では、ある最近のフロンティアモデルの推定値が250万トークンで約40分、5000万トークンで約4時間だったと報告されています。原典はモデル名を明かしていません。
追加計算が効く条件と効かない条件
| 条件 | AISIの記述 |
|---|---|
| エージェントが自分の作業を検証できる(コード実行、エクスプロイトの検証) | 追加の計算が最も効く |
| フィードバックが弱い、または存在しない | ほとんど効かない |
| HealthBench | 全モデルが通常の予算内で頭打ち |
| フィードバックが無い・遅れる・ノイズが多い | 効果が弱い可能性があるとされる(Open questions) |
断定形で書かれているのは脚注の実測部分で、最後の行は “may be weaker” と可能性の形です。AISI が試した範囲もサイバー、ソフトウェアエンジニアリング、数学、学術、ヘルスケアに限られます。
必要な計算量は人間の所要時間に比例する(ただし裏づけは未公開)
AISI は、タスクを解くのに必要な計算量が熟練した人間の所要時間に比例して増えると述べ、脚注で両スイートを通じたべき乗則の指数を概ね0.7〜1.0としています。
| 人間の所要時間 | エージェントに必要とされるトークン |
|---|---|
| 1分 | 数千 |
| 1時間 | 数百万 |
| 1週間規模 | 数十億 |
この脚注には AISI 自身が “(Work forthcoming.)” と注記しており、裏づけとなる研究はまだ公開されていません。検証されたのはサイバーとソフトウェアエンジニアリングの2領域のみ、トレンド周りのばらつきは大きく、人間の所要時間は難易度の不完全な代理指標である、という留保も AISI 自身が付けています。
手順:社内のモデル比較表を作り直す
- スコアの隣にトークン予算の列を足す。 AISI は自機関の評価を複数の予算で行い、最も難しいタスクには非常に大きな予算も使うとしています
- 2水準以上で測り、伸びが止まったかを見る。 AISI は信頼性(reliability)と到達範囲(reach)を予算に対して報告し、本当に能力が低いモデルと予算不足の評価を区別できるようにしていると述べています
- 低いスコアの原因を2つに分けて疑う。 モデルの能力が低いのか、与えた予算が足りていないのか
- 「最小の意味ある予算」はまだ既製品では無いと理解する。 AISI は minimum informative budgets の定義と、安価な実行から高予算の性能を予測する手法の開発に取り組んでいる最中だとしています
注意点
「進歩の速さ」の数字も予算の関数である
AISI は従来、狭義サイバータスクのタイムホライズンが2024年末以降4.7か月ごとに倍になっていると推定していました(1タスクあたり250万トークンの固定予算)。今回のブログは、過去1年間に公開されたモデルについて、5000万トークンで推定すると当てはめたフロンティアのトレンドが約60%急になると報告しています。AISI の表現では、推定される倍加ペースはフロンティアのサイバー能力に備わった固定的な性質ではなく、部分的には評価に使った計算予算の帰結です。
なお4.7か月は今回の新しい測定結果ではなく従来推定の引用であり、AISI は2026年5月13日のブログでこの傾向を大きく上回るモデルが出たこと、それが新しいトレンドかは不明であることにも触れています。
数字の範囲を広げて読まないための3点
| 数字 | 正しい範囲 |
|---|---|
| 78タスク | 図4の分析対象数。スイート全体の規模ではない |
| 約8% | AISIの狭義サイバータスク群に限った割合 |
| 概ね20時間 | 2026年7月のブログにおける『The Last Ones』の見積もり |
図4の分析対象は、METR のソフトウェアエンジニアリングタスク211件と AISI のサイバーCTFタスク78件で、データは狭義サイバーが2025年4月〜2026年4月公開の11モデル、METR 側が2023年3月〜2025年12月公開の20モデルから得られています。『The Last Ones』については、同じ企業ネットワーク・レンジを扱う AISI 自身の2026年3月時点の論文が約14時間と見積もっており、機関内で数値が揺れています。断定形では扱えません。
平均の裏で起きている世代間の後退
AISI は脚注で、世代間の平均的な改善の裏では進歩が一様ではなく、スイートにもよるがおよそ10〜30%のタスクでは新しいモデルが前世代より実際に成績が悪い、と述べています。これも “(Work forthcoming.)” 付きです。予算水準を条件にした記述ではないため、予算との因果として読まないこと。世代が新しいというだけで一律に上位互換とは限らない、という独立した論点です。
AISIが言っていないこと
予算を上げれば実務でも同じだけ成果が上がる、とは書かれていません。AISI が述べているのは測定の話であり、5000万トークン級の予算を業務で推奨する記述もありません。桁の大きな数値は AISI の評価環境で用いた水準です。
評価条件がスコアの意味を変える論点は、隔離データによる評価プログラム AITE を整理した記事と、AISIのインシデント報告と寄与しうる5要因の記事もあわせて参照してください。本記事の数値と引用は2026年8月8日に原典で照合したものです。更新の有無は AISI の公式ページでご確認ください。
参考にした情報源
全5件のうち4件 が公的機関の公開資料です。
- More compute, more capability: Why AI agent evaluations need to account for test-time compute (UK AI Security Institute)
- How Inference Compute Shapes Frontier LLM Evaluation (UK AI Security Institute, arXiv:2606.17930)
- How fast is autonomous AI cyber capability advancing? (UK AI Security Institute)
- Measuring AI Agents' Progress on Multi-Step Cyber Attack Scenarios (Folkerts et al., AISI)
- MirrorCode: Evidence that AI can already do some weeks-long coding tasks (Epoch AI)