最終確認 約7分で読めます AI評価・ベンチマーク

NIST AITEとは:隔離データによるAI評価の中身と3タスクの仕様

NISTが2026年7月27日に発表したAI評価プログラムAITEは、公開しないデータでVLMを評価します。3タスクの試行数(641・10,000・3,000)、評価指標の実体、参加の2トラック、結果の公表範囲を公式仕様書から整理しました。

答え AITEの当初タスク数 3 件 評価開始は2026年8月

この記事は、海外の一次情報をAIエージェントが調査・検証・翻訳して整理したものです。実際に製品やサービスを試した体験談ではありません。

結論:AITEは3タスク・非公開データによるVLM評価で、評価期間は2026年8月開始

NIST(米国国立標準技術研究所)の Technology Test and Evaluation Division は、2026年7月27日付のニュースで AI Technology Evaluation(AITE)を発表しました(ページ表記は Released July 27, 2026, Updated July 28, 2026)。当初のタスクは3件で、いずれも大規模 Vision Language Model(VLM)による画像解析です。タスクは順次追加されるとされています。

公開ベンチマークとの違いは、テストデータを出さない点です。NIST は AITE を、見えないデータ(blind data)上での任意参加テストであり、隔離された(sequestered)環境が学習/テストデータ汚染のリスクを軽減する(mitigates the risk of train/test data contamination)ものだと説明しています。ただし目的を列挙した箇所では、汚染の可能性を取り除く(remove the potential)というより強い表現も使われています。汚染がゼロになると読み替えるべきではありません。

スケジュールは月単位のみで、2026年8月3日時点で次のとおりです。

時期内容
2026年7月AITE Kickoff
2026年7月Evaluation Plan Release
2026年8月Evaluation Period Begins

具体的な日付・締切の記載はありません。Evaluation Plan の実体は「NIST AI Technology Evaluation Overview & Road Map」v1.0(2026年7月24日)です。

3タスクの条件別仕様

以下はNIST の公開仕様(Overview の Available Tests 表と各タスクの Test Specification v1.0)によるものです。これらの数値を報じた第三者の記事は2026年8月3日時点で確認できていません。

タスク(データセット)試行数データ量
Quantum Dot Control(QDC Patches v1.0)641約0.5GB
Human Genome Variant Curation(Genome Variant Visualization v1.0)10,000約1.1GB
Public Safety Visual Event Recognition(Gumby V1.0)3,000約9GB

Public Safety の9GBは9,000画像で、事象候補1件あたり3枚を1組とするため試行数は3,000です。Test Specification は発表の約2か月前(2026年5月28日〜29日)の文書で、データ作成は3タスクとも2026年4月です。

指標名は3種類だが、実体は「重みなし/重みあり」の違い

Overview の表の指標名だけを見ると、3タスクは別々の指標に見えます。しかし Test Specification では、2つは同じ検出コスト関数の設定違いです。

タスクOverview 表の指標名Test Specification の定義
Quantum Dot ControlMean Squared Error次元方向に計算した平均二乗誤差の平均
Human Genome Variant CurationAverage Error Rate重みなしの検出コスト関数
Public Safety Visual Event RecognitionDetection Cost Function重みつきの検出コスト関数

Human Genome Variant Curation の仕様書は、主要指標を「重みなしの検出コスト関数であり、第1種エラー率と第2種エラー率の平均から成る」と定義しています。式は C =(P_Miss + P_FalseAlarm)/ 2 です。Public Safety 側は重みつき版と書かれています。したがってこの2タスクの指標は別系統ではありません。Quantum Dot Control についても、仕様書の主要指標は the mean of the mean squared error computed across dimensions であり、単純な平均二乗誤差ではありません。

入力形式もタスクごとに違う

タスク入力出力
Quantum Dot Control画像1枚とテキスト3状態の確率推定(テキスト)
Human Genome Variant Curationゲノム小領域の画像と変異のテキスト変異が正しくコールされたかの判定
Public Safety Visual Event Recognition動画のキーフレーム3枚とテキストyes / no の判定

Overview の表はモダリティ欄を3タスクとも text and image / text と表記しますが、Public Safety の Test Specification は入力を Multiple Images and Text とし、データは動画のキーフレームだと説明しています。3タスクの入力形式は同一ではありません。

なお Human Genome Variant Curation は、画像に写る変異が正しくコールされているかを判定する VLM の評価タスクであり、診断や臨床判断を扱うものではありません。

参加の2トラックと手順

Overview によると、参加形態は2つです。

トラック提出するもの受け取るもの
データ提供者(data provider)他者がアクセスできない自領域のデータセットと、その上で行うタスク自分のデータ・タスクにおける上位モデルの測定結果
モデル提供者(model provider)データセットとタスクの上でテストされるモデル同一データ・同一指標での他モデルとの相対性能

公開ページに書かれている手順は次の範囲です。

  1. AITE Participation Agreement と規則を守れることを確認する(参加は任意で、この条件を満たす者に開かれているとされています)。
  2. 問い合わせ先 aite-poc@list.nist.gov に参加を申し込む、または質問する。
  3. 受け入れを待つ。NIST は Road Map v1.0 で、初期フェーズに受け入れるテストとモデルは a very limited number(ごく限られた数)であり、データ提供者は想定される容易さと影響の組み合わせで選定され、モデルは容量が許す範囲での先着順でテストされると述べています。

「申し込めば必ず評価される」制度ではありません。AITE Platform と Participant Login は、2026年8月3日時点で Coming soon の表記です。

結果の公表範囲

結果の公表範囲は公開文書に明記されています。NIST の Overview によれば、提出された全システムの結果は提出組織の識別情報とともに AITE のウェブサイトに掲載され、総括レポートは年1回を下回らない頻度(no less than once a year)で更新されるとされています。

Overview & Road Map v1.0 の第3節は、リーダーボードと結果レポートを定期的に更新すること、表示にはモデルごとに次の5項目を明示することを述べています。

  • dataset(データセット)
  • task(タスク)
  • model by metric(指標ごとのモデル)
  • scores(スコア)
  • measures of uncertainty(不確かさの尺度)

適格モデル(eligible model)の条件は、公開文書に定義がありません。

注意点

2026年8月3日時点で公開ページに書かれていないこと

この日に確認した公開ページ4件(ニュース、AITE Main、Overview、Road Map v1.0)には、参加資格の国籍・所在地の要件と参加費用に関する記載が見当たりませんでした。Participation Agreement の本文も公開ページからリンクされていません。

日本の組織が参加できるとも、できないとも書かれていない状態です。書かれていないことは、要件が存在しないことと同じではありません。参加の検討には aite-poc@list.nist.gov への問い合わせが必要です。

現時点の規模は小さい

NIST の Overview & Road Map v1.0 は、AITE の現状を「3つのテストと、単一モデルの結果」から成るとし、4つのフェーズで開発していくと述べています。各フェーズの範囲と時期は容量と参加度合いに依存するとされています。Overview のモデル一覧も、2026年8月3日時点では1件のみです。

「一覧表の一語を原典まで開く」作業の例として、多言語モデルの学習言語に日本語が入っているかを確認した記事と、仕様変更の影響範囲を切り分けた記事もあわせて参照してください。最新の状況は NIST の公式ページでご確認ください。

参考にした情報源

全9件のうち7件 が公的機関の公開資料です。

  1. Announcing NIST's Artificial Intelligence Technology Evaluation (AITE)

    米国政府機関参照 2026-08-03

  2. AITE Overview — AI Technology Evaluation (NIST Pages)

    米国政府機関参照 2026-08-03

  3. AITE Main / Schedule (ai-challenges.nist.gov)

    米国政府機関参照 2026-08-03

  4. NIST AI Technology Evaluation Overview & Road Map v1.0

    米国政府機関参照 2026-08-03

  5. NIST AITE Test Specification: Quantum Dot Control v1.0

    米国政府機関参照 2026-08-03

  6. NIST AITE Test Specification: Human Genome Variant Curation v1.0

    米国政府機関参照 2026-08-03

  7. NIST AITE Test Specification: Public Safety Visual Event Recognition v1.0

    米国政府機関参照 2026-08-03

  8. NIST unveils new AI evaluation platform (Nextgov/FCW)

    nextgov.com参照 2026-08-03

  9. NIST Launches New Testbed Program to Evaluate AI Model Performance (ExecutiveGov)

    executivegov.com参照 2026-08-03