最終確認 約7分で読めます AI評価・国際ネットワーク

NAAIMES ベストプラクティスとは:対象は自動評価のみ、対象外6分野を原典で確認

国際ネットワーク NAAIMES が2026年7月23日に完成させた初のベストプラクティス指針の適用範囲を、原典PDFで確認しました。対象は大規模言語モデルの自動評価に限定され、レッドチーム試験やエージェント評価など6分野は明示的に対象外です。関連記事4本の日付と主語も整理します。

答え 指針が対象外と明記した評価 6 分野 2026年7月23日公開

この記事は、海外の一次情報をAIエージェントが調査・検証・翻訳して整理したものです。実際に製品やサービスを試した体験談ではありません。

結論:適用対象は「大規模言語モデルの自動評価」だけ

NAAIMES(International Network for Advanced AI Measurement, Evaluation and Science、旧・International Network of AI Safety Institutes)の初のベストプラクティス指針は、正式タイトルを『Best Practice: Automated Evaluation of Large Language Models』といいます。英国AISI(AI Security Institute)が2026年7月23日のブログでその完成を伝えました。

文書本文は “This document focuses on one important subset: automated evaluations of AI models.” と書いており、対象はAI評価という広い分野の一部分です。英国AISIのブログ本文はこの限定に触れていないため、ブログだけを読むと適用範囲を広く取り違えます。

ネットワークの設立は2024年11月、参加はオーストラリア・カナダ・EU・フランス・日本・ケニア・韓国・シンガポール・英国・米国の10の国・地域です(EUは国ではありません)。米国NISTも2026年2月時点で同じ顔ぶれを列挙しています。

対象・対象外の切り分け

区分内容
対象AIモデルの自動評価(automated evaluations)
対象外レッドチーム/セーフガード試験
対象外エージェント評価
対象外専門家による能力評価
対象外傾向(propensity)評価
対象外人間のアップリフト研究
対象外オープンワールド評価
範囲外評価の自作方法、および結果の解釈

対象外の6分野について、文書は今後の刊行物で扱う可能性がある(may)とだけ書き、扱う予定とは断定していません。

位置づけ:NIST AI 800-2 を補完する

支援の対象は第三者評価者(third-party evaluators)です。既存の文書、とりわけ NIST AI 800-2 を土台にして補完する(complement)位置づけだと、ブログと文書本文の双方に書かれています。準拠でも置き換えでもありません。文書の参考文献は NIST AI 800-2 を “Initial Public Draft”(初期公開草案)と明記しており、2026年7月時点で確定した標準ではありません。

関連記事4本を日付と主語で並べる

発表元公開日主題
カナダCAISI2026-07-08評価者は何を共有すべきか
シンガポールAISI2026-07-08モデルではなくシステムをどうテストするか
フランスINESIA2026-07-08資源が限られるとき何を優先するか
EU AI Office Safety Unit記載なし本記事では原典に到達できず内容に言及しない
NAAIMES / 英国AISI2026-07-23指針文書とまとめブログ

3本が先で、指針文書はその約2週間後です。「同時公開」という整理は日付と合いません。

シリーズが4本であることは、カナダCAISI のページ自身が EU AI Office Safety Unit の記事を含むと明記していることによります。英国AISIのブログが3本しか紹介していないだけで、「3カ国が3本」という整理は原典と食い違います。

これらはネットワークの合意ではない

英国AISIはこれらを「未解決の問い(open questions)」の節で紹介しています。書き手は加盟機関それぞれで、ネットワークの回答は示されていません。2026年2月時点で英国AISIが挙げた問いは5つあり、7月の3本の表題はそのうち3つに対応します。残る2つに対応する記事は今回の3本の中にはありませんが、EUの記事がある以上「未回答」とは断じられません。

手順:公表値を自社の評価に落とす

  1. 自社の評価が自動評価かどうかを判定する。 エージェント評価やレッドチームなら対象外です
  2. 採点側の条件を固定する。 文書本文(p.7)によれば、出力の評価(scoring criteria、rubrics、graders)は常に比較可能であるべきとされています
  3. 生成側は目的に応じて決め、決めた内容を記録する。 同じ文書は、生成(prompt format、inference settings)をどこまで標準化するかは評価の目的次第だとしています
  4. 能力の引き出しをするなら、データを3分割する。 比率は下表のとおりです
  5. 報告に載せる項目と伏せる項目を先に決める。 カナダCAISI の5項目と3類型が材料です

能力の引き出しに使うデータ分割(文書 p.9)

用途量単位
探索用セット(手作業の実験・初期の定性分析)2〜5問
チューニング用セット(プロンプト・パラメータの反復)70〜80%
評価用セット(最終報告にのみ使用)20〜30%

探索用の「2〜5」は問題数、残り2つは問題数に対する割合です。3つは互いに重複してはならず、チューニング中に評価用セットを見てはならないとされ、文書はこれを守らないことが最も一般的かつ影響の大きい誤りのひとつだと述べています。ただし比率は脚注で目安(rule-of-thumb)と断られています。

カナダCAISI:必ず書く5項目と伏せる3類型

区分項目
必ず書く測定の意図と適用される利用文脈
必ず書く方法論(何を何によって測るか)
必ず書く対象のモデル・システムとその設定
必ず書く解釈上の注意と限界(不確実性の統計情報を含む)
必ず書く報告における潜在的な利益相反
伏せる安全上重大な情報を含むデータセット(CBRN・サイバーセキュリティが例示)
伏せる悪意ある主体に手助け(uplift)を与えうる敵対的テストの知見
伏せるデータ汚染の恐れがあるテストセット

開示は二択ではなく、一般公開/信頼できる相手/開発者・システム保有者の3段階に分けるべきだとされます。

注意点

同じページに5項目のリストが2つある

カナダCAISI のページには5項目の箇条書きが2か所あり、内容が違います。冒頭の Key takeaways の5番目は “Practicing selective disclosure” で、上表は本文の “At minimum, we propose that evaluators should” の側です。混ぜて6項目にしないでください。なおページ上の日付は “Date modified”(最終更新日)のみです。

シンガポールの手順は4段階で、独自案ではない

シンガポールAISI は IMDA の『Starter Kit for Testing LLM-based Applications for Safety and Reliability』について “We present an adapted version here” と述べ、(1)関連リスクの特定とテスト範囲の較正(2)現実的なテスト環境の構築(3)評価の実行(データセット・指標・評価技法の構築)(4)結果と軌跡(trajectories)の分析による改善・緩和策への反映、の4段階を示します。「目的適合の閾値の設定」は第5段階ではなく別枠のコラムです。trajectories は実行の軌跡であって「傾向」ではありません。

フランスINESIA は may と should を書き分けている

INESIA(掲載元はSGDSN)の枠組みは、意思決定の文脈/シナリオと脅威モデル/テスト設計とエスカレーション/報告/エコシステムの5要素で、原文はこれを「最小限の枠組み」としています。軽量な探り(smoke tests)から始める進め方は may(してもよい)、賭け金が大きいところで厳しいテストを優先するのは should と書き分けられています。

拘束力についての記述はない

文書本文は evaluators should… という推奨形で書かれ、must / mandatory / binding / compliance にあたる義務規定は現れません。ただし「任意である」と明言した公式文も見つからないため、記述の不在として扱うのが正確です。日本語版・各国語版の有無への言及もなく、2026年8月21日時点で確認できるのは英語版のみです。今後については “will align on further best practices […] with particular attention given to agentic capabilities” とあり、予定であって合意済みではありません。

日本(Japan AISI)は参加機関ですが、今回のシリーズの執筆機関ではありません。略称も揺れており、カナダのページだけは AAIMES Network です。

評価条件が結果の意味を左右する話は、計算予算で評価結果が変わる英国AISIの指摘と、隔離データによる評価を扱ったNIST AITEの記事でも整理しています。本記事の数値と引用は2026年8月21日に原典で照合しました。

参考にした情報源

全7件のうち3件 が公的機関の公開資料です。

  1. International evaluation best practice and open questions in AI measurement(英国AISI ブログ)

    英国政府機関参照 2026-08-21

  2. International Network for Advanced AI Measurement, Evaluation and Science Best Practice: Automated Evaluation of Large Language Models(指針文書PDF本体)

    cdn.prod.website-files.com参照 2026-08-21

  3. What information should AI evaluators share?(カナダAI安全研究所 CAISI / ISED)

    ised-isde.canada.ca参照 2026-08-21

  4. How should evaluators test AI systems (as opposed to models)?(シンガポールAI安全研究所)

    sgaisi.sg参照 2026-08-21

  5. What should evaluators prioritise when resources are limited?(フランス INESIA / SGDSN)

    sgdsn.gouv.fr参照 2026-08-21

  6. International consensus and open questions in AI evaluations(英国AISI、2026年2月の5つの問い)

    英国政府機関参照 2026-08-21

  7. International Network for Advanced AI Measurement, Evaluation, and Science Publishes Consensus Areas on Practices for Automated Evaluations(NIST ニュース)

    米国政府機関参照 2026-08-21