AI評価・ベンチマーク
ICML 2026 再現チャレンジとは:19日間で論文2,226本の再現を試行・主張35,908件
19日間で再現が試みられた論文 2226 本
Hugging Face と alphaXiv が2026年8月13日に公表した ICML 2026 Open Reproductions challenge の結果を原典で確認しました。19日間・参加者1,221人・論文2,226本・主張35,908件。51%と23%の分母の読み方まで整理します。
全26件 / 22カテゴリ
AI評価・ベンチマーク
19日間で再現が試みられた論文 2226 本
Hugging Face と alphaXiv が2026年8月13日に公表した ICML 2026 Open Reproductions challenge の結果を原典で確認しました。19日間・参加者1,221人・論文2,226本・主張35,908件。51%と23%の分母の読み方まで整理します。
AI評価・ベンチマーク
素のプロンプト・適切な負荷かけ 0.223 以下
Ai2が2026年8月7日に公開した評価フレームワーク TutorMoments の42個のスコアを1枚の表に整理。素のプロンプトでは7モデルすべてが適切な負荷かけ0.223以下、評価内容を明示したプロンプトでは指標ごとの首位も入れ替わります。人間チューターの数値の読み方も原典で確認しました。
AI評価・ベンチマーク
総トークン予算100万→1000万 25 %向上
英国AI Security Instituteが2026年7月2日に公開したブログの要点を一次資料から整理。予算100万→1000万で約25%、狭義サイバーの約8%は1000万トークン超で初めて解決、過去1年公開のモデルでは50M推定でトレンドが約60%急。効く条件と効かない条件も。
AI評価・ベンチマーク
AITEの当初タスク数 3 件
NISTが2026年7月27日に発表したAI評価プログラムAITEは、公開しないデータでVLMを評価します。3タスクの試行数(641・10,000・3,000)、評価指標の実体、参加の2トラック、結果の公表範囲を公式仕様書から整理しました。
検索・埋め込みモデル
5,000本パイロット・256次元 0.9955 再現率
Hugging Face が公開した Papers with Code の検索基盤の数値を、条件つきで読み分けられます。Recall@20 0.9955・p50 1.31ms・毎秒約75本が、それぞれどのコーパス規模・どの次元・どのハードで測られた値なのかを、原典(2026年8月21日)から整理しました。
検索・埋め込みモデル
NQ4,874件をLateOnで索引化 311.5 MB
ColBERT系のマルチベクトル検索でインデックスが何倍になるかを、原典の実測値で判断できます。Sentence Transformers v6.0 の公式ブログが示した索引サイズ・pool_factor 別の削減率・圧縮後サイズを、比較相手ごとに整理しました。
AIインフラ・セキュリティ
第3章の脅威・課題 14 項目
NISTが2026年7月27日に公開した初期公開草案 SP 800-239 の中身を原典で確認しました。脅威・課題は3.1〜3.14の14項目、対策方針は4.1〜4.6の6項目。意見募集は2026年9月25日まで、宛先は sp800-239-comments@nist.gov です。対象外の範囲も整理しました。
AIエージェント・セキュリティ
AISIが挙げた寄与しうる要因 5 項目
英国AI Security Instituteが2026年8月4日に公開したインシデント報告の要点を整理。122実行中10実行で19件の逸脱行動、第5章の寄与しうる5要因、遡及監査の進捗、モデル別件数を比較に使えない理由まで一次資料から。
AIエージェント運用の設定判断
gpt-oss-120b・選別注入 16.1 ポイント
エージェントに注入するガイドラインの最適量はモデルの階層で変わります。IBM Research が AppWorld test_normal(168タスク)で報告した5モデルの最良構成、スコア差(ポイント)、入力トークン増加率(+78%/+51%/+5%)を条件別に並べ、自社で確認する手順と注意点まで整理しました。
AI安全性・エージェント監視
AISIが挙げた攻撃の成功経路 3 経路
英国 AI Security Institute が2026年7月23日に公開したレッドチーム報告を原典で確認しました。Google DeepMind と Anthropic の内部モニターを試験した結果、AISI が挙げた攻撃の成功経路は3つ。方式別・数値の出どころまで表で整理します。
AI標準・ガバナンス
基本テンプレートのRequired 1 項目
NISTのAI文書化テンプレート初期公開草案を、フィールド単位で整理しました。データセット7・モデル8のルートフィールドのうちRequiredは各1項目。条件つき指定の条件文、プロファイルで変更できる範囲、意見受付の期限まで原典から確認しています。
AI評価・音声エージェント
公式解説ページに記載が無いフィールド 3 個
ADK でテキスト評価をライブ(音声)評価に切り替えるとき、test_config.json に何を足せばよいかが分かります。原典ブログのサンプル設定値、公式ドキュメントとの差、公開ソースコードの既定値を2026年8月25日時点の実測で整理しました。
AI評価・音声認識
VoxPopuli英語テストクリップ 40 %
ASRベンチマークの数値がどこまで実力を表すかを判断する材料が持ち帰れます。Hume AI と Hugging Face が2026年8月に公表した3つの行動プローブについて、参照誤り40%・accept-ref 0.18〜0.30・伏字復元約0.40がそれぞれ何を分母にした割合かを原典で切り分けました。
AI評価・国際ネットワーク
指針が対象外と明記した評価 6 分野
国際ネットワーク NAAIMES が2026年7月23日に完成させた初のベストプラクティス指針の適用範囲を、原典PDFで確認しました。対象は大規模言語モデルの自動評価に限定され、レッドチーム試験やエージェント評価など6分野は明示的に対象外です。関連記事4本の日付と主語も整理します。
LLM評価・評価コスト
9設定のshadow実行 81.1 %
英国AISIのLLM評価打ち切りツール optstop が示す削減率57〜97%は、9つの検証設定をshadow modeで測った反実仮想の値です。分母・測定条件・信用区間が較正される項目数と性能帯・導入3段階を、ブログ(2026年8月27日)と論文・READMEから整理しました。
コーディングエージェント・メモリ
2タスクでの公式比較 8 倍
Hugging Face が2026年9月3日に公開したコーディングエージェント向けメモリ層 funes について、セッションログがどこに置かれ誰が読めるのかを3段階の表で確認できます。公式の「8倍・4倍安い」の測定条件と、準備費用の計上方法も原典の数値で整理しました。
コンテンツ来歴・検証
Credentioの対応拡張子 22 種
Google が2026年8月13日に公開した C2PA 検証ライブラリ Credentio を条件別に整理。対応拡張子22種、README にしかない免責2つ、トラストリストが同梱されない事実、Well-Formed / Valid / Trusted の3段階。
セキュリティ標準とAI活用
NIST SP 1353 ipd(草案) 3 ユースケース
NIST SP 1353 ipd に何が書かれているかが条件別に分かります。3つの想定ユースケース、CO-STAR6欄へのNIST自身の説明、Style欄の文面の違い、付属ZIPの手順、意見受付期限(2026年10月15日 11:59 PM)まで原典で確認して整理しました。
ブラウザ推論・WebGPU
809件の個別演算の比較 2.57 倍
Hugging Face が2026年9月1日に公開した207個のWebGPUカーネルのベンチマークを、数値ごとの母数と測定条件で整理しました。2.57倍は1,756ケース中809ケースの幾何平均、MatMulは比較29件で1.14倍、測定はApple M4の単一構成です。
音声認識モデル
Apache版の集約WER(公開7セット) 5 %
商用可のApache 2.0版と非商用版のどちらを選べるかを、数値の測定条件つきで判断できます。集約WER 5.00%と4.85%、7テストセット別のWER、1×H200と1×L4という別々の機材で測られたRTFxを、IBMの原典(2026年8月25日)から整理しました。
開発ツール・生産性計測
ROIカードの成果側の指標 1 項目
GitHubが2026年8月7日にCopilotインパクトダッシュボードへ追加したPotential return on investmentセクションを原典から整理。カードの3項目、コストが推定値である旨のGitHubの注記、同日変わったコホート人数の集計方法、閲覧に必要な権限まで条件別にまとめます。
開発ツールの利用統計と読み方
2026年7月・Hub帰属分 44.4 %
Hugging Face の公式データセット agent-usage の実値で、2026年4〜7月のコーディングエージェント別シェアと、44.4%という数字の分母が分かります。pct_requests と pct_users の違い、原典が挙げる測定範囲の限界3点、レジストリ登録の手順まで条件別に整理しました。
開発者向けセキュリティ
対象外のGitHubトークン 3 種類
npmの2FAバイパス設定つきgranular access tokenへの制限を、GitHub公式発表にもとづき整理。GitHub PAT・GitHub Appトークン・GITHUB_TOKENが対象外である根拠と、CI/CDでの対応手順をまとめました。
推論基盤・移植とコスト
自社の最初に動いたTPU版比 1.86 倍
Google Developers Blog が2026年8月13日に公開した HeyGen x Google Cloud の共同記事を原典から整理。1.86倍が何と比べた値か、最大25%のコスト効率がどの1文に置かれているか、8チップ Trillium(v6e)の構成と適用条件を条件別にまとめます。
推論基盤・埋め込みモデル
テキスト入力の合格ライン 0.999 以上
Google のTPU埋め込み推論の記事に出る数字を、測定構成ごとに読み分けられます。合格ライン0.999/0.995の比較相手、83,996 token/s が出た構成、tensor parallel が2・4・8の3種類あることを、原典(2026年8月26日)と公式レシピから整理しました。
埋め込みモデル選定
検索学習の対象言語 9 言語
LightOnが2026年7月30日に公開した多言語検索モデル mDenseOn・mLateOn の検索学習言語は9言語で、日本語は含まれません。日本語のMIRACL 72.1・MLDR 73.5という発表値の意味と、日本語RAGでの確認手順を一次情報から整理しました。