最終確認 約5分で読めます AI評価・ベンチマーク

ICML 2026 再現チャレンジとは:19日間で論文2,226本の再現を試行・主張35,908件

Hugging Face と alphaXiv が2026年8月13日に公表した ICML 2026 Open Reproductions challenge の結果を原典で確認しました。19日間・参加者1,221人・論文2,226本・主張35,908件。51%と23%の分母の読み方まで整理します。

答え 19日間で再現が試みられた論文 2226 本 原典公開時点・主催者集計

この記事は、海外の一次情報をAIエージェントが調査・検証・翻訳して整理したものです。実際に製品やサービスを試した体験談ではありません。

結論:19日間で論文2,226本、判定された主張は35,908件

Hugging Face は2026年8月13日、ブログ記事『What We Learned by Reproducing 2,200 papers from ICML』(著者 abidlabs / Abubakar Abid)を公開しました。Hugging Face と alphaXiv が主催した「ICML 2026 Open Reproductions challenge」の結果をまとめたものです。

Hugging Face と alphaXiv の公表によれば、参加者は自分のコーディングエージェントを持ち寄り、ICML 2026 の採択論文の主張を1件ずつ再現しました。実施期間は2026年7月15日から8月2日までの19日間です。

項目内容
原典の公開日2026年8月13日
主催Hugging Face と alphaXiv
実施期間2026年7月15日〜8月2日(19日間)
対象ICML 2026 の採択論文の主張
判定自動の Logbook Judge が主張ごとに4ラベル
判定結果チャレンジ終了時点で公開データセットに凍結

本記事の数値はすべて主催者自身の集計です。2026年8月14日時点で、この集計を独立に検証した第三者の資料は見つかりませんでした。

公表された数値(原典公開時点)

項目数値単位
組織に参加した人1,221人
公開された再現ログブック6,816本
再現が試みられた論文2,226本
判定された主張35,908件
起動された HF Jobs2,962件
公開されたエージェント実行トレース274件
参加者への計算クレジット20米ドル

20米ドルは1人あたりの Hugging Face 計算クレジットであって月額料金ではありません。2,962はクラウドジョブの起動回数で、参加者数でも論文数でもありません。参加人数は原典本文の表記に合わせて1,221人としています(原典公開時点の値)。

判定の仕組み:自動 judge が主張ごとに4ラベル

Hugging Face の説明によれば、判定を行ったのは自動の Logbook Judge です。オープンウェイトモデル GLM-5.2 を動かして全ログブックを読み直し、主張ごとに次の4つのいずれかを出しました。

  • verified(検証された)
  • falsified(反証された)
  • toy(縮小スケールでの証拠)
  • inconclusive(判断できない)

ラベルは4つです。原典で contested と呼ばれているのは、独立した再現チームが同じ主張について逆の判定に達した状態を指す集計上の呼称で、judge の判定ラベルとしては列挙されていません。

GLM-5.2 がオープンウェイトのモデルであること(ライセンス MIT、重みの配布)は、モデルカードで2026年8月14日に確認しました。

結果の概観:51%と23%

Hugging Face の集計として公表されている割合は2つです。

区分割合論文数
少なくとも1件の主張が検証された51%1,103本
少なくとも1件が falsified または contested23%496本

実験によって確認された個別の主張は3,978件とされています。原典は、この結果を踏まえて「Reproducibility is not binary; it is adversarial.(再現性は二値ではない。それは敵対的なものだ)」と書いています。

51%・23%の分母に注意

この2つの割合の分母は、原典では「examined papers(検証対象となった論文)」という語だけで示されており、その本数は原典に書かれていません。再現が試みられた2,226本とは別の数です。「2,226本の51%」と書くと原典と食い違うため、割合を引用するときは原文どおりの分母で書く必要があります。

手順:この数値を引用するときに確認すること

  1. 単位を確かめる。 主張(claim)単位で公表されているのは、判定された35,908件と確認された3,978件の2つだけです。1,103本・496本は論文の本数です
  2. 主語を書く。 すべて主催者である Hugging Face と alphaXiv の自己集計であり、独立した第三者の検証はまだ確認できません
  3. 時点を書く。 数値は2026年8月13日公開の原典の記載です
  4. ラベル数を4つとして扱う。 contested を5つ目のラベルとして並べない
  5. 判定結果は公開データセットで確認する。 原典によれば、判定はチャレンジ終了時点で凍結され公開されています

注意点

エージェントだけに任せたときの限界も書かれている

Hugging Face は、エージェントが局所的なループに陥ったこと、スケール依存の挙動を読み違えたこと、ときには単位の不一致の上に反証全体を組み立てたことを挙げています。そのうえで、最も信頼できる結果は人間が舵を取るワークフローから出たと述べています。

反証の申告は主催者が読み直している

Hugging Face の公表によれば、反証したと正式に申告した参加者は35人で、主催者はその申告された反証をすべて敵対的に再検証しました。この再検証の対象は参加者が正式に申告した反証であって、judge が falsified と判定した全件ではありません。

評価の条件が数値の意味を変えるという論点は、隔離データによる評価プログラム AITE の記事と、計算予算でエージェントの評価が動く話の記事もあわせて参照してください。本記事の数値と引用は2026年8月14日に原典で照合しました。更新の有無は Hugging Face の公式ページでご確認ください。

参考にした情報源

全4件のうち0件 が公的機関の公開資料です。

  1. What We Learned by Reproducing 2,200 papers from ICML(Hugging Face 公式ブログ)

    huggingface.co参照 2026-08-14

  2. ICML 2026 Agent Reproductions(主催組織のプロフィール)

    huggingface.co参照 2026-08-14

  3. ICML-2026-agent-repro/challenge(判定結果のデータセット)

    huggingface.co参照 2026-08-14

  4. zai-org/GLM-5.2 モデルカード(ライセンス MIT・重みの配布を確認)

    huggingface.co参照 2026-08-14