記事一覧

全26件 / 22カテゴリ

AI評価・ベンチマーク 4

AI評価・ベンチマーク

TutorMomentsとは:Ai2が公開した7モデル×3指標×2条件の全スコア

素のプロンプト・適切な負荷かけ 0.223 以下

Ai2が2026年8月7日に公開した評価フレームワーク TutorMoments の42個のスコアを1枚の表に整理。素のプロンプトでは7モデルすべてが適切な負荷かけ0.223以下、評価内容を明示したプロンプトでは指標ごとの首位も入れ替わります。人間チューターの数値の読み方も原典で確認しました。

約7分

AI評価・ベンチマーク

AISIテスト時計算とは:トークン予算別に変わる評価スコアの読み方

総トークン予算100万→1000万 25 %向上

英国AI Security Instituteが2026年7月2日に公開したブログの要点を一次資料から整理。予算100万→1000万で約25%、狭義サイバーの約8%は1000万トークン超で初めて解決、過去1年公開のモデルでは50M推定でトレンドが約60%急。効く条件と効かない条件も。

約7分

AI評価・ベンチマーク

NIST AITEとは:隔離データによるAI評価の中身と3タスクの仕様

AITEの当初タスク数 3 件

NISTが2026年7月27日に発表したAI評価プログラムAITEは、公開しないデータでVLMを評価します。3タスクの試行数(641・10,000・3,000)、評価指標の実体、参加の2トラック、結果の公表範囲を公式仕様書から整理しました。

約7分

検索・埋め込みモデル 2

検索・埋め込みモデル

Papers with Code の検索:0.9955は何本で測った値か

5,000本パイロット・256次元 0.9955 再現率

Hugging Face が公開した Papers with Code の検索基盤の数値を、条件つきで読み分けられます。Recall@20 0.9955・p50 1.31ms・毎秒約75本が、それぞれどのコーパス規模・どの次元・どのハードで測られた値なのかを、原典(2026年8月21日)から整理しました。

約5分

検索・埋め込みモデル

MultiVectorEncoder とは:マルチベクトル検索の索引は何倍になるか

NQ4,874件をLateOnで索引化 311.5 MB

ColBERT系のマルチベクトル検索でインデックスが何倍になるかを、原典の実測値で判断できます。Sentence Transformers v6.0 の公式ブログが示した索引サイズ・pool_factor 別の削減率・圧縮後サイズを、比較相手ごとに整理しました。

約7分

AIインフラ・セキュリティ 1

AIインフラ・セキュリティ

NIST SP 800-239とは:AIデータセンターの脅威14項目と意見募集の期限

第3章の脅威・課題 14 項目

NISTが2026年7月27日に公開した初期公開草案 SP 800-239 の中身を原典で確認しました。脅威・課題は3.1〜3.14の14項目、対策方針は4.1〜4.6の6項目。意見募集は2026年9月25日まで、宛先は sp800-239-comments@nist.gov です。対象外の範囲も整理しました。

約10分

AIエージェント・セキュリティ 1

AIエージェント・セキュリティ

英国AISIインシデント報告とは:寄与しうる5要因と実務の点検項目

AISIが挙げた寄与しうる要因 5 項目

英国AI Security Instituteが2026年8月4日に公開したインシデント報告の要点を整理。122実行中10実行で19件の逸脱行動、第5章の寄与しうる5要因、遡及監査の進捗、モデル別件数を比較に使えない理由まで一次資料から。

約8分

AIエージェント運用の設定判断 1

AIエージェント運用の設定判断

エージェントメモリの注入量:モデル階層別の最良構成とトークン増

gpt-oss-120b・選別注入 16.1 ポイント

エージェントに注入するガイドラインの最適量はモデルの階層で変わります。IBM Research が AppWorld test_normal(168タスク)で報告した5モデルの最良構成、スコア差(ポイント)、入力トークン増加率(+78%/+51%/+5%)を条件別に並べ、自社で確認する手順と注意点まで整理しました。

約7分

AI安全性・エージェント監視 1

AI安全性・エージェント監視

英国AISI コントロールレッドチームとは:モニター突破の3経路を原典で整理

AISIが挙げた攻撃の成功経路 3 経路

英国 AI Security Institute が2026年7月23日に公開したレッドチーム報告を原典で確認しました。Google DeepMind と Anthropic の内部モニターを試験した結果、AISI が挙げた攻撃の成功経路は3つ。方式別・数値の出どころまで表で整理します。

約9分

AI標準・ガバナンス 1

AI標準・ガバナンス

NIST AI 300-1 ipdとは:AI文書化テンプレートの必須項目一覧

基本テンプレートのRequired 1 項目

NISTのAI文書化テンプレート初期公開草案を、フィールド単位で整理しました。データセット7・モデル8のルートフィールドのうちRequiredは各1項目。条件つき指定の条件文、プロファイルで変更できる範囲、意見受付の期限まで原典から確認しています。

約9分

AI評価・音声エージェント 1

AI評価・音声エージェント

ADK の音声エージェント評価:live_model_config で何が変わるか

公式解説ページに記載が無いフィールド 3 個

ADK でテキスト評価をライブ(音声)評価に切り替えるとき、test_config.json に何を足せばよいかが分かります。原典ブログのサンプル設定値、公式ドキュメントとの差、公開ソースコードの既定値を2026年8月25日時点の実測で整理しました。

約7分

AI評価・音声認識 1

AI評価・音声認識

音声認識のベンチマーク最適化とは:3つのプローブと数値の分母を原典で確認

VoxPopuli英語テストクリップ 40 %

ASRベンチマークの数値がどこまで実力を表すかを判断する材料が持ち帰れます。Hume AI と Hugging Face が2026年8月に公表した3つの行動プローブについて、参照誤り40%・accept-ref 0.18〜0.30・伏字復元約0.40がそれぞれ何を分母にした割合かを原典で切り分けました。

約7分

AI評価・国際ネットワーク 1

AI評価・国際ネットワーク

NAAIMES ベストプラクティスとは:対象は自動評価のみ、対象外6分野を原典で確認

指針が対象外と明記した評価 6 分野

国際ネットワーク NAAIMES が2026年7月23日に完成させた初のベストプラクティス指針の適用範囲を、原典PDFで確認しました。対象は大規模言語モデルの自動評価に限定され、レッドチーム試験やエージェント評価など6分野は明示的に対象外です。関連記事4本の日付と主語も整理します。

約7分

LLM評価・評価コスト 1

LLM評価・評価コスト

optstopの「57〜97%削減」とは:分母と測定条件の読み方

9設定のshadow実行 81.1 %

英国AISIのLLM評価打ち切りツール optstop が示す削減率57〜97%は、9つの検証設定をshadow modeで測った反実仮想の値です。分母・測定条件・信用区間が較正される項目数と性能帯・導入3段階を、ブログ(2026年8月27日)と論文・READMEから整理しました。

約6分

コーディングエージェント・メモリ 1

コーディングエージェント・メモリ

Hugging Face funes とは:データの持ち出し境界と8倍の分母

2タスクでの公式比較 8 倍

Hugging Face が2026年9月3日に公開したコーディングエージェント向けメモリ層 funes について、セッションログがどこに置かれ誰が読めるのかを3段階の表で確認できます。公式の「8倍・4倍安い」の測定条件と、準備費用の計上方法も原典の数値で整理しました。

約7分

コンテンツ来歴・検証 1

コンテンツ来歴・検証

Credentio の「検証が通った」:C2PA 3段階と対応22拡張子

Credentioの対応拡張子 22 種

Google が2026年8月13日に公開した C2PA 検証ライブラリ Credentio を条件別に整理。対応拡張子22種、README にしかない免責2つ、トラストリストが同梱されない事実、Well-Formed / Valid / Trusted の3段階。

約8分

セキュリティ標準とAI活用 1

セキュリティ標準とAI活用

NIST SP 1353 とは:CSF 2.0用AIプロンプト草案の中身と意見募集期限

NIST SP 1353 ipd(草案) 3 ユースケース

NIST SP 1353 ipd に何が書かれているかが条件別に分かります。3つの想定ユースケース、CO-STAR6欄へのNIST自身の説明、Style欄の文面の違い、付属ZIPの手順、意見受付期限(2026年10月15日 11:59 PM)まで原典で確認して整理しました。

約8分

ブラウザ推論・WebGPU 1

ブラウザ推論・WebGPU

@huggingface/kernels の2.57倍とは:母数と測定条件

809件の個別演算の比較 2.57 倍

Hugging Face が2026年9月1日に公開した207個のWebGPUカーネルのベンチマークを、数値ごとの母数と測定条件で整理しました。2.57倍は1,756ケース中809ケースの幾何平均、MatMulは比較29件で1.14倍、測定はApple M4の単一構成です。

約5分

音声認識モデル 1

音声認識モデル

Granite Speech 5.0 Turbo CTC、2版の違いと数値の測定条件

Apache版の集約WER(公開7セット) 5 %

商用可のApache 2.0版と非商用版のどちらを選べるかを、数値の測定条件つきで判断できます。集約WER 5.00%と4.85%、7テストセット別のWER、1×H200と1×L4という別々の機材で測られたRTFxを、IBMの原典(2026年8月25日)から整理しました。

約6分

開発ツール・生産性計測 1

開発ツール・生産性計測

Copilot ROIセクションとは:カード3項目と08-07の変更点

ROIカードの成果側の指標 1 項目

GitHubが2026年8月7日にCopilotインパクトダッシュボードへ追加したPotential return on investmentセクションを原典から整理。カードの3項目、コストが推定値である旨のGitHubの注記、同日変わったコホート人数の集計方法、閲覧に必要な権限まで条件別にまとめます。

約7分

開発ツールの利用統計と読み方 1

開発ツールの利用統計と読み方

Claude Code 44.4%の正体:Hugging Face agent-usage の読み方

2026年7月・Hub帰属分 44.4 %

Hugging Face の公式データセット agent-usage の実値で、2026年4〜7月のコーディングエージェント別シェアと、44.4%という数字の分母が分かります。pct_requests と pct_users の違い、原典が挙げる測定範囲の限界3点、レジストリ登録の手順まで条件別に整理しました。

約6分

開発者向けセキュリティ 1

開発者向けセキュリティ

npm granular access token(GAT)の2FAバイパス制限 対象と対象外

対象外のGitHubトークン 3 種類

npmの2FAバイパス設定つきgranular access tokenへの制限を、GitHub公式発表にもとづき整理。GitHub PAT・GitHub Appトークン・GITHUB_TOKENが対象外である根拠と、CI/CDでの対応手順をまとめました。

約5分

推論基盤・移植とコスト 1

推論基盤・移植とコスト

HeyGen TPU移植の「1.86倍」とは:基準線と25%の条件

自社の最初に動いたTPU版比 1.86 倍

Google Developers Blog が2026年8月13日に公開した HeyGen x Google Cloud の共同記事を原典から整理。1.86倍が何と比べた値か、最大25%のコスト効率がどの1文に置かれているか、8チップ Trillium(v6e)の構成と適用条件を条件別にまとめます。

約8分

推論基盤・埋め込みモデル 1

推論基盤・埋め込みモデル

TPU埋め込みのコサイン類似度0.999は何と比べた値か

テキスト入力の合格ライン 0.999 以上

Google のTPU埋め込み推論の記事に出る数字を、測定構成ごとに読み分けられます。合格ライン0.999/0.995の比較相手、83,996 token/s が出た構成、tensor parallel が2・4・8の3種類あることを、原典(2026年8月26日)と公式レシピから整理しました。

約6分

埋め込みモデル選定 1

埋め込みモデル選定

mLateOn・mDenseOnの学習言語に日本語は入っているか

検索学習の対象言語 9 言語

LightOnが2026年7月30日に公開した多言語検索モデル mDenseOn・mLateOn の検索学習言語は9言語で、日本語は含まれません。日本語のMIRACL 72.1・MLDR 73.5という発表値の意味と、日本語RAGでの確認手順を一次情報から整理しました。

約5分