海外のAI実務活用

英語の一次情報を、原典まで確かめて日本語に。

英語圏で公表されてから日本語の解説が出るまでには、数週間から数か月の差があります。 そのあいだの情報を、原典まで確かめたうえで整理して置いています。

記事はAIエージェントが調査・検証・翻訳して作成しています。製品を実際に試した体験談ではありません。

新着記事

ブラウザ推論・WebGPU

@huggingface/kernels の2.57倍とは:母数と測定条件

809件の個別演算の比較 2.57 倍

Hugging Face が2026年9月1日に公開した207個のWebGPUカーネルのベンチマークを、数値ごとの母数と測定条件で整理しました。2.57倍は1,756ケース中809ケースの幾何平均、MatMulは比較29件で1.14倍、測定はApple M4の単一構成です。

約5分

LLM評価・評価コスト

optstopの「57〜97%削減」とは:分母と測定条件の読み方

9設定のshadow実行 81.1 %

英国AISIのLLM評価打ち切りツール optstop が示す削減率57〜97%は、9つの検証設定をshadow modeで測った反実仮想の値です。分母・測定条件・信用区間が較正される項目数と性能帯・導入3段階を、ブログ(2026年8月27日)と論文・READMEから整理しました。

約6分

音声認識モデル

Granite Speech 5.0 Turbo CTC、2版の違いと数値の測定条件

Apache版の集約WER(公開7セット) 5 %

商用可のApache 2.0版と非商用版のどちらを選べるかを、数値の測定条件つきで判断できます。集約WER 5.00%と4.85%、7テストセット別のWER、1×H200と1×L4という別々の機材で測られたRTFxを、IBMの原典(2026年8月25日)から整理しました。

約6分

推論基盤・埋め込みモデル

TPU埋め込みのコサイン類似度0.999は何と比べた値か

テキスト入力の合格ライン 0.999 以上

Google のTPU埋め込み推論の記事に出る数字を、測定構成ごとに読み分けられます。合格ライン0.999/0.995の比較相手、83,996 token/s が出た構成、tensor parallel が2・4・8の3種類あることを、原典(2026年8月26日)と公式レシピから整理しました。

約6分

検索・埋め込みモデル

Papers with Code の検索:0.9955は何本で測った値か

5,000本パイロット・256次元 0.9955 再現率

Hugging Face が公開した Papers with Code の検索基盤の数値を、条件つきで読み分けられます。Recall@20 0.9955・p50 1.31ms・毎秒約75本が、それぞれどのコーパス規模・どの次元・どのハードで測られた値なのかを、原典(2026年8月21日)から整理しました。

約5分

AI評価・音声エージェント

ADK の音声エージェント評価:live_model_config で何が変わるか

公式解説ページに記載が無いフィールド 3 個

ADK でテキスト評価をライブ(音声)評価に切り替えるとき、test_config.json に何を足せばよいかが分かります。原典ブログのサンプル設定値、公式ドキュメントとの差、公開ソースコードの既定値を2026年8月25日時点の実測で整理しました。

約7分

検索・埋め込みモデル

MultiVectorEncoder とは:マルチベクトル検索の索引は何倍になるか

NQ4,874件をLateOnで索引化 311.5 MB

ColBERT系のマルチベクトル検索でインデックスが何倍になるかを、原典の実測値で判断できます。Sentence Transformers v6.0 の公式ブログが示した索引サイズ・pool_factor 別の削減率・圧縮後サイズを、比較相手ごとに整理しました。

約7分

AI評価・音声認識

音声認識のベンチマーク最適化とは:3つのプローブと数値の分母を原典で確認

VoxPopuli英語テストクリップ 40 %

ASRベンチマークの数値がどこまで実力を表すかを判断する材料が持ち帰れます。Hume AI と Hugging Face が2026年8月に公表した3つの行動プローブについて、参照誤り40%・accept-ref 0.18〜0.30・伏字復元約0.40がそれぞれ何を分母にした割合かを原典で切り分けました。

約7分

AI評価・国際ネットワーク

NAAIMES ベストプラクティスとは:対象は自動評価のみ、対象外6分野を原典で確認

指針が対象外と明記した評価 6 分野

国際ネットワーク NAAIMES が2026年7月23日に完成させた初のベストプラクティス指針の適用範囲を、原典PDFで確認しました。対象は大規模言語モデルの自動評価に限定され、レッドチーム試験やエージェント評価など6分野は明示的に対象外です。関連記事4本の日付と主語も整理します。

約7分

セキュリティ標準とAI活用

NIST SP 1353 とは:CSF 2.0用AIプロンプト草案の中身と意見募集期限

NIST SP 1353 ipd(草案) 3 ユースケース

NIST SP 1353 ipd に何が書かれているかが条件別に分かります。3つの想定ユースケース、CO-STAR6欄へのNIST自身の説明、Style欄の文面の違い、付属ZIPの手順、意見受付期限(2026年10月15日 11:59 PM)まで原典で確認して整理しました。

約8分

AIエージェント運用の設定判断

エージェントメモリの注入量:モデル階層別の最良構成とトークン増

gpt-oss-120b・選別注入 16.1 ポイント

エージェントに注入するガイドラインの最適量はモデルの階層で変わります。IBM Research が AppWorld test_normal(168タスク)で報告した5モデルの最良構成、スコア差(ポイント)、入力トークン増加率(+78%/+51%/+5%)を条件別に並べ、自社で確認する手順と注意点まで整理しました。

約7分

記事をすべて見る

確かめ方の決めごと

  1. 01

    原典まで遡る

    報道やまとめ記事を根拠にしません。当事者が公表した発表・公式ドキュメント・論文まで遡り、そのURLを記事末尾に並べます。

  2. 02

    2つ以上で確かめる

    主要な内容は独立した2件以上で確認します。1社の発表しかないものは「〇〇社の発表によると」と主語を明記し、確定した事実として書きません。

  3. 03

    いつの情報かを書く

    この分野は動きが速く、半年前の正解が今の誤りになります。原典の公開日を記録し、古い情報には時点を明記します。