コーディングエージェント・メモリ
Hugging Face funes とは:データの持ち出し境界と8倍の分母
2タスクでの公式比較 8 倍
Hugging Face が2026年9月3日に公開したコーディングエージェント向けメモリ層 funes について、セッションログがどこに置かれ誰が読めるのかを3段階の表で確認できます。公式の「8倍・4倍安い」の測定条件と、準備費用の計上方法も原典の数値で整理しました。
海外のAI実務活用
英語圏で公表されてから日本語の解説が出るまでには、数週間から数か月の差があります。 そのあいだの情報を、原典まで確かめたうえで整理して置いています。
記事はAIエージェントが調査・検証・翻訳して作成しています。製品を実際に試した体験談ではありません。
コーディングエージェント・メモリ
2タスクでの公式比較 8 倍
Hugging Face が2026年9月3日に公開したコーディングエージェント向けメモリ層 funes について、セッションログがどこに置かれ誰が読めるのかを3段階の表で確認できます。公式の「8倍・4倍安い」の測定条件と、準備費用の計上方法も原典の数値で整理しました。
ブラウザ推論・WebGPU
809件の個別演算の比較 2.57 倍
Hugging Face が2026年9月1日に公開した207個のWebGPUカーネルのベンチマークを、数値ごとの母数と測定条件で整理しました。2.57倍は1,756ケース中809ケースの幾何平均、MatMulは比較29件で1.14倍、測定はApple M4の単一構成です。
LLM評価・評価コスト
9設定のshadow実行 81.1 %
英国AISIのLLM評価打ち切りツール optstop が示す削減率57〜97%は、9つの検証設定をshadow modeで測った反実仮想の値です。分母・測定条件・信用区間が較正される項目数と性能帯・導入3段階を、ブログ(2026年8月27日)と論文・READMEから整理しました。
音声認識モデル
Apache版の集約WER(公開7セット) 5 %
商用可のApache 2.0版と非商用版のどちらを選べるかを、数値の測定条件つきで判断できます。集約WER 5.00%と4.85%、7テストセット別のWER、1×H200と1×L4という別々の機材で測られたRTFxを、IBMの原典(2026年8月25日)から整理しました。
推論基盤・埋め込みモデル
テキスト入力の合格ライン 0.999 以上
Google のTPU埋め込み推論の記事に出る数字を、測定構成ごとに読み分けられます。合格ライン0.999/0.995の比較相手、83,996 token/s が出た構成、tensor parallel が2・4・8の3種類あることを、原典(2026年8月26日)と公式レシピから整理しました。
検索・埋め込みモデル
5,000本パイロット・256次元 0.9955 再現率
Hugging Face が公開した Papers with Code の検索基盤の数値を、条件つきで読み分けられます。Recall@20 0.9955・p50 1.31ms・毎秒約75本が、それぞれどのコーパス規模・どの次元・どのハードで測られた値なのかを、原典(2026年8月21日)から整理しました。
AI評価・音声エージェント
公式解説ページに記載が無いフィールド 3 個
ADK でテキスト評価をライブ(音声)評価に切り替えるとき、test_config.json に何を足せばよいかが分かります。原典ブログのサンプル設定値、公式ドキュメントとの差、公開ソースコードの既定値を2026年8月25日時点の実測で整理しました。
検索・埋め込みモデル
NQ4,874件をLateOnで索引化 311.5 MB
ColBERT系のマルチベクトル検索でインデックスが何倍になるかを、原典の実測値で判断できます。Sentence Transformers v6.0 の公式ブログが示した索引サイズ・pool_factor 別の削減率・圧縮後サイズを、比較相手ごとに整理しました。
AI評価・音声認識
VoxPopuli英語テストクリップ 40 %
ASRベンチマークの数値がどこまで実力を表すかを判断する材料が持ち帰れます。Hume AI と Hugging Face が2026年8月に公表した3つの行動プローブについて、参照誤り40%・accept-ref 0.18〜0.30・伏字復元約0.40がそれぞれ何を分母にした割合かを原典で切り分けました。
AI評価・国際ネットワーク
指針が対象外と明記した評価 6 分野
国際ネットワーク NAAIMES が2026年7月23日に完成させた初のベストプラクティス指針の適用範囲を、原典PDFで確認しました。対象は大規模言語モデルの自動評価に限定され、レッドチーム試験やエージェント評価など6分野は明示的に対象外です。関連記事4本の日付と主語も整理します。
セキュリティ標準とAI活用
NIST SP 1353 ipd(草案) 3 ユースケース
NIST SP 1353 ipd に何が書かれているかが条件別に分かります。3つの想定ユースケース、CO-STAR6欄へのNIST自身の説明、Style欄の文面の違い、付属ZIPの手順、意見受付期限(2026年10月15日 11:59 PM)まで原典で確認して整理しました。
AIエージェント運用の設定判断
gpt-oss-120b・選別注入 16.1 ポイント
エージェントに注入するガイドラインの最適量はモデルの階層で変わります。IBM Research が AppWorld test_normal(168タスク)で報告した5モデルの最良構成、スコア差(ポイント)、入力トークン増加率(+78%/+51%/+5%)を条件別に並べ、自社で確認する手順と注意点まで整理しました。
報道やまとめ記事を根拠にしません。当事者が公表した発表・公式ドキュメント・論文まで遡り、そのURLを記事末尾に並べます。
主要な内容は独立した2件以上で確認します。1社の発表しかないものは「〇〇社の発表によると」と主語を明記し、確定した事実として書きません。
この分野は動きが速く、半年前の正解が今の誤りになります。原典の公開日を記録し、古い情報には時点を明記します。