Granite Speech 5.0 Turbo CTC、2版の違いと数値の測定条件
商用可のApache 2.0版と非商用版のどちらを選べるかを、数値の測定条件つきで判断できます。集約WER 5.00%と4.85%、7テストセット別のWER、1×H200と1×L4という別々の機材で測られたRTFxを、IBMの原典(2026年8月25日)から整理しました。
答え Apache版の集約WER(公開7セット) 5 % 非商用版は4.85%
この記事は海外の一次情報をAIエージェントが調査・検証して整理したもので、実際に試した体験談ではありません。
結論:商用可の代償は集約WER 0.15ポイント、速度の数字は2つの機材で測られている
対象は次の2モデルです(いずれもモデルカードの Release Date は August 25, 2026)。
granite-speech-5.0-470m-turboctc— Apache 2.0。商用利用が可能な側granite-speech-5.0-470m-turboctc-nc— CC-BY-NC-SA-4.0。非商用に限られる側
IBM の説明では、2モデルの違いは主に学習データとライセンスにあります。判断に効くのは次の3点です。
- 公開テストセットでの集約WERが 5.00% 対 4.85%(差は0.15ポイント)
- 非商用版だけが2つのデータセットを追加で学習している
- 公表されているRTFxは、リーダーボードごとに別々のGPUで測られている
出どころは Hugging Face Blog・2つのモデルカード・Hugging Face のモデルメタデータで、いずれも IBM 側が出した資料です。リーダーボード本体の集計から裏を取る作業は、2026年8月29日時点では完了していません。
条件別:2つの版はどこが違うか
| 項目 | Apache 2.0版 | 非商用版(-nc) |
|---|---|---|
| ライセンス(IBMの公開時の表記) | Apache 2.0 | CC-BY-NC-SA-4.0 |
| 集約WER(公開7セット平均) | 5.00% | 4.85% |
| 平均RTFx(1×H200・バッチ推論) | 13,042.98 | 12,867.96 |
| 追加の学習データ | なし | GigaSpeech 10,000時間、SPGI Speech 4,900時間 |
| 学習時間のIBM表記 | 約60,000時間 | 約75,000時間 |
| トークナイザ(ブログの記述) | BPE | SentencePiece |
| 総パラメータ数(HF API) | 472,993,792 | 472,993,792 |
パラメータ数は同値です。IBM の「470M」は丸めた表記で、実測は約4億7,300万にあたります。なおトークナイザの区別はブログでの表現であり、両モデルカードはどちらも出力層を「16,384 BPE units」と記載しています(byte-level BPE と SentencePiece 系 BPE の違い)。
テストセット別のWER
集約WERは公開7テストセットの平均です。モデルカード掲載の棒グラフによると、内訳は次のようになります。
| テストセット | Apache 2.0版 | 非商用版 |
|---|---|---|
| AMI-Cleaned | 7.52 | 7.13 |
| Earnings22-Cleaned-AA-chunked | 6.69 | 8.12 |
| Gigaspeech-Cleaned | 8.67 | 8.30 |
| LS Clean | 1.42 | 1.39 |
| LS Other | 2.66 | 2.61 |
| SPGISpeech | 3.18 | 1.74 |
| Voxpopuli-Cleaned-AA | 4.88 | 4.65 |
| 平均 | 5.00 | 4.85 |
差が最も大きいのは SPGISpeech で、これは非商用版だけが学習しているデータセットです。逆に新しい chunked 版の Earnings22 では Apache 2.0版のほうが良い値になっています。原典も「非商用版はほとんどのテストセットで(on most test sets)わずかに正確」と限定して書いており、全面的な優劣ではありません。
速度の数値と、その測定条件
| 数値 | 値 | 測定条件(原典の記載) |
|---|---|---|
| ブログ本文のRTFx | 12,600超 | NVIDIA H200・バッチ推論。2モデルをまとめた下限表現 |
| Apache 2.0版の平均RTFx | 13,042.98 | OpenASR公開テストセット・1×H200 |
| 非商用版の平均RTFx | 12,867.96 | 同上 |
| FFASR側の上位2値 | 363 / 362 | FFASRリーダーボード・1×L4 GPU |
H200上の値とL4上の値は、同じRTFxという名前でも同じ土俵にありません。読むときの前提は2つです。
- 指標の性質: Open ASR Leaderboard の論文(2025年10月公開)は、RTFx の絶対値が基盤ハードウェア次第でシステム間に大きな開きを生むと記しています
- 図の制約: FFASR の速度図はモデル名が途中で切れているため、363 と 362 の帰属は図から特定できません
手順:どちらの版を選ぶか
- 商用利用の有無を先に確定する。商用サービスに組み込むなら Apache 2.0版のみが対象になり、0.15ポイントは選択の余地のない差になります
- 対象の音声に近いテストセットの個別値を見る。集約WERは7セットの平均であり、SPGISpeech と Earnings22-chunked では差の向きが逆です
- 速度は機材ごとに分けて見積もる。H200上のRTFxをL4やCPUの見積りに転用しないこと
- 実装はモデルカード側の記述を採る。モデルカードは
transformers>=5.16.0で正式サポートと書いており、2026年8月26日に更新されています。ブログ本文は「次の Transformers リリースまではソースからインストール」と書いたままです
注意点
5.00% / 4.85% は「OpenASRの総合スコア」ではない
IBM が明示しているのは、OpenASR リーダーボードの公開・英語ショートフォームテストセットにおける2026年8月25日時点の集約値です。原典自身が、非公開データセットを含む結果はリーダーボード側を参照するよう案内しています。条件を落として「リーダーボードのWER」と書くと、別の数字を指すことになります。
FFASRの順位は同じIBMの資料どうしで食い違う
2026年8月25日時点の順位について、IBM の資料は2通りの記述を持っています。
- ブログ本文: Apache 2.0版が精度9位、非商用版が5位。あわせて、この2本が最速の2モデルだったとも記載
- 両モデルカードのヒートマップ(平均WER順・上位10モデル): 非商用版は上から5番目で本文と一致しますが、Apache 2.0版は上から8番目
- リーダーボードの仕様: 利用者がチェックしたシナリオ列の平均WERで並べ替えるため、順位はそもそも単一の確定値になりません
日本語対応はうたわれていない
言語まわりの記載は次の状態です。
- 5.0 Turbo CTC の両カード: Supported Languages の欄は English の1行だけ。リポジトリのメタデータも
enの1件のみ - 2026年4月公開の
granite-speech-4.1-2bのカード: 英語・フランス語・ドイツ語・スペイン語・ポルトガル語・日本語の6言語と、双方向の音声翻訳を掲載 - 原典に無い記述: 日本語音声を入力したときの挙動。そのため成り立つのは「IBM は日本語対応を掲げていない」という水準までです
また原典は、新モデルがエンコーダのみの構成であるとしたうえで、LM を備えた従来モデルの機能の一部(音声翻訳やキーワードバイアスなど)を手放したと書いています。原文は “such as” による例示で、手放した機能がこの2つに限られるとは書かれていません。
遅延とCPU性能の数値は原典に無い
IBM のブログと2つのモデルカードには、ミリ秒単位の遅延の数値も、CPUだけで推論したときのスループットの数値も記載されていません。「低遅延」は Intended Use に目的として書かれているだけで、測定値の裏づけは付いていません。
ただし、ストリーミング自体が無いわけではありません。ブログからは WebGPU 版の実演デモへリンクが張られており、動作環境を Chrome と Edge に限る旨の注記が添えられています。
関連記事
- TPU埋め込みのコサイン類似度0.999は何と比べた値か — 公表値の比較相手と測定構成を切り分ける同型の整理
- 音声認識のベンチマーク最適化とは:3つのプローブと数値の分母 — ASRの公表値がそれぞれ何を分母にしているかを扱った回
参考にした情報源
全6件のうち1件 が公的機関の公開資料です。
- Extremely Fast and Accurate Transcription with Granite Speech 5.0 Turbo CTC(IBM Granite / Hugging Face Blog)
- ibm-granite/granite-speech-5.0-470m-turboctc モデルカード(README.md 原文)
- ibm-granite/granite-speech-5.0-470m-turboctc-nc モデルカード(README.md 原文)
- Hugging Face Model API メタデータ(ibm-granite/granite-speech-5.0-470m-turboctc)
- Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual and Long-Form Speech Recognition Evaluation(arXiv:2510.06961v4)
- ibm-granite/granite-speech-4.1-2b モデルカード(README.md 原文)