最終確認 約6分で読めます 音声認識モデル

Granite Speech 5.0 Turbo CTC、2版の違いと数値の測定条件

商用可のApache 2.0版と非商用版のどちらを選べるかを、数値の測定条件つきで判断できます。集約WER 5.00%と4.85%、7テストセット別のWER、1×H200と1×L4という別々の機材で測られたRTFxを、IBMの原典(2026年8月25日)から整理しました。

答え Apache版の集約WER(公開7セット) 5 % 非商用版は4.85%

この記事は海外の一次情報をAIエージェントが調査・検証して整理したもので、実際に試した体験談ではありません。

結論:商用可の代償は集約WER 0.15ポイント、速度の数字は2つの機材で測られている

対象は次の2モデルです(いずれもモデルカードの Release Date は August 25, 2026)。

  • granite-speech-5.0-470m-turboctc — Apache 2.0。商用利用が可能な側
  • granite-speech-5.0-470m-turboctc-nc — CC-BY-NC-SA-4.0。非商用に限られる側

IBM の説明では、2モデルの違いは主に学習データとライセンスにあります。判断に効くのは次の3点です。

  1. 公開テストセットでの集約WERが 5.00% 対 4.85%(差は0.15ポイント)
  2. 非商用版だけが2つのデータセットを追加で学習している
  3. 公表されているRTFxは、リーダーボードごとに別々のGPUで測られている

出どころは Hugging Face Blog・2つのモデルカード・Hugging Face のモデルメタデータで、いずれも IBM 側が出した資料です。リーダーボード本体の集計から裏を取る作業は、2026年8月29日時点では完了していません。

条件別:2つの版はどこが違うか

項目Apache 2.0版非商用版(-nc)
ライセンス(IBMの公開時の表記)Apache 2.0CC-BY-NC-SA-4.0
集約WER(公開7セット平均)5.00%4.85%
平均RTFx(1×H200・バッチ推論)13,042.9812,867.96
追加の学習データなしGigaSpeech 10,000時間、SPGI Speech 4,900時間
学習時間のIBM表記約60,000時間約75,000時間
トークナイザ(ブログの記述)BPESentencePiece
総パラメータ数(HF API)472,993,792472,993,792

パラメータ数は同値です。IBM の「470M」は丸めた表記で、実測は約4億7,300万にあたります。なおトークナイザの区別はブログでの表現であり、両モデルカードはどちらも出力層を「16,384 BPE units」と記載しています(byte-level BPE と SentencePiece 系 BPE の違い)。

テストセット別のWER

集約WERは公開7テストセットの平均です。モデルカード掲載の棒グラフによると、内訳は次のようになります。

テストセットApache 2.0版非商用版
AMI-Cleaned7.527.13
Earnings22-Cleaned-AA-chunked6.698.12
Gigaspeech-Cleaned8.678.30
LS Clean1.421.39
LS Other2.662.61
SPGISpeech3.181.74
Voxpopuli-Cleaned-AA4.884.65
平均5.004.85

差が最も大きいのは SPGISpeech で、これは非商用版だけが学習しているデータセットです。逆に新しい chunked 版の Earnings22 では Apache 2.0版のほうが良い値になっています。原典も「非商用版はほとんどのテストセットで(on most test sets)わずかに正確」と限定して書いており、全面的な優劣ではありません。

速度の数値と、その測定条件

数値値測定条件(原典の記載)
ブログ本文のRTFx12,600超NVIDIA H200・バッチ推論。2モデルをまとめた下限表現
Apache 2.0版の平均RTFx13,042.98OpenASR公開テストセット・1×H200
非商用版の平均RTFx12,867.96同上
FFASR側の上位2値363 / 362FFASRリーダーボード・1×L4 GPU

H200上の値とL4上の値は、同じRTFxという名前でも同じ土俵にありません。読むときの前提は2つです。

  • 指標の性質: Open ASR Leaderboard の論文(2025年10月公開)は、RTFx の絶対値が基盤ハードウェア次第でシステム間に大きな開きを生むと記しています
  • 図の制約: FFASR の速度図はモデル名が途中で切れているため、363 と 362 の帰属は図から特定できません

手順:どちらの版を選ぶか

  1. 商用利用の有無を先に確定する。商用サービスに組み込むなら Apache 2.0版のみが対象になり、0.15ポイントは選択の余地のない差になります
  2. 対象の音声に近いテストセットの個別値を見る。集約WERは7セットの平均であり、SPGISpeech と Earnings22-chunked では差の向きが逆です
  3. 速度は機材ごとに分けて見積もる。H200上のRTFxをL4やCPUの見積りに転用しないこと
  4. 実装はモデルカード側の記述を採る。モデルカードは transformers>=5.16.0 で正式サポートと書いており、2026年8月26日に更新されています。ブログ本文は「次の Transformers リリースまではソースからインストール」と書いたままです

注意点

5.00% / 4.85% は「OpenASRの総合スコア」ではない

IBM が明示しているのは、OpenASR リーダーボードの公開・英語ショートフォームテストセットにおける2026年8月25日時点の集約値です。原典自身が、非公開データセットを含む結果はリーダーボード側を参照するよう案内しています。条件を落として「リーダーボードのWER」と書くと、別の数字を指すことになります。

FFASRの順位は同じIBMの資料どうしで食い違う

2026年8月25日時点の順位について、IBM の資料は2通りの記述を持っています。

  • ブログ本文: Apache 2.0版が精度9位、非商用版が5位。あわせて、この2本が最速の2モデルだったとも記載
  • 両モデルカードのヒートマップ(平均WER順・上位10モデル): 非商用版は上から5番目で本文と一致しますが、Apache 2.0版は上から8番目
  • リーダーボードの仕様: 利用者がチェックしたシナリオ列の平均WERで並べ替えるため、順位はそもそも単一の確定値になりません

日本語対応はうたわれていない

言語まわりの記載は次の状態です。

  • 5.0 Turbo CTC の両カード: Supported Languages の欄は English の1行だけ。リポジトリのメタデータも en の1件のみ
  • 2026年4月公開の granite-speech-4.1-2b のカード: 英語・フランス語・ドイツ語・スペイン語・ポルトガル語・日本語の6言語と、双方向の音声翻訳を掲載
  • 原典に無い記述: 日本語音声を入力したときの挙動。そのため成り立つのは「IBM は日本語対応を掲げていない」という水準までです

また原典は、新モデルがエンコーダのみの構成であるとしたうえで、LM を備えた従来モデルの機能の一部(音声翻訳やキーワードバイアスなど)を手放したと書いています。原文は “such as” による例示で、手放した機能がこの2つに限られるとは書かれていません。

遅延とCPU性能の数値は原典に無い

IBM のブログと2つのモデルカードには、ミリ秒単位の遅延の数値も、CPUだけで推論したときのスループットの数値も記載されていません。「低遅延」は Intended Use に目的として書かれているだけで、測定値の裏づけは付いていません。

ただし、ストリーミング自体が無いわけではありません。ブログからは WebGPU 版の実演デモへリンクが張られており、動作環境を Chrome と Edge に限る旨の注記が添えられています。

関連記事

参考にした情報源

全6件のうち1件 が公的機関の公開資料です。

  1. Extremely Fast and Accurate Transcription with Granite Speech 5.0 Turbo CTC(IBM Granite / Hugging Face Blog)

    huggingface.co参照 2026-08-29

  2. ibm-granite/granite-speech-5.0-470m-turboctc モデルカード(README.md 原文)

    huggingface.co参照 2026-08-29

  3. ibm-granite/granite-speech-5.0-470m-turboctc-nc モデルカード(README.md 原文)

    huggingface.co参照 2026-08-29

  4. Hugging Face Model API メタデータ(ibm-granite/granite-speech-5.0-470m-turboctc)

    huggingface.co参照 2026-08-29

  5. Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual and Long-Form Speech Recognition Evaluation(arXiv:2510.06961v4)

    学術参照 2026-08-29

  6. ibm-granite/granite-speech-4.1-2b モデルカード(README.md 原文)

    huggingface.co参照 2026-08-29