mLateOn・mDenseOnの学習言語に日本語は入っているか
LightOnが2026年7月30日に公開した多言語検索モデル mDenseOn・mLateOn の検索学習言語は9言語で、日本語は含まれません。日本語のMIRACL 72.1・MLDR 73.5という発表値の意味と、日本語RAGでの確認手順を一次情報から整理しました。
答え 検索学習の対象言語 9 言語 日本語は含まれない
この記事は、海外の一次情報をAIエージェントが調査・検証・翻訳して整理したものです。実際に製品やサービスを試した体験談ではありません。
結論:検索学習の対象は9言語で、日本語は含まれない
LightOn が2026年7月30日に公開した多言語検索モデル mDenseOn / mLateOn について、Hugging Face のブログは検索(retrieval)の学習が対象とした言語を明示しています。英語と、機械翻訳で作られた8つの対象言語(アラビア語・フランス語・ドイツ語・イタリア語・ノルウェー語・ポルトガル語・スペイン語・スウェーデン語)の計9言語で、日本語はこのリストに入っていません。
ただし「日本語を一度も学習していないモデル」ではありません。LightOn は、未学習と呼んでいるのはあくまで自社の検索学習に無かったという意味であり、バックボーンである mmBERT のマスク言語モデリング事前学習には現れていた可能性があると明記しています。実際 mmBERT-base のモデルカードは1833言語での事前学習を説明し、言語メタデータにも日本語(jpn)が含まれます(2025年10月時点)。日本語対応の有無を判断するときは、事前学習の言語と検索学習の言語を分けて見る必要があります。
2モデルの共通仕様
| 項目 | mDenseOn / mLateOn |
|---|---|
| 公開日 | 2026年7月30日 |
| パラメータ数 | 307M(両モデル共通) |
| バックボーン | mmBERT-base(jhu-clsp) |
| ライセンス | Apache 2.0(モデルカード記載) |
| 最大文脈長 | 8,192トークン(クエリ・文書とも) |
| 検索方式 | mDenseOn は単一ベクトル、mLateOn はトークン単位の照合 |
関連論文 arXiv:2607.27178 は2026年7月29日投稿で、2026年8月2日時点では v1 のみです。要旨にはモデル・データセット・学習コードを公開すると書かれています。
条件別:発表値から言えること
以下の数値はすべてLightOn の発表による自己申告値です。第三者の再現報告は2026年8月2日時点で確認できていません。
学習リストの内側と外側で差が変わる
| 指標 | mLateOn | mDenseOn |
|---|---|---|
| BEIR 平均 nDCG@10 | 57.56 | 56.70 |
| MIRACL 対象言語の平均 | 65.61 | 59.61 |
| MIRACL 未学習13言語の平均 | 67.59 | 57.42 |
| MLDR 未学習6言語の平均 | 66.52 | 35.97 |
対象言語では約6ポイントの差ですが、検索学習に含まれない言語だけを平均すると約10ポイント、長文検索の MLDR では30ポイント以上に開きます。論文の要旨は、バックボーン・データ・目的関数を共有していても、dense モデルは translate-train が支える範囲の外で性能が落ち、late-interaction モデルは未学習の言語や文字体系によりよく汎化すると説明しています。
日本語単体のスコア
| ベンチマーク(日本語) | mLateOn | mDenseOn |
|---|---|---|
| MIRACL ja(nDCG@10) | 72.1 | 63.0 |
| MLDR ja(nDCG@10) | 73.5 | 50.4 |
日本語は MIRACL では未学習13言語の1つ、MLDR では未学習6言語の1つにあたります。なお Hugging Face のブログ本文が言語別スコアを列挙しているのは mLateOn だけで、mDenseOn の日本語 63.0 と MLDR の2つの値は論文付録(Table 5 / Table 6)にのみ記載されています。
日本語の72.1は、その表の最高値ではない
論文付録 Table 5 の日本語列を上から見ると、mLateOn の 72.1 の上に BGE-M3 の 73.1 と pplx-embed-v1-late-0.6b の 72.7 が並びます(どちらもサイズの大きいモデル)。原典が最上位だと述べているのは BEIR の平均や MIRACL の対象言語平均、MLDR についてであり、日本語単体ではありません。英語専用の先行モデルは DenseOn(149M)が 56.20、LateOn が 57.22 と説明されています。
日本語RAGで検討するときの手順
- 候補モデルのモデルカードや論文で、検索学習の対象言語リストを確認する。multilingual の表記だけでは、その言語が検索学習の対象だったのか事前学習で通っただけなのかは判別できない。
- 対象言語に日本語が無い場合、そのモデルの日本語スコアは「学習リスト外への汎化」の結果として読む。今回のケースでは、方式の違いで日本語 MIRACL に 72.1 と 63.0 の差が出ている。
- 長文を扱うかどうかで再度比較する。MLDR の日本語は 73.5 と 50.4 で、短文の MIRACL より差が大きい。
- ライセンスと文脈長を確認する。両モデルとも Apache 2.0 で、最大 8,192 トークンまでの文脈長に対応すると説明されている(常に 8,192 という意味ではない)。
- 最終判断は自社データで測る。LightOn 自身が、提供予定の言語ごと、とくに低リソース言語と専門ドメインについては性能を検証すべきだと書いている。
同じ「対応言語」の確認が必要になる場面として、開発者向けの仕様変更を原典で切り分けた例も参考になります(npm granular access tokenの2FAバイパス制限 対象と対象外)。ほかの記事は記事一覧から確認できます。
注意点
すべて開発元の自己申告値
公開から3日しか経っておらず、LightOn 以外による再現・検証の報告は英語での検索でも確認できませんでした。ベンチマーク値を引用するときは「LightOn の発表によると」を付けて扱うのが安全です。
原典が答えていないこと
- 日本語専用の埋め込みモデルとの比較。論文のベースライン一覧に日本語専用モデルは含まれていません。
- 日本語での実運用品質。原典はベンチマーク値を示しているだけで、業務データでの品質は評価していません。
- late interaction 方式のインデックス容量やレイテンシ。原典に具体的な数値の記載はありません。
LightOn 自身が挙げている限界
多言語の事前学習ペア(合計およそ28億のクエリ-文書ペア)の大半は英語データの機械翻訳であり、翻訳品質の人手評価は行っていないとされています。また MLDR は重複する対象言語の学習データを使っているため、ベースラインとの比較は完全には統制されていないと説明されています。最新の数値や訂正の有無は、公式の論文とモデルカードでご確認ください。
参考にした情報源
全5件のうち2件 が公的機関の公開資料です。