EmbeddingGemma 2 で、手元の写真や録音を言葉で探せるようになります。740M パラメータの埋め込みモデルが、文字と画像と音と映像を同じ空間に並べる。クラウドに送らず端末の中だけで動くので、見せたくないデータは外に出ません。何ができて、どこから触れるのかを順に見ていきます。
撮りためた動画のどこかにある一瞬を探したいのに、カメラロールを親指で遡るしかない。EmbeddingGemma 2 という名前を見て、私がまず思い出したのはその徒労でした。
私が確かめたのは、発表資料に並ぶ数字です。740M というサイズ、端末で必要になるメモリ、そして一度に扱える音や画像の量。
読み終えたとき、自分のスマホや PC で今日試す価値があるのか、それともアプリが出るまで待つのかを決められるようにしました。

1. 740M で、四つの感覚がひとつになる
Google が発表した EmbeddingGemma 2 は、文字・画像・音声・映像を同じ座標に置き直すモデルです。つまり「声で言ったこと」と「画面に映ったもの」を、同じ尺度で近い・遠いと比べられる。パラメータは740Mで、端末の上で動かすことを前提に設計されています。ライセンスは商用利用もできる Apache 2.0 です。
01. 埋め込みは、意味の住所です
埋め込み(エンベディング)という言葉は難しく見えますが、やっていることは住所を振ることです。似た意味のものを近い場所に、違う意味のものを遠い場所に置く。言葉で検索できるのは、検索語の側にも同じ住所が振られるからです。
これまでの EmbeddingGemma は、その住所をテキストにだけ振っていました。EmbeddingGemma 2 はコードにも、画像にも、映像にも、音声にも同じ住所体系を使う。だから「犬が走っている」と打てば、文字で書かれたメモも、写真も、吠え声の録音も、ひとつの並びの中に出てきます。
モデルはひとつです。別々の変換器を継ぎ足して後から揃えるのではなく、はじめから同じ空間に写すよう作られている。発表では「ネイティブにマルチモーダル」と書かれています。種類ごとにモデルを切り替えるあの手間が、設計の段階で消えている。
02. 土台は Gemma 4、免許は Apache 2.0
EmbeddingGemma 2 は Gemma 4 のアーキテクチャの上に建っています。テキストのトークナイザと音声エンコーダを Gemma 4 と共有しているので、文章を書く側の Gemma 4 と並べて走らせても、合計のメモリは単純な足し算より小さく収まるとされています。探す係と答える係を、同じ端末に同居させられるということです。
重みは Hugging Face と Kaggle からダウンロードできます。端末向けに最適化されたものは Hugging Face の LiteRT Community に置かれています。Gemini Enterprise Agent Platform の Model Garden は近日対応とされていて、その時期は公式発表では未公表です。
2. 567MB で、スマホの中に収まる
体感できるのは、クラウドに投げなくていいことです。発表では、量子化すれば Pixel 11 Pro でテキスト専用の重みが約191MB、マルチモーダル全部込みでも約567MBのアクティブRAMで動くとされています。写真も録音も、端末の外に出さないまま意味で探せる余地があるということです。
01. 保存容量は、好きな長さに切れる
ベクトルを保存する側の話です。EmbeddingGemma 2 は Matryoshka Representation Learning を使っていて、出力の768次元を512・256・128へ動的に切り詰められます。発表では、ローカルのベクトルデータベースと使用メモリを最大6倍まで小さくできるとされています。
ここが生活に関わるのは、インデックスの重さを自分で選べるからです。精度を取るなら768、容量を取るなら128。写真が何万枚あっても、置き場所の大きさを自分の端末に合わせられる。
モジュール式でもあります。テキストだけなら270Mで足り、画像を扱うなら170M、音声なら300Mのエンコーダを足す。使わない感覚の分まで背負わなくていい、という設計です。
02. 一度に、5.5分の音声が入る
コンテキストウィンドウは8Kトークンで、初代 EmbeddingGemma の4倍です。発表によれば、一度に扱えるのは音声なら最長5.5分、画像なら29枚、映像なら58フレーム、あるいはそれらが混ざったもの。すべて端末の上で処理されます。
会議の録音を丸ごと一息で、とまではいきません。それでも5.5分という単位は「さっきの話」を拾うのに足ります。長い録音も区切って住所を振っていけば、文字のクエリで該当箇所を指せる余裕がある。待つ時間が減るのではなく、そもそもどこにも送らないから待つ工程が消える。
| 項目 | 発表された値 |
|---|---|
| パラメータ | 740M(テキスト専用なら270M) |
| 追加エンコーダ | 画像170M/音声300M |
| 出力次元 | 768 →512・256・128 |
| コンテキスト | 8Kトークン(初代の4倍) |
| 一度に扱える量 | 音声5.5分/画像29枚/映像58フレーム |
| アクティブRAM | 約191MB(テキスト)/約567MB(全部込み) |
| ライセンス | Apache 2.0 |
3. 向くのは、自分で組む人
向くのは、手元のデータで何かを組み立てたい人です。ローカルのコードベースを意味で検索したい、家の中の写真と動画にまとめて言葉で問いかけたい、オフラインでも動く RAG を作りたい。逆に、入れれば終わる完成品を待っている人には、今日はまだ早い。入口は用意されていますが、入口は入口です。
01. コード検索の伸びが一番大きい
数字で変化が大きいのはコードです。MTEB Code のスコアは68.76から78.68へ、9.92ポイント上がったと発表されています。多言語のテキスト性能は初代と同等を保ったまま、コードだけがはっきり伸びた形です。
発表では、ローカルのコードベースのインデックス化、セマンティックなコード検索、コーディングエージェントの検索に向くとされています。自分の PC の中だけで、自分が書いてきた全部を意味で引ける。手元のリポジトリが大きい人ほど、差が出るところです。

02. 今日から触れる入口
Google AI Edge Gallery の Instant Media Search では、テキストか画像で自分のメディアライブラリから近いものを探せます。Video Moments Finder は、テキストか音声で動画の該当箇所を指す。Google AI Edge Foresight アプリでは、EmbeddingGemma 2 のローカル検索と Gemma 4 の推論を組み合わせています。
自分で組む側の道具も揃っています。transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama、LMStudio で動かせて、ベクトルの保存は Qdrant。端末向けは Google AI Edge MediaPipe と LiteRT、ブラウザなら transformers.js か WebGPU。微調整は Unsloth の手引きがあります。
分類やルーティングのように、その場で判断させる使い方は MediaPipe Decision Task API から。ここまで並べて「作る場所をもう用意した」と言っているのが、今回の発表の性格です。
4. 今日やること、三つだけ
結論から言います。自分の手でインデックスを作る気があるなら、今日始めて構いません。重みはもう公開されていて、ライセンスは商用も通り、動かす道具も出揃っている。待つ理由があるのは、アプリとして完成したものを使いたい人だけです。ここからは順番の話をします。
01. まずは入口のアプリから
最初の一歩はダウンロードではなく、Google AI Edge Gallery の Instant Media Search と Video Moments Finder です。自分のライブラリに向けて、言葉で問いかけてみる。手応えがあるかどうかは、ここで分かります。重みを落とす前に、使い心地を確かめる順番がいい。
次に Ollama か LMStudio で重みを落として、手元のフォルダをひとつだけインデックスしてみる。写真でも、録音でも、書きかけのコードでもいい。容量が気になるなら、出力を128次元に切り詰めて始める。全部を一気にやらないのが、続けるコツです。
02. 待っていいのは、こういう人
スマホに入れるだけで写真が意味で探せる、という完成品を望んでいるなら、今日の発表は素材の配布です。素材が配られた日から、こなれたアプリが出てくるまでには時間がある。急ぐ必要はありません。
それでも、ひとつだけ言わせてください。740Mという大きさは、自分の端末の中に検索の頭脳を置けるという意味です。写真も声も動画も、どこにも送らずに探せる。部屋の中の全部を自分の手で整えたい——あの気持ちに、ようやく道具のほうが追いついてきた。
5. よくある質問
EmbeddingGemma 2 は無料で使える?
重みは Apache 2.0 という商用利用もできるライセンスで公開されていて、Hugging Face と Kaggle からダウンロードできます。端末向けに最適化されたものは Hugging Face の LiteRT Community に置かれています。
日本語でも使える?
発表では、初代 EmbeddingGemma の多言語テキスト性能をそのまま維持していると書かれています。ただし日本語単体の評価値については公式発表では未公表です。手元の日本語データで試してから判断するのが確実です。
スマホでどのくらいのメモリが必要?
量子化した場合、Pixel 11 Pro でテキスト専用の重みが約191MB、画像と音声まで含めた全部込みでも約567MBのアクティブRAMで動くと発表されています。出力次元を切り詰めれば、保存側も最大6倍小さくできます。
初代 EmbeddingGemma との違いは?
大きいのは三つです。テキストだけだった対象が画像・映像・音声・コードへ広がったこと、コンテキストが8Kトークン(初代の4倍)になったこと、MTEB Code が68.76から78.68へ伸びたこと。土台も Gemma 4 に変わっています。
すぐ試せるアプリはある?
Google AI Edge Gallery の Instant Media Search と Video Moments Finder で、自分のメディアを言葉や画像、音声から探せます。Google AI Edge Foresight アプリでは、ローカル検索と Gemma 4 の推論を組み合わせた形を試せます。
自分のデータで微調整できる?
できます。発表では Unsloth による微調整の手引きが案内されていて、推論と微調整それぞれのガイドも用意されています。transformers や sentence-transformers から扱えるので、普段の学習環境をそのまま使えます。
6. まとめ
探す、という動作が端末の内側に戻ってきます。文字・画像・音声・映像を同じ住所体系に並べる740Mのモデルが、Apache 2.0 で誰にでも配られた。約567MBで全部込みが動き、保存する次元は自分で選べる。つまり、自分の写真と声と動画を外に出さないまま、意味で引ける土台が手に入ったということです。組む気がある人は今日から。完成品が欲しい人は、これから出てくるアプリを待てばいい。どちらも間違いではありません。
- まず試す:AI Edge Gallery の2つの検索機能を触る
- 重みを落とす:Hugging Face か Kaggle、Ollama でも可
- 容量を決める:768か128か、先に次元を選んでおく
- 対象を絞る:フォルダひとつ、リポジトリひとつから
- 待つ判断:完成アプリ待ちなら今日は見るだけでいい
7. 画像の出典
- ① Google 公式発表・表示の安定のため当サイトのサーバーで配信




