Gemini 3.8 Live with Live Avatarは、AIとの会話に「見える相手」を加えます。声に合わせて口が動き、表情が変わり、97言語を会話の途中で切り替えても崩れない。問い合わせ窓口や受付の体験が、文字から人の気配へ変わっていきます。
チャット窓に質問を打ち込んで、返ってきた長い文章を目で追いながら、これ、人に聞けば30秒なのにと思ったことがあるはずです。KPEは、Google DeepMindが発表したGemini 3.8 Live with Live Avatarの資料を読み、何が新しくて、どこまでが今の話なのかを確かめました。読み終えたとき、この技術が自分の生活のどこに触れてくるのか、そして今動くべきか待つべきかを決められます。
KPEは発表資料にある事実だけを追っています。
生活の側から見ていきます。
1. 発表されたのは、話す顔でした
これまでAIとの会話は、声か文字でした。Gemini 3.8 Live with Live Avatarが加えたのは、そこに映像を重ねる仕組みです。聞いて、見て、話す。表情が動く。会話のあいだの間合いまで持つ。2026年9月24日、Google DeepMindがGemini Enterpriseでの提供を発表しました。
01 声と映像が、同時に生まれている
録画した映像に音声を合わせたのではありません。発表によれば、ライブ対話の能力と低遅延のストリーミング映像をネイティブに結合しています。話しながら、その顔がつくられている。ほぼリアルタイムで。
だから口の動きが声とずれません。表情も自然に変わる。発言を譲り合うタイミングもなめらかだと説明されています。人が人と話すとき、言葉以外で伝えているものは驚くほど多い。その部分を、機械が持ちはじめたということです。
02 会話は、もともと多感覚だった
私たちは聞きながら見ています。話しながら表情を使っています。発表資料はそこを起点にしていて、音声と視覚の入力を同時に処理すると書かれています。カメラの向こうの様子を見て、聞いて、映像と声で返す。
つまり相手が何を見ているかを前提にした会話ができる。手元のものを見せながら聞く、という動作が成立します。説明書を読み上げてもらうのではなく、これのことですと指させる。
| 項目 | 発表内容 |
|---|---|
| 名称 | Gemini 3.8 Live with Live Avatar |
| 発表日 | 2026年9月24日 |
| 提供先 | Gemini Enterprise |
| 対応言語 | 97言語 |
| 透かし | SynthIDを音声・映像に埋め込み |
| カスタム作成 | エンタープライズの許可リスト経由のみ |
| 一般消費者向け提供 | 公式発表では未公表 |
2. 待たされない、が変わりはじめる
この発表でKPEがいちばん生活に近いと感じたのは、非同期のツール呼び出しです。調べものをしている最中も、会話が止まらない。あの無言の待ち時間が設計から外されています。速さそのものより、気まずさが減ることのほうが大きい。
01 裏で調べながら、話し続ける
発表では、Live Avatarがバックグラウンドでツールを呼び出しデータを取得しながら、対話を続けられると説明されています。例として挙げられているのは、ホテルのチェックイン。予約を照会している最中も、会話は途切れません。
電話口で少々お待ちくださいと言われ、保留音を聞いている数十秒。あれは短いようで長い。埋められるなら、埋めたほうがいい。待ち時間が消えるのではなく、待ち時間が会話になるという発想です。
02 97言語を、会話の途中で
言語をまたいでも映像が崩れない、というのが発表の主張です。97言語のあいだを会話の途中で切り替えても、口の動きと表情が追随し、映像の品質が落ちたり視覚的なズレが出たりしないと書かれています。ネイティブな多言語の音声同期を備えているためです。
旅先の窓口を想像してみてください。日本語で聞いて、隣の人が英語で割り込んで、また日本語に戻る。人間の受付ならできることが、機械の側でも崩れない。言葉の壁は、待遇の壁でもありました。
03 顔は、ブランドの一部になる
用意されたアバターのライブラリに加えて、組織は自社のアバターを作れます。高品質な参照画像から、元の見た目やブランドの意匠、キャラクターの同一性を保ったまま、動いて応答するアバターを生成できると説明されています。
ただしカスタムのアバター作成は、現時点でエンタープライズの許可リスト経由のみです。誰でもすぐに自分の分身をつくれる、という段階ではありません。
3. つくられた顔と、どう付き合うか
本物そっくりの顔が話すなら、それが生成物だと分かる仕組みが要ります。発表はここに一節を割いていて、AI製品の出力すべてにSynthIDの透かしを入れるとしています。音声にも映像にも、知覚できない形で織り込まれる。
01 見えない透かしが、音と映像に入る
SynthIDは音声と映像の出力へ直接埋め込まれ、人の目や耳では気づけません。AIが生成した内容が検出可能なままであることで、誤情報や誤った帰属を減らすことを狙うと説明されています。
本人そっくりの顔と声が動く技術には、当然この備えが要ります。安全性と責任ある展開についての包括的な考え方は、モデルカードで公開されているとのことです。
02 いまは、企業向けの話です
提供先はGemini Enterprise。開発者向けのAPIドキュメントも案内されています。スマートフォンのアプリで今日から使える、という発表ではありません。
ただし生活者が触れる場所は企業の窓口です。カスタマーサービスや、対話型の案内。つまり自分で導入しなくても、ある日サポート画面に顔が現れる形で届く可能性がある。順番としては、先に出会うほうです。
4. いま決めること、待っていいこと
結論から言えば、個人として今すぐやることはほとんどありません。でも知っておく価値はある。画面の向こうの相手が人かどうか、それを意識する習慣がここから必要になるからです。事業者側なら話は別で、Gemini Enterpriseで今日から検討できます。
01 事業者なら、窓口を思い浮かべる
問い合わせが多言語で来る、説明が長くて電話が伸びる、待たせるたびに離脱する。そういう心当たりがあるなら、検討の余地があります。発表によればGemini Enterpriseで提供開始、APIドキュメントも公開済みです。
ただしカスタムアバターは許可リスト経由のみ。自社の顔でやりたい場合は、そこが入口になります。まずはプリセットのライブラリで感触を確かめる、という順番が現実的でしょう。
02 生活者は、覚えておくだけでいい
今日から何かを買う必要はありません。料金も一般提供の時期も、公式発表では未公表です。だから待つのが自然です。
覚えておきたいのは一点だけ。表情豊かに話すあの顔は、つくられていることがある。SynthIDのような仕組みが入っているのは、そういう時代になったからです。疑うためではなく、知っているために。便利さを受け取りながら、これは誰が話しているのかという問いを手放さない。それだけで十分だとKPEは考えます。
5. よくある質問
Gemini 3.8 Live with Live Avatarとは
Geminiの対話AIに、ほぼリアルタイムの視覚的な存在感を加えた機能です。ライブ対話能力と低遅延のストリーミング映像をネイティブに結合し、聞いて、見て、表情のある姿で話します。2026年9月24日にGoogle DeepMindが発表しました。
個人でも使えますか
提供先はGemini Enterpriseです。開発者向けのAPIドキュメントも案内されています。一般消費者向けアプリでの提供については、公式発表では未公表です。企業の問い合わせ窓口などを通じて触れる形が先になります。
日本語に対応していますか
発表では97言語に対応し、会話の途中で言語を切り替えても、口の動きと表情が追随すると説明されています。映像の品質が落ちたり視覚的なズレが出たりしないとされています。個別の言語ごとの詳細な挙動までは資料に記載がありません。
アバターの見た目は変えられますか
多様なプリセットのライブラリに加え、組織は独自のアバターを作成できます。高品質な参照画像から、見た目やブランドの意匠を保ったまま生成する仕組みです。ただしカスタムアバター作成は、現時点でエンタープライズの許可リスト経由のみとなっています。
AIが作った映像だと分かりますか
出力にはSynthIDの透かしが入ります。音声と映像の両方に知覚できない形で織り込まれ、AI生成コンテンツが検出可能な状態を保つことで、誤情報や誤った帰属を減らすことを狙う仕組みだと説明されています。
会話中に待たされませんか
非同期のツール呼び出しに対応しており、バックグラウンドでツールを実行しデータを取得しながら対話を継続できます。ホテルのチェックイン処理のような複雑なタスクでも、会話の流れが途切れない設計だと発表では説明されています。
6. まとめ
画面の向こうに顔がある。ただそれだけのことが、待ち時間の気まずさも、言葉が通じない心細さも、少しずつ削っていきます。97言語を会話の途中でまたいでも崩れない。裏で調べながら話し続ける。事業者なら今日からGemini Enterpriseで検討できます。生活者は、急いで何かをする必要はない。ただ、あの表情はつくられていることがあると知っておく。知っていれば、怖くない。便利さはそこから始まります。
- 提供先:Gemini Enterprise。APIドキュメント公開済み
- 対応言語:97言語。会話の途中で切り替え可能
- 待ち時間:裏でツール実行、対話は途切れない設計
- カスタム:独自アバターは許可リスト経由のみ
- 見分け方:音声と映像にSynthIDの透かしを内蔵




