Google DeepMind、マルチモーダルAI「Gemini Omni」を発表
Google DeepMindが新モデル「Gemini Omni」を発表した。テキストや画像、音声など複数のモダリティを統合的に扱う、Geminiファミリーの新たなラインアップとみられる。
Google DeepMindが公式ブログにて「Gemini Omni」を発表した。名称の「Omni」が示す通り、テキスト・画像・音声といった複数のモダリティを横断的に処理できることを特徴とするモデルとみられ、既存のGeminiシリーズを拡張する位置づけの発表となる。
Geminiファミリーの拡張
GoogleはこれまでGemini 1.5やGemini 2.0など、マルチモーダル対応を段階的に強化してきた経緯があり、今回の「Omni」もその流れを汲むものと考えられる。単一のモデルでテキスト生成だけでなく、画像認識や音声理解・生成までを一貫して扱えることを目指した製品と位置づけられる。
今後の展開に注目
公式発表の詳細な仕様やベンチマーク結果、提供形態(API・アプリ組み込みなど)については続報が待たれる。マルチモーダルAIの競争が激化する中、Googleがどのような差別化を図るのか、今後の詳細発表が注目される。
原文ソース
Google DeepMind