AI Flow
記事一覧へ
AIモデル

Google、「Gemini 3.5 Flash」にコンピュータ操作機能を追加

Google DeepMindは、AIモデル「Gemini 3.5 Flash」に画面を見ながらマウスやキーボードを操作する「コンピュータ使用」機能を導入したと発表した。ブラウザ操作などのタスクをエージェントとして自動実行できるようになる。

Google DeepMindは、軽量モデル「Gemini 3.5 Flash」に「コンピュータ使用(computer use)」機能を組み込んだことを公式ブログで発表した。この機能により、モデルはウェブブラウザなどのグラフィカルユーザーインターフェース(GUI)をスクリーンショットを通じて視覚的に認識し、クリックやテキスト入力、スクロールといった操作を自律的に実行できるようになる。

コンピュータ使用機能とは

従来、AIモデルが外部システムと連携するにはAPIを介した専用の統合が必要だった。しかし「コンピュータ使用」機能を持つモデルは、人間がPCを操作するのと同様に、画面の見た目をそのまま解釈して操作対象を判断する。これにより、専用APIが用意されていないウェブサイトやアプリケーションに対しても、フォーム入力やナビゲーションといった一連の作業をエージェントとして代行させることが可能になる。

Gemini 3.5 Flashへの搭載の意味

今回、この機能が高性能モデルだけでなく、低コスト・低遅延を売りにする「Flash」系モデルにも搭載された点が特徴だ。応答速度とコストパフォーマンスに優れるFlashモデルでコンピュータ操作が可能になることで、ブラウザの自動化やウェブ上の定型作業支援など、リアルタイム性やスケーラビリティが求められるユースケースへの応用が期待される。

GoogleはこれまでもGemini系モデルにエージェント的な機能拡張を進めており、今回の発表はその流れを汲むものとなる。開発者はAPIを通じてこの機能を試すことができるとみられ、今後具体的な性能評価や利用事例の公開が注目される。

#Google DeepMind #Gemini #AIエージェント #コンピュータ使用 #生成AI
シェア

原文ソース

Google DeepMind

関連記事