top of page

Google、Gemini 3.5 FlashにComputer Useを統合、自律エージェント開発が容易に

  • 執筆者の写真: 白石 奈々
    白石 奈々
  • 6月26日
  • 読了時間: 2分

Google、Gemini 3.5 FlashにComputer Useを統合、自律エージェント開発が容易に
image : Google

プロンプトインジェクション対策も内蔵、低コストなFlashモデルで大規模自動化が現実的に


 米Googleは現地時間6月24日、生成AIモデル「Gemini 3.5 Flash」に、PCやブラウザを操作できる「Computer Use」機能を統合したと発表した。従来は「Gemini 2.5 Computer Use」として個別提供していた機能を、メインモデルへ組み込んだ形となる。


スクリーンショットを認識し、クリック・入力・スクロールを自律実行

 Computer Useを有効化したGemini 3.5 Flashは、スクリーンショットをもとにマウスクリックやキー入力、スクロール操作を実行し、その結果をフィードバックとして受け取りながらタスクを継続的に処理する。ブラウザ、スマートフォン、デスクトップ環境に対応し、連続的なソフトウェアテストや業務アプリをまたぐナレッジワークなど、長時間かつ複数ステップに及ぶ自動化タスクでの活用を想定する。


 またGoogleは、安全対策としてプロンプトインジェクション対策向けの敵対的学習を実施したほか、センシティブな操作前にユーザー確認を求める機能や、インジェクション検知時に自動停止するオプション機能も提供するとしている。


GeminiをAIエージェント基盤として強化

 Geminiはこれまで、検索やマップなどGoogleツールとの連携機能を強化してきた。今回の統合によって、Gemini 3.5 Flashは画面認識と実操作を組み合わせたAIエージェント構築基盤としての性格を強めた形だ。Googleによれば、開発者はGemini API経由でComputer Useを利用できるほか、Enterprise Agent Platformでも提供される。


OpenAIやAnthropicも参入、競争が激化

 AIによるPC操作分野では、OpenAIがブラウザ操作型エージェント「Operator」、Anthropicが画面操作対応の「Computer Use」を展開しており、主要AIベンダー間で“操作できるAI”の開発競争が加速している。従来のチャット中心AIから、実際にアプリや業務システムを操作するエージェント型AIへのシフトが鮮明になりつつある。



参照サイト

Google The Keyword

Introducing computer use in Gemini 3.5 Flash



TAGs


bottom of page