Gemini 3.5 Flashにコンピューター操作機能が導入、エージェント開発を強化
-
FromGoogle DeepMind
Google DeepMindは、Gemini 3.5 Flashにコンピューター操作機能を内蔵し、プラットフォームを横断して対話できるエージェント構築を可能にしたことを発表しました。
この新機能により、開発者はGemini 3.5 Flashを使用して、ブラウザ、モバイル、デスクトップ環境で「見て、推論し、行動する」カスタムエージェントを reliably に構築できるようになります。これにより、継続的なソフトウェアテストや、プロフェッショナルアプリケーションにおけるナレッジワークのような、長期間にわたるエンタープライズ自動化タスクのパフォーマンスが向上します。
以前はスタンドアロンモデルとして提供されていたコンピューター操作機能が、Gemini 3.5 Flashモデルにネイティブ統合されたことで、Geminiの既存の機能呼び出しや検索・マップなどのツール使用能力がさらに強化されました。
安全性に関しても、プロンプトインジェクションのリスクを軽減するため、ターゲットを絞った敵対的トレーニングが実施されています。また、機密性の高い、または取り返しのつかないアクションに対する明示的なユーザー確認を要求する機能や、間接的なプロンプトインジェクションが検出された場合にタスクを自動停止する機能といった、2つのオプションのエンタープライズセーフガードシステムも提供されます。
開発者は、Gemini APIおよびGemini Enterprise Agent Platformを通じて、Gemini 3.5 Flashでのコンピューター操作機能をすぐに利用開始できます。デモ環境でのテストや、リファレンス実装、ドキュメントも提供されています。
AIによる翻訳/要約をしています。正確な情報はオリジナルサイトにてご確認ください。
当サイトの記事にはプロモーションが含まれる場合があります。
