開発者と企業の本番運用を想定した新しいGeminiファミリーが公開されました。プレスリリース元会社名は、トークン効率、低遅延、安定性を重視した設計で、エージェント型ワークフローをスケールさせることを狙います。中核となる3.6 Flashは、コーディングや知識タスク、マルチモーダルでの性能を底上げし、3.5世代より出力トークンの使用を抑制します。さらに3.5 Flash-Liteは高スループットと低遅延を重視し、検索やドキュメント処理などの大量処理に適します。セキュリティ分野では3.5 Flash CyberをCodeMenderに統合し、脆弱性の発見と修正を効率化します。
3.6 Flashの特徴と価格性能の進化
3.6 Flashは、3.5 Flashと比較して出力トークンの使用を17%削減するとされ、推論やツール呼び出しの回数も抑えられる点が強調されています。入力トークンは1.50/1M、出力トークンは7.50ドル/1Mと提示され、エージェントタスク単価の低減が期待できます。性能面では、MLE Benchで63.9%対49.7%、OSWorld-Verifiedで83.0%対78.4%といった指標で優位性が示され、DeepSWEでは不要な編集の削減と精度向上が観測されています。知識作業ではGDPval-AA v2の1421対1349などのベンチマークが挙げられ、ドキュメント解析やデータ分析、レポート生成などのマルチモーダルタスクでも評価が高いとされています。安全性ではCBRNやサイバー領域を含む強化策を導入し、脱獄耐性を高めつつ有益な利用の拒否を最小化する設計です。
3.5 Flash-Liteが担う高スループット運用
3.5 Flash-Liteはシリーズ中で最速の位置づけで、Artificial Analysisによると毎秒350トークンの出力速度を達成します。価格は入力トークンが100万ドル、出力トークンが250万ドルと記載され、3.1 Flash-Liteより品質を大幅改善したとされています。大量のエージェントタスクや文書処理に適し、低遅延下での高ボリューム処理を前提にした設計です。ベンチマークではTerminal-Bench 2.1が54%対31%、GDM-MRCR v2の長期コンテキストで72.2%対60.1%、GDPval-AA v2で1140対642といった差分が示されます。さらにSWE-Bench ProやOSWorld-Verifiedでは、3 Flash世代を上回る評価が提示され、実運用での高速性と性能の両立がうかがえます。モデルはコンピュータ利用の組み込みツールも備え、エージェントシステムの安定運用を支えます。
3.5 Flash CyberとCodeMenderの組み合わせ
セキュリティ領域では、3.5 Flashを基盤にした3.5 Flash CyberをCodeMenderのコードセキュリティエージェントと統合しました。複数エージェントが協調し、単一の統合レポートを作成する構成で、CyberGymなどの評価で競争力が示されています。導入は二重用途性を踏まえた限定展開で、近く政府や信頼できるパートナーに対し、限定アクセスのパイロットとして提供予定です。これにより、重要な脆弱性の早期発見と修正を進め、広範な悪用の抑止を目指します。運用面では、検出、検証、パッチ適用の各段階を一貫して効率化し、大規模環境でのコストと時間を抑制することが意図されています。大規模モデルに比べた価格優位性を強調しており、継続的スキャンや定期的レポートの自動化にも適用が想定されます。
提供開始と利用チャネル
3.6 Flashと3.5 Flash-Liteは利用可能で、Gemini APIはGoogle AI StudioやAndroid Studio、3.6 FlashはGoogle Antigravityでも使用できます。エンタープライズ向けにはGemini Enterprise Agent PlatformやGemini Enterpriseアプリで提供され、一般利用はジェミニアプリから可能です。3.5 Flash-LiteはGoogle検索にも展開されます。併せて、Gemini 3.5 Proはパートナーとテスト中で、準備が整い次第の提供予定です。次世代ではプレトレーニングのジェミニ4が進行中とされ、継続的な性能向上が示唆されています。今後の導入にあたっては、各モデルのレイテンシとコスト、ベンチマークの指標を比較し、ワークフローに最適化することが重要です。
詳しくは「Google DeepMind」の公式ページまで。レポート/DXマガジン編集部






















