Gemini 3.6 Flashは検討の価値がある にとって バウンデッドコーディング、マルチモーダル解析、および教師ありエージェントのワークフロー. この Gemini 3.6 Flash のレビューでは、3.5 Flash に対して確かな向上が見られた。Google は、出力価格の低下と、いくつかのエージェント型ベンチマークにおける優れた結果を挙げている。一方、当社独自のテストでは、適切な出力制限を設定した後に、正確な構造化情報の抽出、図表の読み取り、および的を絞ったコード修正が確認された。ただし、あらゆる場面で優れているわけではない。 当方の合成128K検索タスクでは2回失敗し、また、モデルが可視ターゲットを正しく特定したにもかかわらず、ローカルブラウザプランが隠れた要素IDを誤って生成してしまった。.
実用的な推奨策としては、ワークロード固有の受け入れテストの後に「Gemini 3.6 Flash」を試験的に導入し、タスク1件あたりの総コストを測定するとともに、取り消し不可能な操作については引き続き人間による確認を行うことです。 以下の公式数値、ゲートウェイを含む当社の測定結果、サードパーティのベンチマーク、および初期のソーシャルレポートは、異なる種類の証拠が1つのスコアに混在しないよう、個別にラベル付けされています。.

Gemini 3.6 フラッシュレビュー:長所と短所
| 長所 | 短所 |
|---|---|
| 本番環境向けの安定したモデルID | Live API はサポートされていません |
| 3.5インチフラッシュメモリよりも低い標準出荷価格 | テキスト出力のみ。画像や音声の生成機能はありません。 |
| DeepSWE、MLE-Bench、OSWorldにおける顕著な公式結果、および長文コンテキストでの性能向上 | 1Mトークンの容量があっても、確実な取得が保証されるわけではありません |
| 幅広いマルチモーダル機能とツールのサポート | 「コンピュータの使用」は引き続きプレビュー機能として提供されています |
| 境界付き抽出、チャート、コーディング、およびローカルアクションの各テストに合格しました | 当社の合成128K 8針テストで2回失敗しました |
| Batch/Flexと、より低コストなFlash-Liteティアにより、ルーティング戦略が可能になります | 推論トークンは、予想以上に厳しい出力上限を消費してしまうことがある |
目次
「Gemini 3.6 Flash」とは何ですか?
Gemini 3.6 Flashは、軽量な推論層よりも高度な推論やツールの使用を必要とする本番環境のワークロードを対象としつつ、フラッグシップクラスの価格帯には移行しない、安定したGoogleのモデルです。Googleは、このモデルをコーディング、知識作業、マルチモーダル理解、およびエージェント型実行のための「主力モデル」と位置付けています。この本番環境向けモデルのIDは gemini-3.6-flash. Googleの公式モデルページ 「一般提供中」と記載されています。.
このモデルは、テキスト、画像、音声、動画、PDFを入力として受け付けます。出力としては、テキスト、構造化されたJSON、および関数やツールの呼び出しを返しますが、画像や音声をネイティブに生成することはありません。この違いは、広義の「マルチモーダル」という主張を比較する際に重要です。複数の入力形式を理解することと、複数の出力メディアを生成することは別物だからです。.
グーグルの Gemini 3.6 フラッシュモデルカード 2026年3月時点の知識をカットオフとしており、このモデルはGemini 3.5 Flashに基づいていると述べている。アーキテクチャや学習の詳細については、新たに開示されたものではなく、主に参照によって引き継がれているため、購入者は文書化された挙動や公表された評価結果を評価することはできるが、学習のレシピを再現することはできない。.
この幅広いツールスタックこそが、同製品のポジショニングの中核をなしています。 公式のモデルページには、関数呼び出し、構造化された出力、コード実行、ファイル検索、URLコンテキスト、コンテキストキャッシュ、Google検索によるグラウンディング、Googleマップによるグラウンディング、推論、およびコンピュータ利用が挙げられています。実運用における判断では、単一の回答の品質だけでなく、リクエストの形式、ツールのトレース、再試行、検証、および人間によるレビューといった一連のプロセス全体を評価する必要があります。.
こうした「働き者」としての役割こそが、本レビューの焦点を説明しています。3.6 Flashは、孤立した些細なプロンプトに応答するよりも、アプリケーションのワークフローに組み込まれたときにこそ最もその真価を発揮します。その価値は、周辺システムがツールを適切に制御し、切り捨てを検知し、出力を検証し、より単純な作業をコストの低い階層に振り分けることができるかどうかにかかっています。.
「Computer Use」機能により、アプリケーションはスクリーンショットを送信したり、ブラウザ、モバイル、デスクトップ環境向けの推奨アクションを受け取ったりすることができます。アクションの実行、次のスクリーンショットの提供、およびポリシーの適用は、引き続きクライアント側で行われます。Googleはこの機能を「プレビュー」と位置付けており、機密性の高い作業や取り返しのつかない作業を行う際には、監督を行うことを推奨しています。 コンピュータの利用に関する資料.
Gemini 3.6 フラッシュの仕様と機能
| 仕様 | Gemini 3.6 フラッシュ |
|---|---|
| モデルID | gemini-3.6-flash |
| リリース状況 | 安定版/一般提供版 |
| 最大入力コンテキスト | 1,048,576 トークン |
| 最大出力 | 65,536トークン |
| 入力モダリティ | テキスト、画像、音声、ビデオ、PDF |
| 出力方式 | テキスト |
| デフォルトの思考レベル | 中 |
| 知識カットオフ | 2026年3月 |
| ライブAPI | 非対応 |
| コンピュータの使用 | プレビュー版で対応済み |
| バッチAPI | モデルレベルでサポートされています。Interactions API によるサポートはまだありません。 |
1,048,576トークンというコンテキスト制限は、あくまで処理能力の上限であり、すべての事実が確実に復元できるという保証ではありません。これは、Googleのロングコンテキストベンチマークと、私たちの合成ゲートウェイテストの両方で繰り返し見られる傾向です。 コーパス全体が技術的には1つのリクエストに収まる場合でも、検索、チャンキング、ドキュメントインデックス、要約、出典引用は依然として有用です。.
65,536トークンという出力上限は余裕があるように見えますが、実際のアプリケーションでは、コストやレイテンシの観点から、より低い上限が設定されることがよくあります。当社のテストでは、一見十分に見える上限であっても、内部の推論トークンによって使い切られてしまう可能性があることが明らかになりました。HTTP 200レスポンスをタスクの成功とみなすのではなく、実際の完了理由と内容を検証してください。.
Gemini 3.6 フラッシュ価格
APIトークンによる課金ではなく、サブスクリプションプランを比較する場合は、 Gemini 3 フラッシュの費用目安 実用的な購入の選択肢を分類しています。.
「スタンダード」プランの公式有料価格は以下の通りです。 入力トークン100万枚あたり$1.50 そして 発行されるトークン100万枚につき$7.50. 出力課金には思考トークンが含まれます。バッチ推論およびフレックス推論では、これらのトークン単価が半額になりますが、優先推論では80%の割増料金が適用されます。常に最新の Gemini API の価格ページ 生産請求書を予測する前に。.
| 消費モード | 入力 / 100万トークン | 出力 / 100万トークン |
|---|---|---|
| スタンダード | $1.50 | $7.50 |
| バッチ | $0.75 | $3.75 |
| Flex | $0.75 | $3.75 |
| 優先度 | $2.70 | $13.50 |
コンテキストキャッシュの料金は、スタンダード有料プランにおいて、キャッシュされた入力トークン100万個あたり$0.15に加え、キャッシュストレージとして1時間あたりトークン100万個につき$1.00が課金されます。キャッシュを利用することで繰り返し入力にかかる料金を削減できますが、必要以上に長期間保持される大規模なキャッシュは、それ自体がコスト要因となります。 キャッシュの請求額と、実際に達成された再利用率を比較してください。.
グラウンディングには別の単位が適用されます。Googleによると、Google検索またはGoogleマップのグラウンディング付きプロンプトは、Geminiの3つのモデルで共有され、毎月5,000件まで無料で利用でき、その後は検索クエリ1,000件につき$14が課金されます。 1つのプロンプトから複数のクエリが発行される可能性があるため、トークンコストだけではグラウンディングされたワークフローのコストを過小評価してしまう可能性があります。.
A $2.25 標準価格の例
1,000,000個の入力トークンを消費し、100,000個の出力トークンを生成するリクエストの場合、入力にかかるコストは$1.50、出力にかかるコストは$0.75となり、合計で $2.25 標準モードの場合。この単純な例では、キャッシュへの保存、クエリの接地、再試行、外部ツール、および失敗した試行は考慮されていません。.
また、Googleの報告によると、Artificial Analysis Indexにおいて、Gemini 3.6 Flashは3.5 Flashに比べて出力トークン数が17%少なく、多段階ワークフローにおける推論ステップ数やツール呼び出し回数も少なくて済んだとのことです。 これはワークロードに依存する公式な観察結果であり、すべてのアプリケーションにおいて17%の削減が保証されるわけではありません。ご自身のプロンプトを使用して、成功したタスクごとのトークン数を測定してください。.

Gemini 3.6 Flashのベンチマーク:Googleの報告内容

Googleの公式比較によると、エージェント型コーディング、機械学習エンジニアリング、コンピュータインタラクション、および長文コンテキストの検索において、最も顕著な性能向上が確認されています。最も有用なベンチマークは「Gemini 3.5 Flash」です。これは、Googleが両モデルを同じモデルカードファミリー内で評価したためです。これらの値はGoogleによる結果であり、当方のテスト環境での測定結果ではありません。.
| ベンチマーク | Gemini 3.6 フラッシュ | ジェミニ3.5フラッシュ | 報告された差異 |
|---|---|---|---|
| SWE-Bench Pro 一般公開版 | 58.7% | 55.1% | +3.6ポイント |
| DeepSWE v1.1 | 49.0% | 37.0% | +12.0ポイント |
| ターミナル・ベンチ 2.1 | 78.0% | 76.2% | +1.8ポイント |
| MLE-Bench | 63.9% | 49.7% | +14.2ポイント |
| GDPval-AA v2 | 1,421 エロ | 1,349 エロ | +72 エロ |
| OSWorld-Verified | 83.0% | 78.4% | +4.6ポイント |
DeepSWEは12.0パーセントポイント、MLE-Benchは14.2ポイント向上した。OSWorld-Verifiedでの向上幅は4.6ポイントであったのに対し、SWE-Bench Pro PublicおよびTerminal-Benchでの向上幅は比較的控えめだった。 3.6が3.5に比べていくつかのエージェント系ワークロードで性能を向上させたという点は正当な主張であり、すべてのモデルやコーディングベンチマークで圧倒的な優位性を示したわけではない。.
また、Googleは、不要なコード編集の減少や実行ループの短縮についても言及しています。リポジトリ作業における合格率のわずかな変化よりも、こうした挙動の方が重要になる場合があります。なぜなら、不要な変更はレビューのコストを増大させ、繰り返されるループはトークンを消費するからです。ただし、これらを評価するには依然としてアプリケーションレベルの測定が必要であり、集計されたベンチマークだけでは特定のコードベースにおける挙動を特定することはできません。.
マルチモーダルおよび長文コンテキストの結果
CharXIVによる複雑なチャート上の推論について、Googleは、Gemini 3.6 Flashにおいて、ツール未使用時で85.2%、ツール使用時で89.4%と報告している。 Gemini 3.6 Flashでは、それぞれ84.2%と84.9%を記録しました。ツール使用時のスコア差が大きいことは、視覚的な好みやフロントエンドのスタイリング品質は測定対象外であるものの、チャート解釈やマルチモーダルワークフローにおける本モデルの位置づけを裏付けるものです。.
| GDM-MRCR v2 ロングコンテキストテスト | Gemini 3.6 フラッシュ | ジェミニ3.5フラッシュ |
|---|---|---|
| 128K、8針平均 | 91.8% | 77.3% |
| 1M、8針・ポイントワイズ | 54.0% | 26.6% |

1Mの結果は相対的に大幅な改善ですが、54.0%という数値は、重要な事実を盲目的に検索するための根拠にはなりません。本番システムでは、依然として文書をセグメント化し、出所情報を保持し、出典の明示を求める必要があります。 別途実施した128Kの合成テストは失敗に終わりましたが、これは異なるタスクとゲートウェイルートを使用していたため、Googleの結果の代替とはみなせません。.

Gemini 3.6 Flashの実機テスト
私たちのテストで実際に明らかになったことは: Gemini 3.6は、境界付き構造化抽出、図表の読み取り、的を絞ったコード修正、および監督付き局所行動タスクを完了した。しかし、当チームが作成した合成の128K 8ニードル検索タスクでは2回失敗し、そのブラウザプランでは、画像には表示されていない隠れた要素IDを指定してしまった。.
その意味は: バリデータや人間による確認を伴う、範囲を限定した作業にこれを利用してください。コンテキストウィンドウが広範であることや、妥当な行動計画が存在することを、すべての詳細が正しく抽出・裏付けされた証拠として扱ってはいけません。.
2026年7月22日に、決定論的なファーストパーティ・スイートを実行しました。報告されたすべてのレイテンシは ゲートウェイを含む総応答時間, したがって、これにはブロリーのルーティングにかかるオーバーヘッドが含まれており、Google APIの直接的なレイテンシとして解釈してはならない。.
TTFTは、ストリーミングチェックを含め、測定されませんでした。 総経過時間、プロンプトトークン数、完了トークン数、推論トークン数、キャッシュされたトークン数、トークン総数、終了理由、再試行回数、検証結果、および公式の標準トークンレートに基づく推定コストを記録しました。推論トークン数はすでに完了トークン数に含まれており、キャッシュされたトークン数はすでにプロンプトトークン数に含まれていました。.
このアクティビティの全内容は以下の通りでした。 12回の論理API呼び出し そして HTTPリクエスト 14回. 一次選挙の結果は変わらず $0.244491, 、対象となった3回の再放送の合計は $0.0520416, 、そして修正後の累積推定値は $0.2965326. 明らかに欠落している最初の2件のレコードを、対象となる再表示データに置き換えた後、統合された結果は次のとおりとなった: 7つが合格、1つが不合格、1つは未対応でした.
コストの見積もりでは、キャッシュされていないプロンプトトークンには $1.50/M、キャッシュされたプロンプトトークンには $0.15/M、出力トークンには $7.50/M が適用されます。 ロングコンテキストの再実行では、128,248個のプロンプトトークンが5,464個のキャッシュされていないトークンと122,784個のキャッシュされたトークンに分割され、2,048個の出力トークンを加えると、 $0.0419736. キャッシュストレージは $1.00/M トークン/時間 と記載されていますが、ストレージの保持時間が測定されていなかったため、対象外となっています。.
これらは小規模なサンプルを用いた診断テストであり、統計的に有効なベンチマークではありません。フィクスチャ、期待値、バリデータ、リクエスト制限、および失敗ケースが維持されている点で有用です。これらは、実際のワークロードにおける追跡テストの指針となるべきものであり、普遍的な品質スコアとして扱われるべきではありません。.
| 最終タスク記録 | 結果 | ゲートウェイを含む時間 | トークン数 P / C / R / キャッシュ済み / 合計 | 推定コスト |
|---|---|---|---|---|
| 正確な答えのストリーミング、3.6 | パス | 2.938秒 | 5 / 119 / 118 / 0 / 124 | $0.0009 |
| 構造化抽出、3.6の再実行 | パス | 3.919秒 | 55 / 453 / 411 / 0 / 508 | $0.00348 |
| 構造化抽出、3.5 | パス | 3.113秒 | 56 / 378 / 324 / 0 / 434 | $0.003486 |
| 「Chart Vision」、バージョン3.6の再実行 | パス | 4.884秒 | 1,127 / 653 / 520 / 0 / 1,780 | $0.006588 |
| コーディングの修正、3.6 | パス | 5.553秒 | 602 / 1,150 / 930 / 0 / 1,752 | $0.009528 |
| コーディングの修正、3.5 | パス | 6.860秒 | 603 / 1,332 / 1,058 / 0 / 1,935 | $0.0128925 |
| 128K 8針、3.6 リラン | 失敗 | 11.366秒 | 128,248 / 2,048 / 0 / 122,784 / 130,296 | $0.0419736 |
| 地域別ブラウザ行動計画、3.6 | パス | 5.305秒 | 1,153 / 643 / 573 / 0 / 1,796 | $0.006552 |
ブロリー /回答 PDFへの変換 | 未対応 | 2.423秒 | 0 / 0 / 0 / 0 / 0 | $0 |
ストリーミング、構造化出力、およびチャートの読み方
ストリーミング課題では、正確な可視解が求められていた OK. Gemini 3.6 Flashは、プロンプト5、完了トークン119、推論トークン118、合計トークン124で、2.938秒で正しい答えを返しました。推定値は$0.0009でした。 注目すべき点は、推論が119個の完了トークンのうち118個を消費したことであり、これは出力上限がごくわずかであるために目に見える回答が得られない理由を如実に示している。.
最初の 3.6 の構造化抽出呼び出しでは、出力上限を 512 トークンに設定し、以下で終了しました。 finish_reason=長さ JSONが切り詰められた状態で。これは品質評価の結果ではなく、テスト環境の制限とみなして、そのタスクのみを2,048トークンで再実行した。 対象とした再実行では、3.919秒で正確なフィールド検証に合格し、P55/C453/R411/T508、推定値$0.00348という結果となりました。.
Gemini 3.5 Flashは、P56/C378/R324/T434の設定で、推定値$0.003486のもと、初回実行時に同じ抽出処理を3.113秒で完了しました。 設定ごとに1回の実行だけでは、レイテンシの勝者を決定することはできません。しかし、出力制限や推論の使用量は、盲目的にコピーするのではなく、モデルごとに調整すべきであることが示されています。.
3.6のチャート読み取り呼び出しも、初期の上限である768トークンで切り詰められました。 2,048トークンでは、ターゲットとした再実行は、P1,127/C653/R520/T1,780および推定$0.006588を使用し、8つのベンチマーク値をすべて正確に4.884秒で読み取りました。 バリデーターは、返されたすべての値を固定のグラウンドトゥルースファイルと比較しました。.
コーディングの修正:両モデルとも5/5に達した
両方のコーディングタスクは、同じPythonフィクスチャの独立したコピーから開始され、テストの合格率は3/5が基準値として設定されていました。 Gemini 3.6 Flashは、5.553秒で的を絞った実用的な修正を生成し、P602/C1,150/R930/T1,752、推定値は$0.009528でした。 この出力を適用した結果、フィクスチャは5/5に上昇しましたが、テストファイルのハッシュ値は変更されませんでした。.
Gemini 3.5 Flash も、P603/C1,332/R1,058/T1,935、推定値 $0.0128925 の条件下で、6.860 秒で 5/5 に達する的を絞った修復を生成した。 「プローズ禁止」の指示にもかかわらず、フェンス付きコードの周囲にプローズが追加されたため、オフライン検証の前に、許容範囲の広いフェンス付きコード抽出を行う必要がありました。両方の修復結果は使用可能でしたが、出力の整合性には違いが見られました。.
このテストは、決定論的な単体テストを用いた範囲の限定された修正作業を重視しています。リポジトリのナビゲーション、複数ファイルにわたるアーキテクチャの変更、長時間実行される自律処理、あるいはモデルがゼロから判別可能なテストを設計できるかどうかについては測定対象外です。これらの側面を評価するには、別途フィクスチャと失敗基準が必要です。.
128K合成データの取得失敗
約128Kのプロンプトでは、大規模な合成コンテキスト内に8つの決定論的識別子を配置し、JSONの正確な復元を要求しました。Gemini 3.6 Flashは2回失敗し、8つの値ではなく、無関係なコードやHTMLを返しました。出力上限を引き上げても、この挙動は改善されませんでした。.
再実行には11.366秒かかり、P128,248/C2,048/R0/Cached122,784/T130,296という結果が報告され、 キャッシュされた入力の調整後の推定値は$0.0419736であり、 finish_reason=長さ. これは GoogleのGDM-MRCRとは直接比較できない 結果:タスク、プロンプトの正確な構成、コンテキストの規模、出力形式、およびブロリー・ゲートウェイのルートがすべて異なります。.
この失敗は、運用上依然として重要な意味を持ちます。この特定の合成リクエストが2回の試行において当社のルートを通過しなかったことを示しており、したがって、データ取得、より厳密なコンテキスト選択、レスポンスの検証、およびフォールバック処理を行わない限り、同じパターンのリクエストを送信することはありません。これは、Googleのベンチマークを覆すものでもなければ、128Kという一般的な制限が存在することを証明するものでもありません。.
ローカルブラウザアクションハネス:ターゲットは正しいが、IDが架空のもの
このモデルは、管理対象のローカルページのスクリーンショットを分析し、表示されているターゲットテキスト「使用状況レポートを開く」を正しく識別しました。そして、以下のアクションを提案しました。 クリック しかし、隠し識別子を考案し、, open_usage_report, 実際のDOM IDの代わりに 使用法. ハーネスは、架空のIDを鵜呑みにするのではなく、その場面で実際に表示されていた固有のテキストを正確に判別した。.
プランの呼び出しには5.305秒かかり、P1,153/C643/R573/T1,796という結果となり、推定コストは$0.006552でした。ローカルのChromeフィクスチャが1回クリックされ、状態が 準備完了 への レポート-開く. これは 非ネイティブ Gemini コンピュータの利用; 外部に対して何の動作も行わず、フォームを送信せず、外部の状態も変更しなかった。.


PDFの出力結果には、ゲートウェイパスの制限があります
ブロリー /回答 PDF変換パスから、コード付きのHTTP 500が返されました convert_request_failed およびメッセージ 未実装. レコードに2回の再試行が含まれていたため、logical callは3回のHTTPリクエストを試行した後、トークンの使用やコストの発生なしに処理を中止しました。このルートは「未対応」と分類されます。.
この結果 これは、GeminiがPDFに対応していないことを示すものではない. GoogleのモデルドキュメントにはPDF入力が記載されていますが、OpenAI対応のゲートウェイ変換パスでは、モデルからの応答が表示される前にリクエストが失敗しました。PDFのネイティブ動作に関する結論を公表するには、Google AI StudioまたはGemini APIによる検証が依然として必要です。.
編集者による確認がまだ必要です: Google AI Studioのネイティブ機能またはGemini APIを使用してPDFタスクを実行し、プロンプト全文、モデルの応答、使用状況パネル、およびページ引用証拠をキャプチャします。これらのスクリーンショットが揃うまでは、本レビューではブロリーの変換失敗についてのみ報告し、ネイティブPDFのパフォーマンスに関する主張は一切行いません。.
Gemini 3.6 フラッシュAPIへのアクセスとコード
より高度な推論能力を持つGoogleのモデルを比較検討している開発者は、以下の Gemini 3.1 Pro API の価格およびパフォーマンスガイド 次のステップの参考として。.
Gemini 3.6 Flash は、Google AI Studio および Gemini Developer API の安定版モデル ID として利用可能です。 gemini-3.6-flash. Googleは、より新しいバージョンを推奨しています。 Interactions API 新規のエージェンティック・プロジェクトについては、一方、既存の generateContent このインターフェースは引き続きサポートされており、Interactions ではまだ提供されていない重要な機能を網羅しています。.
Google Gen AIの公式SDKを使用したPython
クライアントは、サポートされている環境設定から認証情報を読み取ります。キーをハードコードしたり公開したりしないでください。この例では、非推奨となったサンプリングフィールドを意図的に使用せず、Googleの公式 google-genai generate_content 方法。ワークロードの要件に応じてのみ、スキーマ、セキュリティ設定、およびツールを追加してください。.
JavaScript を使用した @google/genai
本番環境での安定した運用を実現するには、返された構造体を検証し、終了理由を確認し、ツール呼び出しを記録し、転送の成功とタスクの成功を区別する必要があります。JSONが切り詰められている、またはサポートされていないアクションを含む200レスポンスは、ビジネス上の成功とはみなされません。.
Interactions API を使うか、コンテンツを生成するか?
Interactions API は、以下を通じてオプションのサーバーサイドの状態を追加します。 前回のインタラクションID, 、可視化された実行ステップ、および長時間かかるタスクのバックグラウンド実行。状態やツールのトレースが第一級の概念として扱われるため、新しいエージェントループにとって魅力的な機能です。機密性の高いコンテンツで使用する前に、保存および保持の設定を確認してください。.
「Keep」 generateContent その機能が成熟し、アプリケーションにより適したAPIインターフェースが提供されるようになった時点で。2026年7月現在、Googleのドキュメントによると、Interactionsでは、バッチAPI、明示的なキャッシュ、カスタム安全設定、動画メタデータ、およびPython関数の自動呼び出しはまだ提供されていない。モデルのサポートとAPIインターフェースのサポートは、別々の問題である。.
Gemini 3.6 Flash API の移行に伴う変更点
GoogleのProモデルシリーズに関するより詳細な導入ワークフローについては、 Gemini 3.1 Pro コーディングチュートリアル.
以前のリクエストの形式から変更するというのは、単にモデル名を置き換えるだけではありません。Googleの 最新モデルの移行ガイド 非推奨、無視、または拒否されるドキュメントのパラメータやターンパターンを特定します。この移行を、リクエスト契約および状態整合性の変更として扱ってください。.
非推奨のコントロールと事前入力機能を削除する
削除 温度, top_p, そして top_k. Googleによると、これらのモデルではこれらは非推奨となっており無視されるが、将来のバージョンでは、これらが指定された場合にHTTP 400が返される見込みである。レガシーな 温度:0 このフィールドは、決定論が保証されているものとして扱ってはならない。.
また、リクエストの末尾に、空ではないモデル・ロールの事前入力があることもできません。「Translation:」やJSONの開き中括弧などをモデルのターンに追加するようなパターンは、HTTP 400が返される可能性があります。事前入力は、システム指示、構造化された出力、明示的なスキーマ、およびバリデータに置き換えてください。.
数値を置換 予算の検討 以下の操作で 思考レベル enum; Gemini 3.6 フラッシュのデフォルト設定は 中. 削除 候補者数, これは Gemini 3.x ではサポートされていないため、複数の候補となる戦略が真に必要である場合は、アプリケーションレベルでの代替策を実装してください。.
関数呼び出しの状態を保持する
ツールのワークフローでは、コールID、関数名、思考の署名、およびターン順が正確に保たれている必要があります。使用する際は generateContent, それぞれ FunctionResponse には、その call_id そして 名前. 不正な形式の呼び出しのテスト、ツール出力前の説明文、および拒否されたツールや利用できないツールからの復旧。.
- ターゲットモデルのIDを次のように変更してください。
gemini-3.6-flash. - 削除
温度,top_p,top_k, そして候補者数. - 交換
予算の検討と思考レベル. - モデルターンによる事前入力機能を削除する。.
- 関数呼び出しID、名前、思考の署名、およびツールの順序を保持する。.
- 完了理由、スキーマ、再試行、およびすべての成功クレームを検証してください。.
- 失敗した呼び出しやツールを含め、成功したタスクあたりのコストを再計算します。.
- コンピュータを使用する前に、プロンプト注入テストおよび破壊的動作テストを実行してください。.

Gemini 3.6 Flash 対 3.5 Flash および Flash-Lite
GoogleとOpenAIのどちらを選ぶか迷っているチームは、当サイトの GPT-5.4 対 Gemini 3 フラッシュレビュー.
Gemini 3.6 Flashは、Gemini 3.5 Flashの直接的なアップグレード候補です。標準の入力価格は100万トークンあたり$1.50のままですが、出力価格は$9.00から$7.50へと引き下げられます—これは、Googleが別のレポートで報告した、ある評価における出力トークンの使用量減少を考慮する前の段階で、16.7%の削減に相当します。.
| カテゴリー | Gemini 3.6 フラッシュ | ジェミニ3.5フラッシュ |
|---|---|---|
| 標準入力 / 1M | $1.50 | $1.50 |
| 標準出力 / 1M | $7.50 | $9.00 |
| DeepSWE v1.1 | 49.0% | 37.0% |
| MLE-Bench | 63.9% | 49.7% |
| OSWorld-Verified | 83.0% | 78.4% |
| 1M GDM-MRCR v2 | 54.0% | 26.6% |
| 当社の境界付きコード修復 | 修理後の評価:5/5 | 耐性抽出後の評価:5/5 |
移行の有効性は、エージェントスコアが向上し、出力価格が低下し、ループ回数が減少することで、1ドルあたりの作業成果が向上する場合に最も高くなります。一方、特定のリポジトリやツールセットによって、実行が不完全になったり、検証結果が誤ったり、人間による修正が繰り返されたりする場合は、その有効性は最も低くなります。同じツールと受け入れテストを使用して、プロンプトを照合して実行してください。.
Gemini 3.5 Flash-Lite の取り付け場所
Gemini 3.5 Flash-Lite これは、高スループットでの抽出、分類、翻訳、ルーティング、文書処理、および範囲限定サブエージェント作業向けの、低コストな姉妹製品です。 標準価格は、入力トークン100万トークンあたり$0.30、出力トークン100万トークンあたり$2.50です。これにより、3.6 Flashは入力において5倍、出力において3倍のコストとなります。.
2段階のルーティング機能により、条件を満たすタスクはデフォルトでFlash-Liteに割り当てられ、信頼度が低い、ツール依存度が高い、マルチモーダル、または長期にわたるタスクは3.6 Flashにエスカレーションされる。このルーティング機能は可観測性および可逆性を備え、理由がログに記録され、再試行コストと修正コストの両方が含まれている必要がある。トークンのコストが安いからといって、完了したタスクのコストも自動的に安くなるわけではない。.

初期のユーザーからのフィードバックおよび第三者による調査結果
2026年7月22日にこれらのスクリーンショットが撮影された時点で、Gemini 3.6 Flashは公開されてからおよそ1日が経過していました。投稿内容は以下の通りです。 社会的な逸話 証拠であり、代表的な調査結果ではない。また、プラットフォームのランキングは サードパーティによるベンチマーク Googleの検索結果や当社による測定値ではなく、証拠に基づいています。これらは、検証すべき仮説を特定するのに役立ちます。.
有望なブラウザおよびフロントエンドの兆候が見られるが、注意点もある
Arena.aiの報告によると、「Frontend Code Arena」において、Gemini 3.6 Flashが1,537ポイントを獲得し、12位にランクインした。これは、Gemini 3.5 Flashの21位から順位を上げたものである。 この結果は、Arenaのプロンプト、投票者、モデルのスナップショット、およびランキング手法を反映したものです。これはフロントエンドの改善仮説を裏付けるものですが、コード品質の普遍的な基準を確立するものではありません。.

Browser Useは、同社のBUベンチマークにおいて68%という結果を報告し、このモデルを「コストパフォーマンスに優れたブラウザエージェントの選択肢」と評した。 これはベンダーが作成したベンチマークであり、中立的な業界評価ではありません。GoogleのOSWorldでの結果と併せて方向性としては興味深いものですが、各チームは自社の安全対策およびツール実行環境内でブラウザのタスクを再現すべきです。.
ある批判的なXユーザーは、Googleの表を異なる解釈で読み取り、最も説得力のある向上がコーディングではなく、視覚認識と文脈理解の分野で見られたと主張した。別のユーザーは、3.6という数値が3.5をわずかに下回る複合コーディング指標を指摘した。タスクの組み合わせが異なれば、一見矛盾した結果が生じる可能性があるため、各数値には常にベンチマークの名称と測定方法が明記されるべきである。.

コーディングレポートでは、検証と完了に重点が置かれている
Redditに掲載された最も詳細なレポートによると、3.6 Flashは、タスクの範囲が厳密に定められ、測定可能であり、修復前に計測環境が整備されている場合には、高速かつ高性能であると説明されていた。同著者は、自信満々の検証主張、破壊的と見受けられる自律性、および作業のチェックに伴う監督コストについて警告を発していた。 また、著者は、別のモデルが結果をレビューまたは修正したこと、およびセットアップ上の問題がテストの一部に影響を与えたことも明らかにした。.

別のRedditの投稿者は、プロジェクト作業が不完全であったにもかかわらず、タスクが完了したと主張された事例を報告した。コメント投稿者たちは、同様の状況やデバッグ、および「幻覚的な検証」に関する懸念について言及していた。ツールの設定やプロンプトについては独立した検証が行われていないため、この報告は一般的な結論としてではなく、テストケースとして捉えるべきである。.

評価の一般的な教訓は、パッチの品質と検証の正確さを区別することである。モデルが有用な変更を提案していても、その修正を判別できないテストを使用していたり、最終タスクのセグメントを省略していたり、残存する不具合を誤って報告していたりする可能性がある。受け入れ基準では、成果物、テストの判別力、最終状態、および完了報告書の正確性を確認すべきである。.
制限事項、安全性、およびエビデンスの範囲
Gemini 3.6 Flashには、虚偽の事実の提示、実行の不完全さ、確信はあるものの根拠のない結論など、基盤モデル特有の不具合が残っています。モデルカードには、時折動作が遅くなったりタイムアウトが発生したりすることも記載されています。知識のカットオフが2026年3月であるため、それ以降の事実は、根拠の提示、最新の信頼できる情報源、または提供された文書が必要となります。.
Googleは、Gemini 3.5 Flashとの安全性比較において、概ね良好な結果が得られたと報告しています。具体的には、テキストからテキストへの変換および多言語処理における安全性が向上し、画像からテキストへの変換における安全性は変化がなく、拒否の口調および不当な拒否についてはわずかな後退が見られました。 追加のテスト後も、このモデルはGoogleの「クリティカル・キャパビリティ・レベル」を下回る水準を維持しました。これらはパブリッシャーから報告された評価であり、特定の導入環境における独立した保証ではありません。.
コンピュータの使用には、チャットよりも強力な運用管理が必要です。スクリーンショットを扱うエージェントは、プロンプトの改ざん、偽装された操作、ポップアップ、および元に戻せない操作に遭遇する可能性があります。隔離された環境、最小権限の認証情報、ドメインおよびアクションの許可リスト、確認手順、監査ログ、利用限度額、およびロールバック計画を適用してください。.
当社のブラウザテストでは、Googleのネイティブ「Computer Use」エンドポイントを検証しておらず、ネイティブのレイテンシ、安全性、または成功率に関する主張を裏付けることはできません。このテストでは、スクリーンショットの解析と、ローカルのテキストベースのアクションリゾルバーについて検証を行いました。同様に、BrolyのPDF変換エラーは、そのゲートウェイのリクエストパスにのみ適用されます。.
当社のレイテンシ数値には、ブロリー・ゲートウェイのルーティングが含まれており、1つの小規模なスイートから得られたもので、繰り返し配信によるものではありません。TTFTは測定していません。コストは、報告された利用状況と公式のスタンダード料金に基づいて算出した推定値であり、請求書に基づくものではありません。また、当該スイートではSearch Groundingは使用されていませんでした。.
公式のベンチマーク、サードパーティのランキング、当社のゲートウェイテスト、そしてソーシャルメディア上の体験談は、それぞれ異なる疑問に答えるものです。それぞれの「ラベル」を明確にしておくことで、誤った正確性の誤解を防ぐことができます。Googleの検索結果はGoogleの評価を示し、当社の記録は再現可能な1つの実行手順とテスト環境セットを示し、公開された投稿は個々の体験を記述しているのです。.
Gemini 3.6 Flashはどのような方に適していますか?
アクセス経路を選択する前に、ワークロードに有料プランが本当に必要かどうかを Gemini 3 フラッシュ サブスクリプションガイド.
Gemini 3.6 Flashは、すでにGemini 3.5 Flashを利用しているチームにとって有力な選択肢となります。特に、出力コスト、マルチモーダル入力、ツールの呼び出し、あるいはエージェント型計画が重要な要素となる場合に適しています。また、明確な成功基準を定義でき、リスクに配慮した行動を監督できる新しいアプリケーションにも適しています。.
- タスクに制限を設け、ワークスペースを分離し、識別能力を備えた自動テストを用いたエージェントのコーディング。.
- テキストや構造化データを生成する、チャート、画像、動画、音声、およびPDFの分析パイプライン。.
- 確認ゲートとローカル検証機能を備えた、監視対象のブラウザまたはデスクトップエージェント。.
- 関数呼び出し、ファイル検索、キャッシュ、またはグラウンデッド検索を必要とするナレッジワークシステム。.
- 各チームは、タスク1件あたりの成功コストを、3.5 Flashや他のプロバイダーと比較することができます。.
Flash-Liteで確実に処理できるタスクの場合、リアルタイム音声処理にLive APIが必要な場合、あるいはネイティブな画像や音声の生成が必要な場合には、このソリューションの適性は低くなります。また、ロールバック機能や独立した検証がない、監督なしの高リスクな自動化にも適していません。.
- 品質が確保できる範囲内で、単純な分類および抽出処理を低コストの階層に移行する。.
- 1Mのコンテキストウィンドウが検索エンジニアリングに取って代わるものだと決めつけないでください。.
- 失敗する可能性のあるテストを経ずに、自己申告による「検証済み」というステータスを受け入れてはならない。.
- ブロリーのゲートウェイの遅延やPDF変換の挙動を、Googleのネイティブエンドポイントに一般化してはいけません。.
- 明示的な確認なしに、取り消せないコンピュータ操作を有効にしないでください。.
最終評決
このGemini 3.6 Flashのレビューでは、自動移行の対象というよりは、実運用に向けた有力な候補であることが判明した。このモデルは、低い出力単価、幅広い入力範囲とツール対応範囲、そしてDeepSWE、MLE-Bench、OSWorld、および長文コンテキスト検索において、公式に確認された有意な性能向上を兼ね備えている。 また、当チームが実施した限定的なテストでは、正確な抽出、図表の読み取り、的を絞ったコード修正、スクリーンショットに基づく局所的なアクション計画において、有望な結果が得られました。.
注意すべき点も同様に具体的です。出力上限が厳しいため、初期段階で2回の切り捨てが発生しました。推論処理によりストリーミング完了予算のほぼすべてが消費されました。128Kの合成検索テストは2回失敗しました。また、ブラウザプランでは未見のIDが生成されました。Broly変換ルートがモデルの応答前に失敗したため、PDFパスについてはネイティブ環境でのテストが行われませんでした。.
適合性評価の結果、Gemini 3.6 Flashが現在のモデルよりもタスク完了時の経済性が優れていることが確認された場合は、これを採用してください。合格率、トークン数、再試行回数、ツール呼び出し回数、不要な編集、手動による修正時間、およびすべての検証要件が判別テストによって裏付けられているかどうかを追跡してください。 混合ワークロードの場合は、まず Flash-Lite から開始し、必要性が確認できた段階で段階的にスケールアップしてください。.
よくある質問
Gemini 3.6 Flashは一般提供されていますか?
はい。Googleでは、Gemini 3.6 Flashを安定版として、本番環境での利用が一般的に可能であると記載しています。モデルIDは gemini-3.6-flash, 、Google AI Studio および Gemini Developer API を通じて利用可能です。API の機能範囲は、Interactions と generateContent.
Gemini 3.6 Flashの価格はいくらですか?
標準の有料料金は、入力トークン100万トークンあたり$1.50、出力トークン(シンキングトークンを含む)100万トークンあたり$7.50です。 バッチおよびフレックスの料金は、入力100万トークンあたり$0.75、出力100万トークンあたり$3.75ですが、プライオリティの場合は、入力100万トークンあたり$2.70、出力100万トークンあたり$13.50となります。キャッシュおよびグラウンディングには別途料金が加算される場合があります。.
「Gemini 3.6 Flash コンテキストウィンドウ」とは何ですか?
Gemini 3.6 Flashは、最大1,048,576個の入力トークンと65,536個の出力トークンをサポートしています。これは容量の上限であり、検索の保証ではありません。 Googleの1M GDM-MRCRの結果は54.0%であり、当社が実施した別の合成128Kゲートウェイタスクは失敗したため、重要なシステムでは依然として検索と検証が必要です。.
Gemini 3.6 Flashは、画像、音声、動画、PDFに対応していますか?
はい、Googleはテキスト、画像、音声、動画、PDFをサポートされている入力形式として挙げています。このモデルは、ネイティブな画像や音声ではなく、テキスト、構造化データ、およびツール呼び出しを生成します。当社のBrolyによるPDF変換パスはサポートされていませんでしたが、そのゲートウェイの結果から、GeminiにおけるPDFのネイティブな制限があるとは断定できません。.
Gemini 3.6 Flashは、コンピュータでの使用に対応していますか?
はい。GoogleのGemini APIは、ブラウザ、モバイル、デスクトップ環境において、Gemini 3.6 Flashによる「Computer Use」をサポートしていますが、この機能は依然としてプレビュー版です。クライアントは提案されたアクションを実行し、確認手順や安全対策を実施する必要があります。当社のローカルスクリーンショットテスト環境は、ネイティブな「Computer Use」テストではありませんでした。.
Gemini 3.6 Flashは、Gemini 3.5 Flashよりも優れていますか?
Googleの比較テストではいくつかの項目で優れた結果を示し、出力トークンあたりのコストも安くなっていますが、「優れている」かどうかはワークロードによって異なります。当社のバウンデッドコーディングフィクスチャでは、両モデルとも5/5のスコアを記録しましたが、3.5のスコアでは許容度の高いコード抽出が必要でした。モデル名だけで判断するのではなく、実際にタスクを実行し、検証済みの完了コストを比較してください。.
temperature、top_p、top_k はサポートされていますか?
Googleによると 温度, top_p, そして top_k これらのモデルでは非推奨となっており、無視されます。将来のモデル世代では、これらが拒否される見込みです。移行の際には、これらのフィールドを削除してください。動作を制御するには、明確な指示、スキーマ、構造化された出力、およびアプリケーションバリデータを使用してください。.
無料プランはありますか?
Googleでは、レート制限および利用可能状況に応じて、Standardプランの入力および出力への無料アクセスが提供されています。料金ページには、無料プランのコンテンツはGoogle製品の改善に利用される可能性があることが記載されていますが、有料プランのコンテンツについては別途記載があります。本番環境のデータや機密データを送信する前に、最新のレート、データ使用量、および地域ごとの利用規約を確認してください。.



