Gemini 3.6 O Flash vale a pena para codificação limitada, análise multimodal e fluxos de trabalho de agentes supervisionados. Esta análise do Gemini 3.6 Flash aponta uma atualização confiável em relação ao 3.5 Flash: o Google apresenta preços de saída mais baixos e resultados mais sólidos em vários benchmarks de agência, enquanto nossos testes internos demonstraram extração estruturada precisa, leitura de gráficos e correção focada de código após limites razoáveis de saída. Não se trata de um vencedor universal. Nossa tarefa sintética de recuperação de 128K falhou duas vezes, e o plano de navegação local do modelo inventou um ID de elemento oculto, embora tenha identificado corretamente o alvo visível.
A recomendação prática é realizar um teste-piloto do Gemini 3.6 Flash após os testes de aceitação específicos para cada carga de trabalho, medir o custo total por tarefa bem-sucedida e manter a confirmação humana para ações irreversíveis. Os números oficiais, nossas medições incluindo o gateway, os benchmarks de terceiros e os primeiros relatos nas redes sociais apresentados abaixo são identificados separadamente para que evidências contraditórias não sejam combinadas em uma única pontuação.

Análise rápida do Gemini 3.6 Flash: prós e contras
| Prós | Contras |
|---|---|
| ID de modelo estável para uso em produção | Não há suporte à API Live |
| Preço de venda padrão inferior ao do Flash 3.5 | Apenas saída de texto; sem geração nativa de imagens ou áudio |
| Ganhos significativos nos conjuntos de dados oficiais DeepSWE, MLE-Bench e OSWorld, bem como em contextos longos | Uma capacidade de 1 milhão de tokens não garante uma recuperação confiável |
| Amplo suporte multimodal e a ferramentas | O uso do computador continua sendo um recurso em pré-visualização |
| Nossos testes de extração limitada, gráfico, codificação e ação local foram aprovados | Nosso teste sintético de 128K com oito agulhas falhou duas vezes |
| O Batch/Flex e um nível Flash-Lite mais econômico possibilitam estratégias de roteamento | Os tokens de raciocínio podem atingir limites de saída surpreendentemente restritos |
Índice
O que é o Gemini 3.6 Flash?
O Gemini 3.6 Flash é um modelo estável do Google voltado para cargas de trabalho em produção que exigem mais raciocínio e uso de ferramentas do que uma camada de inferência leve, sem precisar migrar para uma faixa de preço de modelos de ponta. O Google o descreve como um modelo versátil para programação, trabalho intelectual, compreensão multimodal e execução autônoma. O ID do modelo de produção é gemini-3.6-flash. Página oficial de modelos do Google indica que está disponível para o público em geral.
O modelo aceita entradas de texto, imagens, áudio, vídeo e PDF. Ele retorna texto, JSON estruturado e chamadas de funções ou ferramentas, mas não gera imagens nem áudio de forma nativa. Essa distinção é importante ao comparar afirmações genéricas sobre “multimodalidade”: compreender vários formatos de entrada é diferente de produzir vários tipos de mídia de saída.
O Google Gemini 3.6 Placa modelo Flash indica março de 2026 como data de corte do conhecimento e afirma que o modelo se baseia no Gemini 3.5 Flash. Os detalhes sobre a arquitetura e o treinamento são, em sua maioria, herdados por referência, em vez de serem divulgados pela primeira vez; assim, os compradores podem avaliar o comportamento documentado e as avaliações publicadas, mas não conseguem reconstruir a receita de treinamento.
O amplo conjunto de ferramentas é fundamental para o posicionamento. A página oficial do modelo lista chamadas de função, saídas estruturadas, execução de código, pesquisa de arquivos, contexto de URL, armazenamento em cache de contexto, integração com a Pesquisa do Google, integração com o Google Maps, raciocínio e uso de computador. Uma decisão de produção deve avaliar todo o ciclo — formato da solicitação, rastreamento da ferramenta, novas tentativas, validação e revisão humana — e não apenas a qualidade de uma única resposta.
Esse papel de “burro de carga” também explica o foco desta análise: o 3.6 Flash é mais interessante quando participa do fluxo de trabalho de um aplicativo, em vez de responder a uma solicitação isolada e trivial. Seu valor depende de o sistema ao redor restringir as ferramentas, detectar truncamentos, verificar os resultados e encaminhar tarefas mais simples para um nível mais econômico.
O recurso “Uso do Computador” permite que um aplicativo envie capturas de tela e receba sugestões de ações para ambientes de navegador, dispositivos móveis ou computadores. O cliente continua sendo responsável por executar a ação, fornecer a próxima captura de tela e aplicar as políticas. O Google denomina esse recurso de “Pré-visualização” e recomenda supervisão para tarefas confidenciais ou irreversíveis no Documentação sobre o uso do computador.
Gemini 3.6 Especificações e recursos do Flash
| Especificação | Gemini 3,6 Flash |
|---|---|
| ID do modelo | gemini-3.6-flash |
| Status do lançamento | Estável / disponível para o público em geral |
| Contexto máximo de entrada | 1.048.576 tokens |
| Potência máxima | 65.536 tokens |
| Modalidades de entrada | Texto, imagem, áudio, vídeo, PDF |
| Modalidade de saída | Texto |
| Nível de raciocínio padrão | médio |
| Limite de conhecimento | Março de 2026 |
| API ao vivo | Não suportado |
| Uso do computador | Compatível com o Preview |
| API em lote | Suportado no nível do modelo; ainda não por meio da API de Interações |
O limite de contexto de 1.048.576 tokens representa a capacidade máxima, e não uma garantia de que todos os fatos possam ser recuperados de forma confiável. Esse é um tema recorrente tanto nos testes de desempenho de contexto longo do Google quanto em nosso teste de gateway sintético. A recuperação, o agrupamento em blocos, os índices de documentos, os resumos e as citações de fontes continuam sendo úteis mesmo quando um corpus inteiro cabe tecnicamente em uma única solicitação.
O limite máximo de 65.536 tokens é generoso, mas as aplicações reais costumam definir um limite inferior por questões de custo e latência. Nossos testes revelaram como um limite que parece adequado para a resposta visível pode ser esgotado pelos tokens de raciocínio interno. Verifique o motivo e o conteúdo reais da conclusão, em vez de considerar uma resposta HTTP 200 como sucesso da tarefa.
Gemini 3.6 Preços promocionais
O preço oficial do plano Standard é $1,50 por milhão de tokens de entrada e $7,50 por milhão de tokens emitidos. O faturamento de saída inclui tokens de raciocínio. A inferência em lote e a inferência flexível reduzem pela metade essas taxas de tokens, enquanto a inferência prioritária aplica um prêmio de 80%. Verifique sempre o valor atual Página de preços da API Gemini antes de elaborar uma previsão de produção.
| Modo de consumo | Entrada / 1 milhão de tokens | Saída / 1 milhão de tokens |
|---|---|---|
| Padrão | $1.50 | $7.50 |
| Lote | $0.75 | $3.75 |
| Flex | $0.75 | $3.75 |
| Prioridade | $2.70 | $13.50 |
O cache de contexto tem o preço de $0,15 por milhão de tokens de entrada armazenados em cache no plano pago Padrão, mais $1,00 por milhão de tokens por hora para armazenamento em cache. O cache pode reduzir as cobranças por entradas repetidas, mas um cache grande mantido por mais tempo do que o necessário acaba se tornando um centro de custo por si só. Compare a fatura do cache com a reutilização efetivamente alcançada.
O “grounding” tem uma unidade de medida diferente. O Google indica 5.000 prompts com grounding na Pesquisa Google ou no Google Maps por mês, sem custo, distribuídos entre os modelos Gemini 3, seguidos por $14 por cada 1.000 consultas de pesquisa. Uma solicitação pode gerar mais de uma consulta, portanto, o custo dos tokens por si só pode subestimar um fluxo de trabalho com grounding.
Exemplo de precificação padrão para o modelo $2.25
Uma solicitação que consome 1.000.000 de tokens de entrada e produz 100.000 tokens de saída custa $1,50 para a entrada mais $0,75 para a saída, ou $2.25 no modo Padrão. Esse exemplo simples não leva em conta o armazenamento em cache, consultas de verificação, novas tentativas, ferramentas externas e tentativas malsucedidas.
O Google também informa que o Gemini 3.6 Flash utilizou 17% a menos de tokens de saída do que o 3.5 Flash no Índice de Análise Artificial e exigiu menos etapas de raciocínio e chamadas de ferramentas em fluxos de trabalho com várias etapas. Essa é uma observação oficial dependente da carga de trabalho, não uma economia garantida de 17% para todas as aplicações. Meça os tokens por tarefa bem-sucedida usando seus próprios prompts.

Gemini 3.6 Testes de desempenho do Flash: o que o Google divulga

As comparações oficiais do Google mostram os ganhos mais evidentes em codificação agênica, engenharia de aprendizado de máquina, interação com computadores e recuperação de contexto extenso. A linha de base mais útil é o Gemini 3.5 Flash, pois o Google avaliou ambos os modelos dentro da mesma família de model-cards. Esses valores são resultados do Google, e não medições realizadas por nosso ambiente de testes.
| Referência | Gemini 3,6 Flash | Gemini 3.5 Flash | Diferença relatada |
|---|---|---|---|
| SWE-Bench Pro Público | 58.7% | 55.1% | +3,6 pontos |
| DeepSWE v1.1 | 49.0% | 37.0% | +12,0 pontos |
| Banco de terminais 2.1 | 78.0% | 76.2% | +1,8 pontos |
| MLE-Bench | 63.9% | 49.7% | +14,2 pontos |
| GDPval-AA v2 | 1.421 Elo | 1.349 Elo | +72 Elo |
| OSWorld-Verified | 83.0% | 78.4% | +4,6 pontos |
O DeepSWE apresentou uma melhora de 12,0 pontos percentuais e o MLE-Bench, de 14,2 pontos. O ganho no OSWorld-Verified foi de 4,6 pontos, enquanto o SWE-Bench Pro Public e o Terminal-Bench apresentaram variações mais modestas. A afirmação justificável é que a versão 3.6 melhora várias cargas de trabalho de agentes em relação à 3.5, e não que ela supere todos os modelos ou benchmarks de codificação.
O Google também destaca uma redução nas edições indesejadas de código e ciclos de execução mais curtos. Esses comportamentos podem ser mais importantes do que uma pequena variação na taxa de aprovação do trabalho no repositório, pois alterações desnecessárias aumentam o custo da revisão e ciclos repetidos consomem tokens. Eles ainda exigem medições no nível da aplicação; um benchmark agregado não é capaz de determinar o comportamento em uma base de código específica.
Resultados multimodais e de contexto extenso
No CharXIV, ao analisar gráficos complexos, o Google relata 85,2% sem ferramentas e 89,4% com ferramentas para o Gemini 3,6 Flash. O Gemini 3.5 Flash obteve 84,21 TP40T e 84,91 TP40T, respectivamente. A diferença maior com o uso de ferramentas reforça o posicionamento do modelo para interpretação de gráficos e fluxos de trabalho multimodais, embora não avalie o gosto visual nem a qualidade do estilo do front-end.
| Teste de contexto longo do GDM-MRCR v2 | Gemini 3,6 Flash | Gemini 3.5 Flash |
|---|---|---|
| 128K, média de 8 agulhas | 91.8% | 77.3% |
| 1M, ponto a ponto com 8 agulhas | 54.0% | 26.6% |

O resultado de 1M representa uma grande melhoria relativa, mas o 54.0% não serve de base para a recuperação cega de fatos críticos. Os sistemas de produção ainda devem segmentar documentos, manter a proveniência e solicitar citações das fontes. Nosso teste sintético separado de 128K falhou, mas utilizou uma tarefa e uma rota de gateway diferentes e não pode substituir o resultado do Google.

Nossos testes práticos do Gemini 3.6 Flash
Realizamos um conjunto de testes determinísticos de primeira mão em 22 de julho de 2026. Toda a latência relatada é tempo total de resposta, incluindo o gateway, portanto, inclui a sobrecarga de roteamento do Broly e não deve ser interpretada como latência direta da API do Google.
O TTFT não foi medido, inclusive para a verificação de streaming. Registramos o tempo total decorrido, tokens de prompt, tokens de conclusão, tokens de raciocínio, tokens em cache, total de tokens, motivo da conclusão, tentativas, validação e um custo estimado com base nas taxas oficiais de tokens do Standard. Os tokens de raciocínio já estavam incluídos nos tokens de conclusão, e os tokens em cache já estavam incluídos nos tokens de prompt.
A atividade completa consistiu em 12 chamadas de API lógicas e 14 tentativas HTTP. A votação nas primárias continuou $0.244491, as três reprises em questão totalizaram $0.0520416, e a estimativa acumulada corrigida foi $0.2965326. Após substituir dois registros iniciais claramente truncados por suas versões corrigidas, o resultado consolidado foi: 7 foram aprovados, 1 foi reprovado e 1 não foi compatível.
As estimativas de custo são de $1,50/M para tokens de prompt não armazenados em cache, $0,15/M para tokens de prompt armazenados em cache e $7,50/M para tokens de saída. Na reexecução com contexto longo, 128.248 tokens de prompt se dividem em 5.464 tokens não armazenados em cache e 122.784 tokens armazenados em cache; somando-se 2.048 tokens de saída, obtém-se $0.0419736. O armazenamento em cache está listado como $1.00/M tokens/hora, mas foi excluído porque a duração do armazenamento não foi medida.
Trata-se de testes de diagnóstico com amostras pequenas, e não de uma referência com poder estatístico. Eles são úteis porque os cenários de teste, os valores esperados, os validadores, os limites de solicitações e as falhas são preservados. Eles devem servir de orientação para testes de acompanhamento em uma carga de trabalho real, e não se tornar um indicador universal de qualidade.
| Registro da tarefa final | Resultado | Tempo, incluindo o gateway | Tokens P / C / R / em cache / Total | Custo estimado |
|---|---|---|---|---|
| Resposta exata para streaming, 3,6 | Passe | 2,938 segundos | 5 / 119 / 118 / 0 / 124 | $0.0009 |
| Extração estruturada, repetição 3.6 | Passe | 3,919 segundos | 55 / 453 / 411 / 0 / 508 | $0.00348 |
| Extração estruturada, 3,5 | Passe | 3,113 segundos | 56 / 378 / 324 / 0 / 434 | $0.003486 |
| Visão do gráfico, repetição 3.6 | Passe | 4,884 segundos | 1,127 / 653 / 520 / 0 / 1,780 | $0.006588 |
| Reparo de codificação, 3,6 | Passe | 5,553 segundos | 602 / 1,150 / 930 / 0 / 1,752 | $0.009528 |
| Reparo de codificação, 3,5 | Passe | 6,860 segundos | 603 / 1,332 / 1,058 / 0 / 1,935 | $0.0128925 |
| 128K, oito agulhas, repetição de 3,6 | Falha | 11,366 segundos | 128,248 / 2,048 / 0 / 122,784 / 130,296 | $0.0419736 |
| Plano de ação local para navegadores, 3.6 | Passe | 5,305 segundos | 1,153 / 643 / 573 / 0 / 1,796 | $0.006552 |
Broly /respostas Conversão para PDF | Não compatível | 2,423 segundos | 0 / 0 / 0 / 0 / 0 | $0 |
Streaming, saída estruturada e leitura de gráficos
A tarefa de streaming exigia a resposta exata que aparecia na tela OK. Gemini 3,6 O Flash retornou a resposta correta em 2,938 segundos, com 5 tokens de prompt, 119 de conclusão, 118 de raciocínio e 124 tokens no total, a uma estimativa de $0,0009. O detalhe marcante é que o raciocínio consumiu 118 dos 119 tokens de conclusão, ilustrando por que um limite de saída minúsculo pode não gerar nenhuma resposta visível.
A primeira chamada de extração estruturada 3.6 utilizou um limite de saída de 512 tokens e terminou em motivo_conclusão=comprimento com JSON truncado. Consideramos isso um limite do ambiente de teste, e não um veredicto de qualidade, e repetimos apenas essa tarefa com 2.048 tokens. A reexecução direcionada passou na validação exata de campo em 3,919 segundos com P55/C453/R411/T508 e um $ estimado em 0,00348.
O Gemini 3.5 Flash concluiu a mesma extração em sua execução inicial em 3,113 segundos com P56/C378/R324/T434 e uma estimativa de $0,003486. Uma única execução por configuração não é suficiente para determinar qual apresenta a menor latência. No entanto, isso demonstra que os limites de saída e o uso do raciocínio devem ser ajustados para cada modelo, em vez de serem copiados cegamente.
A chamada de leitura do gráfico 3.6 também foi truncada em um limite inicial de 768 tokens. Com 2.048 tokens, a repetição planejada leu todos os oito valores de referência exatamente em 4,884 segundos, utilizando P1.127/C653/R520/T1.780 e um valor estimado de $0,006588. O validador comparou cada valor retornado com um arquivo de referência fixo.
Correção de código: ambos os modelos atingiram 5/5
Ambas as tarefas de codificação partiram de cópias isoladas do mesmo fixture em Python, com uma linha de base de 3/5 testes aprovados. O Gemini 3.6 Flash produziu uma correção focada e utilizável em 5,553 segundos, com P602/C1.150/R930/T1.752 e um $ estimado em 0,009528. A aplicação do resultado elevou o fixture para 5/5, enquanto o hash do arquivo de teste permaneceu inalterado.
O Gemini 3.5 Flash também produziu uma correção direcionada que atingiu 5/5, em 6,860 segundos, com P603/C1.332/R1.058/T1.935 e um valor estimado de $0,0128925. Ele adicionou prosa ao redor do código cercado, apesar da instrução de não incluir prosa; portanto, o harness precisou de uma extração tolerante de código cercado antes da validação offline. Ambas as correções eram utilizáveis; a disciplina de saída diferia.
Este teste privilegia trabalhos de correção delimitados com testes unitários determinísticos. Ele não avalia a navegação no repositório, alterações arquitetônicas envolvendo vários arquivos, autonomia de longa duração nem se o modelo é capaz de criar um teste discriminatório a partir do zero. Essas dimensões exigem fixtures e critérios de falha distintos.
A falha na recuperação de dados sintéticos de 128K
Nosso prompt de quase 128K colocou oito identificadores determinísticos em um amplo contexto sintético e exigiu a recuperação exata em JSON. O Gemini 3.6 Flash falhou duas vezes, retornando código e HTML não relacionados, em vez dos oito valores. Aumentar o limite de saída não corrigiu o comportamento.
A repetição levou 11,366 segundos e apresentou os valores P128.248/C2.048/R0/Cached122.784/T130.296, um valor estimado de $0,0419736 após o ajuste da entrada em cache, e motivo_conclusão=comprimento. Isso é não é diretamente comparável ao GDM-MRCR do Google Resultado: nossa tarefa, a formulação exata do prompt, a escala de contexto, o formato de saída e a rota do gateway do Broly são todos diferentes.
A falha ainda é relevante do ponto de vista operacional. Ela indica que essa solicitação sintética específica não funcionou por meio da nossa rota em duas tentativas; portanto, não enviaríamos o mesmo padrão sem recuperação, seleção de contexto mais restrita, validação da resposta e tratamento de fallback. Isso não invalida o benchmark do Google nem comprova uma limitação geral de 128K.
Estrutura local de ação do navegador: destino correto, ID inventado
O modelo analisou uma captura de tela de uma página local controlada e identificou corretamente o texto-alvo visível: “Abrir relatório de uso”. Ele propôs a ação clique mas criou um identificador oculto, abrir_relatório_de_uso, em vez do ID real do DOM uso. O harness identificou o texto exato e específico que estava visível, em vez de confiar no ID inventado.
A chamada do plano levou 5,305 segundos, com P1.153/C643/R573/T1.796, e custou cerca de $0,006552. Um fixture local do Chrome foi clicado uma vez, alterando o estado de pronto para relatório-aberto. Isso foi Uso do computador Gemini não nativo; não realizou nenhuma ação externa, não enviou nenhum formulário e não alterou nenhum estado externo.


O resultado do PDF é uma limitação do caminho do gateway
O Broly /respostas O caminho de conversão para PDF retornou um erro HTTP 500 com o código convert_request_failed e mensagem não implementado. A chamada lógica realizou três tentativas HTTP, pois o registro inclui duas tentativas de recuperação, e então foi interrompida sem uso de token nem custo. Classificamos essa rota como não suportada.
Esse resultado isso não significa que o Gemini não tenha suporte a PDF. A documentação do modelo do Google indica o formato PDF como entrada; nossa solicitação falhou antes que uma resposta visível do modelo fosse exibida em um caminho de conversão compatível com o OpenAI. Ainda é necessária uma verificação nativa no Google AI Studio ou na API do Gemini antes de publicar qualquer conclusão sobre o comportamento nativo do PDF.
Ainda é necessária a aprovação do editor: Execute a tarefa de PDF pelo Google AI Studio nativo ou pela API Gemini e, em seguida, capture o prompt completo, a resposta do modelo, o painel de uso e as evidências de citação da página. Enquanto essas capturas de tela não estiverem disponíveis, esta análise relata apenas a falha na conversão do Broly e não faz nenhuma afirmação sobre o desempenho do PDF nativo.
Gemini 3.6 Acesso à API do Flash e código
O Gemini 3.6 Flash está disponível no Google AI Studio e na API para desenvolvedores do Gemini sob o ID do modelo estável gemini-3.6-flash. O Google recomenda a versão mais recente API de interações para novos projetos de agência, enquanto os já estabelecidos gerarConteúdo A interface continua sendo suportada e abrange recursos importantes que ainda não foram disponibilizados por meio do Interactions.
Python com o SDK oficial do Google Gen AI
O cliente lê as credenciais a partir da configuração do ambiente compatível; não codifique diretamente nem publique uma chave. O exemplo evita intencionalmente campos de amostragem obsoletos e utiliza o oficial do Google google-genai gerar_conteúdo método. Adicione esquemas, configurações de segurança e ferramentas apenas conforme a carga de trabalho exigir.
JavaScript com @google/genai
Para uma utilização confiável em produção, valide a estrutura retornada, analise os motivos de conclusão, registre as chamadas de ferramentas e diferencie o sucesso do transporte do sucesso da tarefa. Uma resposta 200 contendo JSON truncado ou uma ação não suportada não constitui um resultado comercial satisfatório.
API de interações ou geração de conteúdo?
A API de Interações adiciona um estado opcional no lado do servidor por meio de id_da_interação_anterior, etapas de execução observáveis e execução em segundo plano para tarefas mais demoradas. É uma opção atraente para novos loops de agente, pois os rastros de estado e de ferramentas são conceitos de primeira classe. Verifique as configurações de armazenamento e retenção antes de utilizá-lo com conteúdo confidencial.
Manter gerarConteúdo quando sua interface de recursos, já madura, se adequar melhor à aplicação. Em julho de 2026, a documentação do Google indicava que o Interactions ainda não disponibilizava a API Batch, o armazenamento em cache explícito, configurações de segurança personalizadas, metadados de vídeo nem a chamada automática de funções em Python. O suporte a modelos e o suporte à interface da API são questões distintas.
Gemini 3.6 Alterações na migração da API do Flash
A mudança em relação aos formatos de solicitação anteriores vai além da simples troca do nome do modelo. O Google’s guia de migração para o modelo mais recente parâmetros de documentos e padrões de transformação que estão obsoletos, são ignorados ou rejeitados. Trate a migração como uma alteração no contrato de solicitação e na integridade do estado.
Remover controles obsoletos e o preenchimento automático
Remover temperatura, top_p, e top_k. O Google afirma que elas estão obsoletas e são ignoradas nesses modelos, e espera-se que as futuras gerações retornem um código HTTP 400 quando forem fornecidas. Um recurso legado temperatura: 0 Esse campo não deve ser considerado uma garantia de determinismo.
Além disso, as solicitações não podem terminar com um preenchimento automático não vazio de modelo-função. Padrões como acrescentar “Tradução:” ou a chave de abertura do JSON a uma resposta de modelo podem resultar em um erro HTTP 400. Substitua o preenchimento automático por instruções do sistema, saídas estruturadas, esquemas explícitos e validadores.
Substituir valor numérico pensando_no_orçamento controles com o nível de pensamento enum; Gemini 3.6 A configuração padrão do Flash é médio. Remover número_de_candidatos, o que o Gemini 3.x não suporta, e implementar alternativas no nível do aplicativo caso sejam realmente necessárias várias estratégias possíveis.
Preservar o estado da chamada de função
Os fluxos de trabalho das ferramentas precisam de IDs de chamada, nomes de funções, assinaturas de pensamento e ordem de turnos intactos. Ao usar gerarConteúdo, cada um Resposta da função deveria incluir seu call_id e nome. Teste chamadas com formato incorreto, texto explicativo antes da saída da ferramenta e recuperação em caso de ferramentas rejeitadas ou indisponíveis.
- Altere o ID do modelo de destino para
gemini-3.6-flash. - Remover
temperatura,top_p,top_k, enúmero_de_candidatos. - Substitua
pensando_no_orçamentocomnível de pensamento. - Remover o preenchimento automático de “model-turn”.
- Preservar os IDs das chamadas de função, os nomes, as assinaturas de pensamento e a ordem das ferramentas.
- Valide os motivos de conclusão, os esquemas, as tentativas de repetição e cada alegação de sucesso.
- Recalcular o custo por tarefa bem-sucedida, incluindo chamadas e ferramentas com falha.
- Execute testes de injeção de comandos no prompt e de ações destrutivas antes de utilizar o computador.

Gemini 3.6 Flash x 3.5 Flash e Flash-Lite
O Gemini 3.6 Flash é o candidato direto à atualização do Gemini 3.5 Flash. O preço padrão de entrada permanece em $1,50 por milhão de tokens, enquanto o preço de saída cai de $9,00 para $7,50—uma redução de 16,7% antes de considerar o relatório separado do Google sobre o menor uso de tokens de saída em uma avaliação.
| Categoria | Gemini 3,6 Flash | Gemini 3.5 Flash |
|---|---|---|
| Entrada padrão / 1M | $1.50 | $1.50 |
| Saída padrão / 1M | $7.50 | $9.00 |
| DeepSWE v1.1 | 49.0% | 37.0% |
| MLE-Bench | 63.9% | 49.7% |
| OSWorld-Verified | 83.0% | 78.4% |
| 1M GDM-MRCR v2 | 54.0% | 26.6% |
| Nossa correção de código com limites | 5/5 após o conserto | 5/5 após extração tolerante |
O argumento a favor da migração é mais forte quando melhores pontuações de agência, preço de saída mais baixo e ciclos mais curtos se traduzem em um trabalho mais bem-sucedido por dólar. Ele é mais fraco quando um repositório ou mecanismo de ferramenta específico provoca execução incompleta, verificação incorreta ou correções humanas repetidas. Execute prompts correspondentes com as mesmas ferramentas e testes de aceitação.
Onde o Gemini 3.5 Flash-Lite se encaixa
Gemini 3.5 Flash-Lite é uma versão mais econômica para extração, classificação, tradução, roteamento, processamento de documentos e tarefas de subagentes delimitadas em alta produtividade. O preço padrão é de $0,30 por milhão de tokens de entrada e $2,50 por milhão de tokens de saída. Isso torna o 3.6 Flash cinco vezes mais caro na entrada e três vezes mais caro na saída.
Um roteador de dois níveis pode direcionar, por padrão, as tarefas elegíveis para o Flash-Lite e encaminhar as tarefas de baixa confiança, que exigem muitas ferramentas, multimodais ou de longo prazo para o 3.6 Flash. O roteador deve ser observável e reversível, com os motivos registrados e incluindo tanto o custo de repetição quanto o custo de correção. Tokens mais baratos não significam automaticamente tarefas concluídas mais baratas.

Feedback inicial dos usuários e resultados de terceiros
O Gemini 3.6 Flash já estava disponível ao público há cerca de um dia quando essas capturas de tela foram feitas, em 22 de julho de 2026. As postagens são Anedota social dados, e não uma pesquisa representativa, e os rankings das plataformas são Teste de desempenho realizado por terceiros evidências, em vez de resultados do Google ou de nossas medições. Elas são úteis para identificar hipóteses a serem testadas.
Sinais promissores no navegador e no front-end, com algumas ressalvas
A Arena.ai informou que o Gemini 3.6 Flash ficou em 12º lugar, com 1.537 pontos, no Frontend Code Arena, subindo da 21ª posição ocupada pelo Gemini 3.5 Flash. O resultado reflete as instruções, os votantes, o instantâneo do modelo e o método de classificação da Arena. Ele corrobora a hipótese de melhoria no front-end, mas não estabelece um padrão universal de qualidade de código.

A Browser Use divulgou o resultado de 68% em seu benchmark BU e classificou o modelo como a melhor opção de agente de navegador em termos de relação custo-desempenho. Trata-se de um benchmark elaborado pelo próprio fornecedor, e não de uma avaliação neutra do setor. É interessante do ponto de vista direcional, em comparação com o resultado do Google no OSWorld, mas as equipes devem reproduzir as tarefas do navegador dentro de seu próprio ambiente de segurança e de execução de ferramentas.
Um usuário crítico do X interpretou a tabela do Google de maneira diferente, argumentando que os ganhos mais convincentes apareceram nas áreas de visão e contexto, e não na codificação. Outro usuário destacou um índice composto de codificação em que o valor 3,6 ficava ligeiramente abaixo de 3,5. Combinações diferentes de tarefas podem produzir resultados aparentemente conflitantes; é por isso que os nomes e métodos dos benchmarks devem permanecer associados a cada número.

Os relatórios de codificação enfatizam a verificação e a conclusão
O relatório mais detalhado do Reddit descreveu o 3.6 Flash como rápido e eficiente quando as tarefas eram bem delimitadas, mensuráveis e monitoradas antes da correção. O mesmo autor alertou sobre afirmações de verificação feitas com excesso de confiança, autonomia que parecia destrutiva e o custo de supervisão envolvido na verificação do trabalho. O autor também revelou que outro modelo revisou ou corrigiu o resultado e que um problema de configuração prejudicou parte do teste.

Um usuário do Reddit relatou que o trabalho no projeto ficou incompleto, seguido pela alegação de que a tarefa havia sido concluída. Os comentaristas descreveram situações semelhantes, além de preocupações com depuração e verificações equivocadas. A configuração da ferramenta e as instruções não foram verificadas de forma independente; portanto, o relato deve ser considerado um caso de teste — e não um veredicto generalizado.

A lição comum em avaliações é separar a qualidade da correção da integridade da verificação. Um modelo pode sugerir uma alteração útil, mas utilizar um teste que não consiga identificar a correção, omitir o segmento final da tarefa ou apresentar de forma incorreta as falhas remanescentes. Os critérios de aceitação devem verificar o artefato, o poder discriminatório do teste, o estado final e a precisão do relatório de conclusão.
Limitações, segurança e limites da evidência
O Gemini 3.6 Flash apresenta os modos de falha típicos do modelo básico, incluindo informações fantasiosas, execução incompleta e conclusões assertivas, porém sem fundamento. A ficha do modelo também menciona lentidão ocasional ou comportamentos de tempo limite. Como seu corte de conhecimento é em março de 2026, informações mais recentes exigem fundamentação, uma fonte confiável atual ou documentos fornecidos.
O Google relata comparações de segurança amplamente positivas em relação ao Gemini 3.5 Flash, incluindo melhorias na segurança das funções “texto para texto” e multilíngues, segurança inalterada na função “imagem para texto” e ligeiras regressões no tom de recusa e nas recusas injustificadas. O modelo permaneceu abaixo dos Níveis Críticos de Capacidade do Google após testes adicionais. Essas são avaliações relatadas pelos editores, não garantias independentes para uma implantação específica.
O uso de computadores exige controles operacionais mais rigorosos do que o chat. Agentes baseados em capturas de tela podem se deparar com injeção de comandos, controles enganosos, janelas pop-up e ações irreversíveis. Utilize ambientes isolados, credenciais com o mínimo de privilégios, listas de permissão de domínios e ações, confirmações, registros de auditoria, limites de gastos e planos de reversão.
Nosso teste de navegador não utilizou o endpoint nativo “Computer Use” do Google e, portanto, não pode servir de base para qualquer afirmação sobre latência, segurança ou taxa de sucesso nativas. O teste avaliou a interpretação de capturas de tela e um resolvedor de ações local baseado em texto. Da mesma forma, o erro de conversão de PDF do Broly se aplica apenas a esse caminho de solicitação do gateway.
Nossos dados de latência incluem o roteamento do gateway Broly e foram obtidos a partir de um único conjunto de testes, sem repetições nas distribuições. Não medimos o TTFT. Os custos são estimativas derivadas do uso relatado e das tarifas oficiais do Standard, e não de faturas, e o conjunto de testes não utilizou o Search Grounding.
Os benchmarks oficiais, as tabelas de classificação de terceiros, nossos testes de gateway e as histórias compartilhadas nas redes sociais respondem a diferentes perguntas. Manter suas identificações visíveis evita uma falsa sensação de precisão: os resultados do Google descrevem a avaliação do Google, nossos registros descrevem uma rota e um conjunto de fixtures reproduzíveis, e as publicações abertas descrevem experiências individuais.
Quem deve usar o Gemini 3.6 Flash?
O Gemini 3.6 Flash é uma forte opção para equipes que já utilizam o Gemini 3.5 Flash, especialmente quando o custo de saída, a entrada multimodal, a invocação de ferramentas ou o planejamento agênico são fatores relevantes. Ele também se adapta a novas aplicações capazes de definir critérios explícitos de sucesso e supervisionar ações sensíveis ao risco.
- Programadores com tarefas delimitadas, ambientes de trabalho isolados e testes automatizados seletivos.
- Fluxos de análise de gráficos, imagens, vídeos, áudio e PDFs que geram texto ou dados estruturados.
- Agentes supervisionados no navegador ou na área de trabalho, com etapas de confirmação e validação local.
- Sistemas de trabalho baseados no conhecimento que requerem chamada de funções, pesquisa de arquivos, armazenamento em cache ou pesquisa fundamentada.
- Equipes capazes de comparar o custo por tarefa bem-sucedida com o da 3.5 Flash e de outros provedores.
Essa solução é menos adequada quando a tarefa pode ser executada de forma confiável pelo Flash-Lite, quando o processamento de voz em tempo real exige a API Live ou quando é necessária a geração nativa de imagens ou áudio. Também não é adequada para automação não supervisionada de alto risco sem reversão e verificação independente.
- Transferir as tarefas simples de classificação e extração para um nível de custo mais baixo, sem comprometer a qualidade.
- Não se deve presumir que uma janela de contexto de 1M substitua a engenharia de recuperação.
- Não aceite o status de “verificado” declarado pelo próprio usuário sem um teste que possa falhar.
- Não generalize a latência do gateway do Broly nem o comportamento da conversão de PDF para os endpoints nativos do Google.
- Não habilite ações irreversíveis relacionadas ao uso do computador sem confirmação explícita.
Veredicto final
Esta análise do Gemini 3.6 Flash identifica um forte candidato para produção, mas não uma migração automática. O modelo combina preços de saída mais baixos, uma ampla gama de entradas e ferramentas, além de ganhos oficiais significativos nos testes DeepSWE, MLE-Bench, OSWorld e na recuperação de contexto longo. Nossos testes restritos fornecem evidências encorajadoras para extração exata, leitura de gráficos, correção focada de código e planejamento de ações locais guiadas por capturas de tela.
A advertência é igualmente concreta. Limites rígidos de saída causaram dois truncamentos iniciais; o raciocínio utilizou quase todo o orçamento de conclusão do streaming; nosso teste de recuperação sintética de 128K falhou duas vezes; e o plano do navegador gerou um ID inédito. O caminho do PDF permaneceu sem ser testado nativamente porque a rota de conversão do Broly falhou antes de uma resposta do modelo.
Adote o Gemini 3.6 Flash quando uma avaliação comparativa mostrar melhores resultados econômicos por tarefa concluída do que o seu modelo atual. Acompanhe a taxa de aprovação, tokens, novas tentativas, chamadas de ferramentas, edições indesejadas, tempo de correção manual e se cada afirmação de verificação é respaldada por um teste discriminatório. Para cargas de trabalho mistas, comece com o Flash-Lite e amplie a adoção conforme a necessidade observada.
Perguntas frequentes
O Gemini 3.6 Flash já está disponível para o público em geral?
Sim. O Google classifica o Gemini 3.6 Flash como estável e disponível para uso em produção. O ID do modelo é gemini-3.6-flash, e pode ser acessado por meio do Google AI Studio e da API para desenvolvedores do Gemini. A cobertura dos recursos da API ainda varia entre as interações e gerarConteúdo.
Quanto custa o Gemini 3.6 Flash?
O preço padrão para transações pagas é de $1,50 por milhão de tokens de entrada e $7,50 por milhão de tokens de saída, incluindo tokens de raciocínio. Os planos Batch e Flex custam $0,75 de entrada e $3,75 de saída, enquanto o plano Priority custa $2,70 de entrada e $13,50 de saída. O armazenamento em cache e o grounding podem acarretar cobranças adicionais.
O que é a janela de contexto do Gemini 3.6 Flash?
O Gemini 3.6 Flash suporta até 1.048.576 tokens de entrada e 65.536 tokens de saída. Trata-se de um limite de capacidade, não de uma garantia de recuperação. O resultado de 1 milhão do GDM-MRCR do Google foi de 54,0%, e nossa tarefa sintética diferente de gateway de 128 mil falhou; portanto, sistemas críticos ainda precisam de recuperação e validação.
O Gemini 3.6 Flash é compatível com imagens, áudio, vídeo e PDFs?
Sim, o Google lista texto, imagens, áudio, vídeo e PDFs como entradas compatíveis. O modelo produz texto, dados estruturados e chamadas de ferramentas, em vez de imagens ou áudio nativos. Nosso caminho de conversão de PDF do Broly não era compatível, mas esse resultado do gateway não indica uma limitação nativa do Gemini para PDFs.
O Gemini 3.6 Flash é compatível com uso em computador?
Sim. A API Gemini do Google oferece suporte ao “Computer Use” com o Gemini 3.6 Flash para ambientes de navegador, dispositivos móveis e computadores, mas o recurso ainda está em fase de pré-visualização. O cliente executa as ações propostas e deve aplicar confirmações e controles de segurança. Nosso conjunto de capturas de tela local não constituía um teste nativo do “Computer Use”.
O Gemini 3.6 Flash é melhor do que o Gemini 3.5 Flash?
Ele apresenta melhor desempenho em várias comparações do Google e é mais barato por token de saída, mas o que é “melhor” depende da carga de trabalho. Nosso teste de codificação restrita resultou em 5/5 para ambos os modelos, enquanto o 3.5 exigiu extração de código tolerante. Execute tarefas correspondentes e compare o custo de conclusão verificado, e não apenas os nomes dos modelos.
Os parâmetros temperature, top_p e top_k são suportados?
O Google afirma que temperatura, top_p, e top_k estão obsoletos e são ignorados nesses modelos; espera-se que as futuras gerações de modelos os rejeitem. Remova os campos durante a migração. Utilize instruções claras, esquemas, saídas estruturadas e validadores de aplicativos para controlar o comportamento.
Existe um plano gratuito?
O Google oferece acesso gratuito à entrada e saída de dados no plano Standard, sujeito a limites de taxa e disponibilidade. A página de preços informa que o conteúdo do plano gratuito pode ser utilizado para aprimorar os produtos do Google, enquanto o conteúdo do plano pago é identificado de forma diferente. Verifique as taxas atuais, o uso de dados e os termos regionais antes de enviar dados de produção ou confidenciais.

