Gemini 3.6 Flash: Benchmarks, Preços, Disponibilidade e O Que Mudou
O Google lançou o Gemini 3.6 Flash em 21 de julho de 2026 como a nova ferramenta de uso geral em sua linha Flash. O modelo é voltado para codificação, análise multimodal, agentes de uso de computador e fluxos de trabalho de ferramentas de várias etapas, ao mesmo tempo em que reduz o consumo de tokens de saída e o preço dos tokens de saída em comparação com o Gemini 3.5 Flash.
Os números de destaque são substanciais: o Google relata 49% no DeepSWE, 63,9% no MLE-Bench e 83,0% no OSWorld-Verified. O preço padrão da API é de US$ 1,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída. Este guia explica os benchmarks, níveis de preço, disponibilidade, mudanças na API, ferramentas compatíveis e os motivos práticos para migrar.
Principais conclusões
- Lançamento: O Gemini 3.6 Flash tornou-se disponível para o público em geral em 21 de julho de 2026.
- ID do Modelo: O código estável do modelo da API Gemini é
gemini-3.6-flash. - Preços: O preço padrão é de US$ 1,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída.
- Eficiência: O Google relata 17% menos tokens de saída no Índice de Análise Artificial e até 65% menos no DeepSWE do que o Gemini 3.5 Flash.
- Contexto: O modelo aceita até 1.048.576 tokens de entrada e produz até 65.536 tokens de saída.
- Disponibilidade: Está disponível através da API Gemini, Google AI Studio, Android Studio, Google Antigravity, Gemini Enterprise e do aplicativo Gemini.
Gemini 3.6 Flash em resumo
| Categoria | Gemini 3.6 Flash |
|---|---|
| Função principal | Modelo rápido de raciocínio de propósito geral para cargas de trabalho agenticas e multimodais |
| Identificador estável da API | gemini-3.6-flash |
| Nível de pensamento padrão | Médio |
| Modalidades de entrada | Texto, imagem, vídeo, áudio e PDF |
| Modalidade de saída | Texto |
| Status de produção | Disponível para o público em geral |
O que é Gemini 3.6 Flash?
O Gemini 3.6 Flash é um modelo proprietário de raciocínio multimodal na família Flash do Google, focado em velocidade e eficiência. O Google o posiciona para cargas de trabalho agenticas do mundo real: geração de código, chamada de funções, uso de computador, raciocínio espacial, análise de documentos e fluxos de trabalho que podem exigir várias etapas antes que uma resposta final esteja pronta.
O modelo não é apenas uma liberação 3.5 renomeada. O Google afirma que ele foi ajustado com base no feedback dos desenvolvedores em relação à verbosidade, edições de código indesejadas e loops de execução que consumiram tokens de raciocínio e chamadas de ferramentas adicionais. A melhoria pretendida é, portanto, dupla: melhor qualidade da tarefa e menos trabalho necessário para atingir o resultado.
For developers starting with Google’s platform, Zerlo’s guia para obter uma chave de API Gemini explica a configuração da conta e do Google AI Studio. O nome do modelo a ser selecionado em uma solicitação de API é gemini-3.6-flash.
O que mudou do Gemini 3.5 Flash?
| Área | Mudança no Gemini 3.6 Flash | Efeito prático |
|---|---|---|
| Codificação | Maior precisão, menos edições de arquivo não intencionais e menos loops de depuração | Mais adequado para migrações e desenvolvimento agentico iterativo |
| Eficiência de token | Menos tokens de saída, etapas de raciocínio, turnos e chamadas de ferramentas | Potencialmente menor custo por tarefa concluída em vez de apenas por token |
| Raciocínio multimodal | Melhor interpretação de gráficos, conversão de plantas e compreensão de layout com vários elementos | Fluxos de trabalho de documentos, visuais e espaciais mais fortes |
| Uso de computador | Suporte nativo a ferramentas, atualmente marcado como Preview na documentação do modelo | Pode impulsionar fluxos de trabalho de automação de navegador e interface suportados |
| Preços de saída | US$ 7,50 por milhão de tokens em vez de US$ 9,00 para Gemini 3.5 Flash | Uma redução de 16,7% na taxa padrão de tokens de saída |
| Configuração da API | Parâmetros de amostragem como temperature, top_p e top_k foram preteridos |
Integrações existentes exigem revisão de configuração, não apenas uma mudança de ID do modelo |
Há uma nuance para trabalho de frontend. A documentação de migração do Google afirma que o Gemini 3.6 Flash tende a inspecionar um projeto programaticamente antes de fazer alterações. Isso pode melhorar a correção em tarefas complexas, mas pode adicionar etapas exploratórias a uma edição visual simples. O Google também observa que avaliadores humanos às vezes preferiam modelos anteriores para estilo, então instruções de design explícitas permanecem valiosas.
Benchmarks do Gemini 3.6 Flash
Os dados de lançamento do Google mostram ganhos em relação ao Gemini 3.5 Flash em codificação, engenharia de aprendizado de máquina, trabalho de conhecimento e tarefas de uso de computador. Esses benchmarks usam métodos de pontuação diferentes, portanto, seus valores não devem ser calculados em uma porcentagem geral. Cada resultado é evidência para um tipo específico de carga de trabalho.
| Benchmark | O que ele testa | Gemini 3.5 Flash | Gemini 3.6 Flash |
|---|---|---|---|
| DeepSWE v1.1 | Agentes de engenharia de software de longo prazo | 37% | 49% |
| MLE-Bench | Tarefas de engenharia e pesquisa de aprendizado de máquina | 49.7% | 63.9% |
| OSWorld-Verified | Uso de computador em ambientes de desktop reais | 78.4% | 83.0% |
| GDPval-AA v2 | Qualidade da tarefa de trabalho de conhecimento | 1349 | 1421 |

Fonte: blog.google
Os ganhos mais fortes publicados aparecem em engenharia de software de longo prazo e engenharia de aprendizado de máquina, enquanto o desempenho de uso de computador também aumenta.
Como ler esses resultados de benchmark
- DeepSWE é importante para codificação autônoma: é mais relevante para trabalho em nível de repositório do que uma pergunta de codificação curta e autônoma.
- MLE-Bench mede um fluxo de trabalho especializado: o resultado é útil para agentes de ciência de dados e aprendizado de máquina, mas não é uma pontuação geral de chatbot.
- OSWorld-Verified testa ações: uma pontuação mais alta apoia a narrativa de uso de computador, embora a capacidade de API relacionada ainda seja marcada como Preview.
- GDPval-AA não é uma porcentagem: é uma avaliação comparativa de trabalho de conhecimento e deve ser lida dentro da metodologia desse benchmark.
A eficiência de token faz parte da história do benchmark
Pontuações brutas de tarefas não mostram quantos tokens ou chamadas de ferramentas foram necessários para atingir o resultado. O Google afirma que o Gemini 3.6 Flash gerou 17% menos tokens de saída do que o Gemini 3.5 Flash no Índice de Análise Artificial. No DeepSWE, a empresa relata uma redução maior: os tokens de saída médios por tarefa caíram de cerca de 276.000 para 97.000, uma diminuição de aproximadamente 65%.
A Análise Artificial lista independentemente a configuração de alto raciocínio do Gemini 3.6 Flash com uma pontuação de Índice de Inteligência de 50 e uma janela de contexto de um milhão de tokens. Os resultados de benchmark podem mudar à medida que os avaliadores atualizam prompts, harnesses e versões de modelos, portanto, testes de produção com tarefas representativas permanecem mais importantes do que uma posição no ranking.

Fonte: blog.google
O uso reduzido de tokens de saída pode diminuir o custo de loops de agentes longos, especialmente quando o modelo raciocina repetidamente, edita arquivos e chama ferramentas antes de concluir.
Preços do Gemini 3.6 Flash
A taxa padrão publicada pelo Google é de US$ 1,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída. A taxa de entrada não mudou em relação ao Gemini 3.5 Flash, enquanto a taxa de saída cai de US$ 9,00 para US$ 7,50. A entrada em cache é listada a US$ 0,15 por milhão de tokens na página de preços da Plataforma de Agentes do Google Cloud.
| Opção de consumo | Entrada por 1 milhão de tokens | Saída por 1 milhão de tokens | Uso típico |
|---|---|---|---|
| Padrão | $1.50 | $7.50 | Tráfego interativo e de produção da API normal |
| Prioridade | $2.70 | $13.50 | Cargas de trabalho que pagam mais por capacidade de inferência priorizada |
| Flex ou Batch | $0.75 | $3.75 | Processamento tolerante a atrasos ou assíncrono |
Exemplos de cálculos de preço padrão
| Exemplo de uso mensal | Custo de entrada | Custo de saída | Total estimado |
|---|---|---|---|
| 10 milhões de tokens de entrada e 1 milhão de tokens de saída | $15.00 | $7.50 | $22.50 |
| 50 milhões de tokens de entrada e 5 milhões de tokens de saída | $75.00 | $37.50 | $112.50 |
| 100 milhões de tokens de entrada e 20 milhões de tokens de saída | $150.00 | $150.00 | $300.00 |
Esses exemplos cobrem apenas os tokens do modelo. O grounding de pesquisa, uso de computador, execução de código, serviços externos e outros componentes da plataforma podem adicionar custo ou latência. A métrica interna mais útil é, portanto, o custo por tarefa concluída com sucesso, incluindo retentativas e chamadas de ferramentas, em vez da taxa de token listada isoladamente.
Disponibilidade: onde você pode usar o Gemini 3.6 Flash?
O Gemini 3.6 Flash esteve disponível a partir do dia do lançamento em todas as superfícies de consumidor, desenvolvedor e empresarial do Google. Limites de uso exatos, acesso regional e controles de seleção de modelo podem diferir por produto, assinatura e conta.
| Grupo de usuários | Disponível através de | Detalhe importante |
|---|---|---|
| Desenvolvedores | API Gemini, Google AI Studio e Android Studio | Use o ID de modelo estável gemini-3.6-flash |
| Desenvolvedores de agentes | Google Antigravity e Gemini Managed Agents | O Google fez do 3.6 Flash o modelo padrão para o agente gerenciado Antigravity |
| Empresas | Plataforma de Agente Gemini Enterprise e o aplicativo Gemini Enterprise | Faturamento empresarial, governança e configurações regionais se aplicam |
| Usuários gerais | Aplicativo Gemini | Acesso e limites de uso podem depender da conta e do nível de assinatura |

Fonte: blog.google
Os logs e conjuntos de dados do AI Studio podem ajudar as equipes a comparar o comportamento do modelo, inspecionar solicitações com falha e construir conjuntos de avaliação repetíveis antes de alterar uma implantação em produção.
O Gemini 3.6 Flash não deve ser confundido com Gemini 3.5 Flash-Lite ou Gemini 3.5 Flash Cyber. O Flash-Lite é a opção de menor custo e alto rendimento. O Flash Cyber é um modelo de segurança especializado planejado para governos e parceiros confiáveis por meio de um piloto CodeMender de acesso limitado, não uma substituição geralmente disponível para o 3.6 Flash.
Janela de contexto, entradas e ferramentas suportadas
| Especificação | Gemini 3.6 Flash |
|---|---|
| Tipos de entrada | Texto, imagem, vídeo, áudio e PDF |
| Tipo de saída | Texto |
| Limite de tokens de entrada | 1.048.576 tokens |
| Limite de tokens de saída | 65.536 tokens |
| Capacidades suportadas | Cache, execução de código, pesquisa de arquivos, chamada de funções, grounding de pesquisa, grounding de Maps, saída estruturada, raciocínio e contexto de URL |
| Uso de computador | Suportado em Preview |
| Opções de consumo | Inferência padrão, API Batch, inferência Flex e inferência Prioritária |
| Não suportado | Geração de imagem, geração de áudio e API Live |
A janela de contexto de um milhão de tokens é útil para grandes conjuntos de documentos, repositórios de código, transcrições e registros multimodais. Ela não garante recall perfeito em todas as posições de um prompt longo, e o envio do contexto máximo pode aumentar o custo e a latência. Recuperação, pesquisa de arquivos e segmentação de prompt ainda podem produzir um sistema de produção mais confiável.

Fonte: blog.google
File Search é uma das ferramentas integradas suportadas pelo Gemini 3.6 Flash e pode fundamentar respostas em documentos de projeto indexados em vez de colocar cada arquivo diretamente em cada prompt.
Quais ferramentas integradas importam mais?
- Pesquisa de Arquivos: útil para recuperação de documentos internos, manuais e bases de conhecimento.
- Execução de código: permite que o modelo calcule, transforme dados e verifique partes de uma resposta programaticamente.
- Chamada de função: conecta o modelo a ações e fontes de dados específicas da aplicação.
- Grounding de Pesquisa Google e Maps: adiciona informações atuais ou cientes de localização onde suportado.
- Uso de computador: permite a automação de interface, mas permanece uma capacidade de Preview e requer permissões e validação cuidadosas.
Checklist de migração para Gemini 3.6 Flash
- Altere o ID do modelo de destino para
gemini-3.6-flashem um ambiente de teste. - Remova campos de amostragem preteridos como
temperature,top_petop_k. - Substitua configurações antigas de orçamento de raciocínio por um
thinking_levelapropriado. - Remova viradas de modelo pré-preenchidas e revise o manuseio de estado multivirada.
- Re-teste chamadas de função, respostas de ferramenta e esquemas de saída estruturada.
- Compare sucesso da tarefa, latência, tokens de entrada, tokens de saída, viradas e chamadas de ferramentas com o modelo de produção atual.
- Use um lançamento gradual e mantenha um caminho de reversão até que cargas de trabalho representativas estejam estáveis.
Você deve migrar do Gemini 3.5 Flash?
O Gemini 3.6 Flash é o candidato lógico de migração quando uma aplicação depende de agentes de codificação, uso de ferramentas de várias etapas, interação com computador, análise de documentos ou raciocínio visual e espacial. O menor preço de saída e a menor tendência a entrar em loop são especialmente relevantes para agentes que podem chamar o modelo repetidamente antes de concluir uma solicitação do usuário.
| Carga de trabalho | Melhor direção atual | Razão |
|---|---|---|
| Agente de codificação em nível de repositório | Teste o Gemini 3.6 Flash | Precisão de codificação aprimorada e menos loops de execução |
| Análise multimodal de documentos e gráficos | Teste o Gemini 3.6 Flash | Resultados multimodais e de trabalho de conhecimento publicados mais fortes |
| Classificação ou extração de alto volume | Compare com Gemini 3.5 Flash-Lite | O Flash-Lite foi projetado para maior rendimento a menor custo |
| Geração de imagem | Escolha outro modelo Gemini | O Gemini 3.6 Flash produz apenas saída de texto |
| Aplicação de voz em tempo real | Use um modelo compatível com API Live | A API Live não é suportada pelo Gemini 3.6 Flash |
| Pipeline legado estável sem problemas de qualidade | Benchmark antes de migrar | Uma mudança é útil apenas quando a qualidade, latência ou custo melhoram na carga de trabalho real |
Para uma perspectiva mais ampla de seleção de modelos, o comparativo técnico Gemini vs. Claude da Zerlo explica as diferentes trocas entre o ecossistema do Google e os modelos da Anthropic. Usuários focados em assistentes reutilizáveis em vez de implantação de API também podem achar o guia Gemini Gems útil.
FAQ
Quando o Gemini 3.6 Flash foi lançado?
O Google anunciou e lançou o Gemini 3.6 Flash em 21 de julho de 2026. Ele se tornou amplamente disponível através de produtos Gemini para desenvolvedores, empresas e consumidores.
Qual é o nome do modelo da API Gemini 3.6 Flash?
O ID de modelo estável é gemini-3.6-flash. A documentação do modelo do Google o lista como uma versão estável em vez de um alias apenas para preview.
Quanto custa o Gemini 3.6 Flash?
O preço padrão é de US$ 1,50 por milhão de tokens de entrada e US$ 7,50 por milhão de tokens de saída. O Google Cloud também lista taxas Flex ou Batch mais baixas e taxas Priority mais altas. Ferramentas e outros serviços da plataforma podem adicionar cobranças separadas.
O Gemini 3.6 Flash é mais barato que o Gemini 3.5 Flash?
Sim, para tokens de saída padrão. O preço de entrada permanece US$ 1,50 por milhão de tokens, enquanto o preço de saída cai de US$ 9,00 para US$ 7,50 por milhão de tokens. O Google também relata menor uso de tokens de saída em suas avaliações.
O Gemini 3.6 Flash suporta imagens, áudio e vídeo?
Ele aceita texto, imagens, vídeo, áudio e documentos PDF como entrada. Sua saída é texto. Ele não suporta geração de imagem, geração de áudio ou a API Live.
O Gemini 3.6 Flash está disponível no aplicativo Gemini?
Sim. O Google listou o aplicativo Gemini entre as superfícies de lançamento. Limites específicos da conta, detalhes de rollout regional e controles de seleção de modelo ainda podem variar.
O Gemini 3.6 Flash suporta uso de computador?
Sim, mas o Google marca o uso de computador como uma capacidade de Preview na documentação do modelo. Sistemas de produção devem limitar permissões, validar ações e reter confirmação humana para operações consequentes.
O Gemini 3.6 Flash é melhor que o Gemini 3.5 Flash?
As avaliações publicadas pelo Google mostram pontuações mais altas em codificação, engenharia de aprendizado de máquina, trabalho de conhecimento e uso de computador, juntamente com menor uso de tokens de saída. A vantagem prática depende da carga de trabalho, portanto, as equipes devem realizar testes representativos antes de alterar o tráfego de produção.
Resumo final
O Gemini 3.6 Flash é uma atualização significativa focada em eficiência, em vez de uma mudança cosmética de versão. Ele melhora os resultados publicados pelo Google em codificação agentica, engenharia de aprendizado de máquina, trabalho de conhecimento e uso de computador, enquanto reduz o preço padrão do token de saída de US$ 9,00 para US$ 7,50 por milhão de tokens. Seu caso mais forte não é simplesmente que cada token é mais barato, mas que muitas tarefas de várias etapas podem exigir menos tokens, turnos e chamadas de ferramentas.
Os desenvolvedores devem considerá-lo o principal candidato de migração para cargas de trabalho do Gemini 3.5 Flash que dependem de código, ferramentas ou raciocínio multimodal. O Flash-Lite continua mais adequado para a execução de alto volume mais barata, e o Gemini 3.6 Flash não é o modelo certo para geração de imagem, saída de áudio nativa ou uso da API Live. Os ganhos de benchmark são promissores, mas as decisões de produção ainda devem ser baseadas em precisão específica da tarefa, latência, segurança e custo total.