Gemini 3.7 Flash: Benchmarks, Preços, Disponibilidade da API e o que Mudou
O Google lançou o Gemini 3.7 Flash em 13 de agosto de 2026, apenas três semanas após o Gemini 3.6 Flash. A atualização é voltada diretamente para codificação, fluxos de trabalho agênticos, desenvolvimento web e trabalho de conhecimento intensivo em documentos, com o Google publicando ganhos substanciais em relação ao 3.6 Flash em vários benchmarks de engenharia de software e automação.
A parte incomum são os preços: o Gemini 3.7 Flash será lançado a US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída na API paga padrão até 31 de dezembro de 2026. Essas taxas são temporárias e dobrarão em 1º de janeiro de 2027. Este guia explica os resultados dos benchmarks, disponibilidade da API, limites do modelo, ferramentas suportadas, níveis de preços e as diferenças práticas em relação ao Gemini 3.6 Flash.
Principais conclusões
- Lançamento: O Gemini 3.7 Flash tornou-se geralmente disponível em 13 de agosto de 2026.
- ID do modelo da API: O identificador estável da API Gemini é
gemini-3.7-flash. - Preços introdutórios: O uso pago padrão custa US$ 0,75 por 1 milhão de tokens de entrada e US$ 3,75 por 1 milhão de tokens de saída até 31 de dezembro de 2026. A partir de 1º de janeiro de 2027, essas taxas se tornarão US$ 1,50 e US$ 7,50.
- Ganhos de benchmark: O Google relata 43,6% no FrontierCode 1.1 Main, 65,3% no DeepSWE v1.1, 1588 Elo no Code Arena e 30,4% no AutomationBench.
- Contexto: O modelo aceita até 1.048.576 tokens de entrada e pode retornar até 65.536 tokens de saída.
- Disponibilidade: O Google o distribui através da API Gemini, Google AI Studio, Google Antigravity, produtos Gemini Enterprise e Gemini Spark para assinantes elegíveis do Google AI Pro e Ultra.
Gemini 3.7 Flash em resumo
| Especificação | Gemini 3.7 Flash |
|---|---|
| Data de lançamento | 13 de agosto de 2026 |
| Estágio de lançamento | Geralmente disponível (GA) |
| ID estável do modelo da API | gemini-3.7-flash |
| Modalidades de entrada | Texto, imagem, vídeo, áudio e PDF |
| Modalidade de saída | Texto |
| Limite de tokens de entrada | 1.048.576 tokens |
| Saída máxima | 65.536 tokens |
| Níveis de pensamento | Baixo, médio e alto; mínimo não é suportado |
| Preço da API paga padrão até 31 de dezembro de 2026 | US$ 0,75 / 1 milhão de tokens de entrada; US$ 3,75 / 1 milhão de tokens de saída |
O que é Gemini 3.7 Flash?
O Gemini 3.7 Flash é a próxima iteração da família Gemini 3 Flash do Google. O Google DeepMind afirma que ele é baseado no Gemini 3.6 Flash e adiciona melhorias algorítmicas à base de raciocínio central do modelo. O posicionamento também se tornou mais explícito: o Google chama o 3.7 Flash de seu principal "cavalo de batalha" para codificação e agentes, em vez de um modelo projetado simplesmente para maximizar a produtividade bruta.
Essa distinção é importante. Os modelos Flash têm sido tradicionalmente selecionados porque são mais rápidos e mais baratos do que os maiores modelos de raciocínio. Com o 3.7, o Google está tentando mover mais trabalho multi-etapas para essa camada de custo-eficiência: codificação em nível de repositório, interação com navegador ou computador, chamada de função, processamento complexo de documentos e fluxos de trabalho de negócios que exigem várias chamadas de ferramenta antes que uma resposta seja concluída.
Se você está vindo do antecessor, o visão geral do Gemini 3.6 Flash fornece o contexto de lançamento para o modelo anterior. A atualização importante agora é que o 3.7 Flash mantém a mesma janela de contexto de um milhão de tokens e um amplo conjunto de ferramentas, enquanto aumenta o desempenho em muitas das avaliações de agentes e codificação publicadas pelo Google.
O que mudou do Gemini 3.6 Flash?
| Área | Mudança do Gemini 3.7 Flash | Efeito prático |
|---|---|---|
| Codificação | Maiores pontuações em FrontierCode, DeepSWE e Terminal-bench | Caso mais forte para trabalho em repositório, depuração e agentes de codificação de longa execução |
| Desenvolvimento web | O Code Arena sobe de 1538 para 1588 Elo no cartão de modelo do Google | Melhor desempenho publicado em layouts funcionais e tarefas web completas |
| Automação empresarial | O AutomationBench sobe de 17,0% para 30,4% | Mais promissor para fluxos de trabalho que combinam raciocínio, ferramentas e sistemas de negócios |
| Raciocínio de documentos | O GDP.pdf sobe de 22,0% para 34,0% | Resultado publicado aprimorado para trabalho de conhecimento baseado em PDF difícil |
| Contexto longo | O GDM-MRCR v2 em 128k sobe de 91,8% para 97,0% | Melhor recuperação e raciocínio em entradas longas nessa avaliação |
| Comportamento do desenvolvedor | O Google diz que o modelo se adapta melhor a bloqueios, esclarece a intenção e segue as instruções com mais fidelidade | Potencialmente menos retentativas e menos supervisão manual em fluxos de trabalho multi-etapas |
| Preços | O 3.7 é lançado com uma taxa temporária de US$ 0,75 de entrada / US$ 3,75 de saída por 1 milhão de tokens | Custo de curto prazo menor do que a taxa de lançamento original do 3.6, embora o 3.6 agora esteja na mesma taxa temporária |
A última linha é fácil de mal-entender. O Google descreve o Gemini 3.7 Flash como sendo lançado pela metade do custo original do Gemini 3.6 Flash. No entanto, o cartão de modelo atual do Google lista tanto o 3.6 Flash quanto o 3.7 Flash a US$ 0,75 de entrada e US$ 3,75 de saída por milhão de tokens sob a mesma promoção temporária. Portanto, o 3.7 não é atualmente mais barato por token padrão do que o 3.6; a comparação é contra os preços de lançamento originais do 3.6.
Benchmarks do Gemini 3.7 Flash
O cartão de modelo de agosto de 2026 do Google publica um amplo conjunto de benchmarks cobrindo engenharia de software, uso de terminal agêntico, automação empresarial, trabalho de conhecimento, PDFs, contexto longo, uso de computador e raciocínio científico. Os números abaixo comparam o Gemini 3.7 Flash com o Gemini 3.6 Flash usando os valores desse cartão de modelo.
| Benchmark | O que ele mede | Gemini 3.6 Flash | Gemini 3.7 Flash |
|---|---|---|---|
| Índice de Análise de Inteligência Artificial | Inteligência de modelo composto | 52 | 56 |
| FrontierCode 1.1 Principal | Qualidade de código de produção | 34.4% | 43.6% |
| DeepSWE v1.1 | Engenharia de software de longo horizonte | 48.6% | 65.3% |
| Code Arena | Desenvolvimento web | 1538 Elo | 1588 Elo |
| Terminal-bench 2.1 | Codificação de terminal agêntica | 78.0% | 85.8% |
| AutomationBench | Automação de fluxo de trabalho empresarial | 17.0% | 30.4% |
| GDP.pdf | Compreensão de PDF por especialista | 22.0% | 34.0% |
| GDM-MRCR v2 a 128k | Recuperação e raciocínio de contexto longo | 91.8% | 97.0% |
| OSWorld-2.0 | Uso de computador agêntico | 33.8% | 47.9% |

Fonte: blog.google
Onde os ganhos são mais fortes
O movimento mais claro é em cargas de trabalho que exigem que o modelo continue trabalhando em vez de responder uma vez. O DeepSWE aumenta de 48,6% para 65,3%, enquanto o AutomationBench passa de 17,0% para 30,4%. Isso apoia a afirmação do Google de que o modelo é mais útil para agentes que precisam planejar, chamar ferramentas, inspecionar resultados e se recuperar de obstáculos.
O trabalho com documentos também melhora substancialmente nos dados publicados pelo Google. O GDP.pdf passa de 22,0% para 34,0%, e a empresa destaca especificamente finanças, direito e biociências como domínios densos em conhecimento onde espera melhor raciocínio. Isso não significa que o modelo possa substituir a revisão especializada em trabalhos regulamentados ou de alto risco; significa que o resultado do benchmark é materialmente superior ao 3.6 Flash nas tarefas testadas.
3.7 Flash não vence todos os benchmarks
O lançamento não é uma vitória limpa. No CharXiv sem ferramentas, o Gemini 3.7 Flash pontua 84,5% contra 85,2% para o 3.6 Flash; com ferramentas, pontua 88,7% contra 89,4%. Na tabela intercomparativa do Google, o GPT-5.6 Terra também permanece à frente em algumas avaliações de codificação e terminal. É por isso que uma tabela de benchmark deve ser usada para identificar cargas de trabalho promissoras, não para declarar um vencedor universal.
Há também uma pequena diferença de relatório que vale a pena notar: o artigo de lançamento do Google arredonda o resultado do Gemini 3.6 Flash DeepSWE para 49,0%, enquanto a ficha detalhada do modelo DeepMind lista 48,6%. Este artigo usa o valor mais preciso da ficha do modelo na tabela de comparação.

Fonte: blog.google
Preços do Gemini 3.7 Flash
O Gemini 3.7 Flash tem um cronograma de preços por tempo limitado. As taxas introdutórias atuais vão até 31 de dezembro de 2026. A documentação de preços do Google dobra as taxas de tokens em 1º de janeiro de 2027.
| Opção de consumo | Entrada / 1M de tokens até 31 de dezembro de 2026 | Saída / 1M de tokens até 31 de dezembro de 2026 | Entrada / saída a partir de 1º de janeiro de 2027 |
|---|---|---|---|
| Pago padrão | $0.75 | $3.75 | $1.50 / $7.50 |
| Em lote | $0.375 | $1.875 | $0.75 / $3.75 |
| Flex | $0.375 | $1.875 | $0.75 / $3.75 |
| Prioridade | $1.35 | $6.75 | $2.70 / $13.50 |
A precificação de saída inclui tokens de pensamento. O cache de contexto padrão custa US$ 0,075 por milhão de tokens em cache durante o período introdutório, mais US$ 0,50 por milhão de tokens por hora para armazenamento em cache; essas taxas também dobram em 2027. A base de dados do Google Search e a base de dados do Google Maps podem adicionar cobranças separadas após a cota mensal compartilhada descrita na documentação de preços do Google.
A API padrão também tem um nível gratuito listado como gratuito. Isso não deve ser tratado como capacidade de produção garantida: os limites de taxa dependem do modelo, projeto, nível de uso e status da conta, e o Google afirma explicitamente que os limites publicados não são garantidos. Para cargas de trabalho de produção pagas, os custos do modelo são apenas uma parte do orçamento; a base de dados, APIs externas, armazenamento e etapas de agente falhas ou repetidas podem alterar o total.
Exemplos de custos da API padrão
| Uso de tokens mensal | Custo estimado até 31 de dezembro de 2026 | Custo estimado a partir de 1º de janeiro de 2027 |
|---|---|---|
| 10M de entrada + 2M de saída | $15.00 | $30.00 |
| 50M de entrada + 5M de saída | $56.25 | $112.50 |
| 100M de entrada + 20M de saída | $150.00 | $300.00 |
Estes exemplos incluem apenas tokens de entrada e saída do modelo. Eles não incluem base de dados, armazenamento em cache, serviços externos ou infraestrutura de aplicação.
Disponibilidade da API Gemini 3.7 Flash
O Gemini 3.7 Flash não é um anúncio apenas para pré-visualização. O Google Cloud lista gemini-3.7-flash como GA com data de lançamento em 13 de agosto de 2026, e a documentação da API Gemini identifica a mesma string como a versão estável do modelo.
| Grupo de usuários | Onde o Gemini 3.7 Flash está disponível | Detalhe importante |
|---|---|---|
| Desenvolvedores de API | API Gemini e Google AI Studio | Use o ID de modelo estável gemini-3.7-flash |
| Desenvolvedores Android | Android Studio | O Google lista o Android Studio como uma superfície de lançamento para desenvolvedores |
| Desenvolvedores de agentes | Google Antigravity | Projetado para codificação com foco em agentes e fluxos de trabalho de várias etapas |
| Empresas | Plataforma de Agentes Gemini Enterprise e aplicativo Gemini Enterprise | Aplicam-se governança corporativa, faturamento e controles regionais |
| Indivíduos | Gemini Spark no aplicativo Gemini | O Google afirma que o Spark usa 3.7 Flash para assinantes do Google AI Pro e Ultra em mais de 160 países suportados |
Para desenvolvedores que ainda não configuraram o acesso, o guia de chave da API Gemini da Zerlo cobre a configuração do Google AI Studio. Assim que o acesso estiver pronto, a mudança crítica de implantação é o identificador do modelo; a migração de produção ainda deve incluir testes de regressão para ferramentas, esquemas, latência e uso total de tokens.

Fonte: pexels.com
Limites de taxa são específicos do projeto
Não há um único número de Gemini 3.7 Flash RPM ou TPM que se aplique a todas as contas. O Google mede os limites usando requisições por minuto, tokens por minuto e requisições por dia, aplica-os por projeto em vez de por chave de API, e os ajusta por nível de uso e status da conta. O Google recomenda verificar os limites ativos para o projeto diretamente no AI Studio. O tráfego em lote tem limites separados; por exemplo, a fila de lote Nível 1 documentada permite 3.000.000 de tokens enfileirados para Gemini 3.7 Flash.
Janela de contexto, modalidades e ferramentas suportadas
O envelope da API principal é familiar para qualquer pessoa que já esteja usando o 3.6 Flash: um contexto de entrada de 1.048.576 tokens e uma saída de texto máxima de 65.536 tokens. O modelo pode ingerir texto, imagens, vídeo, áudio e documentos PDF, mas não gera imagens ou áudio por si só.
| Capacidade | Status no Gemini 3.7 Flash |
|---|---|
| Cache | Suportado |
| Execução de código | Suportado |
| Uso do computador | Suportado em Preview |
| Pesquisa de arquivos | Suportado |
| Chamada de função | Suportado |
| Ancoragem de pesquisa do Google | Suportado |
| Ancoragem do Google Maps | Suportado |
| Saídas estruturadas | Suportado |
| Contexto de URL | Suportado |
| Níveis de pensamento | Baixo, médio e alto |
| API ao vivo | Não suportado |
| Geração de imagem | Não suportado |
| Geração de áudio | Não suportado |
Uma armadilha de migração é a configuração de pensamento. O Gemini 3.7 Flash suporta baixo, médio e alto. O Google Cloud documenta médio como padrão em sua Plataforma de Agentes Empresariais, enquanto a configuração mínima explícita retorna um erro de validação. Aplicações que anteriormente usavam uma configuração mínima devem mapear esse comportamento para um nível suportado e reavaliar a latência e a qualidade da saída.

Fonte: pexels.com
O que as mudanças significam na prática
Para agentes de codificação
O Gemini 3.7 Flash tem a história de atualização mais forte quando uma aplicação faz codificação de longo alcance em vez de trechos isolados. Os ganhos do DeepSWE, FrontierCode e Terminal-bench apontam na mesma direção: o modelo é mais capaz de continuar em tarefas de engenharia multi-etapas. O Google também diz que é mais disciplinado em se adaptar a obstáculos e esclarecer intenções, o que pode importar quando um agente tem permissão para editar arquivos ou chamar ferramentas repetidamente.
Para fluxos de trabalho de documentos e conhecimento
A janela de contexto de um milhão de tokens permanece inalterada, mas a qualidade do trabalho em material denso parece melhorar nas avaliações de lançamento. Isso torna o 3.7 Flash um candidato mais forte para relatórios anuais, pipelines de documentos legais, literatura científica, bases de conhecimento internas e fluxos de trabalho mistos de PDF. Uma janela de contexto enorme não é o mesmo que recuperação perfeita, embora; sistemas de recuperação, Pesquisa de Arquivos e segmentação de prompts ainda podem ser mais confiáveis e baratos do que enviar tudo em todas as requisições.
Para desenvolvimento web
O Google destaca uma precisão de código de primeira passada mais forte, layouts mais funcionais e menos prompts para chegar a aplicativos com recursos completos. A pontuação Elo de 1588 do Code Arena é o indicador publicado mais claro. As equipes ainda devem avaliar a aderência ao design, o comportamento do navegador, a acessibilidade e as convenções específicas do framework em sua própria base de código, pois um benchmark web agregado não pode representar todas as pilhas de front-end.
Para tarefas simples de alto volume
Não assuma que o 3.7 Flash deva substituir todos os modelos mais baratos. Se a carga de trabalho for classificação, extração ou transformação de modelos em volume muito alto, um modelo Flash-Lite ainda pode vencer em custo e throughput. O propósito do 3.7 Flash é impulsionar um raciocínio mais forte e um desempenho de agente para o nível Flash, não se tornar a opção de menor custo para todas as requisições.
Você deve migrar do Gemini 3.6 Flash?
| Carga de trabalho | Direção recomendada | Por quê |
|---|---|---|
| Agente de codificação em nível de repositório | Teste intensamente o 3.7 Flash | Grandes ganhos publicados no DeepSWE e FrontierCode |
| Automação de processos de negócios | Teste o 3.7 Flash | O AutomationBench melhora de 17,0% para 30,4% |
| Análise de PDF e documentos | Teste o 3.7 Flash | Melhores resultados de GDP.pdf e de contexto longo |
| Pipeline existente estável do 3.6 Flash | Benchmarking antes de mudar | As taxas de token introdutórias atuais são as mesmas, portanto, a qualidade, a latência e o custo da tarefa devem decidir |
| Extração simples de alto volume | Compare com Flash-Lite | Um modelo mais leve ainda pode ter um melhor perfil de throughput/custo |
| Aplicação de voz em tempo real | Use um modelo compatível com API ao vivo | O Gemini 3.7 Flash não suporta API ao vivo |
| Geração de imagem ou áudio | Use outro modelo | O 3.7 Flash produz saída de texto, não imagens ou áudio gerados |
Lista de verificação de migração para Gemini 3.7 Flash
- Altere o modelo de destino para
gemini-3.7-flashem um ambiente de staging primeiro. - Revise a configuração de pensamento. Não envie
minimal; escolha baixo, médio ou alto. - Reexecute os testes de chamada de função, validação de saída estruturada e verificações de permissão de ferramenta.
- Teste fluxos de trabalho de longo contexto e PDF com os mesmos documentos representativos usados em produção.
- Meça a conclusão bem-sucedida da tarefa, latência, tokens de entrada, tokens de saída e de pensamento, novas tentativas, turnos e chamadas de ferramenta.
- Inclua cobranças de ancoragem e cache ao comparar o custo total por tarefa.
- Implante gradualmente e mantenha um caminho de reversão testado para o modelo de produção existente.
Limitações a serem observadas
A ficha do modelo do Google DeepMind lista as limitações padrão dos modelos de fundação, incluindo alucinações, e observa que lentidão ocasional ou problemas de tempo limite podem ocorrer. Ela dá ao Gemini 3.7 Flash um corte de conhecimento em março de 2026, ao mesmo tempo em que adverte que alguns domínios podem efetivamente ser limitados a janeiro de 2025. Portanto, informações atuais ainda requerem ancoragem ou recuperação de fontes atualizadas quando a novidade é importante.
O uso do computador é marcado como Preview, portanto, as aplicações devem restringir permissões, validar ações e manter a confirmação humana para etapas consequentes. O modelo também carece de API ao vivo, geração de imagem e geração de áudio. Finalmente, o preço de lançamento atraente é explicitamente temporário; aplicações com uso significativo em 2027 devem orçar contra as taxas pós-promoção em vez de assumir que os preços de agosto de 2026 persistirão.Comparação técnica Gemini vs. Claude fornece contexto adicional. Como as gerações e os preços dos modelos mudam rapidamente, use a documentação atual do fornecedor para decisões de aquisição e compare os modelos exatos que você planeja implantar.
FAQ
Quando o Gemini 3.7 Flash foi lançado?
O Google anunciou e lançou o Gemini 3.7 Flash em 13 de agosto de 2026. O Google Cloud lista o modelo estável como geralmente disponível em vez de apenas preview.
Qual é o nome do modelo da API Gemini 3.7 Flash?
O identificador do modelo estável é gemini-3.7-flash. O Google lista este ID exato tanto na documentação do modelo da API Gemini quanto em sua documentação de modelos empresariais.
Quanto custa o Gemini 3.7 Flash?
Até 31 de dezembro de 2026, o uso padrão pago da API é de US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída, incluindo tokens de pensamento. A partir de 1º de janeiro de 2027, essas taxas aumentam para US$ 1,50 e US$ 7,50. Batch, Flex e Priority têm taxas separadas.
O Gemini 3.7 Flash é mais barato que o Gemini 3.6 Flash?
Não nas atuais taxas de token introdutórias. A ficha do modelo de agosto de 2026 do Google lista tanto o Gemini 3.6 Flash quanto o Gemini 3.7 Flash a US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída até 31 de dezembro de 2026. A redação de lançamento do Google "metade do custo" compara o 3.7 com o preço de lançamento original do 3.6 Flash.
O Gemini 3.7 Flash está disponível na API?
Sim. Ele está disponível através da API Gemini e do Google AI Studio com o ID de modelo estável gemini-3.7-flash. O Google também o distribui através de produtos Antigravity e Gemini empresariais.
Qual é a janela de contexto do Gemini 3.7 Flash?
O limite de tokens de entrada é de 1.048.576 tokens e a saída máxima é de 65.536 tokens. As entradas podem incluir texto, imagens, vídeo, áudio e documentos PDF; a saída é texto.
O Gemini 3.7 Flash suporta a Live API?
Não. A documentação do modelo do Google marca a Live API como não suportada. Aplicações que requerem interação de voz em tempo real nativa devem escolher um modelo compatível com a Live API.
O Gemini 3.7 Flash é melhor que o Gemini 3.6 Flash?
As avaliações publicadas pelo Google mostram melhorias substanciais em vários benchmarks de codificação, automação, PDF, contexto longo e uso de computador, mas nem todos os benchmarks melhoram. A resposta prática depende da carga de trabalho, meta de latência, comportamento da ferramenta e custo por tarefa bem-sucedida, portanto, as equipes de produção devem realizar suas próprias avaliações representativas.
Conclusão
O Gemini 3.7 Flash é uma atualização significativa para a parte da família Flash que mais importa para os desenvolvedores: codificação multi-etapa, agentes, automação e fluxos de trabalho com muitos documentos. As melhorias mais fortes publicadas pelo Google não são pequenos avanços em placares; DeepSWE sobe de 48,6% para 65,3%, AutomationBench de 17,0% para 30,4% e GDP.pdf de 22,0% para 34,0%, enquanto o modelo mantém a mesma janela de contexto de um milhão de tokens e o amplo suporte de ferramentas Gemini.
A história dos preços é igualmente importante. O uso padrão da API é temporariamente de US$ 0,75 por milhão de tokens de entrada e US$ 3,75 por milhão de tokens de saída, mas essas taxas dobram em 1º de janeiro de 2027. Para equipes que já utilizam o Gemini 3.6 Flash, a melhor razão para migrar é, portanto, um melhor desempenho de tarefa pelo mesmo preço introdutório atual por token, não um corte permanente de preço. Teste o 3.7 Flash em cargas de trabalho reais, inclua custos de ferramenta e retentativas e tome a decisão de migração com base no custo e confiabilidade da tarefa bem-sucedida, em vez do nome do modelo sozinho.