Gemini 3.7 Flash: Benchmark, Prezzi, Disponibilità API e Cosa è Cambiato

Avatar
Lisa Ernst · 17.08.2026 · Intelligenza Artificiale · 15 minuti di lettura

Google ha rilasciato Gemini 3.7 Flash il 13 agosto 2026, solo tre settimane dopo Gemini 3.6 Flash. L'aggiornamento è mirato specificamente alla codifica, ai flussi di lavoro agentivi, allo sviluppo web e al lavoro di conoscenza intensivo su documenti, con Google che pubblica guadagni sostanziali rispetto a 3.6 Flash su diversi benchmark di ingegneria del software e automazione.

La parte insolita sono i prezzi: Gemini 3.7 Flash viene lanciato a $0,75 per milione di token di input e $3,75 per milione di token di output sull'API a pagamento standard fino al 31 dicembre 2026. Queste tariffe sono temporanee e raddoppiano il 1° gennaio 2027. Questa guida spiega i risultati dei benchmark, la disponibilità dell'API, i limiti del modello, gli strumenti supportati, i livelli di prezzo e le differenze pratiche rispetto a Gemini 3.6 Flash.

Punti chiave

Gemini 3.7 Flash in sintesi

Specifiche Gemini 3.7 Flash
Data di rilascio 13 agosto 2026
Fase di lancio Generalmente disponibile (GA)
ID modello API stabile gemini-3.7-flash
Modalità di input Testo, immagine, video, audio e PDF
Modalità di output Testo
Limite token di input 1.048.576 token
Output massimo 65.536 token
Livelli di pensiero Basso, medio e alto; minimo non supportato
Prezzo API standard a pagamento fino al 31/12/2026 $0,75 / 1 milione di token di input; $3,75 / 1 milione di token di output

Cos'è Gemini 3.7 Flash?

Gemini 3.7 Flash è la prossima iterazione della famiglia Gemini 3 Flash di Google. Google DeepMind afferma che si basa su Gemini 3.6 Flash e aggiunge miglioramenti algoritmici alla base di ragionamento principale del modello. Il posizionamento è diventato anche più esplicito: Google chiama 3.7 Flash il suo "cavallo di battaglia" primario per la codifica e gli agenti, piuttosto che un modello progettato semplicemente per massimizzare il throughput grezzo.

Questa distinzione è importante. I modelli Flash sono stati tradizionalmente scelti perché sono più veloci ed economici dei modelli di ragionamento più grandi. Con il 3.7, Google sta cercando di spostare più lavoro multi-step in quella fascia di costo-efficacia: codifica a livello di repository, interazione con browser o computer, chiamata di funzioni, elaborazione complessa di documenti e flussi di lavoro aziendali che richiedono diverse chiamate di strumenti prima che una risposta sia completa.

Se provieni dal predecessore, la panoramica di Gemini 3.6 Flash di Zerlo fornisce il contesto di lancio per il modello precedente. L'importante aggiornamento ora è che 3.7 Flash mantiene la stessa finestra di contesto di un milione di token e un ampio set di strumenti, aumentando al contempo le prestazioni su molte delle valutazioni di agenti e codifica pubblicate da Google.Panoramica di Gemini 3.6 Flashfornisce il contesto di lancio per il modello precedente. L'importante aggiornamento ora è che 3.7 Flash mantiene la stessa finestra di contesto di un milione di token e un ampio set di strumenti, aumentando al contempo le prestazioni su molte delle valutazioni di agenti e codifica pubblicate da Google.

Cosa è cambiato rispetto a Gemini 3.6 Flash?

Area Modifica di Gemini 3.7 Flash Effetto pratico
Codifica Punteggi più alti su FrontierCode, DeepSWE e Terminal-bench Caso più solido per il lavoro su repository, debugging e agenti di codifica di lunga durata
Sviluppo web Code Arena sale da 1538 a 1588 Elo nella scheda modello di Google Migliori prestazioni pubblicate su layout funzionali e attività web complete di funzionalità
Automazione aziendale AutomationBench sale dal 17,0% al 30,4% Più promettente per flussi di lavoro che combinano ragionamento, strumenti e sistemi aziendali
Ragionamento su documenti GDP.pdf sale dal 22,0% al 34,0% Risultato pubblicato migliorato per lavori di conoscenza complessi basati su PDF
Contesto lungo GDM-MRCR v2 a 128k sale dal 91,8% al 97,0% Migliore recupero e ragionamento su input lunghi in quella valutazione
Comportamento dello sviluppatore Google afferma che il modello si adatta meglio agli ostacoli, chiarisce l'intento e segue le istruzioni in modo più fedele Potenzialmente meno ritentativi e meno supervisione manuale nei flussi di lavoro multi-step
Prezzi 3.7 viene lanciato a una tariffa temporanea di $0,75 input / $3,75 output per 1 milione di token Costo a breve termine inferiore rispetto alla tariffa di lancio originale di 3.6, sebbene 3.6 sia ora sulla stessa tariffa temporanea

L'ultima riga è facile da fraintendere. Google descrive Gemini 3.7 Flash come lanciato a metà del costo originale di Gemini 3.6 Flash. Tuttavia, la scheda modello attuale di Google elenca sia 3.6 Flash che 3.7 Flash a $0,75 input e $3,75 output per milione di token sotto la stessa promozione temporanea. Quindi 3.7 non è attualmente più economico per token standard rispetto a 3.6; il confronto è rispetto ai prezzi di lancio originali di 3.6.

Benchmark di Gemini 3.7 Flash

La scheda modello di agosto 2026 di Google pubblica un ampio set di benchmark che copre ingegneria del software, uso di terminali agentivi, automazione aziendale, lavoro di conoscenza, PDF, contesto lungo, uso di computer e ragionamento scientifico. I numeri seguenti confrontano Gemini 3.7 Flash con Gemini 3.6 Flash utilizzando i valori in quella scheda modello.

Benchmark Cosa misura Gemini 3.6 Flash Gemini 3.7 Flash
Indice di Intelligenza di Analisi Artificiale Intelligenza del modello composito 52 56
FrontierCode 1.1 Principale Qualità del codice di produzione 34.4% 43.6%
DeepSWE v1.1 Ingegneria del software a lungo orizzonte 48.6% 65.3%
Code Arena Sviluppo web 1538 Elo 1588 Elo
Terminal-bench 2.1 Codifica del terminale agentivo 78.0% 85.8%
AutomationBench Automazione dei flussi di lavoro aziendali 17.0% 30.4%
GDP.pdf Comprensione esperta di PDF 22.0% 34.0%
GDM-MRCR v2 a 128k Recupero e ragionamento a lungo contesto 91.8% 97.0%
OSWorld-2.0 Uso del computer agentivo 33.8% 47.9%
Tabella di benchmark di Google che confronta Gemini 3.7 Flash con Gemini 3.6 Flash e altri modelli di intelligenza artificiale

Fonte: blog.google

La tabella di valutazione di Google di agosto 2026 mostra guadagni particolarmente ampi di 3.7 Flash nell'ingegneria del software a lungo orizzonte, nell'automazione dei flussi di lavoro aziendali, nella comprensione dei documenti e nell'uso del computer. I benchmark misurano diversi carichi di lavoro e non dovrebbero essere combinati in un unico punteggio universale.

Dove i guadagni sono più forti

Il movimento più chiaro si osserva nei carichi di lavoro che richiedono al modello di continuare a lavorare piuttosto che rispondere una sola volta. DeepSWE passa dal 48,6% al 65,3%, mentre AutomationBench passa dal 17,0% al 30,4%. Ciò supporta l'affermazione di Google secondo cui il modello è più utile per gli agenti che devono pianificare, chiamare strumenti, ispezionare i risultati e recuperare dagli ostacoli.

Anche il lavoro sui documenti migliora in modo sostanziale nei dati pubblicati da Google. GDP.pdf passa dal 22,0% al 34,0%, e l'azienda evidenzia specificamente finanza, legge e bioscienze come domini ad alta densità di conoscenza in cui si aspetta un migliore ragionamento. Ciò non significa che il modello possa sostituire la revisione di esperti in lavori regolamentati o ad alto rischio; significa che il risultato del benchmark è materiale più alto di 3.6 Flash sui compiti testati.

3.7 Flash non vince ogni benchmark

Il rilascio non è una vittoria netta. Su CharXiv senza strumenti, Gemini 3.7 Flash ottiene l'84,5% contro l'85,2% di 3.6 Flash; con strumenti ottiene l'88,7% contro l'89,4%. Nella tabella cross-model di Google, GPT-5.6 Terra rimane anche avanti su alcune valutazioni di codifica e terminale. Questo è il motivo per cui una tabella di benchmark dovrebbe essere utilizzata per identificare carichi di lavoro promettenti, non per dichiarare un vincitore universale.

C'è anche una piccola differenza di segnalazione degna di nota: l'articolo di lancio di Google arrotonda il risultato DeepSWE di Gemini 3.6 Flash al 49,0%, mentre la scheda modello DeepMind dettagliata elenca il 48,6%. Questo articolo utilizza il valore più preciso della scheda modello nella tabella di confronto.

Grafico costo-prestazioni di Google per Gemini 3.7 Flash su DeepSWE v1.1

Fonte: blog.google

Google inquadra anche il rilascio attorno al costo per attività di ingegneria del software completata, non solo al prezzo per token. Questa è la metrica di produzione corretta per gli agenti: ritentativi, token di ragionamento e chiamate ripetute agli strumenti possono contare più della tariffa token principale.

Prezzi di Gemini 3.7 Flash

Gemini 3.7 Flash ha un programma di prezzi a tempo limitato. Le attuali tariffe introduttive sono valide fino al 31 dicembre 2026. La documentazione sui prezzi di Google raddoppia quindi le tariffe dei token il 1° gennaio 2027.

Opzione di consumo Input / 1 milione di token fino al 31 dicembre 2026 Output / 1 milione di token fino al 31 dicembre 2026 Input / output dal 1° gennaio 2027
Pagato standard $0.75 $3.75 $1.50 / $7.50
Batch $0.375 $1.875 $0.75 / $3.75
Flex $0.375 $1.875 $0.75 / $3.75
Priorità $1.35 $6.75 $2.70 / $13.50

I prezzi di output includono i token di pensiero. La cache del contesto standard costa $0,075 per milione di token memorizzati nella cache durante il periodo introduttivo, più $0,50 per milione di token all'ora per lo storage della cache; queste tariffe raddoppiano anche nel 2027. Il grounding di Google Search e il grounding di Google Maps possono comportare costi aggiuntivi dopo la quota mensile condivisa descritta nella documentazione dei prezzi di Google.

La Standard API ha anche un livello gratuito indicato come gratuito. Ciò non deve essere trattato come capacità di produzione garantita: i limiti di frequenza dipendono dal modello, dal progetto, dal livello di utilizzo e dallo stato dell'account, e Google afferma esplicitamente che i limiti pubblicati non sono garantiti. Per i carichi di lavoro di produzione a pagamento, i costi del modello sono solo una parte del budget; il grounding, le API esterne, lo storage e i passaggi dell'agente falliti o ripetuti possono modificare il totale.

Esempi di costi della Standard API

Utilizzo mensile dei token Costo stimato fino al 31 dicembre 2026 Costo stimato dal 1° gennaio 2027
10 milioni di input + 2 milioni di output $15.00 $30.00
50 milioni di input + 5 milioni di output $56.25 $112.50
100 milioni di input + 20 milioni di output $150.00 $300.00

Questi esempi includono solo i token di input e output del modello. Non includono grounding, storage della cache, servizi esterni o infrastruttura applicativa.

Disponibilità API Gemini 3.7 Flash

Gemini 3.7 Flash non è un annuncio in anteprima. Google Cloud elenca gemini-3.7-flash come GA con data di rilascio del 13 agosto 2026, e la documentazione API di Gemini identifica la stessa stringa come la versione stabile del modello.

Gruppo di utenti Dove è disponibile Gemini 3.7 Flash Dettaglio importante
Sviluppatori API API Gemini e Google AI Studio Utilizza l'ID del modello stabile gemini-3.7-flash
Sviluppatori Android Android Studio Google elenca Android Studio come superficie di lancio per gli sviluppatori
Sviluppatori di agenti Google Antigravity Progettato per la codifica incentrata sull'agente e flussi di lavoro multi-step
Aziende Gemini Enterprise Agent Platform e app Gemini Enterprise Si applicano governance aziendale, fatturazione e controlli regionali
Individui Gemini Spark nell'app Gemini Google afferma che Spark utilizza 3.7 Flash per gli abbonati a Google AI Pro e Ultra in oltre 160 paesi supportati

Per gli sviluppatori che non hanno ancora configurato l'accesso, la guida alle chiavi API di Gemini di Zerlo guida alla chiave API Gemini copre la configurazione di Google AI Studio. Una volta che l'accesso è pronto, la modifica critica di distribuzione è l'identificatore del modello; la migrazione alla produzione dovrebbe comunque includere test di regressione per strumenti, schemi, latenza e utilizzo totale dei token.

Sviluppatore che lavora con codice sorgente su un laptop

Fonte: pexels.com

Passare a un nuovo ID modello è la parte facile. La migrazione più sicura consiste nel testare attività di codifica e agenti rappresentative in staging, registrare il successo del compito, la latenza, l'utilizzo dei token, i ritentativi e le chiamate agli strumenti, e solo allora spostare il traffico di produzione.

I limiti di frequenza sono specifici del progetto

Non esiste un singolo numero RPM o TPM di Gemini 3.7 Flash che si applica a ogni account. Google misura i limiti utilizzando richieste al minuto, token al minuto e richieste al giorno, li applica per progetto piuttosto che per chiave API e li adatta in base al livello di utilizzo e allo stato dell'account. Google consiglia di controllare i limiti attivi per il progetto direttamente in AI Studio. Il traffico batch ha limiti separati; ad esempio, la coda batch Tier 1 documentata consente 3.000.000 di token accodati per Gemini 3.7 Flash.

Finestra di contesto, modalità e strumenti supportati

L'involucro API principale è familiare a chiunque utilizzi già 3.6 Flash: un contesto di input di 1.048.576 token e un output di testo massimo di 65.536 token. Il modello può ingerire testo, immagini, video, audio e documenti PDF, ma non genera immagini o audio da solo.

Capacità Stato in Gemini 3.7 Flash
Caching Supportato
Esecuzione del codice Supportato
Uso del computer Supportato in anteprima
Ricerca file Supportato
Chiamata di funzione Supportato
Ancoraggio della Ricerca Google Supportato
Ancoraggio di Google Maps Supportato
Output strutturati Supportato
Contesto URL Supportato
Livelli di pensiero Basso, medio e alto
API Live Non supportato
Generazione di immagini Non supportato
Generazione audio Non supportato

Una trappola di migrazione è la configurazione del pensiero. Gemini 3.7 Flash supporta basso, medio e alto. La documentazione di Google Cloud indica medio come predefinito nella sua Enterprise Agent Platform, mentre impostare esplicitamente minimo restituisce un errore di convalida. Le applicazioni che in precedenza utilizzavano un'impostazione minima dovrebbero mappare tale comportamento a un livello supportato e rimisurare latenza e qualità dell'output.

Impiegati d'ufficio che revisionano documenti accanto a un laptop

Fonte: pexels.com

Gemini 3.7 Flash migliora i risultati pubblicati da Google su PDF e knowledge-work, che sono rilevanti per i flussi di lavoro a elevata densità di documenti. Un punteggio di benchmark più elevato non elimina il rischio di allucinazioni, quindi i fatti estratti importanti e le decisioni consequenziali necessitano ancora di verifica.

Cosa significano le modifiche in pratica

Per gli agenti di codifica

Gemini 3.7 Flash ha la storia di upgrade più forte quando un'applicazione esegue la codifica a lungo orizzonte anziché snippet isolati. I guadagni di DeepSWE, FrontierCode e Terminal-bench puntano tutti nella stessa direzione: il modello è più in grado di proseguire attraverso attività di ingegneria multi-step. Google afferma inoltre che è più disciplinato nell'adattarsi agli ostacoli e nel chiarire l'intento, il che può essere importante quando un agente ha il permesso di modificare file o chiamare strumenti ripetutamente.

Per flussi di lavoro di documenti e conoscenze

La finestra di contesto di un milione di token rimane invariata, ma la qualità del lavoro su materiale denso sembra migliorare nelle valutazioni di rilascio. Ciò rende 3.7 Flash un candidato più forte per i rapporti annuali, le pipeline di documenti legali, la letteratura scientifica, le basi di conoscenza interne e i flussi di lavoro PDF misti. Una finestra di contesto enorme non è la stessa cosa di un recupero perfetto, tuttavia; i sistemi di recupero, la ricerca di file e la segmentazione dei prompt possono ancora essere più affidabili ed economici rispetto all'invio di tutto a ogni richiesta.

Per lo sviluppo web

Google evidenzia una maggiore accuratezza del codice al primo passaggio, layout più funzionali e meno prompt per raggiungere applicazioni complete di funzionalità. Il punteggio Elo di 1588 di Code Arena è l'indicatore pubblicato più chiaro. I team dovrebbero comunque valutare l'aderenza al design, il comportamento del browser, l'accessibilità e le convenzioni specifiche del framework sul proprio codebase perché un benchmark web aggregato non può rappresentare ogni stack frontend.

Per attività semplici ad alto volume

Non dare per scontato che 3.7 Flash debba sostituire ogni modello più economico. Se il carico di lavoro è classificazione, estrazione o trasformazione con template ad altissimo volume, un modello Flash-Lite potrebbe ancora vincere per costo e throughput. Lo scopo di 3.7 Flash è spingere un ragionamento più forte e prestazioni agentive nel livello Flash, non diventare l'opzione più economica per ogni richiesta.

Dovresti migrare da Gemini 3.6 Flash?

Carico di lavoro Direzione raccomandata Perché
Agente di codifica a livello di repository Prova intensamente 3.7 Flash Grandi guadagni pubblicati su DeepSWE e FrontierCode
Automazione dei processi aziendali Prova 3.7 Flash AutomationBench migliora dal 17,0% al 30,4%
Analisi PDF e documenti Prova 3.7 Flash Risultati più alti su GDP.pdf e a lungo contesto
Pipeline esistente stabile con 3.6 Flash Esegui il benchmark prima di passare Le tariffe attuali dei token introduttivi sono le stesse, quindi qualità, latenza e costo del task dovrebbero decidere
Estrazione semplice ad alto volume Confronta con Flash-Lite Un modello più leggero potrebbe ancora avere un profilo throughput/costo migliore
Applicazione vocale in tempo reale Utilizza un modello compatibile con API Live Gemini 3.7 Flash non supporta API Live
Generazione di immagini o audio Usa un altro modello 3.7 Flash produce output di testo, non immagini o audio generati

Checklist di migrazione per Gemini 3.7 Flash

  1. Cambia il modello di destinazione in gemini-3.7-flash prima in un ambiente di staging.
  2. Rivedi la configurazione del pensiero. Non inviare minimal; scegli basso, medio o alto.
  3. Esegui nuovamente i test di chiamata di funzione, la convalida dell'output strutturato e i controlli delle autorizzazioni degli strumenti.
  4. Prova i flussi di lavoro a lungo contesto e PDF con gli stessi documenti rappresentativi utilizzati in produzione.
  5. Misura il completamento del task riuscito, la latenza, i token di input, i token di output e di pensiero, i tentativi, i turni e le chiamate agli strumenti.
  6. Includi i costi di grounding e caching quando confronti il costo totale per task.
  7. Distribuisci gradualmente e mantieni un percorso di rollback testato verso il modello di produzione esistente.

Limitazioni da tenere a mente

La scheda modello di Google DeepMind elenca le limitazioni standard dei modelli di fondazione, incluse le allucinazioni, e nota che occasionali problemi di lentezza o timeout possono verificarsi. Assegna a Gemini 3.7 Flash un cutoff di conoscenza di marzo 2026, avvertendo che alcuni domini potrebbero essere effettivamente limitati a gennaio 2025. Le informazioni attuali richiedono quindi ancora grounding o recupero da fonti aggiornate quando la freschezza è importante.

L'uso del computer è contrassegnato come Anteprima, quindi le applicazioni dovrebbero limitare le autorizzazioni, convalidare le azioni e mantenere la conferma umana per i passaggi consequenziali. Il modello manca inoltre di API Live, generazione di immagini e generazione di audio. Infine, gli allettanti prezzi di lancio sono esplicitamente temporanei; le applicazioni con un utilizzo significativo nel 2027 dovrebbero preventivare contro le tariffe post-promozione anziché presumere che i prezzi di agosto 2026 persisteranno.Confronto tecnico tra Gemini e Claude fornisce contesto aggiuntivo. Poiché le generazioni di modelli e i prezzi si muovono rapidamente, utilizzare la documentazione corrente del fornitore per le decisioni di approvvigionamento e confrontare i modelli esatti che si intende distribuire.

FAQ

Quando è stato rilasciato Gemini 3.7 Flash?

Google ha annunciato e rilasciato Gemini 3.7 Flash il 13 agosto 2026. Google Cloud elenca il modello stabile come generalmente disponibile anziché solo in anteprima.

Qual è il nome del modello API Gemini 3.7 Flash?

L'identificatore del modello stabile è gemini-3.7-flash. Google elenca questo ID esatto sia nella documentazione dei modelli API Gemini che nella sua documentazione sui modelli aziendali.

Quanto costa Gemini 3.7 Flash?

Fino al 31 dicembre 2026, l'uso dell'API Standard a pagamento costa $0,75 per milione di token di input e $3,75 per milione di token di output, inclusi i token di pensiero. A partire dal 1° gennaio 2027, tali tariffe aumenteranno a $1,50 e $7,50. Batch, Flex e Priority hanno tariffe separate.

Gemini 3.7 Flash è più economico di Gemini 3.6 Flash?

Non alle attuali tariffe introduttive per i token. La scheda modello di Google di agosto 2026 elenca sia Gemini 3.6 Flash che Gemini 3.7 Flash a $0,75 per milione di token di input e $3,75 per milione di token di output fino al 31 dicembre 2026. La formulazione di lancio di Google "metà costo" confronta 3.7 con il prezzo di lancio originale di 3.6 Flash.

Gemini 3.7 Flash è disponibile nell'API?

Sì. È disponibile tramite l'API Gemini e Google AI Studio con l'ID modello stabile gemini-3.7-flash. Google lo distribuisce anche tramite Antigravity e prodotti Gemini aziendali.

Qual è la finestra di contesto di Gemini 3.7 Flash?

Il limite di token di input è 1.048.576 token e l'output massimo è 65.536 token. Gli input possono includere testo, immagini, video, audio e documenti PDF; l'output è testo.

Gemini 3.7 Flash supporta l'API Live?

No. La documentazione dei modelli di Google indica che l'API Live non è supportata. Le applicazioni che richiedono interazione vocale nativa in tempo reale dovrebbero scegliere un modello compatibile con l'API Live.

Gemini 3.7 Flash è migliore di Gemini 3.6 Flash?

Le valutazioni pubblicate da Google mostrano miglioramenti sostanziali su diversi benchmark di codifica, automazione, PDF, contesto esteso e utilizzo del computer, ma non tutti i benchmark migliorano. La risposta pratica dipende dal carico di lavoro, dall'obiettivo di latenza, dal comportamento degli strumenti e dal costo per attività completata, pertanto i team di produzione dovrebbero eseguire le proprie valutazioni rappresentative.

In conclusione

Gemini 3.7 Flash è un aggiornamento significativo per la parte della famiglia Flash che conta di più per gli sviluppatori: codifica multi-step, agenti, automazione e flussi di lavoro con molti documenti. I migliori miglioramenti pubblicati da Google non sono piccoli aggiustamenti nelle classifiche; DeepSWE passa dal 48,6% al 65,3%, AutomationBench dal 17,0% al 30,4% e GDP.pdf dal 22,0% al 34,0%, mentre il modello mantiene la stessa finestra di contesto da un milione di token e il supporto generale degli strumenti Gemini.

La storia dei prezzi è altrettanto importante. L'utilizzo standard dell'API è temporaneamente di $0,75 per milione di token di input e $3,75 per milione di token di output, ma tali tariffe raddoppieranno il 1° gennaio 2027. Per i team già su Gemini 3.6 Flash, il motivo migliore per migrare è quindi una migliore performance delle attività all'attuale tariffa introduttiva per token, non un taglio permanente del prezzo. Testa 3.7 Flash su carichi di lavoro reali, includi i costi degli strumenti e dei ritentativi, e prendi la decisione di migrazione in base al costo e all'affidabilità per attività completata piuttosto che al solo nome del modello.

Condividi il nostro articolo!
Fonti