Google esce dal letargo con un modello che si prospetta veramente competitivo, ed era ora.
Negli ultimi mesi seguire i rilasci AI è diventato un lavoro a tempo pieno.
OpenAI esce con GPT-6 Astra, Anthropic risponde con Claude Opus 5.5, e a ogni modello arriva la contromossa.
Un ritmo da botta e risposta, con i benchmark usati come munizioni.
E Google? Google, nel frattempo, dormiva. O almeno così sembrava.
L'ultimo modello Pro, Gemini 3.1 Pro, è di febbraio.
Poi solo Flash: 3.5 Flash a maggio, 3.6 a luglio, 3.7 ad agosto, più una variante 3.8-Cyber. Aggiornamenti incrementali, utili ma poco eccitanti.
Il Gemini 3.5 Pro di cui si parlava per mesi non è mai arrivato. Mentre gli altri si davano battaglia sulla frontiera, Mountain View aggiungeva decimali.
Ma poi, il 30 settembre, arriva Gemini 4 Argon. E cavolo se si è fatto sentire!

La novità più vistosa è il limite di output: 1 milione di token, contro i 64K di prima.
In pratica il modello può ragionare e produrre su traiettorie lunghissime senza interrompersi, ed è proprio quello che serve agli agenti che lavorano per ore su un compito.
Google lo posiziona su tre fronti: software engineering, lavoro enterprise (legale, finanza, fisco) e cybersecurity.
Nel complesso Argon è in testa su 12 benchmark su 18. Ma su alcuni perde: su Terminal-Bench 4.0 Opus resta davanti, su FrontierSWE v2 vince Astra.

Ancora più interessante è l'uso interno.
Google dice di aver usato Argon per migrare da C++ a Rust oltre 800.000 righe del kernel Zircon di Fuchsia e per liberare 300 terabyte di memoria nei propri data center.
Qui il marketing c'entra poco: è il modello che fa manutenzione all'infrastruttura di chi lo ha costruito.

E sul fronte cyber?
Stando a Google, Argon è in grado di trovare, validare e correggere in autonomia vulnerabilità critiche.
Prima si cerca la falla, poi si verifica che sia sfruttabile, infine si scrive la patch: l'intero ciclo del lavoro di un security researcher.
Su CWE-bench v1, che misura la capacità di correggere vulnerabilità, ottiene il 68%, primo posto ma a pari merito con GPT-6 Astra e Grok 4.7.

Nella scoperta di vulnerabilità in 20 linguaggi supera Gemini 3.8 Flash Cyber, il modello specializzato che Google aveva rilasciato poco tempo fa.

Primo posto nel benchmark di penetration testing di Wiz, sia nella mappatura della superficie d'attacco sia nella validazione delle falle.
In testa sul benchmark di Gray Swan contro le indirect prompt injection, cioè le istruzioni malevole nascoste nei contenuti che un agente legge.

Il caso più citato arriva da Wiz, che usa Argon nel programma Scan for Good.
Il modello avrebbe trovato una vulnerabilità critica in un software ospedaliero usato in tutto il mondo, che esponeva dati personali e che i modelli di frontiera precedenti non avevano visto.
Quale software sia e se la falla sia stata corretta, però, non viene detto.
Ricapitolando: dove la cybersecurity si misura pubblicamente, Argon è in pareggio.
Dove dichiara un vantaggio, le prove sono interne, di un partner o anonimizzate.
Il prezzo, per ora, è $2 per milione di token in input e $10 in output, che a fine promozione raddoppiano.
Il problema è che, ad oggi, non lo può usare quasi nessuno.
Argon è disponibile solo per un gruppo di trusted cyber defenders tramite il Fairwind Program, più un accesso anticipato per il governo USA.
Inoltre, ai difensori e ai team interni di Google, Argon viene dato senza cyber guardrail, nella sua versione più capace.

Seguiranno i clienti API a pagamento e gli abbonati AI Ultra, as soon as possible. Ma una data non c'è.
Non è una prima volta.
Ad aprile Anthropic ha fatto lo stesso con Claude Mythos Preview: un modello presentato come troppo capace in ambito cyber per un rilascio pubblico, e quindi riservato a pochi partner.
Con Argon, Google conferma che questo è il nuovo modo di lanciare un modello di frontiera: annuncio oggi, rollout prudente, accesso graduale.
E la cosa si può leggere in due modi, entrambi veri.
Argon può essere davvero un salto, e il milione di token in output potrebbe cambiare il lavoro con gli agenti più di qualche punto percentuale in classifica.
Ma per ora abbiamo grafici e casi d'uso interni, scritti da chi vende il modello.
In ogni caso, il messaggio di Google arriva forte e chiaro: non era uscita dalla gara, stava solo aspettando di avere qualcosa di grosso da mostrare.
Che sia anche qualcosa di valido, lo vedremo quando arriverà nelle nostre mani.
Giacomo Ciarlini - CIO - Datapizza
Simone Conversano - AI Transformation & Marketing Specialist - Datapizza