I punti vengono da un modello di Bradley-Terry bayesiano. È la stessa idea dell’Elo degli scacchi: +100 punti vuol dire vincere il 64% dei confronti. Il riferimento è Claude Opus 5.5 in Claude Code a sforzo high, e vale 0 punti. Per ogni configurazione riportiamo l’intervallo al 95% e P(meglio). P(meglio) è la probabilità di essere migliore del riferimento su quel tipo di lavoro.
Il giudice vede l’incarico, il materiale di partenza, un brief di qualità scritto prima e le due consegne. Le consegne sono etichettate 1 e 2. Non vede mai la soluzione attesa né il nome dell’autore. Legge fino a 600.000 caratteri per lato. Prima di giudicare misuriamo che cosa gli arriva davvero.
Il giudice risponde in un formato fisso: la preferenza, la preferenza su ogni dimensione del brief, gli errori di ciascuna consegna con il punto che li prova.
Il segnale più robusto contro i pregiudizi dei giudici sono le concessioni. Sono le dimensioni su cui il giudice della famiglia che perde dà ragione all’altra.
Il rumore fra due esecuzioni della stessa configurazione è grande. Viene quasi tutto dal modello che genera, non dal giudice.
Ogni agente legge da sé un file di istruzioni diverso: Claude Code legge CLAUDE.md, Codex legge AGENTS.md. Nel banco le istruzioni del repository stanno sotto tutti e due i nomi.
Il primo round comprendeva anche un modello piccolo della generazione precedente. Serviva da fondo della scala. Nel secondo round il suo posto lo prende Claude Haiku 5.5. È uscito il 7 ottobre.