giovedì 8 ottobre 2026

[AI] - Quando due agenti AI concordano e hanno entrambi torto

Un secondo agente AI che conferma il lavoro del primo può sembrare una garanzia. Uno produce una risposta, l’altro la controlla, entrambi arrivano alla stessa conclusione: dunque deve essere corretta.

Non necessariamente.

Il problema non è che due agenti siano inutili. Possono migliorare il lavoro, trovare omissioni e rendere più espliciti i dubbi. Il problema nasce quando il loro accordo viene trattato come una prova, pur senza verificare se i due abbiano ragionato davvero in modo indipendente e, soprattutto, se abbiano controllato fonti esterne affidabili.

L’accordo che sembra una verifica

Immaginiamo un caso semplice. Il primo agente riceve una documentazione incompleta e deduce che una tabella sia la sorgente corretta di un dato. Il secondo agente legge la stessa documentazione, riceve lo stesso prompt e trova plausibile la stessa deduzione.

Il risultato finale può apparire rassicurante:

  • Agente 1: “La sorgente è questa tabella.”
  • Agente 2: “Confermato.”

Ma nessuno dei due ha verificato il database, letto il SQL originario o confrontato il risultato con un caso reale. Il secondo agente non ha validato un fatto: ha validato la plausibilità della risposta del primo.

Due conferme non diventano una prova solo perché sono due.

Perché gli agenti possono sbagliare insieme

L’indipendenza non dipende dal numero di finestre aperte. Dipende da ciò che ciascun agente vede, dagli strumenti che usa e dalle fonti che può controllare.

Due agenti possono condividere:

  • lo stesso modello o modelli addestrati su fonti simili;
  • lo stesso prompt ambiguo;
  • lo stesso documento incompleto;
  • gli stessi dati obsoleti;
  • lo stesso errore iniziale presentato in modo convincente;
  • la stessa tendenza a completare un vuoto con una risposta plausibile.

In questi casi il secondo agente può diventare un amplificatore del primo. L’errore non viene corretto: riceve una seconda voce, una forma più ordinata e un’apparenza di consenso.

Questa è la parte più insidiosa: il fallimento non appare come conflitto. Appare come collaborazione riuscita.

Il dibattito tra agenti può aiutare, ma non è una garanzia

La ricerca sui sistemi multi-agente mostra che il confronto fra più modelli può migliorare alcuni compiti di ragionamento e ridurre certe risposte errate. Non è quindi ragionevole concludere che usare più agenti sia inutile.

Ma il beneficio non autorizza una scorciatoia: “se concordano, allora è vero”.

Un lavoro di ricerca più recente descrive proprio una “illusione di coerenza”: agenti che raggiungono la stessa risposta possono non condividere una catena di ragionamento coerente o dimostrabile. È una ricerca preliminare e non una regola universale, ma evidenzia un controllo utile: verificare non soltanto la risposta finale, bensì le evidenze che l’hanno prodotta. 

Il consenso, quindi, può essere un segnale da investigare. Non è il criterio di accettazione.

Come rendere utile il secondo agente

Un secondo agente deve avere un compito diverso dal primo.

Se il primo produce una bozza, il secondo non dovrebbe limitarsi a dire se la bozza “sembra corretta”. Dovrebbe lavorare come un revisore con esiti limitati e verificabili:

EsitoSignificato
ConfermatoLa fonte primaria dimostra l’affermazione.
Non dimostratoLa bozza afferma qualcosa che le fonti disponibili non provano.
In contrastoLa fonte dice qualcosa di diverso.
PropostaÈ una scelta progettuale, non un fatto estratto.

Il secondo agente deve ricevere le fonti originali, non solo il riassunto del primo. Deve poter segnalare una lacuna invece di essere spinto a raggiungere per forza una conclusione.

Meglio ancora se i due agenti hanno percorsi differenti:

  • il primo interpreta requisiti e prepara una soluzione;
  • il secondo confronta ogni affermazione con evidenze primarie;
  • uno script controlla elementi oggettivi, come nomi di tabelle, colonne, date, importi o riferimenti;
  • l’operatore decide sui punti che restano ambigui.

Questa separazione non elimina ogni errore, ma impedisce che il consenso sia scambiato per dimostrazione.

La verifica esterna resta indispensabile

Il punto non è diffidare dell’AI per principio. È attribuire a ogni controllo il valore che possiede davvero.

Un agente che conferma un altro agente può aumentare la qualità della revisione. Un controllo automatico può rilevare incongruenze ripetitive. Un test può dimostrare un comportamento specifico. Una fonte primaria può dimostrare un fatto.

Nessuno di questi elementi, da solo, prova tutto il resto.

Il NIST raccomanda una gestione del rischio AI continua, con attività di governo, mappatura, misurazione e gestione: l’affidabilità non deriva da un singolo segnale positivo, ma da controlli proporzionati al rischio. 

La domanda utile non è: “Quanti agenti sono d’accordo?”

È: “Quale evidenza indipendente dimostra che hanno ragione?”

Conclusione

Due agenti AI possono collaborare bene. Possono anche condividere lo stesso errore con una sicurezza raddoppiata.

Per questo un sistema affidabile non usa il secondo agente come timbro di approvazione. Lo usa per cercare contraddizioni, fonti mancanti, assunzioni nascoste e punti non dimostrati.

Quando due agenti concordano, il lavoro non è finito.

È il momento di chiedere: su quali prove?

Fonti consultate

  • NIST, Artificial Intelligence Risk Management Framework: Generative AI Profile, verificata l’8 ottobre 2026.
  • Du et al., Improving Factuality and Reasoning in Language Models through Multiagent Debate, 2023.
  • Wang e Yang, The Consistency Illusion: How Multi-Agent Debate Hides Reasoning Misalignment, preprint, 2026.

Nessun commento:

Posta un commento