Immagine AI

Un test condotto da Mercor su attività contabili strutturate ha mostrato che Claude Opus 5 ha raggiunto un’accuratezza prossima al 100%, mentre un gruppo di commercialisti e contabili professionisti ha ottenuto in media il 37%. La valutazione ha coinvolto 12 professionisti in possesso della qualifica CPA, con un’esperienza media di circa cinque anni e mezzo, ai quali sono stati assegnati compiti costruiti sulla base di scenari simili a quelli affrontati durante una chiusura contabile mensile. Le attività richiedevano di individuare valori all’interno dei documenti, eseguire calcoli, seguire istruzioni molto precise e produrre tabelle e risultati finali coerenti. In fase di progettazione del benchmark, i ricercatori avevano previsto punteggi intorno al 30% per figure junior e circa al 55% per profili intermedi, ma il risultato reale dei professionisti si è fermato mediamente al 37%. Il divario rispetto ai modelli di fascia più alta è risultato particolarmente evidente anche perché, secondo Mercor, soltanto 18 mesi prima nessun sistema AI riusciva a raggiungere il livello medio ottenuto dagli esseri umani nello stesso tipo di compito. Nel maggio 2024 GPT-4o aveva ottenuto un risultato vicino allo 0%, mentre nel maggio 2025 o3 aveva già superato la media dei professionisti; con i modelli più recenti il benchmark è arrivato sostanzialmente a saturazione, almeno per questa specifica categoria di attività.

Il vantaggio osservato riguarda anche tempi e costi. I partecipanti umani hanno impiegato generalmente tra 30 e 180 minuti per completare ciascun incarico, mentre i modelli più avanzati hanno terminato tutti i task in meno di dieci minuti. Mercor ha inoltre calcolato il costo necessario per soddisfare ciascun criterio di valutazione: per l’AI il valore medio è risultato pari a circa 0,21 dollari, contro 10,35 dollari per un professionista remunerato sulla base dello stipendio medio statunitense, con una differenza di circa cinquanta volte. Il progresso non è però distribuito uniformemente tra tutti i modelli. Sistemi open source o a basso costo come Qwen3.5-122B continuano infatti a posizionarsi al di sotto della media dei professionisti, evidenziando una crescente differenziazione tra i modelli di frontiera e quelli meno costosi. Il dato non indica quindi che qualsiasi sistema AI sia ormai in grado di svolgere attività contabili complesse con precisione quasi perfetta, ma mostra piuttosto che la fascia più avanzata dei modelli ha raggiunto prestazioni molto elevate su task fortemente strutturati, caratterizzati da ricerca puntuale nei file, calcoli e rispetto rigoroso di istruzioni dettagliate.

I ricercatori hanno però sottolineato che le condizioni del test erano in parte sfavorevoli ai professionisti umani. Il benchmark era stato costruito con una modalità di valutazione estremamente rigida, nella quale anche la mancata individuazione di un solo valore o di una singola indicazione poteva generare più penalizzazioni, e i partecipanti lavoravano in un ambiente completamente isolato, senza poter chiedere aiuto ai colleghi né utilizzare il contesto accumulato normalmente all’interno di un’azienda. Uno dei contabili coinvolti ha osservato che le variabili e i problemi erano realistici, ma che l’assenza totale di comunicazione esterna e il sistema di scoring particolarmente severo avevano inciso in maniera significativa sui risultati. Lo stesso team di ricerca ha quindi precisato che il benchmark non dimostra che i contabili debbano essere sostituiti dall’AI: le prove erano concentrate soprattutto su attività strutturate e meticolose, come individuazione delle informazioni, elaborazione di file e applicazione precisa delle istruzioni, mentre non misuravano componenti importanti del lavoro reale come il dialogo con il cliente, la capacità di formulare le domande corrette, l’interpretazione di informazioni incomplete o il recupero di contesto implicito attraverso colleghi e procedure aziendali.

Il risultato viene invece utilizzato da Mercor per evidenziare un cambiamento nel modo in cui dovrebbero essere costruiti i benchmark per l’intelligenza artificiale. Finora molte valutazioni hanno cercato soprattutto di stabilire quanto bene un modello riuscisse a replicare un’attività svolta normalmente da un essere umano, utilizzando la prestazione professionale come riferimento massimo. Quando però un sistema raggiunge o supera stabilmente quel livello nelle attività strutturate, questo tipo di benchmark perde progressivamente capacità discriminante. I ricercatori propongono quindi di spostare l’attenzione verso incarichi che un professionista potrebbe teoricamente eseguire ma che, nella pratica, risultano troppo costosi, lenti o dettagliati per essere svolti sistematicamente su larga scala. In quest’ottica il valore dell’AI non consisterebbe soltanto nel sostituire una determinata attività umana, ma anche nel rendere praticabili analisi e controlli che fino a oggi venivano omessi perché richiedevano quantità di tempo e lavoro non sostenibili. Il benchmark contabile diventa così un esempio di questa transizione: dai test che misurano quanto l’AI riesca ad avvicinarsi alle prestazioni umane a valutazioni pensate per capire quali attività nuove possano diventare economicamente e operativamente possibili grazie alla drastica riduzione di tempi e costi.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy