Immagine AI

LlamaIndex ha reso disponibile OpenDocRouter, piattaforma hosted che espone attraverso una singola API differenti modelli frontier e open source destinati alla conversione di PDF e immagini in Markdown. Il servizio nasce per eliminare parte del lavoro ripetitivo necessario quando un team vuole sperimentare nuovi modelli documentali: individuare l’OCR o il VLM da utilizzare, creare i prompt appropriati, gestire deployment e rate limit, stimare il costo per pagina e ripetere benchmark ogni volta che viene pubblicato un modello più recente. OpenDocRouter raccoglie questi sistemi dietro uno stesso endpoint, applica a ciascuno una “parsing recipe” versionata e li sottopone allo stesso benchmark ParseBench, consentendo agli sviluppatori di selezionare il modello in funzione del compromesso desiderato fra accuratezza e costo senza modificare continuamente l’intera pipeline.

Al lancio sono presenti dieci modelli. I cinque frontier sono Claude Opus 5.5, Gemini 3 Flash, Gemini 3.8 Flash, GPT-5.6 Terra e GPT-6 Luna; quelli open source sono Infinity-Parser2-Flash, MinerU2.5-Pro, TeleOCR, dots.mocr e PaddleOCR-VL-1.6. ParseBench misura cinque dimensioni — Tables, Charts, Faithfulness, Formatting e Grounding — e calcola l’Overall come media delle cinque. Claude Opus 5.5 ottiene il punteggio complessivo più elevato fra i valori riportati, 84,20, con 93,53 sulle tabelle e 91,03 sulla fedeltà, ma il costo stimato è 48,82 dollari ogni 1.000 pagine. GPT-6 Luna raggiunge 71,34 a circa 0,80 dollari per 1.000 pagine, MinerU2.5-Pro 70,05 a 0,86 dollari e TeleOCR 57,25 a 2,70 dollari.

Il costo per mille pagine non rappresenta una tariffa fissa applicata a ogni documento, ma una stima costruita sul consumo medio di token dei documenti di ParseBench utilizzando i prezzi correnti di ciascun modello; pagine più dense o più semplici possono quindi produrre valori differenti. Le tabelle pubblicate sono datate 6 ottobre 2026. Anche le recipe hanno una propria versione: quando viene modificato un prompt, un parametro o un altro elemento capace di cambiare l’output, la versione viene aggiornata in modo da rendere riproducibile il parsing. Al momento del lancio Claude Opus 5.5 e GPT-5.6 Terra utilizzano recipe datate 25 settembre, mentre quella di GPT-6 Luna è del 5 ottobre. LlamaIndex prevede di valutare i nuovi modelli con ParseBench prima di aggiungerli al servizio e di continuare a ottimizzare quelli più utilizzati attraverso prompt migliori e hosting capace di ridurre la latenza.

L’endpoint principale è POST /v1/parse e accetta PDF, PNG e JPEG. Un documento può essere fornito attraverso un URL HTTPS pubblico oppure mediante un file precedentemente caricato, con limite di 50 MB o 500 pagine, mentre l’invio inline in base64 è limitato a circa 3 MB. Fino a 50 pagine il parsing può essere eseguito in modalità sincrona; per documenti più lunghi il processo diventa asincrono e può arrivare a 500 pagine, a condizione che venga abilitata la cache. Il parametro pages permette di elaborare soltanto parti specifiche, per esempio “1-3,7”, evitando di pagare nuovamente per pagine già disponibili. Ogni pagina viene trattata come chiamata indipendente quando si libera capacità e restituisce il proprio Markdown, stato e costo, per cui un errore non obbliga a riprocessare l’intero file.

La risposta complessiva può avere stato completed, partial oppure failed e riporta per ogni pagina anche il consumo di token. LlamaIndex distribuisce SDK tipizzati sia per Python sia per TypeScript, installabili rispettivamente tramite pip e npm, con repository open source dedicati e metodi che riflettono gli endpoint del servizio, tra cui parse.create, uploads.create, credits.get e models.list. Un elemento aggiuntivo è il grounding engine progettato per normalizzare informazioni che i differenti modelli gestiscono in modi incompatibili. Alcuni VLM restituiscono bounding box nativamente, altri soltanto se richiesti con prompt appropriati e altri ancora non dispongono di questa capacità. Impostando layout:true, OpenDocRouter aggiunge al Markdown bounding box e componenti di layout ordinati secondo la sequenza di lettura.

Le classi normalizzate comprendono title, section_header, text, list_item, table, picture, chart, formula, caption, footnote, page_header, page_footer, code, form e key_value. Le coordinate vengono espresse come frazioni della pagina misurate partendo dall’angolo superiore sinistro e ciascun elemento dispone di un valore di confidence. Se l’estrazione del layout fallisce, il Markdown della pagina viene comunque mantenuto e il servizio non addebita la componente di layout. Per impostazione predefinita OpenDocRouter non conserva i documenti. Quando la cache viene abilitata, i risultati sono archiviati cifrati per 24 ore e possono essere eliminati anticipatamente tramite una delete call; richieste successive sulle stesse pagine, con identico modello e identica impostazione layout, vengono servite gratuitamente dalla cache. Ogni pagina viene ritentata una volta in caso di timeout, rate limit, errore del provider, mancanza di capacità oppure comportamento nel quale il modello entra in loop o non produce la trascrizione.

I limiti iniziali prevedono dieci richieste simultanee, delle quali non più di cinque asincrone, 300 parse call e 60 polling call al minuto, 270 secondi di timeout massimo per pagina e fino a 30 minuti di attesa per la disponibilità di capacità nei job asincroni. La tariffazione è interamente basata sui token. Gli account utilizzano credito prepagato con ricariche a partire da 25 dollari e una commissione del 5% su ogni top-up; per i modelli frontier viene applicato il normale prezzo per token del provider senza markup. L’attivazione del layout costa ulteriori 0,20 dollari per milione di token sulle pagine nelle quali l’estrazione riesce, mentre pagine fallite, vuote o servite dalla cache non vengono fatturate. Prima dell’avvio di un job l’account deve disporre di credito sufficiente a coprire il costo massimo teorico e la quota non utilizzata viene liberata al termine.

Nella tabella del 7 ottobre Claude Opus 5.5 viene fatturato a 4 dollari per milione di token in input e 20 dollari in output, GPT-6 Luna a 0,10 e 0,50 dollari, MinerU2.5-Pro a 0,08 e 0,39. LlamaIndex distingue esplicitamente OpenDocRouter da LlamaParse: il primo è pensato come livello semplice per accedere rapidamente ai modelli più recenti, confrontarli e spostare il routing fra essi pagando in base all’effettivo utilizzo; LlamaParse rimane invece la piattaforma documentale gestita con tier di parsing ottimizzati manualmente, controlli enterprise, opzioni self-hosted e API aggiuntive per attività come schema extraction e indexing. OpenDocRouter è già operativo e può essere utilizzato generando una API key dopo la registrazione.

Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)

Di Fantasy