Twelve Labs ha integrato Marengo Embed 3.0 nelle Managed Knowledge Base di Amazon Bedrock, rendendo disponibile un sistema gestito per indicizzare e ricercare semanticamente contenuti video, immagini e audio attraverso query in linguaggio naturale. Marengo 3.0 è il primo modello dedicato al video disponibile come opzione di embedding all’interno di questo servizio e consente alle aziende di rendere ricercabili i propri archivi multimediali senza dover costruire separatamente pipeline per estrazione dei frame, trascrizione, generazione degli embedding, database vettoriali e sincronizzazione dei risultati.
Amazon Bedrock Managed Knowledge Base è un servizio RAG completamente gestito che si occupa di ingestione, archiviazione, indicizzazione, embedding, ranking e retrieval dei dati. Con Marengo Embed 3.0, il sistema può trattare congiuntamente informazioni visive, audio, parlato e testo, trasformandole in rappresentazioni vettoriali utilizzabili per la ricerca semantica. Il modello codifica questi segnali in uno spazio vettoriale compatto a 512 dimensioni, permettendo di cercare contenuti sulla base del loro significato anziché esclusivamente attraverso metadati o parole chiave associate in precedenza.
Un utente può quindi formulare direttamente richieste come “mostrami il calcio di rigore nel secondo tempo” e recuperare il punto corrispondente all’interno di un archivio video, senza conoscere in anticipo il nome del file o il timestamp. AWS ha mostrato il funzionamento utilizzando un filmato di dieci minuti della finale dei Mondiali FIFA 2022: il video viene caricato in Amazon S3 e successivamente acquisito dalla knowledge base, mentre segmentazione, campionamento dei frame e trascrizione vengono gestiti automaticamente dal servizio.
La differenza rispetto a un’implementazione tradizionale riguarda soprattutto la quantità di infrastruttura che l’azienda deve predisporre. Una pipeline di ricerca semantica video costruita internamente richiede normalmente servizi separati per estrarre immagini dai filmati, convertire il parlato in testo, generare embedding, memorizzarli in un database vettoriale e mantenere sincronizzati i riferimenti temporali tra audio, immagini e trascrizioni. È inoltre necessario progettare il modo in cui una richiesta dell’utente viene interpretata e collegata alle diverse modalità presenti nel video. Con Managed Knowledge Base queste operazioni vengono invece coordinate direttamente da Amazon Bedrock.
Il servizio supporta file video MP4 e MOV, immagini JPEG e PNG e tracce audio. Oltre ad Amazon S3, le Managed Knowledge Base possono utilizzare connettori nativi verso fonti come SharePoint e Confluence e, più in generale, AWS ha reso disponibili anche integrazioni con Google Drive, OneDrive e Web Crawler. Collegando una fonte dati, i contenuti possono quindi essere acquisiti, indicizzati e resi interrogabili senza costruire manualmente l’intera infrastruttura di retrieval.
L’utilizzo all’interno dell’infrastruttura AWS consente inoltre alle aziende di mantenere i propri contenuti multimediali nel proprio ambiente cloud e di applicare i controlli di accesso già utilizzati per i dati aziendali. Questo rende l’architettura utilizzabile anche in contesti nei quali video e registrazioni possono contenere informazioni sensibili, come servizi finanziari, sanità, pubblica amministrazione o archivi aziendali interni. Le Managed Knowledge Base supportano infatti anche controlli di accesso a livello di documento, con strumenti specifici per verificare e diagnosticare i permessi applicati ai contenuti indicizzati.
Tra le prime aziende a utilizzare questa integrazione figura Iconik, la piattaforma di Media Asset Management cloud-native e API-first di Backlight. Twelve Labs e Iconik hanno integrato la ricerca semantica direttamente nell’ambiente di gestione dei contenuti, consentendo agli utenti di individuare scene, oggetti e dialoghi sulla base del contenuto del filmato e non soltanto dei metadati disponibili. L’integrazione di ricerca è già disponibile, mentre il nuovo connettore nativo è in early access.
Twelve Labs e Backlight presentano l’integrazione durante IBC 2026, in programma al RAI di Amsterdam dall’11 al 14 settembre. Twelve Labs è presente nel Partner Pod di Iconik domenica 13 settembre dalle 10 alle 12, con una dimostrazione dedicata alla ricerca e alla comprensione profonda degli archivi video.
Marengo 3.0 era già disponibile come modello su Amazon Bedrock dall’ottobre 2025, ma l’integrazione nelle Managed Knowledge Base aggiunge ora la gestione automatica dell’intero processo di ingestione e retrieval. Il modello supporta l’elaborazione di video e audio fino a quattro ore e file fino a 6 GB, comprende 36 lingue oltre all’inglese e utilizza embedding a 512 dimensioni progettati per ridurre spazio di archiviazione e costi di elaborazione. Può inoltre combinare video, immagini, audio e testo nello stesso spazio rappresentazionale, caratteristica che permette di eseguire ricerche multimodali senza mantenere pipeline separate per ogni tipo di contenuto.
Questo articolo è stato redatto con il supporto di strumenti di intelligenza artificiale (AI)
