Categoria: Intelligenza Artificiale Multimodale

ByteDance presenta SeedRealtime, un modello multimodale full-duplex per interazioni audio-video in tempo reale

ByteDance ha presentato SeedRealtime, un modello linguistico multimodale full-duplex capace di elaborare simultaneamente voce, immagini e testo all’interno di un’unica architettura. Il sistema è stato progettato per superare il funzionamento…

Black Forest presenta FLUX 3 per unificare immagini, video, audio e azioni robotiche in un’unica architettura

Black Forest Labs ha presentato FLUX 3, una nuova architettura multimodale addestrata congiuntamente per comprendere e generare immagini, video con audio e sequenze combinate fino a 20 secondi, estendendo la…