NVIDIA TriAttention, tecnica per ridurre la memoria necessaria ai modelli linguistici
NVIDIA, insieme a ricercatori del MIT, ha presentato una nuova tecnica denominata TriAttention, progettata per ridurre drasticamente il consumo di memoria nei modelli LLM intervenendo su uno dei principali limiti…