Quantizzazione della KV cache: chiavi e valori richiedono assi diversi per preservare le prestazioni dei modelli
La quantizzazione della KV cache nei modelli linguistici non dipende soltanto dal numero di bit utilizzati, ma anche dall’asse lungo il quale vengono raggruppati i valori per calcolare scale factor…