1 post found
TurboQuant de Google atteint une compression 6x du cache KV sans perte de précision, rendant l'inférence IA sur CPU standard viable en production.