Vue d’ensemble
A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.
Prérequis, installation et démarrage rapide
Utilisation
Compatibilité des modèles et cas d’usage
La compatibilité des modèles n’est pas indiquée dans les métadonnées du dépôt.
Licence et notes sur les risques
Apache-2.0
ToolAI metadata-only listing: repository metadata is public; editorial content and manual verification are still pending. Quality score was recomputed from live GitHub repository facts on 2026-08-22 UTC using the seven-dimension channel formula.