Inférence, déploiement et exécution

Model-Optimizer

NVIDIA/Model-Optimizer

A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.

★ 3,3KÉtoiles
⑂ 513Forks
318Problèmes ouverts
PythonLangue
Apache-2.0Licence
Q@project.QualityScoreScore éditorial

Vue d’ensemble

A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.

Prérequis, installation et démarrage rapide

Les exigences d'installation ne sont pas indiquées dans les métadonnées du dépôt.

Utilisation

L’utilisation n’est pas indiquée dans les métadonnées du dépôt.

Compatibilité des modèles et cas d’usage

La compatibilité des modèles n’est pas indiquée dans les métadonnées du dépôt.

Licence et notes sur les risques

Apache-2.0

ToolAI metadata-only listing: repository metadata is public; editorial content and manual verification are still pending. Quality score was recomputed from live GitHub repository facts on 2026-08-22 UTC using the seven-dimension channel formula.

vllm

vllm-project/vllm

★ 89,5KPython

sglang

sgl-project/sglang

★ 32,2KPython

OpenVINO

openvinotoolkit/openvino

★ 10,6KC++

GPUStack

gpustack/gpustack

★ 5,4KPython