Inferensi, Deployment & Runtime

Model-Optimizer

NVIDIA/Model-Optimizer

A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.

★ 3,3KBintang
⑂ 513Fork
318Isu terbuka
PythonBahasa
Apache-2.0Lisensi
Q@project.QualityScoreSkor editorial

Ringkasan

A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.

Persyaratan, instalasi, dan mulai cepat

Persyaratan instalasi tidak tercantum dalam metadata repositori.

Penggunaan

Penggunaan tidak dicantumkan dalam metadata repositori.

Kompatibilitas model dan kasus penggunaan

Kompatibilitas model tidak tercantum dalam metadata repositori.

Catatan lisensi dan risiko

Apache-2.0

ToolAI metadata-only listing: repository metadata is public; editorial content and manual verification are still pending. Quality score was recomputed from live GitHub repository facts on 2026-08-22 UTC using the seven-dimension channel formula.

vllm

vllm-project/vllm

★ 89,5KPython

sglang

sgl-project/sglang

★ 32,2KPython

OpenVINO

openvinotoolkit/openvino

★ 10,6KC++

GPUStack

gpustack/gpustack

★ 5,4KPython