انفرنس، ڈپلائمنٹ اور رَن ٹائم

Model-Optimizer

NVIDIA/Model-Optimizer

A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.

★ 3.3Kستارے
⑂ 513فورکس
318کھلے مسائل
Pythonزبان
Apache-2.0لائسنس
Q86ادارتی اسکور

جائزہ

A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.

ضروریات، انسٹالیشن اور فوری آغاز

ریپوزٹری میٹا ڈیٹا میں انسٹالیشن کی ضروریات درج نہیں ہیں۔

استعمال

ریپوزٹری کے میٹا ڈیٹا میں استعمال کا ذکر نہیں ہے۔

ماڈل کی مطابقت اور استعمال کے مواقع

ریپوزٹری میٹا ڈیٹا میں ماڈل کی مطابقت درج نہیں ہے۔

لائسنس اور خطرے سے متعلق نوٹس

Apache-2.0

ToolAI metadata-only listing: repository metadata is public; editorial content and manual verification are still pending. Quality score was recomputed from live GitHub repository facts on 2026-08-22 UTC using the seven-dimension channel formula.

vllm

vllm-project/vllm

★ 89.5KPython

sglang

sgl-project/sglang

★ 32.2KPython

OpenVINO

openvinotoolkit/openvino

★ 10.6KC++

GPUStack

gpustack/gpustack

★ 5.4KPython