ইনফারেন্স, ডিপ্লয়মেন্ট ও রানটাইম

Model-Optimizer

NVIDIA/Model-Optimizer

A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.

★ 3.3Kতারকা
⑂ 513ফর্ক
318খোলা সমস্যাগুলো
Pythonভাষা
Apache-2.0লাইসেন্স
Q86সম্পাদকীয় স্কোর

ওভারভিউ

A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.

প্রয়োজনীয়তা, ইনস্টলেশন ও দ্রুত শুরু

রিপোজিটরি মেটাডেটায় ইনস্টলেশনের প্রয়োজনীয়তাগুলি উল্লেখ করা নেই।

ব্যবহার

রিপোজিটরির মেটাডেটাতে ব্যবহার উল্লেখ করা নেই।

মডেলের সামঞ্জস্যতা ও ব্যবহারের ক্ষেত্র

রিপোজিটরি মেটাডেটায় মডেলের সামঞ্জস্যতা উল্লেখ করা নেই।

লাইসেন্স ও ঝুঁকি-সংক্রান্ত নোট

Apache-2.0

ToolAI metadata-only listing: repository metadata is public; editorial content and manual verification are still pending. Quality score was recomputed from live GitHub repository facts on 2026-08-22 UTC using the seven-dimension channel formula.

vllm

vllm-project/vllm

★ 89.5KPython

sglang

sgl-project/sglang

★ 32.2KPython

OpenVINO

openvinotoolkit/openvino

★ 10.6KC++

GPUStack

gpustack/gpustack

★ 5.4KPython