Inferentie, implementatie en runtime

Model-Optimizer

NVIDIA/Model-Optimizer

A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.

★ 3,3KSterren
⑂ 513Forks
318Openstaande problemen
PythonTaal
Apache-2.0Licentie
Q86Redactionele score

Overzicht

A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.

Vereisten, installatie en snel aan de slag

Installatievereisten staan niet vermeld in de metadata van de repository.

Gebruik

Het gebruik wordt niet vermeld in de metagegevens van de repository.

Modelcompatibiliteit en gebruiksscenario's

Modelcompatibiliteit staat niet vermeld in de metadata van de repository.

Licentie- en risiconotities

Apache-2.0

ToolAI metadata-only listing: repository metadata is public; editorial content and manual verification are still pending. Quality score was recomputed from live GitHub repository facts on 2026-08-22 UTC using the seven-dimension channel formula.

vllm

vllm-project/vllm

★ 89,5KPython

sglang

sgl-project/sglang

★ 32,2KPython

OpenVINO

openvinotoolkit/openvino

★ 10,6KC++

GPUStack

gpustack/gpustack

★ 5,4KPython