Инференс, развёртывание и среда выполнения

Model-Optimizer

NVIDIA/Model-Optimizer

A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.

★ 3,3KЗвёзды
⑂ 513Форки
318Открытые проблемы
PythonЯзык
Apache-2.0Лицензия
Q86Редакционная оценка

Обзор

A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.

Требования, установка и быстрый старт

В метаданных репозитория требования к установке не указаны.

Использование

В метаданных репозитория сведения об использовании не указаны.

Совместимость моделей и варианты использования

В метаданных репозитория совместимость моделей не указана.

Лицензия и примечания о рисках

Apache-2.0

ToolAI metadata-only listing: repository metadata is public; editorial content and manual verification are still pending. Quality score was recomputed from live GitHub repository facts on 2026-08-22 UTC using the seven-dimension channel formula.

vllm

vllm-project/vllm

★ 89,5KPython

sglang

sgl-project/sglang

★ 32,2KPython

OpenVINO

openvinotoolkit/openvino

★ 10,6KC++

GPUStack

gpustack/gpustack

★ 5,4KPython