推論、デプロイ、ランタイム

Model-Optimizer

NVIDIA/Model-Optimizer

A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.

★ 3.3Kスター
⑂ 513フォーク数
318未解決の問題
Python言語
Apache-2.0ライセンス
Q@project.QualityScore編集部スコア

概要

A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.

要件、インストール、クイックスタート

リポジトリのメタデータにインストール要件が記載されていません。

使用方法

使用方法はリポジトリのメタデータに記載されていません。

モデルの互換性とユースケース

リポジトリのメタデータにモデル互換性の記載がありません。

ライセンスとリスクに関する注意事項

Apache-2.0

ToolAI metadata-only listing: repository metadata is public; editorial content and manual verification are still pending. Quality score was recomputed from live GitHub repository facts on 2026-08-22 UTC using the seven-dimension channel formula.

vllm

vllm-project/vllm

★ 89.5KPython

sglang

sgl-project/sglang

★ 32.2KPython

OpenVINO

openvinotoolkit/openvino

★ 10.6KC++

GPUStack

gpustack/gpustack

★ 5.4KPython