项目截图
概览
memra 是一个从零开始用 Rust 和 CUDA 编写的高性能 LLM 推理引擎。它针对两种特定的 GPU 架构——NVIDIA RTX 50 系列 Blackwell (sm_120a) 和 H100 Hopper (sm_90a)——在构建时进行自动检测。该引擎的显著特点在于严格的精确性约束:推测性和图重放的输出保证与普通解码在 token 级别完全一致,并且在并发负载下贪婪服务是隔离一致的,确保速度和批处理不会改变模型输出。它具有根据测量的硬件极限调优的手写内核,并包含针对 llama.cpp 和 vLLM 的全面单模型性能基准测试。
主要功能
- 从零开始构建的 Rust + CUDA 引擎,无 ggml 依赖
- 针对 RTX 5090 (sm_120a) 和 H100 (sm_90a) 的自动检测双架构支持
- 严格的精确性约束推理,确保 token 级别的输出一致
- 具有自适应草稿深度和置信度截断的 MTP 推测解码
- 通过常驻专家机制和 AUTO-KQUANT 在 24GB 显存上运行 MoE
- Hopper wgmma/TMA 内核和 FA3 级别的预填充注意力
- 具有最少主机流量的 CUDA 图解码
- 兼容 OpenAI 的服务器,支持批量解码和跨请求预填充批处理
- m 不变的预填充路由器,确保隔离一致的并发服务
要求、安装和快速入门
用法
模型兼容性与使用场景
支持的模型包括 Qwen3.5-9B、Qwen3.6-27B、Qwen3.6-35B-A3B MoE、Gemma-4 12B、Gemma-4 26B-A4B MoE、Gemma-4 31B、Gemma-4 E4B、Ornith-1.0-9B 和 Ornith-1.0-35B。支持 Hy3 Layer103.5 但仍在调优中。KAT-Coder-V2.5 和 Qwen-AgentWorld-35B-A3B 正在引入中。MiniMax-M3 REAP50 正在进行中。
许可证与风险说明
仓库元数据显示许可证为 MIT。发布或商用前,请核对仓库中的 LICENSE 文件、版权声明及依赖项许可条款。
Editorial verification 2026-08-02: repository URL, owner, description, license and repository statistics were reviewed. License metadata: MIT. README was fetched for the channel draft; re-check repository dependencies, releases and model terms before production use.
发布与维护
Not stated in the repository metadata