项目截图
概览
EvalScope 是由 ModelScope 社区构建的开源评测框架,旨在评估大模型能力、进行推理性能压测并可视化结果。它支持多种模型类型,包括大语言模型(LLM)、视觉语言模型(VLM)、Embedding、Reranker 和 AIGC。该框架集成了 OpenCompass、VLMEvalKit 和 RAGEval 等多种评测后端,并提供 MMLU、C-Eval 和 GSM8K 等业界公认的内置基准。此外,它还提供了一个交互式 WebUI 仪表板,用于多维度的模型比较和深入分析。
主要功能
- 全面的内置评测基准(MMLU、C-Eval、GSM8K 等)。
- 多模态和多领域支持(LLM、VLM、Embedding、Reranker、AIGC)。
- 多后端集成(原生、OpenCompass、VLMEvalKit、RAGEval)。
- 智能体评测模式,具备多轮 AgentLoop、可插拔策略、工具和 Docker 沙盒。
- 推理性能压力测试,提供 TTFT、TPOT 和吞吐量等指标。
- 交互式 WebUI 可视化仪表板,用于模型比较和报告检查。
- 用于多模型成对对战和直观排名的竞技场模式。
- 高度可扩展的架构,支持自定义数据集、模型和指标。
要求、安装和快速入门
用法
模型兼容性与使用场景
支持任何兼容 OpenAI API 的模型服务、Anthropic Claude API 以及托管在 ModelScope 上的本地模型。
许可证与风险说明
Apache-2.0
Editorial verification 2026-08-09: repository URL, owner, description, license and repository statistics were reviewed. License metadata: Apache-2.0. README was fetched for the channel draft; re-check repository dependencies, releases and model terms before production use.
发布与维护
最近的更新包括添加了 Claw-Eval、ResearchRubrics、Toolathlon、TVBench、WideSearch 和 PerspectiveGap 基准。添加了 CharXiv、BabyVision、ERQA 和 WorldVQA 多模态基准。大幅扩展了智能体和代码评估,新增 BigCodeBench、SWE-bench Multilingual、BrowseComp、MCP-Atlas 和 GDPval。将 RAG 评估模块重构为 MTEB 2.x 和 RAGAS 0.4.x。引入了用于现成智能体 CLI 的外部智能体桥接模式。使用 React + Vite 界面替换了 Gradio WebUI。