RAG 与知识系统

EvalScope

modelscope/evalscope

一个轻量且可定制的大模型(LLM、VLM、AIGC)评测与性能基准测试框架。

★ 3.2K星级
⑂ 440Fork 数
32未解决的问题
Python语言
Apache-2.0许可证
Q@project.QualityScore编辑评分

项目截图

EvalScope 的截图 EvalScope 的截图

概览

EvalScope 是由 ModelScope 社区构建的开源评测框架,旨在评估大模型能力、进行推理性能压测并可视化结果。它支持多种模型类型,包括大语言模型(LLM)、视觉语言模型(VLM)、Embedding、Reranker 和 AIGC。该框架集成了 OpenCompass、VLMEvalKit 和 RAGEval 等多种评测后端,并提供 MMLU、C-Eval 和 GSM8K 等业界公认的内置基准。此外,它还提供了一个交互式 WebUI 仪表板,用于多维度的模型比较和深入分析。

主要功能

  • 全面的内置评测基准(MMLU、C-Eval、GSM8K 等)。
  • 多模态和多领域支持(LLM、VLM、Embedding、Reranker、AIGC)。
  • 多后端集成(原生、OpenCompass、VLMEvalKit、RAGEval)。
  • 智能体评测模式,具备多轮 AgentLoop、可插拔策略、工具和 Docker 沙盒。
  • 推理性能压力测试,提供 TTFT、TPOT 和吞吐量等指标。
  • 交互式 WebUI 可视化仪表板,用于模型比较和报告检查。
  • 用于多模型成对对战和直观排名的竞技场模式。
  • 高度可扩展的架构,支持自定义数据集、模型和指标。

要求、安装和快速入门

pip install evalscope

用法

评估兼容 OpenAI API 的模型:`evalscope eval --model your-model-name --api-url $OPENAI_API_BASE_URL --api-key $OPENAI_API_KEY --eval-type openai_api --datasets gsm8k --limit 5`。评估本地模型:`evalscope eval --model Qwen/Qwen2.5-0.5B-Instruct --datasets gsm8k arc --limit 5`。启动可视化仪表板:执行 `pip install 'evalscope[service]'` 后运行 `evalscope service`,然后访问 http://127.0.0.1:9000。

模型兼容性与使用场景

支持任何兼容 OpenAI API 的模型服务、Anthropic Claude API 以及托管在 ModelScope 上的本地模型。

许可证与风险说明

Apache-2.0

Editorial verification 2026-08-09: repository URL, owner, description, license and repository statistics were reviewed. License metadata: Apache-2.0. README was fetched for the channel draft; re-check repository dependencies, releases and model terms before production use.

发布与维护

最近的更新包括添加了 Claw-Eval、ResearchRubrics、Toolathlon、TVBench、WideSearch 和 PerspectiveGap 基准。添加了 CharXiv、BabyVision、ERQA 和 WorldVQA 多模态基准。大幅扩展了智能体和代码评估,新增 BigCodeBench、SWE-bench Multilingual、BrowseComp、MCP-Atlas 和 GDPval。将 RAG 评估模块重构为 MTEB 2.x 和 RAGAS 0.4.x。引入了用于现成智能体 CLI 的外部智能体桥接模式。使用 React + Vite 界面替换了 Gradio WebUI。

LanceDB

lancedb/lancedb

★ 11.1KRust

Infino

infino-ai/infino

★ 67Rust