EvalScope
modelscope/evalscope
一个轻量且可定制的大模型(LLM、VLM、AIGC)评测与性能基准测试框架。
ToolAI.io · GitHub 频道
一个基于事实的 LLM、智能体、MCP、RAG 和 AI 开发项目索引;每个条目均包含许可证、设置、下载、截图及相关资源。
公开仓库数据
modelscope/evalscope
一个轻量且可定制的大模型(LLM、VLM、AIGC)评测与性能基准测试框架。
truera/trulens
TruLens 是一个开源的、原生支持 OpenTelemetry 的评估与追踪库,适用于 LLM 应用和 AI 智能体。它帮助开发者追踪每一步骤,使用 LLM 作为评判者对性能进行打分,并比较不同版本的应用。
dataelement/bisheng
BISHENG 是一个开源的 LLM 应用 DevOps 平台,面向下一代企业级 AI 应用,提供 GenAI 工作流编排、RAG、Agent 管理以及企业级系统管控等全面功能。
promptfoo/promptfoo
一个用于评估、测试和红队测试 LLM 应用、RAG 和 Agent 的开源 CLI 和库。它支持通过声明式配置进行模型并行对比,并支持 CI/CD 集成和漏洞扫描。
comet-ml/opik
Opik 是一个采用 Apache-2.0 许可证的平台,用于追踪、评估、调试和监控 LLM 应用、RAG 系统及多步骤智能体工作流。它支持自托管、Comet.com 托管选项、客户端 SDK、REST API、自动化评估、提示词实验和生产仪表板。
giskard-ai/giskard-oss
一个用于评估和测试基于 LLM 及智能体系统的开源 Python 库,支持多轮评估、LLM-as-judge 检查和自动化漏洞扫描。
langwatch/langwatch
一个开放核心平台,用于在发布前及生产环境中评估、测试、追踪和监控 LLM 应用与 AI 智能体。
NVIDIA/garak
ToolAI 对 NVIDIA/garak 的客观项目介绍。the LLM vulnerability scanner
openai/evals
ToolAI 对 openai/evals 的客观项目介绍。Evals is a framework for evaluating LLMs and LLM systems, and an open-source registry of benchmarks