智能体与多智能体

Giskard OSS:用于 AI 智能体的评估、红队测试与测试生成

giskard-ai/giskard-oss

一个用于评估和测试基于 LLM 及智能体系统的开源 Python 库,支持多轮评估、LLM-as-judge 检查和自动化漏洞扫描。

★ 5.7K星级
⑂ 513Fork 数
85未解决的问题
Python语言
Apache-2.0许可证
Q@project.QualityScore编辑评分

概览

Giskard v3 提供模块化、async-first 架构,可用于封装和测试 LLM、黑盒智能体及多步骤流水线。其 beta 组件涵盖基于场景的评估和智能体漏洞扫描。专用的 v3 RAG 评估包计划推出,而部分漏洞扫描和 RAG 功能仍依赖旧版 v2 实现。

主要功能

  • 用于评估同步或异步目标的 Scenario API
  • 内置字符串匹配、比较、正则表达式和语义相似度检查
  • 包括 Groundedness、Conformity 和 LLMJudge 在内的 LLM-as-judge 检查
  • 多轮智能体评估和场景套件
  • 自动化红队测试与漏洞扫描
  • 提示注入载荷数据集
  • 可扩展的自定义 ScenarioGenerator 支持
  • 具有针对性依赖集的模块化包
  • 可选的聚合遥测,以及文档说明的环境变量退出方式

要求、安装和快速入门

使用 `pip install giskard` 安装主包。使用 `pip install "giskard[scan]"` 添加漏洞与质量扫描,或使用 `pip install giskard-scan` 直接安装扫描器。通过 `pip install "giskard[openai]"` 等 extra 安装 LLM 提供商 SDK。也可使用 `pip install giskard-checks` 直接安装检查组件。旧版 v2 可通过 `pip install "giskard[llm]>2,<3"` 获取,但不再积极维护。

用法

若要快速评估,可定义目标可调用对象,创建 `Scenario`,添加交互以及 `Groundedness` 等检查,然后 await `scenario.run()` 并打印报告。若要进行漏洞扫描,可定义异步智能体可调用对象,然后 await `vulnerability_scan(target=my_agent, description="A customer support chatbot for an e-commerce platform.", languages=["en"])`。Groundedness 和扫描生成需要已配置的 LLM 提供商 extra 及 API 密钥。

模型兼容性与使用场景

v3 目标接口可通过同步或异步可调用对象封装 LLM、黑盒智能体或多步骤流水线。Groundedness 所述默认模型为 `openai/gpt-4o-mini`。提及了 OpenAI 和 Anthropic 提供商 extra,但仓库元数据未说明完整的受支持模型或提供商列表。仓库元数据未说明 MCP 支持。

许可证与风险说明

仓库元数据将许可证标识为 Apache-2.0。许可证参考:https://api.github.com/licenses/apache-2.0

发布与维护

所提供的 README 将 v3 描述为一次全新重写,重点包括动态多轮测试、更轻量的依赖、更强的 AI 漏洞扫描器和改进的 RAG 评估。它还表示 v2 仍然可用,但不再积极维护。所提供仓库记录未说明版本号和发布日期。

Firecrawl

firecrawl/firecrawl

★ 161.1KTypeScript

LangChain

langchain-ai/langchain

★ 143.6KPython

RAGFlow

infiniflow/ragflow

★ 86.7KGo