概览
Giskard v3 提供模块化、async-first 架构,可用于封装和测试 LLM、黑盒智能体及多步骤流水线。其 beta 组件涵盖基于场景的评估和智能体漏洞扫描。专用的 v3 RAG 评估包计划推出,而部分漏洞扫描和 RAG 功能仍依赖旧版 v2 实现。
主要功能
- 用于评估同步或异步目标的 Scenario API
- 内置字符串匹配、比较、正则表达式和语义相似度检查
- 包括 Groundedness、Conformity 和 LLMJudge 在内的 LLM-as-judge 检查
- 多轮智能体评估和场景套件
- 自动化红队测试与漏洞扫描
- 提示注入载荷数据集
- 可扩展的自定义 ScenarioGenerator 支持
- 具有针对性依赖集的模块化包
- 可选的聚合遥测,以及文档说明的环境变量退出方式
要求、安装和快速入门
使用 `pip install giskard` 安装主包。使用 `pip install "giskard[scan]"` 添加漏洞与质量扫描,或使用 `pip install giskard-scan` 直接安装扫描器。通过 `pip install "giskard[openai]"` 等 extra 安装 LLM 提供商 SDK。也可使用 `pip install giskard-checks` 直接安装检查组件。旧版 v2 可通过 `pip install "giskard[llm]>2,<3"` 获取,但不再积极维护。
用法
若要快速评估,可定义目标可调用对象,创建 `Scenario`,添加交互以及 `Groundedness` 等检查,然后 await `scenario.run()` 并打印报告。若要进行漏洞扫描,可定义异步智能体可调用对象,然后 await `vulnerability_scan(target=my_agent, description="A customer support chatbot for an e-commerce platform.", languages=["en"])`。Groundedness 和扫描生成需要已配置的 LLM 提供商 extra 及 API 密钥。
模型兼容性与使用场景
v3 目标接口可通过同步或异步可调用对象封装 LLM、黑盒智能体或多步骤流水线。Groundedness 所述默认模型为 `openai/gpt-4o-mini`。提及了 OpenAI 和 Anthropic 提供商 extra,但仓库元数据未说明完整的受支持模型或提供商列表。仓库元数据未说明 MCP 支持。
许可证与风险说明
仓库元数据将许可证标识为 Apache-2.0。许可证参考:https://api.github.com/licenses/apache-2.0
发布与维护
所提供的 README 将 v3 描述为一次全新重写,重点包括动态多轮测试、更轻量的依赖、更强的 AI 漏洞扫描器和改进的 RAG 评估。它还表示 v2 仍然可用,但不再积极维护。所提供仓库记录未说明版本号和发布日期。