Giskard OSS:用于 AI 智能体的评估、红队测试与测试生成
giskard-ai/giskard-oss
一个用于评估和测试基于 LLM 及智能体系统的开源 Python 库,支持多轮评估、LLM-as-judge 检查和自动化漏洞扫描。
ToolAI.io · GitHub 频道
一个基于事实的 LLM、智能体、MCP、RAG 和 AI 开发项目索引;每个条目均包含许可证、设置、下载、截图及相关资源。
公开仓库数据
giskard-ai/giskard-oss
一个用于评估和测试基于 LLM 及智能体系统的开源 Python 库,支持多轮评估、LLM-as-judge 检查和自动化漏洞扫描。
potpie-ai/potpie
Potpie 将代码库和软件开发生命周期转化为供 AI 代理使用的动态上下文图,通过索引代码、结构、决策、源码历史和团队知识,实现具备上下文感知的编码、规划和调试。
embabel/embabel-agent
Embabel 是一个开源 JVM 框架,用于构建强类型智能体应用,将 LLM 交互、常规代码、工具和领域模型结合起来。它支持动态规划,可通过 Kotlin 或 Java 使用。
opencsgs/csghub
CSGHub 是一个开源的本地化部署平台,用于管理大语言模型资产的全生命周期,包括模型、数据集、空间和代码,提供类似于私有化 Hugging Face 的功能。
openagents-org/openagents
一个开源平台,为 AI 智能体提供协作式操作系统,支持统一工作区管理、多智能体协调和网络集成,且无供应商锁定。
langwatch/langwatch
一个开放核心平台,用于在发布前及生产环境中评估、测试、追踪和监控 LLM 应用与 AI 智能体。
truera/trulens
TruLens 是一个开源的、原生支持 OpenTelemetry 的评估与追踪库,适用于 LLM 应用和 AI 智能体。它帮助开发者追踪每一步骤,使用 LLM 作为评判者对性能进行打分,并比较不同版本的应用。
openai/openai-agents-js
A lightweight, powerful framework for multi-agent workflows and voice agents
agentscope-ai/reme
ReMe 是一个本地优先的 AI 智能体记忆层,可将对话与资源转化为可读、可编辑且可搜索的 Markdown 记忆文件。
NVIDIA/skills
Agent Skills for NVIDIA products — install into Claude Code, Codex, and other coding agents to run Physical AI, robotics, simulation, CUDA, and RAG workflows end to end.
dstackai/dstack
一个与供应商无关的控制平面,用于在 GPU 云、Kubernetes 和本地基础设施上配置和编排训练、推理、开发及智能体工作负载。
makecindy/cindy
Cindy 是一个开源桌面和移动端 AI 智能体客户端,可配合本地文件、已登录应用、浏览器、计算机和手机使用。它支持 Claude Code 和 Codex harness,并提供多种模型访问方式、持久化工作区上下文、自动化和 MCP 集成。
第 4 / 8 页 · 90 个项目