评估与 LLMOps

评测框架、链路追踪、可观测性、护栏与提示词管理。

该分类下的工具

评估与 LLMOps ★ 34.7k

Open Code Review

确定性规则在前、LLM 在后的混合代码评审,这是唯一能过企业安全评审的顺序。

需要 AI 代码评审真正通过安全评审、而不只是演示好看的团队 阅读全文 →

Guardrails AI

用 schema 校验模型输出,而不是祈祷——校验失败还会带上错误重新问一次。

必须可靠解析的结构化输出,以及内容触达用户前的 PII 与策略检查 阅读全文 →

OpenLLMetry

把 LLM 追踪变成标准 OpenTelemetry span——这样它们就能落进你已经在付费的那套可观测性栈里。

已有 OpenTelemetry 栈、不想再开第二个可观测性孤岛的组织 阅读全文 →
评估与 LLMOps ★ 15.0k

Langfuse

可自托管的链路追踪、评测与提示词管理——多数团队忘了建的那一层可观测性。

链路追踪、提示词版本管理与线上评测 阅读全文 →
评估与 LLMOps ★ 11.0k

Ragas

RAG 的指标套件:忠实度、上下文精确率、召回率——上线评审前需要的那些数字。

RAG 回归测试与上线指标 阅读全文 →

该分类下的文章