兵器库 · 45

全部工具

评估与 LLMOps ★ 34.7k

Open Code Review

确定性规则在前、LLM 在后的混合代码评审,这是唯一能过企业安全评审的顺序。

需要 AI 代码评审真正通过安全评审、而不只是演示好看的团队 阅读全文 →
Agent 与编排 ★ 7.9k

Worktrunk

给并行编码 Agent 用的 git worktree 命令行工具,让多个 Agent 不再互相踩工作区。

需要在同一个仓库上并行跑多个编码 Agent 的人 阅读全文 →
Agent 与编排 ★ 95.8k

Agent Skills

一套给编码 Agent 用的可复用技能集——决定 Agent 是「完成任务」还是「按你的方式完成任务」。

需要在同一代码库上统一多个工程师的 Agent 行为的团队 阅读全文 →
Agent 与编排 ★ 145.9k

Claude Code

让 Agent 编码走向主流的终端原生工具,也是现在所有其他编码 Agent 的参照系。

想在既有终端与 git 工作流里使用 Agent 编码的工程师 阅读全文 →
Agent 与编排 ★ 71.1k

Orca

并行跑一堆编码 Agent,同时继续用你已经在付费的订阅——成本模型本身就是产品。

瓶颈在并行度而非模型能力的团队 阅读全文 →
部署与推理 ★ 29.2k

9router

一层路由,让某个供应商限流时你的编码 Agent 还能继续跑——光是自动回退这一项就值。

重度使用 Agent 时经常被供应商限流的个人与小团队 阅读全文 →
Agent 与编排 ★ 49.6k

Humanizer

去掉生成文本里那些「一眼 AI」的节奏特征——有用,同时也提醒你这些特征现在已经众所周知。

在人工编辑之前清理自己的初稿 阅读全文 →
Agent 与编排 ★ 10.4k

no-ai-slop

一份明确可读的清单,列出二十来种让文本「读起来像生成」的模式——当检查清单比当过滤器更有价值。

编写团队评审指南或内部风格检查工具 阅读全文 →

Chroma

从 pip install 到能用的检索器,距离最短——这也是为什么几乎所有 RAG 教程都从这里开始。

原型、notebook 和几百万向量以下的单节点应用 阅读全文 →

Guardrails AI

用 schema 校验模型输出,而不是祈祷——校验失败还会带上错误重新问一次。

必须可靠解析的结构化输出,以及内容触达用户前的 PII 与策略检查 阅读全文 →

Mem0

给 Agent 跨会话的连续性——当用户开始期待「它记得我」时,缺的就是这块。

跨会话连续性是产品需求的助手与 Agent 阅读全文 →

OpenLLMetry

把 LLM 追踪变成标准 OpenTelemetry span——这样它们就能落进你已经在付费的那套可观测性栈里。

已有 OpenTelemetry 栈、不想再开第二个可观测性孤岛的组织 阅读全文 →
RAG 与知识库 ★ 25.4k

WeKnora

开箱即用的文档到 RAG 流水线,出自在腾讯规模上真跑过它的团队。

需要基于内部文档自建知识库的团队,尤其是中文语料场景 阅读全文 →
Agent 与编排 ★ 82.5k

Agent-Reach

让 Agent 上网而不必按次付费,包括那些根本没有可用 API 的平台。

按次调用成本会直接压死场景的内部调研与监控 Agent 阅读全文 →
Agent 与编排 ★ 137.4k

Spec Kit

把规格说明放回代码前面——这是 Agent 产出保持可评审的唯一办法。

从零散试用 Agent 走向「评审者能真正验收」流程的团队 阅读全文 →
Agent 与编排 ★ 287.6k

Superpowers

它不是工具而是方法:把团队的工作方式固化下来,然后让 Agent 照着做。

原则上认同流程、但每次会话都要重新吵一遍的团队 阅读全文 →
部署与推理 ★ 62.0k

vLLM

基于 PagedAttention 的高吞吐推理引擎——要在同一张卡上压出更多吞吐,通常就是它。

NVIDIA / AMD 显卡上的自托管生产推理 阅读全文 →
部署与推理 ★ 118.0k

Ollama

一条命令在笔记本上跑起大模型——把模型摆到客户面前最快的方式。

本地演示、隔离网试点、开发机 阅读全文 →
Agent 与编排 ★ 86.0k

Dify

可自托管的 LLMOps 平台,可视化工作流、RAG 与提示词管理一体。

内部工具、自托管的低代码 AI 应用 阅读全文 →
评估与 LLMOps ★ 15.0k

Langfuse

可自托管的链路追踪、评测与提示词管理——多数团队忘了建的那一层可观测性。

链路追踪、提示词版本管理与线上评测 阅读全文 →
评估与 LLMOps ★ 11.0k

Ragas

RAG 的指标套件:忠实度、上下文精确率、召回率——上线评审前需要的那些数字。

RAG 回归测试与上线指标 阅读全文 →