评估与 LLMOps
★ 34.7k
Open Code Review
确定性规则在前、LLM 在后的混合代码评审,这是唯一能过企业安全评审的顺序。
需要 AI 代码评审真正通过安全评审、而不只是演示好看的团队
阅读全文 →
评测框架、链路追踪、可观测性、护栏与提示词管理。
确定性规则在前、LLM 在后的混合代码评审,这是唯一能过企业安全评审的顺序。
用 schema 校验模型输出,而不是祈祷——校验失败还会带上错误重新问一次。
把 LLM 追踪变成标准 OpenTelemetry span——这样它们就能落进你已经在付费的那套可观测性栈里。
可自托管的链路追踪、评测与提示词管理——多数团队忘了建的那一层可观测性。
RAG 的指标套件:忠实度、上下文精确率、召回率——上线评审前需要的那些数字。
以 Notebook 为核心的可观测性工具,聚类能把你没想到的失效模式挖出来。
即插即用的代理,记录每一次请求,按用户、按功能、按天展示成本。
自托管只有在利用率超过某个门槛后,才在每 token 成本上赢过 API。而几乎没人达到那个门槛——低于它时,你在为闲置算力和工程师注意力付费,只有前者会写进表格。
做测量的团队往往只测简单题,因为只有这些题有人事先知道答案。而真正会让你赔钱的,是那些没人想到要放进去的题。
路由是 LLM 系统里杠杆最大的成本控制手段,却几乎总是最后才被实现——在为那些小模型回答得一模一样的问题付了十八个月高价之后。
你不会在没有测试的情况下合并代码,那也别在没有评测的情况下发布 Agent 改动。