部署与推理
★ 29.2k
9router
一层路由,让某个供应商限流时你的编码 Agent 还能继续跑——光是自动回退这一项就值。
重度使用 Agent 时经常被供应商限流的个人与小团队
阅读全文 →
推理服务栈、推理引擎、GPU 编排与成本控制工具。
一层路由,让某个供应商限流时你的编码 Agent 还能继续跑——光是自动回退这一项就值。
GPU 吞吐的最后几个百分点,代价是构建复杂度和硬件锁定。
模型层搞定之后,你交给用户的那个前端。
已经把 Agent 和 MCP 接好的多用户、多供应商对话平台。
基于 PagedAttention 的高吞吐推理引擎——要在同一张卡上压出更多吞吐,通常就是它。
一条命令在笔记本上跑起大模型——把模型摆到客户面前最快的方式。
纯 C/C++ 的推理实现,优先面向 CPU——GPU 去不了的地方它能去。
HuggingFace 用 Rust 写的推理服务栈,内置张量并行与流式输出。
为结构化输出与大量前缀复用设计的推理引擎。
用一套 OpenAI 接口对接 100+ 模型厂商,附带按 key 统计花费的代理。
每个多租户 RAG 最终都会发现同一件事:检索之后过滤结果不是隔离。过滤必须约束搜索本身,而不是裁剪它的输出。
风险不在于模型说错了什么,而在于 Agent 做错了什么——而且是带着凭证,在一个没有撤销按钮的系统里做错。
「自托管更便宜」只有在利用率超过某个水平之后才成立。低于这个水平,你在为闲置的 GPU 和工程师的注意力付费——而第二项,几乎没人写进表格。
用户感受到的不是你的架构,而是一个数字。多数团队说不清这个数字是从哪来的。在它真的变慢之前,用户早就觉得它慢了。