HN讨论 · 身份未知
开源模型网关:按请求路由最优模型,缓存成本成关注点
该项目发布了一个开源、宣称零加价的模型网关,统一管理自托管与多家推理提供商,并试图按每次请求选择成本/质量最优模型。评论区对方案表示兴趣,同时提出跨模型切换可能破坏输入缓存、推高成本的具体担心。
查看原始信号hn:49471407
目标用户
运行多模型 AI 应用的开发团队和独立开发者,尤其是同时使用自托管模型与多家商用推理 API、需要控制 token 成本的人。
潜在需求
需要一个可自托管、不加价的统一模型网关,兼容各家提供商差异,并在按请求路由最优模型的同时把缓存命中率纳入成本计算,避免切换模型导致费用失控。
发生场景
团队需要在同一应用里接入多个推理提供商和自托管模型,处理流式格式、工具调用、参数、限流和错误行为的差异;为控制成本希望每次请求选到成本/质量最优的模型,但按请求切换模型可能让输入缓存失效,费用反而上升;现有商业网关对简单路由按 token 加价。
来源证据
评论者指出,坚持用单一模型能省下输入 token 的缓存费用;在不同模型间切换可能提升性能,但成本可能失控。
Could you say more about how caching works? One major advantage of sticking with a single model is saving money on cached input tokens. I'd imagine if you swap between a bunch of models, you may improve performance but cost would would balloon out of controlhttps://news.ycombinator.com/item?id=49471407
为什么值得留意
该信号同时展示了解法形态和它的成本软肋:评论区对多模型切换的缓存成本提出具体疑问,说明模型路由的关键不只是选择模型,还在于缓存和成本账能否算清;开源、零加价和基于 OTel 痕迹的智能路由值得继续跟踪。
已有方案
- OpenRouter
未满足部分
- 商业模型网关对简单路由按 token 加价约 10%,且不开源
可能延伸 · 模型推测
- 将缓存命中率作为路由打分的显式约束,避免跨模型切换让缓存失效
- 基于用户真实流量的 opt-in 私有模型训练(项目已规划)
- 在路由前给出按提供商/模型的预期缓存成本预估
- 将路由决策与成本明细做成可审计报告,增加透明度
目前未知
- 评论者是否实际使用多模型网关,还是仅基于经验提问
- 按请求切换模型的真实缓存命中损失缺乏数据
- 项目的零加价和延迟数据未获独立验证
- OTel 痕迹驱动的路由准确性缺少评测
继续核实
- 多模型按请求切换时,输入缓存命中率实际下降多少、token 成本增加多少?
- 现有商业网关(如 OpenRouter)的缓存策略和加价结构是怎样的?
- 目标用户在选择模型路由工具时,最在意零加价、自托管还是路由质量?
- 能否通过提示前缀共享或缓存感知路由来缓解多模型切换的成本问题?
主题词
model gatewayllm routingcache costmulti-provider integrationtoken markupself-hosted ai