路由优化

以 Markdown 格式查看

路由优化层决定请求应使用指定模型、回退到其他提供商、路由到更低成本的模型,还是在产生提供商成本前停止。

Alephant 将路由决策与 Virtual Key、智能体、预算、策略、请求元数据和成本分析关联起来。

优化模式

模式目的
模型回退主路由失败时尝试其他模型或提供商
成本感知路由策略允许时,将低风险工作发送到低成本模型
模型允许列表限制智能体、部门或 Virtual Key 可使用的模型
预算感知路由接近预算限制时阻止、限流或降级流量
提示词感知路由按模板、版本或任务类型路由提示词管理请求

模型回退

当提供商不可用、受到速率限制、过载或返回瞬态错误时,回退可提升可用性。

回退链示例:

openai/gpt-4o
-> anthropic/claude-3-5-sonnet
-> google/gemini-1.5-pro

对于每次回退尝试,Alephant 可记录:

  • 请求的模型
  • 尝试过的提供商和模型
  • 失败状态或错误类别
  • 最终提供服务的提供商和模型
  • 增加的延迟
  • 成本影响
  • 请求日志和运行追踪元数据

成本感知路由

成本感知路由有助于避免将前沿模型预算用于简单工作。

典型的路由信号包括:

  • 提示词长度
  • 任务类别
  • 提示词模板 ID
  • 智能体或工作流身份
  • 所需模型能力
  • 预算状态
  • 用户、部门或工作区策略

示例:

Short summarization task
-> route from openai/gpt-4o to openai/gpt-4o-mini
-> record savings and final model used

策略护栏

路由优化应保持在策略边界内。成本规则不应覆盖:

  • 工作区模型限制
  • 智能体或部门允许列表
  • 安全策略
  • 数据驻留要求
  • 付费端点策略
  • 预算硬性停止条件

如果同时适用多个控制项,Alephant 应优先采取最安全的决策:阻止、限流或要求显式配置,而不是悄然选择不允许的路由。

监控项

使用以下指标跟踪路由优化:

  • 回退次数
  • 回退成功率
  • 平均回退延迟
  • 经成本感知路由优化的请求
  • 预估节省额
  • 路由变更后的错误率
  • 可用时的质量或业务结果指标

相关页面