> For clean Markdown of any page, append .md to the page URL.
> For a complete documentation index, see https://developers.alephant.io/llms.txt.
> For AI client integration (Claude Code, Cursor, etc.), connect to the MCP server at https://developers.alephant.io/_mcp/server.

# 路由优化

> 使用回退、成本感知路由和模型策略提升可靠性并控制支出

路由优化层决定请求应使用指定模型、回退到其他提供商、路由到更低成本的模型，还是在产生提供商成本前停止。

Alephant 将路由决策与 Virtual Key、智能体、预算、策略、请求元数据和成本分析关联起来。

## 优化模式

| 模式      | 目的                           |
| ------- | ---------------------------- |
| 模型回退    | 主路由失败时尝试其他模型或提供商             |
| 成本感知路由  | 策略允许时，将低风险工作发送到低成本模型         |
| 模型允许列表  | 限制智能体、部门或 Virtual Key 可使用的模型 |
| 预算感知路由  | 接近预算限制时阻止、限流或降级流量            |
| 提示词感知路由 | 按模板、版本或任务类型路由提示词管理请求         |

## 模型回退

当提供商不可用、受到速率限制、过载或返回瞬态错误时，回退可提升可用性。

回退链示例：

```text
openai/gpt-4o
-> anthropic/claude-3-5-sonnet
-> google/gemini-1.5-pro
```

对于每次回退尝试，Alephant 可记录：

* 请求的模型
* 尝试过的提供商和模型
* 失败状态或错误类别
* 最终提供服务的提供商和模型
* 增加的延迟
* 成本影响
* 请求日志和运行追踪元数据

## 成本感知路由

成本感知路由有助于避免将前沿模型预算用于简单工作。

典型的路由信号包括：

* 提示词长度
* 任务类别
* 提示词模板 ID
* 智能体或工作流身份
* 所需模型能力
* 预算状态
* 用户、部门或工作区策略

示例：

```text
Short summarization task
-> route from openai/gpt-4o to openai/gpt-4o-mini
-> record savings and final model used
```

## 策略护栏

路由优化应保持在策略边界内。成本规则不应覆盖：

* 工作区模型限制
* 智能体或部门允许列表
* 安全策略
* 数据驻留要求
* 付费端点策略
* 预算硬性停止条件

如果同时适用多个控制项，Alephant 应优先采取最安全的决策：阻止、限流或要求显式配置，而不是悄然选择不允许的路由。

## 监控项

使用以下指标跟踪路由优化：

* 回退次数
* 回退成功率
* 平均回退延迟
* 经成本感知路由优化的请求
* 预估节省额
* 路由变更后的错误率
* 可用时的质量或业务结果指标

## 相关页面

* [提供商路由](/ai-gateway/provider-routing)
* [策略与规则](/docs/overview/security-compliance/policies-rules)
* [成本分析](/docs/overview/fin-ops-budget/cost-analytics)
* [智能体财务](/docs/overview/fin-ops-budget/agent-finance)