以文件形式编写策略
路由规则只需编写一次,即可绑定到整个组织、某个项目或单个密钥。保存前会进行类型检查。
ai.ml 是一个 LLM 网关。继续使用您现有的 OpenAI、Anthropic 或 Gemini SDK,只需修改 Base URL,每个请求都会被转换、路由到最佳主机、流式返回,并精确计量到每个 Token。
from openai import OpenAI client = OpenAI(- base_url="https://api.openai.com/v1",+ base_url="https://api.ai.ml/v1", api_key=KEY,)client.chat.completions.create( model="openai/gpt-5-mini", ...)
故障转移示例:第一个主机超时,请求转到下一个主机。您只收到一个回答,只付一次费用。
支持五种线上格式,无论由哪个供应商处理,都以相同的格式返回。选择一种格式,查看它的路径和所支持的内容。
client = OpenAI(base_url="https://api.ai.ml/v1", api_key=KEY)
您的 SDK 与模型之间有六个阶段。点击某个阶段,或播放完整路径,查看每个阶段检查什么、记录什么。
按功能、国家和数据规则筛掉无法处理该请求的主机。其余主机按您的策略排序:价格、速度或可用率。
# trace
5 hosts, 3 eligible ranked by price每个模型都列出提供它的主机,以及价格、实测速度和 30 天可用率。您可以排序、将流量限定在一个国家,或点击某一行固定到一个主机。以下是 openai/gpt-5-mini 的主机。
| 主机 | 国家或地区 | 每百万输入 / 输出 | 首个 Token | 30 天可用率 |
|---|---|---|---|---|
| Azure OpenAI (Global Standard) | 全球 | $0.25 / $2.00 | n/a | n/a |
| OpenAI | 美国 | $0.25 / $2.00 | n/a | n/a |
| OpenRouter | 全球 | $0.26 / $2.10 | 0.68 s | 100.00% |
如果该主机失败或变慢,列表中的下一个主机会接手请求。您只被收费一次。
# 添加到请求体 "route": { "sort": "price" }
来自目录的实时数据,基于最近 30 天测得。
路由规则只需编写一次,即可绑定到整个组织、某个项目或单个密钥。保存前会进行类型检查。
将一小部分流量发送到新主机。当其错误率或回答质量下滑时,流量份额会自动削减。
在后台将实时请求重放到另一个模型,对比成本、速度和停止原因。您的用户不会察觉。
用真实的路由器跑一遍历史请求或您描述的请求,查看它会选择哪个主机,以及其他主机为何落选。
各主机支持的功能不同。网关了解每个主机,在可以安全补齐的地方补齐差异,无法补齐时以清晰的错误拒绝。悬停或点按单元格查看。
| 模型 | 工具 | 结构化输出 | 视觉 | 推理 | 提示词缓存 |
|---|---|---|---|---|---|
| anthropic/claude-haiku-4.5 | 支持 | 支持 | 支持 | 支持 | 支持 |
| google/gemini-3.1-flash-lite | 支持 | 支持 | 支持 | 支持 | 支持 |
| openai/gpt-5-mini | 支持 | 支持 | 支持 | 支持 | 支持 |
| deepseek/deepseek-v4.1-flash | 支持 | 支持 | 支持 | 支持 | 支持 |
| meta/llama-3.3-70b-instruct | 支持 | 支持 | 不可用 | 不可用 | 不可用 |
| aion-labs/aion-2.0 | 支持 | 支持 | 不可用 | 支持 | 支持 |
来自实时目录。每个模型的页面都列出了所有主机及其支持的功能。
您无需猜测是哪个供应商作答、尝试了几次或花费多少。答案就在响应中,同一条记录也保存在请求日志里,保留时长与您的日志留存期一致。
所有被考虑过的主机,以及在每个主机上发生了什么。
HTTP/1.1 200 OK x-aiml-request-id: 01K7QW3M9T2ZB4 x-aiml-provider: bedrock x-aiml-region: us x-aiml-attempts: 2 x-aiml-cost-micro: 2676 x-aiml-route-trace: anthropic:timeout,bedrock:ok
每个密钥都有自己的速率限制、模型允许列表、允许的浏览器来源、有效期和支出预算。预算用完后,下一个请求会以清晰的错误拒绝,并通过 Webhook 通知您的团队。试一试:启动一个陷入循环的智能体。
正在等待第一个请求。数据规则按密钥设置,越往下级只能越严格。拨动开关,查看采用这些规则的密钥会怎么做。
每个账户都包含签署的数据处理协议、子处理方清单以及应要求删除数据。
设置命令会先检查您的密钥和模型,只修改它所管理的设置,并保留备份,再执行一条命令即可全部还原。
$ npx @aiml/cli setup claude-code ok key accepted ok model available ok backup saved ok wrote ~/.claude/settings.json npx @aiml/cli restore
团队在首次集成之后需要的功能,都已具备。
为某个密钥开启后,相同的请求将直接从缓存返回,不产生费用,流式请求同样适用。
一条路由覆盖 OpenAI、Cohere、Voyage 和 Jina 风格的嵌入模型,大批量请求自动拆分。
带上您已有的密钥。请求经由它们发出,日志、限额和路由仍由您掌握。
图像、PDF 或音频文件只需上传一次,即可在任意供应商的任意请求中引用。
TypeScript、Python 和 Go 库,以及一个在达到您设定的支出上限时停止的工具调用循环。
让您的编辑器或智能体通过标准工具读取模型、用量和请求,并创建密钥。
用您自己的测试集为模型和主机打分,并让结果引导路由。
带重试的签名事件,SAML 或 OIDC 登录,以及从您的目录同步用户。
预付,按 Token 付费。 可通过 UPI、银行卡或网银以卢比充值,或通过银行卡以美元充值。无需订阅。印度企业每次充值都会获得 GST 发票。
查看价格如有其他问题,请在申请中提出,会有专人回复。
内测采用邀请制。请提交申请,获批后您会收到一个用于设置密码并开通账户的链接。
是的。无论由哪个供应商生成,事件都会以您的 SDK 发送时的格式、按其期望的顺序返回。工具调用和推理同样支持流式输出。
按 Token 付费,价格以模型页面上每个主机显示的为准。无需订阅。
不需要。继续使用您现在的 OpenAI、Anthropic 或 Gemini SDK,只需修改 Base URL 和密钥。流式输出、工具和结构化输出的用法保持不变。
请求会转到提供同一模型的下一个主机。您只需为收到的回答付费,失败的尝试不收费。
每个请求会增加一小段固定开销,并在每个响应中单独报告,与供应商自身的耗时分开,您可以自行查看。
由您决定。可以将密钥限制为只使用某一区域的主机,无法在该区域处理的请求会被拒绝。