🚦 自建 LLM 放量

模型采样参数

全局作用于阿里云和自建 LLM;单次请求显式传参时仍以请求参数优先。保存后通过 Nacos 热更新,无需重启。

0 更稳定,值越高越发散;范围 0–2。
只从累计概率范围内采样;范围 0.01–1。

LLM 影子流量

按真实请求异步复制到指定模型,影子结果不会返回给用户;失败、超时和过载均与主链路隔离。保存后通过 Nacos 热更新。

每条命中的真实请求复制几份。
超过上限立即 shed,不排队。

客户 API Key → 自建 LLM 放量

默认把整个 API Key 切到 turing-llm-next(100%)。高流量客户可以先调低比例、逐步放量。 其余流量走阿里云;自建 LLM 不可用时自动回退阿里云。不在表里的客户全部走阿里云。

客户 API Key放量到自建 LLM规则开关

自建 LLM 放量控制台

使用与工单系统相同的图灵 SSO 登录。

使用钉钉 SSO 登录