1、bge-reranker-large模型配置失败
日志明细:Verification failed, please check whether the parameters are correct: headers: {‘date’: ‘Thu, 24 Sep 2026 07:29:46 GMT’, ‘server’: ‘istio-envoy’, ‘x-request-id’: ‘9b09b8b6-2fed-4caa-ab41-2f34f8274541’, ‘content-length’: ‘0’}, status_code: 404, body: ×
失败原因:
url地址配置上画蛇添足,手动加入了模型自动会添加后缀名。
Keytime 界面填写内容:
API URL 填的:<code>http://ai-network-qwen.top/rerankerpath/v1/rerank</code>
Keytime 内部逻辑:Keytime 的 Rerank 适配器,会把填写的 API URL 当做 base_url,再在后面拼接上自己固定的后缀 <code>/rerank</code>
最终真实的访问地址变成:<code>http://ai-network-qwen.top/rerankerpath/v1/rerank/rerank</code>
多拼接了一层<code>/rerank</code>,这个 endpoint 不存在 → istio 返回 404!!这就是 404 根因。
解决方案:
严格按照配置信息填写,不要画蛇添足。

2、stream_idle_timeout 模型休闲超时
日志明细:
llm_service_duration\":180001
"response_code_details":"stream_idle_timeout",
复现背景:
部署框架:sglang,真武ppu,2 * 96GB,20cores 200GB内存
以上是我切qwen3.6-35B-A3B到qwen3.8-27B模型之后,一些同事遇到的请求超时的问题。从日志看,
就是stream_idle_timeout被设置为180s,超过这个值,就被停止响应了。这个值可以改吗?但是在哪里改?
失败原因:
上下文太长,导致prefill任务阶段,处理时间过长,一点都不输出给用户,导致触发空闲超时。
生成速度慢、超长冷 prompt prefill导致的超时两个问题
解决方案:
1、设置心跳保活
2、修改网关stream_idle_timeout的值
3、提高缓存命中率
3、DSML
目前PAI-EAS已经支持部署模型:DeepSeek-V4-Flash-INT8-W8A8。但是有同事反馈,这个模型不支持工具的调用,但是又有DSML格式的问题存在
部署刚新出的模型,一般都不适配,比如ds
原因定位:
部署刚新出的模型,显卡不适配
解决方案:
等ppu供应商基于自己的显卡做了适配之后,再去部署
4、镜像落后
背景:
DSW的vllm和sglang的版本过低,qwen-rerank-8B模型部署不了,这事能解决吗?DSW是断网环境,我只能到内置的镜像库里面找。但是vllm镜像版本过低,无法部署。
原因定位:
每个厂商自己的系统的镜像一般都落后于市场,比如DSW自部署就需要llm或者sglang的镜像文件。太低版本会导致一些最新模型无法部署(部署的参数命令都不对)
解决方案:
试试这里面的镜像,在DSW里面写镜像地址:
英伟达:
<code>https://help.aliyun.com/zh/cs/user-guide/acs-ai-container-image-version-release-record/?spm=a2c4g.11186623.help-menu-2584271.d_2_5_5_0.49fa1f26VkIwL8</code>
ppu:
https://help.aliyun.com/zh/document_detail/2864774.html?spm=a2c4g.11186623.help-menu-2864431.d_2_3_1_0.2ccbea73n4wq9l