阿里排序模型
更新时间 2026-09-06 17:30:06
最近更新时间: 2026-09-06 17:30:06
本文介绍阿里排序模型调用API。
模型简介
排序(Rerank)模型用于检索系统召回阶段之后做二次精准重排序。向量召回为保证执行效率,返回候选文档相关性参差不齐;Rerank 模型接收用户查询 query 和一批召回文档,计算每篇文档与 query 的语义相关性分数,按照分数从高到低输出结果,提升 RAG、语义检索的最终准确率。
支持的模型
| 模型名称 | 简介 |
|---|---|
| qwen3‑rerank | 通义系列文本重排序模型,支持 100 + 语种,单请求最大 token 上限更高,作为 gte‑rerank 系列的升级替代方案,面向 RAG、多语言文本语义检索场景。 |
| gte‑rerank‑v2 | gte 系列文本重排序模型,支持 50 余语种,报文使用input/parameters嵌套结构,适用于中文为主的文本检索业务。 |
接口详情
qwen3‑rerank接口详情
http调用
请求方式:POST
请求路径:https://ai.ctaigw.cn/v1/reranks
请求头
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
| Content‑Type | string | 是 | 固定application/json |
| Authorization | string | 是 | Bearer ${YOUR_APP_KEY} |
请求参数
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
| model | string | 是 | 固定值:qwen3‑rerank |
| query | string | 是 | 查询文本,最大 4000token |
| documents | array[string] | 是 | 待排序候选文档字符串数组,最多 500 条 |
| top_n | int | 否 | 返回 top‑n 条结果,不传返回全部文档;若大于文档总数返回全部 |
| instruct | string | 否 | 自定义排序指令,英文,指导排序策略;默认问答检索模式。示例:Given a web search query, retrieve relevant passages that answer the query. |
响应参数
| 参数 | 类型 | 说明 |
|---|---|---|
| id | string | 请求唯一 ID,排查问题溯源 |
| object | string | 固定返回list |
| model | string | 调用的模型名称 |
| results | array | 排序结果数组,按 relevance_score 降序 |
| results.index | int | 输入 documents 数组原始下标 |
| results.relevance_score | double | 相关性分数 0‑1,越高越相关,仅本次请求内相对分值,不可跨请求对比 |
| usage | object | token 消耗统计 |
| usage.total_tokens | int | 本次总消耗 token,用于计费审计 |
gte-rerank-v2接口详情
http调用
请求方式:POST
请求路径:https://ai.ctaigw.cn/v1/services/rerank/text-rerank/text-rerank
请求头
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
| Content‑Type | string | 是 | 固定application/json |
| Authorization | string | 是 | Bearer ${YOUR_APP_KEY} |
请求参数
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
| model | string | 是 | 固定值:gte‑rerank‑v2 |
| input | object | 是 | 输入容器对象 |
| input.query | string | 是 | 查询文本,最大 4000token |
| input.documents | array[string] | 是 | 待排序候选文档字符串数组,最多 500 条 |
| parameters | object | 否 | 参数容器对象 |
| parameters.top_n | int | 否 | 返回 top‑n 条,不传返回全部文档 |
| parameters.return_documents | bool | 否 | 是否返回原文,默认 false,开启后返回 document 文本,增加返回报文大小 |
响应参数
| 参数 | 类型 | 说明 |
|---|---|---|
| request_id | string | 请求唯一 ID,排查溯源 |
| output | object | 输出对象 |
| output.results | array | 排序结果数组,分数降序 |
| output.index | int | 输入 documents 原始下标 |
| output.relevance_score | double | 相关性 0‑1,仅本次请求相对分数 |
| output.document | dict | 仅return_documents=true才返回; |
| usage | object | token 统计 |
| usage.total_tokens | int | 本次请求总 token 消耗 |
请求/响应示例
qwen3‑rerank示例
请求
curl --request POST \
--url https: //ai.ctaigw.cn/v1/reranks \
--header "Authorization: Bearer ${YOUR_APP_KEY}" \
--header "Content-Type: application/json" \
--data '{
"model": "qwen3-rerank",
"query": "Java接口如何降低RT,减少接口响应耗时?",
"documents": [
"Java接口可以通过线程池调优、减少同步锁、开启异步调用、合理使用缓存来降低接口RT。",
"Go语言使用goroutine实现轻量级并发,大幅提升服务并发处理能力。",
"MySQL通过索引优化、分库分表降低慢查询带来的数据库耗时。",
"避免Java接口中循环查询数据库,批量查询可以显著缩短整体响应时间。",
"Redis过期key淘汰策略支持volatile‑lru、allkeys‑lru等多种策略。",
"JVM调优调整堆内存大小、GC回收器,可以减少STW停顿,改善接口耗时。"
],
"top_n": 3,
"instruct": "Select paragraphs that describe java api response time optimization techniques."
}'成功响应
{
"object": "list",
"results": [
{
"index": 0,
"relevance_score": 0.8334521178273196
},
{
"index": 2,
"relevance_score": 0.24100082626411193
}
],
"model": "qwen3-rerank",
"id": "xxxxxxx",
"usage": {
"total_tokens": 200
}
}异常响应
{
"error": {
"type:": "Invalid_request",
"code": "missing_parameter",
"message": "Missing required parameters"
}
}qwen3‑rerank示例
请求
curl --location 'https: //ai.ctaigw.cn/v1/services/rerank/text-rerank/text-rerank' \
--header "Authorization: Bearer ${YOUR_APP_KEY}" \
--header 'Content-Type: application/json' \
--data '{
"model": "gte-rerank-v2",
"input": {
"query": "容器服务如何实现服务优雅下线",
"documents": [
"Kubernetes中配置preStop钩子可以实现容器优雅关闭,等待业务处理完现有请求。",
"Mit PreStop‑Hook kann die Anwendung vor dem Beenden Anfragen abschließen.",
"Nginx支持长连接配置,可调整keepalive参数。",
"Docker镜像多阶段构建可以有效缩小镜像体积。",
"Kubernetes terminationGracePeriodSeconds 设置优雅等待超时时间。"
]
},
"parameters": {
"return_documents": true,
"top_n": 2
}
}'成功响应
{
"output": {
"results": [
{
"document": {
"text": "Java接口可以通过线程池调优、减少同步锁、开启异步调用、合理使用缓存来降低接口RT。"
},
"index": 0,
"relevance_score": 0.95623
},
{
"document": {
"text": "避免Java接口中循环查询数据库,批量查询可以显著缩短整体响应时间。"
},
"index": 3,
"relevance_score": 0.92144
},
{
"document": {
"text": "JVM调优调整堆内存大小、GC回收器,可以减少STW停顿,改善接口耗时。"
},
"index": 5,
"relevance_score": 0.87302
}
]
},
"usage": {
"total_tokens": 312
},
"request_id": "xxxxx"
}