活动

天翼云最新优惠活动,涵盖免费试用,产品折扣等,助您降本增效!
热门活动
  • 818 天翼云云智盛典 NEW 爆款云主机低至1.5折起,Token套餐低至9.9元/月起
  • 安全隔离版OpenClaw NEW OpenClaw云服务器专属“龙虾“套餐低至1.5折起
  • 聚力AI赋能 天翼云大模型专项 大模型特惠专区·Token Plan 轻享包低至9.9元起
  • 青云志云端助力计划 NEW 一站式科研助手,海外资源安全访问平台,助力青年翼展宏图,平步青云
  • 企业出海解决方案 NEW 助力您的业务扬帆出海,通达全球!
  • 天翼云信创专区 NEW “一云多芯、一云多态”,国产化软件全面适配,国产操作系统及硬件芯片支持丰富
  • 云上钜惠 爆款云主机全场特惠,2核4G只要1.8折起!
  • 天翼云奖励推广计划 加入成为云推官,推荐新用户注册下单得现金奖励
免费活动
  • 免费试用中心 HOT 多款云产品免费试用,快来开启云上之旅
  • 天翼云用户体验官 NEW 您的洞察,重塑科技边界

息壤智算

领先开放的智算服务平台,提供算力、平台、数据、模型、应用“五位一体”智算服务体系,构建全流程的AI基础设施能力
星辰TokenHub
  • 模型广场
  • 体验中心
  • 服务接入
星辰MaaS平台
  • 星辰MaaS智能体平台
  • 星辰大模型
大模型
  • glm-5.3-flash
  • GLM-5.2
  • deepseek-v4-pro-0813
  • deepseek-v4-flash-0713-new
  • qwen3.8-flash
AI Store
  • 算力市场
  • 模型市场
  • 应用市场
应用托管
  • 天翼云DramaFlow2.0
  • 应用实例
科研助手
  • 开发机
  • 并行计算
训推服务
  • 模型开发
  • 训练任务
  • 服务部署
智能体引擎
  • 智能体引擎
可信数据空间
  • 可信数据空间
公共算力服务
  • 裸金属
  • 定制裸金属
智算一体机
  • 智算一体机
模型适配专家服务
  • 模型适配专家服务
算力服务商
  • 入驻算力服务商

应用商城

天翼云精选行业优秀合作伙伴及千余款商品,提供一站式云上应用服务
进入甄选商城进入AI Store公有云生态专区智云上海应用生态专区
建站工具
  • 新域名服务
  • SSL证书
  • 翼建站
企业办公
  • 智教云电脑
  • WPS 365 天翼云版
灾备迁移
  • 云管家2.0
  • 翼备份(SaaS版)
  • 琥珀数据压缩归档服务
智慧教育
  • 智擎思政平台(个人版)
  • 智擎研学平台(个人基础版)

定价

协助您快速了解云产品计费模式、价格详情,轻松预估上云成本
价格计算器
  • 动态测算产品价格
定价策略
  • 快速了解计费模式

合作伙伴

天翼云携手合作伙伴,共创云上生态,合作共赢
天翼云生态合作中心
  • 天翼云生态合作中心
天翼云渠道合作伙伴
  • 天翼云代理渠道合作伙伴
天翼云服务合作伙伴
  • 天翼云集成商交付能力认证
天翼云应用合作伙伴
  • 天翼云甄选商城合作伙伴
天翼云技术合作伙伴
  • 天翼云OpenAPI中心
天翼云培训认证
  • 天翼云学堂
天翼信创云专区
  • 信创云专区
  • 适配互认证

开发者

开发者相关功能入口汇聚
技术社区
  • 专栏文章
  • 互动问答
  • 技术视频
资源与工具
  • OpenAPI中心
培训与认证
  • 天翼云学堂
  • 天翼云认证
开源社区
  • 魔乐社区
  • OpenTeleDB

支持与服务

为您提供全方位支持与服务,全流程技术保障,助您轻松上云,安全无忧
文档与工具
  • 文档中心
  • 新手上云
  • 自助服务
  • OpenAPI中心
定价
  • 价格计算器
  • 定价策略
基础服务
  • 售前咨询
  • 在线支持
  • 在线支持
  • 工单服务
  • 服务保障
  • 会员中心
增值服务
  • 红心服务
  • 首保服务
  • 客户支持计划
  • 专家技术服务
  • 备案管家
我要反馈
  • 建议与反馈
  • 用户体验官
信息公告
  • 客户公告

了解天翼云

天翼云秉承央企使命,致力于成为数字经济主力军,投身科技强国伟大事业,为用户提供安全、普惠云服务
品牌介绍
  • 关于天翼云
  • 智算云
  • 新闻资讯
  • 天翼云APP
基础设施
  • 全球基础设施
  • 信任中心
最佳实践
  • 精选案例
  • 超级探访
  • 云杂志
  • 分析师和白皮书
  • 天翼云·创新直播间
市场活动
  • 2026智能云生态大会
  • 2025智能云生态大会
  • 2024智算云生态大会
  • 2023云生态大会
  • 2022云生态大会
  • 天翼云中国行
天翼云
  • 活动
  • 息壤智算
  • 产品
  • 解决方案
  • 应用商城
  • 定价
  • 合作伙伴
  • 开发者
  • 支持与服务
  • 了解天翼云
      • 文档
      • 控制中心
      • 备案
      • 管理中心
      文档中心

      星辰TokenHub运营服务平台

      星辰TokenHub运营服务平台

      • 星辰TokenHub运营服务平台

      无数据

        • 产品动态
        • 产品介绍
        • 产品定义
        • 产品优势
        • 功能特性
        • 应用场景
        • 术语解释
        • 使用限制
        • 计费说明
        • 按需计费模式-按量付费
        • 包周期计费模式-编程Token Plan
        • 包周期计费模式-Tokens量包
        • 按需计费模式-卡时
        • 包周期计费模式-卡时
        • 产品退订
        • 快速入门
        • 准备工作
        • 快速入门
        • 用户指南
        • 编程Token Plan
        • 套餐概述
        • 快速开始
        • 接入AI工具
        • OpenClaw
        • Claude Code
        • OpenCode
        • Cursor
        • Cline
        • Chatbox
        • Codebuddy
        • Trae
        • Hermes Agent
        • Codex桌面版
        • 编程Token Plan常见问题
        • Token Plan
        • 套餐介绍
        • 快速开始
        • 接入AI工具
        • OpenClaw
        • OpenCode
        • Cursor
        • Cline
        • Chatbox
        • codebuddy
        • Trae
        • Hermes Agent
        • Codex桌面版
        • 常见问题
        • 智算广场
        • 模型广场
        • MCP广场
        • 体验中心
        • 模型体验
        • MCP体验
        • 模型服务
        • 服务接入
        • 在线推理
        • 缓存命中
        • 调用监控
        • 用量统计
        • 系统管理
        • 权限管理
        • 限额管理
        • 最佳实践
        • 第三方工具添加模型配置指南
        • DeepSeek模型调用-快捷版
        • DeepSeek模型调用-专业版
        • 基于息壤的企业级RAG知识库构建指南
        • API参考
        • 推理服务API
        • 如何调用API
        • 错误码(新版)
        • 错误码(旧版)
        • API
        • 文本生成
        • OpenAI兼容-Chat
        • Anthropic兼容-Messages
        • Chat对话API(旧版)
        • 图像生成
        • Seedream生图API
        • Wan图像生成与编辑
        • Qwen文生图API
        • Qwen图像编辑API
        • Image文本生图API(旧版)
        • 视频生成
        • MiniMax生视频API
        • Seedance生视频API
        • HappyHorse
        • HappyHorse-文生视频API
        • HappyHorse-图生视频API
        • HappyHorse-参考生视频API
        • HappyHorse-视频编辑API
        • 万相
        • 万相2.7-视频生成API
        • 万相(2.1-2.6)-文生视频API
        • 万相(2.1-2.6)-图生视频API
        • 万相(2.1-2.6)-参考生视频API
        • 万相-视频换人
        • 语音模型
        • Qwen非实时语音识别(同步接口)
        • Qwen非实时语音识别(异步接口)
        • 向量与排序
        • 阿里文本向量
        • 阿里多模态向量
        • 阿里排序模型
        • BGE文本向量
        • BGE重排序API
        • 模型列表API
        • 平台OpenAPI
        • 平台功能API使用说明
        • 常见问题
        • 计费类
        • 操作类
        • 权限类
        • 平台升级与用户割接说明
        • 联系我们
        • 相关协议
        • 天翼云星辰TokenHub运营服务平台服务协议
        • 天翼云星辰TokenHub运营服务平台用户信息处理规则
        • 生成式人工智能服务备案信息参考
        • 人工智能大模型备案指南
        • 文档下载
          无相关产品

          本页目录

          帮助中心 星辰TokenHub运营服务平台 API参考 推理服务API API 向量与排序 阿里排序模型
          阿里排序模型
          更新时间 2026-09-06 17:30:06
          • 新浪微博
          • 微信
            扫码分享
          • 复制链接
          最近更新时间: 2026-09-06 17:30:06
          分享文章
          • 新浪微博
          • 微信
            扫码分享
          • 复制链接
          本文介绍阿里排序模型调用API。

          模型简介

          排序(Rerank)模型用于检索系统召回阶段之后做二次精准重排序。向量召回为保证执行效率,返回候选文档相关性参差不齐;Rerank 模型接收用户查询 query 和一批召回文档,计算每篇文档与 query 的语义相关性分数,按照分数从高到低输出结果,提升 RAG、语义检索的最终准确率。

          支持的模型

          模型名称简介
          qwen3‑rerank通义系列文本重排序模型,支持 100 + 语种,单请求最大 token 上限更高,作为 gte‑rerank 系列的升级替代方案,面向 RAG、多语言文本语义检索场景。
          gte‑rerank‑v2gte 系列文本重排序模型,支持 50 余语种,报文使用input/parameters嵌套结构,适用于中文为主的文本检索业务。

          接口详情

          qwen3‑rerank接口详情

          http调用

          请求方式:POST

          请求路径:https://ai.ctaigw.cn/v1/reranks

          请求头

          参数类型必填说明
          Content‑Typestring是固定application/json
          Authorizationstring是Bearer ${YOUR_APP_KEY}

          请求参数

          参数类型必填说明
          modelstring是固定值:qwen3‑rerank
          querystring是查询文本,最大 4000token
          documentsarray[string]是待排序候选文档字符串数组,最多 500 条
          top_nint否返回 top‑n 条结果,不传返回全部文档;若大于文档总数返回全部
          instructstring否自定义排序指令,英文,指导排序策略;默认问答检索模式。示例:Given a web search query, retrieve relevant passages that answer the query.

          响应参数

          参数类型说明
          idstring请求唯一 ID,排查问题溯源
          objectstring固定返回list
          modelstring调用的模型名称
          resultsarray排序结果数组,按 relevance_score 降序
          results.indexint输入 documents 数组原始下标
          results.relevance_scoredouble相关性分数 0‑1,越高越相关,仅本次请求内相对分值,不可跨请求对比
          usageobjecttoken 消耗统计
          usage.total_tokensint本次总消耗 token,用于计费审计

          gte-rerank-v2接口详情

          http调用

          请求方式:POST

          请求路径:https://ai.ctaigw.cn/v1/services/rerank/text-rerank/text-rerank

          请求头

          参数类型必填说明
          Content‑Typestring是固定application/json
          Authorizationstring是Bearer ${YOUR_APP_KEY}

          请求参数

          参数类型必填说明
          modelstring是固定值:gte‑rerank‑v2
          inputobject是输入容器对象
          input.querystring是查询文本,最大 4000token
          input.documentsarray[string]是待排序候选文档字符串数组,最多 500 条
          parametersobject否参数容器对象
          parameters.top_nint否返回 top‑n 条,不传返回全部文档
          parameters.return_documentsbool否是否返回原文,默认 false,开启后返回 document 文本,增加返回报文大小

          响应参数

          参数类型说明
          request_idstring请求唯一 ID,排查溯源
          outputobject输出对象
          output.resultsarray排序结果数组,分数降序
          output.indexint输入 documents 原始下标
          output.relevance_scoredouble相关性 0‑1,仅本次请求相对分数
          output.documentdict仅return_documents=true才返回;
          usageobjecttoken 统计
          usage.total_tokensint本次请求总 token 消耗

          请求/响应示例

          qwen3‑rerank示例

          请求

          curl --request POST \
           --url https: //ai.ctaigw.cn/v1/reranks \
           --header "Authorization: Bearer ${YOUR_APP_KEY}" \
           --header "Content-Type: application/json" \
           --data '{
              "model": "qwen3-rerank",
              "query": "Java接口如何降低RT,减少接口响应耗时?",
              "documents": [
                  "Java接口可以通过线程池调优、减少同步锁、开启异步调用、合理使用缓存来降低接口RT。",
                  "Go语言使用goroutine实现轻量级并发,大幅提升服务并发处理能力。",
                  "MySQL通过索引优化、分库分表降低慢查询带来的数据库耗时。",
                  "避免Java接口中循环查询数据库,批量查询可以显著缩短整体响应时间。",
                  "Redis过期key淘汰策略支持volatile‑lru、allkeys‑lru等多种策略。",
                  "JVM调优调整堆内存大小、GC回收器,可以减少STW停顿,改善接口耗时。"
              ],
              "top_n": 3,
              "instruct": "Select paragraphs that describe java api response time optimization techniques."
          }'

          成功响应

          {
              "object": "list",
              "results": [
                  {
                      "index": 0,
                      "relevance_score": 0.8334521178273196
                  },
                  {
                      "index": 2,
                      "relevance_score": 0.24100082626411193
                  }
              ],
              "model": "qwen3-rerank",
              "id": "xxxxxxx",
              "usage": {
                  "total_tokens": 200
              }
          }

          异常响应

          {
              "error": {
                  "type:": "Invalid_request",
                  "code": "missing_parameter",
                  "message": "Missing required parameters"
              }
          }

          qwen3‑rerank示例

          请求

          curl --location 'https: //ai.ctaigw.cn/v1/services/rerank/text-rerank/text-rerank' \
          --header "Authorization: Bearer ${YOUR_APP_KEY}" \
          --header 'Content-Type: application/json' \
          --data '{
              "model": "gte-rerank-v2",
              "input": {
                  "query": "容器服务如何实现服务优雅下线",
                  "documents": [
                      "Kubernetes中配置preStop钩子可以实现容器优雅关闭,等待业务处理完现有请求。",
                      "Mit PreStop‑Hook kann die Anwendung vor dem Beenden Anfragen abschließen.",
                      "Nginx支持长连接配置,可调整keepalive参数。",
                      "Docker镜像多阶段构建可以有效缩小镜像体积。",
                      "Kubernetes terminationGracePeriodSeconds 设置优雅等待超时时间。"
                  ]
              },
              "parameters": {
                  "return_documents": true,
                  "top_n": 2
              }
          }'

          成功响应

          {
              "output": {
                  "results": [
                      {
                          "document": {
                              "text": "Java接口可以通过线程池调优、减少同步锁、开启异步调用、合理使用缓存来降低接口RT。"
                          },
                          "index": 0,
                          "relevance_score": 0.95623
                      },
                      {
                          "document": {
                              "text": "避免Java接口中循环查询数据库,批量查询可以显著缩短整体响应时间。"
                          },
                          "index": 3,
                          "relevance_score": 0.92144
                      },
                      {
                          "document": {
                              "text": "JVM调优调整堆内存大小、GC回收器,可以减少STW停顿,改善接口耗时。"
                          },
                          "index": 5,
                          "relevance_score": 0.87302
                      }
                  ]
              },
              "usage": {
                  "total_tokens": 312
              },
              "request_id": "xxxxx"
          }
          文档反馈

          建议您登录后反馈,可在建议与反馈里查看问题处理进度

          鼠标选中文档,精准反馈问题

          选中存在疑惑的内容,即可快速反馈问题,我们会跟进处理

          知道了

          上一篇 :  阿里多模态向量
          下一篇 :  BGE文本向量
          搜索 关闭
          ©2026 天翼云科技有限公司版权所有 增值电信业务经营许可证A2.B1.B2-20090001
          公司地址:北京市东城区青龙胡同甲1号、3号2幢2层205-32室
          备案 京公网安备11010802043424号 京ICP备 2021034386号
          ©2026天翼云科技有限公司版权所有
          京ICP备 2021034386号
          备案 京公网安备11010802043424号
          增值电信业务经营许可证A2.B1.B2-20090001
          用户协议 隐私政策 法律声明