Skip to main content
Doubao Embedding Vision 是字节跳动的多模态向量化模型,通过 Upmore 以标准 embeddings 接口(/v1/embeddings)提供服务。将文本和图片映射到同一个 2048 维向量空间,适合图文检索与语义搜索。

核心能力

  • 多模态输入 — 文本、图片或图文混合输入,输出一个向量
  • 统一向量空间 — 文本向量与图片向量可直接比较
  • 2048 维 — 固定输出维度
  • 图文分价 — 文本输入与视觉输入分开计价,usage 按类型分别上报

快速示例

与普通向量化模型不同,input内容对象数组(方舟多模态格式),不是纯字符串。纯文本也用这个格式:[{"type": "text", "text": "..."}]。一次请求对整个输入返回一个融合向量

参数说明

响应说明

API 参考

查看可交互的 API Playground。