qwen-audio-3.0-asr-flash 会返回词级时间戳。
模型
两个模型都支持音频(
wav、mp3、m4a、aac、flac、ogg、opus、amr、wma 等)和视频(mp4、mov、mkv、avi、webm、flv、wmv)。传入视频时会自动转写其中的音轨——模型不理解画面内容。
时间戳是词级而非字级:中文按词切分(今天、给大家介绍),每个词带start/end。响应只返回一条覆盖整个文件的segment,字幕分行需要你自己按标点和停顿切。
快速开始
cURL
response_format 支持 json、text 和 verbose_json,只有 verbose_json 带时间戳。
带词级时间戳的响应(verbose_json)
建议先抽音轨再上传(推荐做法)
Upmore 是通过公网把请求转发给阿里百炼的,上游模型接收的是内联 Base64 data URI。由此带来三个后果:- 体积上限。内联 Base64 输入上限 10 MiB,约合原始文件 7.5 MB。1080p 视频通常远超这个体积。
- 带宽与成本。文件要先从你的客户端传到 Upmore,再由 Upmore 以 Base64(比原始大约 33%)发往阿里。网关的公网出流量是计费的,接近上限的上传,带宽成本可能和转写费本身相当。
- 内存。网关会把整个文件连同 Base64 副本(约 1.33 倍文件大小)缓冲在每个进行中的请求里。
* 按约 0.8 元/GB 的标价估算。46 秒的转写费是 0.0101 元,所以抽成 MP3 后上传,带宽成本约占转写费的 4%;而接近上限的 WAV 或 MP4 上传,带宽成本可能逼近转写费本身。
计费
按模型返回的音频时长计费:ceil(秒数) / 60 × 1000 个 token,再乘以模型倍率。按 0.00022 元/秒的标价,46 秒约 0.0101 元。传入视频时只按音频时长计费。
限制与说明
- 单次 5 分钟。更长的文件要切成 ≤5 分钟的片段,转写后把每段时间戳加上偏移量再拼接。(支持 12 小时长文件的异步
filetrans接口目前尚未开放。) - 仅支持文件上传。把 URL 当作
file的值传入,目前不支持。 - 只转语音。视频画面不会被分析。需要画面时间轴,请用视频理解模型(如
doubao-seed-2-1-pro),再把两条时间轴按时间戳合并。