您好,欢迎来到武汉站!
首页商业资讯 › 千问五款语音模型齐发,全线降价最高9…

千问五款语音模型齐发,全线降价最高95%

分类:商业资讯地区:全国发布:2026-09-23浏览:6

语音大模型赛道的竞争,正在从能力比拼延伸到价格层面。千问正式推出Qwen-Audio-3.1系列语音大模型,一次性发布五款新模型,同时对全线语音模型价格进行大幅下调,最高降幅达到95%。这一动作既是对自身音频能力栈的补全,也向市场释放出降低语音AI使用门槛的信号。

一次发布五款模型,补齐音频能力栈

从本次发布的内容看,千问并未止步于单一模型的迭代,而是围绕音频场景做了体系化布局。升级覆盖语音识别(ASR)、语音合成(TTS)和实时语音交互(Realtime)三大核心方向,并新增两款面向细分场景的模型:音频创作模型Qwen-Audio-3.1-TTS-Next和音频理解模型Qwen-Audio-3.1-ASR-Next。

五款模型组合在一起,形成了从“理解”到“生成”,再到“交互”与“创作”的完整链路。这种能力栈式的产品结构,意味着开发者可以在同一技术体系内完成多种音频任务的调用,而不必在不同厂商、不同接口之间反复切换。对于需要构建语音应用的团队而言,集成复杂度和维护成本都有望下降。

价格下调,降幅最大的是ASR

与模型发布同样值得关注的,是价格策略的调整。根据线索信息,Qwen-Audio全线语音模型价格均下调,且不同方向的降幅差异明显:

  • TTS(语音合成)降价约70%;
  • Realtime(实时语音交互)降幅约85%;
  • ASR(语音识别)降幅达95%。

其中ASR接近“打一折”的降幅最为突出。语音识别是许多AI应用的基础环节,例如会议记录、客服质检、字幕生成、语音输入等,调用量往往较大,成本敏感度高。识别价格大幅下探,可能使此前因成本顾虑而受限的场景变得可行。

实时语音交互约85%的降幅同样具有指向性。实时交互对延迟和并发要求较高,单位成本通常高于普通识别或合成任务,价格下降有助于语音助手、实时翻译、在线教育等交互型产品的规模化尝试。

对行业与企业的几点影响

从产业视角看,头部厂商在模型能力升级的同时推动价格下行,往往会带来几方面连锁反应。

一是应用侧创新空间扩大。语音能力的调用成本降低后,中小开发者和创业团队更容易将语音功能纳入产品设计,尤其是在教育、客服、内容创作、无障碍工具等对语音有刚性需求的领域。

二是竞争焦点可能从“有没有”转向“用得起、用得好”。当基础语音能力逐渐普及,厂商之间的差异将更多体现在识别准确率、合成自然度、交互流畅度以及工程稳定性上,价格只是入场条件之一。

三是企业选型需要更理性。降价并不等于总成本必然下降,实际支出还与调用量、并发规模、数据合规、迁移成本等因素相关。企业在评估时,宜结合自身业务场景做小范围验证,而非仅凭价格标签做决策。

点评

千问此次以“五款模型+全线降价”的组合出击,显示出语音大模型正在进入能力与成本同步优化的阶段。对开发者而言,这是降低尝试门槛的窗口期;对行业而言,价格下探会加速语音能力的普及,但最终能否留住用户,仍取决于模型在真实场景中的稳定表现与配套服务能力。语音赛道的下一轮较量,大概率会落在工程化落地与生态建设上。

信息来源:36氪快讯