星空体育·(StarSky Sports)官方网站-星空官方认证

阶跃星辰最强开源端到端语音大模型:开启终端人机交互语音新范式-星空体育官方网站

新闻资讯
质量为本、客户为根、勇于拼搏、务实创新

阶跃星辰最强开源端到端语音大模型:开启终端人机交互语音新范式

日期:2025-09-02 浏览: 

  据IPO早知道消息,阶跃星辰日前正式发布最强开源端到端语音大模型 Step-Audio 2 mini,该模型在多个国际基准测试集上取得 SOTA(State-of-The-Art,即当前最佳水平)成绩。在技术层面,Step-Audio 2 mini 采用了真正的端到端多模态架构,并将语音理解、音频推理与生成统一建模,不仅时延更低、输出更快,还能更加精准地理解副语言信息、非人声信号等星空体育 星空体育平台语音要素,显著提升了语音人机交互的效率和智能上限。目前,Step-Audio 2 mini 已经可在 GitHub、Hugging Face 等平台下载并体验。

阶跃星辰最强开源端到端语音大模型:开启终端人机交互语音新范式(图1)

  根据测评,这款模型在音频理解、语音识别、跨语种翻译、情感与副语言解析、等任务中表现突出,综合性能超越 Qwen-Omni 、Kimi-Audio 在内的所有开源端到端语音模型,并在大部分任务上超越 GPT-4o-audio。

  随着语音交互成为人机主要交互方式,智能终端设备对语音模型的智商及情商水平提出了更高要求。Step-Audio 2 mini 首创了音频推理能力,能对情绪、语调、音乐等副语言和非语音信号进行精细理解、推理并自然回应,由此让 AI 听懂人类的“弦外之音”;同时,该模型率先支持语音原生的 Tool Calling 能力,可实现联网搜索等操作,有效解决模型幻觉问题,并让语音模型像文本模型一样具有更强大的知识储备和推理能力。

  在此之前,吉利发布了搭载阶跃星辰端到端语音大模星空体育 星空体育平台型的吉利银河 M9,这是行业内端到端语音大模型首次实现量产上车。据阶跃星辰相关人士介绍,自去年发布国内首个千亿参数端到端语音大模型 Step-1o Audio 以来,该公司持续迭代模型性能,并跟吉利、鲸鱼机器人、TCL、Cyan 青心意创等头部终端厂商达成深度合作,让语音大模型在生活场景中为消费者提供更加智能、便捷的互动体验。

  今年以来,阶跃星辰已经开源了 8 款性能领先的多模态模型,覆盖语音、视频生成、图像编辑、3D、多模态推理等多个类别,为全球开源社区贡献多模态力量。

  特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

  罗翔:钱没了可以再挣,工作没了可以再找,朋友没了可以再交,你生来就一无所有,何惧从头再来......

  12架歼10C加60枚霹雳15,孟加拉若下单,印空军将被歼10三面包围

  《编码物候》展览开幕 北京时代美术馆以科学艺术解读数字与生物交织的宇宙节律

  华硕带来白色款 Prime RX 9070 XT OC 显卡,基于原版相同模具

  realme Watch 5配置、渲染图曝光:1.97英寸AMOLED屏、14天续航

  跑满AMD R9 9950X3D!蓝宝石PURE极地B850A WIFI主板图赏