Skip to main content
Aggregate OSChina 开源资讯 鸿蒙 11 Sep 2026 - 18:02

小米开源工业级目标说话人语音识别大模型 CocktailASR-1,解决鸡尾酒会难题

RSS 官方收录 · 可信分层展示

关键摘要

把一个人声从嘈杂的人群中剥离出来,人类的听觉系统做这件事毫不费力。但对 ASR 模型来说,多人同时讲话的场景至今是一个未被充分解决的难题。小米刚刚开源的 CocktailASR-1,做出了一个有意思的尝试:不是做"更好的降噪",而是从根本上改变任务的输入——先告诉模型你要听谁说话,再让模型只输出那个人的话。 这就是目标...

规则摘要 · 来源可核验

正文提要

把一个人声从嘈杂的人群中剥离出来,人类的听觉系统做这件事毫不费力。但对 ASR 模型来说,多人同时讲话的场景至今是一个未被充分解决的难题。小米刚刚开源的 CocktailASR-1,做出了一个有意思的尝试:不是做"更好的降噪",而是从根本上改变任务的输入——先告诉模型你要听谁说话,再让模型只输出那个人的话。 这就是目标...

来源:https://www.oschina.net/news/502427/xiaomi-cocktailasr-1

打开官方原文 站点原文页 可信分区 本信源更多 今日简报 分享图 RSS 稍后再看列表