10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 标签云 排行榜

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

网易有道Confucius4双榜第一:R2T2语音识别与T3PO实时翻译模型开源

1小时前 AI最新动态 7 0

Hugging Face 今年3月出的报告里,过去一年的模型下载,中国占了41%,美国是36.5%;Artificial Analysis 的开源权重模型榜,前六名全是中国实验室;OpenRouter 上按 token 量排,前五名里有四个是中国模型。

AI 时代,中国大模型公司的开源文化整得风生水起,跟海对面以闭源为主的生态形成了典型的对比。

前几天 Hugging Face 上语言相关模型分类下的两个趋势榜第一:Confucius4-R2T2 在自动语音识别,Confucius4-T3PO 在翻译。Hugging Face 上现在挂着 300 多万个模型,光自动语音识别这一个分类就有 3.6 万多个,翻译也有 1.7 万多个,趋势榜排的是最近这段时间谁最热。

图片 1

R2T2 做实时语音识别,放上去才两个礼拜左右,算是最近被追得最热的实时语音模型了。另一个 T3PO 是做实时翻译的,在翻译分类也还挂在第一。

图片 2

中国的开源模型,已经从通用大模型一路铺到了语音、翻译这些更细的方向上了。这两个模型来自网易有道,一个管实时转写的时候哪几个字可以先定下来,一个管同传的时候哪半句话可以先开口翻译。

一、R2T2:出了的字,就不再改

你只要开过实时字幕,大概都见过这个画面:一句话还没说完,字幕先冒出几个字,过半秒被改掉,改完又变,一整行字在那跳。其实呢,模型是边听边猜的,猜错了就回头改,这种做法一般叫伪流式;不想让字跳,就只能等一句话说完再上屏,字是稳了,但慢了好几秒。

R2T2 是 Real Real-Time Transcription 的缩写,是个真流式模型:每来一小段音频(80毫秒到2秒可调,默认160毫秒)就出字,没把握的字先不出,出了的字就是最终结果,之后不再改。

图片 3

「有没有把握」这个判断是训出来的。有道自己设计了一套训练数据,有稳定前缀数据、强制时间对齐数据和词元级音频切分数据,再配合最长稳定前缀(Longest Stable Prefix,LSP)的学习范式,让模型自己判断什么时候可以把一段字定下来、什么时候还得再听一会儿。

图片 4

模型卡里有一组数:把基座模型直接按 160 毫秒一段、出了不许改的方式来跑,英文 LibriSpeech clean 的错误率是 22.30%,中文会议场景是 20.38%;R2T2 在同样的条件下分别是 2.13% 和 7.27%。

图片 5

中文这张,R2T2 在 160 毫秒一段的设置下,质量优先档的错误率是 6.42%,延迟优先档把平均延迟压到了 0.32 秒;英文那张分别是 6.13% 和 0.21 秒。

图片 6

模型卡对这组结果的说法是,准确率接近离线识别,平均延迟在 200 到 600 毫秒之间。

二、T3PO:什么时候开口翻译

T3PO 是个 140 亿参数级的纯文本模型,接在 R2T2 这种流式 ASR 后面,ASR 每吐出一点英文,它就判断这时候要不要翻。

每次请求,把已经翻过的"原文¦译文"历史和当前还没翻的那截原文一起塞进去,模型输出空,就是 WAIT,接着等;输出了文字就是 TRANS,这一段定下来进历史,以后不再改。和 R2T2 一样,出去的字不收回。

我拿苹果 9 月发布会 iPhone Duo 那一段试了一下,按苹果官方的英文字幕一个词一个词往里喂:

图片 7

模型卡里说它主要靠两件事训出来:一是从普通的平行语料里自动构造出分段对齐的同传数据;二是一个"帕累托感知"的强化学习算法。等得越久翻得越准,但也越慢,这个 RL 大概就是在这两者之间找平衡。

英伟达 Q2 财报电话会上 CFO 讲资产负债表和下季度指引的那段,我用公开的逐字稿喂给它,145 次请求里它选了 101 次等、44 次开口。英文的 billion 翻成中文要换算成"亿",这段里 7 处 billion 的换算它全对:

图片 8

我是在自己的 MacBook Pro(M4 Pro,24GB 内存)上用 llama.cpp 跑的量化版,单次请求的中位数是 0.51 秒,这段话真人说完要 280 秒,它全部算完用了 138 秒,追得上语速。

三、我的视频管线里,ASR 干的活

我现在做 B 站视频有一整条生产线,写成了一个叫 huashu-video-pipeline 的 skill,其实里面有好几步都要用 ASR:出词级时间轴,字幕和剪辑切点都要靠它;带上下文转录,把专名转对;拿提词稿和实际转录对一遍,找出重录和口误,生成剪点候选。

我拿自己豆包工作那期视频的 20 分钟口播,中英夹杂、有重录有口癖,丢给有道部署在 Hugging Face 上的官方 demo 转了一遍。R2T2 原生支持把上下文和热词塞进 prompt,我分别跑了带术语表和不带的:

图片 9

"飞书"在口播里出现了 6 次,不带术语表对了 1 次,带上之后 6 次全对;"豆包工作"9 次,从 7 次对到 9 次全对。

两个模型串起来放在 Voice Agent(语音 agent)的最前面可能挺合适的:上游转出来的字不会改,下游的 LLM 就不用等你一句话彻底说完再开始想。也许在你话说到一半的时候,Agent 就可以开始查资料、做规划了。

参考资料

  • R2T2:https://huggingface.co/netease-youdao/Confucius4-R2T2
  • T3PO:https://huggingface.co/netease-youdao/Confucius4-T3PO
  • R2T2 在线试用:https://huggingface.co/spaces/netease-youdao/confucius4-r2t2-demo
  • R2T2 GitHub:https://github.com/netease-youdao/Confucius4-R2T2
  • T3PO GitHub:https://github.com/netease-youdao/Confucius4-T3PO
声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:网易有道Confucius4双榜第一:R2T2语音识别与T3PO实时翻译模型开源
#网易有道 #Confucius4 #R2T2 #T3PO #语音识别 #实时翻译 #HuggingFace 
收藏 1
Hypit开源项目:让AI Agent自动复刻爆款视频,改台词不用重排时间轴
腾讯QClaw宣布12月停运:AI办公内部赛马结束,WorkBuddy胜出
推荐阅读
  • Qwen-Audio-3.0-TTS 发布:16 语种+20 方言的开源 TTS 模型,Artificial Analysis 榜单夺冠
  • 2025年度AI报告合集|深度解读行业趋势与技术突破
  • Claude Opus 4.8 深度解析:从聊天机器人到自主工作系统的进化
  • 震惊!这个开源项目挖了Cursor、v0、Manus等完整的各大AI模型官方系统提示词
  • OpenAI Codex三大重磅更新:角色插件、Sites 网站生成、精准批注
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
34133 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
30740 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
23466 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
22901 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
21190 5月前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
18955 5月前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
18577 1年前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
18373 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
18154 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
16583 1年前

文章目录

关于苏米客
分类排行
1 腾讯QClaw宣布12月停运:AI办公内部赛马结束,WorkBuddy胜出
2 网易有道Confucius4双榜第一:R2T2语音识别与T3PO实时翻译模型开源
3 GPT-6 Sol实测:价格大幅下降但编码能力倒退,性价比成最大亮点
4 CLM-8B对比决策模型发布:延迟仅为Jev的九分之一,刷新SOTA
5 腾讯混元智囊团HyExpert上线:用行业专家知识优化大模型,兼职也能赚钱
6 Claude发现新型逆转录酶系统ART:AI Agent走进基础生物学未知地带
7 WorkBuddy登顶中国企业级桌面智能体第一:生态、安全、可控是三大关键优势
8 腾讯 WorkBuddy 月活破 2000 万背后:办公智能体的商业化难题与破局路径
9 热点模型性能测评:Jev、DeepSeek v4.1 flash 与 GLM 5.3 flashx 对比
10 腾讯 WorkBuddy 金融版上线:80+ 专属技能,定制金融行业 AI 工作台
苏米客
登录 注册
显示
没有账号? · 立即注册
显示
已有账号? · 直接登录
登录代表你已同意 用户协议 和 隐私政策
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6 网站地图 百度地图
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联