Hugging Face 今年3月出的报告里,过去一年的模型下载,中国占了41%,美国是36.5%;Artificial Analysis 的开源权重模型榜,前六名全是中国实验室;OpenRouter 上按 token 量排,前五名里有四个是中国模型。
AI 时代,中国大模型公司的开源文化整得风生水起,跟海对面以闭源为主的生态形成了典型的对比。
前几天 Hugging Face 上语言相关模型分类下的两个趋势榜第一:Confucius4-R2T2 在自动语音识别,Confucius4-T3PO 在翻译。Hugging Face 上现在挂着 300 多万个模型,光自动语音识别这一个分类就有 3.6 万多个,翻译也有 1.7 万多个,趋势榜排的是最近这段时间谁最热。

R2T2 做实时语音识别,放上去才两个礼拜左右,算是最近被追得最热的实时语音模型了。另一个 T3PO 是做实时翻译的,在翻译分类也还挂在第一。

中国的开源模型,已经从通用大模型一路铺到了语音、翻译这些更细的方向上了。这两个模型来自网易有道,一个管实时转写的时候哪几个字可以先定下来,一个管同传的时候哪半句话可以先开口翻译。
一、R2T2:出了的字,就不再改
你只要开过实时字幕,大概都见过这个画面:一句话还没说完,字幕先冒出几个字,过半秒被改掉,改完又变,一整行字在那跳。其实呢,模型是边听边猜的,猜错了就回头改,这种做法一般叫伪流式;不想让字跳,就只能等一句话说完再上屏,字是稳了,但慢了好几秒。
R2T2 是 Real Real-Time Transcription 的缩写,是个真流式模型:每来一小段音频(80毫秒到2秒可调,默认160毫秒)就出字,没把握的字先不出,出了的字就是最终结果,之后不再改。

「有没有把握」这个判断是训出来的。有道自己设计了一套训练数据,有稳定前缀数据、强制时间对齐数据和词元级音频切分数据,再配合最长稳定前缀(Longest Stable Prefix,LSP)的学习范式,让模型自己判断什么时候可以把一段字定下来、什么时候还得再听一会儿。

模型卡里有一组数:把基座模型直接按 160 毫秒一段、出了不许改的方式来跑,英文 LibriSpeech clean 的错误率是 22.30%,中文会议场景是 20.38%;R2T2 在同样的条件下分别是 2.13% 和 7.27%。

中文这张,R2T2 在 160 毫秒一段的设置下,质量优先档的错误率是 6.42%,延迟优先档把平均延迟压到了 0.32 秒;英文那张分别是 6.13% 和 0.21 秒。

模型卡对这组结果的说法是,准确率接近离线识别,平均延迟在 200 到 600 毫秒之间。
二、T3PO:什么时候开口翻译
T3PO 是个 140 亿参数级的纯文本模型,接在 R2T2 这种流式 ASR 后面,ASR 每吐出一点英文,它就判断这时候要不要翻。
每次请求,把已经翻过的"原文¦译文"历史和当前还没翻的那截原文一起塞进去,模型输出空,就是 WAIT,接着等;输出了文字就是 TRANS,这一段定下来进历史,以后不再改。和 R2T2 一样,出去的字不收回。
我拿苹果 9 月发布会 iPhone Duo 那一段试了一下,按苹果官方的英文字幕一个词一个词往里喂:

模型卡里说它主要靠两件事训出来:一是从普通的平行语料里自动构造出分段对齐的同传数据;二是一个"帕累托感知"的强化学习算法。等得越久翻得越准,但也越慢,这个 RL 大概就是在这两者之间找平衡。
英伟达 Q2 财报电话会上 CFO 讲资产负债表和下季度指引的那段,我用公开的逐字稿喂给它,145 次请求里它选了 101 次等、44 次开口。英文的 billion 翻成中文要换算成"亿",这段里 7 处 billion 的换算它全对:

我是在自己的 MacBook Pro(M4 Pro,24GB 内存)上用 llama.cpp 跑的量化版,单次请求的中位数是 0.51 秒,这段话真人说完要 280 秒,它全部算完用了 138 秒,追得上语速。
三、我的视频管线里,ASR 干的活
我现在做 B 站视频有一整条生产线,写成了一个叫 huashu-video-pipeline 的 skill,其实里面有好几步都要用 ASR:出词级时间轴,字幕和剪辑切点都要靠它;带上下文转录,把专名转对;拿提词稿和实际转录对一遍,找出重录和口误,生成剪点候选。
我拿自己豆包工作那期视频的 20 分钟口播,中英夹杂、有重录有口癖,丢给有道部署在 Hugging Face 上的官方 demo 转了一遍。R2T2 原生支持把上下文和热词塞进 prompt,我分别跑了带术语表和不带的:

"飞书"在口播里出现了 6 次,不带术语表对了 1 次,带上之后 6 次全对;"豆包工作"9 次,从 7 次对到 9 次全对。
两个模型串起来放在 Voice Agent(语音 agent)的最前面可能挺合适的:上游转出来的字不会改,下游的 LLM 就不用等你一句话彻底说完再开始想。也许在你话说到一半的时候,Agent 就可以开始查资料、做规划了。
参考资料
- R2T2:https://huggingface.co/netease-youdao/Confucius4-R2T2
- T3PO:https://huggingface.co/netease-youdao/Confucius4-T3PO
- R2T2 在线试用:https://huggingface.co/spaces/netease-youdao/confucius4-r2t2-demo
- R2T2 GitHub:https://github.com/netease-youdao/Confucius4-R2T2
- T3PO GitHub:https://github.com/netease-youdao/Confucius4-T3PO