一张图开口说话,延迟低到能聊天。在 NVIDIA RTX 3090 上,Demo 的生成吞吐速度可达到 30+ FPS,显存占用低于 4 GB,同时呈现清晰的人脸细节。
功能特性
- 音频驱动:传段录音或对着麦克风说话,照片里的人跟着张嘴
- 视频换脸:保留原视频的姿势和节奏,只替换嘴型动作
- 聊天代理:接 OpenAI 兼容的大模型,打字或语音输入,数字人实时回话、出声、做表情
几个细节:预设了习惯 ID 切换说话风格,不用额外录参考视频;同一套缓存机制,注册一次头像后续直接复用;麦克风模式建议戴耳机,不然容易自激啸叫。
怎么跑起来
要 Linux + NVIDIA 显卡 + FFmpeg,测试环境是 Python 3.10、CUDA 12.1、cuDNN 9。
方式一:conda
conda env create -f environment.yaml
conda activate talklikeyou-demo
方式二:pip(得先自己装好对应版本的 PyTorch)
pip install -r requirements.txt
启动命令:
cd TalkLikeYou-Streaming-RealTime-Demo
CUDA_VISIBLE_DEVICES=0 python app.py --host 0.0.0.0 --port 5070
浏览器开 http://127.0.0.1:5070,传图或传视频注册头像,选模式点播放就行。聊天代理要配环境变量或 .env 文件接 LLM、TTS、STT 服务,Edge TTS 装完依赖直接用,其他的走 OpenAI 兼容接口。
模型权重去 Hugging Face 下,按 checkpoints/motion/ 和 checkpoints/runtime/ 的目录放好,runtime_config.pkl 源码里自带不用另下。命令行客户端也能跑:demo_client.py 传 --source 和 --audio 做音频驱动,视频源自动进换脸模式。
Github:https://github.com/BQ-Wang0511/TalkLikeYou-Streaming-RealTime-Demo
声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。