发现一个开源的本地化知识库构建工具——博主万能蒸馏器(Blogger Distiller)。它能一键蒸馏任意抖音、小红书、YouTube 博主的视频:yt-dlp 下载 → Whisper 转写 → 中文标点恢复 → 导出逐字稿,然后直接喂给本地大语言模型,用来创建专属的数字分身或搭建 RAG 系统。
RAG 是"检索增强生成"的缩写。通俗讲,就是把你整理好的博主内容喂给 AI,让它能"模仿"这位博主的语气和知识来回答问题。相当于给 AI 配了一本专属参考书。

核心功能
项目底层分为两条核心流水线,并具备断点续传机制:
- 推文采集流水线(Twitter/X):支持全量推文采集。将时间线切割为 37 个 15 天日期微区间进行检索,规避传统游标翻页的 400 错误,实现免 Cookie、免登录的抓取。抓取时会去除缩略图限制,本地化下载高清原始图片,并自动提取推文下方热度排名前 15 的追问和反思(高赞读者评论),一并归档至 Markdown 作为上下文。
- 视频转写流水线(抖音/小红书/YouTube):通过 TikHub API 采集元数据,调用 yt-dlp 实时提取音频流,再通过 Whisper 语音转文字。最后由算法自动补齐逗号、句号等中文标点,并完成繁转简排版,导出高精度口播逐字稿。
- 流式实时落盘与断点续传:数据采用流式实时存储写入硬盘。中途崩溃后重启,脚本可识别本地已有进度,直接跳过已完成部分,避免重复的 API 计费。
实战案例
项目通过"大超说媒"案例展示了具体应用。通过蒸馏该情感博主的逐字稿得到 Markdown 知识库后,用户可以向本地 LLM 设定包含"向下兼容"、"情绪价值"、"相亲市场香饽饽"等行话的系统提示词。

结合提取出的逻辑口吻,大模型能够针对用户输入的新情侣条件,输出具备该博主风格的深度适配度诊断结果。
部署与安装
git clone https://github.com/lihuanihaoma-design/creator-distiller.git
cd creator-distiller
pip install -r requirements.txt
前置依赖:
- 必须安装 ffmpeg(Whisper 与 yt-dlp 的硬依赖),macOS 用
brew install ffmpeg,Windows 用winget install Gyan.FFmpeg - 必须注册 TikHub 账号获取 API Token(最低 ¥5 即可采集上百条)。这是第三方付费服务,存在额度与价格变动的隐性成本
- Whisper 模型在本地运行,转写速度高度依赖本机 GPU;若无 GPU,CPU 转写将非常缓慢
配置 TikHub Token:
python -c "import json, os
cfg = os.path.join(os.path.expanduser('~'), '.xiaohongshu', 'tikhub_config.json')
os.makedirs(os.path.dirname(cfg), exist_ok=True)
json.dump({'tikhub_api_token': '你的TOKEN'}, open(cfg, 'w'))"
使用方式:
# 蒸馏 Twitter/X 博主
python scripts/distill_twitter.py
# 蒸馏抖音博主(传入博主主页或视频链接)
python scripts/retry_ytdlp.py ""
客观限制
- Twitter 采集完全依赖 TikHub 第三方 API,并非真正意义上的"零成本"——API 额度耗尽后无法继续抓取,且 TikHub 服务的可用性与定价不受本项目控制
- 小红书与 YouTube 功能在 README 路线图中明确标记为"计划中"(🚧),当前版本实际可用的仅 Twitter 与抖音两条管线
项目由 lihuanihaoma-design 开发,采用 MIT License。
声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:博主万能蒸馏器:一键把任意博主内容转化为本地 AI 知识库