豆包 seed 模型最近推出了一套激进的无限流模式——doubao-seed-evolving,始终使用同一个模型 ID,后台静默更新、自动替换,用户永远拿到的是最新版本。大约每两周更新一次。

对用户来说这是利好——永远用最新的模型,不用关心版本号。但评测可能还没捂热就过期了。作者跑了一些 case 对比,分为三个部分:3D 测试(前后端能力)、网页复刻(多模态能力)、Anthropic 工程面试题(工程后端能力)。整体感受:多模态能力比较强,编码能力追得很快,但还没有超越海外前沿模型。
3D 测试
之前流行生成好看的网页,但后来模型把审美内化到训练阶段了,现在的模型只要命中风格关键词就能输出模板化页面。因此 3D 模型测试成了更好的对比标准——除了写代码,还要管场景、光照、材质、交互。
黑洞测试
第一个 case 是制作类似电影《星际穿越》中卡冈图雅黑洞效果的网页,要求有吸积盘效果和引力透镜效应,用户可以旋转观察并调整参数。

对比结果:左 Gemini 3.7 Flash,右 Claude Opus 5。

左 GPT 5.6 sol,右 doubao seed evolving。这个 case 中,有视觉能力的 doubao-seed 表现还挺不错。

太阳系测试
制作太阳系交互式 3D 页面,包含八大行星、月球和土星环,用户可以调整视角和距离。

doubao-seed-evolving 的表现:效果还可以,土星环和月球细节都有。

网页复刻测试
复刻 xai.com 首页,考验多模态能力。

复刻结果:整体布局、颜色、动效都还原得不错。

Anthropic 工程面试题
一道典型的工程后端题:设计一个 API 限流系统,需要支持多种限流策略,包括基于用户、IP、API Key 的限流,支持滑动窗口和令牌桶算法。
doubao-seed 给出了完整的实现方案,包括架构设计、核心代码和测试用例。

整体来看,doubao seed evolving 的干活能力追得挺快,多模态能力比较强。虽然国产模型思考时间还比较长,但效果上已经能跟海外模型掰手腕了。而且无限流模式让用户永远用到最新模型,省去了追版本号的麻烦。
