10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI最新动态

AMD免费API实测:DeepSeek-V4-Flash比英伟达快7.9倍,含opencode和WorkBuddy接入教程

20分钟前 AI最新动态 0 0

AMD 开发者站上挂着四个免费的大模型 API,注册拿 key,接口 OpenAI 兼容。我把它们和英伟达的免费接口放在一起,用同一道题跑了一轮。同一个 DeepSeek V4 Flash,AMD 输出 19.8 tok/s,英伟达 2.5 tok/s,差 7.9 倍。

但这个倍数救不了挑错模型的人。AMD 自家四个模型里,最快的 MiniCPM5-1B 跑 212.2 tok/s,最慢的 Qwen3.8-Flash-Next 跑 1.1 tok/s,内部差了近 200 倍。

AMD 免费 API 实测对比

四个模型是什么,以及怎么拿 key

打开 AMD Radeon TokenFactory,页面列出四个 Public Free Model APIs,全部跑在 AMD GPU Cloud 上:

模型 上下文 输入(pts/M) 输出(pts/M) 缓存读 视觉
DeepSeek-V4-Flash 1,048,576 0.14 0.28 0.0028 ✗
DeepSeek-V4-Flash-Vision-Exp 1,048,576 0.14 0.28 0.0028 ✓
Qwen3.8-Flash-Next 262,144 0.15 0.47 0.016 ✓
MiniCPM5-1B 131,072 0.124 0.7425 0.124 ✗

价格单位是 pts / 1M tokens。NVIDIA 的 integrate.api.nvidia.com 免费接口同样限速率;AMD 这边我连着打第二轮时撞过一次 HTTP 429,间隔 20 秒重试就通了。两边都不是无限量,别拿它跑批量任务。

AMD TokenFactory 页面

拿 key 的流程是:登录 AMD 开发者账号后进 Radeon TokenFactory 生成 token,前缀是 rc-。验证最快的方式是直接打 models 接口:

curl https://developer.amd.com.cn/radeon/api/v1/models \  -H "Authorization: Bearer rc-xxxx"

HTTP 200,1.23 秒返回,四个模型全在。

获取 API Key

实测:AMD 和英伟达跑同一道题

测试条件两家完全一致。同一道题("用一句话解释什么是温度系数采样,然后写一段 Python 的斐波那契函数"),非流式,max_tokens 300,串行请求。

AMD 四个模型:

模型 耗时 输出速度 结果
MiniCPM5-1B 1.41s 212.2 tok/s 答错
DeepSeek-V4-Flash 7.63s 19.8 tok/s 正确
DeepSeek-V4-Flash-Vision-Exp 22.82s 8.3 tok/s 正确
Qwen3.8-Flash-Next 140.33s 约 1.1 tok/s 正确

英伟达免费接口:

模型 耗时 输出速度
deepseek-v4-flash-0731 70.57s 2.5 tok/s
kimi-k3 61.53s 4.8 tok/s

实测速度对比

AMD 的 DeepSeek-V4-Flash 和英伟达的 deepseek-ai/deepseek-v4-flash-0731 是同一个模型的不同部署。19.8 对 2.5,7.9 倍。横向看,AMD 的 Vision-Exp 跑 8.3 tok/s,英伟达最快的 kimi-k3 跑 4.8 tok/s。除了 Qwen3.8-Flash-Next,AMD 在剩下的每一项上都更快。

MiniCPM5-1B 甩出 212 tok/s,但它答错了——题目问的是采样温度,它答成了温度传感器采样。1B 量级的模型,跑得快和答得对是两回事。

同模型对比结果

接入 opencode

opencode 的 provider 配置写在 ~/.config/opencode/opencode.json:

{
  "amd": {
    "models": {
      "DeepSeek-V4-Flash": {
        "name": "DeepSeek-V4-Flash",
        "limit": {"context": 1048576, "output": 384000}
      }
    },
    "npm": "@ai-sdk/openai-compatible",
    "options": {
      "apiKey": "rc-xxx",
      "baseURL": "https://developer.amd.com.cn/radeon/api/v1",
      "setCacheKey": true
    }
  }
}

三个字段容易填错:npm 必须是 @ai-sdk/openai-compatible;baseURL 末尾的 /v1 不能省;setCacheKey: true 是让 prompt 缓存生效的开关,对应便宜 50 倍的缓存读价。

opencode 配置示例

opencode 运行效果

改完把顶层 model 设成 amd/DeepSeek-V4-Flash,或者启动时用 /model 切。

opencode 模型切换

接入 WorkBuddy

图形界面:左下角账户头像 → 设置 → 左侧导航"模型"→ 自定义模型区域点"添加模型"。提供商选"自定义 / Custom",接口地址填 https://developer.amd.com.cn/radeon/api/v1,API Key 填 rc- key,模型名称填 DeepSeek-V4-Flash。

DeepSeek-V4-Flash 实测支持工具调用,勾上"工具调用";它没有视觉能力,"图片输入"别勾。

WorkBuddy 模型配置

另一条路是直接写 ~/.workbuddy/models.json,WorkBuddy 会监听文件变更并热重载:

[
  {
    "id": "DeepSeek-V4-Flash",
    "name": "AMD DeepSeek-V4-Flash (免费)",
    "vendor": "Custom",
    "url": "https://developer.amd.com.cn/radeon/api/v1",
    "apiKey": "rc-xxx",
    "supportsToolCall": true,
    "supportsImages": false,
    "supportsReasoning": true,
    "useCustomProtocol": false
  }
]

适用边界与三条建议

该用的:想先把编码工具跑起来、不想掏钱的人。需要一个备用端点、在几个免费额度之间来回切的人。任务类型限于原型验证、写单测、改文档这类对延迟不敏感的活。DeepSeek-V4-Flash 的 19.8 tok/s,干这些够用。

别用的:要跑长上下文、多轮 Agent 的人——Qwen3.8-Flash-Next 一个请求 140 秒,一轮循环下来你会以为它死了。需要视觉输入的也别指望,Vision-Exp 是 8.3 tok/s 的实验版。MiniCPM5-1B 的速度像本地模型,错误率也像本地 1B 模型。

三条建议:

  1. 只接 DeepSeek-V4-Flash 一个,它是四个里唯一同时做到"跑得动"和"答得对"的
  2. limit.context 和 setCacheKey 别漏——前者决定你能读多长的代码,后者决定你实际花多少钱
  3. 429 当常态处理——连着打第二轮我就撞上了,隔 20 秒重试即通,批量脚本里加个退避

免费的额度按 token 计价,时间不按 token 计价。7.9 倍的速度差能把一个免费工具从"忍一忍"推到"能日常用",前提是你挑对了那个模型。

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:AMD免费API实测:DeepSeek-V4-Flash比英伟达快7.9倍,含opencode和WorkBuddy接入教程
#AMD #免费API #DeepSeek-V4 #模型评测 #opencode #WorkBuddy 
收藏 1
阿里开源zg:把ripgrep+BM25+向量检索整合为Agent时代本地统一检索层
这是最后一篇
推荐阅读
  • Claude Cowork 现已向所有 Pro 用户(及以上)开放,刚发布就被拆解!
  • 吴恩达解析 Loop Engineering:AI 时代的三层开发循环
  • 实测 PaddleOCR 3.3:109 种语言与结构化解析,一次部署覆盖大部分文档场景
  • Meta宣布彻底解决RAG最大痛点:速度提升30倍,上下文窗口暴增16倍,成本直接腰斩!
  • 即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
评论 (0)
请登录后发表评论
分类精选
Cursor 限制国内使用 Claude 等模型解决方案!
33757 1年前
学生/非学生:如何申请Cursor Pro免费会员,如何通过SheerID验证快速激活全攻略
30259 1年前
即梦AI图片2.1:一句话快速生成带中文的海报图,免费AI文生图、视频工具、AIGC创作工具
23229 1年前
注意!Cursor单设备登录新规:一个账户最多可以3台设备登录,且限制单点登录
22450 1年前
腾讯ima知识库skills上线:教你如何把腾讯 IMA 知识库接入 OpenClaw 一步打通
20231 5月前
国产大模型横向对比:Kimi K2.6、GLM-5.1、Qwen3、MiniMax M2 四大模型选型指南
18516 4月前
Trae国内版,搭载 doubao-1.5-pro、DeepSeek R1/V3模型,对比 Trae 国际版有什么不同
18148 1年前
字节推出Trae CLI :Claude Code 和 Gemini CLI的国产平替 ?手把手教你如何安装Trae Agent
18115 1年前
DeepSeek宣布:降价,最高降价75%!别错过这个优惠时段,赶紧充值
17720 1年前
刚刚!Cursor风控又加强了,可能是因为这个原因!
16344 1年前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 AMD免费API实测:DeepSeek-V4-Flash比英伟达快7.9倍,含opencode和WorkBuddy接入教程
2 微信开放个人虚拟支付:个人开发者也能开通微信支付,10万/月上限下的合规变现路径
3 WorkBuddy 应用市场上线:行业专属工作台+开放生态,要再造一个 AI 版小程序平台
4 谷歌发布 Gemini 2.5 Flash:跑分硬刚 Opus 5,价格仅七分之一的高性价比 AI 模型
5 WorkBuddy 开放平台上线实测:上传第一个 Skill 的完整体验
6 智谱 GLM-5.3 开放权重:Hacker News 热帖与本地部署指南
7 MiniMax H3 视频模型开源部署指南:含越狱编码器与提示词模板
8 腾讯Hy4 preview实测:对比GLM-5.3,谁的Agent编程能力更强?
9 豆包工作实测:只给一个博主名字,自动完成抖音博主内容研究
10 微信AI硬核技术开源:WeMM-Embedding 多模态搜索实测
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联