#评测
GPT-6 Sol实测:价格大幅下降但编码能力倒退,性价比成最大亮点
今天跟大家一起看一下 GPT-6 Sol 的情况。GPT-6 Sol 跟 Claude Opus 5.5 基本上是同一天发布的,但口碑已经呈现出了非常明显的两极分化。
GPT-6 Sol 的价格要比 5.6 Sol 更便宜 10 美元/Mi…
豆包诗词山河上线:用地图维度组织诗歌,AI 定制课程免费生成
之前豆包爱学上线了「豆包课堂」——把中国古诗词和经典古文通过豆包 AI 做成精品讲解视频互动课。
影视级的画质、循序渐进的内容推进、唯美的配图、带有交互的课程呈现,所有内容均由豆包 AI 制作,口碑爆棚。
…
AMD免费API实测:DeepSeek-V4-Flash比英伟达快7.9倍,含opencode和WorkBuddy接入教程
AMD 开发者站上挂着四个免费的大模型 API,注册拿 key,接口 OpenAI 兼容。我把它们和英伟达的免费接口放在一起,用同一道题跑了一轮。同一个 DeepSeek V4 Flash,AMD 输出 19.8 tok/s,英伟达 2.5…
GLM 5.3 实测:750B 参数后训练逼平 GPT-5.6,复杂编码与安全能力全面评测
GLM5.3 API上线了,昨天又充值了GLM Coding Plan。
5.3的定位很直接,擅长复杂编码,长程Agent任务,加上防御性网络安全。
AA榜成绩也出来了,GLM-5.3拿到60分,也是进了前十。60分及以上的模型一共六个,G…
腾讯 WorkBuddy Bench 开源:260 道 Agent 评测任务 + 2 个自动化 Skill
腾讯 WorkBuddy 团队最新开源了 2 个 Agent Skill:wbbench-report-skills 和 wbbench-run-setup。
WorkBuddy Bench 是 WorkBuddy 产品工程实践的副产品&m…
Qwen 3.8 Max 实测:与 Kimi K3 三场景对比,工程严谨度更胜一筹
两周多前实测 Kimi K3 时,结论是国产模型已经摸进了第一梯队。
本周 Qwen 3.8 Max 发布,我的第一反应是没兴趣——印象里它的编程能力不太行。
但 Qoder 正好在送 800 次免费调用,于是我用 …
Qwen3.8-Max 评测:自主编程 16 天、2.4 万亿参数,能否挑战 GPT?
先是 GLM5.2,然后是 Kimi K3,现在是 Qwen3.8-Max。从 6 月开始,国产大模型在 Coding 和 Agent 领域明显加速,与海外顶级 SOTA 的差距正在肉眼可见地缩小。
参数与定价
Qwen3.8-Max 沿…
阿里开源 skill-up:Agent Skill 的声明式评测框架,告别'感觉有用'
2026 年,Agent Skill 已经不是什么新概念了。Claude Code、Codex、Cursor 都在用 Skill 增强 Agent 能力,SkillsBench 的研究数据也证实:精心编写的 Skill 能让任务完成率平均提…
Kimi K3 深度评测:2.8T 参数开源模型,性能能否媲美旗舰?
近日,Kimi K3 正式发布,成为目前参数规模最大的开源大语言模型,引发业界广泛关注。如何看待这一模型的实际能力?本文将从多个维度进行分析。
性能表现是否接近旗舰水平?
综合多家国际评测机构的测试结果,Kimi K3 的性能表现基本可信。…
Qwen-3.8-Max 限时 0.2 折,Kimi K3 下架后的平替方案
Kimi K3 近期突然下架了部分套餐方案。从实际参数规模来看,当前算力分配可能倾向于更强性能的模型,同时兼顾合规需求的用户群体。目前该套餐已无法通过常规渠道采购。
关于 K3 的实际使用体验,综合用户反馈主要有两点:
前端表现优于后端,…