#Agent

ffmpeg-skill:给 Claude Code 装上 28 个 FFmpeg 工具,先探测再动手
ffmpeg-skill 是一个专门为 Claude Code、Cursor、Codex 等 AI 编程助手设计的 Agent Skill。它的核心想法很简单:不让 Agent 自己拼 FFmpeg 命令,而是给它 28 个经过严格工程化的…
小米 MiMo Desktop 邀测上线:长程 Agent 任务 99% 缓存命中,直连 Blender 和 Figma
不得不说,国内Agent大战已经到了白热化阶段,就在昨天,小米也正式下场。开放桌面端应用:MiMo Desktop。目前是邀测阶段。 这是 MiMo 第一个面向个人真实工作场景的桌面 agent 应用,邀测期间能免费体验小米的两款新一代模…
DeepSeek Harness 如何实现动态修改系统提示词且不破坏 KV Cache
DeepSeek Harness(DSH)最近上线了一项更新:支持动态修改系统提示词且不破坏 KV Cache。在 Agent 框架中,KV Cache 的命中率直接影响响应速度——命中与否的延迟相差可达数十倍。系统…
Qoder 实测:从 Skill 验证到电子书架产品,一个下午的 AI 编程工作流
前段时间,WorkAgent 蓝皮书发布后,有读者评论说想看印刷的纸质版。AI 领域的内容做书籍出版有个天然矛盾:出版周期长,但 AI 更新太快,刚交付新东西又出来了。所以蓝皮书一直用网站形式在更新。 但转念一想:用户要的可能不是"纸",是…
Agentic UI 设计指南:从任务计划、执行状态到结果工作台
AMD 开发者站上挂着四个免费的大模型 API,注册拿 key,接口 OpenAI 兼容。我把它们和英伟达的免费接口放在一起,用同一道题跑了一轮。同一个 DeepSeek V4 Flash,AMD 输出 19.8 tok/s,英伟达 2.5…
MiniCPM5-2B开源:AA榜单4B以下第一,端侧模型也能做通用Agent
面壁智能与 OpenBMB 社区开源了新一代端侧模型 MiniCPM5-2B。在国际权威基准 Artificial Analysis Intelligence Index 评测中,该模型以 23 分的成绩登顶全球 4B 以下开源基座模型第一…
多模态 Agent 架构综述:三代感知融合、四域基准与七个开放问题
这篇被 TMLR 接收的 60 页综述,由马里兰大学牵头、联合 KAUST 与牛津大学等十家机构的 16 位作者完成。 它做的事可以概括成一句话:把多模态沿着智能体的每个功能模块系统捋一遍,看它究竟改变了什么,以及为此付出了什么代价。 决定…
huashu-mac-use:开源 Mac 电脑操控 Skill,让 Agent 不靠点击也能操作 App
最近在网上刷到大量夸赞 GPT-6 Astra 在 Computer Use 方面能力的帖子,各种操控 Blender 做出 3D 模型的案例确实令人惊叹。但现阶段要解决白领办公问题,除了 coding 能力,最关键的还有搞定电脑和浏览器操…
CrewAI 多智能体开发实践:在自治与确定性之间找到平衡
近两年多来,许多团队在构建 Agent 系统时都遇到了相似的困境:把几个模型、几句提示语、一些工具拼在一起,就以为拥有了一个可工作的"智能体协作"系统。跑 demo 很快,但要进入生产环境却困难重重。问题不在模型本身,而在于编排方式。 真正…
阿里开源zg:把ripgrep+BM25+向量检索整合为Agent时代本地统一检索层
你让 AI Agent 帮你找"启动时恢复主题偏好"的代码逻辑,Agent 拿着这句话开始搜索:先搜 theme preference,没结果;换 restore theme,还是没有;再试 startup settings……