今年 5 月,Claude Code 团队的 Thariq 写了一篇文章,说 HTML is the new markdown。他几乎不再写 Markdown 了,计划、方案、报告都让 Claude Code 直接生成 HTML,因为超过一百行的 Markdown 他自己都读不下去。到了刚刚过去的国庆节,Karpathy 也发帖说了类似的观点:与其让模型写一大段文字,不如让它画图,或者直接输出 HTML 网页。
不过这些都还是提示词技巧,你得记得每次跟模型说一句「用 HTML 输出」。这次 GPT-6 推给 ChatGPT 所有用户,同时带来了一个叫 Intelligent UI 的功能,又往前走了一步。ChatGPT 回答里直接就能生成图表、按钮、表单,甚至一个能玩的小游戏,模型会根据问题自己判断要不要出界面,不再需要特殊的提示词。
Intelligent UI 是什么?
按 OpenAI 博客的说法,Intelligent UI 背后是两样东西:一个是原生的界面组件库,支持流式输出,模型从里面挑组件拼出回答;另一个是编译器,模型一边生成,界面一边渲染,不用等整段回答写完。
这跟 Thariq 那种用法不太一样。在 Claude Code 里让模型输出 HTML,是从一张白纸开始写代码,想要什么效果都行,但每次都得从头写一遍样式和交互逻辑。Intelligent UI 的积木是 OpenAI 提前做好的,是内置在 ChatGPT 界面中的一部分,模型只管挑合适的积木来搭。
OpenAI 设计师 Andrew Chen 提到,模型早就能写出好看的 HTML 了。生成式 UI 难的是另外两件事:让界面看起来本来就属于 ChatGPT,以及让模型判断什么时候真的需要界面,什么时候一段文字就够了。

拿 OpenAI 官方博客的复古游戏为例,提示词就一句「Create a retro interactive gaming console that I can play」,出来的是一台 1989 年风格的掌机。屏幕上能切换贪吃蛇、打砖块和乒乓三个游戏,方向键、A/B 键也都可以正常操控。这句提示词一个字没提 Intelligent UI,但要什么风格、要什么东西、要能玩,都说清楚了。
怎么触发界面
刚尝试这个功能的时候,想让模型讲讲 Transformer 的工作原理,提示词写的是「用 Intelligent UI 帮我理解 Transformer 的工作原理」。结果它还是照常给了一大段文字。把提示词换成「用可视化交互界面帮我理解 Transformer 的工作原理」,只改了这几个字,界面就直接出来了。

它把 Transformer 拆成了四步:Token 变向量、Self-Attention、FFN 加多层、预测下一个词,每一步都能点开查看更详细的图示界面。比如在 Self-Attention 这一步,点一下「我爱吃苹果」里的「吃」,右边的注意力矩阵就会显示它对其他词的权重,下面还配了 Q、K、V 各管什么,以及注意力的计算公式。
其实帮助文档里写了,Intelligent UI 不需要特殊提示词,出不出界面是模型根据问题自己判断的。你只说「用 Intelligent UI」,它也不知道你到底想要什么样的界面。
怎么写提示词才管用?
把界面本身描述出来:要一个什么东西,上面有什么控件,改了之后什么跟着变。下面几个例子效果都不错:
| 提示词 | 出来的界面 | 说清了什么 |
|---|---|---|
| Create an ocean dive with a depth slider, changing light+pressure, and clickable creatures | 带深度滑块的潜水场景 | 场景、控件、联动、可点的元素 |
| teach me orbital mechanics without giving me code | 轨道模拟器,能调速度、质量、距离和发射方向,轨道实时更新 | 学习目标,外加「不要代码」 |
| break down the design of a 7-speed bike | 自行车结构图,车架、车轮、传动、刹车、车把五个系统可以分别点开 | 一个「拆解」的动作 |
轨道力学那条提示词很短,但后半句很关键。这类问题模型很容易直接甩一段模拟代码给你,加上「不要代码」,就等于把这条路堵死了。
还有哪些坑?
Pro 档反而用不了。Intelligent UI 只支持 Instant 到 Extra High 这几档,最高的 Pro 档用的是 GPT-6 Astra,并不支持。另外,Work 标签页、语音模式和旧版桌面客户端也都用不了,建议直接用网页版。
界面关不干净。ChatGPT 网页版设置里可以把 Layout and visuals 调成简洁,但只会减少视觉元素,不会切回纯文本。偶尔不想要界面的话,直接在对话里说「只用文字回答」更省事。
做出来的工具留不住。组件状态换一个对话就没了,也没法单独分享给别人。这也是它跟 HTML 文件差距最大的地方,HTML 发个链接其他人就能打开。
错误答案更难发现。一个排版漂亮的计算器摆在面前,很少有人会去检查背后的公式。涉及钱的计算,最好让它把公式和假设一起列出来,自己核对一遍。
写在最后
模型越来越强大,写代码的成本也越来越低,以前根本不值得专门做的小工具,现在可以随手生成,用完就扔了。Intelligent UI 把这件事变成了 ChatGPT 的默认能力,只要把想要的界面说清楚,就能拿到一个能点能拖的交互式界面。
不过做出来的东西留不下来。想弄懂一个技术原理、临时要个小工具,交给 Intelligent UI 很合适;要保存、要分享、要反复改的方案和报告,还是更建议在 Claude Code 或 Codex 里让 Agent 直接生成 HTML 更容易共享。