上一集聊的是画布:借助意图识别、快捷操作出图。但那本质上还是「你动手,AI 辅助」。这一集聊一个不一样的东西——你不动手,AI 自己干。这就是 Agent。
一句话说清楚 Agent 是什么
提示词生成 = 一问一答。Agent = 交代一件事,它自己搞定。
画布操作的模式是:你给指令,AI 出图,一次一张。不满意?改提示词,再来一次。你是主导者,AI 是执行手。
Agent 不一样。你给的不是一条指令,而是一个目标。Agent 会自己做目标规划、工具调用、信息整合、多 Agent 协同,然后拆步骤、自己执行。你是老板,Agent 是执行团队。
但「自主」不等于「瞎搞」。
设计 Agent 最重要的环节不是「AI 执行」
很多人以为 Agent 的核心是 AI 执行得多聪明——其实不是。最重要的是前面怎么把想法变成需求。
举个例子。你脑子里想的是「我要一个北欧风的客厅」——这是想法。
拆成需求是:色调偏冷白、家具线条简洁、大面积留白、自然光为主……
再编排成计划:先定空间布局平面图 → 再选材质风格 → 最后生成不同视角效果图。
整条链路就是:
聊清楚想法 → 整理好需求 → 计划编排任务 → 执行出成果
这四步是 Thusdesign 设计 Agent 的底层逻辑。
什么时候用 Agent,什么时候自己动手
[!tip] 一句话原则 模糊的目标交给 Agent 探索,明确的自己手动微调。
适合用 Agent 的场景
- 方案探索阶段——你还没想好要什么,让 Agent 先出几个方向,你来挑和收敛
- 批量出图——同一个项目要出不同场景、不同风格、不同视角的效果图,规模化生产
- 快速验证需求——临时改需求,需要快速拿出一版方案
- 多步骤自动化——比如:先生成首尾帧 → 再生成视频,整个流程串联给 Agent 跑
不适合用 Agent 的场景
- 精准标绘修改——「把这个沙发移到划线位置」这类带坐标的局部操作,自己动手更快、更准
- 方案已明确,只差执行——这时候直接对接生成模型,没必要让 Agent 多绕一圈
- 需要强可控性——每一步都想自己掌控、严格贴合意图,手动微调更稳定
还有一个常见误区:不要把提示词直接喂给 Agent。你的提示词会被 Agent 再理解一遍,按它自己的理解发挥,反而带来更多不确定性,还额外消耗 token。
四个实操场景
场景一:宣传海报
最简单的例子,用来说明 Agent 的完整流程。
发送一段需求描述后,Agent 没有直接出图——它先开始采访:
- 海报上需要呈现什么文案?
- 品牌名称和发布日期?
- 风格偏向?
确认信息(如是绘设计智能体、深色赛博霓虹风格)之后,Agent 生成了一个执行计划让你审批。你觉得没问题,直接批准;有意见,点修改,它把计划回退、重新生成,再让你过。
审批通过后,自动选定模型、比例尺寸(根据「九比十六海报」这个信息,自动用竖版),开始执行。
最终产出:一张赛博朋克风海报,文字呈现准确,再进 PS 做些填充调整,基本达到可交付水准。
[!note] 为什么「澄清需求」这么重要? 对比一下市面上某款看起来很酷的设计 Agent:它用了大量工具(Canvas、SVG 矢量绘图、像素操作……),但全程自主执行,没有任何人工干预节点。结果是:海报里最关键的「呈现什么内容」「用什么风格」——它根本没问。
最后生成的东西完全无法交付,白白浪费了一大堆 token。
流程再酷,不问需求,就是无效执行。
场景二:室内设计
任务:根据工业风轻奢风格,按给出的平面图先渲染平面图,再分别渲染各室内空间场景效果图。
Agent 生成的执行计划逻辑清晰:
- 结合手绘草图与风格参考,生成渲染后平面图
- 以平面图为约束,并发生成客厅、卧室、厨房等六个视角的室内效果图
批准后,平面图先出,其他场景图并发生成。
整体风格保持连贯,空间一致性因模型限制(用的是 Banana2,速度快但精度稍低)有些瑕疵——换 GPT 模型会更好。但作为快速出套图的工作流,效率明显。
场景三:景观设计
任务:参考俯瞰现代住宅区的风格,渲染景观园林总平面图,再按平面图给出七个节点的放大节点平面和人视点效果图。
[!warning] 上下文干扰 不同任务之间,务必新建画布窗口。上下文残留往往导致 Agent 严重偏离目标。
这个场景里 Agent 输出的空间一致性保持得相当不错——关键节点的空间关系基本忠实于平面图。部分加载的细节有瑕疵,但几张的效果已经达到参考图水准。
场景四:品牌设计
任务:为一个手工咖啡品牌「慢半拍」设计全套品牌 VI——调性是松弛、手作感、不着急。包含 Logo、名片、外卖杯套、手提袋、菜单、社媒模板、店面门头。
这次没有给参考图,完全靠文字描述。Agent 也没有提问——因为给到的信息已经足够让它推断:风格、受众感受、设计语言该往哪个方向走。
有趣的地方在于:它把「松弛」和「手作感」这两个抽象词翻译成了具体的视觉决策——这是 Agent 在做真实的设计思考,不只是执行指令。
门头效果图有些地方夸张了,适合做二次细化的起点,而不是直接交付。
Agent 的核心价值
四个场景跑完,结论很清楚:
Agent 的价值不是图画得多精细,而是它能帮你完成从模糊想法到可视化方案这段路。
以前这段路你得自己走:一步一步输入提示词。现在 Agent 替你跑前半程,你只需要在关键节点回答问题、审批计划——然后在终点等着,挑可用的成果,细化半成品。
一点冷静的判断
当下这个时间点,Agent 就像一个看起来很酷炫、但花活大于实际的表演者。
除了 Coding Agent 之外,其他领域的 Agent 落地时或多或少都有瑕疵。但它的演化速度也比大多数人想象的快。
如果今天看完想自己试:从一个你熟悉的设计场景开始,用平时你会对同事说的方式描述需求,不用刻意写提示词。 看看它给你什么,再慢慢学会怎么跟 AI 对话。
Agent 能做的远不止出效果图。图片参考视频联动、知识库深度搜索、PPT 网页制作、画布复杂操作……每个方向展开都是单独一期的内容。
下一集:视频生成。