3. Agent

Thusdesign Agent 全解——从模糊想法到可视化设计方案的四步工作流与四个实操场景

2026-07-21

上一集聊的是画布:借助意图识别、快捷操作出图。但那本质上还是「你动手,AI 辅助」。这一集聊一个不一样的东西——你不动手,AI 自己干。这就是 Agent。


一句话说清楚 Agent 是什么

提示词生成 = 一问一答。Agent = 交代一件事,它自己搞定。

画布操作的模式是:你给指令,AI 出图,一次一张。不满意?改提示词,再来一次。你是主导者,AI 是执行手。

Agent 不一样。你给的不是一条指令,而是一个目标。Agent 会自己做目标规划、工具调用、信息整合、多 Agent 协同,然后拆步骤、自己执行。你是老板,Agent 是执行团队。

但「自主」不等于「瞎搞」。

设计 Agent 最重要的环节不是「AI 执行」

很多人以为 Agent 的核心是 AI 执行得多聪明——其实不是。最重要的是前面怎么把想法变成需求。

举个例子。你脑子里想的是「我要一个北欧风的客厅」——这是想法。

拆成需求是:色调偏冷白、家具线条简洁、大面积留白、自然光为主……

再编排成计划:先定空间布局平面图 → 再选材质风格 → 最后生成不同视角效果图。

整条链路就是:

聊清楚想法 → 整理好需求 → 计划编排任务 → 执行出成果

这四步是 Thusdesign 设计 Agent 的底层逻辑。


什么时候用 Agent,什么时候自己动手

[!tip] 一句话原则 模糊的目标交给 Agent 探索,明确的自己手动微调。

适合用 Agent 的场景

  • 方案探索阶段——你还没想好要什么,让 Agent 先出几个方向,你来挑和收敛
  • 批量出图——同一个项目要出不同场景、不同风格、不同视角的效果图,规模化生产
  • 快速验证需求——临时改需求,需要快速拿出一版方案
  • 多步骤自动化——比如:先生成首尾帧 → 再生成视频,整个流程串联给 Agent 跑

不适合用 Agent 的场景

  • 精准标绘修改——「把这个沙发移到划线位置」这类带坐标的局部操作,自己动手更快、更准
  • 方案已明确,只差执行——这时候直接对接生成模型,没必要让 Agent 多绕一圈
  • 需要强可控性——每一步都想自己掌控、严格贴合意图,手动微调更稳定

还有一个常见误区:不要把提示词直接喂给 Agent。你的提示词会被 Agent 再理解一遍,按它自己的理解发挥,反而带来更多不确定性,还额外消耗 token。


四个实操场景

场景一:宣传海报

最简单的例子,用来说明 Agent 的完整流程。

发送一段需求描述后,Agent 没有直接出图——它先开始采访

  • 海报上需要呈现什么文案?
  • 品牌名称和发布日期?
  • 风格偏向?

确认信息(如是绘设计智能体、深色赛博霓虹风格)之后,Agent 生成了一个执行计划让你审批。你觉得没问题,直接批准;有意见,点修改,它把计划回退、重新生成,再让你过。

审批通过后,自动选定模型、比例尺寸(根据「九比十六海报」这个信息,自动用竖版),开始执行。

最终产出:一张赛博朋克风海报,文字呈现准确,再进 PS 做些填充调整,基本达到可交付水准。

[!note] 为什么「澄清需求」这么重要? 对比一下市面上某款看起来很酷的设计 Agent:它用了大量工具(Canvas、SVG 矢量绘图、像素操作……),但全程自主执行,没有任何人工干预节点。结果是:海报里最关键的「呈现什么内容」「用什么风格」——它根本没问。

最后生成的东西完全无法交付,白白浪费了一大堆 token。

流程再酷,不问需求,就是无效执行。

场景二:室内设计

任务:根据工业风轻奢风格,按给出的平面图先渲染平面图,再分别渲染各室内空间场景效果图。

Agent 生成的执行计划逻辑清晰:

  1. 结合手绘草图与风格参考,生成渲染后平面图
  2. 以平面图为约束,并发生成客厅、卧室、厨房等六个视角的室内效果图

批准后,平面图先出,其他场景图并发生成。

整体风格保持连贯,空间一致性因模型限制(用的是 Banana2,速度快但精度稍低)有些瑕疵——换 GPT 模型会更好。但作为快速出套图的工作流,效率明显。

场景三:景观设计

任务:参考俯瞰现代住宅区的风格,渲染景观园林总平面图,再按平面图给出七个节点的放大节点平面和人视点效果图。

[!warning] 上下文干扰 不同任务之间,务必新建画布窗口。上下文残留往往导致 Agent 严重偏离目标。

这个场景里 Agent 输出的空间一致性保持得相当不错——关键节点的空间关系基本忠实于平面图。部分加载的细节有瑕疵,但几张的效果已经达到参考图水准。

场景四:品牌设计

任务:为一个手工咖啡品牌「慢半拍」设计全套品牌 VI——调性是松弛、手作感、不着急。包含 Logo、名片、外卖杯套、手提袋、菜单、社媒模板、店面门头。

这次没有给参考图,完全靠文字描述。Agent 也没有提问——因为给到的信息已经足够让它推断:风格、受众感受、设计语言该往哪个方向走。

有趣的地方在于:它把「松弛」和「手作感」这两个抽象词翻译成了具体的视觉决策——这是 Agent 在做真实的设计思考,不只是执行指令。

门头效果图有些地方夸张了,适合做二次细化的起点,而不是直接交付。


Agent 的核心价值

四个场景跑完,结论很清楚:

Agent 的价值不是图画得多精细,而是它能帮你完成从模糊想法到可视化方案这段路。

以前这段路你得自己走:一步一步输入提示词。现在 Agent 替你跑前半程,你只需要在关键节点回答问题、审批计划——然后在终点等着,挑可用的成果,细化半成品。


一点冷静的判断

当下这个时间点,Agent 就像一个看起来很酷炫、但花活大于实际的表演者

除了 Coding Agent 之外,其他领域的 Agent 落地时或多或少都有瑕疵。但它的演化速度也比大多数人想象的快。

如果今天看完想自己试:从一个你熟悉的设计场景开始,用平时你会对同事说的方式描述需求,不用刻意写提示词。 看看它给你什么,再慢慢学会怎么跟 AI 对话。


Agent 能做的远不止出效果图。图片参考视频联动、知识库深度搜索、PPT 网页制作、画布复杂操作……每个方向展开都是单独一期的内容。

下一集:视频生成。