AI 能取代用户研究吗?它见不到 Awad。
我自己的设计引擎推荐了一个和 claude.ai 首页几乎一样的方案。AI 在研究中能做好什么、在哪里失败,以及 UX 职业为什么会更好。
本页内容

2026 年 5 月,ux-skill 需要一个新首页。ux-skill 是我在做的设计引擎,它存在的全部理由,就是找出让 AI 做出来的界面看起来都一样的那些地方。所以我们做了最自然的事:用我们自己的推荐引擎,跑我们自己的需求。一个开发者工具的落地页,语气是编辑感、自信、安静、电影感。不许用的清单上有:用 Inter 做标题字体、紫到蓝的渐变、三张一样大的卡片。
十二秒后,引擎给出了答案。奶油色底上的 Cormorant Garamond,配一个温暖的棕红色强调色。这几乎就是 claude.ai 的首页。
引擎遵守了需求里的每一条规则。它读到”编辑感”和”安静”,就去找最接近的匹配,而那个匹配,正是这个品类里的 AI 工具早已上线的样子。我们给自己提了两个 bug。“编辑感”这个标签过度偏向一类老式书本字体。“安静”这个标签被写成了”必须是浅色底”,所以接近黑色的配色从来没有机会。修好之后,同一份需求给出的是近黑色底、一个温暖的金色强调色和 Fraunces 字体,一套我们谁都不会单凭品味选出来的系统。
ux-skill 不调用任何语言模型。它是一个确定性的评分引擎,可它还是做了模型面对熟悉问题时会做的事:给出可能性最高的答案。而可能性最高的答案,就是已有内容的平均值。
记住这个画面,因为关于 AI 和用户研究的全部争论都在这里。让模型假装成你的用户,你得到的是可能性最高的那个用户。研究存在的意义,就是找到那个和他不一样的人。
要点
- AI 取代不了用户研究。它能起草访谈脚本,转写和翻译访谈录音,整理笔记,列出失败状态,写出报告的草稿。
- 合成用户是模型读过的内容的平均值。Nielsen Norman Group 发现,合成用户会顺着你说,对所有事情一样在意,还会讲出自己从没有过的经历。
- 你的用户群越特别,模型就越不像他们。NN/g 自己给的不该使用合成用户的例子,是越南的一位农民。海湾地区的牧民是同一种情况。
- UX 就业市场正在稳定下来,入门依然很难,价值正在从产出界面转向判断、研究、系统和品味。
- 照 NN/g 的说法使用 AI:像对待实习生一样。给它背景和限制,然后把每一行都和真实的原话对照。
十位牧民告诉了我们什么模型不知道的事?
2023 年,我在设计 Wfrah,一款给海湾地区绵羊和山羊养殖户的应用。在任何界面出现之前,创始人 Abdullatif 就告诉我们要面对什么。牧民按父亲教的方式经营这门手艺,不相信一个应用会比他们更懂自己的牲畜。
于是我们去听。和不同经验的牧民做了十次深度访谈,再花时间观察他们已经在用的工具。问一个牧民农场为什么亏钱,他每次给你的都是同一个答案:饲料太贵,买家给得太少。
这是人们会说出口的答案,而人们说出口的答案,就是最后会被写下来的那些。任何从人们写下的文字里学出来的东西,都会把它原样还给你。
访谈发现了这句话底下的东西。很多牧民没法用公式算出畜群每天的营养需要,而”问题出在市场”的想法,让他们忽视了营养和管理。于是应用里最有用的东西,成了一个营养计算器,为每头牲畜、每个生长阶段完成计算。没有人要求过它。访谈显示了有多少人需要它。

研究最后变成了一个用户画像:Awad。他为自己按家族几代人的方式做事而自豪,因为管理畜群很难而觉得累,也好奇有没有更好的办法。这种两面,自豪和好奇同时存在,成了整个设计的出发点:一个对 Awad 说教的应用会失去他,一个在第一屏就给他有用东西的应用,也许能留住他。
Awad 是虚构的,由十次真实访谈构建而成。这就是用户画像和合成用户的区别,这篇文章接下来的内容都建立在这一点上。

AI 在用户研究中能做好什么?
比批评它的人愿意承认的要多。我的设计流程指南里,很多方法下面都有一段”用 Claude 来做”。这些段落的模式都一样:模型起草、整理、列出。人来做决定。
Nielsen Norman Group 关于用 AI 加速研究的指南,最近一次审阅是在 2026 年 1 月,结论也一样。它认为 AI 在计划和分析两个阶段最有帮助,在中间最弱,因为中间需要有人看着一个人使用产品。
| 研究任务 | AI 做得好的 | 你仍要检查的 |
|---|---|---|
| 案头研究 | 开始阅读,收集来源 | 编造的事实和来源。每一个都要打开 |
| 访谈脚本和测试任务 | 很快写出很多选项 | 引导性问题和”你会不会用”这类问题 |
| 同意书、筛选问题、研究计划 | 按你的模板为这次研究填好 | 错误的权限,错误的细节 |
| 转写和翻译 | 说话人、时间点、摘要 | 口音和某些语言上的错误 |
| 整理笔记 | 对主题做第一轮归类 | 按关键词分的组,塞得太满的”其他” |
| 失败状态 | 列出每一步可能出错的所有方式 | 每个状态都说出了字段和解决办法 |
| 报告草稿 | 语法、语气、给决策者的简单说法 | 并非来自研究的细节 |
起草脚本。 空白页是准备访谈时最慢的部分。我把研究问题贴进去,要一份 30 分钟的脚本,内容是这个人上一次做这件事的经过:不要假设性问题,不要提到具体功能的问题,并标出任何提前给出答案的问题。然后我删掉它还是加进来的每一个”你会不会”问题。NN/g 在测试任务上看到了同样的事:即使给了好的例子和明确的规则,AI 也常常写出引导性的任务。草稿能省一个小时。修改仍然是你的事。

转写和整理。 访谈之后,模型真正派上用场。我把转写文本贴进去,要它把每条观察写成一行,带参与者编号和原话,然后提出分组,只有一条规则:只有一位参与者说过的话,不能成为一个主题。整理是模型做得好的事。用听起来合理的发现去填补空白,是你必须抓出来的事。NN/g 说得很直接:AI 的分组往往按关键词来,很多笔记最后落在”其他”里。

列出失败状态。 在这件事上,AI 比大多数赶时间的设计师做得更好。给它主流程,要它列出每一步的每一种失败:输入无效、超时、离线、点了两次、权限被拒、数据为空。然后检查每个状态是否告诉了用户出了什么问题、怎么解决。在 Dot 的收银台上,手机号少一位时显示的是:“Nothing added. Phone is short by 1.”(没有加上积分,手机号少了 1 位。)模型会列出这个状态。而”每条失败信息都以 Nothing added 开头”这条规则,因为收银员出错后的第一个问题总是”这笔到底加上了没有”,来自为站在收银台前的那个人做设计。
AI 在用户研究中哪里会失败?
就在研究存在的那件事上:弄清楚你没见过的人身上什么是真的。这种失败有个名字。合成用户是 AI 生成的一份资料,照着某一类用户的样子,像其中一员那样回答访谈问题。有些产品把它当作”没有用户的用户研究”来卖。
Nielsen Norman Group 测试了合成用户,拿来和他们之前用真人做过的三项研究对比。下面是他们的发现。
它想顺着你说。 一项在线学习研究里,真实的学员承认自己开始学了却没有学完。合成用户说,自己提到的每一项都学完了。大多数真实参与者不用交流区,因为那里的互动显得很假。合成用户却说了很多交流区的好话。NN/g 的解释是,模型读过很多关于交流区对学习有好处的文章,而对你有好处,不等于你真的会用。
它什么都在意。 问一个合成用户什么让在线学习有吸引力,它带着同样的热情列出了七个因素。真实的人对某些事情的在意远远多过其他,而这个排序正是研究要找的。七个同样重要的需要,没法告诉你先做什么。
它记得从没发生过的事。 模型没有用过你的产品,所以它讲的过去的经历都是编的。NN/g 指出,这些资料在观点上比在故事上更准确,而这对研究来说正好反了,因为故事才是证据。他们向一位合成的医药销售代表讲用无人机送样品的想法,它说这个想法可能会改变整个局面。
它是平面的。 NN/g 最直接的一句话是:合成用户感觉像是对几万人经历的一个平面的大概,因为它们就是。这又是我那个首页的故事。引擎没有算错。它给出的是那一类的中间值。
用户群越特别,情况越糟。NN/g 自己的建议是:对少见或专业的人群,不要使用合成用户。它给的例子是越南的一位农民,因为模型关于这个人的数据是零散的。Awad 正是这种情况。一位从父亲那里学会这门手艺的海湾牧民,在模型学习的那些文字里,几乎没有写下什么。站在繁忙收银台前的收银员也一样。
人们说的和做的。 第二个缺口是行为。模型很会处理文字,而研究常常关心的是文字和行动之间的距离。在我所有模板都用到的 Bunn 例子里,用户画像 Rana 在访谈中说最后才出现的配送费是在坑人。笔记里记着,她付钱前把费用看了两次,一次在菜单上,一次在结账时。原话和行为放在一起,才是发现。转写文本里只有原话。

NN/g 对可用性测试也说了同样的话:无论人还是 AI 工具,都无法只凭转写文本分析一次可用性测试,因为人们不会说出每一次点击,还常常做一件事、说另一件事。它 2026 年的指南仍然建议不要让 AI 主持可用性测试。Rana 把费用看两次,是一个行为。你只有看着才会发现。
它没法判断来源。 好的研究者会问模型不会问的问题:访谈者是不是引导了这个回答?参与者是不是觉得难为情?这个人到底符不符合招募条件?NN/g 正是把这些列为依赖背景的判断,超出了现有工具的能力。
证据怎么说?
研究这个问题的人对大致情况看法一致:AI 已经出现在研究工作的每个地方,而几乎没有人不经检查就信任它。
| 来源 | 发现 |
|---|---|
| User Interviews,用户研究现状报告 2025,485 名研究者 | 80% 使用 AI,一年内上升 24 个百分点 |
| 91% 担心输出的准确性和编造内容 | |
| 63% 担心 AI 会降低人的洞察和批判性思维的价值 | |
| Figma 2025 AI 报告,2,500 名设计师和开发者 | 78% 认为 AI 明显提高了他们的工作效率 |
| 32% 表示可以依赖 AI 的输出 | |
| 69% 的设计师对 AI 工具满意,开发者是 82% | |
| 31% 的设计师在核心设计工作中使用 AI,开发者在核心开发工作中是 59% | |
| MeasuringU,在 tree test 中使用 ChatGPT,33 人,10 个任务 | 真人完成了约 51% 的任务。ChatGPT 在一轮中十个任务全部找对路径,在另外四轮中找对了十个中的九个 |
把 Figma 的两个数字放在一起看。78% 觉得自己更快了,32% 信任输出。这个差距就是这份工作。总得有人检查这些结果,而检查的人必须知道什么是对的。
MeasuringU 的研究是平均值问题最清楚的证据。让 ChatGPT 在美国 IRS 网站的导航里找东西,它找到的次数远远多于真人。一个从不迷路的参与者,在一个专门找出人们会在哪里迷路的测试里毫无用处。它对每个任务难度的估计,和人们的回答相当接近。它能预测观点。它没法重现行为。
NN/g 的结论是:如果要用合成用户,只用于案头研究和在真实研究之前提出假设。永远不要把它们的输出当作发现来展示;在本来就很难做研究的地方要格外小心,因为正是在那里,便宜的替代品会取代真东西。
AI 在拿走 UX 的工作吗?
不是 2023 年那些标题说的那样。Nielsen Norman Group 的 2026 年 UX 现状描述了这条曲线:疫情之后的大量招人,2023 年到 2024 年随着预算收紧而来的快速下降,然后从 2024 年底到整个 2025 年逐渐稳定。它也点出了让下降更严重的那个说法:AI 热潮让人以为新工具能很快取代设计师和研究者。NN/g 说这不是真的,但对想要削减成本的人来说很方便。
回升并不平均。资深从业者和通才回来得更快。入门职位仍然很少,竞争很大,NN/g 预计 2026 年还会这样。User Interviews 的调查从内部显示了同样的压力:49% 的研究者对这个领域的未来不看好,上升了 26 个百分点;67% 不看好职业机会。
它也显示了标题没说的东西。21% 的人说公司解雇了研究者,和 2024 年差不多,而且研究者受到的冲击并不比设计或工程更大。35% 得到了晋升或承担了更多责任,20% 转到了新的职能。报告自己的解读是:研究也许正在从一个职位,变成其他职位都需要的一种能力。拥有这个职位的人可能会变少。需要这项工作的人会变多。
所以诚实的答案是:AI 没有删掉这份工作。它提高了门槛,而门槛最高的地方在门口。
UX 的工作在怎样变化?
工作正在从产出界面,转向决定界面应该是什么。NN/g 说得很直白:界面已经不再是让你与众不同的东西。设计系统让界面更便宜,AI 工具又把这一点放大了。用他们的话说,如果你只是把设计系统里的组件拼在一起,你已经可以被 AI 取代。不容易自动化的是:精心选择的品味、基于研究的背景理解、批判性思维和细致的判断。
我在自己的工作里看着这件事发生。在 Dot 的收银台上,界面从来不是难的部分。第一版先要金额,再选国家,再输手机号,再点按钮:六次点击加打字,而且界面打开时没有任何字段准备好输入。任何工具都能画出那个界面。重做从规格里的一行字开始:繁忙收银台前一位很累的收银员,一只手拿着手机,一只手拿着杯子。手机号放在最前面,金额字段自动准备好输入,一位回头客现在只需要点两下。
价值移到了前面,移到一句关于人的话里。我的设计流程指南是这样说的:AI 让做东西变得便宜,所以代价最高的错误移到了前面,也就是很快地做出错误的东西。由此有四个转变。
从界面到系统。 当一个设计系统加一个模型就能拼出界面时,设计师的工作就是这个系统:设计令牌、模式、每个状态的规则。这就是为什么 ux-skill 根据每一份需求生成一套新的系统,也是为什么我写了品牌规范是训练数据,不是模板。
从产出到判断。 NN/g 关于 AI 时代的设计品味的文章认为,技术能力不等于品味;当谁都能做出东西时,选择和辨别才让作品被看见。我首页的那个 bug 就是一个小小的证明。引擎做出了一套完全合格的系统。要知道它对我们来说是错的,需要一个能看出它落进了哪个类别的人。
从平均的用户到具体的用户。 默认设置越来越像。我们读了 150 个 shadcn/ui 仓库,收藏最多的项目用的是两种字体之一,加一个灰色主色。值得雇用的设计师,是能说清这个东西为谁而做的人,细节清楚,证据齐全。
从英语优先到本地语境。 这里的差距最大,也是我工作的地方。我们检查了 179 家获得融资的中东和北非新创公司,44% 没有阿拉伯语网站。从英语模板翻译过来的用户画像,记录的是英语作者的预期;一个主要从英语文本学习的模型,也有同样的问题。所以我免费的用户画像模板的阿拉伯语版直接用阿拉伯语写成,人物简介读起来就像一个来自安曼的人。NN/g 关于少见人群的提醒,放大到一个国家也成立:一个人群在网上写得越少,模型对它了解得就越少。
为什么 UX 职业会发展得更好?
因为这个故事里的每一种力量,都在抬高只有人能做的那件事的价格。界面越来越便宜,所以知道哪个界面重要就越来越值钱。做东西越来越快,所以做错东西的代价越来越高。AI 功能越来越多,NN/g 预计信任会成为 2026 年一个重要的设计问题,而它首先是一个研究问题。在 Figma 的调查里,52% 做 AI 产品的人说,设计对 AI 产品比对传统产品更重要,95% 说至少一样重要。
这对一个职业意味着什么,具体来说:
要学什么。
- 访谈和观察。 这两种能力模型做不到。自己去做用户访谈,问上一次的经过,看人们在平时的地方做这件事。
- 能查到来源的分析。 一张每张便签都带参与者编号的亲和图。这也是你检查模型整理结果的方法。
- 可用性测试。 看五个人用。NN/g 的指南仍然让 AI 远离主持这类测试。免费的可用性测试模板把每个发现和证据原话记在一起。
- 系统。 设计令牌、组件、状态、交付。
- 你的本地语境。 语言、收银台、畜栏、光线不好时的手机。你的用户群越特别,这些知识就越值钱。
- 和 AI 一起工作。 Figma 的调查里,超过 80% 的设计师和开发者说,学会和 AI 一起工作会是必不可少的。学会怎样给它需求、怎样限制它、怎样检查它。
要停止做什么。
- 把一堆界面当成交付物。交付的是决定,以及支持它的证据。
- 让模型假装成你的用户,再为它的回答做设计。
- 做”你会不会用这个”那种访谈。人和模型都很容易说会。
- 把 AI 摘要当作发现来展示。NN/g 认为,当来源是合成用户时,这样做是不诚实的,还会损害公司对研究的看法。

怎样把 AI 当作一个要你检查工作的新手研究员。 NN/g 说,AI 最好的用法就像实习生:充分的说明、背景、限制和纠正。就这样对待它。
- 像给新同事写说明一样给它写需求。 研究问题、参与者、你已经知道的东西。NN/g 发现,没有背景时,结果又模糊又没有先后。
- 给它一个模板。 填一张好的表,比自己发明一张,它出的错更少。
- 要它给出来源。 每条观察都带参与者编号和原话。每条案头研究的说法都带一个你自己会去打开的链接。
- 不许它填空。 告诉它,笔记里找不到依据时就把字段留空。然后删掉任何没有编号的行。
- 决定留给自己。 起草三个问题陈述是模型的事。选哪个问题是你的事,给每个发现定严重程度也是。模型不知道哪一次延误会花掉钱。
- 永远别让它当用户。 如果真要用合成用户,就用它在真实访谈前演练脚本或列出话题,并把它说的一切都标为假设。
全部的提示词,一个方法一个方法地写在设计流程指南里,指南用到的九个免费模板都在商店里。
这些都不新。没有人想要你的产品,他们想要的是结果,而结果在一个你必须亲自去见的人那里。AI 让这次见面周围的一切都变快了。它没有让见面本身变得可有可无。
常见问题
AI 能取代用户研究吗?
不能。模型很会起草脚本、整理访谈转写、列出失败状态。可它没法告诉你 Awad 在畜栏里做什么,或者 Rana 为什么把费用看两次。让它假装成你的用户,你得到的是它读过内容的平均值,而这恰恰是研究要去检验的假设。
AI 会取代 UX 设计师吗?
不会取代做判断的那部分人。Nielsen Norman Group 的 2026 年 UX 现状说,只会从设计系统里拼组件的设计师已经可以被 AI 取代,而品味、基于研究的背景理解、批判性思维和判断很难自动化。工作正在转向这些。
2026 年 UX 还是好职业吗?
是的,只是入门更难。NN/g 报告说,UX 就业市场从 2024 年底到 2025 年逐渐稳定,资深和通才职位回升得比入门职位快。在 User Interviews 2025 年的调查中,35% 的研究者得到了晋升或承担了更多责任。会访谈、会分析、会测试,又了解一个本地市场的新人,会更容易被看见。
ChatGPT 能做用户研究吗?
能做其中一部分:案头研究、起草脚本、转写、第一轮归类和报告草稿。它没法观察行为;当它假装成用户时,往往会附和你,觉得什么都重要,还会编出过去的经历。在 MeasuringU 的 tree test 里,它找对答案的次数远多于真人,这让它作为参与者毫无用处。
什么是合成用户?
由 AI 生成、照着某一类用户的样子、像其中一员那样回答研究问题的资料。NN/g 建议,如果要用,只在真实研究之前用于案头研究和提出假设,永远不要当作发现,而且对少见或专业的用户群要避免使用。
AI 能分析可用性测试吗?
不可靠。NN/g 说,无论人还是 AI 工具,都无法只凭转写文本分析一次可用性测试,因为人们不会说出自己做的每件事;它 2026 年的指南仍然建议不要让 AI 主持这类测试。AI 可以转写录音,起草发现清单。严重程度由你来定,每一句原话由你来核对。
参考来源
- 用 AI 加速研究 nngroup.com
- 测试了合成用户 nngroup.com
- User Interviews,用户研究现状报告 2025 userinterviews.com
- Figma 2025 AI 报告 figma.com
- MeasuringU,在 tree test 中使用 ChatGPT measuringu.com
- 2026 年 UX 现状 nngroup.com
- AI 时代的设计品味 nngroup.com