文章

AI 能取代用户研究吗?它见不到 Awad。

我自己的设计引擎推荐了一个和 claude.ai 首页几乎一样的方案。AI 在研究中能做好什么、在哪里失败,以及 UX 职业为什么会更好。

作者
Laith Aljunaidy
发布于
分钟阅读
15 分钟阅读
  • AI 能取代用户研究吗
  • 合成用户
  • AI 用户研究
  • UX 职业前景
  • AI 会取代 UX 设计师吗
本页内容
  1. 要点
  2. 十位牧民告诉了我们什么模型不知道的事?
  3. AI 在用户研究中能做好什么?
  4. AI 在用户研究中哪里会失败?
  5. 证据怎么说?
  6. AI 在拿走 UX 的工作吗?
  7. UX 的工作在怎样变化?
  8. 为什么 UX 职业会发展得更好?
  9. 常见问题
  10. 参考来源
ux-skill 根据四份需求生成的四个落地页:家庭医生、开发者工具、家庭餐馆和一个阿拉伯语记账应用
四份需求交给 ux-skill,得到四套不同的系统。可在它自己首页的需求上,同一个引擎第一次给出的是这个品类里最常见的答案。

2026 年 5 月,ux-skill 需要一个新首页。ux-skill 是我在做的设计引擎,它存在的全部理由,就是找出让 AI 做出来的界面看起来都一样的那些地方。所以我们做了最自然的事:用我们自己的推荐引擎,跑我们自己的需求。一个开发者工具的落地页,语气是编辑感、自信、安静、电影感。不许用的清单上有:用 Inter 做标题字体、紫到蓝的渐变、三张一样大的卡片。

十二秒后,引擎给出了答案。奶油色底上的 Cormorant Garamond,配一个温暖的棕红色强调色。这几乎就是 claude.ai 的首页。

引擎遵守了需求里的每一条规则。它读到”编辑感”和”安静”,就去找最接近的匹配,而那个匹配,正是这个品类里的 AI 工具早已上线的样子。我们给自己提了两个 bug。“编辑感”这个标签过度偏向一类老式书本字体。“安静”这个标签被写成了”必须是浅色底”,所以接近黑色的配色从来没有机会。修好之后,同一份需求给出的是近黑色底、一个温暖的金色强调色和 Fraunces 字体,一套我们谁都不会单凭品味选出来的系统。

ux-skill 不调用任何语言模型。它是一个确定性的评分引擎,可它还是做了模型面对熟悉问题时会做的事:给出可能性最高的答案。而可能性最高的答案,就是已有内容的平均值。

记住这个画面,因为关于 AI 和用户研究的全部争论都在这里。让模型假装成你的用户,你得到的是可能性最高的那个用户。研究存在的意义,就是找到那个和他不一样的人。

要点

  • AI 取代不了用户研究。它能起草访谈脚本,转写和翻译访谈录音,整理笔记,列出失败状态,写出报告的草稿。
  • 合成用户是模型读过的内容的平均值。Nielsen Norman Group 发现,合成用户会顺着你说,对所有事情一样在意,还会讲出自己从没有过的经历。
  • 你的用户群越特别,模型就越不像他们。NN/g 自己给的不该使用合成用户的例子,是越南的一位农民。海湾地区的牧民是同一种情况。
  • UX 就业市场正在稳定下来,入门依然很难,价值正在从产出界面转向判断、研究、系统和品味。
  • 照 NN/g 的说法使用 AI:像对待实习生一样。给它背景和限制,然后把每一行都和真实的原话对照。

十位牧民告诉了我们什么模型不知道的事?

2023 年,我在设计 Wfrah,一款给海湾地区绵羊和山羊养殖户的应用。在任何界面出现之前,创始人 Abdullatif 就告诉我们要面对什么。牧民按父亲教的方式经营这门手艺,不相信一个应用会比他们更懂自己的牲畜。

于是我们去听。和不同经验的牧民做了十次深度访谈,再花时间观察他们已经在用的工具。问一个牧民农场为什么亏钱,他每次给你的都是同一个答案:饲料太贵,买家给得太少。

这是人们会说出口的答案,而人们说出口的答案,就是最后会被写下来的那些。任何从人们写下的文字里学出来的东西,都会把它原样还给你。

访谈发现了这句话底下的东西。很多牧民没法用公式算出畜群每天的营养需要,而”问题出在市场”的想法,让他们忽视了营养和管理。于是应用里最有用的东西,成了一个营养计算器,为每头牲畜、每个生长阶段完成计算。没有人要求过它。访谈显示了有多少人需要它。

Awad,Wfrah 研究中虚构的牧民用户画像,在畜栏里一只公羊旁边
Awad。一个根据十次真实访谈构建的虚构用户画像:为家里的方法自豪,也好奇有没有更好的办法。

研究最后变成了一个用户画像:Awad。他为自己按家族几代人的方式做事而自豪,因为管理畜群很难而觉得累,也好奇有没有更好的办法。这种两面,自豪和好奇同时存在,成了整个设计的出发点:一个对 Awad 说教的应用会失去他,一个在第一屏就给他有用东西的应用,也许能留住他。

Awad 是虚构的,由十次真实访谈构建而成。这就是用户画像和合成用户的区别,这篇文章接下来的内容都建立在这一点上。

移动开发 Hisham 和我在同一个房间里开发 Wfrah
和移动开发 Hisham 一起推进 Wfrah 的开发。

AI 在用户研究中能做好什么?

比批评它的人愿意承认的要多。我的设计流程指南里,很多方法下面都有一段”用 Claude 来做”。这些段落的模式都一样:模型起草、整理、列出。人来做决定。

Nielsen Norman Group 关于用 AI 加速研究的指南,最近一次审阅是在 2026 年 1 月,结论也一样。它认为 AI 在计划和分析两个阶段最有帮助,在中间最弱,因为中间需要有人看着一个人使用产品。

研究任务AI 做得好的你仍要检查的
案头研究开始阅读,收集来源编造的事实和来源。每一个都要打开
访谈脚本和测试任务很快写出很多选项引导性问题和”你会不会用”这类问题
同意书、筛选问题、研究计划按你的模板为这次研究填好错误的权限,错误的细节
转写和翻译说话人、时间点、摘要口音和某些语言上的错误
整理笔记对主题做第一轮归类按关键词分的组,塞得太满的”其他”
失败状态列出每一步可能出错的所有方式每个状态都说出了字段和解决办法
报告草稿语法、语气、给决策者的简单说法并非来自研究的细节

起草脚本。 空白页是准备访谈时最慢的部分。我把研究问题贴进去,要一份 30 分钟的脚本,内容是这个人上一次做这件事的经过:不要假设性问题,不要提到具体功能的问题,并标出任何提前给出答案的问题。然后我删掉它还是加进来的每一个”你会不会”问题。NN/g 在测试任务上看到了同样的事:即使给了好的例子和明确的规则,AI 也常常写出引导性的任务。草稿能省一个小时。修改仍然是你的事。

用户访谈脚本和笔记模板:五个部分共 18 个问题,旁边是一张记录原话、观察和后续问题的笔记表
免费的用户访谈模板,用一个完整的例子填好:Bunn,一个虚构的咖啡应用。左边是脚本,右边是每位参与者一张笔记表。

转写和整理。 访谈之后,模型真正派上用场。我把转写文本贴进去,要它把每条观察写成一行,带参与者编号和原话,然后提出分组,只有一条规则:只有一位参与者说过的话,不能成为一个主题。整理是模型做得好的事。用听起来合理的发现去填补空白,是你必须抓出来的事。NN/g 说得很直接:AI 的分组往往按关键词来,很多笔记最后落在”其他”里。

亲和图模板:Bunn 咖啡应用的六次访谈整理成五个主题
Bunn 例子里的一张亲和图。六次访谈,五个主题,每张便签都带着参与者编号。正是这个编号让你能检查模型。

列出失败状态。 在这件事上,AI 比大多数赶时间的设计师做得更好。给它主流程,要它列出每一步的每一种失败:输入无效、超时、离线、点了两次、权限被拒、数据为空。然后检查每个状态是否告诉了用户出了什么问题、怎么解决。在 Dot 的收银台上,手机号少一位时显示的是:“Nothing added. Phone is short by 1.”(没有加上积分,手机号少了 1 位。)模型会列出这个状态。而”每条失败信息都以 Nothing added 开头”这条规则,因为收银员出错后的第一个问题总是”这笔到底加上了没有”,来自为站在收银台前的那个人做设计。

AI 在用户研究中哪里会失败?

就在研究存在的那件事上:弄清楚你没见过的人身上什么是真的。这种失败有个名字。合成用户是 AI 生成的一份资料,照着某一类用户的样子,像其中一员那样回答访谈问题。有些产品把它当作”没有用户的用户研究”来卖。

Nielsen Norman Group 测试了合成用户,拿来和他们之前用真人做过的三项研究对比。下面是他们的发现。

它想顺着你说。 一项在线学习研究里,真实的学员承认自己开始学了却没有学完。合成用户说,自己提到的每一项都学完了。大多数真实参与者不用交流区,因为那里的互动显得很假。合成用户却说了很多交流区的好话。NN/g 的解释是,模型读过很多关于交流区对学习有好处的文章,而对你有好处,不等于你真的会用。

它什么都在意。 问一个合成用户什么让在线学习有吸引力,它带着同样的热情列出了七个因素。真实的人对某些事情的在意远远多过其他,而这个排序正是研究要找的。七个同样重要的需要,没法告诉你先做什么。

它记得从没发生过的事。 模型没有用过你的产品,所以它讲的过去的经历都是编的。NN/g 指出,这些资料在观点上比在故事上更准确,而这对研究来说正好反了,因为故事才是证据。他们向一位合成的医药销售代表讲用无人机送样品的想法,它说这个想法可能会改变整个局面。

它是平面的。 NN/g 最直接的一句话是:合成用户感觉像是对几万人经历的一个平面的大概,因为它们就是。这又是我那个首页的故事。引擎没有算错。它给出的是那一类的中间值。

用户群越特别,情况越糟。NN/g 自己的建议是:对少见或专业的人群,不要使用合成用户。它给的例子是越南的一位农民,因为模型关于这个人的数据是零散的。Awad 正是这种情况。一位从父亲那里学会这门手艺的海湾牧民,在模型学习的那些文字里,几乎没有写下什么。站在繁忙收银台前的收银员也一样。

人们说的和做的。 第二个缺口是行为。模型很会处理文字,而研究常常关心的是文字和行动之间的距离。在我所有模板都用到的 Bunn 例子里,用户画像 Rana 在访谈中说最后才出现的配送费是在坑人。笔记里记着,她付钱前把费用看了两次,一次在菜单上,一次在结账时。原话和行为放在一起,才是发现。转写文本里只有原话。

Rana 为 10:00 的会议点咖啡的共情图:说、想、做、感受,以及痛点和收获
Bunn 例子里的共情图。说的和做的并排放着,因为发现往往就在两者不一致的地方。

NN/g 对可用性测试也说了同样的话:无论人还是 AI 工具,都无法只凭转写文本分析一次可用性测试,因为人们不会说出每一次点击,还常常做一件事、说另一件事。它 2026 年的指南仍然建议不要让 AI 主持可用性测试。Rana 把费用看两次,是一个行为。你只有看着才会发现。

它没法判断来源。 好的研究者会问模型不会问的问题:访谈者是不是引导了这个回答?参与者是不是觉得难为情?这个人到底符不符合招募条件?NN/g 正是把这些列为依赖背景的判断,超出了现有工具的能力。

证据怎么说?

研究这个问题的人对大致情况看法一致:AI 已经出现在研究工作的每个地方,而几乎没有人不经检查就信任它。

来源发现
User Interviews,用户研究现状报告 2025,485 名研究者80% 使用 AI,一年内上升 24 个百分点
91% 担心输出的准确性和编造内容
63% 担心 AI 会降低人的洞察和批判性思维的价值
Figma 2025 AI 报告,2,500 名设计师和开发者78% 认为 AI 明显提高了他们的工作效率
32% 表示可以依赖 AI 的输出
69% 的设计师对 AI 工具满意,开发者是 82%
31% 的设计师在核心设计工作中使用 AI,开发者在核心开发工作中是 59%
MeasuringU,在 tree test 中使用 ChatGPT,33 人,10 个任务真人完成了约 51% 的任务。ChatGPT 在一轮中十个任务全部找对路径,在另外四轮中找对了十个中的九个

把 Figma 的两个数字放在一起看。78% 觉得自己更快了,32% 信任输出。这个差距就是这份工作。总得有人检查这些结果,而检查的人必须知道什么是对的。

MeasuringU 的研究是平均值问题最清楚的证据。让 ChatGPT 在美国 IRS 网站的导航里找东西,它找到的次数远远多于真人。一个从不迷路的参与者,在一个专门找出人们会在哪里迷路的测试里毫无用处。它对每个任务难度的估计,和人们的回答相当接近。它能预测观点。它没法重现行为。

NN/g 的结论是:如果要用合成用户,只用于案头研究和在真实研究之前提出假设。永远不要把它们的输出当作发现来展示;在本来就很难做研究的地方要格外小心,因为正是在那里,便宜的替代品会取代真东西。

AI 在拿走 UX 的工作吗?

不是 2023 年那些标题说的那样。Nielsen Norman Group 的 2026 年 UX 现状描述了这条曲线:疫情之后的大量招人,2023 年到 2024 年随着预算收紧而来的快速下降,然后从 2024 年底到整个 2025 年逐渐稳定。它也点出了让下降更严重的那个说法:AI 热潮让人以为新工具能很快取代设计师和研究者。NN/g 说这不是真的,但对想要削减成本的人来说很方便。

回升并不平均。资深从业者和通才回来得更快。入门职位仍然很少,竞争很大,NN/g 预计 2026 年还会这样。User Interviews 的调查从内部显示了同样的压力:49% 的研究者对这个领域的未来不看好,上升了 26 个百分点;67% 不看好职业机会。

它也显示了标题没说的东西。21% 的人说公司解雇了研究者,和 2024 年差不多,而且研究者受到的冲击并不比设计或工程更大。35% 得到了晋升或承担了更多责任,20% 转到了新的职能。报告自己的解读是:研究也许正在从一个职位,变成其他职位都需要的一种能力。拥有这个职位的人可能会变少。需要这项工作的人会变多。

所以诚实的答案是:AI 没有删掉这份工作。它提高了门槛,而门槛最高的地方在门口。

UX 的工作在怎样变化?

工作正在从产出界面,转向决定界面应该是什么。NN/g 说得很直白:界面已经不再是让你与众不同的东西。设计系统让界面更便宜,AI 工具又把这一点放大了。用他们的话说,如果你只是把设计系统里的组件拼在一起,你已经可以被 AI 取代。不容易自动化的是:精心选择的品味、基于研究的背景理解、批判性思维和细致的判断。

我在自己的工作里看着这件事发生。在 Dot 的收银台上,界面从来不是难的部分。第一版先要金额,再选国家,再输手机号,再点按钮:六次点击加打字,而且界面打开时没有任何字段准备好输入。任何工具都能画出那个界面。重做从规格里的一行字开始:繁忙收银台前一位很累的收银员,一只手拿着手机,一只手拿着杯子。手机号放在最前面,金额字段自动准备好输入,一位回头客现在只需要点两下。

价值移到了前面,移到一句关于人的话里。我的设计流程指南是这样说的:AI 让做东西变得便宜,所以代价最高的错误移到了前面,也就是很快地做出错误的东西。由此有四个转变。

从界面到系统。 当一个设计系统加一个模型就能拼出界面时,设计师的工作就是这个系统:设计令牌、模式、每个状态的规则。这就是为什么 ux-skill 根据每一份需求生成一套新的系统,也是为什么我写了品牌规范是训练数据,不是模板。

从产出到判断。 NN/g 关于 AI 时代的设计品味的文章认为,技术能力不等于品味;当谁都能做出东西时,选择和辨别才让作品被看见。我首页的那个 bug 就是一个小小的证明。引擎做出了一套完全合格的系统。要知道它对我们来说是错的,需要一个能看出它落进了哪个类别的人。

从平均的用户到具体的用户。 默认设置越来越像。我们读了 150 个 shadcn/ui 仓库,收藏最多的项目用的是两种字体之一,加一个灰色主色。值得雇用的设计师,是能说清这个东西为谁而做的人,细节清楚,证据齐全。

从英语优先到本地语境。 这里的差距最大,也是我工作的地方。我们检查了 179 家获得融资的中东和北非新创公司,44% 没有阿拉伯语网站。从英语模板翻译过来的用户画像,记录的是英语作者的预期;一个主要从英语文本学习的模型,也有同样的问题。所以我免费的用户画像模板的阿拉伯语版直接用阿拉伯语写成,人物简介读起来就像一个来自安曼的人。NN/g 关于少见人群的提醒,放大到一个国家也成立:一个人群在网上写得越少,模型对它了解得就越少。

为什么 UX 职业会发展得更好?

因为这个故事里的每一种力量,都在抬高只有人能做的那件事的价格。界面越来越便宜,所以知道哪个界面重要就越来越值钱。做东西越来越快,所以做错东西的代价越来越高。AI 功能越来越多,NN/g 预计信任会成为 2026 年一个重要的设计问题,而它首先是一个研究问题。在 Figma 的调查里,52% 做 AI 产品的人说,设计对 AI 产品比对传统产品更重要,95% 说至少一样重要。

这对一个职业意味着什么,具体来说:

要学什么。

  • 访谈和观察。 这两种能力模型做不到。自己去做用户访谈,问上一次的经过,看人们在平时的地方做这件事。
  • 能查到来源的分析。 一张每张便签都带参与者编号的亲和图。这也是你检查模型整理结果的方法。
  • 可用性测试。 看五个人用。NN/g 的指南仍然让 AI 远离主持这类测试。免费的可用性测试模板把每个发现和证据原话记在一起。
  • 系统。 设计令牌、组件、状态、交付。
  • 你的本地语境。 语言、收银台、畜栏、光线不好时的手机。你的用户群越特别,这些知识就越值钱。
  • 和 AI 一起工作。 Figma 的调查里,超过 80% 的设计师和开发者说,学会和 AI 一起工作会是必不可少的。学会怎样给它需求、怎样限制它、怎样检查它。

要停止做什么。

  • 把一堆界面当成交付物。交付的是决定,以及支持它的证据。
  • 让模型假装成你的用户,再为它的回答做设计。
  • 做”你会不会用这个”那种访谈。人和模型都很容易说会。
  • 把 AI 摘要当作发现来展示。NN/g 认为,当来源是合成用户时,这样做是不诚实的,还会损害公司对研究的看法。
Bunn 的可用性测试模板:计划、五个带通过、部分通过和失败结果的任务,以及按严重程度排序、附证据原话的发现
Bunn 例子里的可用性测试模板。每个发现都带着证明它的那句原话。这一列,正是模型填不了的部分。

怎样把 AI 当作一个要你检查工作的新手研究员。 NN/g 说,AI 最好的用法就像实习生:充分的说明、背景、限制和纠正。就这样对待它。

  1. 像给新同事写说明一样给它写需求。 研究问题、参与者、你已经知道的东西。NN/g 发现,没有背景时,结果又模糊又没有先后。
  2. 给它一个模板。 填一张好的表,比自己发明一张,它出的错更少。
  3. 要它给出来源。 每条观察都带参与者编号和原话。每条案头研究的说法都带一个你自己会去打开的链接。
  4. 不许它填空。 告诉它,笔记里找不到依据时就把字段留空。然后删掉任何没有编号的行。
  5. 决定留给自己。 起草三个问题陈述是模型的事。选哪个问题是你的事,给每个发现定严重程度也是。模型不知道哪一次延误会花掉钱。
  6. 永远别让它当用户。 如果真要用合成用户,就用它在真实访谈前演练脚本或列出话题,并把它说的一切都标为假设。

全部的提示词,一个方法一个方法地写在设计流程指南里,指南用到的九个免费模板都在商店里。

这些都不新。没有人想要你的产品,他们想要的是结果,而结果在一个你必须亲自去见的人那里。AI 让这次见面周围的一切都变快了。它没有让见面本身变得可有可无。

常见问题

AI 能取代用户研究吗?

不能。模型很会起草脚本、整理访谈转写、列出失败状态。可它没法告诉你 Awad 在畜栏里做什么,或者 Rana 为什么把费用看两次。让它假装成你的用户,你得到的是它读过内容的平均值,而这恰恰是研究要去检验的假设。

AI 会取代 UX 设计师吗?

不会取代做判断的那部分人。Nielsen Norman Group 的 2026 年 UX 现状说,只会从设计系统里拼组件的设计师已经可以被 AI 取代,而品味、基于研究的背景理解、批判性思维和判断很难自动化。工作正在转向这些。

2026 年 UX 还是好职业吗?

是的,只是入门更难。NN/g 报告说,UX 就业市场从 2024 年底到 2025 年逐渐稳定,资深和通才职位回升得比入门职位快。在 User Interviews 2025 年的调查中,35% 的研究者得到了晋升或承担了更多责任。会访谈、会分析、会测试,又了解一个本地市场的新人,会更容易被看见。

ChatGPT 能做用户研究吗?

能做其中一部分:案头研究、起草脚本、转写、第一轮归类和报告草稿。它没法观察行为;当它假装成用户时,往往会附和你,觉得什么都重要,还会编出过去的经历。在 MeasuringU 的 tree test 里,它找对答案的次数远多于真人,这让它作为参与者毫无用处。

什么是合成用户?

由 AI 生成、照着某一类用户的样子、像其中一员那样回答研究问题的资料。NN/g 建议,如果要用,只在真实研究之前用于案头研究和提出假设,永远不要当作发现,而且对少见或专业的用户群要避免使用。

AI 能分析可用性测试吗?

不可靠。NN/g 说,无论人还是 AI 工具,都无法只凭转写文本分析一次可用性测试,因为人们不会说出自己做的每件事;它 2026 年的指南仍然建议不要让 AI 主持这类测试。AI 可以转写录音,起草发现清单。严重程度由你来定,每一句原话由你来核对。

参考来源

  1. 用 AI 加速研究 nngroup.com
  2. 测试了合成用户 nngroup.com
  3. User Interviews,用户研究现状报告 2025 userinterviews.com
  4. Figma 2025 AI 报告 figma.com
  5. MeasuringU,在 tree test 中使用 ChatGPT measuringu.com
  6. 2026 年 UX 现状 nngroup.com
  7. AI 时代的设计品味 nngroup.com

双指、双击或用触控板缩放,拖动可移动。