# AI 能取代用户研究吗？它见不到 Awad。

我自己的设计引擎推荐了一个和 claude.ai 首页几乎一样的方案。AI 在研究中能做好什么、在哪里失败，以及 UX 职业为什么会更好。

https://laithjunaidy.com/zh/writing/can-ai-replace-user-research
作者 Laith Aljunaidy. 发布于: 2026-10-05.

---

![ux-skill 根据四份需求生成的四个落地页：家庭医生、开发者工具、家庭餐馆和一个阿拉伯语记账应用](https://laithjunaidy.com/writing/design-process/uxskill-4-brands.jpg)

*四份需求交给 [ux-skill](https://laithjunaidy.com/zh/research/ux-skill)，得到四套不同的系统。可在它自己首页的需求上，同一个引擎第一次给出的是这个品类里最常见的答案。*

2026 年 5 月，[ux-skill](https://laithjunaidy.com/zh/research/ux-skill) 需要一个新首页。ux-skill 是我在做的设计引擎，它存在的全部理由，就是找出让 AI 做出来的界面看起来都一样的那些地方。所以我们做了最自然的事：用我们自己的推荐引擎，跑我们自己的需求。一个开发者工具的落地页，语气是编辑感、自信、安静、电影感。不许用的清单上有：用 Inter 做标题字体、紫到蓝的渐变、三张一样大的卡片。

十二秒后，引擎给出了答案。奶油色底上的 Cormorant Garamond，配一个温暖的棕红色强调色。这几乎就是 claude.ai 的首页。

引擎遵守了需求里的每一条规则。它读到"编辑感"和"安静"，就去找最接近的匹配，而那个匹配，正是这个品类里的 AI 工具早已上线的样子。我们给自己提了[两个 bug](https://uxskill.laithjunaidy.com/blog/dogfooding-design-engine.html)。"编辑感"这个标签过度偏向一类老式书本字体。"安静"这个标签被写成了"必须是浅色底"，所以接近黑色的配色从来没有机会。修好之后，同一份需求给出的是近黑色底、一个温暖的金色强调色和 Fraunces 字体，一套我们谁都不会单凭品味选出来的系统。

ux-skill 不调用任何语言模型。它是一个确定性的评分引擎，可它还是做了模型面对熟悉问题时会做的事：给出可能性最高的答案。而可能性最高的答案，就是已有内容的平均值。

记住这个画面，因为关于 AI 和用户研究的全部争论都在这里。让模型假装成你的用户，你得到的是可能性最高的那个用户。研究存在的意义，就是找到那个和他不一样的人。

## 要点

- AI 取代不了用户研究。它能起草访谈脚本，转写和翻译访谈录音，整理笔记，列出失败状态，写出报告的草稿。
- 合成用户是模型读过的内容的平均值。Nielsen Norman Group 发现，合成用户会顺着你说，对所有事情一样在意，还会讲出自己从没有过的经历。
- 你的用户群越特别，模型就越不像他们。NN/g 自己给的不该使用合成用户的例子，是越南的一位农民。海湾地区的牧民是同一种情况。
- UX 就业市场正在稳定下来，入门依然很难，价值正在从产出界面转向判断、研究、系统和品味。
- 照 NN/g 的说法使用 AI：像对待实习生一样。给它背景和限制，然后把每一行都和真实的原话对照。

## 十位牧民告诉了我们什么模型不知道的事？

2023 年，我在设计 [Wfrah](https://laithjunaidy.com/zh/work/wfrah)，一款给海湾地区绵羊和山羊养殖户的应用。在任何界面出现之前，创始人 Abdullatif 就告诉我们要面对什么。牧民按父亲教的方式经营这门手艺，不相信一个应用会比他们更懂自己的牲畜。

于是我们去听。和不同经验的牧民做了十次深度访谈，再花时间观察他们已经在用的工具。问一个牧民农场为什么亏钱，他每次给你的都是同一个答案：饲料太贵，买家给得太少。

这是人们会说出口的答案，而人们说出口的答案，就是最后会被写下来的那些。任何从人们写下的文字里学出来的东西，都会把它原样还给你。

访谈发现了这句话底下的东西。很多牧民没法用公式算出畜群每天的营养需要，而"问题出在市场"的想法，让他们忽视了营养和管理。于是应用里最有用的东西，成了一个[营养计算器](https://laithjunaidy.com/zh/writing/designing-wfrah)，为每头牲畜、每个生长阶段完成计算。没有人要求过它。访谈显示了有多少人需要它。

![Awad，Wfrah 研究中虚构的牧民用户画像，在畜栏里一只公羊旁边](https://laithjunaidy.com/writing/wfrah/persona.jpg)

*Awad。一个根据十次真实访谈构建的虚构用户画像：为家里的方法自豪，也好奇有没有更好的办法。*

研究最后变成了一个用户画像：Awad。他为自己按家族几代人的方式做事而自豪，因为管理畜群很难而觉得累，也好奇有没有更好的办法。这种两面，自豪和好奇同时存在，成了整个设计的出发点：一个对 Awad 说教的应用会失去他，一个在第一屏就给他有用东西的应用，也许能留住他。

Awad 是虚构的，由十次真实访谈构建而成。这就是用户画像和合成用户的区别，这篇文章接下来的内容都建立在这一点上。

![移动开发 Hisham 和我在同一个房间里开发 Wfrah](https://laithjunaidy.com/writing/wfrah/team.jpg)

*和移动开发 Hisham 一起推进 Wfrah 的开发。*

## AI 在用户研究中能做好什么？

比批评它的人愿意承认的要多。我的[设计流程指南](https://laithjunaidy.com/zh/writing/design-process-checklist)里，很多方法下面都有一段"用 Claude 来做"。这些段落的模式都一样：模型起草、整理、列出。人来做决定。

Nielsen Norman Group 关于[用 AI 加速研究](https://www.nngroup.com/articles/research-with-ai/)的指南，最近一次审阅是在 2026 年 1 月，结论也一样。它认为 AI 在计划和分析两个阶段最有帮助，在中间最弱，因为中间需要有人看着一个人使用产品。

| 研究任务 | AI 做得好的 | 你仍要检查的 |
| :- | :- | :- |
| 案头研究 | 开始阅读，收集来源 | 编造的事实和来源。每一个都要打开 |
| 访谈脚本和测试任务 | 很快写出很多选项 | 引导性问题和"你会不会用"这类问题 |
| 同意书、筛选问题、研究计划 | 按你的模板为这次研究填好 | 错误的权限，错误的细节 |
| 转写和翻译 | 说话人、时间点、摘要 | 口音和某些语言上的错误 |
| 整理笔记 | 对主题做第一轮归类 | 按关键词分的组，塞得太满的"其他" |
| 失败状态 | 列出每一步可能出错的所有方式 | 每个状态都说出了字段和解决办法 |
| 报告草稿 | 语法、语气、给决策者的简单说法 | 并非来自研究的细节 |

**起草脚本。** 空白页是准备访谈时最慢的部分。我把研究问题贴进去，要一份 30 分钟的脚本，内容是这个人上一次做这件事的经过：不要假设性问题，不要提到具体功能的问题，并标出任何提前给出答案的问题。然后我删掉它还是加进来的每一个"你会不会"问题。NN/g 在测试任务上看到了同样的事：即使给了好的例子和明确的规则，AI 也常常写出引导性的任务。草稿能省一个小时。修改仍然是你的事。

![用户访谈脚本和笔记模板：五个部分共 18 个问题，旁边是一张记录原话、观察和后续问题的笔记表](https://laithjunaidy.com/store/user-interview/en-light.jpg)

*免费的[用户访谈模板](https://laithjunaidy.com/zh/store/user-interview)，用一个完整的例子填好：Bunn，一个虚构的咖啡应用。左边是脚本，右边是每位参与者一张笔记表。*

**转写和整理。** 访谈之后，模型真正派上用场。我把转写文本贴进去，要它把每条观察写成一行，带参与者编号和原话，然后提出分组，只有一条规则：只有一位参与者说过的话，不能成为一个主题。整理是模型做得好的事。用听起来合理的发现去填补空白，是你必须抓出来的事。NN/g 说得很直接：AI 的分组往往按关键词来，很多笔记最后落在"其他"里。

![亲和图模板：Bunn 咖啡应用的六次访谈整理成五个主题](https://laithjunaidy.com/store/affinity-map/en-light.jpg)

*Bunn 例子里的一张[亲和图](https://laithjunaidy.com/zh/store/affinity-map)。六次访谈，五个主题，每张便签都带着参与者编号。正是这个编号让你能检查模型。*

**列出失败状态。** 在这件事上，AI 比大多数赶时间的设计师做得更好。给它主流程，要它列出每一步的每一种失败：输入无效、超时、离线、点了两次、权限被拒、数据为空。然后检查每个状态是否告诉了用户出了什么问题、怎么解决。在 [Dot](https://laithjunaidy.com/zh/research/dot) 的收银台上，手机号少一位时显示的是："Nothing added. Phone is short by 1."（没有加上积分，手机号少了 1 位。）模型会列出这个状态。而"每条失败信息都以 Nothing added 开头"这条规则，因为收银员出错后的第一个问题总是"这笔到底加上了没有"，来自为站在收银台前的那个人做设计。

## AI 在用户研究中哪里会失败？

就在研究存在的那件事上：弄清楚你没见过的人身上什么是真的。这种失败有个名字。合成用户是 AI 生成的一份资料，照着某一类用户的样子，像其中一员那样回答访谈问题。有些产品把它当作"没有用户的用户研究"来卖。

Nielsen Norman Group [测试了合成用户](https://www.nngroup.com/articles/synthetic-users/)，拿来和他们之前用真人做过的三项研究对比。下面是他们的发现。

**它想顺着你说。** 一项在线学习研究里，真实的学员承认自己开始学了却没有学完。合成用户说，自己提到的每一项都学完了。大多数真实参与者不用交流区，因为那里的互动显得很假。合成用户却说了很多交流区的好话。NN/g 的解释是，模型读过很多关于交流区对学习有好处的文章，而对你有好处，不等于你真的会用。

**它什么都在意。** 问一个合成用户什么让在线学习有吸引力，它带着同样的热情列出了七个因素。真实的人对某些事情的在意远远多过其他，而这个排序正是研究要找的。七个同样重要的需要，没法告诉你先做什么。

**它记得从没发生过的事。** 模型没有用过你的产品，所以它讲的过去的经历都是编的。NN/g 指出，这些资料在观点上比在故事上更准确，而这对研究来说正好反了，因为故事才是证据。他们向一位合成的医药销售代表讲用无人机送样品的想法，它说这个想法可能会改变整个局面。

**它是平面的。** NN/g 最直接的一句话是：合成用户感觉像是对几万人经历的一个平面的大概，因为它们就是。这又是我那个首页的故事。引擎没有算错。它给出的是那一类的中间值。

用户群越特别，情况越糟。NN/g 自己的建议是：对少见或专业的人群，不要使用合成用户。它给的例子是越南的一位农民，因为模型关于这个人的数据是零散的。Awad 正是这种情况。一位从父亲那里学会这门手艺的海湾牧民，在模型学习的那些文字里，几乎没有写下什么。站在繁忙收银台前的收银员也一样。

**人们说的和做的。** 第二个缺口是行为。模型很会处理文字，而研究常常关心的是文字和行动之间的距离。在我所有模板都用到的 Bunn 例子里，用户画像 Rana 在访谈中说最后才出现的配送费是在坑人。笔记里记着，她付钱前把费用看了两次，一次在菜单上，一次在结账时。原话和行为放在一起，才是发现。转写文本里只有原话。

![Rana 为 10:00 的会议点咖啡的共情图：说、想、做、感受，以及痛点和收获](https://laithjunaidy.com/store/empathy-map/en-light.jpg)

*Bunn 例子里的[共情图](https://laithjunaidy.com/zh/store/empathy-map)。说的和做的并排放着，因为发现往往就在两者不一致的地方。*

NN/g 对可用性测试也说了同样的话：无论人还是 AI 工具，都无法只凭转写文本分析一次可用性测试，因为人们不会说出每一次点击，还常常做一件事、说另一件事。它 2026 年的指南仍然建议不要让 AI 主持可用性测试。Rana 把费用看两次，是一个行为。你只有看着才会发现。

**它没法判断来源。** 好的研究者会问模型不会问的问题：访谈者是不是引导了这个回答？参与者是不是觉得难为情？这个人到底符不符合招募条件？NN/g 正是把这些列为依赖背景的判断，超出了现有工具的能力。

## 证据怎么说？

研究这个问题的人对大致情况看法一致：AI 已经出现在研究工作的每个地方，而几乎没有人不经检查就信任它。

| 来源 | 发现 |
| :- | :- |
| [User Interviews，用户研究现状报告 2025](https://www.userinterviews.com/state-of-user-research-report)，485 名研究者 | 80% 使用 AI，一年内上升 24 个百分点 |
| | 91% 担心输出的准确性和编造内容 |
| | 63% 担心 AI 会降低人的洞察和批判性思维的价值 |
| [Figma 2025 AI 报告](https://www.figma.com/blog/figma-2025-ai-report-perspectives/)，2,500 名设计师和开发者 | 78% 认为 AI 明显提高了他们的工作效率 |
| | 32% 表示可以依赖 AI 的输出 |
| | 69% 的设计师对 AI 工具满意，开发者是 82% |
| | 31% 的设计师在核心设计工作中使用 AI，开发者在核心开发工作中是 59% |
| [MeasuringU，在 tree test 中使用 ChatGPT](https://measuringu.com/chatgpt4-tree-test/)，33 人，10 个任务 | 真人完成了约 51% 的任务。ChatGPT 在一轮中十个任务全部找对路径，在另外四轮中找对了十个中的九个 |

把 Figma 的两个数字放在一起看。78% 觉得自己更快了，32% 信任输出。这个差距就是这份工作。总得有人检查这些结果，而检查的人必须知道什么是对的。

MeasuringU 的研究是平均值问题最清楚的证据。让 ChatGPT 在美国 IRS 网站的导航里找东西，它找到的次数远远多于真人。一个从不迷路的参与者，在一个专门找出人们会在哪里迷路的测试里毫无用处。它对每个任务难度的估计，和人们的回答相当接近。它能预测观点。它没法重现行为。

NN/g 的结论是：如果要用合成用户，只用于案头研究和在真实研究之前提出假设。永远不要把它们的输出当作发现来展示；在本来就很难做研究的地方要格外小心，因为正是在那里，便宜的替代品会取代真东西。

## AI 在拿走 UX 的工作吗？

不是 2023 年那些标题说的那样。Nielsen Norman Group 的 [2026 年 UX 现状](https://www.nngroup.com/articles/state-of-ux-2026/)描述了这条曲线：疫情之后的大量招人，2023 年到 2024 年随着预算收紧而来的快速下降，然后从 2024 年底到整个 2025 年逐渐稳定。它也点出了让下降更严重的那个说法：AI 热潮让人以为新工具能很快取代设计师和研究者。NN/g 说这不是真的，但对想要削减成本的人来说很方便。

回升并不平均。资深从业者和通才回来得更快。入门职位仍然很少，竞争很大，NN/g 预计 2026 年还会这样。User Interviews 的调查从内部显示了同样的压力：49% 的研究者对这个领域的未来不看好，上升了 26 个百分点；67% 不看好职业机会。

它也显示了标题没说的东西。21% 的人说公司解雇了研究者，和 2024 年差不多，而且研究者受到的冲击并不比设计或工程更大。35% 得到了晋升或承担了更多责任，20% 转到了新的职能。报告自己的解读是：研究也许正在从一个职位，变成其他职位都需要的一种能力。拥有这个职位的人可能会变少。需要这项工作的人会变多。

所以诚实的答案是：AI 没有删掉这份工作。它提高了门槛，而门槛最高的地方在门口。

## UX 的工作在怎样变化？

工作正在从产出界面，转向决定界面应该是什么。NN/g 说得很直白：界面已经不再是让你与众不同的东西。设计系统让界面更便宜，AI 工具又把这一点放大了。用他们的话说，如果你只是把设计系统里的组件拼在一起，你已经可以被 AI 取代。不容易自动化的是：精心选择的品味、基于研究的背景理解、批判性思维和细致的判断。

我在自己的工作里看着这件事发生。在 Dot 的收银台上，界面从来不是难的部分。第一版先要金额，再选国家，再输手机号，再点按钮：六次点击加打字，而且界面打开时没有任何字段准备好输入。任何工具都能画出那个界面。重做从规格里的一行字开始：繁忙收银台前一位很累的收银员，一只手拿着手机，一只手拿着杯子。手机号放在最前面，金额字段自动准备好输入，一位回头客现在只需要点两下。

价值移到了前面，移到一句关于人的话里。我的[设计流程指南](https://laithjunaidy.com/zh/writing/design-process-checklist)是这样说的：AI 让做东西变得便宜，所以代价最高的错误移到了前面，也就是很快地做出错误的东西。由此有四个转变。

**从界面到系统。** 当一个设计系统加一个模型就能拼出界面时，设计师的工作就是这个系统：设计令牌、模式、每个状态的规则。这就是为什么 ux-skill 根据每一份需求生成一套新的系统，也是为什么我写了[品牌规范是训练数据，不是模板](https://laithjunaidy.com/zh/writing/brand-specs-are-training-data)。

**从产出到判断。** NN/g 关于 [AI 时代的设计品味](https://www.nngroup.com/articles/taste-vs-technical-skills-ai/)的文章认为，技术能力不等于品味；当谁都能做出东西时，选择和辨别才让作品被看见。我首页的那个 bug 就是一个小小的证明。引擎做出了一套完全合格的系统。要知道它对我们来说是错的，需要一个能看出它落进了哪个类别的人。

**从平均的用户到具体的用户。** 默认设置越来越像。我们[读了 150 个 shadcn/ui 仓库](https://laithjunaidy.com/zh/writing/taken-apart-shadcn-defaults)，收藏最多的项目用的是两种字体之一，加一个灰色主色。值得雇用的设计师，是能说清这个东西为谁而做的人，细节清楚，证据齐全。

**从英语优先到本地语境。** 这里的差距最大，也是我工作的地方。我们[检查了 179 家获得融资的中东和北非新创公司](https://laithjunaidy.com/zh/writing/taken-apart-arabic-100)，44% 没有阿拉伯语网站。从英语模板翻译过来的用户画像，记录的是英语作者的预期；一个主要从英语文本学习的模型，也有同样的问题。所以我免费的[用户画像模板](https://laithjunaidy.com/zh/store/persona)的阿拉伯语版直接用阿拉伯语写成，人物简介读起来就像一个来自安曼的人。NN/g 关于少见人群的提醒，放大到一个国家也成立：一个人群在网上写得越少，模型对它了解得就越少。

## 为什么 UX 职业会发展得更好？

因为这个故事里的每一种力量，都在抬高只有人能做的那件事的价格。界面越来越便宜，所以知道哪个界面重要就越来越值钱。做东西越来越快，所以做错东西的代价越来越高。AI 功能越来越多，NN/g 预计信任会成为 2026 年一个重要的设计问题，而它首先是一个研究问题。在 Figma 的调查里，52% 做 AI 产品的人说，设计对 AI 产品比对传统产品更重要，95% 说至少一样重要。

这对一个职业意味着什么，具体来说：

**要学什么。**

- **访谈和观察。** 这两种能力模型做不到。自己去做[用户访谈](https://laithjunaidy.com/zh/store/user-interview)，问上一次的经过，看人们在平时的地方做这件事。
- **能查到来源的分析。** 一张每张便签都带参与者编号的[亲和图](https://laithjunaidy.com/zh/store/affinity-map)。这也是你检查模型整理结果的方法。
- **可用性测试。** 看五个人用。NN/g 的指南仍然让 AI 远离主持这类测试。免费的[可用性测试模板](https://laithjunaidy.com/zh/store/usability-test)把每个发现和证据原话记在一起。
- **系统。** 设计令牌、组件、状态、交付。
- **你的本地语境。** 语言、收银台、畜栏、光线不好时的手机。你的用户群越特别，这些知识就越值钱。
- **和 AI 一起工作。** Figma 的调查里，超过 80% 的设计师和开发者说，学会和 AI 一起工作会是必不可少的。学会怎样给它需求、怎样限制它、怎样检查它。

**要停止做什么。**

- 把一堆界面当成交付物。交付的是决定，以及支持它的证据。
- 让模型假装成你的用户，再为它的回答做设计。
- 做"你会不会用这个"那种访谈。人和模型都很容易说会。
- 把 AI 摘要当作发现来展示。NN/g 认为，当来源是合成用户时，这样做是不诚实的，还会损害公司对研究的看法。

![Bunn 的可用性测试模板：计划、五个带通过、部分通过和失败结果的任务，以及按严重程度排序、附证据原话的发现](https://laithjunaidy.com/store/usability-test/en-light.jpg)

*Bunn 例子里的[可用性测试模板](https://laithjunaidy.com/zh/store/usability-test)。每个发现都带着证明它的那句原话。这一列，正是模型填不了的部分。*

**怎样把 AI 当作一个要你检查工作的新手研究员。** NN/g 说，AI 最好的用法就像实习生：充分的说明、背景、限制和纠正。就这样对待它。

1. **像给新同事写说明一样给它写需求。** 研究问题、参与者、你已经知道的东西。NN/g 发现，没有背景时，结果又模糊又没有先后。
2. **给它一个模板。** 填一张好的表，比自己发明一张，它出的错更少。
3. **要它给出来源。** 每条观察都带参与者编号和原话。每条案头研究的说法都带一个你自己会去打开的链接。
4. **不许它填空。** 告诉它，笔记里找不到依据时就把字段留空。然后删掉任何没有编号的行。
5. **决定留给自己。** 起草三个问题陈述是模型的事。选哪个问题是你的事，给每个发现定严重程度也是。模型不知道哪一次延误会花掉钱。
6. **永远别让它当用户。** 如果真要用合成用户，就用它在真实访谈前演练脚本或列出话题，并把它说的一切都标为假设。

全部的提示词，一个方法一个方法地写在[设计流程指南](https://laithjunaidy.com/zh/writing/design-process-checklist)里，指南用到的九个免费模板都在[商店](https://laithjunaidy.com/zh/store)里。

这些都不新。[没有人想要你的产品](https://laithjunaidy.com/zh/writing/nobody-wants-your-product)，他们想要的是结果，而结果在一个你必须亲自去见的人那里。AI 让这次见面周围的一切都变快了。它没有让见面本身变得可有可无。

## 常见问题

### AI 能取代用户研究吗？

不能。模型很会起草脚本、整理访谈转写、列出失败状态。可它没法告诉你 Awad 在畜栏里做什么，或者 Rana 为什么把费用看两次。让它假装成你的用户，你得到的是它读过内容的平均值，而这恰恰是研究要去检验的假设。

### AI 会取代 UX 设计师吗？

不会取代做判断的那部分人。Nielsen Norman Group 的 2026 年 UX 现状说，只会从设计系统里拼组件的设计师已经可以被 AI 取代，而品味、基于研究的背景理解、批判性思维和判断很难自动化。工作正在转向这些。

### 2026 年 UX 还是好职业吗？

是的，只是入门更难。NN/g 报告说，UX 就业市场从 2024 年底到 2025 年逐渐稳定，资深和通才职位回升得比入门职位快。在 User Interviews 2025 年的调查中，35% 的研究者得到了晋升或承担了更多责任。会访谈、会分析、会测试，又了解一个本地市场的新人，会更容易被看见。

### ChatGPT 能做用户研究吗？

能做其中一部分：案头研究、起草脚本、转写、第一轮归类和报告草稿。它没法观察行为；当它假装成用户时，往往会附和你，觉得什么都重要，还会编出过去的经历。在 MeasuringU 的 tree test 里，它找对答案的次数远多于真人，这让它作为参与者毫无用处。

### 什么是合成用户？

由 AI 生成、照着某一类用户的样子、像其中一员那样回答研究问题的资料。NN/g 建议，如果要用，只在真实研究之前用于案头研究和提出假设，永远不要当作发现，而且对少见或专业的用户群要避免使用。

### AI 能分析可用性测试吗？

不可靠。NN/g 说，无论人还是 AI 工具，都无法只凭转写文本分析一次可用性测试，因为人们不会说出自己做的每件事；它 2026 年的指南仍然建议不要让 AI 主持这类测试。AI 可以转写录音，起草发现清单。严重程度由你来定，每一句原话由你来核对。
