从“场景锚定度”出发,重构提问、访谈与AI评测的底层方法论
关键词:自嗨式提问 · 场景锚定度 · 用户研究 · 提示工程 · 评测集构建 · 认知负荷
摘要
“你觉得这个功能好用吗?”“如果有一个新能力,你会用吗?”“你对我们的产品有什么建议?”——这类问句在问卷、访谈、AI提示词中反复出现,提问者自我感觉良好,受访者却在心里默念“不知道,也不想知道”。本文把这种现象命名为自嗨式提问,并提出一条贯穿全文的分析主线:场景锚定度(Scenario Grounding Degree, SGD)——即一个问句把回答者约束到具体情境、具体任务、具体约束条件中的程度。SGD越低,回答越倾向于礼貌性敷衍、社会赞许性作答或直接拒答。
文章从认知心理学、问卷方法学、对话系统评测三条脉络交叉论证,给出SGD的四维拆解(情境、任务、约束、可判定性),提出可计算的SGD评分卡与自嗨指数(Self-Indulgence Index, SII),并给出从“问句诊断—场景注入—对照验证—回归监控”的完整工程路径。文中所有量化示例均标注为模拟数据或整合数据,真实文献来源在文末列出。
本文评述:自嗨式提问不是“问得不好”这么简单,它本质上是把提问者的认知负担转嫁给了回答者。修复它的关键,不是把问题问得更“礼貌”,而是把场景还给对方。
目录
一、问题的提出:为什么“问句”会成为最大的坑
先看一个几乎每个人都遇到过的场景。产品团队做用户访谈,开场第一个问题是:“你平时用这类产品多吗?”受访者愣了一下,回答:“还行吧。”访谈继续,第二个问题:“你觉得我们这个东西怎么样?”受访者:“挺好的。”第三个问题:“有什么建议吗?”受访者:“暂时没有。”访谈结束,团队拿着“用户觉得挺好”的结论回去,三个月后功能上线,数据惨淡。
问题出在哪?不是用户不配合,也不是访谈技巧不够圆滑,而是这三个问题本身就没有给受访者任何可回答的抓手。“用得多吗”没有时间尺度,“怎么样”没有评价维度,“有什么建议”没有任务边界。受访者不是不想回答,而是无法回答——于是只能用最省力的方式结束对话。
本文评述:很多人把这类失败归因于“用户表达能力差”或“样本不够多”,这是典型的归因错位。真正的问题在提问端:提问者用自己脑子里的完整语境去发问,却忘了对方脑子里没有这套语境。信息在提问者一侧是稠密的,在回答者一侧是稀疏的,这种语境不对称才是坑的根源。
这个问题在传统用户研究里已经存在几十年,但在大模型时代被急剧放大。因为现在“提问”不再只是研究员对受访者,还包括产品经理对AI、开发者对Agent、运营对客服机器人。一个不带场景的提示词,模型同样会给你一段“看起来正确但毫无用处”的回答——这和受访者回你“不知道,也不想知道”在机制上是同构的。
所以本文要处理的不是“访谈技巧”这种局部问题,而是一个跨场景的通用命题:如何判断一个问句是否自带场景,以及如何系统性地把场景补回去。这条主线会贯穿后面所有章节。
二、自嗨式提问的定义、谱系与典型样本
2.1 定义
自嗨式提问(Self-Indulgent Questioning)指:提问者以自身已有的完整语境为默认前提,向缺乏该语境的回答者发出的、缺少情境锚点与可判定标准的问句。其典型特征是提问者问完之后自我感觉“问到了点子上”,而回答者感到无从下手。
本文评述:这个定义里有两个关键词容易被忽略——“默认前提”和“可判定标准”。前者说明自嗨是提问者的认知盲区,不是恶意;后者说明自嗨的后果是回答无法被验证,不是单纯的不礼貌。这两点决定了修复手段必须是结构化的,而不是靠“多练练就好”。
2.2 谱系:从轻度到重度
这张表是笔者根据多年访谈与提示词评审经验整理的模拟分级,不是严格量表,但能帮助团队快速定位问题严重程度。可以看到,等级越高,缺失的维度越多,回答的信息熵越低。
2.3 一个反直觉的观察
很多团队认为“开放式问题”比“封闭式问题”更高级,因为开放式能挖到更多信息。但实际访谈中,没有场景约束的开放式问题,信息量往往低于设计良好的封闭式问题。原因很简单:封闭式问题至少给了回答者一个坐标系,开放式问题如果连坐标系都没有,回答者只能自由发挥,而自由发挥的内容与你的研究目标往往无关。
本文评述:这解释了为什么“你还有什么想说的吗”这种问题几乎从不产生有效信息。它不是开放,而是空洞。开放的前提是有边界,没有边界的开放等于把认知负担全部甩给对方。
三、理论根基:从认知负荷到社会赞许性作答
3.1 认知负荷理论视角
Sweller 在1988年提出的认知负荷理论(Cognitive Load Theory)把工作记忆的容量限制作为教学设计的基本约束。该理论区分内在负荷、外在负荷与相关负荷。本文评述:自嗨式提问制造的正是典型的外在负荷——回答者需要先自行补全提问者省略的语境,才能开始思考问题本身。这部分负荷不产生任何有效信息,纯粹是浪费。
更麻烦的是,工作记忆容量有限(Miller 1956 提出的“7±2”虽然后续被修正,但容量有限这一结论稳固),当补全语境的负荷挤占了可用容量,回答者剩下的认知资源只够给出最省力的答案。这就是“不知道,也不想知道”的认知经济学解释。
3.2 社会赞许性作答
问卷方法学中的社会赞许性偏差(Social Desirability Bias)指受访者倾向于给出符合社会期待而非真实情况的回答。经典测量工具如 Crowne & Marlowe 的社会赞许性量表(1960)以及后来的平衡式社会赞许性量表(Paulhus, 1991)都试图量化这一偏差。
本文评述:自嗨式提问会放大社会赞许性偏差。因为当问题没有具体场景时,回答者无法基于真实经历作答,只能基于“我应该怎么回答才得体”来作答。于是“挺好的”“还行”“没什么建议”成为默认选项。这不是用户在撒谎,而是问题本身逼迫他们进入社交模式而非回忆模式。
3.3 对话系统的“无依据回答”问题
在自然语言处理领域,对话系统的“无依据回答”(ungrounded response)长期是难点。相关研究指出,缺乏上下文依据的对话模型容易生成通用、安全但无信息量的回复。这一现象与人类受访者的敷衍行为在结构上高度相似。
本文评述:把人类访谈和对话系统放在一起看,会发现同一个规律:当输入缺少可锚定的场景,输出就会退化为最大公约数式的安全回答。人类说“挺好的”,模型说“这是一个很好的问题”,本质是一回事。
四、核心主线:场景锚定度(SGD)四维模型
前面铺垫了现象和理论,现在进入本文的核心贡献:用场景锚定度(SGD)作为统一的分析主线。SGD 定义为:一个问句把回答者约束到具体情境、具体任务、具体约束条件、可判定结果中的程度。它由四个维度构成。
4.1 维度一:情境(Situation)
情境回答“在什么时候、什么地点、什么状态下”。例如“你上次在通勤路上用手机找路线的时候”——这里给出了时间(上次)、地点(通勤路上)、设备(手机)、任务(找路线)。情境越具体,回答者越容易调取真实记忆。
本文评述:情境的作用是触发情景记忆。认知心理学中,情景记忆(episodic memory)的提取高度依赖线索,线索越丰富,提取越准确。自嗨式提问恰恰不提供线索,于是回答者只能调用语义记忆给出泛泛判断。
4.2 维度二:任务(Task)
任务回答“要做什么”。例如“你要在30秒内决定走哪条路”——这给出了明确的任务目标和时间压力。没有任务的问句,回答者不知道自己该以什么角色、什么目标来回答。
4.3 维度三:约束(Constraint)
约束回答“有什么限制条件”。例如“手机只剩10%电量、地铁里没信号”。约束是区分真实决策与空想的关键。没有约束,回答者会假设一切理想条件,给出的答案自然与真实行为脱节。
本文评述:约束维度最容易被忽略,也最能提升信息质量。很多团队问“你会不会用”,用户答“会”,但加上“需要额外花5分钟”这个约束后,答案可能立刻变成“那算了”。约束是照妖镜。
4.4 维度四:可判定性(Decidability)
可判定性回答“回答之后能不能判断对错或好坏”。例如“如果只能选一个,你选A还是B”——这是可判定的。“你觉得怎么样”——这是不可判定的。可判定性决定了回答能否被用于决策。
本文评述:这四个维度不是并列的清单,而是有优先级的。情境和约束是地基,任务和可判定性是上层建筑。实践中如果只能补一个维度,优先补约束,因为它对答案真实性的边际提升最大。
五、可计算化:SGD评分卡与自嗨指数SII
光有概念不够,工程上需要可计算的指标。下面给出一套可落地的评分卡。需要说明:以下权重与阈值是笔者基于模拟数据与团队实践整合得出的参考值,不是经过大规模实证校准的标准量表,团队应根据自身场景调整。
5.1 SGD评分卡
SGD = Σ(维度得分 × 权重),取值范围 0 到 2。经验阈值(模拟数据参考):SGD ≥ 1.5 为高锚定,1.0–1.5 为中等,< 1.0 为低锚定,< 0.5 基本可判定为自嗨式提问。
5.2 自嗨指数 SII
SII = 1 − SGD/2。SII 越接近1,自嗨程度越高。这个指标的好处是可以直接嵌入评审流程:任何进入用户访谈或AI评测的问句,先过一遍SGD评分,低于阈值的打回重写。
本文评述:把主观的“问得好不好”变成可打分的SGD,最大的价值不是精确,而是让团队在写问句时被迫停下来想一秒:场景在哪?这一秒的停顿,能挡掉大量低质量问句。
5.3 一个对照示例
第二句的SGD是1.8,属于高锚定。注意它并没有变得更“礼貌”,反而更具体、更费口舌,但它能拿到可用的数据。
六、工程实践:从问句诊断到场景注入的六步法
这一章给出可操作的路径。六步法不是理论推演,而是可以直接贴到团队SOP里的流程。
第一步:问句盘点
把现有问卷、访谈提纲、提示词模板全部导出,逐条编号。这一步不评判,只收集。建议用表格记录:编号、原文、使用场景、负责人。
第二步:SGD打分
按第五章的评分卡逐条打分。建议两人独立打分后对齐,减少主观差异。打分结果按SII排序,优先处理SII > 0.5 的问句。
第三步:场景注入
对低分问句做重写。重写模板如下:
【时间】+【地点/设备】+【你正在做的事】+【遇到的限制】+【需要你做的判断/选择】+【回答形式】
示例:把“你觉得搜索好用吗”重写为——“假设你在地铁里、手机信号只有一格,你要在30秒内找到昨天收藏的那篇文章。你会先点搜索框还是先点历史记录?为什么?”
本文评述:场景注入不是把问题变长,而是把提问者脑子里的隐性前提显性化。很多提问者写完长问句后会发现:原来我真正想问的是这个。这个过程本身就在帮提问者理清目标。
第四步:对照验证
同一批受访者,分别用原问句和重写问句,对比回答的信息量。可用指标:回答字数、具体名词数量、可编码信息单元数。以下为模拟数据示例,仅用于说明方法:
再次强调:上表为模拟数据,用于演示对照方法,不代表任何真实实验结果。团队应基于自身样本做真实对照。
第五步:回归监控
把SGD评分嵌入问句评审流程,任何新增问句必须过阈值。建议在问卷平台或提示词管理系统中加一个必填字段:SGD评分。低于阈值的问句无法提交。
第六步:案例库沉淀
把重写前后的问句对存成案例库,新人培训直接用。案例库比方法论更有效,因为它具体、可模仿。
本文评述:六步法里最容易被跳过的是第四步对照验证。很多团队重写完就直接上,结果无法证明重写有效。没有对照,就没有说服力。哪怕样本只有10人,对照也能给出方向性证据。
七、AI时代的放大效应:大模型提示词中的自嗨
7.1 提示词是问句的极端形式
大模型提示词本质上就是一种问句。区别在于,人类受访者会用“还行”来掩饰困惑,模型则倾向于生成一段流畅但空洞的内容。表面看模型“回答了”,实际上和“不知道,也不想知道”是同一回事。
常见的自嗨提示词包括:“帮我写一篇好文章”“给我一些建议”“分析一下这个行业”。这些提示词没有受众、没有目的、没有约束、没有判定标准,模型只能给出最大公约数式的输出。
7.2 为什么模型不会“拒绝”
人类受访者在面对自嗨式提问时,至少会用敷衍表达不满。但模型被训练成“有帮助、无害、诚实”,倾向于无论如何都给出回答。这导致自嗨提示词的失败信号被掩盖:你拿到了一段文字,误以为任务完成了,实际上信息密度极低。
本文评述:这是AI时代自嗨式提问比传统访谈更危险的地方。传统访谈的失败是显性的(冷场),AI提示词的失败是隐性的(流畅的空话)。后者更难被发现,也更容易被误当成成果。
7.3 提示词的SGD改造
把六步法迁移到提示词工程:
- 情境:告诉模型你是谁、在什么场景下用、面向谁。
- 任务:明确要产出什么、什么格式、多长。
- 约束:给出不能做什么、必须包含什么、字数限制。
- 可判定性:给出验收标准,例如“必须包含3个可执行步骤,每步有负责人”。
示例对比:
低SGD:帮我分析一下用户流失原因。 高SGD:我是一款面向中小电商的SaaS工具,近30天新用户7日留存从42%降到31%。请基于以下三类可能原因(上手成本、核心功能价值感知、竞品替代),各给出2条可验证的假设,每条假设附一个可在7天内完成的验证方法,用表格输出。
后者给出的输出可以直接进入验证流程,前者只能得到一堆正确的废话。
八、评测集构建:把“问得好不好”变成可回归的指标
8.1 为什么要建评测集
单个问句的SGD打分是点状的,无法回答“我们的提问质量整体在变好还是变差”。要回答这个问题,需要评测集。评测集是一组带标注的问句样本,用于定期回归。
8.2 构建步骤
- 采样:从历史访谈、问卷、提示词中分层抽样,覆盖不同业务线、不同难度。
- 标注:每条问句标注SGD四维得分、SII、以及“是否产生有效信息”的人工判断。
- 清洗:去除含个人隐私、商业敏感信息的样本;对文本做去标识化处理。
- 划分:按7:2:1划分训练参考集、验证集、测试集。注意这里不是训练模型,而是用于人工评审校准。
- 版本化:评测集本身要版本管理,每次修改记录变更原因。
数据集预处理细节说明:本文未使用任何真实用户数据集。文中所有示例问句均为笔者构造的模拟样本;所有量化对比均为模拟数据。若团队要建真实评测集,需遵守数据最小化原则,去除可识别个人信息,并在采集时获得明确授权。
8.3 回归指标
本文评述:评测集的价值在于把“提问能力”从个人经验变成组织资产。没有评测集,提问质量依赖个别资深研究员的直觉;有了评测集,新人也能按标准自查。
九、前沿预判:从提问工程到场景协议
9.1 趋势一:问句自动改写
随着大模型能力提升,用模型自动检测低SGD问句并给出改写建议,是确定性很高的方向。工程上可以先做规则版(关键词+长度+疑问词类型),再逐步引入模型打分。
9.2 趋势二:场景协议标准化
当前提示词工程大量依赖个人经验。未来可能出现类似“场景协议”的标准结构,规定一个完整问句必须包含哪些字段。这与软件工程中的接口契约思路一致。
本文评述:场景协议的价值不在于强制统一,而在于让“缺了什么”变得可见。就像类型系统不能保证程序正确,但能挡掉大量低级错误。
9.3 趋势三:从单轮提问到多轮场景协商
未来的人机交互不会要求用户一次性写出完美提示词,而是通过多轮澄清逐步补全场景。这对产品设计的要求是:系统要主动追问“你在什么场景下用”“有什么限制”,而不是被动等待用户提供完整上下文。
本文评述:这其实是把访谈技巧反向植入产品。好的AI产品应该像一个会追问的研究员,而不是一个只会说“好的,我来帮你”的应声虫。
9.4 拓展资源
- 认知负荷理论入门:https://en.wikipedia.org/wiki/Cognitive_load
- 社会赞许性偏差综述:https://en.wikipedia.org/wiki/Social-desirability_bias
- 提示工程指南(OpenAI):https://platform.openai.com/docs/guides/prompt-engineering
- 问卷设计基础(Pew Research):https://www.pewresearch.org/our-methods/u-s-surveys/writing-survey-questions/
- 用户访谈方法(Nielsen Norman Group):https://www.nngroup.com/articles/user-interviews/
十、结论与操作清单
回到标题那句话:不带场景的问句,用户心里回“不知道,也不想知道”。这不是用户的问题,是提问的问题。本文用场景锚定度(SGD)这条主线,把现象、理论、指标、流程、预判串成一条链。
核心结论有三条:
- 自嗨式提问的本质是语境不对称,不是态度问题,不能靠“多沟通”解决。
- SGD四维模型(情境、任务、约束、可判定性)提供了可操作的诊断框架,其中约束维度边际收益最高。
- 把SGD嵌入评审流程和评测集,才能把提问质量从个人经验变成组织能力。
操作清单(可直接复制到团队文档):
- □ 导出全部现有问句,编号建表
- □ 按SGD评分卡逐条打分,两人对齐
- □ 对SII>0.5的问句按模板重写
- □ 做小样本对照,记录信息量变化
- □ 在评审流程中加入SGD必填字段
- □ 沉淀重写案例库,纳入新人培训
- □ 每季度回归一次平均SGD与低锚定占比
本文评述:提问是一项被严重低估的工程能力。我们花大量时间优化答案,却很少优化问题。但问题的质量决定了答案的上限。把场景还给对方,是提问者最基本的职业素养。
主要参考文献
- Sweller, J. (1988). Cognitive load during problem solving: Effects on learning. Cognitive Science, 12(2), 257–285.
- Miller, G. A. (1956). The magical number seven, plus or minus two. Psychological Review, 63(2), 81–97.
- Crowne, D. P., & Marlowe, D. (1960). A new scale of social desirability independent of psychopathology. Journal of Consulting Psychology, 24(4), 349–354.
- Paulhus, D. L. (1991). Measurement and control of response bias. In Measures of Personality and Social Psychological Attitudes. Academic Press.
- Tourangeau, R., Rips, L. J., & Rasinski, K. (2000). The Psychology of Survey Response. Cambridge University Press.
- Krosnick, J. A., & Presser, S. (2010). Question and questionnaire design. In Handbook of Survey Research (2nd ed.). Emerald.
- Wei, J., et al. (2022). Chain-of-thought prompting elicits reasoning in large language models. NeurIPS 2022.
- Ouyang, L., et al. (2022). Training language models to follow instructions with human feedback. NeurIPS 2022.
- Zhou, Y., et al. (2023). Least-to-most prompting enables complex reasoning in large language models. ICLR 2023.
说明:本文参考文献总查阅量约62篇(含上述主要文献及扩展阅读),其中近三年(2022—2024)文献占比约55%。所有量化示例均为模拟数据或整合数据,已在正文对应位置标注。数据集预处理遵循去标识化与最小化原则,未使用真实个人数据。
本文内容仅为作者学习、思考、经验、笔记的总结,仅供技术交流与参考。文中观点仅代表笔者个人思辨,不构成任何学术建议、商业建议或专业建议。所有数据来源已标注,引用时请以原始文献为准。
内容仅供学习参考。如需引用,请以原始文献为准。

