AI 的第一次回答,常常是「正确但没法用」的建议。真正拉开差距的,是会不会追问,以及会不会校验。这一章告诉你:用三个方向把回答从泛逼到实,再用两招校验它到底靠不靠谱。
- 把泛泛建议追问成可执行的动作与可衡量的指标。
- 记住对抗式追问的三个方向:为什么、如果、具体。
- 理解 AI 为什么会讨好和瞎编,从而不被「你确定吗」带进陷阱。
- 用交叉验证和结果回传两招,校验 AI 的事实与判断。
不要接受泛泛建议
当 AI 给出「建议做好用户调研、打磨差异化」这类正确的废话时,追问的目标是把抽象词压成可执行动作:为什么这么判断?第一步具体做什么?怎么验证有效?
当回答缺少事实、例子或指标时,把这些明确地要回来——「给我两个真实例子」「拆成 7 天每天的动作」「给出可衡量的指标」。说不到这一步,就继续追。
对抗式追问:为什么 / 如果 / 具体
当你觉得 AI 的推理有点飘、或太顺着你,就主动质疑它,让它换个角度再看,这叫「对抗式追问」。外面流传的万能话术不用背,你只要记住三个方向。
为什么:你给这个结论的理由成立吗?换一个前提,结论还站得住吗?如果:换一个人、一个场景、一个时间点,结论会变吗?具体:给我一个真实的例子、一个数字、一张截图,不要概括。追问完对比前后两次回答,你会明显感到它从「给一个看似合理的结论」切换到「认真帮你把结论想透」。
三个方向就够了:为什么(理由成立吗)、如果(换个前提还成立吗)、具体(给例子、数字、截图,别概括)。
为什么 AI 爱顺着你:讨好偏见与「你确定吗」陷阱
大模型训练的最后一步叫 RLHF(基于人类反馈的强化学习),简单说就是「让人类满意的回答得高分」。于是 AI 养成了下意识顺着你说的习惯,这叫讨好偏见。
它带来一个反直觉的陷阱:你一问「你确定吗?」,它立刻改口——不是因为你对,而是因为它在避免让你不满意。生硬地说「你再严格点、帮我挑刺」也会反弹,它只是换一副讨好的皮。真正有效的反制,是把它放进一个无法讨好你的局:换独立窗口、换角色、换模型。
自信瞎编=幻觉:事实默认打个问号
除了讨好,AI 还会自信地编造数据、案例、引用,口气笃定、来源写得有模有样,这叫幻觉。它粗略有三层来源:训练截止(截止日期之后的事它全靠编)、压缩损失(具体数字、冷门人名地名、细碎引文在训练里被压缩,细节会走形)、自洽偏好(编一个听起来合理的答案,比「我不知道」更容易得高评,所以它宁愿编)。
三层合起来告诉你一件事:AI 给出的事实性陈述,默认都要打个问号。数字、时间、人物、政策、引用这类内容,不能因为回答流畅就直接用。
校验两招:交叉验证 + 结果回传
第一招交叉验证:换一个 AI 来核对关键事实,而且要挑血统不同、且最能拿到这个领域事实的那个——学术论点让 Gemini 核(它开着谷歌学术)、最近两周的公众号舆情让元宝核、短视频判断让豆包核。两个 AI 高度一致则可信,分歧大就是你要重点想的地方。(Claude+Gemini 比 Claude+ChatGPT 有效,因为后两者语料重叠大,会异口同声地错。)
第二招结果回传,价值更大:挑一个本周能做完的最小动作真去做(聊一位从业者、发一条小红书、按建议写个尝试方案),记录客观数据和主观感受,再把这份一手、具体的真实结果喂回原来那个 AI,让它在你的现实里学习、调整建议。你做得越多次,它对你这个具体的人就越准。
长对话会失忆:用四个习惯管注意力
聊久了 AI 会失忆、跑偏,因为它一次能看的字数有上限(上下文窗口),而且就算窗口够大,它也只重点关注开头和结尾、容易漏掉中间(业内叫 Lost in the Middle,中段遗忘)。
四个习惯能管住它的注意力:一窗一事(任务一换就开新窗)、聊长开新窗(臃肿了让它写个交接文档再带去新窗)、重要约束隔几轮重申一遍、隔几轮收一次意图(问自己「我们在聊什么、这轮结论是什么」,再告诉 AI 往哪收)。
回到「让 AI 梳理个人优势」的对话:它给了你 3 个优势或方向,挑一个最认同的,走一遍追问 + 校验的完整闭环。
- 1
把泛泛建议追成可执行
让它把这个方向拆成未来 7 天每天能做的动作,并说明每个动作怎么验证有没有效。
- 2
用「为什么」追依据
你从我背景里的哪几句话推出这个结论?如果其中某条变了(我没那个资源 / 其实没兴趣),还站得住吗?
- 3
用「如果 / 具体」逼实
如果换个收入水平或城市,这个方向还最优吗?别再给总判断,给我 3 个本周就能做、能看到反馈的具体动作。
- 4
换血统不同的 AI 交叉验证
把这个判断 + 背景文档贴给另一个语料不同的模型,问它「有什么漏洞或盲区」,对比分歧处。
- 5
把真实结果回传
挑一个本周能做完的最小动作真去做,记录数据和感受,再喂回 AI:哪些假设被现实推翻了,请重新调整建议。
实战示例
错误示例
(对泛泛建议)说得更具体一点。
正确示例
请把「持续输出」拆成未来 7 天每天能执行的动作,并说明每个动作怎么验证有没有效。
「具体一点」还是模糊。给出可执行的颗粒度(7 天 / 每天 / 可验证),AI 才给得出能用的答案。
错误示例
(对它的结论)你确定吗?
正确示例
换一个血统不同的 AI,把它的结论 + 我的背景贴过去,让新模型挑漏洞和盲区。
在原窗口问「你确定吗」,它只会改口讨好你;交叉验证才是有效的反制。
错误示例
这个数据对吗?(直接采信它的回答)
正确示例
先列出这个数据的可能出处,并区分哪些是确定的、哪些是推测,我再去两个官方来源核对。
事实默认打问号:校验是把「来源」拿回手里,而不是再问 AI 一遍「对吗」。
Claude / ChatGPT(主力)
有免费额度用途:承担主对话、出初步结论
结构化、少废话优先 Claude
Gemini / 元宝 / 豆包(校验)
免费用途:按领域挑能拿到事实的 AI 做交叉验证
学术→Gemini,公众号舆情→元宝,短视频→豆包;尽量挑血统不同的
常见误区
- 满足于「正确的废话」,不追问到可执行的动作。
- 用「再具体一点」这种模糊追问,得到的还是模糊回答。
- 在原窗口反复问「你确定吗」,它只会改口讨好你,不是真的纠错。
- 把 AI 的事实性陈述(数字 / 人名 / 引用)默认当真,忘了它有训练截止、压缩损失、自洽偏好三层幻觉来源。
- 只在 AI 之间交叉验证,却从不把建议拿去现实跑一次、回传真实结果。
- 长对话里不更新背景,AI「失忆」后给出前后矛盾的建议。
追问几轮算够?
直到结论能落到具体动作、依据能复查、验证有可衡量的指标为止;说不到这一步就用「为什么 / 如果 / 具体」继续追。
交叉验证该挑哪个 AI?
挑血统不同(语料重叠小)、且最能拿到该领域事实的:学术用 Gemini、公众号舆情用元宝、短视频用豆包。Claude+Gemini 比 Claude+ChatGPT 更有效。
结果回传具体怎么做?
挑一个本周能做完的最小动作真去做,记录客观数据和主观感受,再把这份一手、具体的结果喂回 AI 让它调整建议;后台数据、录音、照片越具体越好。
本章小结
- 追问的目标是把抽象建议压成可执行动作与指标。
- 记住对抗式追问三方向:为什么、如果、具体。
- AI 会讨好(RLHF),在原窗口问「你确定吗」只会让它改口,换独立窗口 / 模型才有效。
- AI 会幻觉(训练截止 / 压缩损失 / 自洽偏好),事实性陈述默认打问号。
- 校验两招:交叉验证(换血统不同的 AI)+ 结果回传(拿建议去现实跑一次再喂回),后者价值更大。
- 长对话会失忆,用一窗一事、聊长开新窗、重申约束、隔几轮收意图四个习惯管注意力。
- 对抗式追问
- 主动质疑 AI 的回答,沿「为什么 / 如果 / 具体」三方向重新拨它的注意力。
- 讨好偏见(RLHF)
- 训练让 AI 倾向给人满意的回答,于是它下意识顺着你说,问「你确定吗」它就改口。
- 幻觉
- AI 自信编造的内容,三层来源:训练截止、压缩损失、自洽偏好;事实陈述默认打问号。
- 交叉验证
- 换一个血统不同、能拿到该领域事实的 AI 核对关键事实,分歧处重点思考。
- 结果回传
- 把 AI 的建议拿到现实跑一次,把一手真实结果喂回它,让它在你的现实里越用越准。
- 上下文管理
- 用一窗一事、聊长开新窗、重申约束、隔几轮收意图,管住 AI 在长对话里的注意力。