落地的人工智能 · 综合

幻觉:为什么会发生,什么才真正有用

一句话: 被问到一个它没有答案的问题时,模型会生成一个看起来合理的答案——解法不是要求它别出错,而是给它来源和一条说「不知道」的路。

问题的根源

模型生成的是最可能的续写,而不是真相。当它没有依据时,输出看起来仍然很自信——而这恰恰是危险所在:错误看起来不像错误。

四件有用的事

把相关来源附到提示词里,而不是依赖模型的记忆。

要求每条论断都引用来源,并在代码里验证这个来源确实存在于提供的材料中。

给出一条明确的「材料里没有答案」的说法,并用示例去奖励它。

对离散事实——数字、日期、标识符——对照结构化的真相来源核验,而不是对照文本。

没用的事

在提示词里写「不要编造」。那是一个请求,不是一个机制。模型自称的置信度也不是可靠的度量——它是输出的一部分,而不是对输出的度量。

深入一层

构建一个专门的测试类别,全是材料里没有答案的问题,并度量系统正确地说出这一点的频率。这是几乎总被忘掉的指标,而它决定了在真实使用中你能不能信任这个系统。