幻觉不是“模型坏”,而是大模型本质是概率生成——它擅长把话说得流畅,却不一定说得对。对客服、法务、财务这类要求零错的场景,幻觉是上线前必须治理的问题。治理不是靠“提醒它别胡说”,而要分层处理。
第一层:提示词约束
明确要求“只依据给定资料回答,资料里没有就说不清楚”,配合低温度参数,能明显减少自由发挥。这层最便宜,但治标不治本。
第二层:检索增强(RAG)
把回答锚定到企业真实文档上,并要求模型给出引用。有据可查,答错的机会大幅下降。这是目前企业场景里最有效的治理手段之一。
第三层:输出校验与工具调用
对结构化输出做字段级校验;涉及计算、查询类问题,让模型先调用工具拿到确定结果再作答,而不是凭空推算。比如算税率、查库存,就让系统算,而不是让模型猜。
第四层:人工兜底与风险分级
高风险场景保留人工复核,或对低置信度回答自动降级、标注“仅供参考”。一套成熟的线上系统,通常四层同时存在,而不是只押注某一层。
一句话:先约束,再锚定资料,再做校验,最后留人工兜底。高危场景尤其要分层治理。想评估自己的 AI 方案幻觉风险,用诊断工具快速自测。
