最常见的一种情况是:公司搬了办公地址,客户问 AI 时拿到的还是旧地址。另一种版本更麻烦:AI 说这家公司提供某项它从来没做过的服务,客户带着这个预期打来电话。

这类问题值得认真对待。它不像排名下降那样有数字可看,却直接影响客户对品牌的第一印象。

AI 回答品牌信息错误,常见到什么程度

研究给出的答案是:比多数人以为的常见。

Liu 等研究者在2023年审计了四个生成式搜索引擎,发现只有51.5%的生成语句得到引用的完整支撑,只有74.5%的引用真正支撑了它所附着的那句话。换句话说,答案里标了来源,不代表那句话真的来自那个来源。

2025年,欧洲广播联盟与 BBC 牵头,联合22家公共媒体机构做了一次更大规模的评测,覆盖18个国家、14种语言、4个 AI 助手,评估了3000多条回答。结论是接近一半的回答至少有一个重大问题,三分之一存在严重的来源问题,五分之一存在重大准确性问题,包括虚构细节和过时信息。

51.5%生成语句中得到引用完整支撑的比例Liu 等 2023
74.5%真正支撑了对应语句的引用比例Liu 等 2023
3000多条EBU 与 BBC 评测的 AI 回答数量EBU 2025

这两项研究都有明显的边界。前者测的是2023年的英文产品,后者测的是新闻类问题,评测对象是 ChatGPT、Copilot、Gemini 和 Perplexity,都不包括国内平台,也不是专门针对品牌信息。它们能说明的是,生成式答案出错是一个系统性现象,而不是某家产品的偶发故障。国内平台在品牌问题上的错误率是多少,目前没有公开的权威数据。

对品牌方来说,这组研究更实际的含义在第一项数字上。引用和语句对不上的情况这么普遍,意味着看到答案标了来源,不能默认来源就是错误的出处。错误可能在来源里,也可能是模型在转述时加上去的,两种情况的处理方式完全不同。

AI 幻觉与品牌:错误从哪里来

幻觉指模型给出没有来源支撑、语气却很笃定的说法。但品牌信息出错,并不都是幻觉。分清来路,决定了往哪里使劲。

错误类型典型表现源头在哪纠正方向
无来源编造编出的服务项目、案例、成立年份可核查材料太少,模型在填空补齐一致的事实材料
旧信息旧地址、旧名称、已停产的产品某个旧页面仍在被检索或曾进入训练数据更新或下线旧页面,推动第三方更正
转述错误来源写的是对的,答案复述错了来源表述含糊,或信息分散在多处把关键事实写成一句能单独成立的话
实体混淆把同名或近名公司的信息安到自己头上实体标识不清统一全称、注册信息与官网写法

表里第一类最常被误解。很多品牌的第一反应是去和模型的输出较劲,但幻觉通常是在填补空白。可核查的一致材料很少时,模型会构造一个看起来合理的说法。材料补上了,空白才会缩小。

第二类最容易被低估。一篇多年前的媒体报道、一个没关掉的旧官网子站、某个平台上忘了更新的企业资料,都可能是旧信息的来源。企业自己早就忘了它们,检索系统却没有。

动手纠正之前,先写一份事实表

多数纠正工作失败,不是因为方法不对,而是企业内部对正确答案本身就没有统一口径。市场部写的成立年份和工商登记差一年,销售资料里的服务范围比官网多两项,这种情况下去要求 AI 说对,没有标准可依。

事实表不需要复杂,一张表列清楚这些字段就够:公司全称与常用简称,成立时间,注册地址与实际办公地址,服务范围,明确不提供的服务,对外联系方式。每个字段写成一句能单独成立的话,并注明这句话以哪份文件为准。

「明确不提供的服务」这一栏最容易被跳过,却和无来源编造关系最大。模型之所以会编出一项服务,往往是因为同行都提供,而这家公司的材料里对此只字未提。写明不做什么,等于提前堵上一块空白。

这张表之后的每一步纠正,都以它为准。

AI 说错了怎么纠正:从源头往回改

纠正的顺序大致如下,每一步都比下一步更可控。

  1. 把错误原样记下来。 哪个平台、哪天、用什么问法、是否联网、答案全文。没有原始记录,后面所有判断都没有依据。
  2. 打开答案引用的来源。 能看到来源的平台,先确认错误是来源本身写错了,还是转述出了错。
  3. 先改自己能改的。 官网、自有账号、平台上的企业资料,把公司全称、成立时间、地址、服务范围改成同一个版本。
  4. 再推动第三方更正。 百科词条按规则修改,媒体报道联系编辑更正,行业目录更新资料。这一步慢,但分量重。
  5. 最后使用平台的反馈渠道。

第五步排在最后,并不是因为它没用。《生成式人工智能服务管理暂行办法》自2023年8月15日起施行,第十五条要求服务提供者建立健全投诉、举报机制,设置便捷的入口,公布处理流程和反馈时限。这给了企业一个正式渠道。

它的局限同样要说清楚。投诉渠道处理的是一条具体回答,源头材料不改,换一种问法、换一个平台,同样的错误还会出现。

纠正之后怎么确认它真的改了

改完不能只问一次。生成式答案在不同次运行之间本来就有波动,一次答对了可能是运气,一次答错了也可能只是波动。

可靠的做法是固定当初发现错误的那组问题,在相同条件下重复测量,看错误说法出现的比例有没有下降。我们的效果监测与复测就是按这个逻辑做的:同一组冻结问题按周期复测,每条原始答案原样保留,正面、中性、负面提及分开计数,负面提及不算作有效结果。一条错误说法有没有减少,可以直接回到原始答案里核对。

这套方法也有做不到的地方。它只能覆盖问题集里的问题,客户用一种没被收录进问题集的问法问出错误,监测看不到。它也不能替平台修改答案,能做的是让修改有没有生效变得可以验证。模型版本在一轮测量中途发生变化时,这一轮的变动也不能归因于任何纠正动作。

纠正品牌信息错误很难在几天之内完成。能缩短这个周期的,只有源头材料的质量和一致程度,平台反馈和对话里的更正都替代不了它。

参考来源