LLM把23万条评论情景示意读完,两秒钟给出一句总结:"消费者整体评价正面,主要抱怨集中在物流和包装环节。"这句话没有错,读起来也很像"AI分析出了结论",但如果你是产品负责人,看完这一句你能做什么决定?基本什么都做不了——它没告诉你物流问题是哪种物流问题,包装抱怨里有多少人其实在说的是"内衬太薄导致产品磕碰",也没告诉你这两个话题各自的讨论量是在上升还是已经在下降。这正是AI消费者洞察最容易被误解的地方:总结文字读起来流畅、像结论,但真正能支撑决策的是文字背后那一层结构——每条评论到底被归到了哪个Consumer Insight意义上的具体问题。
这一层结构靠的是Topic Modeling和Entity Resolution,而不是LLM单次生成的总结句子。同一个问题在真实评论里几乎从不会用同一种说法出现:有人写"电池不禁用",有人写"续航差",有人写"充一次电撑不到半天",还有人只写了一句"半天就没电了,很失望"。这四条评论说的是同一件事,但字面上完全不同。如果Topic Modeling把它们各自聚成四个独立的小主题——"电池"、"续航"、"充电"、"失望"——那么原本一个占比不小、值得优先处理的问题,会被拆散成四个看起来都不起眼的小Topic,每一个单独看都不会触发预警。这是评论分析里最隐蔽也最常见的失败模式之一:不是模型读错了内容,而是归类颗粒度出了问题,导致真实的Severity被系统性低估。AI怎么分析评论,很大程度上就是在回答这个归类颗粒度该怎么定的问题,而不是总结写得漂不漂亮。
Entity Resolution:同一件事的不同说法要能对上
Topic Modeling负责把语义相近的表达聚到一起,Entity Resolution负责更进一步:把型号、俗称、简写、错别字都对应到同一个实体上。比如同一款产品在评论里可能被写成完整型号、简称、甚至用户自造的外号,如果这些不能被识别成同一个实体,围绕它的负面讨论就会被稀释到多个"小分身"里,各自看起来讨论量都不高,团队很容易得出"这个问题不严重"的错误结论。反过来,把不该合并的实体错误地合并在一起,也会把两个完全不同产品线的问题混在一个Topic里,让分析结果失真。这两种错误方向不同,但后果类似:决策者看到的数字和真实情况之间隔着一层没有被校准过的归类逻辑。
一个情景示意:同一批评论,两种归类方式,两个不同结论
假设某周新增评论1.2万条情景示意,其中提到"电量""待机""充电"相关内容的约有480条。如果归类颗粒度太细,这480条会被拆成十几个各自只有几十条的小Topic,团队周会上看到的是一长串"占比都不高"的问题列表,没有一条会被单独提出来讨论。如果归类颗粒度合理,这480条会被合并成一个"续航体验"Topic,占当周评论总量接近4%,而且连续三周环比都在上升——这才是一个真正会被排进处理队列的信号。同一批原始数据,仅仅因为归类逻辑不同,团队看到的紧急程度完全不一样。这也是为什么单独评估LLM"读没读懂评论"意义有限,真正决定分析结果能不能用的,是Topic Modeling和Entity Resolution这一层归类逻辑本身有没有被校准过。
把这一层做对之后,Topic Modeling和Entity Resolution产出的结构化数据,才是后续判断哪个问题该优先处理的基础,也是口碑分析里评估问题严重程度时真正依赖的信号,而不是情绪打分本身。归类错误的后果不只是"分析不准确"这么简单——当同一个真实问题被拆成五个互不相关的小Topic时,每个Topic单独看讨论量都不高,趋势曲线也都不明显,团队很可能因此错过一个正在积累、还没爆发的产品问题,直到它已经扩散到情绪-严重度矩阵里明显可见的位置才被注意到,而这时往往已经错过了成本最低的处理窗口。这也是为什么把评论主题和销量变化放在一起追踪会比只看好评率有意义得多:Topic层面的归类质量,直接决定了后面所有分析结论的可信度。