大部分人做竞品分析,第一眼看的是价格、图片、排名。这三样都有用,但都是公开的——意味着你在看的东西,别人也在看,最后大家得出同一套结论。

评论正好相反。它同样是公开的,却几乎没人系统地读。几百条评论里装着这个 listing 上其他任何地方都没有的信息:到底哪里会坏、用了多久坏、卖家承诺的东西哪一条没兑现。

这篇文章讲的,就是怎么把这些原始文本变成一次决策。

先说量

一个正常品类,两个像样的竞品,文字评论加起来三五百条很常见。我们手上最新的一份宠物饮水机分析,两款产品一共 478 条,一款 236 条,一款 242 条。

这个量手工读是要出人命的。按一千条三个多小时算,光看完就是整整一个工作日,还没开始归类、比对、算占比。

这里有个门槛值得说清楚:单品文字评论低于一百条,就别急着下结论。50 条评论里 40% 的人抱怨什么,跟 5000 条拆出来的 40%,完全是两回事,前者接近抛硬币。

流程

第一步,拉评论。 官方 API 这条路基本堵死了,拿不到全量。卖家精灵这类工具能做抽样;要更接近完整,得自己搭采集。难点其实不在采,在风控——频率一上来就弹验证码。

第二步,按痛点打标。 几百条评论,人脑已经装不下结构了。丢给模型按固定标签体系分类,一条评论可以带多个标签,又骂寿命又骂音质的就打两个。

这一步最费时间的坑是:让模型每次自由发挥。跑两次出来两套类别,结果没法对比,等于白拆。标签体系必须先固定,后面所有事都建立在它上面。

第三步,聚类对比。 标签打完就是数数:每个痛点被提及多少条、占多少比例、两款产品并排一看差在哪。

有用的发现都是在这一步冒出来的。有线耳机那个例子,Amazon Basics($9.99,174 条)和 LUDOS($12.99,215 条)评分都是 3.5,差评率 30.5% 和 31.6%,几乎一模一样。只看这几个数字,你会觉得这就是两款差不多的平价耳机。

结果完全不是。Amazon Basics 的头号差评是寿命短,占它痛点提及的 23.3%,LUDOS 只有 1.3%;LUDOS 的头号差评是耳塞戴不住,占 26.8%,Basics 只有 4.1%。评分一样,死法相反。

第四步,归死法。 把每个痛点归到类型上:卖点没兑现的、基础体验塌的、品控过不了时间的、服务不兜底的。归完这一层,抱怨清单才变成"该做什么、该躲什么"。

三个会让分析悄悄失效的地方

评分和评论文本不是同一个池子。 前台那个大分是全量 rating 加权出来的,包含大量一个字没写的人;你能拆的文字评论是另一个小得多的集合。两边数字对不上很正常。先把口径定下来,再跟人讨论数字。

恶意差评要单独分出来。 真实差评带着具体使用场景——用了多久、怎么坏的,写得清清楚楚;恶搞的那种反而笼统,描述跟产品对不上。拆个几十条就有感觉,但你得主动去找。

AI 会归错。 这是常态。任何结论落地之前,抽一部分回原始评论核一遍。我们有批结论方向整个偏了,就是靠回查原始评论才发现的。

这套东西的产出是什么

同一套方法用在宠物饮水机这个品类上。两款中高端饮水机,478 条评论,品类平均分 3.2。

Neareal(236 条,$29.99,3.5 分)差评率 23.3%,头号抱怨是泵几周内就坏,占它痛点提及的 17.5%。它的卖点押在不锈钢材质上,评论里也有人不买账,指出只有顶部是不锈钢。

PETLIBRO Dockstream 2(242 条,$19.98,3.0 分)差评率 35.5%,头号抱怨完全是另一批:一年内停转(10.3%)、客服不响应(10.3%)、底座漏水(9.9%)。

十个维度打分,两款分别是 2.5 和 2.3。除了水流,没有一项超过 4 分。

这就是结论。这个品类不是一款好、一款差,而是没有人解决掉卫生和泵的可靠性。功能更多的那款,增加的是一堆新的失效点——App 连不上、服务器出问题、宣传里的功能要订阅,而不是修掉老问题。

对这个品类的入局者来说,决策其实自己就写出来了:机会不在加功能,在一台能完全拆开、没有够不着的缝、泵要么过度设计要么保修不啰嗦的饮水机。

这套方法做不到什么

提及占比高,不等于影响面大。一个很少导致退货的痛点,照样能在评论里占大头。所以聚类结果要拿退货数据和成本再验一道——分析负责把坑标出来,拍板的是成本和人群。

评论也滞后于市场。最近两个月在往上走的痛点,是领先信号;两年前很凶、现在消失了的,可能早就被修掉了。

最后

上面这些,标签体系一旦固定下来就是机械劳动,而这部分我们做成了自动化。Choicesages 采集评论、聚类痛点、给每款产品做维度评分,输出一份完整 PDF 报告——就是文中案例用的那套结构,14 个章节,中英双语。

报告按品类、跨品牌做,这也是对比能成立的前提。想先看格式的,报告页上有公开样本。