聚类分析

地图帮2026-03-02

聚类分析

把一堆数据按"相似度"自动分成几组:200 家门店按日均销售额、客单价、客流量分出"标杆店 / 普通店 / 待优化店",不需要事先告诉它谁好谁差,算法根据数据自己找规律。

三种主流算法可选,能自动推荐最佳分组数,生成评估报告和可视化图表。完全免费,数据行数不限。


准备至少两个数值列

  • 一份 Excel 或 CSV 文件,每行代表一个样本(门店、客户、区域都行)
  • 至少包含 2 个数值列 作为分组依据(比如销售额、客流量)
  • 样本数量建议 不少于 20 条,太少分组没有统计意义

四种业务场景,选一个就好

打开聚类分析后有四个入口,对应四种典型场景:

场景干什么
门店分群分析把门店按经营指标自动分成"标杆店 / 普通店 / 待优化店",每组附管理建议
客户分群分析把客户按消费行为分成"高价值 / 潜力 / 沉默 / 流失"四类,方便差异化运营
区域分类分析把区县或城市按经济指标分类,识别发达和欠发达区域,结果能在地图上可视化
通用聚类分析不限定场景,导入任意数据集,自由选择特征和算法,适合科研或探索性分析

不知道选哪个,先用「通用聚类分析」,它最灵活。


三步走完一次聚类

  1. 导入数据。点进任意场景,顶部有步骤条「导入数据 → 参数设置 → 分析结果」。把 Excel 或 CSV 拖进第一步页面,或点导入按钮选文件。加载完成后右侧出现字段列表和数据预览表格。想先试试工具,点页面下方蓝色的「加载示例数据」链接,自动填入现成数据。

    确认一下:数据预览表格正常显示,列名和行数都出来了。

  2. 选择特征和算法。点「下一步」进入参数页,做两件事:

    • 选分组特征:勾选哪些列参与分组。比如按"日均销售额"和"客流量"分门店,就勾这两列。只有数值类型的列才能选
    • 选算法和参数:默认 K-Means、分 3 组,大多数情况直接用默认值。三种算法的区别:
    算法特点
    K-Means最常用,速度快,适合大部分数据。需要指定分几组(K 值)
    层次聚类适合小数据集(几百条以内),能生成树状图,直观看到分组层次
    DBSCAN不需要指定分几组,它自己发现,还能识别"噪声点"(不属于任何组的异常数据)

    不知道该分几组,点右下角「自动推荐最佳 K 值」按钮:系统扫描 K=2 到 K=10,用轮廓系数找到最优分组数并自动填入,还会在浏览器里打开一张肘部图,直观看到拐点在哪。

  3. 查看结果。点「下一步」,通常几秒钟出结果。结果页分左右两列:

    左列:分组结论和统计表

    • 顶部一句话结论,分了几组、每组多少样本
    • 簇特征统计表列出每组在各特征上的平均值,哪组销售额最高、哪组客流量最低直接看表
    • 门店/客户/区域场景还附带每组的标签名和管理建议

    右列:评估指标和可视化图表

    • 轮廓系数:越接近 1 越好,0.5 以上算不错
    • DBI 指数:越小越好,各组之间分得越开
    • CH 指数:越大越好,组内紧凑、组间分离
    • ANOVA 检验:每个特征在各组之间的差异是否显著(p<0.05 就是显著)
    • 点「在浏览器中查看图表」打开一组 ECharts 交互式图表:PCA 散点图、簇分布柱状图、雷达图等

    不用记这些指标名词,看系统给的一句话解读就行:写着"聚类效果较好",结果就可以用。

导出:点右列底部「导出结果数据」按钮,导出的 Excel 里每行多一列「簇标签」,标明这个样本被分到了哪一组。


数据预处理,系统帮你做了

参数页的高级选项里可以调这几项(默认值通常够用):

  • 缺失值处理:删除、均值填充、中位数填充(默认删除)
  • 异常值处理:保留全部 或 IQR 方法剔除(默认保留)
  • 标准化:Z-Score(推荐)、Min-Max、不标准化

特征量纲差别大时必须标准化

比如"销售额"是几万、"评分"是 1-5,不标准化的话销售额这种大数值会"压倒"评分,分组结果全被销售额主导。默认的 Z-Score 标准化就能解决,不用改。

文本列不能参与分组

把"门店名称""地址"这类文本列勾上会报错。算法只认数字,只勾数值列。


确认分组结果能用

分组统计表出来了、评估指标显示"聚类效果较好"、图表能正常打开,说明聚类完成。

接下来可以把结果导出为 Excel,按簇标签筛选看每组的具体成员;或去 门店绘 把分组结果画到地图上,用"簇标签"列做分类着色,一眼看出各组门店的地理分布。

最后更新时间 8/13/2026, 1:09:16 AM