抽样助手

地图帮2026-03-10

抽样助手

科学地从大数据集中抽取样本:三种抽样方法,自动对比抽样前后的分布差异,确保样本能代表整体。十万行数据跑分析太慢时,先抽一部分试跑,不用担心"随便取前 1000 行结果全是北京的数据"。


准备一份大表

  • 一份 Excel 或 CSV 文件(数据量越大,抽样越有意义)

四步抽出代表性样本

  1. 导入数据。打开数据魔方,点顶部「数据分析」标签页,进「抽样助手」卡片,导入数据文件。导入成功后下方显示数据预览和总行数。

  2. 选择抽样方法和参数。参数面板里的设置:

    • 抽样方法:三种可选
    方法原理(用人话说)什么时候用
    随机抽样每一行被抽中的概率相同,完全随机大多数情况用它就够了
    分层抽样先按某列分组(比如"城市"),再从每组里按比例抽取,保证每个组都有代表数据里有明确分类,想确保每类都被抽到
    系统抽样每隔固定间距抽一行(比如每隔 100 行抽 1 行)数据本身有顺序的时候用
    • 样本量:想抽多少行,填具体数字(比如 1000)或比例(比如 10%)
    • 分层列(仅分层抽样):按哪一列分层(比如"城市""品类")
    • 随机种子:默认 42。同一个种子每次抽出来的结果一样,方便复现;想每次抽不同样本才需要改

    不知道选哪个就选随机抽样、样本量 1000 或 10%,先跑一次看效果。

  3. 查看结果。点「开始分析」,结果分两部分:

    • 抽样结果:抽出来的样本数据,左上角显示"原始 100000 行 → 样本 1000 行"
    • 分布对比表:自动对比抽样前后的数值列分布,包括每列的原始均值 vs 样本均值、原始标准差 vs 样本标准差
  4. 导出结果。点「导出」把样本数据保存为 Excel 或 CSV。

分层列要选"种类少的分类字段"

分层列选了唯一值特别多的字段(比如"姓名"),每层只有 1 行,抽出来跟原始数据差不多。合适的分层列是城市(几十个)、性别(2-3 个)、等级(几个)这类。

均值差距大说明代表性不好

分布对比表显示原始均值和样本均值差距很大时,可以:增加样本量;换分层抽样保证各类比例一致;换一个随机种子重新抽。


确认样本分布跟整体接近

样本行数是设置的样本量,分布对比表显示均值和标准差跟原始数据接近,说明抽样可靠。

接下来可以拿样本跑 描述性统计助手 快速了解数据全貌,或用 相关性分析助手 探索变量关系。

最后更新时间 8/13/2026, 12:36:44 AM