抽样助手
地图帮2026-03-10
抽样助手
科学地从大数据集中抽取样本:三种抽样方法,自动对比抽样前后的分布差异,确保样本能代表整体。十万行数据跑分析太慢时,先抽一部分试跑,不用担心"随便取前 1000 行结果全是北京的数据"。
准备一份大表
- 一份 Excel 或 CSV 文件(数据量越大,抽样越有意义)
四步抽出代表性样本
导入数据。打开数据魔方,点顶部「数据分析」标签页,进「抽样助手」卡片,导入数据文件。导入成功后下方显示数据预览和总行数。
选择抽样方法和参数。参数面板里的设置:
- 抽样方法:三种可选
方法 原理(用人话说) 什么时候用 随机抽样 每一行被抽中的概率相同,完全随机 大多数情况用它就够了 分层抽样 先按某列分组(比如"城市"),再从每组里按比例抽取,保证每个组都有代表 数据里有明确分类,想确保每类都被抽到 系统抽样 每隔固定间距抽一行(比如每隔 100 行抽 1 行) 数据本身有顺序的时候用 - 样本量:想抽多少行,填具体数字(比如 1000)或比例(比如 10%)
- 分层列(仅分层抽样):按哪一列分层(比如"城市""品类")
- 随机种子:默认 42。同一个种子每次抽出来的结果一样,方便复现;想每次抽不同样本才需要改
不知道选哪个就选随机抽样、样本量 1000 或 10%,先跑一次看效果。
查看结果。点「开始分析」,结果分两部分:
- 抽样结果:抽出来的样本数据,左上角显示"原始 100000 行 → 样本 1000 行"
- 分布对比表:自动对比抽样前后的数值列分布,包括每列的原始均值 vs 样本均值、原始标准差 vs 样本标准差
导出结果。点「导出」把样本数据保存为 Excel 或 CSV。
分层列要选"种类少的分类字段"
分层列选了唯一值特别多的字段(比如"姓名"),每层只有 1 行,抽出来跟原始数据差不多。合适的分层列是城市(几十个)、性别(2-3 个)、等级(几个)这类。
均值差距大说明代表性不好
分布对比表显示原始均值和样本均值差距很大时,可以:增加样本量;换分层抽样保证各类比例一致;换一个随机种子重新抽。
确认样本分布跟整体接近
样本行数是设置的样本量,分布对比表显示均值和标准差跟原始数据接近,说明抽样可靠。
