地址清洗助手
地址清洗助手
选好地址列,点一下「开始清洗」,几百条乱格式地址自动拆成省 / 市 / 区县 / 街道 / 门牌号五列。纯本地处理,不调任何 API,不限行数。
典型的原始数据长这样:
- 有的写"北京市朝阳区建国路88号"
- 有的只写"望京SOHO",省市全没有
- 有的夹着手机号"广州天河路385号13800138000"
- 有的全角半角混着来"深圳市南山区科技路100号"
这些都能处理。系统自动识别省市区、去噪音、补缺失,几秒钟出结果。
准备一份带地址列的表
- 一份 Excel 或 CSV 文件
- 至少包含一列中国地址,完整或部分都行(只有"朝阳区望京SOHO"也能处理)
六步洗完一批地址
打开工具。左侧菜单点「数据魔方」,顶部选「数据处理」Tab,点「地址清洗助手」卡片。页面是一个三步向导:数据导入、清洗配置、清洗结果。
导入数据。把 Excel 或 CSV 拖到页面中间的虚线框,或点「选择文件」手动选。没有现成数据,点左下角「加载示例数据」,系统生成 10 条门店地址样本。导入后下方出现「字段映射」卡片,系统会自动找名字里带"地址""address""addr"的列选好地址列;没猜对就手动换。
确认一下:上方有数据预览表格,下方"地址列"下拉框已选中某一列。
调清洗选项。点右上角「下一步」进入清洗配置页,四个开关:
开关 默认 作用 省市区自动补全 开 地址只写"朝阳区"时补上"北京市",靠内置行政区划词典,不联网 去除噪音字符 开 去掉括号备注、手机号、固话、邮编、特殊符号 全角转半角 开 "100号"变"100号",全角逗号变半角 尝试纠错 关 检测连续重复字,如"朝阳阳区"改"朝阳区";比较激进,地址里有合法重复字(如人名)建议保持关闭 一般情况下保持默认就够了。
开始清洗。点「开始清洗」按钮,页面上方出现进度条。200 条大概 1-2 秒跑完,上万条也只要几秒。跑完自动跳到结果页,右上角弹出绿色提示"清洗成功"。
查看结果。结果页有两块:
- 清洗统计:总条数、成功率、省级/市级/区级识别率、词典补全条数
- 结果预览表:原始数据后面多了六列,
省、市、区/县、街道地址、门牌号、清洗状态
清洗状态有三种:完整(省市区全部识别)、已补全省市(原始地址缺省或市,系统补上了)、无法识别区划(无法解析,可能是纯英文地址或写得太简略)。
导出。点结果页的导出按钮,数据发送到左下角「数据导出」面板,选格式(Excel / CSV)和保存路径。
地址列选错是最常见的失败原因
比如选了"门店名称"列而不是"详细地址"列,跑出来会全是"无法识别区划"。回到第一步,确认下拉框选的是包含地址文本的那一列。
"已补全省市"不是出错
原始地址只写"望京SOHO",清洗后变成"北京市 / 朝阳区 / 望京SOHO",省市是系统根据"望京"反推补上的。这类结果标记为"已补全省市",属于正常补全,不需要返工。
确认五列都拆出来了
结果预览表里"省""市""区/县"三列大部分填上了内容,成功率在 80% 以上,说明清洗完成。
接下来可以:
