35 个文件、14.58% 数据是空的,我让 TRAE Work 十分钟收拾干净了
35 个文件、14.58% 数据是空的,我让 TRAE Work 十分钟收拾干净了的重点在于把前置条件、操作顺序和容易误判的地方分清楚。
先说我干了什么
我是做数据开发和分析的。上月底,业务那边甩过来 35 个 CSV,说是"全国城市空气质量的公开监测数据,你帮我们出个月报分析"。
这种需求我接了没有一百次也有八十次。文件拿到手,老规矩,先 head 看一眼——好家伙,一个文件 378 列,375 个城市横着排,日期、小时、指标竖着堆。再看数据量,一个月 465 万行。空值?我随手数了一下,14.58%,六十八万个格子是空的,还有的是纯空格糊弄人。有几天的文件行数都不对,7 月 24 号只有 289 行,正常应该是 360 行——那天差不多 5 个小时的监测数据整个没了。
放以前,这活儿我这么干:写个 pandas 脚本,合并、清洗、聚合,跑完还得自己检查哪天的数据不对劲,光检查就得来回折腾。上个月我就栽过一次——有个字段缺数据没处理干净,均值被拉偏,报告交上去被业务的人问"这数字怎么跟统计局对不上",我解释了半天,脸都丢光了。
这次我换了路子。全程用 TRAE Work 对话搞定,从文件到手到报告出来,十来分钟。
怎么干的:四轮对话
第一轮:先让它体检,别急着动手
我的第一句话是:
这步我坚持必须有。数据都不了解就开洗,跟蒙眼开车没区别。TRAE Work 跑完,报告长这样:
| 体检项 | 结果 |
|---|---|
| 文件结构 | 35 个 CSV,每个 378 列宽表(375 城市 × 15 指标 × 24 小时) |
| 行数异常 | 7/6、7/7、7/20 少 15 行;7/22 只有 302 行;7/24 只有 289 行 |
| 缺失单元格 | 684,815 个,占 14.58%,一部分还是纯空格占位 |
| 换行符 | 行尾混着 r,Excel 一打开就错行 |
跟我自己扫了一遍的印象一致,但人家几十秒就把数据量化和汇总了。这里有个细节:我特意强调"只报告、别改",它还真就没自作主张动数据。
第二轮:规则一次说清
体检完了,下指令:
TRAE Work 生成了脚本直接跑,核心代码就一小段:
# TRAE Work 生成的核心片段(宽转长 + 缺失标准化)for _, rowin raw.iterrows():for city in cities:v = str(row[city]).strip()rows.append({'date': row['date'], 'hour': row['hour'], 'metric': row['type'],'city': city, 'value': float(v) if v and v !='nan'elseNone })
35 个文件合成一张 465.9 万行的长表,字段干净,类型统一。这段代码我自己写也就几分钟,但写完还要调试边界情况——空字符串、nan、空格、r 尾缀,这些坑它一次全踩平了。
第三轮:质量复核,专治上次翻车
合并完先别急着算数,我补了一句:
这就是我上个月丢人的那个坑,这次提前堵上。它复查出来 8 条记录不达标,主要集中在 7/22 和 7/24 两天,处理方式是"标记、保留、统计时排除、报告里写明"。这样哪怕数据缺了,报告里也是清清楚楚的,别人问起来我有依据,而不是"我也不知道怎么就少了"。
第四轮:直接要成品
最后一句:
它直接给了一份能浏览器打开的完整报告,排名、柱状图、走势、数据质量说明都在里面,不用我再装任何工具。
结果:3 小时变 10 分钟
交付的东西:
clean_long.csv:465.9 万行标准长表,直接能进 BI 工具clean_daily_aqi.csv:11,682 行「城市×日」聚合表,带 AQI 等级和完整性标记report.html:可视化月报
报告里的几个真实结论:
- 7 月全国整体不错,优良天数占比 99%,但还有 65 条"城市×日"记录过了污染线(AQI>100)
- 最差的是和田地区,日均 AQI 169,中度污染;喀什 101 第二——南疆沙尘的影响一眼就能看出来
- 最好的是黔南州、临沧,日均才 17
- 北京 7 月日均 39,优良率 100%
- 8 月前四天全国均值比 7 月还低一点
换以前,我手工顶多给个"全国平均 AQI 是多少",这次排名、污染日分布、城市对比全有了。业务那边要的"为什么这个月和上个月不一样",也有数据能解释了。
清洗前长这样——378 列宽表,红格全是缺的:
清洗后是这种标准长表,等级自动标好:
完整月报长这样:
数据来源是公开的监测数据整理站:
我把这套流程沉淀成了一个 Skill
活儿干完,我把四步流程固化成了一个可复用的 Skill(数据处理技能) ,后续类似的表格整理需求,直接整包调用:
这 Skill 的价值有三点:
- 流程固定:体检→清洗→复核→产出四步顺序锁死,复核环节不会被跳过——上一版报告缺数据没发现,正是漏掉了这一步
- 产物分级落地:原始文件只读不动,体检报告、合并长表、质量清单进
intermediate/,标准表和聚合表进output/,任何数字都能回溯到对应目录 - HTML 可选:需要给业务方汇报就生成
report.html,内部自用只要 CSV,不产生多余产物
Skill 的完整定义我放在文末附录,可以直接抄走,字段换成你自己的业务数据就能用。
能直接抄的经验
流程就四步:体检 → 清洗 → 复核 → 产出
跳过体检,你都不知道数据烂在哪;跳过复核,你就是三个月前的我。
四条指令模板,每次复制改改就行
体检:
清洗:
复核:
产出:
几个坑,都是真金白银换的
- 纯空格是"假空值" :直接按空单元格处理会漏掉,一定要明确"空格也算缺失"
r换行符:Excel 打开直接错行,合并前统一清,不然交付的表客户一打开就是花的- 缺数据的日期会悄悄拉偏均值:必须做完整性复核,超阈值就排除并在报告里注明。写清楚"哪天缺数据、为什么没算",客户反而更信你
- 别一次塞太多要求:四步分四轮说,每轮结果都能验证,出问题好定位
- 先体检后动手:多少人上来就"帮我清洗",结果 AI 把该留的脏标记也当垃圾清了
时间账
| 环节 | 手工写脚本/Excel | TRAE Work | 差距 |
|---|---|---|---|
| 合并 35 个文件 | 40 分钟 | 半分钟 | 约 80 倍 |
| 缺失值处理 | 1 小时 | 1 分钟(含复核) | 约 60 倍 |
| 均值/排名/图表 | 1 个多小时 | 2 分钟 | 约 40 倍 |
| 数据质量说明 | 写不准、不愿写 | 自动生成 | — |
| 合计 | 约 3 小时 | 约 10 分钟 | 约 18 倍 |
附录:Skill 完整定义
写在最后
数据整理的核心问题从来不是"会不会做",而是"做得稳不稳、快不快、能不能说清楚"。四步法的价值在于把这三件事拆开解决:体检保证"看得清",清洗保证"理得顺",复核保证"算得准",产出保证"交得出"。方法本身不依赖具体业务——销售流水、门店报表、问卷导出、财务明细,只要是多文件、多口径的表格整理需求,均可按 Skill 定义直接复用。
-
09.01
立刻MV音乐MV生成如何设置镜头效果?
-
09.01
用 Rust 打造 AI 命令行工具:从零构建智能 Agent 的工程实践
-
09.01
Claude 是懂 PPT 的有哪些重点-关键信息和实际影响
-
09.01
#WorkBuddy 9年电商人第一次使用心得
-
09.01
企业AI之路:机遇、误区与思考有哪些重点-关键信息和实际影响
-
09.01
卡哇伊情绪大爆发拼贴画
-
-
-
-
-
- 战士对决石像鬼
- 09.01
-
-
下载
- |
-
-
下载
- 《行尸走肉第一章》免安装中文汉化硬盘版下载
- 单机|436 MB
- 一款以动作冒险为主题的游戏
-
-
下载
- 《街头霸王X铁拳》免安装中文汉化硬盘版下载
- 单机|111MB
- 一款非常好玩的格斗游戏
-
-
下载
- |
-
-
下载
- 《暗黑破坏神3》免安装繁体中文正式版下载
- 单机|7630 MB
- 一款以角色扮演为主题的游戏
-
-
下载
- 《马克思佩恩3》免安装硬盘版下载
- 单机|27033 MB
- 一款以第三人称射击为主题的游戏