文章目录
- 0、引言
- 一、为什么Excel在国赛中不可替代?
- 二、国赛Excel必会操作清单
- 三、Excel与Python的分工边界
- 四、Excel的常见坑点
0、引言
国赛倒计时第5天,公式排版的问题解决了,今天我们来补上另一个同样重要但经常被忽视的工具:Excel。如果说Mathtype管的是“论文怎么排”,那Excel管的就是“数据怎么用”。
一、为什么Excel在国赛中不可替代?
很多队伍拿到赛题数据后的第一反应是“直接写Python读取CSV”。这其实是个误区。Excel在国赛场景下有四个独特价值:
价值一:快速理解数据,比代码更直观
打开一个Excel文件,你能在10秒内看到数据的全貌——多少行、多少列、缺失值多不多、有没有明显异常值。代码可能需要跑几行才能知道数据形状,Excel是眼睛直接看。
价值二:数据清洗的“预览+修复”模式
缺失值怎么补?异常值怎么处理?这些决策需要你先“看到数据的样子”再决定方法。Excel里用排序、筛选、条件格式把问题区域高亮出来,比在代码里print一堆数字更直观。
价值三:赛前准备数据的“万能读卡器”
国赛给的数据格式五花八门——.csv、.xlsx、.txt、甚至.pdf表格。Excel能打开绝大多数格式,把它当作“数据中转站”:用Excel打开查看→确认数据无误→另存为.csv→用Python读取。比在代码里折腾编码问题和格式解析省时间。
价值四:临时画图、做简单统计的“备用武器”
如果Python跑不通、matplotlib报错,Excel的数据透视表和图表功能可以快速出图做探索性分析,至少先给写作手提供描述性统计的素材。
二、国赛Excel必会操作清单
以下操作覆盖了比赛中95%的数据处理场景,倒计时阶段不需要精通所有功能,但每项操作三个人里至少有一个能快速完成。
操作一:条件格式——3秒找出异常值
选中数据区域→开始→条件格式→突出显示单元格规则→大于/小于/重复值。比如赛题给的温度数据范围是0-100℃,如果出现999,用条件格式标红,一秒定位异常。这是比写循环更快的异常值筛查方式。
操作二:数据分列——处理混乱的文本数据
数据→分列→按分隔符或固定宽度拆分。适用场景:日期时间合并在同一列、CSV文件读进来所有数据挤在一列、文本里有制表符需要拆分。
操作三:VLOOKUP / XLOOKUP——多表关联查询
=VLOOKUP(查找值, 查找区域, 返回列号, 0)。国赛数据经常拆成多个文件(比如站点信息表、监测数据表),需要把站点经纬度匹配到监测数据上时,VLOOKUP比写pandas merge更快。注意查找区域的第一列必须是查找值所在的列。
操作四:数据透视表——快速分组统计
插入→数据透视表→把字段拖到行/列/值区域。最常用的场景:按时间分组统计平均值、按类别统计总和、快速生成频数分布表。比写groupby快一个数量级。
操作五:IF + 逻辑函数——快速打标签
=IF(条件, 值1, 值2)。比如“如果温度>50则标记为异常”,用IF写一列公式比写Python循环更直观。配合AND/OR可以处理多条件判断。
操作六:常用快捷键——提速基本功
| 快捷键 | 功能 | 使用场景 |
|---|---|---|
| Ctrl+Shift+↓ | 选到数据末尾 | 快速选中整列数据 |
| Ctrl+Shift+L | 筛选 | 看某个类别的子集 |
| Alt+= | 自动求和 | 快速看总和/平均值 |
| Ctrl+1 | 设置单元格格式 | 调整小数位数显示 |
三、Excel与Python的分工边界
倒计时5天,很多同学对Excel和Python的关系有误解,觉得“用Excel说明水平低”。事实不是这样的。我的建议是明确分工:
用Excel做的事(前提手):
- 第一次打开数据,看数据长什么样(形状、列名、缺失情况)
- 快速筛查异常值、重复值、格式错误
- 多表关联时预览匹配结果
- 给写作手快速生成描述性统计表格(均值、中位数、最大最小值)
- 处理几KB到几MB的小规模数据
用Python做的事(主力):
- 大规模数据的清洗和预处理
- 复杂模型的训练和预测
- 高精度的可视化出图(论文用图)
- 重复性高的处理流程(写一次循环跑所有数据)
分工原则:用Excel做“看一眼就懂”的事,用Python做“需要跑代码才能算”的事。不要觉得用Excel就是“不专业”,在倒计时冲刺中高效才是第一生产力。
四、Excel的常见坑点
坑一:日期时间被读成数字串
Excel默认把日期转为数字存储(比如2026-08-31存成46200)。读取csv再用Python处理时,需要注意这个格式转换问题。最好在Excel里先设置单元格格式为文本或标准日期格式再保存。
坑二:小数位显示导致精度丢失
Excel默认显示2位小数,但实际存储的值可能更多位。用肉眼看到“3.14”但实际值是“3.1415926”。注意复制数据进论文时确认显示格式,避免出现精度不一致。
坑三:文件过大,打开/保存卡顿
国赛数据如果超过10万行,Excel打开和操作会明显变慢。这种情况直接用Python处理,不用硬用Excel打开。