Excel: xls与xlsx格式转换排坑指南
Excel: xls与xlsx格式转换排坑指南在日常数据处理中Excel 文件格式的转换是高频操作。尤其是从旧系统xls迁移到新系统xlsx或反过来兼容老软件时坑点层出不穷。今天我们就来聊聊 xls 与 xlsx 格式转换中的那些“坑”以及如何用 Python 轻松填平它们。### 1. 格式差异不只是扩展名不同xls 是 Excel 97-2003 时代的二进制格式而 xlsx 是 Office 2007 之后基于 XML 的压缩格式。这带来了几个关键差异-文件大小xlsx 通常比 xls 小很多因为它是压缩的。-行数限制xls 最多支持 65536 行xlsx 支持 1048576 行。-功能支持xlsx 支持更多新特性如条件格式、数据透视表等。-兼容性老软件如 Excel 2003无法直接打开 xlsx。这些差异导致转换时容易遇到编码、格式丢失、内存溢出等问题。下面我们直接进入实战。### 2. 环境准备安装必要的库我们推荐使用pandasopenpyxl处理 xlsx和xlrd读取 xls组合。注意xlrd从 2.0 版本开始只支持 xls不再支持 xlsx所以别装错。bashpip install pandas openpyxl xlrd### 3. 基础转换从 xls 到 xlsx最简单的转换直接读取 xls 再保存为 xlsx。但这里有个大坑pandas读取 xls 时如果文件里有日期、公式或特殊编码可能报错或数据错乱。来看一个带注释的安全示例pythonimport pandas as pddef xls_to_xlsx(input_path, output_path): 将 xls 文件转换为 xlsx 文件 :param input_path: 输入的 .xls 文件路径 :param output_path: 输出的 .xlsx 文件路径 # 读取 xls 文件enginexlrd 是必须的否则 pandas 会尝试用 openpyxl 读取导致报错 df pd.read_excel(input_path, enginexlrd) # 处理常见问题将 NaN 替换为空字符串避免输出时出现 nan 字样 df df.fillna() # 保存为 xlsxindexFalse 避免写入行索引 df.to_excel(output_path, indexFalse, engineopenpyxl) print(f转换成功: {input_path} - {output_path})# 使用示例if __name__ __main__: xls_to_xlsx(old_data.xls, new_data.xlsx)坑点提醒如果 xls 文件里有合并单元格或宏pandas会忽略它们。如果需要保留这些要用xlutils或pyexcel等更底层的库但这里不展开。### 4. 反向转换从 xlsx 到 xls从 xlsx 转 xls 更麻烦因为pandas的to_excel不支持直接写 xls需要xlwt库但它已停止维护。而且 xlsx 的行数可能超过 xls 限制导致转换失败。来看一个稳健的转换函数pythonimport pandas as pddef xlsx_to_xls(input_path, output_path): 将 xlsx 文件转换为 xls 文件 :param input_path: 输入的 .xlsx 文件路径 :param output_path: 输出的 .xls 文件路径 # 读取 xlsx 文件engineopenpyxl 明确指定 df pd.read_excel(input_path, engineopenpyxl) # 检查行数是否超过 xls 限制65536 行 if len(df) 65535: # 减去表头一行 raise ValueError(f数据行数 {len(df)} 超过 xls 格式最大行数 65535请先拆分数据) # 注意xls 不支持某些数据类型如 datetime64需要转为字符串 for col in df.columns: if df[col].dtype datetime64[ns]: df[col] df[col].astype(str) # 转为字符串避免报错 # 保存为 xls需要安装 xlwtpip install xlwt df.to_excel(output_path, indexFalse, enginexlwt) print(f转换成功: {input_path} - {output_path})# 使用示例if __name__ __main__: xlsx_to_xls(new_data.xlsx, old_compatible.xls)坑点提醒xlwt不支持写入超过 65535 行也不支持写入日期类型会报错所以上面的代码做了预处理。另外如果 xlsx 里有图片或图表转换后会丢失。### 5. 批量转换与异常处理实际工作中经常要批量转换一堆文件。这里给一个带异常处理和进度提示的脚本避免一个文件出错就中断pythonimport osimport pandas as pddef batch_convert(folder_path, target_formatxlsx): 批量转换文件夹中的所有 Excel 文件 :param folder_path: 文件夹路径 :param target_format: 目标格式xlsx 或 xls for filename in os.listdir(folder_path): if not filename.endswith((.xls, .xlsx)): continue input_path os.path.join(folder_path, filename) # 生成输出文件名替换扩展名 base_name os.path.splitext(filename)[0] output_path os.path.join(folder_path, f{base_name}.{target_format}) try: if target_format xlsx: # 如果是 xls 转 xlsx df pd.read_excel(input_path, enginexlrd) df.to_excel(output_path, indexFalse, engineopenpyxl) else: # 如果是 xlsx 转 xls df pd.read_excel(input_path, engineopenpyxl) if len(df) 65535: print(f跳过 {filename}: 行数超限) continue df.to_excel(output_path, indexFalse, enginexlwt) print(f成功: {filename} - {output_path}) except Exception as e: print(f失败: {filename} - 错误: {e})# 使用示例if __name__ __main__: batch_convert(./excel_files, target_formatxls)### 6. 编码与特殊字符的坑中文文件名或内容里的特殊字符如#、?在转换时可能导致编码错误。解决办法是统一使用utf-8编码并处理文件名pythonimport pandas as pd# 读取时指定编码如果内容有乱码df pd.read_excel(中文数据.xls, enginexlrd, encodingutf-8-sig)# 写文件时确保路径无特殊字符output_path output/最终_数据.xlsx # 避免使用 ? 等字符df.to_excel(output_path, indexFalse, engineopenpyxl)### 7. 总结xls 与 xlsx 转换的核心坑点在于-引擎选择读 xls 用xlrd读 xlsx 用openpyxl写 xls 用xlwt写 xlsx 用openpyxl。混用会导致各种报错。-行数限制xls 最多 65536 行超出必须分割或改用 xlsx。-数据类型日期、布尔值等在转换时可能丢失或报错建议预处理为字符串。-功能丢失合并单元格、宏、图表等不会被pandas保留需要更专业的库如pyexcel或直接操作 XML。-批量处理务必用 try-except 包裹避免一个坏文件卡死整个流程。掌握了这些你就能在 xls 和 xlsx 之间平滑切换再也不用担心“文件打不开”或“数据变乱码”了。如果你有特殊需求如保留格式可以进一步研究xlwings或win32com调用 Excel 应用本身来转换但那属于另一个话题了。