Python学习笔记(6) xml转换为excel

网络爬虫采集下来的结果数据是用XML文件存的,如果要转换成Excel格式,需要用到爬虫的导入和导出功能。导入数据的方法又分成手工导入和自动导入两种情况。

  1. 做完采集规则后,点击爬数据或者DS打数机上的单搜或者集搜按钮,这样采集下来的数据是不会自动导入的,需要按照本教程讲解的方法导入数据。
  2. 对规则设置了调度,而且勾选了自动入库,或者使用微博采集工具箱和快捷采集工具,那么都会自动导入,用户只需在规则管理那里导出数据即可。

使xml格式转为excel格式,手工导入导出的操作步骤如下:(注意控制ZIP包的大小)

Python学习笔记(6) xml转换为excel

二、手工导入操作步骤

打数机采集下来的数据,一页一个XML文件,存放在硬盘的DataScraperWorks目录下,相应主题名文件夹里**。**

1,在硬盘的主题名文件夹里选中多个xml文件直接压缩到zip包,不要夹杂除xml外的文件夹或其他文件类型。

2,登录中心->任务管理。

3,点击对应的任务名进入到该任务的管理页面,点击“数据”按钮->“导入XML”,选择XML的压缩包zip,导入。

4,导入成功后即可“导出数据”,在“历史记录”中可以重复下载。下载的数据,默认保存在本地的下载目录

注意:ZIP包不能大于10M,为了稳定上传,最好分批压缩成多个2M的包。

Python学习笔记(6) xml转换为excel

Python学习笔记(6) xml转换为excel

**【注意】**数据管理功能是增值服务,每个规则可以免费导出1万条数据。专业版or旗舰版爬虫”。

三、自动导入操作步骤

在中心给自己做的规则设置调度,而且勾选了自动入库,如果运行起来爬虫群模式,爬虫群就能自动入库。

Python学习笔记(6) xml转换为excel