实验一 数据爬取与数据清理:用浏览器自动化爬虫从国防科大图书馆(超星发现)与 Web of Science 两个数据源爬取 “Database” 主题的 500 篇以上论文关键信息(题名、作者、作者单位、摘要、刊名、年),再对多源数据做格式标准化、去重、缺失值处理与字段重组,最终重整为作者合著边列表。作者把这套”模拟真人操作、降低封号风险”的爬取思路命名为 EVANGELION 方法(Efficient eValuation And Non-invasive Gathering of ELigible Information from Online Networks)。
数据爬取与清洗大作业
任务背景
(依据本人实验报告整理)作业包含两个实验:
实际数据产出:校图书馆 650 条 + WOS 1000 条,合并去重(标题规范化比对)后得 1585 条有效记录。
内容结构
2025_Cource_assistant/Crouse_assistant.pyLib.csv;含多标签页多线程框架2025_Cource_assistant/douban_pic.py2025_Cource_assistant/main.py、test.py2025_Cource_assistant/Lib.csv、failed_data.txtEVANGELION/The_Only.pydata_clean_NUDT/data_clean_WOS)、按标题去重合并(data_merge)、作者拆列并生成合著边表(data_transform)、剔除空值边(data_purify)EVANGELION/requirments.txtEVANGELION/图.gephi运行方法
DrissionPage、DataRecorder、pandas、openpyxl(完整清单见EVANGELION/requirments.txt,pip install -r即可)。test.py校验浏览器路径。python 2025_Cource_assistant/Crouse_assistant.py(需在校园网环境登录图书馆,账号自行填写)。python EVANGELION/The_Only.py(登录凭据已脱敏置空,运行前在PaperExporter.login中自行填写;下载目录默认D:\Downloads,清洗阶段需在脚本目录放置excel/export_*.xls与wos.xls)。EVANGELION/图.gephi。来源声明
maoyan_movie_table.py、multi-tab.py、sign_up.py经内容比对为 DrissionPage 官方教程示例代码(猫眼榜单抓取、gitee 多标签页采集、gitee 登录),非本人业务代码,故不入库;模板脚本运行产物data.csv(猫影榜单数据)一并未收录。Data.zip(爬取与清洗的全量中间数据,xls/csv 约 4.8MB)、code.zip(同目录代码旧快照)、.idea/、实验报告 docx 与任务书 pdf 按入库原则排除。无单文件超过 20MB 的入库文件。2025_Cource_assistant的图书馆检索解析流程与EVANGELION/The_Only.py的导出、清洗、合并、边表生成逻辑为本人编写;部分翻页等待、定位器写法参考了 DrissionPage 官方文档与课程示例。The_Only.py中误含的他人共享账号密码已置空,douban_pic.py中的本机绝对路径已改为相对路径。