把求职里最常见的几件事放到同一个系统里:上传简历、分析岗位、推荐职位、预测薪资、优化简历、导出文档。
本系统是一个完整的招聘数据分析解决方案,通过爬虫技术获取招聘网站数据,利用数据分析和机器学习技术,为求职者提供薪资分析、职位推荐、薪资预测等功能。
- 爬取主流招聘网站职位数据(智联招聘/前程无忧/Boss 直聘)
- 支持多线程/异步爬取
- 反爬策略处理
- 薪资数据标准化
- 缺失值和异常值处理
- 多维度统计分析(城市、学历、经验、行业等)
- 城市薪资分布地图
- 薪资/学历/经验分布图表
- 技能词云图
- 行业/公司规模分析
- 职位推荐:基于 TF-IDF 和余弦相似度的推荐算法
- 薪资预测:使用随机森林/逻辑回归预测薪资区间
- 用户注册/登录
- 个人信息管理
- 浏览历史记录
- 职位收藏功能
- 框架:Django 4.2
- 数据库:MySQL 8.0
- ORM:SQLAlchemy
- 爬虫:Requests + BeautifulSoup4 + Selenium + Scrapy
- 分析:Pandas + NumPy
- 可视化:Matplotlib + Seaborn + WordCloud
- 框架:Scikit-learn
- NLP:Jieba(中文分词)
- 算法:TF-IDF、余弦相似度、随机森林、逻辑回归
- 基础:HTML5 + CSS3 + JavaScript
- 图表:ECharts
- UI 框架:Bootstrap
ai-job-seeker/
├── manage.py # Django 管理入口
├── start.sh / stop.sh # 本地启动与停止脚本
├── job_platform/ # Django 项目配置
├── jobs/ # 职位、分析、文档生成相关应用
├── users/ # 用户、权限、访问日志相关应用
├── recommendations/ # 推荐相关应用
├── crawler/ # 爬虫核心模块
├── data_process/ # 数据清洗、分析、可视化模块
├── ml_models/ # 机器学习模型
├── frontend/ # Next.js 前端
├── scripts/
│ ├── crawlers/ # 爬虫运行、Cookie、页面诊断脚本
│ └── data/ # 数据导入、清理、检查、初始化脚本
├── tests/manual/ # 手动/集成验证脚本
├── docs/
│ ├── guides/ # 使用和功能指南
│ └── reports/ # 阶段性报告和修复记录
├── reports/ # JSON 等运行报告输出
├── runtime/ # PID 等运行时文件
├── data/ # 原始数据、处理后数据、模型和图表
├── config/ # 配置文件
└── requirements.txt
- Python 3.8+
- MySQL 8.0+
- pip
git clone <repository-url>
cd bishepip install -r requirements.txt创建 MySQL 数据库:
CREATE DATABASE job_analysis CHARACTER SET utf8mb4 COLLATE utf8mb4_unicode_ci;配置数据库连接(config/config.py)
python manage.py makemigrations
python manage.py migratepython manage.py runserverpython scripts/crawlers/run_crawler.pypython data_process/cleaner.pypython data_process/analyzer.pypython ml_models/predictor.py --trainpython scripts/data/import_jobs_data.py
python scripts/data/check_data_quality.py- 项目初始化
- 数据爬虫实现
- 数据清洗与存储
- 数据分析模块
- Django Web 框架搭建
- 数据可视化实现
- 推荐算法实现
- 薪资预测模型
- 用户系统开发
- 前端页面开发
- 系统测试与优化