
1. 项目概述这个基于Python的京东手机数据分析与推荐系统是我在指导学生完成毕业设计时开发的一个实战项目。作为一名长期从事数据分析和Python教学的技术从业者我发现在电商数据分析领域很多教学案例要么过于简单要么脱离实际业务场景。因此我设计了这个覆盖数据采集、清洗、分析和可视化全流程的项目它不仅能帮助学生掌握Python核心技术栈更能培养真实的商业数据分析思维。系统采用Flask作为后端框架通过requests库采集京东手机数据使用pyecharts进行可视化展示并实现了基于规则的推荐功能。整个项目代码量约2000行涉及爬虫、数据库、Web开发和数据分析等多个技术领域。下面我将从技术选型、实现细节到避坑经验全面剖析这个项目的开发过程。提示本项目所有代码和数据均已开源文末会提供获取方式。建议读者边阅读边动手实践遇到问题可以参考我的解决方案。2. 技术架构设计2.1 整体技术栈选型选择合适的技术栈是项目成功的关键。经过多轮评估我最终确定了以下技术组合后端框架Flask轻量级适合快速开发数据采集requests 自定义Headers避免被反爬数据存储SQLite单文件数据库便于部署可视化pyecharts交互性强图表类型丰富前端HTML Bootstrap响应式布局为什么没有选择Django或Scrapy在教学场景下Flask的学习曲线更平缓能让学生更专注于业务逻辑而非框架本身。而requests相比Scrapy更易于理解和调试适合中小规模数据采集。2.2 系统架构设计系统采用典型的三层架构[数据层] ├─ 爬虫模块requests ├─ 数据库SQLite [业务层] ├─ 数据分析Pandas/Numpy ├─ 推荐算法基于规则 [展示层] ├─ Web界面Flask ├─ 可视化图表pyecharts这种分层设计使得各模块职责清晰便于后期维护和功能扩展。例如当需要增加新的数据源时只需修改数据层的爬虫模块不会影响其他部分。3. 核心模块实现3.1 数据采集模块京东的数据采集有以下几个技术难点需要特别注意反爬机制京东对爬虫检测严格需要模拟浏览器行为动态加载商品数据通过AJAX异步加载数据清洗原始数据包含大量噪音这是经过实战检验的爬虫代码片段def fetch_jd_phone_data(keyword, page): headers { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36, Referer: https://search.jd.com/ } params { keyword: keyword, page: page, s: (page-1)*30 1 } try: response requests.get( https://search.jd.com/Search, headersheaders, paramsparams, timeout10 ) response.raise_for_status() # 解析HTML获取商品列表 soup BeautifulSoup(response.text, html.parser) items soup.select(.gl-item) data [] for item in items: # 提取价格、标题、评论数等信息 price item.select(.p-price strong i)[0].text title item.select(.p-name em)[0].text.strip() comment item.select(.p-commit strong a)[0].text data.append({ price: float(price), title: title, comment: process_comment(comment) # 评论数清洗 }) return data except Exception as e: print(f爬取失败: {str(e)}) return []重要提示实际项目中需要添加随机延迟time.sleep和代理IP池避免触发反爬。我建议控制在3-5秒/请求的频率并使用try-catch处理异常。3.2 数据清洗与存储原始数据需要经过以下处理步骤评论数转换将2万转换为20000价格过滤剔除异常价格如999999品牌提取从标题中提取手机品牌清洗后的数据存入SQLite数据库表结构设计如下CREATE TABLE phone ( id INTEGER PRIMARY KEY, brand TEXT NOT NULL, -- 品牌 image_url TEXT, -- 图片URL price REAL, -- 价格 name TEXT, -- 产品名称 detail_url TEXT, -- 详情页链接 comment TEXT -- 评论数据(JSON格式) );使用SQLite而非MySQL的原因对于毕业设计级别的项目SQLite完全够用且部署简单单个.db文件。实际生产环境可以考虑迁移到MySQL或MongoDB。4. 数据分析与可视化4.1 销售分布分析通过以下SQL查询获取各品牌销售数据def get_brand_sales(): conn sqlite3.connect(jd_phone_info.db) cursor conn.cursor() # 查询各品牌评论数总和代理销量 sql SELECT brand, SUM( CASE WHEN json_extract(comment, $.CommentCountStr) LIKE %万% THEN CAST(REPLACE(json_extract(comment, $.CommentCountStr), 万, ) AS REAL) * 10000 ELSE CAST(json_extract(comment, $.CommentCountStr) AS INTEGER) END ) as total_comments FROM phone GROUP BY brand ORDER BY total_comments DESC cursor.execute(sql) results cursor.fetchall() return results使用pyecharts生成柱状图的关键代码from pyecharts.charts import Bar def draw_sales_bar(brand_sales): brands [item[0] for item in brand_sales] sales [item[1] for item in brand_sales] bar Bar() bar.add_xaxis(brands) bar.add_yaxis(销量, sales) bar.set_global_opts( title_optsopts.TitleOpts(title各品牌手机销量分布), xaxis_optsopts.AxisOpts(axislabel_optsopts.LabelOpts(rotate45)) ) return bar4.2 价格分析价格分析采用箱线图展示分布情况核心是计算各品牌的价格统计量def get_price_stats(): conn sqlite3.connect(jd_phone_info.db) df pd.read_sql(SELECT brand, price FROM phone, conn) stats df.groupby(brand)[price].agg([ (count, size), (min, min), (q1, lambda x: x.quantile(0.25)), (median, median), (q3, lambda x: x.quantile(0.75)), (max, max) ]).reset_index() return stats.to_dict(records)5. 智能推荐系统实现5.1 推荐算法设计考虑到毕业设计的复杂度和实用性我们采用基于规则的推荐策略主要考虑以下维度品牌偏好用户指定感兴趣的品牌价格区间设置最低和最高价格好评率过滤低于阈值的产品推荐接口的核心逻辑app.route(/recommend) def recommend(): brand request.args.get(brand) min_price float(request.args.get(min_price, 0)) max_price float(request.args.get(max_price, 99999)) min_rating float(request.args.get(min_rating, 90)) conn sqlite3.connect(jd_phone_info.db) cursor conn.cursor() sql f SELECT * FROM phone WHERE brand ? AND price BETWEEN ? AND ? AND json_extract(comment, $.GoodRate) ? ORDER BY json_extract(comment, $.GoodRate) DESC LIMIT 20 cursor.execute(sql, (brand, min_price, max_price, min_rating)) results cursor.fetchall() return jsonify([dict(row) for row in results])5.2 推荐效果优化在实际测试中发现几个问题冷启动问题新用户没有历史数据解决方案提供热门品牌和价格区间的默认值长尾效应小众品牌推荐结果少解决方案加入相似品牌扩展如选择小米时也推荐红米评分偏差不同品牌好评率基准不同解决方案使用Z-Score标准化处理优化后的推荐逻辑流程图用户输入 → 参数校验 → 数据库查询 → 结果过滤 → 标准化处理 → 排序 → 返回TOP206. 部署与性能优化6.1 项目部署方案对于毕业设计演示推荐两种部署方式本地运行pip install -r requirements.txt python app.py云服务器部署以Ubuntu为例# 安装依赖 sudo apt update sudo apt install python3-pip pip3 install -r requirements.txt # 使用Gunicorn运行 pip3 install gunicorn gunicorn -w 4 -b 0.0.0.0:5000 app:app6.2 性能优化技巧在项目开发过程中我总结了以下性能优化经验数据库索引优化CREATE INDEX idx_phone_brand ON phone(brand); CREATE INDEX idx_phone_price ON phone(price);缓存机制from flask_caching import Cache cache Cache(config{CACHE_TYPE: SimpleCache}) cache.init_app(app) app.route(/sales) cache.cached(timeout3600) # 缓存1小时 def get_sales_data(): # 耗时查询 return jsonify(data)异步加载 前端使用AJAX异步加载图表数据避免页面卡顿。7. 常见问题与解决方案7.1 爬虫被封禁现象请求返回403状态码或验证码页面解决方案轮换User-Agent和代理IP添加随机请求延迟使用selenium模拟人工操作7.2 数据可视化渲染慢现象页面加载时间过长优化方案减少一次性渲染的数据量如只显示TOP20品牌使用WebWorker进行后台计算启用图表动画效果降级7.3 推荐结果不准确改进方法引入协同过滤算法增加用户行为数据收集使用机器学习模型预测偏好8. 项目扩展方向这个基础框架可以进一步扩展增加数据源整合天猫、苏宁等平台数据增强推荐实现混合推荐内容协同过滤实时分析使用KafkaSpark Streaming处理实时数据移动端适配开发微信小程序版本我在实际教学中发现学生最常遇到的困难是反爬虫策略和数据分析方法的选择。建议先从小规模数据开始逐步完善系统功能。对于想深入学习的同学可以考虑引入以下技术使用Scrapy-Redis构建分布式爬虫采用Django REST Framework重构API集成TensorFlow实现销量预测这个项目完整代码和数据集已分享在我的技术博客示例URL包含详细的部署文档和视频教程。在实际开发过程中记得定期备份数据并使用版本控制如Git管理代码变更。