ML之RS:基于用户的CF+LFM实现的推荐系统(基于相关度较高的用户实现电影推荐)


百年孤寂
百年孤寂 2022-09-19 16:57:13 64813
分类专栏: 资讯

ML之RS:基于用户的CF+LFM实现的推荐系统(基于相关度较高的用户实现电影推荐)

目录

输出结果

实现代码


输出结果

 

实现代码

  1. ML之RS:基于CF和LFM实现的推荐系统
  2. import numpy as np
  3. import pandas as pd
  4. import matplotlib.pyplot as plt
  5. import time
  6. import warnings
  7. warnings.filterwarnings('ignore')
  8. np.random.seed(1)
  9. plt.style.use('ggplot')
  10. data = pd.read_csv('ml-20m/ratings_smaller.csv', index_col=0)
  11. movies = pd.read_csv('ml-20m/movies_smaller.csv')
  12. 1、导入数据集
  13. data = pd.read_csv('ml-latest-small/ratings.csv')
  14. movies = pd.read_csv('ml-latest-small/movies.csv')
  15. movies = movies.set_index('movieId')[['title', 'genres']]
  16. 2、观察数据集
  17. How many users?
  18. print (data.userId.nunique(), 'users')
  19. How many movies?
  20. print (data.movieId.nunique(), 'movies')
  21. How possible ratings?
  22. print (data.userId.nunique() * data.movieId.nunique(), 'possible ratings')
  23. How many do we have?
  24. print (len(data), 'ratings')
  25. print (100 * (float(len(data)) / (data.userId.nunique() * data.movieId.nunique())), '% of possible ratings')
  26. Number of ratings per users
  27. fig = plt.figure(figsize=(10, 10))
  28. ax = plt.hist(data.groupby('userId').apply(lambda x: len(x)).values, bins=50)
  29. plt.xlabel("ratings")
  30. plt.ylabel("users")
  31. plt.title("Number of ratings per user")
  32. plt.show()
  33. Number of ratings per movie
  34. fig = plt.figure(figsize=(10, 10))
  35. ax = plt.hist(data.groupby('movieId').apply(lambda x: len(x)).values, bins=50)
  36. plt.xlabel("ratings")
  37. plt.ylabel("movies")
  38. plt.title('Number of ratings per movie')
  39. plt.show()
  40. Ratings distribution评分分布
  41. fig = plt.figure(figsize=(10, 10))
  42. ax = plt.hist(data.rating.values, bins=5)
  43. plt.xlabel("ratings")
  44. plt.ylabel("numbers")
  45. plt.title("Distribution of ratings")
  46. plt.show()
  47. Average rating per user
  48. fig = plt.figure(figsize=(10, 10))
  49. ax = plt.hist(data.groupby('userId').rating.mean().values, bins=10)
  50. plt.xlabel("Average rating")
  51. plt.ylabel("numbers")
  52. plt.title("Average rating per user")
  53. plt.show()
  54. Average rating per movie
  55. fig = plt.figure(figsize=(10, 10))
  56. ax = plt.hist(data.groupby('movieId').rating.mean().values, bins=10)
  57. plt.title('Average rating per movie')
  58. plt.show()
  59. Top Movies,genres电影类型
  60. average_movie_rating = data.groupby('movieId').mean()
  61. top_movies = average_movie_rating.sort_values('rating', ascending=False).head(10)
  62. pd.concat([movies.loc[top_movies.index.values],
  63. average_movie_rating.loc[top_movies.index.values].rating], axis=1)
  64. Robust Top Movies - Lets weight the average rating by the square root of number of ratings让平均评分进行加权数的平方根
  65. top_movies = data.groupby('movieId').apply(lambda x:len(x)**0.5 * x.mean()).sort_values('rating', ascending=False).head(10)
  66. pd.concat([movies.loc[top_movies.index.values],
  67. average_movie_rating.loc[top_movies.index.values].rating], axis=1)
  68. controversial_movies = data.groupby('movieId').apply(lambda x:len(x)**0.25 * x.std()).sort_values('rating', ascending=False).head(10)
  69. pd.concat([movies.loc[controversial_movies.index.values],
  70. average_movie_rating.loc[controversial_movies.index.values].rating], axis=1)

相关文章推荐

GitHub

网站声明:如果转载,请联系本站管理员。否则一切后果自行承担。

本文链接:https://www.xckfsq.com/news/show.html?id=3719
赞同 0
评论 0 条
百年孤寂L0
粉丝 0 发表 9 + 关注 私信
上周热门
Kingbase用户权限管理  1999
信刻全自动光盘摆渡系统  1727
信刻国产化智能光盘柜管理系统  1399
银河麒麟添加网络打印机时,出现“client-error-not-possible”错误提示  987
银河麒麟打印带有图像的文档时出错  888
银河麒麟添加打印机时,出现“server-error-internal-error”  682
麒麟系统也能完整体验微信啦!  637
统信桌面专业版【如何查询系统安装时间】  600
统信操作系统各版本介绍  595
统信桌面专业版【全盘安装UOS系统】介绍  570
本周热议
我的信创开放社区兼职赚钱历程 40
今天你签到了吗? 27
信创开放社区邀请他人注册的具体步骤如下 15
如何玩转信创开放社区—从小白进阶到专家 15
方德桌面操作系统 14
我有15积分有什么用? 13
用抖音玩法闯信创开放社区——用平台宣传企业产品服务 13
如何让你先人一步获得悬赏问题信息?(创作者必看) 12
2024中国信创产业发展大会暨中国信息科技创新与应用博览会 9
中央国家机关政府采购中心:应当将CPU、操作系统符合安全可靠测评要求纳入采购需求 8

添加我为好友,拉您入交流群!

请使用微信扫一扫!