参考资料:whoosh+jieba:python下实现中文全文检索 whoosh官方文档
1,根据数据库新建schema
只保留音乐库数据中我需要的部分,即下面图片中的黄色部分,把所有表格变成统一格式的记录,格式为:artist_id,artist_name,music_id,music_name,album_id,album_name,lyrics,comment_num,hot_num
基本思想:根据musics表格取出music_id,music_name,album_id,lyrics,comment_num,从albums表格中根据album_id找到album_name和artist_id,从artist表格中根据artist_id找到artist_name。这样前面的8个就得到了,最后一个hot_num代表的是热门度,此热门度的初始值是comment_num,后续根据用户点击情况调整。
新建schema的代码:create_schema.py
# -*- coding:utf-8 -*-
import sqlite3
import re
from whoosh.fields import Schema, STORED, ID, KE