组合特征（一）tfidf(word+article)

最新推荐文章于 2025-07-15 21:09:20 发布

原创最新推荐文章于 2025-07-15 21:09:20 发布 · 981 阅读

1 ·

CC 4.0 BY-SA版权

达观杯nlp算法比赛总结专栏收录该内容

20 篇文章

订阅专栏

本文详细介绍了一种基于TF-IDF的特征工程方法，通过结合文章内容与关键词，构建更全面的特征向量，适用于文本分类等机器学习任务。文章首先进行数据预处理，然后利用TF-IDFVectorizer实现特征提取，最后将训练集与测试集的特征矩阵保存为本地文件，便于后续模型训练。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

"""
将tfidf(word)和tfidf(article)拼接成新的特征

"""

import pickle
import pandas as pd
from sklearn.feature_extraction.text import TfidfVectorizer

"""=====================================================================================================================
1 数据预处理
"""
read_start_time = time.time()
df_train=pd.read_csv('train_set.csv')
df_test=pd.read_csv('test_set.csv')


#df_train.drop(df_train.columns[0],axis=1,inplace=True)

df_train["word_article"] = df_train["article"].map(str) +' '+ df_train["word_seg"].map(str)
df_test["word_article"] = df_test["article"].map(str) +' ' + df_test["word_seg"].map(str)
y_train = (df_train['class'] - 1).values

"""=====================================================================================================================
2 特征工程
"""
vectorizer = TfidfVectorizer(ngram_range=(1, 2), min_df=3, max_df=0.9, sublinear_tf=True)
vectorizer.fit(df_train['word_article'])
x_train = vectorizer.transform(df_train['word_article'])
x_test = vectorizer.transform(df_test['word_article'])

"""=====================================================================================================================
3 保存至本地
"""
data = (x_train, y_train, x_test)
with open('./tfidf(word+article).pkl', 'wb') as f：
	pickle.dump(data, f)