tf*idf 用于文本分类中的特征提取

简介: tf*idftf*idf,term frequency * inverse document frequency,词频 *逆向文档频率。1.思想TF-IDF是一种统计方法,用于评估某个词语在文档集合中的重要程度。 如果某个词语term在一篇文章中出现的频率TF高,并且在其他文章中很少出现,则认为这个词语具有很好的文档分类能力。2.公式tfij=t

tf*idf

tf*idf,term frequency * inverse document frequency,词频 *逆向文档频率。

1.思想

TF-IDF是一种统计方法,用于评估某个词语在文档集合中的重要程度。
如果某个词语term在一篇文章中出现的频率TF高,并且在其他文章中很少出现,则认为这个词语具有很好的文档分类能力。

2.公式

tfij=termidocjdocj,表示词语i在文档j中的频率。
idfi=lg(i),含有词语i的文档数越少,则此项得分最高。
tfidfi=idfijntfij,得分越高表示词语i对文章的分类能力越强。

3.用途

文本分类中的特征提取。

目录
相关文章
|
14天前
|
自然语言处理
N-Gram模型是什么?
N-Gram模型是什么?
|
6月前
|
PyTorch 算法框架/工具
时间序列预测:CNN+LSTM+Attention模型实战
时间序列预测:CNN+LSTM+Attention模型实战
242 0
|
3月前
|
机器学习/深度学习 算法 PyTorch
pytorch实现手写数字识别 | MNIST数据集(全连接神经网络)
pytorch实现手写数字识别 | MNIST数据集(全连接神经网络)
|
12月前
|
机器学习/深度学习 数据采集 人工智能
基于TextCNN实现文本分类
本文参考Yoon Kim的论文"Convolutional Neural Networks for Sentence Classification",实现TextCNN卷积神经网络进行文本分类。
155 0
基于TextCNN实现文本分类
|
机器学习/深度学习 自然语言处理 算法
【文本分类】基于改进TF-IDF特征的中文文本分类系统
【文本分类】基于改进TF-IDF特征的中文文本分类系统
191 0
【文本分类】基于改进TF-IDF特征的中文文本分类系统
|
算法 数据挖掘 Linux
【文本分类】采用同义词的改进TF-IDF权重的文本分类
【文本分类】采用同义词的改进TF-IDF权重的文本分类
【文本分类】采用同义词的改进TF-IDF权重的文本分类
|
机器学习/深度学习 编解码 自然语言处理
【文本分类】Attention Is All You Need
【文本分类】Attention Is All You Need
120 0
【文本分类】Attention Is All You Need
|
机器学习/深度学习 自然语言处理 算法
PyTorch-RNN循环神经网络实现分类-回归
PyTorch-RNN循环神经网络实现分类-回归
642 0
PyTorch-RNN循环神经网络实现分类-回归
TF-IDF及相似度计算
TF-IDF:衡量某个词对文章的重要性由TF和IDF组成 TF:词频(因素:某词在同一文章中出现次数) IDF:反文档频率(因素:某词是否在不同文章中出现) TF-IDF = TF*IDF TF :一个单词在一篇文章出现次数越多越重要 IDF: 每篇文章都出现的单词(如的,你,我,他) ,越不重要
261 0
TF-IDF及相似度计算
|
机器学习/深度学习 算法
TF之LSTM:利用多层LSTM算法对MNIST手写数字识别数据集进行多分类
TF之LSTM:利用多层LSTM算法对MNIST手写数字识别数据集进行多分类
TF之LSTM:利用多层LSTM算法对MNIST手写数字识别数据集进行多分类