基于BERT的超长文本分类模型

更新时间:2023-07-15 01:37:43 阅读：评论：0

基于BERT 的超长⽂本分类模型

xt是什么意思

基于BERT 的超长⽂本分类模型

损失

hdcp0.Abstract

本⽂实现了⼀个基于BERT+LSTM超长⽂本分类的模型, 评估⽅法使⽤准确率和F1 Score.

项⽬代码github地址:

1.任务介绍

⽤BERT做⽂本分类是⼀个⽐较常见的项⽬.石家庄一模

celebration 麦当娜但是众所周知BERT对于⽂本输⼊长度有限制. 对于超长⽂本的处理, 最简单暴⼒⽆脑⾼效的办法是直接截断, 就取开头这部分送⼊BERT. 但是也请别看不起这种做法, 往往最简单，最Naive的⽅法效果反⽽⽐⼀顿操作猛如虎复杂模型来得好.

英国关闭餐厅酒吧

这⾥多提⼀句为什么. 通常长⽂本的⽂章结构都⽐较明确, ⽂章前⾯⼀两段基本都是对于后⾯的概述. 所以等于作者已经帮你提取了⽂章⼤意, 所以直接取前⾯⼀部分理论上来说是有意义的.

当然也有最新研究表明取⽂章中间部分效果也很不错. 在此不展开.

本⽂实现的是⼀种基于HIERARCHICAL(级联)思想的做法, 把⽂本切成多⽚处理. 该⽅法来⾃于这篇论⽂ .

⽂中提到这么做还能降低lf-attention计算的时间复杂度.

假设原句⼦长为n, 每个分段的长度是k. 我们知道最原始的BERT计算时间复杂度是O(n ), 作者认为，这么做可以把时间复杂度降低到O(nk).因为我们把n分数据分割成k⼩份, 那么我们⼀共要做n/k次, 每次我们的时间复杂度是k , 即O(n/k * k ) = O(nk)

数据集

这次我们测试该模型在两种语⾔上的效果. 分别是中⽂数据集和英语数据集.

中⽂数据集依旧是我们的⽼朋友ChineNLPCorps提供的不同类别商品的评论.英语四级真题下载

英语数据集来源于Kaggle⽐赛, ⽤户对于不同⾦融产品的评论.

由于两种数据集训练预测上没有什么本质区别, 下⽂会⽤英语数据集来演⽰.

评估⽅法

本项⽬使⽤的评估⽅法是准确率和F1 Score. ⾮常常见的分类问题评价标准.

测试集

power struggle此项⽬中直接取了数据集⾥⼀⼩部分作为测试集.

2.数据初步处理

222

观察数据集，我们发现⽤户评论是有NaN值的. ⽽且本次实验⽬的是做超长⽂本分类. 我们选取⾮NaN值，并且是长度⼤于250的评论.

筛选完后我们保留⼤约17k条左右数据

如图, 准确率达到了88%. 训练数据不过10k的数量级, 对于深度学习来说是⾮常少的. 这⾥不得不感叹下BERT作为预训练模型在⼩样本数据

kanye west amazing随后我们将这些分割的句⼦分离成单独的⼀条数据. 并为他们加上label.

对⽐原⽂本可以发现, index 1~ index4来源于同⼀句句⼦. 它被分割成了4份并且每份都拥有原⽂本的label.

4.最终模型freeze是什么意思

接着, 我们提取出这些⽂本的句⼦表⽰.

本文发布于:2023-07-15 01:37:43，感谢您对本站的认可！

标签：数据模型分类

留言与评论（共有 0 条评论）