NLP-模型总结

 

如何用BERT做生成任务

解读的文章:《It’s Not Just Size That Matters: Small Language Models Are Also Few-Shot Learners》

[必须要GPT3吗?不,BERT的MLM模型也能小样本学习 - 科学空间 Scientific Spaces](https://kexue.fm/archives/7764)

code: https://github.com/bojone/Pattern-Exploiting-Training

这个模式特别适合用来做量表查询症状,现有量表表述+UGC,以此检索ugc中的对应的量表题项

[必须要GPT3吗?不,BERT的MLM模型也能小样本学习 - 科学空间 Scientific Spaces](https://kexue.fm/archives/7764)

Pattern-Exploiting

读到这里,读者应该不难发现其中的规律了,就是给输入的文本增加一个前缀或者后缀描述,并且Mask掉某些Token,转换为完形填空问题,这样的转换在原论文中称为Pattern,这个转换要尽可能与原来的句子组成一句自然的话,不能过于生硬,因为预训练的MLM模型就是在自然语言上进行的。显然同一个问题可以有很多不同的Pattern,比如情感分类的例子,描述可以放最后,变成“这趟北京之旅我感觉很不错。__满意。”;也可以多加几个字,比如“觉得如何?__满意。这趟北京之旅我感觉很不错。”。

然后,我们需要构建预测Token的候选空间,并且建立Token到实际类别的映射,这在原论文中称为Verbalizer,比如情感分类的例子,我们的候选空间是{很,不},映射关系是很→正面,不→负面,候选空间与实际类别之间不一定是一一映射,比如我们还可以加入“挺”、“太”、“难”字,并且认为{很,挺,太}→正面以及{不,难}→负面,等等。不难理解,不少NLP任务都有可能进行这种转换,但显然这种转换一般只适用于候选空间有限的任务,说白了就是只用来做选择题,常见任务的就是文本分类。

1、对于每种Pattern,单独用训练集Finetune一个MLM模型出来;

2、然后将不同Pattern对应的模型进行集成,得到融合模型;

3、用融合模型预测未标注数据的伪标签;

4、用伪标签数据Finetune一个常规的(非MLM的)模型。

如何更快更有效的训练MLM

[修改Transformer结构,设计一个更快更好的MLM模型 - 科学空间 Scientific Spaces](https://kexue.fm/archives/7661)

qwen门控注意力

(23 封私信 / 8 条消息) NeurIPS 2025 最佳论文奖!一文详解Gated Attention - 知乎