如何用BERT做生成任务
解读的文章:《It’s Not Just Size That Matters: Small Language Models Are Also Few-Shot Learners》
| [必须要GPT3吗?不,BERT的MLM模型也能小样本学习 - 科学空间 | Scientific Spaces](https://kexue.fm/archives/7764) |
code: https://github.com/bojone/Pattern-Exploiting-Training
这个模式特别适合用来做量表查询症状,现有量表表述+UGC,以此检索ugc中的对应的量表题项
| [必须要GPT3吗?不,BERT的MLM模型也能小样本学习 - 科学空间 | Scientific Spaces](https://kexue.fm/archives/7764) |
Pattern-Exploiting
读到这里,读者应该不难发现其中的规律了,就是给输入的文本增加一个前缀或者后缀描述,并且Mask掉某些Token,转换为完形填空问题,这样的转换在原论文中称为Pattern,这个转换要尽可能与原来的句子组成一句自然的话,不能过于生硬,因为预训练的MLM模型就是在自然语言上进行的。显然同一个问题可以有很多不同的Pattern,比如情感分类的例子,描述可以放最后,变成“这趟北京之旅我感觉很不错。__满意。”;也可以多加几个字,比如“觉得如何?__满意。这趟北京之旅我感觉很不错。”。
然后,我们需要构建预测Token的候选空间,并且建立Token到实际类别的映射,这在原论文中称为Verbalizer,比如情感分类的例子,我们的候选空间是{很,不},映射关系是很→正面,不→负面,候选空间与实际类别之间不一定是一一映射,比如我们还可以加入“挺”、“太”、“难”字,并且认为{很,挺,太}→正面以及{不,难}→负面,等等。不难理解,不少NLP任务都有可能进行这种转换,但显然这种转换一般只适用于候选空间有限的任务,说白了就是只用来做选择题,常见任务的就是文本分类。
1、对于每种Pattern,单独用训练集Finetune一个MLM模型出来;
2、然后将不同Pattern对应的模型进行集成,得到融合模型;
3、用融合模型预测未标注数据的伪标签;
4、用伪标签数据Finetune一个常规的(非MLM的)模型。
如何更快更有效的训练MLM
| [修改Transformer结构,设计一个更快更好的MLM模型 - 科学空间 | Scientific Spaces](https://kexue.fm/archives/7661) |
qwen门控注意力
(23 封私信 / 8 条消息) NeurIPS 2025 最佳论文奖!一文详解Gated Attention - 知乎