主页

如何应对数据不均衡问题?

前言 自杀风险筛查数据 数据增强 通过数据增强的方式构造更多的少数样本,使得正负样本均衡 回译: 将以下内容翻译成英文,然后再翻译回中文进行数据增强: title:【心理科普】青少年有自残、自伤行为怎么办?这7步有助于正确应对 comment:笑死,第一次发现我自伤的是老师,父母不带管的 1 ✅ 对比分析:原始 vs 增强版         标题 “自残、自伤行为” “出现自残行为”...

阅读更多

小红书考虑数据分布的视频观看时长预测-best paper

文章来源 文章来源:Multi-Granularity Distribution Modeling for Video Watch Time Prediction via Exponential-Gaussian Mixture Network CODE:https://github.com/BestActionNow/EGMN Introduction Motivation why to predict watch time of videos? Short-video platforms such as TikTok and KuaiShou have experienced a significant surge in popularity over recent y...

阅读更多

Positive-Unlabeled Learing

好的,这是一个关于 Positive-Unlabeled Learning(正类-无标记学习,简称 PU Learning) 的详细解释。 核心定义 Positive-Unlabeled Learning (PU Learning) 是一种特殊的半监督机器学习范式。在传统的分类问题中,我们通常拥有明确标记的正样本和负样本。但在 PU Learning 的场景下,我们的训练数据只包含两部分: 正样本 (P): 一组被明确标记为“正类”的样本。 无标记样本 (U): 一组未标记的样本,其中既包含隐藏的正样本,也包含负样本。 关键点:无标记样本集 不是负样本集,而是一个正样本和负样本的混合体,只是我们不知道每个样本的具体身份。 问题背景与挑战 为什么会出现这种情况...

阅读更多

同辈支持的力量-两个半小时的唠嗑

今天是2025年10月13日,距离读博的报道第一天已经过去了591天,好消息是好兄弟gap一年半之后顺利上岸,师姐也顺利拿到了青基,师弟的数据也收的差不多了。 时间回到昨天,由于音乐节的海风过于自由,回到南京之后成功感冒,整个人昏昏沉沉的,睡到三点才爬起来准备换到工位接着躺尸,终于走到了九曲桥,看到对面一个家伙骑车迎面过来,似乎有点眼熟,噢,原来是上次吃饭的一个家伙。就认真的打了下招呼,以为打完招呼就会走掉,没想到他直接说 你咋看起来状态这么差,就这样开始唠了起来。他就搁哪骑在共享自行车上,我后背靠着桥的玻璃护栏,心想反正头痛干不了活,那就悠闲的开始唠嗑好了。 开始聊到了工作状态,作为好心人的我开始分享我的每日5小时工作制,以及训练专注度的方法。渐渐话题就打开了,就聊到了家庭关系,...

阅读更多

NLP-ERNIE2.0

文章来源 文章来源: [1907.12412] ERNIE 2.0: A Continual Pre-training Framework for Language Understanding CODE:https://github.com/PaddlePaddle/ERNIE Introduction Motivation Generally the pre-training of models often train the model based on the co-occurrence of words and sentences. While in fact, there are other lexical, syntactic and semantic infor...

阅读更多

NLP-ERNIE2.0

文章来源 文章来源: [1907.12412] ERNIE 2.0: A Continual Pre-training Framework for Language Understanding CODE:https://github.com/PaddlePaddle/ERNIE Introduction Motivation Generally the pre-training of models often train the model based on the co-occurrence of words and sentences. While in fact, there are other lexical, syntactic and semantic infor...

阅读更多

NLP-模型总结

文章来源 BERT系列 RoBERTa ALBERT SpanBERT ERNIE 1.0 2.0 3.0 DistillBERT XLNet ELECTRA 模型榜单 GLUE Benchmark 总结 换到具体场景下 如何构造不同难度的样本?并进一步渐进式学习?

阅读更多