最新要闻
- 成流量变现渠道,“探店”等营销短视频须标明“广告” 全球快报
- 全球短讯!纽约金价26日上涨
- 山西上党181个行政村收入均超10万元 村级集体经济促乡村振兴
- 正在直播 | “ 科技改变生活,创新改变未来”——市委党校陈思教授做客云上文化讲述科技创新的魅力
- 商务部美大司负责人就美方以涉芬太尼问题为由起诉中国企业答记者问_天天观天下
- 盘点一下2015年消失的12大科技产品和服务有哪些?
- 天天快看:浙商银行回应深圳买楼:与配股进度重合纯属巧合
- 世界今头条!常说爱情像钻石一样闪耀,这些钻石知识你知道吗?
- 中国自研视景系统首次试飞成功
- 【全球报资讯】韶关市中考成绩查询2006(韶关市中考成绩查询)
- 【世界时快讯】电池级碳酸锂下跌1500元/吨 报310000元/吨
- 世界即时看!广东省2023年普通高考志愿填报辅助系统网址
- 环球快讯:禅城特色街区解锁端午多样化消费体验
- 3259元!JBL蘑菇型超低景观扬声器已上架 世界关注
- 某些国家妄评香港国安法,中国代表予以坚决驳斥
- 全球新动态:新阿尔巴特五星级公寓酒店_关于新阿尔巴特五星级公寓酒店简介
手机
机器人概念股午后反弹,秦川机床涨停
中国五矿辽宁陈台沟铁矿项目开工 总投资将超百亿_世界讯息
- 机器人概念股午后反弹,秦川机床涨停
- 中国五矿辽宁陈台沟铁矿项目开工 总投资将超百亿_世界讯息
- 冲煞虎日冲猴煞北是什么意思(冲猴煞北是什么意思) 环球微资讯
- 我国首个省级新型电力系统 技术创新中心建设方案获批 世界今日报
- 微软曾考虑收购世嘉_全球简讯
- 俄罗斯将应对原油价格上限的措施延长至2023年底-环球头条
家电
微动态丨贫穷让我预训练
预训练的效果是直接的,需要的资源常常令人望而却步。如果有这样一种预训练方法,它需要算力、数据、人工的资源很少,低到单人单卡原始语料就可以启动。经过无监督的数据处理,完成一次迁移到自己领域的预训练之后,就能获得零样本的NLG、NLG和向量表示推理能力,其他向量表示的召回能力超过BM25,那么你有兴趣尝试吗?
(资料图片)
要不要做一件事,需要衡量投入产出来决定。预训练是大事,需要一些前置条件和资源,也要又充足的预期收益才会实行。通常所需要的条件有:充足的语料库建设,通常来说质量比数量更难得,所以语料库的质量可以放松些,数量一定要管够;其次是具备相应的人才储备和人力预算,相较而言,小模型训练更容易,障碍更少,大模型遇到的问题会多些;最后才是算力资源,根据场景和人才搭配,丰俭由人,最好有一块大内存显卡。预训练带来的收益也很直观,迁移模型能直接带来效果提升,提升幅度跟预训练投入和领域差异直接相关,最终收益由模型提升和业务规模共同增益。
在我们的场景中,数据领域跟通用领域差异极大,甚至需要大幅度更替词表,业务规模也已经足够。如果不预训练的话,也会为每个下游任务专门微调模型。预训练的预期收益是确定的。我们的语料库质量上很烂,但是数量足够。算力资源很有限,配合相应的人才储备可弥补。此时预训练的条件都已经具备。
直接决定我们启动预训练的因素是需要维护的下游模型太多了,特别占用机器和人力资源,需要给每个任务都要准备一大堆数据训练出一个专属模型,模型治理的复杂度急剧增加。所以我们探索预训练,希望能构建统一的预训练任务,让各个下游模型都受益。我们做这件事的时候也不是一蹴而就的,需要维护的模型多也意味着模型经验多,结合之前多个项目经验,包括一些自监督学习、对比学习、多任务学习等模型,经过反复实验迭代融合成形的。
上图是传统的nlp流水线范式,基于已有的通用预训练模型,在可选的迁移预训练完成后,为每个下游任务收集数据集,微调训练,并且需要诸多人工和显卡维护多个下游模型和服务。
下图是我们提出的新范式,在迁移到我们领域继续预训练时候,使用联合语言建模任务和对比学习任务,使得产出模型具备零样本的NLU、NLG、向量表示能力,这些能力是模型化的,可以按需取用。如此需要维护的模型就少了,尤其是在项目启动时候可以直接用于调研,如果有需要再进一步微调,需要的数据量也大大降低。
二、如何预训练这是我们的预训练模型架构,包括Transformer的编码器、解码器和向量表示头。
预训练的目标包括语言建模和对比表示,损失函数为Total Loss = LM Loss + α CL Loss,采用语言建模任务与对比表示任务联合训练,其中α表示权重系数。语言建模采用掩码模型,类似于T5,只解码掩码部分。对比表示任务类似于CLIP,在一个批次内,有一对相关训练正样本,其他未负样本,对于每一条样本对(i,I)中的i,有一个正样本I,其他样本为负样本,使用对称交叉熵损失,迫使正样本的表示相近,负样本的表示相远。采用T5方式解码可以缩短解码长度。一个非线性向量表示头加载编码器上方,一是向量表示场景中要求更快,二是两个所示函数作用远离,防止训练目标冲突。那么问题来了,完形填空的任务很常见,不需要样本,那相似性样本对是怎么来的呢?
当然,作为预训方法,样本对一定是无监督算法挖掘的。通常信息检索领域采用挖掘正样本基本方法是逆完形填空,在一篇文档中挖掘几个片段,假定他们相关。我们这里将文档拆分为句子,然后枚举句子对。我们采用最长公共子串来判定两个句子是否相关。如图取两个正负句对,最长公共子串长到一定程度判定为相似,否则不相似。阈值自取,比如长句子为三个汉字,英文字母要求多一些,短句子可以放松些。
我们采用相关性作为样本对,而不是语义等价性,是因为二者目标是冲突的。如上图所示,猫抓老鼠跟老鼠抓猫,语义相反却相关。我们的场景搜索为主,更加侧重相关性。而且相关性比语义等价性更广泛,语义等价更适合在相关性基础上继续微调。
有些句子筛选多次,有些句子没有被筛选。我们限制句子入选频次上限。对于落选句子,可以复制作为正样本,可以拼接到入选句子中,还可以用逆向完型填空作为正样本。
传统的掩码方式如SpanBert,采用几何分布采样掩码长度,短掩码概率高,长掩码概率低,适用于长句子。但我们的语料是支离破碎的,当面对一二十个字的短句子时,传统倾向掩码两个单字胜过遮蔽一个双字,这不符合我们期望。所以我们改进了这个分布,让他采样最优长度的概率最大,其他长度概率逐次降低,就像一个骆驼的驼峰,成为驼峰几何分布,在我们短句富集的场景中更加健壮。
三、实验效果我们做了对照实验。包括GUR-FULL,用到了语言建模和向量对比表示;UR-LCS的样本对没有经过LCS筛选过滤;UR-CL没有对比表示学习,相当于传统的语言模型;GUR-LM只有向量对比表示学习,没有语言建模学习,相当于为下游任务专门微调;NLPC是百度场内的一个word2vec算子。
实验从一个T5-small开始继续预训练。训练语料包括维基百科、维基文库、CSL和我们的自有语料。我们的自有语料从物料库抓来的,质量很差,质量最佳的部分是物料库的标题。所以在其他文档中挖正样本时是近乎任意文本对筛选,而在我们语料库中是用标题匹配正文的每一个句子。GUR-LCS没有经过LCS选,如果不这样干的话,样本对太烂了,这么做的话,跟GUR-FULL差别就小多了。
我们在几个检索任务中评测模型的向量表示效果。左图是几个模型在召回中的表现,我们发现经过向量表示学习的模型表现都是最好的,胜过BM25。我们还比较了排序目标,这回BM25扳回一局。这表明密集模型的泛化能力强,稀疏模型的确定性强,二者可以互补。实际上在信息检索领域的下游任务中,密集模型和稀疏模型经常搭配使用。
上图是在不同训练样本量的NLU评测任务,每个任务有几十到几百个类别,以ACC得分评估效果。GUR模型还将分类的标签转化为向量,来为每个句子找到最近的标签。上图从左到右依据训练样本量递增分别是零样本、小样本和充足微调评测。右图是经过充足微调之后的模型表现,表明了各个子任务的本身难度,也是零样本和小样本表现的天花板。可见GUR模型可以依靠向量表示就可以在一些分类任务中实现零样本推理。并且GUR模型的小样本能力表现最突出。
这是在NLG的零样本表现。我们在做标题生成和query扩展中,挖掘优质流量的标题,将关键词保留,非关键词随机掩码,经过语言建模训练的模型表现都不错。这种自动prompt效果跟人工构造的目标效果差不多,多样性更广泛,能够满足大批量生产。经过语言建模任务的几个模型表现差不多,上图采用GUR模型样例。
四、结语本文提出了一种新的预训练范式,上述对照实验表明了,联合训练不会造成目标冲突。GUR模型在继续预训练时,可以在保持语言建模能力的基础上,增加向量表示的能力。一次预训练,到处零原样本推理。适合业务部门低成本预训练。
上述链接记载了我们的训练细节,参考文献详见论文引用,代码版本比论文新一点。希望能给AI民主化做一点微小贡献。大小模型有各自应用场景,GUR模型除了直接用于下游任务之外,还可以结合大模型使用。我们在流水线中先用小模型识别再用大模型指令任务,大模型也可以给小模型生产样本,GUR小模型可以给大模型提供向量检索。
论文中的模型为了探索多个实验选用的小模型,实践中若选用更大模型增益明显。我们的探索还很不够,需要有进一步工作,如果有意愿的话可以联系laohur@gmail.com,期待能与大家共同进步。
关键词:
微动态丨贫穷让我预训练
致远电子实控人IPO股改前突然离婚 灿芯股份信息披露“补丁摞补丁”丨上市公司研究院_今日聚焦
机器人概念股午后反弹,秦川机床涨停
中国五矿辽宁陈台沟铁矿项目开工 总投资将超百亿_世界讯息
冲煞虎日冲猴煞北是什么意思(冲猴煞北是什么意思) 环球微资讯
我国首个省级新型电力系统 技术创新中心建设方案获批 世界今日报
微软曾考虑收购世嘉_全球简讯
国内首台12兆瓦海上风电机组完成安装 天天微资讯
当前热点-这家人工智能初创公司希望通过构建脑细胞驱动的计算机成为下一个英伟达
群雄逐鹿,动力电池竞争“白热化”-今日热门
俄罗斯将应对原油价格上限的措施延长至2023年底-环球头条
世界新资讯:三星手机上市时间表
A股下跌的时候,大资金扫货超百亿!
抖音怎么查看抖音公益视频?如何找到抖音的抖音公益视频
打造社区养老新模式!宝山这家综合为老服务分中心试运营-全球热闻
微速讯:局中人|出自意大利青训、仅1米85的赵维伦,是中国男篮的答案吗?
广州发热门诊定点医院名单(WherecomeWind:广州发热患者就诊高峰已过)|当前热议
环球热资讯!巴菲特再度抛售比亚迪 H 股,持股比例从 9.21% 降至 8.98%
逆水寒手游宝石打造全新攻略介绍_当前消息
成流量变现渠道,“探店”等营销短视频须标明“广告” 全球快报
如何判断燃气是否泄漏?发现泄漏怎么办?这些知识要牢记
当前视讯!进游戏公司要有什么技能?
杭州亚运电竞项目参赛名单公示:刀塔2两代LGD混搭 英雄联盟选手全是强队主力 全球聚看点
天天报道:随着英伟达RTX4060Ti系列显卡的发布技嘉也推出了多款新品
瑞典阿特拉斯·科普柯工业压缩机研发制造中国总部项目在无锡开工
【速看料】四川发布山洪灾害蓝色预警,涉及都江堰、彭州、大邑等12个县(市、区)
沙特开始找曼城挖人了,“马球王”即将投奔,还有引爆足坛的引援正在酝酿
世界信息:药易购:公司及全资子公司拟与成都国际铁路港经济技术开发区管理委员会签署《项目投资协议》
全球热头条丨雄安新区助推毕业生顺利就业创业
5月债券市场共发行各类债券54561.6亿元_环球今亮点
天天新消息丨金壮龙:深入实施“科技成果赋智”“质量标准品牌赋值”“数字化赋能”中小企业专项行动
全球短讯!纽约金价26日上涨
天天亮点!云海金属6月27日盘中涨停
【全球速看料】彰显对未来发展信心 博众精工拟不超1亿元回购股份
山西上党181个行政村收入均超10万元 村级集体经济促乡村振兴
当前信息:4宗地15亿起拍!7月放开购房入户,三水土拍开挂!
公告精选丨杭州银行拟定增募资不超过125亿元;昆仑万维回复关注函:股东借款安排让公司资金储备更加丰富|环球新动态
陕西考古发掘魏晋至明清时期墓葬1200余座
今日观点!6小时06分08秒!日本百公里国家纪录告破 距世界纪录仅差33秒
《八角笼中》在京首映,王宝强说要把“金扫帚”还回去-全球实时
淘宝会员id在哪里查看(淘宝会员id在哪里查看)
鸡胸肉怎么做才不会很柴?有什么菜谱推荐?
全球动态:【世界说】美媒:美国枪支暴力失控与其政府对外战争政策息息相关
安徽警方通报男童被打后跳下5楼:肺部挫伤 天天热议
【短讯】科创板晚报|浙海德曼拟定增募资不超过1.73亿元 大普技术、朗视仪器等科创板IPO已问询
胡锡进回应在多家公司任职高管:无聊至极,有一些人心术不正,没从兼职公司获得一分钱收入
北京今日高温卷土重来 最高气温直冲39℃ 近来北方地区为何这么热?|每日看点
童年向,数码宝贝太一这些人的数码宝贝究极体形态排名! 快播报
天天关注:高质量发展看中国|安徽:探索信息便民“新举措”构建高效医疗服务
全球快消息!电报解读|振江股份(603507.SH):西歌事件对公司影响有限
美专栏作家刊文:美国全球地位被国内政治两极化削弱 世界时快讯
河北建设集团牵头联合体中标保定市大水系建设项目 中标额45.75亿元
环球观点:重庆江北国际机场启动国际通程航班业务
环球热推荐:海南今年以来供港澳活猪逾2.8万头 确保优“鲜”通关
环球新消息丨2023粤港澳车展:911 GT3 RS实车首次公众亮相
大丰港铁路支线建设快马加鞭_环球精选
焦点信息:机器人概念股午后反弹 秦川机床涨停
世界微动态丨一夜间缩水逾三成!发生了什么?
花旗银行董事总经理:作为银行需要给新经济业态提供负责的建议_环球最资讯
当前要闻:浦发银行宁波分行因员工行为管理不到位被罚30万
“失”而复得,大湾区迎来大利好!
正在直播 | “ 科技改变生活,创新改变未来”——市委党校陈思教授做客云上文化讲述科技创新的魅力
2023下半年房地产行业展望丨内地:等待更多民企复苏信号;香港:渐趋乐观
5G板块午后大涨 中兴通讯创近3年新高 全球资讯
2020年吉普角斗士启动版在美国上市 世界观速讯
纳斯达克中国金龙指数涨超1% 小鹏汽车涨超4%
全球邮政特快专递单号跟踪查询_全球邮政特快专递单号查询
青岛税务优化涉税服务 激发“专精特新”澎湃活力
天天实时:MMB-AC 3-甲氧基-3-甲基醋酸丁酯商品报价动态(2023-06-27)
碲粒商品报价动态(2023-06-27)
全球观天下!我乐家居(603326)盘中异动 股价振幅达8.36% 上涨7.12%(06-27)
6月27日 14:04分 索菲亚(002572)股价快速拉升
消防救援队伍全力投入汶川“6·27”泥石流失联人员搜救工作 天天日报
商务部美大司负责人就美方以涉芬太尼问题为由起诉中国企业答记者问_天天观天下
盘点一下2015年消失的12大科技产品和服务有哪些?
范玉秀_关于范玉秀的简介_环球信息
【环球热闻】漫·议 | 上市公司官微贺喜“高考状元”缘何惹吐嘈
中国核电:核材料电池尚处在较为前期研究的阶段|环球观察
普渡慈航歌曲_普渡慈航
智微智能:公司没有生产数据中心800GE交换机产品 每日报道
世界即时看!华储网:6月28日中央储备冻牛羊肉投放竞价交易0.45万吨
含有是_非_的成语_带 ldquo 是非 rdquo 的成语有哪些_世界微头条
【速看料】周二(6月27日)午盘:截止11:30纸黄金最高448.099最低446.71
环球快看点丨灵宝市属于哪个市哪个省(灵宝市属于哪个市)
剧名:古惑仔之少年激斗篇_新古惑仔之少年激斗篇的演员简介介绍
天天快资讯丨党的什么是管党治党的重要依据_是管党治党的总规矩
商家用燃气马虎不得,衡阳开展泄漏应急演练培训安全知识|全球快资讯
世界热门:苹果为什么听筒没声音免提有声音_苹果手机听筒没有声音免提有声音
天天快看:浙商银行回应深圳买楼:与配股进度重合纯属巧合
要闻速递:生活用水人均用水量标准_生活用水人均用水量
湘行散记思维导图初中_湘行散记思维导图 天天速读
威漫是啥意思_威漫
鴂舌_关于鴂舌简述_快播
建设草原网围栏 如何护绿又增收(美丽中国) 每日热门
指法游戏钢琴 指法游戏
d3drm.dll放在哪里_d3drm dll_当前关注
头条焦点:当心
【全球速看料】福岛核排污最新进展:排污海底隧道已经基本完工
徐小明:120分钟 焦点要闻
世界焦点!助力中国制造走出国门