精品国产YW在线观看,人妻熟女一二三区夜夜爱,好色视频下载

開(kāi)局一道面試題。

面試官：大模型微調(diào)如何組織訓(xùn)練樣本？

你：大模型訓(xùn)練一問(wèn)一答，一指令一輸出，問(wèn)題和指令可以作為prompt輸入，答案作為輸出，計(jì)算loss的部分要屏蔽掉pad token。

面試官：多輪對(duì)話如何組織訓(xùn)練樣本呢？

你：假設(shè)多輪為Q1A1/Q2A2/Q3A3，那么可以轉(zhuǎn)化成 Q1—>A1, Q1A1Q2->A2, Q1A1Q2A2Q3->A3三條訓(xùn)練樣本。

面試官：這樣的話一個(gè)session變成了三條數(shù)據(jù)，并且上文有依次重復(fù)的情況，這樣會(huì)不會(huì)有啥問(wèn)題？

你：數(shù)據(jù)中大部分都是pad token，訓(xùn)練數(shù)據(jù)利用效率低下。另外會(huì)有數(shù)據(jù)重復(fù)膨脹的問(wèn)題，訓(xùn)練數(shù)據(jù)重復(fù)膨脹為 session數(shù)量*平均輪次數(shù)，且上文有重復(fù)部分，訓(xùn)練效率也會(huì)低下。

面試官：你也意識(shí)到了，有什么改進(jìn)的方法嗎？

你：有沒(méi)有辦法能一次性構(gòu)造一個(gè)session作為訓(xùn)練樣本呢？（思索）

面試官：提示你下，限制在decoder-only系列的模型上，利用模型特性，改進(jìn)樣本組織形式。

對(duì)于這個(gè)問(wèn)題，我們思考下decoder-only模型有啥特點(diǎn)，第一點(diǎn)很關(guān)鍵的是其attention形式是casual的，casual簡(jiǎn)單理解就是三角陣，單個(gè)token只能看到其上文的信息。

如圖所示：

其二是postion_id是只有token次序含義而無(wú)需特定指代信息，（區(qū)別于GLM模型需要postion_id來(lái)標(biāo)識(shí)生成span的位置等特殊的要求）。

有了這兩點(diǎn)我們就可以設(shè)想，如果構(gòu)造多輪對(duì)話樣本的input為 Q1 A1 Q2 A2 Q3 A3 ，在計(jì)算loss的時(shí)候，只需要計(jì)算 A1 A2 和 A3 部分，豈不是就可以進(jìn)行session級(jí)別的訓(xùn)練了？

嗯為什么原來(lái)的chatglm不能用這種形式呢，雖然prefix attention可以推廣為適應(yīng)多輪訓(xùn)練的prefix attention形式，如圖：

但是由于其postition id 無(wú)法簡(jiǎn)單按次序推廣，故不能高效訓(xùn)練，這也是chatglm初代的很大的一個(gè)問(wèn)題，導(dǎo)致后續(xù)微調(diào)的效果都比較一般。

現(xiàn)在chatglm2的代碼針對(duì)這兩個(gè)問(wèn)題已經(jīng)進(jìn)行了改善，可以認(rèn)為他就是典型的decoder-only模型了，具體表現(xiàn)為推斷時(shí)候attention 是casual attention的形式，position id也退化為token次序增長(zhǎng)。

那么好了，萬(wàn)事具備，只欠東風(fēng)。我們據(jù)此實(shí)現(xiàn)了chatglm2-6b的代碼微調(diào)。其核心代碼邏輯為處理樣本組織的邏輯，其他的就是大模型微調(diào)，大同小異了。

conversation=''
input_ids = []
labels = []
eos_id = tokenizer.eos_token_id
turn_idx = 0
for sentence in examples[prompt_column][i]:
    sentence_from = sentence["from"].lower()
    sentence_value = '[Round {}]

問(wèn)：'.format(turn_idx) + sentence["value"] + '

答：' if sentence_from == 'human' else sentence["value"]+'

'
    conversation += sentence_value
    sentence_ids = tokenizer.encode(sentence_value, add_special_tokens=False)  
    label = copy.deepcopy(sentence_ids) if sentence_from != 'human' else [-100] * len(sentence_ids)               
    input_ids += sentence_ids 
    labels += label
    if sentence_from != 'human':
        input_ids += [eos_id]
        labels += [eos_id]
        turn_idx += 1
input_ids=tokenizer.encode('')+input_ids#addgmaskbos
labels =  [-100] * 2 + labels# #add padding
pad_len = max_seq_length - len(input_ids)
input_ids = input_ids + [eos_id] * pad_len 
labels = labels + [-100] * pad_len

其中有幾個(gè)關(guān)鍵的地方，就是在開(kāi)頭要加上 bos和gmask，遵循模型原來(lái)的邏輯。問(wèn)答提示詞和輪次prompt，還有兩個(gè) 保持和原模型保持一致，最后屏蔽掉pad部分的loss計(jì)算。

實(shí)測(cè)訓(xùn)練效果如下：

同樣的數(shù)據(jù)在chatglm1上 train loss只能降到2.x左右，同時(shí)評(píng)估測(cè)試集結(jié)果，在同樣的數(shù)據(jù)上rouge等指標(biāo)都有不小的提升。

我們?cè)僮屑?xì)回顧下，對(duì)話session級(jí)別訓(xùn)練和拆開(kāi)訓(xùn)練從原理上有啥區(qū)別？

1.session級(jí)別訓(xùn)練，效果之一為等價(jià)batchsize變大（1個(gè)batch可以塞下更多樣本），且同一通對(duì)話產(chǎn)生的樣本在一個(gè)bs內(nèi)。

2. session級(jí)別的不同輪次產(chǎn)生的梯度是求平均的，拆開(kāi)輪次構(gòu)造訓(xùn)練是求和的，這樣除了等價(jià)于lr會(huì)變大，還會(huì)影響不同輪次token權(quán)重的分配，另外還會(huì)影響n(yōu)orm的計(jì)算。

我們用一個(gè)簡(jiǎn)化地例子定量分析下，我們假設(shè)兩條訓(xùn)練樣本分為 1.問(wèn)：A 答：xx 2.問(wèn): A答：xx 問(wèn): B答：xx問(wèn): C答：xx 則session級(jí)別訓(xùn)練影響梯度為 (Ga+(Ga +Gb + Gc)/3)/2。對(duì) A，B，C影響的權(quán)重分別為，2/3 1/6 1/6。拆開(kāi)訓(xùn)練為(Ga+Ga+ (Ga+Gb)/2+(Ga+Gb+ Gc)/3)/4。對(duì) A，B，C影響的權(quán)重分別為，17/24 5/24 1/12。從上面的權(quán)重分布來(lái)看，session級(jí)別靠后的輪次影響權(quán)重要比拆開(kāi)更大。這也是更合理的，因?yàn)榇蟛糠謭?chǎng)景下，開(kāi)場(chǎng)白都是趨同和重復(fù)的。 一點(diǎn)小福利，以上面試題對(duì)應(yīng)的ChatGLM2-6B微調(diào)完整的代碼地址為： https://github.com/SpongebBob/Finetune-ChatGLM2-6B

實(shí)現(xiàn)了對(duì)于 ChatGLM2-6B 模型的全參數(shù)微調(diào)，主要改進(jìn)點(diǎn)在多輪對(duì)話的交互組織方面，使用了更高效的session級(jí)別高效訓(xùn)練，訓(xùn)練效果相比原版ChatGLM-6B有較大提升。

這可能是目前全網(wǎng)效果最好的ChatGLM2-6B全參數(shù)微調(diào)代碼。

聲明：本文內(nèi)容及配圖由入駐作者撰寫(xiě)或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人，不代表電子發(fā)燒友網(wǎng)立場(chǎng)。文章及其配圖僅供工程師學(xué)習(xí)之用，如有內(nèi)容侵權(quán)或者其他違規(guī)問(wèn)題，請(qǐng)聯(lián)系本站處理。舉報(bào)投訴

數(shù)據(jù)

數(shù)據(jù)

+關(guān)注

關(guān)注
8

文章
7030

瀏覽量
89038
代碼

代碼

+關(guān)注

關(guān)注
30

文章
4788

瀏覽量
68616
大模型

大模型

+關(guān)注

關(guān)注
2

文章
2450

瀏覽量
2714

原文標(biāo)題：大模型微調(diào)樣本構(gòu)造的trick

文章出處：【微信號(hào)：zenRRan，微信公眾號(hào)：深度學(xué)習(xí)自然語(yǔ)言處理】歡迎添加關(guān)注！文章轉(zhuǎn)載請(qǐng)注明出處。

評(píng)論

相關(guān)推薦

《具身智能機(jī)器人系統(tǒng)》第7-9章閱讀心得之具身智能機(jī)器人與大模型

的應(yīng)用。MAML算法通過(guò)二階優(yōu)化找到對(duì)任務(wù)變化敏感的模型參數(shù)，實(shí)現(xiàn)了快速適應(yīng)。上下文學(xué)習(xí)則引入了注意力機(jī)制，使模型能夠根據(jù)當(dāng)前場(chǎng)景動(dòng)態(tài)調(diào)整行為策略。在預(yù)訓(xùn)練-微調(diào)范式中，我們要注意任務(wù)表示的重要性：好的表示

發(fā)表于 12-24 15:03

【書(shū)籍評(píng)測(cè)活動(dòng)NO.52】基于大模型的RAG應(yīng)用開(kāi)發(fā)與優(yōu)化

一個(gè)在線的自助產(chǎn)品咨詢(xún)工具，允許客戶(hù)使用自然語(yǔ)言進(jìn)行交互式的產(chǎn)品問(wèn)答，比如“請(qǐng)介紹一下您公司這款產(chǎn)品與××產(chǎn)品的不同之處”。為了讓客戶(hù)有更好的體驗(yàn)，你決定使用大模型來(lái)構(gòu)造這樣的咨詢(xún)功能并將其嵌入公司

發(fā)表于 12-04 10:50

一種信息引導(dǎo)的量化后LLM微調(diào)新算法IR-QLoRA

大模型應(yīng)用開(kāi)卷，連一向保守的蘋(píng)果，都已釋放出發(fā)展端側(cè)大模型的信號(hào)。問(wèn)題是，大語(yǔ)言模型（LLM）卓越的表現(xiàn)取決于“力大磚飛”，如何在資源有限的環(huán)境中部署大模型并保障性能，仍然頗具挑戰(zhàn)。

發(fā)表于 11-19 17:16 ?310次閱讀

一種信息引導(dǎo)的量化后LLM<b class='flag-5'>微調(diào)</b>新算法IR-QLoRA

大語(yǔ)言模型如何開(kāi)發(fā)

大語(yǔ)言模型的開(kāi)發(fā)是一個(gè)復(fù)雜且細(xì)致的過(guò)程，涵蓋了數(shù)據(jù)準(zhǔn)備、模型架構(gòu)設(shè)計(jì)、訓(xùn)練、微調(diào)和部署等多個(gè)階段。以下是對(duì)大語(yǔ)言模型開(kāi)發(fā)步驟的介紹，由AI部落小編整理發(fā)布。

發(fā)表于 11-04 10:14 ?144次閱讀

示波器探頭補(bǔ)償微調(diào)旋鈕的作用

示波器探頭補(bǔ)償微調(diào)旋鈕是一種用于調(diào)整示波器探頭性能的重要組件。一、示波器探頭補(bǔ)償微調(diào)旋鈕的作用校準(zhǔn)探頭性能示波器探頭補(bǔ)償微調(diào)旋鈕的主要作用是校準(zhǔn)探頭的性能。由于探頭在生產(chǎn)過(guò)程中可能存在一定

發(fā)表于 08-09 11:31 ?684次閱讀

大模型為什么要微調(diào)？大模型微調(diào)的原理

難以達(dá)到最佳性能。為了提升模型在特定任務(wù)上的表現(xiàn)，微調(diào)（Fine-tuning）成為了一個(gè)關(guān)鍵步驟。本文將詳細(xì)探討大模型為什么要進(jìn)行微調(diào)以及微調(diào)

發(fā)表于 07-10 10:43 ?4114次閱讀

【大語(yǔ)言模型：原理與工程實(shí)踐】大語(yǔ)言模型的應(yīng)用

類(lèi)任務(wù)上表現(xiàn)出色，甚至在零樣本條件下也能取得良好效果。另一類(lèi)則需要逐步推理才能完成的任務(wù)，類(lèi)似于人類(lèi)的系統(tǒng)2，如數(shù)字推理等。然而，隨著參數(shù)量的增加，大語(yǔ)言模型在這類(lèi)任務(wù)上并未出現(xiàn)質(zhì)的飛躍，除非有精心

發(fā)表于 05-07 17:21

【大語(yǔ)言模型：原理與工程實(shí)踐】核心技術(shù)綜述

其預(yù)訓(xùn)練和微調(diào)，直到模型的部署和性能評(píng)估。以下是對(duì)這些技術(shù)的綜述：模型架構(gòu): LLMs通常采用深層的神經(jīng)網(wǎng)絡(luò)架構(gòu)，最常見(jiàn)的是Transformer網(wǎng)絡(luò)，它包含多個(gè)自注意力層，能夠捕捉輸入數(shù)據(jù)中

發(fā)表于 05-05 10:56

基于雙級(jí)優(yōu)化（BLO）的消除過(guò)擬合的微調(diào)方法

這篇論文試圖解決的問(wèn)題是大型預(yù)訓(xùn)練模型在下游任務(wù)中進(jìn)行微調(diào)時(shí)出現(xiàn)的過(guò)擬合問(wèn)題。盡管低秩適應(yīng)（LoRA）及其變體通過(guò)學(xué)習(xí)低秩增量矩陣有效地減少了與完全微調(diào)方法相比的可訓(xùn)練參數(shù)數(shù)量。

發(fā)表于 04-02 16:46 ?695次閱讀

大模型微調(diào)開(kāi)源項(xiàng)目全流程

對(duì)于所有“基座”（Base）模型，–template 參數(shù)可以是 default, alpaca, vicuna 等任意值。但“對(duì)話”（Chat）模型請(qǐng)務(wù)必使用對(duì)應(yīng)的模板。

發(fā)表于 03-13 14:56 ?883次閱讀

大模型Reward Model的trick應(yīng)用技巧

借助對(duì)比學(xué)習(xí)和元學(xué)習(xí)的方法。增加對(duì)比學(xué)習(xí)的loss，對(duì)比學(xué)習(xí)通過(guò)增強(qiáng)模型區(qū)分能力，來(lái)增強(qiáng)RM的對(duì)好壞的區(qū)分水平。元學(xué)習(xí)則使獎(jiǎng)勵(lì)模型能夠維持區(qū)分分布外樣本的細(xì)微差異，這種方法可以用于迭代式的RLHF優(yōu)化。

發(fā)表于 01-25 09:31 ?1026次閱讀

2023年LLM大模型研究進(jìn)展

作為做LLM應(yīng)用的副產(chǎn)品，我們提出了RLCD[11]，通過(guò)同時(shí)使用正例和負(fù)例prompt，自動(dòng)生成帶標(biāo)簽的生成樣本不需人工標(biāo)注，然后可以接大模型微調(diào)，或者用于訓(xùn)練reward models

發(fā)表于 01-19 13:55 ?484次閱讀

教您如何精調(diào)出自己的領(lǐng)域大模型

BERT和 GPT-3 等語(yǔ)言模型針對(duì)語(yǔ)言任務(wù)進(jìn)行了預(yù)訓(xùn)練。微調(diào)使它們適應(yīng)特定領(lǐng)域，如營(yíng)銷(xiāo)、醫(yī)療保健、金融。在本指南中，您將了解 LLM 架構(gòu)、微調(diào)過(guò)程以及如何為 NLP 任務(wù)微調(diào)自己

發(fā)表于 01-19 10:25 ?1151次閱讀

商湯科技與庫(kù)醇科技達(dá)成合作為垂域大模型構(gòu)建高質(zhì)量大規(guī)模的領(lǐng)域微調(diào)數(shù)據(jù)

數(shù)字化轉(zhuǎn)型，為垂域大模型構(gòu)建高質(zhì)量大規(guī)模的領(lǐng)域微調(diào)數(shù)據(jù)。 ? 本次合作將基于商湯通用大模型進(jìn)行二次開(kāi)發(fā)，給模型注入領(lǐng)域知識(shí)，訓(xùn)練一個(gè)專(zhuān)門(mén)根據(jù)葡萄酒愛(ài)好者問(wèn)題生成關(guān)鍵詞的大

發(fā)表于 01-10 09:46 ?712次閱讀

四種微調(diào)大模型的方法介紹

全微調(diào)（Full Fine-tuning）：全微調(diào)是指對(duì)整個(gè)預(yù)訓(xùn)練模型進(jìn)行微調(diào)，包括所有的模型參數(shù)。在這種方法中，預(yù)訓(xùn)練

發(fā)表于 01-03 10:57 ?2.4w次閱讀