快速工程

s1lv3r

版主

s1lv3r Rep
0
0
0
Rep
0
s1lv3r Vouches
Vouches
0
8 MONTHS
8 8 MONTHS OF SERVICE
s1lv3r 获得
0
0
0
获得
0
s1lv3r 凭证
0
0
0
凭证
0
主题
22
点赞
0
HakB
8
在社区成长 8 月
LEVEL 90 100 XP
 
提示工程,也称为上下文提示,是指如何与LLM 通信以引导其行为以获得所需结果而不更新模型权重的方法。这是一门经验科学,不同模型的即时工程方法的效果可能差异很大,因此需要大量的实验和启发式方法。
这篇文章只关注自回归语言模型的即时工程,所以没有涉及完形填空测试、图像生成或多模态模型。即时工程的核心目标是对齐和模型可操纵性。查看我之前关于可控文本生成的文章。
[我个人的辣味] 在我看来,一些快速的工程论文不值得八页长,因为这些技巧可以用一句话或几句话来解释,剩下的都是关于基准测试的。一个易于使用和共享的基准基础设施应该对社区更有利。迭代提示或外部工具的使用并不容易设置。协调整个研究界采用它也很重要。

基本提示#​

零样本和少样本学习是两种最基本的模型提示方法,由许多LLM 论文首创,通常用于LLM 性能基准测试。

零射击#​

零样本学习就是简单地将任务文本输入模型并询问结果。
(所有情感分析示例均来自SST-2)
Text: 我敢打赌视频游戏比电影有趣得多。
情绪:

少量镜头#​

小样本学习提供了一组关于目标任务的高质量演示,每个演示都包含输入和所需输出。当模型首先看到好的例子时,它可以更好地理解人类的意图和所需答案的标准。因此,少样本学习通常会比零样本学习带来更好的性能。然而,它的代价是消耗更多的令牌,并且当输入和输出文本很长时可能会达到上下文长度限制。
Text:(劳伦斯弹跳)在舞台上跳舞、奔跑、流汗、擦脸,总体上展示了最初为他带来名声的古怪天赋。
情绪: 积极
Text: 尽管有所有相反的证据,这部烂片还是成功地伪装成一部真正的故事片,这种电影需要全额入场费,并在电视上大肆宣传,旨在取悦小孩子和表面上的成年人。
情绪: 负面
德尼罗多年来第一次深入情感,也许是因为他被联合主演的强大作品所感动。
情绪: 积极
Text: 我敢打赌视频游戏比电影有趣得多。
情绪:
许多研究探讨了如何构建上下文示例以最大限度地提高性能,并观察到提示格式、训练示例和示例顺序的选择可能会导致性能显着不同,从接近随机猜测到接近SoTA。
赵等人。 (2021) 研究了少样本分类的情况,并提出LLM 的几个偏差(他们在实验中使用GPT-3)导致了如此高的方差: (1) 如果示例之间的标签分布不平衡,则存在多数标签偏差; (2)新近度偏差(Recency Bias)是指模型最后可能重复标签的倾向; (3) 常见代币偏差表明LLM 倾向于比稀有代币更频繁地产生常见代币。为了克服这种偏差,他们提出了一种方法来校准模型输出的标签概率,使其在输入字符串为N/A 时保持一致。

示例选择提示#​

在嵌入空间中使用$k$-NN 聚类选择语义上与测试示例相似的示例(Liu et al. 2021)
为了选择一组多样化且有代表性的示例,Su 等人。 (2022) 提出使用基于图的方法: (1) 首先,基于样本之间的嵌入(例如通过SBERT 或其他嵌入模型)余弦相似度构建有向图$G=(V, E)$,其中每个节点指向其$k$ 最近邻居; (2) 从一组选定的样本$\mathcal{L}=\emptyset$ 和一组剩余样本$\mathcal{U}$ 开始。每个样本$u \in \mathcal{U}$ 均由$$ 评分
\text{score}(u)=\sum_{v \in \{v \mid (u, v) \in E, v\in \mathcal{U}\}} s(v)\quad\text{其中}s(v)=\rho^{- \vert \{\ell \in \mathcal{L} \vert (v, \ell)\in E \}\vert},\quad\rho 1
$$ 这样,如果选择了许多$v$ 的邻居,$s(v)$ 就会很低,因此评分鼓励选择不同的样本。
鲁宾等人。 (2022) 提出通过特定于一个训练数据集的对比学习来训练嵌入,以进行上下文学习样本选择。给定每个训练对$(x, y)$,一个示例$e_i$(格式化输入输出对)的质量可以通过LM: $\text{score}(e_i)=P_\text{LM}(y \mid e_i, x)$ 分配的条件概率来测量。我们可以将具有top-$k$ 和Bottom-$k$ 分数的其他示例识别为每个训练对的正候选集和负候选集,并将其用于对比学习。
一些研究人员尝试使用Q-Learning 来进行样本选择。 (张等人,2022)
受基于不确定性的主动学习的推动,Diao 等人。 (2023)建议识别多个抽样试验中具有高度分歧或熵的例子。然后对这些示例进行注释,以便在少数提示中使用。

示例订购提示#​

一般建议是保持示例选择多样化、与测试样本相关并按随机顺序排列,以避免多数标签偏差和新近度偏差。
增加模型大小或包含更多训练示例并不会减少上下文示例的不同排列之间的差异。相同的顺序可能对一种型号有效,但对另一种型号则效果不佳。当验证集有限时,请考虑选择顺序,以使模型不会产生极其不平衡的预测或对其预测过于自信。 (Lu 等人,2022)

指令提示#​

在提示中呈现少量示例的目的是解释我们对模型的意图;换句话说,以演示的形式向模型描述任务指令。然而,few-shot 在令牌使用方面可能会很昂贵,并且由于上下文长度有限而限制了输入长度。那么,为什么不直接给出指示呢?
指令型LM(例如InstructGPT、自然指令)使用高质量元组(任务指令、输入、地面实况输出)对预训练模型进行微调,使LM 更好地理解用户意图并遵循指令。 RLHF(人类反馈强化学习)是一种常见的方法。指令跟随风格微调的好处是使模型更加符合人类意图,并大大降低了沟通成本。
在与教学模型交互时,我们应该详细描述任务要求,力求具体和精确,避免说“不做某事”,而是明确要做什么。
请标出对给定电影评论的电影的看法。情绪标签应该是“积极”或“消极”。
Text: 我敢打赌视频游戏比电影有趣得多。
情绪:
解释目标受众是另一种明智的指示方式
例如为孩子们制作教育材料,
向6 岁的孩子描述什么是量子物理学。
和安全的内容,
.使用工作安全的语言。
上下文指令学习(Ye et al. 2023)将小样本学习与指令提示结合起来。它在提示中合并了跨不同任务的多个演示示例,每个演示都包含指令、任务输入和输出。请注意,他们的实验仅针对任务,并且指令提示包含所有分类标签选项。
定义: 确定对话的说话者,“代理”或“客户”。
输入: 我已经成功订票了。
输出:个代理
定义: 确定问题要求的类别:“数量”或“位置”。
输入: 美国最古老的建筑是什么?
输出: 位置
定义: 对给定电影评论的情绪进行分类,“正面”或“负面”。
Input: 我敢打赌视频游戏比电影有趣得多。
输出:

自洽抽样#​

自一致性采样(Wang et al. 2022a)是对温度为0 的多个输出进行采样,然后从这些候选中选择最好的一个。
选择最佳候选人的标准可能因任务而异。一般的解决方案是选择多数票。对于易于验证的任务,例如带有单元测试的编程问题,我们可以简单地运行解释器并通过单元测试验证正确性。

思想链 (CoT)#​

思维链(CoT)提示(Wei et al. 2022)生成一系列短句来逐步描述推理逻辑,称为推理链或基本原理,最终得出最终答案。对于使用大型模型(例如具有超过50B 个参数)的复杂推理任务,CoT 的优势更为明显。简单的任务只能从CoT 提示中获得轻微的好处。

CoT 提示的类型#​

CoT 提示的两种主要类型:
少镜头CoT。它是通过一些演示来提示模型,每个演示都包含手动编写(或模型生成)的高质量推理链。
(所有数学推理示例均来自GSM8k)
Question: 汤姆和伊丽莎白有一场爬山比赛。伊丽莎白爬山需要30 分钟。汤姆爬上山所需的时间是伊丽莎白的四倍。汤姆爬上山需要多少小时?
答案: 汤姆爬山需要30*4=30*4=120120 分钟。
汤姆需要120/60=&
 
顶部