HAVE FUN! THANKS

585  0

Qwen3 Embedding

Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models Embedding 使用[EOS]对应的hidden state作为embedding 使用改进的InfoNCE Loss进行训练 分子S = query 和 正例的余弦相似度 分母Z = S + query和难负样本的余弦相似度+batch内正例与其它query的余弦相似度+batch内query与其它文档的余弦相似度 温度系数 防止假负例:相似度>S+0.1 大规模合成数据的弱监督训练 任务类型:检索(Retrieval)、双语对齐(Bitext mining)、语意相似度(STS, semantic textual similarity)、分类(classification) 查询重写:角色库top5的角色放入提示词中,提示词涵盖查询类型、查询长度、难度、语言等 1.5亿对进行预训练,1200万高质量进行SFT 重写Prompt Given a **Character**, **Passage**, and **Requirement**, generate a query from the **Character**’s perspective that satisfies the **Requirement** and can be used to retrieve the **Passage**. Please return the result in JSON format. Here is an example: <example> Now, generate the **output** based on the **Character**, **Passage** and language, the **Character** and **Requirement** will be in English. **Requirement** from user, the **Passage** will be in...

907  0

Kimi K2

MuonClip Muon 抛弃 Adam 的二阶矩,用全局 RMS 缩放替代,以牺牲少量稳定性换翻倍的令牌效率和更低的计算开销。 MuonClip 解决 Muon 规模化训练时的Attention Logits 爆炸问题(注意力层的Q K权重Wq​ Wk快速增长,导致 Q・K^T 的点积失控式增大),适配万亿参数 MoE 模型的规模化训练。 前向传播:旧权重 Wq/Wk → 计算 Q/K → logits → loss 反向传播:计算所有参数(含 Wq/Wk)的梯度 Muon 梯度更新:用梯度更新所有参数(得到新的 Wq/Wk) (额外步骤)QK-Clip 修正:a. 用之前得到的每个注意力头的 最大Logits(Smax^h)b. 若 Smax^h > τ,逐头缩放 Wq/Wk(原文中阈值 τ=100) Pre Training 知识数据重写:通过精心设计的提示词,引导大型语言模型在保持事实准确性的前提下,以多种风格和视角重述原始文本,增强语言多样性 数学数据重写:参考 SwallowMath 的方法,将高质量数学文档重述为 “学习笔记” 风格;同时,将其他语言的高质量数学材料翻译为英文,增加数据多样性 MoE稀疏度缩放定律 稀疏度(Sparsity)= 激活专家数 / 总专家数​ 在激活参数总量固定的前提下增大稀疏度增加总专家数,同时保持激活专家数不变,可以持续降低train和valid的损失,提升模型性能。 稀疏度 激活专家vs总专家数量 计算量倍数 8 8 64 1.69 16 8 128 1.35 32 8 256 1.15 48 8 384 1 64 8 512 近似大于1 Attention Head 数量 Deepseek-V3 将注意力头数设置为模型层数的两倍(128个) 文章中进行了验证。序列长度为 128k 时,将注意力首脑数量从 64 增加到 128,同时将专家总数固定在 384,推理 FLOP 数量增加 83%,验证损失改善 0.5% – 1.2% Post Training...

843  0

GRPO:Deepseek-V3.2

GRPO KL散度的近似估算方式 在 R1 的 GRPO 中,KL 散度直接通过采样数据计算: 这种方法在 (当前策略采样某动作的概率远低于参考策略)时,会导致梯度权重无界放大,引入大量噪声,破坏训练稳定性。 V3.2 采用修正 K3 估算器,通过重要性采样比率修正 KL 散度的计算,公式为: 其中 是重要性采样权重,用于修正采样分布与目标分布的偏差。 增加Off-Policy掩码 为解决大规模强化学习训练中 Off-Policy问题而设计的核心优化手段,本质是过滤掉训练中 “有害且不可靠” (负优势、高分歧)的样本,只保留有效学习信号,从而大幅提升 GRPO 算法的训练稳定性。 Off-Policy:用旧策略πold​ 采样的数据,训练新策略πθ​(数据和策略 “不同步”)。 MOE优化 记录推理时专家路由,训练强制复用,确保梯度更新目标一致 Deepseek-3.2 基于蒸馏数据训练的模型性能仅略低于领域专用专家模型,且通过后续的强化学习训练,这一性能差距可有效消除 DSA稀疏注意力机制

937  0

2025主流LLM对比表

模型名称 发布时间 参数量 (total / active) Trans BlockNum TokenEmbed Dim TransHidden Size MoE Hidden Size Vocab Size 位置编码 注意力机制 头数(Q/KV) 归一化策略 MoE(Total / Share + Active) 上下文长度 关键创新点 DeepSeek V3/R1 2024.122025.01 671B/37B 61 7168 7168 2048 129k RoPE MLA 128/- Pre-RMSNorm 256/1+8 128k MLA压缩KV;前3层稠密 OLMo 2 2025.01 7B/13B/32B(稠密) 324064 409651206144 110081331227648 – 100k RoPE+YaRN MHA/GQA 32/32;40/8 Post-RMSNorm+QK-Norm – Post-Norm稳训练;全透明 Gemma 3 2025.03 1B/4B/12B/27B(稠密) 16243662 1024204830725376 409681921228821504 – 256k RoPE GQA+SWA 32/16(27B) Pre+Post-RMSNorm+QK-Norm – 滑动窗口5:1;平衡性能 Gemma 3n 2025.06 4B(优化) 24 2048 8192 – 256k RoPE GQA+SWA 32/16 同Gemma 3 – – 层嵌入按需加载;移动端适配 Mistral Small 3.1 2025.03 24B(稠密) 40 5120 32768 –...

806  0

GRPO: DeepSeek-R1

在推理能力方面,OpenAI 的 o1 系列模型(OpenAI, 2024b)率先通过延长思维链(Chain-of-Thought)推理过程的长度实现推理时扩展,在数学、编程、科学推理等多种推理任务中取得了显著进步。 大规模强化学习(RL)可以显著提升推理能力,即使不使用监督微调(SFT)作为冷启动。此外,我们发现少量高质量冷启动数据能进一步提高性能。 aha moment(顿悟时刻):DeepSeek-R1-Zero 随着训练推进,模型不仅提升了性能,还逐渐表现出自身的推理习惯:输出的推理链越发长、出现反思(reflection)、自我验证等行为 迭代训练是推理模型更优的发展路径 将更强大的模型蒸馏到小型模型中能产生优异的结果,而小型模型若依赖本文所述的大规模强化学习,不仅需要巨大的计算资源,其性能甚至可能不及蒸馏模型 尽管蒸馏策略既经济又高效,但要突破智能的边界,可能仍需要更强大的基础模型和更大规模的强化学习。 GRPO GRPO(Group Relative Policy Optimization)的核心是通过 “组内相对评估” 简化强化学习训练,无需独立评论者模型,同时保证优化稳定性。 无需独立评论者模型:通过组内奖励相对比较计算优势值,节省训练成本。 抗噪声能力强:依赖组内相对评估,抵消单个样本的奖励误差。 稳定可控:通过裁剪操作和 KL 正则项,避免模型出现 “奖励黑客” 或训练震荡。 一、训练准备:定义目标与基础组件 1. 确定核心目标:优化策略模型,让模型在推理任务中生成更优输出(如正确解题思路),目标是最大化 GRPO 的优化目标函数。 2. 设定基础参数与模型: 基础模型:采用待优化的策略模型(如 DeepSeek-V3-Base),初始参数为(旧策略)。 超参数:设置裁剪系数(通常取 0.2)、KL 正则系数、每组输出样本数G。 3. 设计奖励系统:采用规则化奖励(如准确性奖励 + 格式奖励),为每个输出分配奖励值,用于后续优势值计算。 二、样本采样:生成组内对比数据 对每个推理问题q(从问题分布中采样),执行以下操作: 从旧策略中采样G个输出,形成输出组(如同一数学题的G种解题思路)。 为每个输出计算对应的奖励(如解题正确得高分,错误得低分)。 三、关键计算:优势值与目标函数 1. 计算优势值:通过组内奖励的相对差异标准化计算,消除不同问题的奖励尺度偏差: 2. 计算KL散度正则项:限制新策略与参考策略(通常为旧策略)的差异,避免训练震荡: 3. 构建优化目标函数:结合概率比值、优势值、裁剪操作和KL正则项,形成最终优化目标: 四、模型更新:迭代优化策略 梯度上升更新:通过最大化目标函数,计算梯度并更新模型参数,核心逻辑是 “鼓励新模型更偏好组内优势值高的输出”。 裁剪约束:通过函数将新 / 旧策略的概率比值限制在,防止参数更新幅度过大导致训练不稳定。 迭代迭代:将更新后的参数作为新的,重复 “采样→计算→更新” 流程,直至模型在推理基准上收敛(如 AIME 2024 的 pass@1 分数稳定)。 Deepseek-R1训练流程 DeepSeek-R1 是基于多阶段训练流程构建的推理模型,既解决了 DeepSeek-R1-Zero 可读性差、语言混合的问题,又通过迭代优化实现了与 OpenAI-o1-1217 相当的推理性能。 一、阶段 1:冷启动(Cold Start) 核心目标 避免从基础模型直接启动强化学习(RL)时的早期不稳定性,为模型注入 “符合人类阅读习惯的推理范式”,生成 RL 训练所需的初始智能体(Actor)。 数据收集与设计 收集数千条高质量长思维链(CoT)数据: 少样本提示生成的详细推理示例 模型生成的含反思 / 验证的答案 DeepSeek-R1-Zero 中格式易读的输出 人工标注后处理的优化结果 设计 “易读化格式”: 统一输出结构为 |特殊标记|<推理过程>|特殊标记|<总结>,要求每个响应末尾包含结论总结 过滤语言混合、无格式的内容,确保可读性。 模型微调 以 DeepSeek-V3-Base 为基础模型,使用上述冷启动数据进行微调,得到 “具备基础推理范式、格式规范”...

845  0

KTO 训练流程总结

在 7B 参数规模以下,对齐相较于单纯的 SFT 几乎没有增益 DPO 的默认学习率为 5e-7,但我们发现 KTO 使用 5e-6 作为默认学习率效果更佳 一、 数据预处理与超参数初始化 数据格式转换 若原始数据为偏好对 ( 优于 ),则标记  为合意样本、 为不合意样本;若为原生二元反馈,直接按标签划分两类样本。 处理数据不平衡:设合意样本数为 、不合意样本数为 ,调整权重超参数 (合意权重)、(不合意权重),满足: 示例:若 ,设 ,则 。 模型与超参数配置 确定参考模型 :可为有监督微调(SFT)模型或预训练模型;待优化模型  初始化与  一致。 设置核心超参数: 风险厌恶系数 :大型模型 / 已 SFT 用 ;小型模型 / 无 SFT 用  学习率:推荐 (搭配 AdamW 优化器) 微批次大小:(推荐 ,需满足参考点估计的样本量要求) 二、 单步训练核心计算流程 对每个训练微批次执行以下步骤,迭代至模型收敛: 步骤 1:计算隐含奖励  对批次内每个样本 ,计算当前模型相对于参考模型的概率比对数,即隐含奖励: 合意样本期望 (当前模型生成概率高于参考模型) 不合意样本期望 (当前模型生成概率低于参考模型) 步骤 2:估计参考点  参考点用于衡量全局 “基准奖励”,控制损失函数饱和,采用不匹配对有偏估计: 对批次内 m 个样本,构造不匹配对  ) 计算不匹配对的隐含奖励均值,截断为非负值: 简化场景:若 SFT 数据是 KTO 数据的子集,可直接设 ,无需额外计算。 步骤 3:计算人类感知价值函数  基于前景理论的逻辑函数(避免指数函数数值不稳定),分样本类型计算价值: 其中 Sigmoid 函数 ,确保价值在收益区呈凹形、损失区呈凸形,契合人类决策偏差。 风险厌恶 / 寻求程度由 β 控制;β 越大,收益区域的风险厌恶程度越高,损失区域的风险寻求程度也越高。在实际应用中,对于已进行 SFT 的大型模型,β 在 [0.01, 0.10] 范围内的较小值效果更佳;对于未进行前期 SFT、直接进行 KTO 训练的小型模型,β 在 [0.10, 1.00] 范围内的较大值效果更佳。 步骤 4:计算 KTO 损失函数  损失目标是最大化价值函数,形式为批次样本的期望均值: 其中  对应样本类型的权重(合意取 ,不合意取 ),保证损失非负。 步骤 5:模型参数更新 对损失函数关于模型参数  求梯度( 不参与反向传播,避免训练不稳定),梯度公式为: 其中  为符号因子:合意样本取 -1,不合意样本取 +1;z 为价值函数内的自变量(合意样本为 ,不合意样本为 )。用梯度下降算法(如 AdamW)更新参数 ,完成单步训练。 三、 训练收尾与调优 收敛判断:通过验证集的生成质量评估(如 GPT-4 胜率、任务指标)判断模型是否收敛,避免过拟合。 简化训练:大参数量预训练模型(如 Llama-3 8B)可跳过 SFT...

961  0

DPO(直接偏好优化)训练流程总结

DPO 的核心是跳过显式奖励模型训练和强化学习采样,直接用 “输入 x + 偏好回复 yₙ+ 非偏好回复 yₗ” 的三元组数据,通过简单的分类损失函数优化模型,让模型对齐人类偏好,全程无需模型凭空生成新回复。 一、准备 1. 偏好数据集构建 核心数据格式:每个样本是三元组 (x, yₙ, yₗ) 数据来源:人类标注者对模型初始生成的回复进行 pairwise 偏好判断(二选一),无需标注绝对分数。 x:用户输入提示(如 “我弄坏了朋友的东西,该怎么说?”) yₙ(chosen):人类偏好的优质回复(如 “主动道歉,问问能不能赔偿”) yₗ(rejected):人类不偏好的劣质回复(如 “假装不知道,别理他”) 2. 参考模型(π_ref)初始化 参考模型是 “能力基准”,用于限制训练中模型的偏离程度,避免能力退化: 优先选择:已训练好的监督微调模型(SFT 模型),即通过高质量单轮回复微调后的基础模型; 备选方案:若无 SFT 模型,可在偏好数据集的 (x, yₙ) 对上做简单监督微调,得到仅学习优质回复的模型作为 π_ref。参考模型的参数在 DPO 训练中固定不变,仅用于计算约束项。 3. 目标模型(π_θ)初始化 目标模型是待优化的模型,初始参数直接复用参考模型 π_ref 的参数,避免从零训练导致的效率低下和稳定性问题。 二、训练 第一步:数据预处理 —— 拼接序列并转 token 将三元组数据转换为模型可处理的输入格式: 对每个样本,分别拼接两个完整序列: 优质序列:x + yₙ(如 “我弄坏了朋友的东西,该怎么说?+ 主动道歉,问问能不能赔偿”) 劣质序列:x + yₗ(如 “我弄坏了朋友的东西,该怎么说?+ 假装不知道,别理他”) 通过模型的 tokenizer 将两个序列转为 token ID(chosen_input_ids、rejected_input_ids),并生成对应的注意力掩码(attention_mask),标记有效 token 位置。 第二步:计算对数概率 —— 评估现成回复的 “得分” DPO 无需生成新回复,仅计算模型对已有 yₙ 和 yₗ 的生成概率(对数形式,记为 logps),步骤如下: 分别将 chosen_input_ids 和 rejected_input_ids 输入目标模型 π_θ,得到模型输出的 logits(未归一化的预测分数); 提取回复部分(yₙ 或 yₗ 对应的 token 位置,跳过输入 x 的 token)的 logits,通过 log_softmax 转换为对数概率; 按 yₙ/yₗ 的真实 token 序列,提取每个位置的对数概率并求和,得到整个回复的对数概率: 优质回复对数概率:chosen_logps = sum(log P_θ(yₙ_token | x, yₙ_prev_tokens)) 劣质回复对数概率:rejected_logps = sum(log P_θ(yₗ_token | x, yₗ_prev_tokens)) 同时,用参考模型 π_ref 对相同的两个序列做同样计算,得到 ref_chosen_logps(π_ref 对 yₙ 的对数概率)和 ref_rejected_logps(π_ref 对 yₗ 的对数概率)。 第三步:计算 DPO 损失函数 —— 约束偏好与偏离度...

955  0

PPO(近端策略优化)训练流程总结

PPO 训练核心是“采样-计算-多轮裁剪优化”的循环,以“旧策略采样、新策略裁剪更新”为核心逻辑,兼顾稳定性、样本效率和实现简洁性,完整流程如下: 一、前置初始化 网络构建:搭建 Actor-Critic 双分支网络 Actor(策略网络):输入状态 (s),输出动作概率分布(离散动作输出类别 logits,连续动作输出高斯分布均值+标准差),用于生成动作。 Critic(价值网络):输入状态 (s),输出状态价值 (V(s))(预测该状态的长期期望奖励),用于计算优势值。 可选共享底层特征层(如 MLP/CNN),减少参数冗余。 超参数设置: 折扣因子 (\gamma = 0.99)、GAE 参数 (\lambda = 0.95)、裁剪系数 (\epsilon = 0.2) 多轮优化次数 (K = 10)、单智能体采样步数 (T = 2048)、并行智能体数 (N = 8) 小批量大小 (batch_size = 64)、优化器(Adam,学习率 (lr = 3e-4)) 环境与参数初始化:创建训练环境(如 CartPole/MuJoCo),初始化网络参数 (\theta)。 二、核心迭代循环(每轮 = 1 次策略更新) 循环执行至策略收敛(奖励达标/迭代上限),每轮包含 4 关键步骤: 步骤 1:并行采样数据(用旧策略收集样本) 启动 N 个并行智能体,每个智能体基于当前旧策略(未更新的网络参数)与环境交互 (T) 步。 每步记录核心数据:状态 、动作 、即时奖励 、旧策略动作对数概率 、下一状态 、是否结束 (回合结束为 True)。 最终收集 条样本(如 条),保证数据多样性。 步骤 2:计算优势值 与目标价值 核心是用 GAE(广义优势估计)给每个动作“打分”,修正价值网络预测: 用 Critic 网络预测所有采样状态的价值: 、 计算时序差分误差 : 从后往前倒推计算 GAE 优势值 (平衡偏差与方差): 标准化优势值(提升优化稳定性): 计算目标价值 (用于训练 Critic 网络): 步骤 3:保存旧策略与数据格式化 保存当前网络参数 为 ,作为后续计算“新旧策略概率比”的锚点,避免策略突变。 将所有样本()转换为张量,按小批量大小分组,生成数据加载器。 步骤 4:多轮小批量裁剪优化(核心!) 重复...

1,039  0

[略读] RouteLLM

https://arxiv.org/pdf/2406.18665 Abstract 大型语言模型(LLM)在广泛任务上表现出色,但选择合适的模型往往需要在性能与成本之间权衡。强大的模型效果更好却更昂贵,小型模型更具成本优势但能力较弱。为解决这一权衡,我们提出一种训练框架,用于学习高效的“路由器”模型,在推理过程中动态选择更强或更弱的 LLM。我们的框架利用人类偏好数据,并采用数据增强技术来提升性能。在公共基准上的评估表明,该方法在不牺牲响应质量的前提下可将成本降低超过 2 倍。此外,我们的路由器具有很强的泛化能力,即使在路由至未参与训练的 LLM 之间也能保持性能。这凸显了该框架在提供高性价比且高性能的 LLM 解决方案方面的潜力。 Metric 在本节中,我们定义用于刻画 LLM 路由问题中成本与性能权衡的评估指标。我们首先给出分别评估路由器模型 MRα 在两种模型(Ms ∈ Mstrong 与 Mw ∈ Mweak)之间路由时的成本效率与性能的指标,然后引入在实验评估中使用的两个复合指标。 通过计算路由至强模型的调用比例来衡量 MRα 的成本效率:c(MRα) = (1 / |Q|) ∑{q∈Q} I{Rα(q) = Mstrong}因为强模型 Mstrong 的调用成本显著高于弱模型 Mweak。 通过计算平均响应质量来衡量性能:r(MRα) = (1 / |Q|) ∑{q∈Q} s(MRα(q))其中 s(MRα(q)) 表示单条响应的质量分数,例如在带金标的数据集(如 MMLU)上的正确率,或数值打分(如 1-5 或 1-10),数值越高表示质量越好。类似地,可分别定义强模型与弱模型的 r(Ms) 与 r(Mw)。 由于路由器模型的性能位于弱模型与强模型之间,我们将其性能相对于两者之间的差距进行量化。 性能差距回收率(PGR):PGR(MRα) = [ r(MRα) − r(Mw) ] / [ r(Ms) − r(Mw) ] 该指标刻画了路由器模型从弱模型到强模型之间的性能差距中,能够“回收”多少。 单独使用上述任一指标都不足以刻画路由中的质量—成本权衡。例如,一个总是把所有请求发送到强模型的“平凡”路由器可以达到完美的 PGR = 1,但没有任何成本节约。为解决这一问题,我们通过改变阈值 α,为路由器 MRα 计算“调用—性能”曲线。 平均性能差距回收率(APGR):APGR(MRα) = ∫₀¹ PGR(MRα) d(c(MRα))作为在不同成本约束下路由器回收性能差距能力的总体度量 调用—性能阈值(CPT):在给定期望的路由器性能(即达到 x% 的 PGR)时,CPT(x%) 表示为达到该目标 PGR 所需调用强模型的最小比例。 Method 相似度加权(SW)排序:采用 Bradley–Terry(BT)模型,给定用户查询 q,我们计算它与训练集中每个查询 q′ 的余弦相似度,并按该数据集中 q′ 的最大余弦相似度进行缩放 矩阵分解:借鉴推荐系统中的矩阵分解模型,我们将该方法用于从偏好数据中学习。目标是发现隐藏评分函数 δ : M × Q...

1,373  0

DeepSeek-V3

Abstract MoE 671B -> 37B Multi-head Latent Attention auxiliary-loss-free strategy a multi-token prediction training objective Pre-Training Context Extension Post-Training Architecture Multi-head Latent Attention (MLA) 已有工作如何减小注意力机制的缓存 LLM模型多采用多头注意力机制,传统推理时,每次都需要计算t次q、k、v(t表示第t个token),但不难发现,q只需计算当前token即可,前t-1个token的k和v都是重复计算,所以我们可以将k和v缓存起来,大大减少计算量。传统的KV cache通过缓存key、value,从而不必每次重新计算,提高推理速度。但是在推理过程中,随着序列长度的不断增加,KV cache会越来越大,访问的开销也越来越大,已然成为了目前限制推理速度的瓶颈。目前解决方法:MQA、GQA MHA:为每个注意力头都存一组k、v,内存开销:2✖️nd✖️ntoken✖️dh✖️l,不存在精度损失MQA:所有注意力头共享一组k、v,内存开销:2✖️ntoken✖️dh✖️l,精度损失较大GQA:对注意力头进行分组,每组共享一组k、v,内存开销:2✖️ng✖️ntoken✖️dh✖️l,这是MHA和MQA的折中方案,精度损失也介于MHA和GQA之间 Input Hidden Demension=7168 number of attention heads = 128, head dimension = 128 KV compression dimension 𝑑𝑐 = 512, and the query compression dimension 𝑑′𝑐 = 1536 per-head dimension 𝑑𝑅ℎ = 64 基本思路:不直接存储k、v,而是将其低维压缩后再进行存储,使用时,再将其映射回原始k、v维度,类似于对KV cache做LoRA。 Q1:缓存Latent Ckv 而不是KV,虽然减小了缓存尺寸,但在每次计算时候,需要重复计算KV,增加了计算量? 推理访存密集,对kv缓存的优化能带来很大收益;计算这边attention量还好 Q2:Q和K经过RoPE后,已经包含了语意+位置信息,为什么还需要与自身concatenate? K的RoPE是从Input Hidden计算的,由于Kc是压缩后的潜在语意空间,如果走RoPE会破坏潜在的表达,因此最终方案使用在Kc后面拼接位置信息。 Q是从Latent中提取的,如果直接过RoPE,可能会破坏潜在表达? 其他尝试的解法   MLA之所以能保持跟GQA一样大小的KV cache,其关键一步是将合并为一个(跟位置无关的)矩阵作为q的投影矩阵,但如果加了RoPE的话,这一步就无法实现了。这是因为RoPE是一个跟位置相关的的分块对角矩阵,满足,MLA加入RoPE之后会让中间多插入了一项:这里的就无法合并为一个固定的投影矩阵了(跟位置差t-i相关),从而MLA的想法无法结合RoPE实现。 一个naive的解决思路是:在重算后再添加RoPE,但这样访存效率会很低,因为普通MHA只是简单读取KV Cache就已经达到瓶颈,现在还需要读取投影并加上RoPE其他解决方案:放弃RoPE,换用其他基于Attention Bias的位置编码,如ALIBI–>效果明显不如RoPE将的输入也改为,然后将RoPE加在之后,即:不过此时的RoPE不再是通过绝对位置实现相对位置,而单纯是加在q、k上的绝对位置信息,让模型自己想办法提炼相对位置信息。(简单理解:后,得不到) RoPE https://arxiv.org/abs/2104.09864 提出了对Transformer中Multi-Head Attention改造,增加相对位置信息 DeepSeekMoE DeepSeekMoE改造FFN层,使用1个共享专家和256选9个路由专家,每个专家的hidden dimension = 2048。 auxiliary-loss-free strategy Router 选择 Top-k时,每个专家有一个b的偏置分数。b在每个step后更新,通过计算经过每个专家的token数量,将其减去均值,乘以𝛾,得到需要更新的值。 Complementary Sequence-Wise Auxiliary Loss 一个损失函数,促进专家在句子粒度上的平衡。 Multi-Token Prediction (MTP) https://openreview.net/forum?id=pEWAcejiU2...