Round and Round We Go! What makes Rotary Positional Encodings useful?
理解 RoPE 的高低频
理解 RoPE 的高低频
LLM Representational Collapse
TTA, Test-Time Augmentation
Adam 预训练的 1-bit SGD 优化方法
CPT, 类似 CosineAnnealingWarmRestarts 的 Precision 循环机制
GaLore, 低秩空间中的梯度投影以及权重更新
MicroAdam, 通过梯度稀疏化以及 error compensation 实现轻量的优化器
Q-GaLore, 对 GaLore 进一步施加低精度量化
SWALP, 通过 SWA 稳定低精度训练
快手, 广告场景下的 Scaling Laws