Hacker NewsAnon84
用 998 美元训练一个 3.8B 参数的大模型
原标题:Training a 3.8B LLM to 0.384 CORE for $998
模型78
个人开发者将预训练的算力成本压缩至千元以内。通过精心设计的训练配比与数据筛选,一个 3.8B 规模的模型在 998 美元的预算下跑出了 0.384 的 CORE 基准分。大模型的训练门槛正在从企业级机房悄悄退守到独立开发者的信用卡账单里。
为什么值得读
它给出了百元至千元级独立预训练的具体账单与工程基准,让小规模模型探索从昂贵的理论走向了可复现的个人实践。
标签
LLMPretrainingOpenSourceComputeEfficiencySmallModelsMachineLearning