LongStraw 是面向百万级上下文强化学习后训练的架构感知执行栈,基于 GRPO 在固定 GPU 预算下复用无梯度共享前缀、仅保留模型特定状态,并逐一重放短响应分支。8 张 H20 可处理 Qwen3.6-27B 的 210 万位置,32 张 H20 验证 GLM-5.2 的端到端执行路径,但训练正确性仍未完整证明。
最近 24 小时暂无可用热度快照。