GigaChat Audio 面向最长 120 分钟的录音问答,引入交错式时间标记与连续音频 token,使模型能够输出带明确时间戳的回答、片段描述和摘要。论文报告了短、长音频基准上的时间定位结果,并通过消融实验分析时间表示、标记频率、token 化和时长混合策略。作者同时发布模型权重与数据集。
最近 24 小时暂无可用热度快照。