论文提出MiniCache,将Program-of-Thought程序转换为带参数的缓存对象,在结构相似请求之间复用计算。缓存命中时由小模型抽取语义变量,并在目标大模型生成期间进行推测式起草,从而减少昂贵调用。摘要称其在购物请求、WebShop、Formula和CodeTAT-QA上最高实现3.1倍延迟降低、2.8倍并行吞吐提升,同时保持任务质量。
最近 24 小时暂无可用热度快照。