Meta近期发布了一篇名为《Metacognitive Reuse: Turning Recurring LLM Reasoning Into Concise Behaviors》的论文,提出了一种新的推理机制,旨在让大型语言模型(LLM)在推理过程中“记住”常用的思维步骤,从而提高效率。
该机制被称为“行为复用”(Metacognitive Reuse),模型在每次推理后总结出常用的推理步骤,并将其存储为简短的指令,称为“行为”。在面对类似问题时,模型可以直接调用这些“行为”,而无需重复推理过程。实验结果显示,在数学推理任务中,采用这一机制后,模型在准确率不下降的前提下,推理所需的token数量最多减少46%。这使得模型在推理时更加高效,类似于人类在解决问题时依赖经验和套路。
Meta将这一机制称为“行为手册”(Behavior Handbook),并通过三种模式进行验证:行为调节推理、行为引导自我改进和行为调节监督微调。实验结果表明,采用这一机制后,模型的推理效率显著提高,性能保持稳定。这一研究为大型语言模型的推理效率提升提供了新的思路。
原文:36kr
等于把推理过程也Context Caching?
向人类学习