AI消息速览

用于多仓库库存分配中运筹学公式选择的大语言模型

事件日期 2026-07-28 · 学术前沿 · 已接受

事件日期2026-07-28
信息日期2026-07-28
入库日期2026-07-30
通道学术前沿
状态已接受
来源arXiv 论文

知识卡片:用于多仓库库存分配中运筹学公式选择的大语言模型

一句话结论

本研究提出一种由求解器引导的大语言模型(LLM)框架,用于为多仓库库存分配中的每个实例选择最优的混合整数规划(MIP)公式。在京东的真实数据集上,该方法将Top-1命中率从21.45%提升至50.42%,并将分配精度与事后最优解的差距缩小至4.85个百分点,显著优于固定公式和偏好训练的选择器。

事件概述或研究问题

多仓库库存分配问题通常被建模为混合整数规划(MIP),但不存在一个通用的MIP公式能适用于所有决策实例。需求集中度、库存不平衡、补货规模、服务约束和预测波动等因素导致实例层面的异质性问题,使得任何单一公式都无法在所有场景下持续取得最优性能。本文将这一问题形式化为实例级运筹学(OR)公式选择任务:为每个分配实例从候选专家库中分配一个求解器可执行的公式。

方法/产品要点

  • 框架结构:提出一个由求解器引导的LLM框架用于OR公式选择。每个“OR专家”对应一个MIP公式,编码不同的分配优先级。
  • 训练流程(三阶段)
    1. 监督微调(SFT):构建平衡的专家条件化SFT记录,用于模式学习。
    2. 身份偏好优化(IPO):利用MIP求解器对历史实例的评估,将求解器评估的分配质量差距转化为边际加权的IPO偏好。
    3. 群体相对策略优化(GRPO):根据每个实例的专家得分元数据,为采样响应分配奖励,从而优化选择器。
  • 核心创新:首次将LLM用于OR公式的实例级选择,并通过求解器反馈(Solver Feedback)驱动偏好学习和强化学习。

主要结果或产业意义

  • 性能提升:在京东的多仓库库存分配实例上,GRPO将Top-1命中率(Hit Ratio@1)从21.45%提高到50.42%,Top-2命中率从70.47%提高到82.31%。
  • 分配精度:相对于现有基线,分配精度增益达12.57个百分点。
  • 与最优解差距:与事后最优OR专家相比,差距仅为4.85个百分点,即选择器几乎达到了接近最优的公式选择水平。
  • 产业意义:对京东等大型电商的库存分配决策具有直接价值,表明将LLM与运筹学求解器结合可在复杂供应链优化中取得显著收益。

为什么重要

多仓库库存分配是供应链管理的核心问题,传统做法依赖单一固定公式或人工经验选择公式。本研究证明,通过LLM动态选择公式,可以大幅提升分配质量。更重要的是,这一框架为“LLM作为运筹学建模选择器”开辟了新路径——LLM不必直接求解优化问题,而是识别适合当前实例的专家公式,从而在保持求解器可靠性的同时获得灵活性。

局限与不确定性

  • 材料未明确提及:该方法对跨域迁移(如从京东到其他零售或制造业场景)的泛化能力待核实。
  • 计算成本:GRPO训练涉及求解器评估和偏好生成,计算开销待核实。
  • 问题边界:框架当前仅针对多仓库库存分配这一特定问题,对更一般的OR公式选择问题的适用性待核实。
  • 与既有脉络的关系:本卡片聚焦于利用LLM进行运筹学公式选择,而非测试时模型选择或模型压缩,因此与已有相关卡片中的“重采样还是重路由”“BiSCo-LLM”等内容无直接重合。

可用于图书/PPT/简报的角度

  • 供应链与AI的结合:以京东为例,说明大语言模型如何解决传统运筹学中的“公式选择困境”。
  • 求解器引导的强化学习:作为“LLM + 传统算法”协同框架的典型案例,适合在AI与运筹学交叉领域分享。
  • HR@1翻倍的故事:直观呈现从21%到50%的提升,便于非技术听众理解。

原始材料

  • 英文标题:Large Language Model for Operations Research Formulation Selection in Multi-Warehouse Inventory Allocation
  • 英文关键词:large language model, operations research, formula selection, inventory allocation, mixed-integer programming, GRPO
  • 原始来源:arXiv: 2607.25956v1 (cs.AI, math.OC, 2026-07-28)
    • 作者:Jintao Xu, Yingzheng Ma, Jiong Dong, Yongzhi Qi, Jianshen Zhang
    • URL: https://arxiv.org/abs/2607.25956v1
  • 补充说明:“OR专家”指预定义的MIP公式;实验基于京东的数据。