SpecFirst 将行为规范提取作为独立阶段前置到代码合成之前,在 ProgramBench 基准上将测试通过率提升 6.9%–21.3%,证明了“需求工程先行”范式对于从零开始的程序构建的有效性。
LLM 智能体在已有代码库的软件工程任务中表现出色,但从头构建程序仍极具挑战。ProgramBench 基准显示,面对仅含自然语言文档和可执行二进制的行为 oracle,即使前沿模型解决率也低于 1%。现有框架将文档阅读、行为探索和代码合成混为单次循环,导致探索不足、行为意图漂移、早期误解被传播。研究问题:能否借鉴经典需求工程,将行为规范提取作为独立的一等…