守门人与幻觉:大语言模型驱动量子电路生成的分层评估框架

随着大语言模型(LLM)融入量子模拟工作流(IDE辅助编码、笔记本助手、智能体流水线),评估必须超越功能正确性,在结构化故障通过昂贵流水线传播之前提前发现并拦截。该团队提出了一种面向材料启发的变分量子本征求解器(VQE)电路生成的分层评估框架:(i)涵盖七项物理与框架标准的门控筛选准则;(ii)电路保真度分析,将模型输出与H2/STO-3G/约旦-Wigner/UCCSD的分析解及参考实现值进行对比,包含ansatz分类与门组成分解;(iii)设计熵——一种运行间行为一致性度量。该研究揭示出五种不同的大语言模型故障模式(几何幻觉、使用不存在的API、运行时集成失败、约束违反以及看似合理但无法验证的输出),每种故障模式具有不同的可检测性特征,且本质上归属于任务结构而非特定模型。对评估平台自身源代码的取证审计进一步表明,两次明显的模型故障源自测试框架中静默回退模板替换,这证明评估基础设施应与所测试的模型处于同一信任边界内。将该框架应用于基于Materials Project集成流水线的多个基础模型后,结果表明门控式验证对于可靠部署是必要而非可选的。

作者单位: VIP可见
页数/图表: 登录可见
提交arXiv: 2026-06-16 19:17

量科快讯