编码中的自我对话:评论的哪些特性有助于代码生成?
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
大语言模型在编写代码时经常生成自然语言评论,这些评论会成为后续代码生成所用上下文的一部分。但评论的哪些属性影响代码生成性能仍不明确。研究通过观察性分析和受控干预探讨该问题。在LiveCodeBench上,评论频率和宽泛的评论意图都无法可靠预测pass@1。随后用更强源模型撰写的评论块预填较弱的接收模型,从而将评论的表面形式与其传达的解法内容分离。来自通过测试的源解法的评论平均使接收模型pass@1提升17.2%;描述失败解法的评论没有可靠增益;针对不同问题撰写的评论使pass@1下降20.8%。最后,在多种模型和提示变体下,多数接收模型无法显著恢复外部评论带来的增益,最佳情况仅恢复24%。结果表明,评论有助于代码生成,不仅因为它们是评论,更因为它们能提供提示无法可靠引出的正确解法内容。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究问题
论文关注大语言模型写代码时生成的注释,追问注释的哪些属性会影响后续代码生成表现。
观察性分析
在 LiveCodeBench 上,注释频率与宽泛的注释意图都不能可靠预测 pass@1。
受控干预设计
研究者把较强源模型写出的注释块预填给较弱的接收模型,从而把注释的表面形式与其传递的解法内容分开考察。
通过测试的注释带来提升
来自通过测试的源解法的注释,使接收模型 pass@1 平均提高 17.2%。
失败解法注释无增益
描述失败解法的注释没有提供可靠增益。
不同问题的注释造成下降
为不同问题写出的注释使 pass@1 降低 20.8%。
接收模型难以自行恢复增益
在多种模型与提示变体中,多数接收模型没有显著恢复外部注释带来的增益,最佳情况仅恢复 24%。
核心结论
注释帮助代码生成,不是仅因为它们形式上是注释,而是因为它们能提供提示无法可靠引出的正确解法内容。
SOURCES
共 1 个来源来源与引用
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息https://arxiv.org/abs/2609.09242