软件工程中的氛围转变:评估人工智能主导的对话式编程在性能、认知与负责任采用方面的表现
arXiv cs.AI · · 发布于 2026-09-11 · 4 分钟阅读
本研究评估氛围编程这一新兴的人工智能主导对话式编程范式,开发者可通过与大型语言模型自然语言交互生成软件。研究采用混合方法设计,在传统编程和人工智能辅助编程环境对照下,考察性能效率、认知影响与负责任采用。三十名参与者包括专业开发者和高年级计算机学生,在三种实验条件下完成等价编程任务。定量数据采用描述性统计和重复测量方差分析,定性数据通过主题分析。结果显示,氛围编程显著提升开发效率,任务完成时间比传统编程减少27%,比人工智能辅助编程减少12%。但维护性指标较低、安全漏洞较多,表明软件质量存在权衡。可用性获得良好评分(系统可用性量表得分71.4),认知负荷中等(认知负荷量表得分55.5),反映句法负担降低但语言推理增加。主题分析识别信任校准、控制感丧失、认知适应和提示工程策略等关键构念。值得注意的是,感知控制感丧失与安全风险增加相关,原因是透明度降低以及对人工智能生成输出的验证减少。基于这些发现,研究提出负责任采用的三支柱框架:人类与人工智能能力混合集成、人类监督与透明问责、情境感知部署。总体而言,氛围编程提升生产力,但需要关键监督,强化其作为软件开发中变革性但过渡性范式的角色。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。研究主题
评估 Vibe Coding 这一以人工智能主导的对话式编程范式,即开发者通过自然语言与大型语言模型交互生成软件。
研究设计
采用混合方法设计,从性能效率、认知影响与负责任采用三个维度,与传统编程和 AI 辅助编程环境进行比较。
参与者与任务
共 30 名参与者,包括专业开发者与高年级计算专业学生,在三种实验条件下完成等价的编程任务。
分析方法
定量数据使用描述性统计与重复测量方差分析,定性数据使用主题分析。
效率提升
Vibe Coding 显著提升开发效率,任务完成时间较传统编程减少 27%,较 AI 辅助编程减少 12%。
质量权衡
效率收益伴随更低的可维护性指标与更高的安全漏洞,表明软件质量方面存在权衡。
可用性与认知负荷
可用性获得良好评级(SUS = 71.4),认知负荷保持中等水平(NASA-TLX = 55.5),反映句法性投入减少但语言推理增加。
质性主题
主题分析识别出信任校准、控制感丧失、认知适应与提示工程策略作为关键构念。
风险机制
感知到的控制感丧失与安全风险上升相关,原因是透明度下降以及对 AI 生成输出的验证减少。
负责任采用框架
提出三支柱框架:人机能力的混合集成、人类监督与透明问责、情境感知部署。
总体结论
Vibe Coding 提升生产力,但需要批判性监督,其角色是变革性且处于过渡阶段的软件开发范式。