NewsFi.AI
返回今日
已核验来源

AgenticGen:奖励引导的智能体广告视频生成

arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读

NewsFi 导读3 分钟速览

广告视频生成不只是视频合成任务,也是以产品为条件、以在线业务指标衡量成功的推理问题。现有视频基础模型能依据多模态条件生成逼真片段,却未优化如何将产品转化为有效广告,也未利用在线业务反馈改进后续生成。为此,作者提出奖励引导的智能体框架 AgenticGen,将广告视频生成拆解为策略选择与草稿生成两个可训练推理阶段,使在线业务反馈能够监督优化目标。该框架从积累的在线反馈中学习基于表现的奖励,并结合与人类质量标准一致的评分表奖励,共同监督策略优化:先以直接偏好优化使策略贴近在线偏好,再用组相对策略优化结合过程与结果奖励细化两个阶段。离线实验验证了奖励模型与逐步策略优化。在 TikTok 广告系统的在线对照实验中,经过上述两阶段优化的 AgenticGen 相比监督微调基线,点击率提升 2.72%,转化率提升 2.63%,Advv 提升 9.61%。

当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。
1

任务被重新定义

论文把广告视频生成界定为以产品为条件的推理问题,而不仅是视频合成任务,其成功由线上业务指标衡量。

2

现有视频基础模型的缺口

近期视频基础模型能由多模态条件生成逼真片段,但不优化产品如何被转化为有效广告,也不优化如何依据线上业务反馈改进未来生成。

3

AgenticGen 框架

论文提出 AgenticGen,一个奖励引导的智能体框架,将广告视频生成分解为策略选择与草稿生成两个可训练的推理阶段,从而暴露出线上业务反馈可以监督的优化目标。

4

双奖励设计

AgenticGen 从累积的线上反馈中学习基于表现的奖励,并引入与之互补、与人类质量标准对齐的评分准则奖励,两者共同用于监督策略优化。

5

两阶段策略优化

训练先用 DPO 把智能体策略推向线上偏好,再用 GRPO 以过程奖励和结果奖励进一步精炼策略选择与草稿生成两个阶段。

6

离线实验结论

离线实验验证了奖励模型的有效性以及逐次进行的策略优化效果。

7

线上 A/B 结果

在 TikTok 广告系统中的线上 A/B 实验显示,经过 DPO 与 GRPO 的 AgenticGen 相比 SFT 基线,CTR 提升 2.72%,CVR 提升 2.63%,Advv 提升 9.61%。

8

闭环思路

整条技术路线意在闭合“生成—上线反馈—再优化”的循环,使广告视频生成持续朝线上业务指标改进。

SOURCES

来源与引用

共 1 个来源
官方原文arXiv cs.AI 原始发布2026-09-11 · 一手信息
https://arxiv.org/abs/2609.09187