Era by Eon 基准:为企业大语言模型智能体构建具精确真值的生成式企业环境
arXiv cs.AI · · 发布于 2026-09-11 · 3 分钟阅读
该研究提出 Era by Eon 基准,用于评估使用企业工具的大语言模型智能体。由于无法在客户生产数据上评测,且现有替代方案缺乏真值,该基准围绕一家完整虚构公司构建,包含产品模拟器、公司专属内部数据库、基准问题与计算得出的答案键。行业、公司规模、商业模式、应用组合与随机种子共同定义每家公司;单一带种子的实体图向 Salesforce、Zendesk、Slack、Gong 等产品模拟器提供共享数据,问题条件生成器则据此生成内部数据库的模式与记录,从而保证整体企业环境一致。所有预期答案由最终记录计算得出,因此评分精确。设计与答案键检查用于验证内部数据库,真实感评分卡与对抗性检测器用于验证实体图。在 23 家生成公司中,平均真实感得分从 61.8 升至 97.0,无记录被标记为合成数据。在模拟器赛道的对比中,9 个模型对同样 33 道题各作答三次,准确率估计介于 42.4% 至 76.8%,36 组两两差异中仅 3 组在校正后仍获支持。
当前来源仅提供摘要,以下要点基于摘要生成;可通过官方原文查看完整信息。问题背景
面向企业记录系统的 LLM 智能体无法在客户生产数据上评估,而现有替代方案均不提供真值。
基准名称与定位
论文提出 Era by Eon Benchmark,用于评估使用企业工具的 LLM 智能体。
核心构成
基准围绕一家完整虚构公司构建,包含产品模拟器、公司专属内部数据库、基准问题以及计算得出的答案键。
公司定义方式
行业、公司规模、商业模式、应用组合与一个随机种子共同定义每家公司。
共享实体图
一个带种子的实体图为 Salesforce、Zendesk、Slack、Gong 等产品的模拟器提供共享公司数据。
内部数据库生成
以问题为条件的生成器创建内部数据库的模式与记录,先从同一实体图取用共享实体、键与值,再生成数据库专属事实。
一致性设计
上述两种机制共同描述同一个一致的企业整体,避免模拟器与内部数据库之间出现矛盾。
精确评分
每个预期答案均由最终记录计算得出,因此评分是精确的,而非依赖人工判断。
双重校验机制
设计校验与答案键校验用于验证内部数据库;真实性评分卡与对抗检测器用于验证实体图。
真实性提升数据
在 23 家生成公司中,平均真实性得分从 61.8 提升至 97.0,且没有任何记录被标记为合成。
模拟器赛道对比
在报告的模拟器赛道对比中,九个模型对同一组 33 个问题各回答三次,准确率估计范围为 42.4% 至 76.8%。
统计显著性结果
36 个两两差异经过校正后,仅三个差异仍然成立,说明多数模型间的差距并不稳健。