发布 | 《Office Agent工作流测评报告》发布
时间:2026-08-05
2026年是智能体落地元年,各类现象级智能体产品加速涌现,依托大模型底座具备自主规划、多工具联动、长流程执行能力,全面渗透工业、政务、消费等各类场景。在智慧办公领域,智能体实现从单一文档生成向多任务串联、跨文件协同升级,大幅降低多任务切换成本,成为企业提效、用户减负的重要载体。
2024和2025年,我中心人工智能所已连续两年开展大模型赋能智慧办公的PPT生成测评,相关成果获得行业广泛关注。今年,我们聚焦Office Agent完整工作流执行能力,选取4类典型办公场景与1类特殊场景,围绕流程协作衔接、文本内容生成、视觉效果呈现、全链路功能体验四大核心维度开展系统化测评。相较于前两年,本次测评在覆盖广度、评测深度上全方位升级:一是测评对象由PPT拓展至Word、Excel、PPT全套办公工具;二是测评重点贴合真实工作场景,覆盖从原始数据处理到成果演示全链路需求;三是构建了可量化的测评体系,全面测试产品各项能力。
测试结果表明,Office Agent已打通三件套(Word、PPT、Excel)基础办公流程,有效提升日常办公效率,但模型幻觉问题仍然存在,任务执行精确度与生成结果专业性仍需加强。

注:本次测评结果仅体现产品在测试时段和测试环境下的表现
协作衔接方面,被测产品均可以支持多格式文件导入和导出,大部分产品可以自主执行长链任务,并根据指令联动修改已生成文件,个别产品生成结果联动和数据一致性仍需加强,平均分87.92分。文本内容方面,被测产品生成的大部分文字内容流畅,逻辑清晰,但虚假信息、幻觉问题仍然存在,专业深度有待提高,平均分74.38分。视觉呈现方面,所有产品均具备Word、PPT、Excel排版美化能力,各项美化能力较为均衡,部分产品图表绘制能力有待加强,平均分74.38分。功能体验方面,各产品系统稳定性表现出色,具有较为完善的安全合规机制,大部分可进行多轮交互,未来可适当提升在线编辑自由度、丰富辅助功能,平均分67.22分。基于本次测评结果,围绕Office Agent长期发展,报告从流程自主性优化、专业内容能力优化、视觉美化能力优化、安全合规优化、产业生态体系优化提出五方面建议,以期为政企单位选型、平台优化迭代提供参考,助力智能体赋能智慧办公产业高质量发展。
未来,我们将进一步扩大评测范围,拓展评测维度,继续开展大模型赋能智慧办公系列测评研究。期待与各方交流合作,共同推动行业高质量发展。
联系人:张若丹 13681408180
点击“阅读原文”查看报告原文
来源:人工智能所