产品派
返回

实测多款AI辅助Excel:复杂任务交付仍易出错

AI少数派2026/9/14 16:35:27
AI 导读

自然语言操控电脑曾被视为AI办公的下一步,但两年前的Office Copilot Pro实测仍常误解指令、操作失误。此次测试发现,AI写公式已较成熟,复杂流程的最终交付却不稳定;载体选择、提示词严谨度和人工复核同样重要,拿到文件后还应修改一次原始数据,确认公式能否自动更新。

测试比较了多种模型及载体,并对原生推理模型统一开启High或深度思考。Office官方加载项主要依靠Office.js,Pi for Excel还可调用Python;Codex等独立工作台则采用“文件+提示词”的端到端方式。OpenAI和Anthropic同时测试了官方加载项与Pi for Excel,其余模型通过Pi for Excel调用。

测试数据覆盖清洗、重复公式和成品交付等场景,题目源自常见Excel工作流,完整用例和提示词可在Notion获取。每轮均使用最新正式版、全新独立文件,并记录耗时、交互次数、硬编码和是否破坏原始数据。

硬编码用于判断结果是动态公式还是后台计算后写入静态值;无损原则则检查原始数据与版式是否被擅自改动。测试重点是数值与逻辑准确性、复杂任务稳定性,以及如何通过提示词构建更可靠的工作流。

数据清洗中,“发现问题”不等于“告知问题”或“正确处理”。在A09姓名匹配测试里,Claude Cowork遇到重名会先询问;ChatGPT for Excel、Claude for Excel和DeepSeek(Pi for Excel)提到重名却默认匹配第一个,Kimi-K3(Pi for Excel)还添加注释;Claude、Gemini(均经Pi for Excel)未提示重名,Workbuddy甚至为找不到的姓名猜填近似值。

A11图书销售分析要求清洗数据、制作透视表、生成季度看板、热力图、区域占比和趋势图,即使提示“有歧义要提问”,也很少能一次完成。常见问题包括同义词未统一、异构字段未处理和文本数字被误判;pandas读取CSV时可能自动转换类型,导致Python结果与Excel原生汇总不一致。

A10和A11共22个文件中,16个创建了透视表,14个使用了正确数据源,但只有6个(27%)计算正确,排序也经常失败。深度思考虽能减少幻觉,复杂任务耗时反而明显增加:A08、A10、A11及Q11共45次测试的人工干预率为51%,A01至A07仅12%。Kimi-K3曾在A10中思考超过25分钟仍未完成排序,DeepSeek v4 Flash修正类型错误耗时10分钟;Claude Cowork曾因残留LibreOffice文件卡住10分钟,Workbuddy执行A10约40分钟仍无进展。

ExcelAI办公数据分析办公自动化

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文