搜索
首页科技周边人工智能管提需求,大模型解决问题:图表处理神器SheetCopilot上线

这种丝滑的操作流程简直是职场人的福音!

管提需求,大模型解决问题:图表处理神器SheetCopilot上线

近日,来自中科院自动化所、港理工等机构的研究者们造出了一个「表格 AI 助手」SheetCopilot,该智能体能根据用户指令生成操纵表格的解决方案并在特定软件(如:Excel、GoogleSheets 等)上执行。SheetCopilot 可以快速连接多款表格处理软件,且支持多表操作、图表绘制和数据透视表生成,有望赋能多个领域的表格数据处理和可视化,并向实现通才智能助手迈出关键一步。

管提需求,大模型解决问题:图表处理神器SheetCopilot上线

网站:https://sheetcopilot-demo.github.io/

论文:https://arxiv.org/abs/2305.19308

让我们首先通过以下示例来感受 SheetCopilot 如何显著提升工作效率。

假如你是一个刚入职小白,有一天老板要求你帮他分析销售数据。你拿到表格一看,上千行的数据眼花缭乱,一时不知从何下手,于是你边查边做。

首先,你尝试采用把各 Product 名称提取出来,然后用公式对各 Product 的收入求和。

管提需求,大模型解决问题:图表处理神器SheetCopilot上线

搞了二十多分钟,SUMIF 一直报”#NAME?”的错误,遂放弃。

继续上网搜索,发现还有数据透视表(Pivot table)这么方便的工具,于是开始第二次挑战。

管提需求,大模型解决问题:图表处理神器SheetCopilot上线

又花了二十多分钟,终于搞定。整个过程将近一个小时,效率不如人意。每次老板交给你新的表格处理任务时,你之前的经验没有什么用处,因此你只能从头开始查看网站并进行处理。

你的同事则使用 SheetCopilot,伸个懒腰的工夫就把各种奇怪的要求都完成了: )。

管提需求,大模型解决问题:图表处理神器SheetCopilot上线

看到 SheetCopilot 如此丝滑,你也简单尝试了一下,画个图不在话下。

管提需求,大模型解决问题:图表处理神器SheetCopilot上线

有了 SheetCopilot,你再也不用把鼠标滑过半张桌子的距离来选中超出屏幕的数据了,轻松让上千行数据在多张表之间辗转腾挪。

管提需求,大模型解决问题:图表处理神器SheetCopilot上线

为什么提出 SheetCopilot

长久以来,人们一直渴望拥有即使没有专业经验也能熟练掌握复杂软件的能力。许多人都曾遇到过这样的情况:不知如何操作 PhotoShop 的繁琐界面,想要分析数据却不知道数据透视表这一高级功能,想要绘制齿轮却对 Solidworks 一无所知。

随着具有强大语言理解和生成能力的大型语言模型(LLM)的出现,这个愿景比以往任何时候都更接近现实。如果能够引导 LLM 掌握各种软件,就能够释放出 LLM 几乎无限的潜能,进而让人类的生产力达到前所未有的高度。

这篇文章指出电子表格(Spreadsheet)是进行这项研究的理想基础,因为它是一种常见的多功能生产工具。然而,表格操控面临着多样化的挑战,用户难以掌握足够的表格处理和编程技巧以应对变化多端的任务需求。

如果有一种通才 AI 智能体,它掌握丰富的软件操控技能,那么不仅办公效率能得到极大提升,企业产出也会大大加快。SheetCopilot 的出现正好契合了人们这样的远景。

SheetCopilot 有哪些亮点

1. 覆盖表格处理的典型需求

SheetCopilot 涵盖了表格操作的几乎所有典型任务,可以出色地完成各式图表生成任务。

管提需求,大模型解决问题:图表处理神器SheetCopilot上线

销售数据分析

管提需求,大模型解决问题:图表处理神器SheetCopilot上线

实验图表绘制

管提需求,大模型解决问题:图表处理神器SheetCopilot上线

复杂公式计算

管提需求,大模型解决问题:图表处理神器SheetCopilot上线

应用条件格式

2. 超越基于 VBA 的方法

SheetCopilot 优于用GPT-3.5 生成 VBA 代码并执行的方法,生成的解决方案的显著优于后者(见下图),这使得 SheetCopilot 有望成为数据处理人员未来强大的 AI 辅助工具。

管提需求,大模型解决问题:图表处理神器SheetCopilot上线

不仅如此,相比于晦涩的 VBA 代码,SheetCopilot生成的解决方案包含通俗易懂的步骤,这免去了学习新编程语言并艰难调试的痛苦。

管提需求,大模型解决问题:图表处理神器SheetCopilot上线

左图:冗长的 VBA 代码;右图:SheetCopilot简单易懂的解决方案。

3. 舒适的使用体验

SheetCopilot 在网络连接稳定的情况下,仅需约 10 步多表组合操作,即可在上千行数十列的表格中快速完成任务。这不仅解放了用户疲惫的双眼,还节省了查找网站并逐个尝试操作步骤所浪费的时间,同时也避免了学习 VBA 的成本。

管提需求,大模型解决问题:图表处理神器SheetCopilot上线

方法原理

这篇文章将表格操控所需的核心功能抽象为一组虚拟 API(称为原子操作,见下图),用于生成解决方案,作为 LLM 与应用软件之间交互的桥梁。

管提需求,大模型解决问题:图表处理神器SheetCopilot上线

最简单的方法是对 LLM 的一次查询(query)生成一个任务的所有步骤。然而,随着任务复杂度的增加,后序步骤更加依赖前序步骤的执行结果,导致这种开环控制难以得到正确结果。例如,如果无法确定筛选后可见数据的位置,LLM 就难以确定操作范围。

为了实现高效的闭环控制,SheetCopilot 根据软件状态反馈和外置原子操作知识库优化解决方案,提升了成功率和效率。

如何评测

该文提出了一个高质量评测基准。该基准的任务具有多样化的表述,并涉及丰富的原子操作,如下面词云所示:

管提需求,大模型解决问题:图表处理神器SheetCopilot上线

此基准采用了如下有关成功率的指标(越高越好):

  • Exec@1:生成的任务解决方案的执行成功率。
  • Pass@1:任务通过率,即执行后能匹配上任意参考答案的解决方案的占比。

此基准还考虑如下效率指标(越低越好):

  • A50:将符合任务要求的解决方案的步数除以参考答案最少步数,然后对所有计算结果取中位数。
  • A90:计算方式同上,但取所有计算结果的 90 分位数。该指标反映动作数的极值分布。

实验结果

管提需求,大模型解决问题:图表处理神器SheetCopilot上线

表 1:在 SheetCopilot 数据集上对比 GPT-3.5-Turbo、GPT-4、Claude 以及生成 VBA 的方法。

不出意料,GPT-4 符合任务要求的解决方案占比最高且效率最优,而 GPT-3.5-Turbo 则紧随其后,Claude 最次但也接近 GPT-3.5-Turbo。

一个值得关注的结果是,与将用户指令翻译成 VBA 代码并在 Excel 上执行的方法对比,SheetCopilot 取得了非常出色的成功率。这意味着 SheetCopilot 让软件智能控制离我们又近了一大步,让不会编程的用户能以日常交流的方式指挥计算机完成繁杂的工作。

我们再通过下面各个细分类别上的指标来看一看这三个 LLM 各自的优缺点。

管提需求,大模型解决问题:图表处理神器SheetCopilot上线

GPT-3.5 和 GPT-4 轻而易举地解决了 Management(排序、筛选等表格管理操作)和 Entry & manipulation(数据输入与操纵)这两类任务,均取得了 100% 可执行率。此外,三个 LLM 在不同任务类别中各自表现出最佳效率,这一有趣的发现表明每个 LLM 都有其独特的优势,GPT-4 也难以完胜其它模型。

结语

SheetCopilot 借助 LLM成功地将感知、推理和决策通过文字接口构成了一个闭环,实现高效的电子表格操控,促进智能软件控制更上一层楼,也为对通才智能体感兴趣的研究者带来了新的灵感。

以上是管提需求,大模型解决问题:图表处理神器SheetCopilot上线的详细内容。更多信息请关注PHP中文网其他相关文章!

声明
本文转载于:51CTO.COM。如有侵权,请联系admin@php.cn删除
您必须在无知的面纱后面建立工作场所您必须在无知的面纱后面建立工作场所Apr 29, 2025 am 11:15 AM

在约翰·罗尔斯1971年具有开创性的著作《正义论》中,他提出了一种思想实验,我们应该将其作为当今人工智能设计和使用决策的核心:无知的面纱。这一理念为理解公平提供了一个简单的工具,也为领导者如何利用这种理解来公平地设计和实施人工智能提供了一个蓝图。 设想一下,您正在为一个新的社会制定规则。但有一个前提:您事先不知道自己在这个社会中将扮演什么角色。您最终可能富有或贫穷,健康或残疾,属于多数派或边缘少数群体。在这种“无知的面纱”下运作,可以防止规则制定者做出有利于自身的决策。相反,人们会更有动力制定公

决策,决策……实用应用AI的下一步决策,决策……实用应用AI的下一步Apr 29, 2025 am 11:14 AM

许多公司专门从事机器人流程自动化(RPA),提供机器人以使重复性任务自动化 - UIPATH,在任何地方自动化,蓝色棱镜等。 同时,过程采矿,编排和智能文档处理专业

代理人来了 - 更多关于我们将在AI合作伙伴旁边做什么代理人来了 - 更多关于我们将在AI合作伙伴旁边做什么Apr 29, 2025 am 11:13 AM

AI的未来超越了简单的单词预测和对话模拟。 AI代理人正在出现,能够独立行动和任务完成。 这种转变已经在诸如Anthropic的Claude之类的工具中很明显。 AI代理:研究

为什么同情在AI驱动的未来中对领导者更重要为什么同情在AI驱动的未来中对领导者更重要Apr 29, 2025 am 11:12 AM

快速的技术进步需要对工作未来的前瞻性观点。 当AI超越生产力并开始塑造我们的社会结构时,会发生什么? Topher McDougal即将出版的书Gaia Wakes:

用于产品分类的AI:机器可以总税法吗?用于产品分类的AI:机器可以总税法吗?Apr 29, 2025 am 11:11 AM

产品分类通常涉及复杂的代码,例如诸如统一系统(HS)等系统的“ HS 8471.30”,对于国际贸易和国内销售至关重要。 这些代码确保正确的税收申请,影响每个INV

数据中心的需求会引发气候技术反弹吗?数据中心的需求会引发气候技术反弹吗?Apr 29, 2025 am 11:10 AM

数据中心能源消耗与气候科技投资的未来 本文探讨了人工智能驱动的数据中心能源消耗激增及其对气候变化的影响,并分析了应对这一挑战的创新解决方案和政策建议。 能源需求的挑战: 大型超大规模数据中心耗电量巨大,堪比数十万个普通北美家庭的总和,而新兴的AI超大规模中心耗电量更是数十倍于此。2024年前八个月,微软、Meta、谷歌和亚马逊在AI数据中心建设和运营方面的投资已达约1250亿美元(摩根大通,2024)(表1)。 不断增长的能源需求既是挑战也是机遇。据Canary Media报道,迫在眉睫的电

AI和好莱坞的下一个黄金时代AI和好莱坞的下一个黄金时代Apr 29, 2025 am 11:09 AM

生成式AI正在彻底改变影视制作。Luma的Ray 2模型,以及Runway的Gen-4、OpenAI的Sora、Google的Veo等众多新模型,正在以前所未有的速度提升生成视频的质量。这些模型能够轻松制作出复杂的特效和逼真的场景,甚至连短视频剪辑和具有摄像机感知的运动效果也已实现。虽然这些工具的操控性和一致性仍有待提高,但其进步速度令人惊叹。 生成式视频正在成为一种独立的媒介形式。一些模型擅长动画制作,另一些则擅长真人影像。值得注意的是,Adobe的Firefly和Moonvalley的Ma

Chatgpt是否会慢慢成为AI最大的Yes-Man?Chatgpt是否会慢慢成为AI最大的Yes-Man?Apr 29, 2025 am 11:08 AM

ChatGPT用户体验下降:是模型退化还是用户期望? 近期,大量ChatGPT付费用户抱怨其性能下降,引发广泛关注。 用户报告称模型响应速度变慢,答案更简短、缺乏帮助,甚至出现更多幻觉。一些用户在社交媒体上表达了不满,指出ChatGPT变得“过于讨好”,倾向于验证用户观点而非提供批判性反馈。 这不仅影响用户体验,也给企业客户带来实际损失,例如生产力下降和计算资源浪费。 性能下降的证据 许多用户报告了ChatGPT性能的显着退化,尤其是在GPT-4(即将于本月底停止服务)等旧版模型中。 这

See all articles

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

Video Face Swap

Video Face Swap

使用我们完全免费的人工智能换脸工具轻松在任何视频中换脸!

热工具

SublimeText3 Linux新版

SublimeText3 Linux新版

SublimeText3 Linux最新版

SublimeText3汉化版

SublimeText3汉化版

中文版,非常好用

VSCode Windows 64位 下载

VSCode Windows 64位 下载

微软推出的免费、功能强大的一款IDE编辑器

安全考试浏览器

安全考试浏览器

Safe Exam Browser是一个安全的浏览器环境,用于安全地进行在线考试。该软件将任何计算机变成一个安全的工作站。它控制对任何实用工具的访问,并防止学生使用未经授权的资源。

PhpStorm Mac 版本

PhpStorm Mac 版本

最新(2018.2.1 )专业的PHP集成开发工具