码农知识堂 - 1000bd
  •   Python
  •   PHP
  •   JS/TS
  •   JAVA
  •   C/C++
  •   C#
  •   GO
  •   Kotlin
  •   Swift
  • PPTC Benchmark: Evaluating Large Language Models for PowerPoint Task Completion


    本文是LLM系列文章,针对《PPTC Benchmark: Evaluating Large Language Models for PowerPoint
    Task Completion》的翻译。
    @TOC

    摘要

    最近对大型语言模型(LLM)的评估集中在测试其用于基本自然语言任务的零样本/少样本能力,以及将指令转换为工具API的能力。然而,在复杂的多模态环境中,利用复杂工具完成多轮、多模态指令的LLM的评估尚未得到研究。为了解决这一差距,我们引入了PowerPoint任务完成(PPTC)基准,以评估LLM根据用户说明创建和编辑PPT文件的能力。它包含279个多回合会话,涵盖不同的主题和数百条涉及多模式操作的指令。我们还提出了PPTX-Match评估系统,该系统基于预测文件而不是标签API序列来评估LLM是否完成指令,因此它支持各种LLM生成的API序列。我们测量了3个封闭LLM和6个开源LLM。结果表明,GPT-4在单回合对话测试中的准确率为75.1%,优于其他LLM,但在完成整个会话方面面临挑战,会话准确率仅为6%。我们在基准测试中发现了三个主要的错误原因:多回合会话中的错误积累、长PPT模板处理和多模态感知。这些对未来的LLM和代理系统提出了巨大的挑战。我们在https://github.com/gydpku/PPTC上开源了我们的数据、代码和评估系统。

    1 引言

    2 PPTC基准

    3 算法

    4 实验

  • 相关阅读:
    考研数学一二三 2010-2019年每道题的难度系数
    2023年全球及中国运动休闲服饰发展趋势分析:互联网经营将成为行业趋势[图]
    MQTT协议入门介绍
    GaussDB向量数据库为盘古大模型再添助力
    驱动开发:内核遍历进程VAD结构体
    在 Ubuntu 中卸载 Microsoft Edge 浏览器
    十、Spring Boot 安全管理(4)
    R语言biopsy 数据集数据分析 报告
    【C语言】——通讯录(静态-动态增长-文件储存)
    各种激活函数ReLU+sigmoid+tanh ----转沐神课程笔记
  • 原文地址:https://blog.csdn.net/c_cpp_csharp/article/details/134282070
  • 最新文章
  • 沪漂五周年了:我越来越迷茫了
    Agentic Skill Routing 实战:别再把所有 Skill 塞进 AI Agent 上下文
    MySQL-Seconds_behind_master的精度误差
    [MAF预定义ChatClient中间件-03]CachingChatClient——利用缓存省钱省时间
    AI的至暗历史:从万众期待到被政府撤资,AI的两次死亡徘徊
    Agent OS :五种驯服不确定性的范式
    PortSwigger SQL注入LAB11
    数据库即时编译JIT
    [Begin]AI Learn Data Day 0
    深度学习进阶(二十七)现代 LLM 的核心架构设计其二:SwiGLU
  • 热门文章
  • 十款代码表白小特效 一个比一个浪漫 赶紧收藏起来吧!!!
    奉劝各位学弟学妹们,该打造你的技术影响力了!
    五年了,我在 CSDN 的两个一百万。
    Java俄罗斯方块,老程序员花了一个周末,连接中学年代!
    面试官都震惊,你这网络基础可以啊!
    你真的会用百度吗?我不信 — 那些不为人知的搜索引擎语法
    心情不好的时候,用 Python 画棵樱花树送给自己吧
    通宵一晚做出来的一款类似CS的第一人称射击游戏Demo!原来做游戏也不是很难,连憨憨学妹都学会了!
    13 万字 C 语言从入门到精通保姆级教程2021 年版
    10行代码集2000张美女图,Python爬虫120例,再上征途
小工具 小游戏
Copyright © 2022 侵权请联系2656653265@qq.com    京ICP备2022015340号-1

京公网安备 11010502049817号