《人工智能大模型体验报告2.0》发布

为进一步直观感受我国当前主流科技企业所推出的大模型产品的现状、优势和特点,新华社研究院中国企业发展研究中心于今年7月启动了本次报告研究。与2023年6月首次发布的《人工智能大模型体验报告》相比,本次测评在题目设计、对标Benchmark(人类)、打分权重、专家测评团队四大维度进行了全面升级。

日前,新华社研究院中国企业发展研究中心发布的《人工智能大模型体验报告2.0》(以下简称报告)显示,讯飞星火、百度文心一言、商汤商量和智谱AI-ChatGLM均表现抢眼,AI大模型的发展为人类工作和生活的提质增效均带来了正向积极的影响。

今年以来,国内科技企业纷纷布局人工智能大模型。据不完全统计,在新一轮生成式AI热潮中,国内已经出现了上百个大模型。天眼查数据显示,截至2023年上半年,与“大模型”直接相关的融资事件超20起。

为进一步直观感受我国当前主流科技企业所推出的大模型产品的现状、优势和特点,新华社研究院中国企业发展研究中心于今年7月启动了本次报告研究。与2023年6月首次发布的《人工智能大模型体验报告》相比,本次测评在题目设计、对标Benchmark(人类)、打分权重、专家测评团队四大维度进行了全面升级。

《人工智能大模型体验报告2.0》发布

其中,在题目设计方面,测评题目由300道扩展至500道,并进一步完善了题目分类;在对标Benchmark方面,本次测评将接受过高等教育的人类作为对照,来考评大模型真实能力;在打分标准上,本次测评根据对产业、生活的实际价值,对基础能力、智商能力、情商能力和工具提效四大测评维度进行了权重设计;在测评团队方面,本次测评特邀北京大学文化与传播研究所及其他产界、学界专家全程参与。

本次研究设置了用户体验项目,抓取了7月31日―8月4日数据,通过人机互动提问等形式,对国内主流大模型进行使用体验评测,旨在为科技企业调整努力方向提供参考。

报告显示,与2023年6月相比,当前中国大模型产品进步显著。但与接受过高等教育的人类相比,大模型在智商、情商等方面还存在一定程度差距。具体来看,讯飞星火在工作提效方面优势明显,百度文心一言基础能力仍处领军水准,商汤商量则在情商方面表现优秀,智谱AI-ChatGLM整体表现优秀。

针对各维度能力测评,该报告还给出了相应的案例展示和分析。

在基础能力方面,人类与AI之间的差距并不显著。课题组分别从语言能力(35%)、AI向善(10%)、跨模态(20%)和多轮对话(35%)四大指标进行测评。测评显示,科技企业大模型中,百度文心一言表现最为抢眼,商汤商量、智谱AI-ChatGLM、360智脑表现优良。

在智商评估方面,人类在智商方面仍然具有明显优势。课题组分别从常识知识(20%)、逻辑能力(50%)和专业知识(30%)方面对科技企业大模型进行考量。结果显示,讯飞星火、智谱AI-ChatGLM表现突出,百度文心一言、昆仑万维天工表现优良。

在情商方面,AI与人类之间的差距最为明显。人类在情绪理解和处理方面通常具有更强的优势,和更灵活的处理能力。通过对处理日常事项(35%)、一语双关(30%)、人际关系(35%)问题进行分析发现,科技企业大模型中,商汤商量表现亮眼,百度文心一言、澜舟科技Mchat、智谱AI-ChatGLM及360智脑均表现优良。

在工作效率提升方面,课题组重点在工具提效(50%)和生成创新(50%)方面进行考量。结果显示,讯飞星火表现最为抢眼,百度文心一言、商汤商量、智谱AI-ChatGLM表现优良。不过,尽管AI具有高速度和高效率的优势,但在某些复杂和具有创新性的任务中,人类的智慧和想象力仍然具有无法替代的作用。

报告认为,虽然在不同领域中,AI和人类表现出不同的优劣势,但在整体上,AI大模型的发展为人类工作和生活的提质增效带来了重要的积极影响,大模型正在加速走进生活、走进产业。在本次体验测评基础上,研究团队将继续深耕,加强在大模型安全可解释性、工作提效能力、实际落地情况、产业优秀案例等维度上的探索与研究。

该文观点仅代表作者,本站仅提供信息存储空间服务,转载请注明出处。若需了解详细的安防行业方案,或有其它建议反馈,欢迎联系我们

(0)
小安小安

相关推荐

  • 2023年光伏市场稳定 市场激烈、产业积极向好

    随着全球对可再生能源需求的不断增长,相关技术不断发展的同时,市场也收获了显著发展。其中光伏产业因为本就相对成熟的技术基础、较为理想的发展前景,近几年的收获更加可观。 我国作为光伏产…

    2024年6月26日
  • 吉林省安防协会第五届第六次理事会顺利召开

    会上,副秘书长李宏文对2020年上半年协会工作情况作出总结,并概要的报告了下半年的主要工作任务。2020年上半年,协会以政治建设为统领,积极推进党建工作,强化自身建设,加强行业交流,以服务会员为宗旨,开展多元化会员服务,紧贴服务政府的工作重点,协助引导行业企业规范健康发展。

    2024年4月13日
  • 富阳区多点出击推进避灾场所无障碍设施建设工作

    根据《杭州市无障碍环境建设领导小组关于印发杭州市创建全国无障碍建设示范城市实施方案的通知》及市应急管理局有关工作部署要求,助力杭州创建无障碍建设示范城市,富阳区立足辖区实际,多点出…

    2024年6月26日
  • 警用设备智能化 4G头盔可传输实时画面

    近期,一支由150人和15辆特制警车组成的冲锋队悄然出现在上海街头,在获得允许后,记者5月13日与这支特种机动部队进行了一番零距离接触。一起来看看这支配备智能化高科技设备的冲锋队。

    2024年4月25日
  • 无线技术紧密连接 家庭报警联合移动终端

    无论是网络还是模拟摄像机,考虑到用户需求的前提下,智能终端的作用是显而易见的。有线智能家居的控制信号稳定,但问题也非常突出,除了布线繁杂、工作量大、维护困难以外,成本高、不易组网也是不小的难题。

    2024年7月27日
  • CPS2003中国社会公共安全产品展览会

    尊敬的各参展商、参观单位人员:
    由北京市公安局主办,北京市公安局社会公共安全产品行业管理委员会、北京市公安局科技处、北京四星展览服务有限公司承办的“ CPS2003中国社会公共安全产品与技术设备(北京)展览会”自2002年9月份筹备至今,得到了国内外企业的大力支持。截止2003年4月20日,已有国内外近 300家企业报名参加,在此对所有的报名参展企业及支持本次展会各方人士,表示衷心的感谢!

    2024年4月12日