2024年AI大模型全球“加速度”,上海这个榜单可以看过来

今天,我们来关注一项科技界的大新闻:OpenCompass年度大模型评测榜单揭晓,同时,司南伙伴计划正式启动。

在这场人工智能的竞赛中,GPT-4 Turbo表现突出,各项评测中均获最佳。国内厂商如智谱清言GLM-4、阿里巴巴Qwen-Max、百度文心一言4.0紧随其后,成绩亮眼。但值得注意的是,大模型在复杂推理能力上仍有提升空间。

上海人工智能实验室推出的OpenCompass2.0评测体系,为大模型提供了全面的能力诊断。它不仅量化了模型在知识、语言、理解、推理等方面的能力,还推动了模型的迭代和优化。目前,已有30余家企业和科研机构采用这一体系。

评测结果显示,GPT-4 Turbo在客观评测中表现优异,在数学和代码处理上,国内大模型仍有短板。不过,在中文场景下,国内模型展现出独特优势,部分维度上接近GPT-4 Turbo的水平。

OpenCompass2.0还推出了“铁三角”支撑体系,包括权威评测榜单、评测基准社区和评测工具链体系,这些都将助力大模型技术的进一步发展。

此外,司南伙伴计划的启动,预示着大模型将在更多垂直领域发挥作用,如法律、金融、医疗等,推动产业革命。

也许,这不仅是科技界的一次飞跃,也预示着未来智能服务将更加精准、高效。我们期待这些进步能为我们的生活带来更多便利。

来源:周到上海       作者:苗夏丽