通用AI-Eval 页面截图
产品页面 点击查看大图

通用AI-Eval

AGI-Eval(通用AI-Eval)是一个AI评测社区,围绕大语言模型与多模态模型提供能力榜单、评测集、人机竞赛和Data Studio数据贡献服务,帮助用户了解模型表现并参与评测生态共建。

大模型评测社区
平台
Web
语言
中文
地区
中国
01

Overview

产品概述

平台以“评测助力,让AI成为你更好的伙伴”为理念,建设了包含模型榜单、评测集、人机竞赛、交流区和Data Studio等模块的社区。模型榜单基于通用评测方案,覆盖综合评测和各能力项评测,定期更新并强调数据透明、权威;评测集分为平台官方与用户自建,并提供高难度信息学算法竞赛组成的数据集;Data Studio支持个人贡献专业领域数据,平台用户已超20000,任务标签超500个,并配有机器与人工多重审核机制。
02

Capabilities

核心能力

01

模型能力榜单

基于通用评测方案提供大语言模型和多模态模型的能力得分排名,榜单涵盖综合评测和各能力项评测,数据透明权威并定期更新。

02

人机协同评测

构建人机协同评测方案,支持用户参与人机竞赛,探索下一代评测方案。

03

评测集与Data Studio

提供平台官方与用户自建的评测集,并可通过Data Studio以单条数据、扩写、Arena等方式贡献多领域数据,数据经机审与人审双重审核,保证质量。

03

Use Cases

适用场景

  1. 01

    了解模型优缺点

    通过定期更新的综合及各能力项榜单,深入了解每个模型的优缺点,帮助做出模型选型决策。

  2. 02

    参与人机竞赛与共建标准

    参与人机评测与竞赛,与大模型协作,体验前沿科技,共同构建下一代评测方案。

  3. 03

    贡献评测数据与获取回报

    个人或机构可通过Data Studio贡献专业领域数据或自建评测集,在保证数据质量的同时获得收益。