8月21日消息,Keep披露,其自研运动健康大模型Keepace.ai已完成国家及北京市大模型备案。同时,Keep首次系统公布运动健康大模型评测基准MoveBench V1.0的框架及阶段性评测结果。
据介绍,MoveBench由Keep联合首都体育学院运动健康领域专家团队设计,包含809道评测题目和5012条评分细则,主要考察AI教练在训练课程生成、运动数据解读和专业知识问答三类任务中的综合执行能力。其中,题库由499道开放问答题、197道多选题和113道单选题构成,数据基于Keep平台真实用户数据,经清洗、脱敏后结合BMI、年龄、伤病及运动目标等特征抽样构建。
在评分机制上,MoveBench设置安全层、专业层和体验层,其中安全层实行“一票否决”。针对开放题,评测采用Gemini、Claude和GPT组成的裁判委员会,当两位及以上裁判判断存在安全风险时,将触发最高惩罚机制。
据Keep披露,在对Claude-4.6 Opus、GPT-5.5、Doubao Seed-2.0 Pro、DeepSeek V4 Pro等主流模型的横向评测中,Keepace.ai综合得分达到0.943,与Claude-4.6 Opus表现相当。(定西)