GOAI 2026 世界人工智能开源大赛全场大奖评审规则

各参赛团队、各评审专家、各相关单位:

为确保GOAI2026世界人工智能开源大赛全场大奖评审工作公平、公正、规范开展,经组委会审定,制定本规则。

本规则用于规范GOAI2026世界人工智能开源大赛全场大奖评审的评审对象、评审架构、评分维度、路演安排、材料要求、评分与计分方式、名次确定、结果确认与公布、程序性申诉等事项,是全场大奖评审与结果产生的唯一依据。

一、总则

1.1 评审对象

本环节评审对象为四大赛道决赛产生并晋级全场大奖评审的6支冠军团队:

  • 赛道一「新智基座 Agent Infra」1支
  • 赛道二「无界应用 Boundless Agents」1支
  • 赛道三「前沿探索 AI for Research」2支(算法赛题、开放探索赛题各1支)
  • 赛道四「具身未来 Embodied Future」2支(双臂协作赛题、全地形巡逻赛题各1支)

1.2 成绩独立

各赛道决赛成绩仅用于产生本赛道冠军,不带入全场大奖。6支冠军团队在全场大奖阶段重新独立评分、独立排名。

1.3 基本原则

  1. 客观公正:所有晋级团队适用统一的评价维度、评分标准、计分方式与结果确认流程。评审不因团队所属机构知名度、融资情况、既往奖项、项目开源时间长短等与本次评价无直接关系的因素改变标准。

  2. 独立评审:评委基于路演展示、答辩事实及可核验证据独立评分。评分提交前不得交换具体分数、项目排名或奖项倾向;评委合议不替代个人独立评分。

  3. 证据优先:评分以可核验事实为主要依据,包括已锁定材料、现场展示、运行记录、代码与开源状态、实验或实机结果。仅有概念描述、未来计划或无法核验的口头主张,不按照已实现的成果计分。

  4. 规则冻结:本规则所涉评分维度、权重、计分公式、同分顺序、回避规则及申诉机制应在赛前完成确认与冻结。评审开始后,不得临时增加、删除或调整影响评分及最终排名的实质性评价标准。

  5. 全程留痕:评委评分、利益冲突回避、核分、事实核验、争议处理、结果确认等关键环节均应形成可核查记录并留档备查。

二、评审架构

全场大奖在四大赛道冠军基础上进行跨赛道横向评审,沿用决赛统一评价框架,并新增「场景落地与生态协同潜力」维度,形成六个一级维度。

设三个评审组,共12位专家,按组别分工共同打分:

评审组 评委人数 承接的一级维度 组内满分 最终权重
技术创新组 4名 创新性;技术/研究深度 100分 35%
成果可信与开放生态组 4名 完成度与可验证性;开源价值与复用 100分 25%
场景价值组 4名 问题价值与实际影响;场景落地与生态协同潜力 100分 40%

评委仅对本人所属评审组负责的维度进行评分,不跨组代评。

三、评审维度与分工

一级维度 评审组 评价重点
问题价值与实际影响 场景价值组 继续判断问题是否真实、重要,以及项目可能产生的实际影响
创新性 技术创新组 重点比较跨赛道的原创性、突破高度与相对领先性
技术/研究深度 技术创新组 重点判断技术难度、核心壁垒、方法深度与系统能力
完成度与可验证性 成果可信与开放生态组 判断核心成果是否真正完成,关键主张是否具有充分、可信、可核验的证据
开源价值与复用 成果可信与开放生态组 判断开放程度、复现复用能力,以及持续形成开发者与生态价值的潜力
场景落地与生态协同潜力(新增维度) 场景价值组 评价真实场景进入能力,以及与产业、科研、应用场景、资本和生态资源的协同承接潜力

四、评分表

三组均使用100分制评分表,每组设4个二级评分项,评委直接填写整数分。

4.1 技术创新组 | 100分(权重35%)

二级评分项 分值 主要判断
原创性与突破高度 30 是否形成实质性新方法、新架构、新能力或关键技术突破
相对领先性与差异化 20 相较既有论文、产品、开源方案或工程实践,是否具备清晰、可解释的领先点和差异价值
技术难度与核心壁垒 30 核心问题是否具备足够技术难度;关键能力是否由团队自主实现,并形成可识别的技术壁垒
技术方法完整性与延展价值 20 技术路线、方法或系统链路是否严谨完整,核心能力能否进一步扩展到更多任务、场景或研究问题

4.2 成果可信与开放生态组 | 100分(权重25%)

二级评分项 分值 主要判断
成果完成度 20 核心功能、研究成果或系统能力是否已经真实完成,并达到可展示、可运行或可检验的状态
验证充分性与可信度 25 Demo、实验、Benchmark、实机结果、代码、日志或其他证据是否充分支持关键主张,结果是否可核验
开放程度与可复现性 30 核心代码、模型、数据、工具、接口或关键方法是否具有实质开放价值,第三方是否能够理解、运行并复现
复用价值与生态潜力 25 成果是否便于二次开发、研究或集成,是否具备形成开发者使用、协作贡献及生态扩散的潜力

4.3 场景价值组 | 100分(权重40%)

二级评分项 分值 主要判断
真实问题与价值证据 25 是否解决真实且重要的问题;用户、科研、产业或社会价值是否有事实与证据支撑
实际影响与规模化潜力 20 成果是否具备扩大使用范围、复制到更多场景并形成持续影响的可能
真实场景落地可行性 25 从当前 Demo / 成果进入真实应用,还需补齐哪些产品、工程、合规或交付条件;路径是否清晰可行
产业生态与资源协同潜力 30 与产业基础、科研资源、应用场景、资本及生态伙伴的匹配度,以及形成合作、 POC 、孵化或持续发展的实际可能

关于「产业生态与资源协同潜力」的说明:

本项不以口头落地承诺作为唯一依据,重点判断项目与真实资源、场景和合作条件的客观匹配程度,以及未来6-12个月形成合作、POC、孵化、团队或业务承接等实质性进展的可能。

本项不以项目承诺或已经落地特定地区为得分前提;项目注册地、团队所在地不作为评价依据。

五、路演安排

5.1 时间与地点

全场大奖路演于2026年9月23日上午举行,地点为云谷之芯负一楼云升厅(选手备战间:云渡)。

冠军队伍须于7:30前完成签到及设备检查,8:00正式开始。评选结果于当日GOAIDAY颁奖盛典(10:00,云谷之芯一楼主会场)统一发布。

5.2 出场顺序

出场顺序于9月22日决赛路演结束后,由6支冠军队伍代表现场抽签确定,抽签结果当场公布并留档。

5.3 形式与时长

每支队伍展示总时长10分钟:

  • 项目陈述5分钟
  • 核心 Demo 3 分钟
  • 评委提问 2 分钟

队伍之间另设2分钟换场时间。

5.4 统一展示内容

各队展示应覆盖以下内容:

  1. 项目解决的核心问题
  2. 技术与产品创新
  3. Demo 已完成的验证
  4. 项目的开源成果与协作价值
  5. 真实场景或科研应用潜力
  6. 下一阶段发展计划

5.5 观摩与直播

全场大奖路演为受控评审环节,不开放公众观摩。

晋级团队的参赛队员及必要随队人员可全程现场观摩其他项目路演与公开问答;路演画面通过官方信号同步至主会场,公众可在主会场观看。

公平性通过材料赛前锁定、出场顺序随机、展示时长统一及评分过程封闭予以保障。不开放现场观摩,旨在避免现场人流对选手发挥及评委独立评分造成影响。

六、材料要求

6.1 材料构成

全场大奖路演原则上沿用赛道决赛核心答辩材料,不要求冠军团队重新制作完整PPT。

晋级后可在原材料基础上优化叙事顺序,并补充1页「场景落地与生态协同」标准化内容(模板见附件《GOAI增补页- 落地路径与生态协同》)。

核心材料应覆盖:问题与价值、整体方案、核心创新、关键技术实现、Demo / 验证结果、开源与复用、真实世界应用及下一步。新增标准化页面应重点说明优先真实场景、当前验证基础、下一阶段里程碑,以及与产业、科研、应用生态的协同机会。

6.2 提交与锁定

晋级团队应于2026年9月22日22:00前,将补充完成的路演材料提交至组委会指定渠道(详见晋级通知)。

材料提交后统一锁定。团队可现场观摩其他项目路演与公开问答,但不得因观摩或评委提问对已锁定材料作实质性修改。

逾期未提交的,以赛道决赛封版材料为准进行展示。

6.3 赛道四特别安排

赛道四团队进入全场大奖后,可采用决赛官方实机录像或Demo视频作为验证材料,并结合PPT对核心技术、系统实现、创新点和真实场景价值进行说明。视频时长计入3分钟核心Demo环节;评委可结合9月22日实机比赛结果及技术核验记录进行判断。

七、评分方式与现场执行

7.1 每位评委仅完成本人所属评审组的评分表,直接填写整数分,不另填整体印象分。

7.2 各队展示结束后,评委即时完成本队评分;全部路演结束后进入核分与结果确认程序。

7.3 评分提交前,评委不得交换具体分数、项目排名或奖项倾向;可就已公开的技术与事实问题进行提问和澄清。

7.4 评语原则上不作为必填项。出现明显异常分差、事实争议、利益冲突回避,或组委会要求补充判断依据时,评委可填写简要说明。

7.5 评分提交后原则上锁定。仅当出现分数录入错误、使用了错误的材料版本,或经事实核验发现原评分依据的客观事实存在错误时,可由评委本人独立调整,并保留修改前后记录及原因。

八、计分与有效评分

8.1 组内计分

同一项目在同一评审组内,以有效评委总分的算术平均值作为该组最终得分,不去最高分、不去最低分。

8.2 有效评分

因临时缺席或利益冲突回避后,单个项目同组有效评分不少于3份即可计分;低于3份时应补充评审。

8.3 异常分差复核

同一项目组内最高分与最低分相差达到20分时,触发事实复核。复核只确认事实和证据,不统一观点;事实确认后,评委可维持或独立调整本人评分。

8.4 关键事实可核验

代码、Demo、开源状态、数据来源、技术归属等发生重大争议时,可调取材料、录像、日志等证据进行核验。核验只针对事实,不对专业判断重新评价。

九、综合成绩与名次确定

9.1 计算公式

全场大奖综合得分 = 技术创新组平均分 × 35% + 成果可信与开放生态组平均分 × 25% + 场景价值组平均分 × 40%

三组均使用100分制评分表,综合得分满分100分。

9.2 计分精度

综合成绩统一保留两位小数用于展示。

9.3 名次产生

全场大奖最终名次依据本规则第9.1条规定的权重公式计算产生。

评委合议仅用于确认评分完整性、核验影响评分的客观事实及处理程序问题,不用于统一评委专业判断,不得以合议、讨论或集体投票方式改变按公式计算得出的结果。

任何后台岗位均无权修改评委评分。发生客观事实变化时,仅由相关评委本人独立决定是否调整本人已提交的评分,再由后台重新核分。

9.4 结果复核

后台核分完成后形成拟确认结果,经结果健康检查(包括评分完整性、回避情况、计算公式、异常分差及尚未核实事项等)及争议处理窗口后,方可正式锁定并公布。

十、利益冲突与回避

10.1 评委与参赛团队存在下列情形之一的,应提前申报并对相关项目回避:

  1. 任职关系
  2. 投资关系
  3. 导师 / 学生关系
  4. 合作研发关系
  5. 直系亲属关系
  6. 其他可能影响独立判断的实质性利益关系

10.2 同一评审组不配置来自同一单位的两名正式评委,以保持评价来源的多样性。

10.3 回避评委不参与相关项目的提问、评分、排名讨论及同分裁决,其缺失评分按第 8.2 条有效评分规则处理。

十一、同分处理

如出现综合成绩相同,按以下顺序处理:

11.1 首先比较未四舍五入的原始综合成绩。

11.2 原始综合成绩仍相同的,依次比较各组平均分:

  1. 场景价值组平均分
  2. 技术创新组平均分
  3. 成果可信与开放生态组平均分

11.3 仍无法区分的,由未回避的全场大奖正式评委进行匿名投票。

11.4 如仍同票,由组委会组织补充复核后确认。

不得在出现同分后临时新增新的评分指标。

十二、结果确认与公布

12.1 两次确认:全场大奖结果实行两次确认。后台核分仅形成拟确认结果,完成程序复核与争议处理窗口后方可正式锁定。

12.2 签字与公证:最终结果由评审负责人、计分负责人、监督/公证人员共同签字确认,并现场公证。评分原始记录、核分记录及结果确认单由组委会封存备查。

12.3 公布方式:全场大奖结果于 2026 年 9 月 23 日 GOAI DAY 颁奖盛典现场统一公布。结果正式锁定前,不向任何团队、评委或第三方透露中间得分与临时排名。

12.4 暂缓公布:如出现重大事实或程序争议且无法在颁奖前可靠确认,组委会有权暂缓确认并暂缓公布全场大奖结果,其他已确认奖项及颁奖议程正常进行。组委会应在赛后完成专项复核并正式公布结果。

12.5 信息保护:为保护评审独立性与参赛团队权益,组委会不公开其他团队的评分记录及评委个人评分。

十三、程序性申诉

13.1 可受理事项

参赛团队可就下列事项提出程序性申诉:

  1. 使用了错误的作品或材料版本
  2. 分数录入或综合成绩计算错误
  3. 应回避的评委未执行回避
  4. 对不同团队存在明显不一致的规则执行
  5. 客观记录或技术事实核验存在明显错误

13.2 不受理事项

程序性申诉原则上不受理以下事项:

  • 单纯认为评分过低
  • 对评委专业判断存在异议
  • 要求更换评委重新评分
  • 因奖项或排名结果提出重新评分要求

专业判断差异属于评审正常组成部分。除非存在事实、程序或利益冲突问题,不因个别评委或团队"不同意结果"而重新组织评审。

13.3 申诉渠道与时限

申诉应由团队代表于全场大奖路演排名公布后30分钟内,向现场赛事监督人员书面提出并说明具体事由。

组委会应在颁奖盛典开始前完成核查并答复。经核查确认存在确需纠正的程序或事实错误的,组委会应按已冻结规则进行更正并留档。

十四、其他

14.1 本规则由 GOAI 赛事组委会负责组织实施及必要的程序解释。

14.2 对于本规则未明确覆盖的现场情况,应按照已公开赛事规则、已冻结评分标准、公平一致原则及可核验事实进行处理。

14.3 本规则自发布之日起施行,至 GOAI 2026 全场大奖评审结束终止。

GOAI 2026 世界人工智能开源大赛组织委员会 2026 年 9 月18日