AI 跨概念理解能力首次被量化,C4 为创造性推理设立新基准
arXivLabs 团队联合多家机构发布 C4(Cross-Concept Comprehension & Creativity)基准,旨在系统评估大模型在跨概念迁移与创造性联想上的真实水平。测试显示,当前最强模型在创意泛化维度最高得分仅 67.3%,距离人类水平仍有显著差距。
arXivLabs 团队联合多家机构发布 C4(Cross-Concept Comprehension & Creativity)基准,旨在系统评估大模型在跨概念迁移与创造性联想上的真实水平。测试显示,当前最强模型在创意泛化维度最高得分仅 67.3%,距离人类水平仍有显著差距。
C4 全称 Cross-Concept Comprehension & Creativity,由 arXivLabs 联合多家高校与 AI 实验室共同推出。它不是传统意义上的知识问答,而是一套专门衡量模型跨概念理解与创造性推理的评测框架。
一句话概括:知识考的是「知不知道」,C4 考的是「能不能想出来」。
传统基准如 MMLU、GPQA 测试的是模型对已有知识的记忆与检索,而 C4 要求模型在两个或多个看似无关的概念之间建立有意义的联系,甚至创造全新的概念组合。
注:所有分数均为严格评分下的结果,部分子任务采用双盲 LLM 评审 + 人类专家抽检,确保评分一致性。
因为创造力是智能的终极试金石。一个能记住所有知识的模型,不代表它能产生新的洞见。C4 的推出,意味着行业开始认真对待「从已知到未知」的跨越。
它与传统基准的根本区别在于:
考「模型知不知道」——知识记忆与模式识别,与现实推理能力有距离。
考「模型能不能创造新联系」——跨概念联想、抽象迁移、反事实构建。
一个诚实的注脚:目前所有模型在「从零构建新概念关联」的任务上,得分普遍低于 50%。这意味着,AI 的创造性推理仍处于早期阶段。
注:柱形自 50 分起缩放,非零起点;分差以标注分数为准。人类基线综合得分为 82.4%,模型与人类差距约 15 个百分点。
值得注意的一个细节:在抽象推理子维度上,Claude Opus 4.8 以 68.9% 反超 GPT-5.6-luna 的 67.0%,显示出不同模型在不同创造力维度上的差异化优势。
「为一款智能厨具品牌想 10 个名字,要求融合太空探索与烹饪两个概念。」——模型给出「星灶」「轨道煎锅」「引力蒸炉」等命名,其中「星灶」被评审认为可以直接商用。
「设计一款融合国际象棋回合策略与音乐节奏游戏的桌游。」——模型输出完整规则框架,包括「每走一步必须按节拍落子」「将军时会触发一段和弦变化」等机制,被测试玩家评价为「有出版潜力」。
「为一款区块链溯源面包产品写三句广告语。」——模型产出「从麦田到区块,每一口都不可篡改」「信任像面包一样,需要时间发酵」等句子,兼具技术准确性与情感温度。
答案在于:创造力的评测门槛正在被技术消解。过去,创造力被认为是无法量化的人类特质,但 C4 的提出证明——通过精心设计的任务架构与多维度评分体系,创造性推理可以被拆解、测量、比较。
从技术演进看,底座模型的能力已经足够支撑这类评测:
C4 代表的是这个链条上最末端、也最困难的一环。目前模型在「跨概念迁移」上表现尚可,但在「创造性重构」上仍显吃力。这恰恰是下一个技术突破的关键隘口。
创造力评测的标准化,将倒逼模型从「记忆大师」进化成「思想者」。下一个 AI 竞赛的决胜点,不是参数规模,而是模型能否产生人类认可的真正新意。
C4 基准的完整论文、评测数据与排行榜已在 arXiv Lab 官网公开发布,开发者与研究者可获取全部测试用例与评分细则。
arXiv Lab 官网 → C4 基准