📊 基准 · 能力评估

FinSkillBench 首次全面评估 AI 投资管理能力,覆盖分析、决策、风控全链路

一项名为 FinSkillBench 的新兴评测基准,正在系统性地衡量 AI 代理在投资管理领域的真实技能——从财务分析到风险控制,从组合构建到合规审查,覆盖 7 大核心能力域、超过 200 项任务,首次为「AI 能否胜任投资岗位」提供了可量化的标尺。

来源:arXiv 预印本 2026-07-24 全文约 3 分钟读完
#FinSkillBench #AI Agent #投资管理 #评测基准 #arXiv
🧭 7 大能力域 从财务分析到合规审查,全链路覆盖
200+ 细粒度评测任务
5 级 技能熟练度评分体系

⚡ 30 秒速览

  • FinSkillBench 是什么:一个专门评估 AI 代理在投资管理领域专业技能的评测基准,由学术界提出,基于真实投资场景构建。
  • 测什么:财务分析、估值建模、组合构建、风险管理、交易执行、合规审查、投后管理 —— 共 7 个一级能力域,细分为 200+ 任务。
  • 怎么测:每个任务设置 5 级熟练度(从识别到自动化),要求 AI 代理在模拟环境中完成端到端操作,交付可验证的成果。
  • 为什么重要:填补了「AI 在金融专业岗位的实操能力」缺乏系统评估的空白,为行业提供可比较、可复现的标准化标尺。
  • 核心发现:当前最强模型在基础分析任务上已接近人类初级分析师水平,但在复杂判断、跨域推理和不确定性处理上仍有显著差距。

01FinSkillBench 全景 7 大能力域 × 5 级熟练度

FinSkillBench 的设计者来自多家高校与金融科技实验室。他们发现,现有 AI 评测要么停留在「问答式」的知识记忆(如 FinanceBench),要么只关注单一任务(如交易策略生成),缺乏对投资管理全流程能力的系统性评估。

FinSkillBench 的核心创新在于双维结构:横向是 7 个能力域,纵向是 5 级熟练度——从 L1(识别与理解)到 L5(全自动化与优化),形成一个能力矩阵。

能力域 7 个
任务总数 200+
熟练度等级 L1 – L5
评估方式 双轨校验
模拟环境 真实数据 + 沙箱
开源 ✅ 全量公开

注:双轨校验指「自动化结果验证 + 领域专家评审」相结合,确保评分既客观又具备专业深度。L1–L5 分别对应:识别、应用、分析、综合、自动化。

027 大能力域 投资管理全链路拆解

FinSkillBench 的 7 个能力域并非随意划分,而是对标真实投资机构的前中后台职能线。每个能力域下包含 20–40 个具体任务,任务难度从 L1 到 L5 阶梯分布。

📊财务分析
📐估值建模
🧩组合构建
🛡️风险管理
交易执行
📋合规审查
📈投后管理
🔗跨域任务

注:每个能力域下包含 20–40 个任务,跨域任务要求同时调用多个能力域,如「评估并购标的的财务影响与合规风险」需同时调用财务分析、估值建模、合规审查三个域。

一个值得注意的设计:约 30% 的任务为跨域任务,要求 AI 代理同时调用多个能力域。设计者认为,真实投资工作中很少有「单一技能」场景,跨域整合能力才是区分初级与高级从业者的关键。

03当前模型表现 GPT-5、Claude 4、Gemini 3 等参测

FinSkillBench 团队对 2025–2026 年主流大语言模型进行了全面评估,包括 GPT-5.6、Claude Opus 4.8、Gemini 3 Ultra、Qwen3.7-max、DeepSeek-V4 等。以下是综合能力 Top 5 排名:

🥇 Claude Opus 4.8Anthropic
88.2
GPT-5.6-lunaOpenAI
86.7
Gemini 3 UltraGoogle DeepMind
84.1
Qwen3.7-max阿里通义千问
80.5
DeepSeek-V4深度求索
77.3

注:柱形自 70 分起缩放,非零起点;分差以标注分数为准。综合得分为 7 个能力域的加权平均,权重由领域专家根据实际投资岗位的重要性分配。

一个诚实的注脚:最高分 88.2 意味着什么?设计团队将 L3(分析级)定义为「能独立完成常规任务并给出合理解释」,88.2 分意味着头部模型在多数任务上已达到 L3 水平,但在 L4(综合级)和 L5(自动化级)任务上表现明显下滑——尤其在不确定性处理和复杂判断场景中。

04三个典型任务 从基础到高阶

📄 财务分析:识别非经常性项目并调整 EBITDA L2 · 识别级

  • 给定一份财报,要求 AI 代理识别出 非经常性损益项目(如资产出售、重组费用),并计算调整后的 EBITDA。
  • 需区分「经常性 vs 非经常性」——这看似简单,但实际财报中常有分类模糊的项目。
  • Claude Opus 4.8 准确率 91%,接近初级分析师水平;GPT-5.6 为 87%。
专家点评:「基础分析任务,头部模型已基本胜任。」

🧩 组合构建:给定约束条件优化资产配置 L3 · 分析级

  • 给定 5 类资产的历史收益率、波动率、相关性矩阵,以及投资者的风险预算和流动性约束,要求输出最优权重。
  • 需要同时处理 均值-方差优化、约束条件、情景分析,并以可解释的方式呈现建议。
  • 多数模型能完成数学优化,但 仅 30% 的模型能主动识别约束冲突并提出调整方案。
专家点评:「能算,但不会主动‘想’——这是当前 AI 与人类分析师的核心差距。」

⚖️ 合规审查:识别跨境投资中的监管冲突 L4 · 综合级

  • 模拟一个跨境投资场景:某中国基金拟投资一家美国 AI 初创公司,需同时审查 中国对外投资管理办法美国 CFIUS 审查规则以及行业特定数据隐私法规。
  • 要求识别出至少 3 个潜在的监管冲突点,并给出缓解建议。
  • 只有 Claude Opus 4.8 和 GPT-5.6 能识别出 2 个以上冲突点,且缓解建议的可行性评分 均低于 60%
专家点评:「跨域复杂判断,当前 AI 仍处于‘勉强及格’阶段。」

05为什么需要 FinSkillBench?

金融行业是 AI 代理落地最活跃的领域之一,但一直缺乏一个「岗位能力对标」的评测体系。传统的 KPI 是「模型答对了多少题」,FinSkillBench 问的是另一个问题:

「这个 AI 代理,能胜任投资岗位的哪个级别?」

设计者将评测结果与真实投资岗位的职级体系做了映射:L1–L2 对应实习生/助理,L3 对应初级分析师,L4 对应高级分析师/投资经理,L5 对应投资总监/合伙人。当前头部模型在 L3 任务上已接近及格线,但 L4 以上差距显著。

这意味着什么?AI 正在快速逼近「能独立完成常规分析工作」的水平,但对于需要深度判断、跨域整合和不确定性管理的复杂决策,人类专家的位置仍然稳固。

L1 识别L2 应用L3 分析L4 综合L5 自动化

注:L1–L5 熟练度等级对标真实投资岗位职级,L3 及以上为「可独立履职」水平。当前头部模型综合得分对应 L3 初级阶段。

编辑核心判断

FinSkillBench 的价值不在于排名,而在于它揭示了 AI 在投资管理领域的「能力天花板」——常规分析正在被攻克,但复杂判断与跨域整合仍是人类护城河。未来三年,AI 与人类在投资岗位上的分工将不是「替代」而是「梯次配置」。

了解更多

FinSkillBench 已公开发布完整评测框架、任务集与评估结果,研究团队同步开放了沙箱模拟环境,供开发者测试自有模型的投资管理能力。

arXiv 预印本 → 搜索 FinSkillBench