FinSkillBench 首次全面评估 AI 投资管理能力,覆盖分析、决策、风控全链路
一项名为 FinSkillBench 的新兴评测基准,正在系统性地衡量 AI 代理在投资管理领域的真实技能——从财务分析到风险控制,从组合构建到合规审查,覆盖 7 大核心能力域、超过 200 项任务,首次为「AI 能否胜任投资岗位」提供了可量化的标尺。
一项名为 FinSkillBench 的新兴评测基准,正在系统性地衡量 AI 代理在投资管理领域的真实技能——从财务分析到风险控制,从组合构建到合规审查,覆盖 7 大核心能力域、超过 200 项任务,首次为「AI 能否胜任投资岗位」提供了可量化的标尺。
FinSkillBench 的设计者来自多家高校与金融科技实验室。他们发现,现有 AI 评测要么停留在「问答式」的知识记忆(如 FinanceBench),要么只关注单一任务(如交易策略生成),缺乏对投资管理全流程能力的系统性评估。
FinSkillBench 的核心创新在于双维结构:横向是 7 个能力域,纵向是 5 级熟练度——从 L1(识别与理解)到 L5(全自动化与优化),形成一个能力矩阵。
注:双轨校验指「自动化结果验证 + 领域专家评审」相结合,确保评分既客观又具备专业深度。L1–L5 分别对应:识别、应用、分析、综合、自动化。
FinSkillBench 的 7 个能力域并非随意划分,而是对标真实投资机构的前中后台职能线。每个能力域下包含 20–40 个具体任务,任务难度从 L1 到 L5 阶梯分布。
注:每个能力域下包含 20–40 个任务,跨域任务要求同时调用多个能力域,如「评估并购标的的财务影响与合规风险」需同时调用财务分析、估值建模、合规审查三个域。
一个值得注意的设计:约 30% 的任务为跨域任务,要求 AI 代理同时调用多个能力域。设计者认为,真实投资工作中很少有「单一技能」场景,跨域整合能力才是区分初级与高级从业者的关键。
FinSkillBench 团队对 2025–2026 年主流大语言模型进行了全面评估,包括 GPT-5.6、Claude Opus 4.8、Gemini 3 Ultra、Qwen3.7-max、DeepSeek-V4 等。以下是综合能力 Top 5 排名:
注:柱形自 70 分起缩放,非零起点;分差以标注分数为准。综合得分为 7 个能力域的加权平均,权重由领域专家根据实际投资岗位的重要性分配。
一个诚实的注脚:最高分 88.2 意味着什么?设计团队将 L3(分析级)定义为「能独立完成常规任务并给出合理解释」,88.2 分意味着头部模型在多数任务上已达到 L3 水平,但在 L4(综合级)和 L5(自动化级)任务上表现明显下滑——尤其在不确定性处理和复杂判断场景中。
金融行业是 AI 代理落地最活跃的领域之一,但一直缺乏一个「岗位能力对标」的评测体系。传统的 KPI 是「模型答对了多少题」,FinSkillBench 问的是另一个问题:
「这个 AI 代理,能胜任投资岗位的哪个级别?」
设计者将评测结果与真实投资岗位的职级体系做了映射:L1–L2 对应实习生/助理,L3 对应初级分析师,L4 对应高级分析师/投资经理,L5 对应投资总监/合伙人。当前头部模型在 L3 任务上已接近及格线,但 L4 以上差距显著。
这意味着什么?AI 正在快速逼近「能独立完成常规分析工作」的水平,但对于需要深度判断、跨域整合和不确定性管理的复杂决策,人类专家的位置仍然稳固。
注:L1–L5 熟练度等级对标真实投资岗位职级,L3 及以上为「可独立履职」水平。当前头部模型综合得分对应 L3 初级阶段。
FinSkillBench 的价值不在于排名,而在于它揭示了 AI 在投资管理领域的「能力天花板」——常规分析正在被攻克,但复杂判断与跨域整合仍是人类护城河。未来三年,AI 与人类在投资岗位上的分工将不是「替代」而是「梯次配置」。
FinSkillBench 已公开发布完整评测框架、任务集与评估结果,研究团队同步开放了沙箱模拟环境,供开发者测试自有模型的投资管理能力。
arXiv 预印本 → 搜索 FinSkillBench