行业新闻

AFAC2026金融智能大赛聚焦真实场景,四道赛题考验Agent落地能力

大赛通过贴近产业的高难度赛题,推动金融AI从刷分Benchmark转向解决真实约束下的Agent落地问题。

AFAC2026金融智能创新大赛不设标准答案,四道赛题全部来自真实业务:保险文档解析、资金行为识别、自动化实验、知识库问答。出题人坦言“猜不到最优解”,考验Agent在预算、上下文、精度等硬约束下的工程能力。

正文摘录

名为AFAC2026 金融智能创新大赛,总算不是单纯刷分的「乏味 Benchmark」。四道赛题,全部从真实金融场景中生长出来: 以保险文档还原 Markdown 为例,一旦碰到大图片、大文档场景,模型在相关 Benchmark 上的平均分甚至会掉到 0.1 以下,即便是 GPT、Gemini 这样的前沿多模态模型都够呛。 这正是 AFAC2026 大赛的核心宣言:全员回归基础研究,一起探索模型如何在真实约束下,交付产业价值。 结果就是持续的对抗与升级:当某些资金行为被识别出来,真正使用这些手法的人就会反过来隐藏自己,甚至利用市场对这些信号的认知进行反向博弈。 在 蚂蚁集团财富保险事业群投研投顾技术负责人、AFAC 大赛出题家纪韩 看来,这正是这道赛题最有趣的地方:资金识别这件事,从来不只是数学题。 从交易角度看,挂单、撤单、拆单,本质上是你与对手盘之间的一种沟通。这里面夹杂着大量意图,包括误导和制造假象。 如今大模型的出现,为这场游戏提供了又一把新武器。它能从高频数值数据中,发现人类尚未总结出的隐含模式。 L2 行情数据(Level 2 行情,即深度行情数据,包含逐笔委托、逐笔成交等详细信息)的数据量极其庞大,如果硬塞进模型,哪怕是支持 1M 上下文的窗口也会直接爆掉,导致注意力机制失效。 因此,参赛者需要提前写好规则或现成代码,或者让模型调用工具,先把数据处理到可观察、可理解、可判断的状态。 参赛选手需要设计并实现一个端到端的文档解析系统,将一张金融文档图片,完整、准确、有结构地转成 Markdown。 金融文档不是普通的小作文。一份保险文档,通常包含多级标题、密集表格、脚注和批注,每项信息都必须 100% 准确。 经纪人拿到需求后,凭借直觉定位到第 15XX 页的某一张表、某一个单元格,查出张三 45 岁时能领多少钱。 机构当然希望能把这些文档结构化。

阅读原文(qbitai.com)→

行业新闻Jay2026-07-01原文

相关内容