金工研究灵感

ViT视觉大模型捕捉K线形态增量信息 vs 另类数据全景与"周期效应"反思

本期两条方法论主线:申万宏源将视觉大模型ViT引入量化选股,把K线渲染成图、经预训练ViT编码后与GBM正交残差融合,证明"图形"存在数值特征之外的增量信息 ;兴业金工以文献综述系统梳理另类数据九大类别与生成式AI的范式革命,并重点引介"短期高频数据过度使用会挤出长期预测能力"的周期效应 。

7 个来源 约 6 分钟

0. 近月脉络

近月灵感集中在:AI智能体因子挖掘(广发CogAlpha)、高频微观结构因子簇(国盛订单聚集)、组合约束精细化(申万偏度峰度)、深度学习分域训练与多状态融合(申万GRU、兴业机器学习系列)。本期两条线分别指向”新模型”与”新数据”:申万把深度学习选股推进到视觉大模型ViT的K线形态识别,兴业以综述形式给出另类数据从”数据丰度”到”周期效应”再到生成式AI的方法论演进地图。

1. 本期研究灵感 ⭐

灵感点1:视觉大模型ViT选股——用预训练K线编码器捕捉数值模型遗漏的形态信息 [1]

  • 灵感点:申万宏源以中证500指增为例,把个股过去60个交易日K线图渲染为384×384像素图片,喂给预训练的视觉大模型ViT(SigLIP,约4亿参数,ModelScope可直接下载),输出1152维向量后再回归预测未来20日收益。三个关键发现:①ViT对经典LightGBM正交取残差后,残差IC显著(4%水平),证明K线”形态”确实含有数值特征工程之外的信息增量;②图形模型不需要额外特征工程——在图上叠加更多均线、跳空标记(R1/R2)的ICIR反而不如纯K线(R0);③1152维向量用线性模型映射优于小型神经网络。将ViT残差因子与GBM得分合成后,费后年化超额从8.05%提升至9.40%,再叠加”动量/高波动极值中性”约束后各年超额全部转正。
  • 出处:申万宏源邓虎团队——“申万金工因子观察第13期”《视觉大模型ViT在量化选股上的探索》。
  • 启发 / 怎么用:这篇报告最可迁移的不是ViT本身,而是”新信息源如何并入主力模型”的三步流程:正交化→残差IC显著性检验→残差因子合成。研究者可以把任何异质信息源(文本向量、图像特征、另类数据打分)照此流程先做增量检验,避免”直接替换模型”的高昂代价。其次,“预训练视觉模型当特征抽取器”的工程路径成本很低、复现门槛不高,可推广到分时图、分钟热力图、订单簿快照等图形态数据;“线性头优于神经网络”的结论也提示视觉特征已是高质量抽象,下游无需复杂结构。值得警惕:ViT单独使用信息量不足、双边换手高达50倍以上(费后收益被成本大幅侵蚀),必须与数值模型合成并控制换手;2025年负超额显示图形alpha与量价alpha同受环境失效影响,增量需要配合组合约束才能转正。

灵感点2:另类数据方法论全景——从”数据丰度”红利到”周期效应”红线,再到GenAI范式革命 [2]

  • 灵感点:兴业金工以综述形式梳理另类数据在因子挖掘中的完整逻辑链:首先引介Dugast & Foucault (2025)的”数据丰度”理论——数据池扩大带来”隐藏金矿效应”、管理人业绩分化加剧、价格信息含量提升;接着逐一回顾地理空间(卫星停车、热红外)、舆情情绪(社交媒体关注度与情绪分离)、消费行为(信用卡交易)、供应链(B2B支付及时性)、人力资本(员工评价)、ESG(评级分歧)、物联网(工业用电)、网页爬取(在线价格)、专家网络(分析师调研)九大类数据源的代表性实证;再重点引介Dessaint et al. (2024)的”周期效应”:短期高频另类数据被过度追逐会诱发注意力挤出,一年期以上长期盈利预测精度系统性下滑;最后提出生成式AI赋能另类数据的三个层次——文本语义理解、非文本结构化解析、多源异构融合,并给出”长短周期分层数据源建设""另类数据延伸至公司治理与风控”等未来方向。
  • 出处:兴业证券郑兆磊/林沁莹团队——“海外文献推荐系列之一百九十二”《另类数据的量化投资图景:从数据丰度到范式革命》。
  • 启发 / 怎么用:这篇综述的实用价值是给出一张”另类数据落地清单+避坑指南”。对A股研究者,可落地性较高的方向包括:分析师实地调研数据(深交所强制披露,已有公开数据)、ESG评级分歧(多家评级机构可得)、工业用电(省级月度数据)、在线价格爬取——都可以按综述中的因子构造逻辑做本土化复验。“周期效应”是最值得记住的一条认知红线:短期高频另类信号增厚收益的同时,会系统性挤占对长期基本面的研究投入,这提示在因子库建设时要有意识做长短周期分层,而不是全部堆短期信号。GenAI三个层次则可直接作为工程路线图:先用大模型做文本语义因子,再扩展到图像/时序的结构化解析,终极目标是跨模态融合。

2. 方法论主题归类

本期灵感仅2条且方向分散(新模型 vs 新数据综述),暂不做主题归类。

3. 值得持续追踪的系列

  • 申万宏源”申万金工因子观察”系列:第13期《视觉大模型ViT在量化选股上的探索》 [1],从既往的因子/组合约束主题跨界到视觉大模型,可关注后续是否对预训练权重做金融数据微调,或拓展到分钟级图形输入。
  • 兴业金工”海外文献推荐系列”:第192期《另类数据的量化投资图景》 [2],该系列已从单篇文献翻译转向主题综述(此前覆盖风险平价、风格轮动、智能体与深度学习),可关注下一期主题及其对A股实践的映射。

附:补充信源

  • [3] 广发金工 — 中证港股通信息技术综合指数分析:虽是指数产品介绍,但包含”港股科技资产分层(平台互联网/综合科技龙头/AI硬科技)""需求—资本开支—硬件订单—盈利兑现”产业链传导框架,对AI硬件主题的另类指标跟踪有背景参考价值。
  • 本期其余报告([4][5][6][7])为跟踪型周报(指增组合超额、因子表现监控、择时观点、基金仓位跟踪),无方法论或新因子创新。

本报告为卖方金工研究的灵感摘录,方法与结论以各家原始报告为准,不构成投资建议。

本系列近 30 天回顾 8/6 – 9/5
  • 从因子生产走向系统整合:卖方主线由挖掘新因子逐期后移至因子拥挤度、深度因子去风格化,并最终聚焦多模型融合与AI Agent重构投研流程,“流程再造”成为下一阶段重心。
  • 深度学习因子从追逐超额到剥离风格捷径:国盛、广发等不再只比较RankIC,而分别以收益无关的行为预训练/双头分解和标签、权重、数据多维消偏,降低对低波、小市值等风格的依赖,追求可归因的稳定Alpha。
  • 信号评价从相对收益框架转向应用场景重构:量价事件信号在绝对收益、事件触发调仓的通道策略中重设筛选标准;仓位测算用残差反推调仓、组合构建用分风险预算替代统一优化器,表明方法须匹配产品场景。
  • 风格研究从粗标签走向解构再融合:价值SmartBeta被解构成低相关子策略组合配置,成长因子则沿路径、动能、超预期等缺陷逐一优化再融合;单风格不再是简单因子,而是可检验、可组合的生态。
  • 高频因子生产走向算子化工程:从时间段切割到时间点划分,离散向量算子持续补齐归类,极值筛选加信息钝化形成系统分类学;“挖单个因子”正在转变为批量产出低相关因子簇的工程路径。

引用源7

  1. 视觉大模型ViT在量化选股上的探索——申万金工因子观察第13期20260728 申万宏源金工 相关度 61
  2. 另类数据的量化投资图景:从数据丰度到范式革命——海外文献推荐系列之一百九十二 兴业金工 相关度 65
  3. 中证港股通信息技术综合指数:聚焦港股AI硬件产业链 广发金融工程研究 相关度 60
  4. 超额持续回暖,四大指增组合本周均跑赢基准【国信金工】 国信金工-量化藏经阁 相关度 62
  5. 四大主动量化组合年内排名稳步攀升 国信金工-量化藏经阁 相关度 64
  6. 【招商因子周报20260724】本周大盘和低流动性风格显著 招商金工 相关度 63
  7. 【国盛量化】强势板块疲态初显 留富兵法 相关度 60