ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

量化求真07|高分股票,后来真的涨了吗?

量化求真07|高分股票,后来真的涨了吗? 前言买入之前先问分数有没有用前六篇围绕同一套动量策略查过回测偏差、收益账本、报告证据、比较基准、参数选择和资金容量。我们已经知道怎样怀疑一条漂亮的净值线。现在往前退一步看看净值线最初从哪里来。这套策略给股票打分再挑出靠前的股票。如果分数高的股票在后来并没有更好的表现其他环节做得再精细选股理由也站不稳。反过来就算高分组后来确实表现更好也不能直接推断我们已经找到一套赚钱的交易策略。真正下单时还有股票资格、持仓数量、成交时点、费用、风险限制和资金容量。本文拿策略里的20日动量分数作例子讨论怎样检验“排序有没有预测力”。平台因子研究室正好有对应的“20日动量”因子以及Rank IC、分组收益、成员更替率和分阶段表现。但因子室的默认评估与完整策略回测不是同一次实验这个差别必须写在结论前面。文中所有带数字的图均为明确标注的手工教学算例不是平台实测报告。文章回答的是怎样研究、怎样读结果以及结果允许我们说到哪里。目录前言买入之前先问分数有没有用01先把策略拆成一个分数02分数形成后才轮到未来收益03哪些股票参加考试04Rank IC到底在衡量什么05分组收益让排序接受另一种检查06平均值之外还要看稳定性07试了很多因子不能只报告胜者08从“有预测力”走到“能交易”关于本文的研究口径参考资料01先把策略拆成一个分数先不谈买卖只看每只股票在某天收盘后拿到的分数。前六篇的动量策略用过去20个交易日的价格变化排序平台内置的“20日动量”因子也按同样形式计算M i , t 20 P i , t a d j P i , t − 20 a d j − 1 M_{i,t}^{20}\frac{P^{\mathrm{adj}}_{i,t}}{P^{\mathrm{adj}}_{i,t-20}}-1Mi,t20​Pi,t−20adj​Pi,tadj​​−1P a d j P^{\mathrm{adj}}Padj是用于计算信号的复权收盘价i ii代表股票t tt代表信号形成日。这个式子说的是“此前20日涨了多少”不说此后一定会涨。同一个分数放进策略与放进因子评估承担的任务并不相同。完整策略先按历史资格选可投资股票再要求较长窗口趋势为正、20日平均成交额达到门槛最后才按短期动量排名并受持仓数量、调仓频率、成本和风控限制。因子室评估则先看可用行情中的一批股票当天的分数能否与随后观察到的收益对应页面没有自动复制上述整套策略过滤条件。公式相近也要核对具体数据。因子计算沿统一交易日历往前数20格策略在每只股票的历史记录中剔除缺失复权价后再取较早的有效记录。若行情中间有缺口两处的比较起点可能不同。因子计算在整批复权价不可用时还允许退回未复权收盘价策略则要求复权价。因此真正把两份结果并排解释之前应抽查同日同股分数与价格口径。图1概念图。相同的20日动量公式并不意味着两边使用同一股票池、成交时点或费用口径。这意味着“因子有预测力”和“前六篇策略赚钱”是两项不同的主张。前者关心排序信息后者关心账户最终怎样变化。如果未经核对就把两者写成同一个结论因子图越漂亮误会可能越深。早期关于动量的研究确实提出过“过去赢家之后可能继续表现较好”的经验问题。[1] 但那篇论文研究的市场和持有期不等于本文这个20日A股分数。我们仍要用本项目自己的样本、时间顺序和交易规则做检验。02分数形成后才轮到未来收益分数在t tt日收盘后形成检验它时只能把它与此后才发生的价格变化对应。平台因子评估采用的未来收益口径是t 1 t1t1日收盘价作为买入参照持有N NN个交易日到t N 1 tN1tN1日收盘价计算退出收益。R i , t ( N ) P i , t N 1 a d j P i , t 1 a d j − 1 R^{(N)}_{i,t}\frac{P^{\mathrm{adj}}_{i,tN1}}{P^{\mathrm{adj}}_{i,t1}}-1Ri,t(N)​Pi,t1adj​Pi,tN1adj​​−1例如选择5个交易日持有期比较的是t 1 t1t1日收盘至t 6 t6t6日收盘并非t tt日收盘后立即按已知价格买入。能否在这两个收盘点按该价成交也不是这个公式提供的保证。图2按平台因子评估实现绘制的时间线窗口结束日若缺价格该股票不能得到完整的未来收益标签。前六篇的策略回测则模拟次日开盘成交。一个使用次日收盘作收益参照另一个使用次日开盘及成交模型。即使股票、日期都一致两种收益也不应机械相等。因子室的分组收益未扣佣金、印花税、滑点和冲击且不包含持仓约束。还要防止一种更隐蔽的时间错误某只股票后来涨了于是研究者才决定它应该被纳入当时的候选池。正确的顺序是先用当时可得资料确定股票池和分数之后才观察后来收益。否则我们测到的可能是未来信息进入样本的效果。03哪些股票参加考试一场考试的平均成绩取决于谁被允许坐进考场。因子研究也一样。假设某日原本有100只可考虑股票其中10只缺少形成分数所需的完整历史另有5只缺少完整未来价格。平台会先用可得分数形成当日分组未来价格缺失的股票在收益统计时没有可用标签但不应因此事后重新分组。我们需要同时报告原先希望纳入多少、实际有多少得到分数、多少能形成分组、多少最终有完整未来收益。图3100、10、5只是手工教学数字。缺数据不能自动解释为股票表现差每一层实际数量都应从真实结果核对。这几层数字不是越大越好。如果只有高流动性、大市值股票才有稳定数据统计结论只能对应这个实际样本不能直接代表所有A股。如果退市股票或停牌时期被悄悄排除也可能重现第一篇讨论的幸存者偏差。平台因子评估页面默认按本地行情仓库可得股票运行并不自动应用动量策略那套历史股票资格、长期趋势与成交额过滤。页面显示的“有效交易日截面”也不是“所有股票都具备有效分数与未来收益”的保证。若要检验前六篇策略实际候选池里的20日动量排名必须先按当日历史资格重建每日候选名单再用一致的收益时点重新评估这一步不能仅凭因子室默认截图完成。分组本身也需要足够股票。平台要求每个有效截面能形成全部预设分组遇到有效股票太少或大量同分导致无法切出完整分位组时不强行把股票按代码拆散。报告里出现分组缺口应先检查样本和分数分布不能把缺失格当成0%收益。04Rank IC到底在衡量什么Rank IC这个名字听起来很硬其实它问的事情很直白同一天分数排得靠前的股票后来收益是否也大体排在前面每个日期单独计算一次之后再观察它在多个日期上的平均、波动和分阶段表现。用数学写就是当日股票分数排名与未来收益排名的相关程度R a n k I C t corr ⁡ S p e a r m a n ( M i , t 20 , R i , t ( N ) ) \mathrm{RankIC}_t\operatorname{corr}_{\mathrm{Spearman}} \bigl(M_{i,t}^{20},R_{i,t}^{(N)}\bigr)RankICt​corrSpearman​(Mi,t20​,Ri,t(N)​)为了看懂这个数字假设某日只有三只股票。A、B、C的分数由高到低依次是8、5、2随后5日收益分别为5%、−2%、1%。未来收益的顺序是A、C、B。A被排对了B和C的顺序颠倒这三只股票的秩相关为0.5。图4独立手工算例。三只股票的0.5只用于解释排名不能拿它当实际因子的有效性估计。正值表示当日排序大体同向负值表示大体反向接近零表示整体排序关系不明显。但一个正的平均Rank IC不保证每一天都有效一个接近零的平均也可能由正负两段互相抵消。它更不是“有50%概率选对股票”的中奖率。页面还显示普通IC它比较的是分数和后来收益的数值相关程度Rank IC比较排名。少数极端分数可能对普通IC影响更大。本文优先看Rank IC因为原策略按名次选股但如果两种结果明显冲突也应回去检查异常值和分数组成。平台还有“Rank IC IR”这里按每日Rank IC的均值除以标准差计算反映平均方向相对于日常波动是否稳定界面中的数值没有自动年化。做多天持有期时相邻日期的未来收益窗口会重叠统计上不能把每一天当成完全独立的新实验。平台为均值显著性表采用了考虑这类相关性的估计但该表也明确不包含反复尝试很多因子的校正。05分组收益让排序接受另一种检查Rank IC概括了整批股票的排序关系。另一种更直观的检查是每天按分数把股票分成五组再看后来收益是否大体随着分数组别提高。假设以下数字是五组股票在多个日期上计算得到的平均5日未来收益最低分组−0.3%第二组0.4%第三组0.2%第四组0.6%最高分组0.9%。最高组比最低组高1.2个百分点但第二组高于第三组曲线并不完全单调。图5手工教学数据。最高组减最低组为1.2个百分点这是平均未来收益差不是扣费后的投资组合年化收益。这样的图比只报最高组更诚实。若只有最末一组突然升高中间组没有过渡就要查是否由很少几只股票、某一年行情或数据缺口推动。若五组都上涨最高组赚了钱还要问它有没有比其他组和合理基准多赚。平台显示的“同日多空收益差均值”是每个有完整高低两组收益的日期先做“最高组减最低组”再对这些日期取平均。它是一项排序诊断。A股个股做空的可行性、借券成本和交易费用并没有因此得到解决不能把这个数字当成一条已经可交易的多空策略收益曲线。持有5日的相邻日期样本还可能重叠不能把每天的分组收益简单相乘或按252天放大成年化业绩。因子室还显示Top组成员更替率。它统计相邻有效日期中当日Top组有多少新成员不是实际组合的资金换手率。高分组换得很快提示未来要认真核算交易成本但仅凭成员比例算不出下一篇订单需要付多少钱。06平均值之外还要看稳定性一个漂亮的全期平均可能来自前半段好、后半段平也可能来自个别年份异常强。因子室提供前后半段Rank IC、分年度结果和不同持有期的衰减图这三种拆法回答的问题不一样。举个独立算例四年的Rank IC均值分别为0.06、0.04、−0.01、0。四年简单平均仍是0.0225但后两年已经没有清晰的正向表现。如果只在页面顶部截图“平均值为正”会漏掉最重要的变化。图6手工教学数据四年平均0.0225。实际各年有效日期数可能不同图中的简单平均不能代替平台全期逐日均值。“持有期衰减”则看1日、5日、10日、20日后的排序关系。它不是同一个样本被机械拉长四次较长窗口需要更远的未来价格可用日期和股票数可能改变。若5日有效而1日无效要检查这是否符合策略实际的持有方式若只在20日有效天天调仓去捕捉它也未必合适。还可以问分数是否只是某种行业或市值偏好。平台支持不调整、行业调整、市值调整和同时调整前提是本地有当时已经可得的历史行业与市值资料。没有这些资料时应让分析停在“无法完成”而不是用今天的行业分类或市值补过去。调整前后Rank IC变化说明结果对这些暴露敏感但调整本身也改变了研究对象不能在看完结果后只报告最好的一种口径。图7三项检查分别处理时间稳定性、预测期限和行业/市值影响一种通过不能替代另外两种。平台的“前半段/后半段”只是按当前评估区间切开显示。若我们是在看完后半段以后才决定要不要采用这个因子后半段对这一最终决定就不再是未经接触的新数据。第五篇讲过的选择顺序在因子研究中仍然适用。07试了很多因子不能只报告胜者想找好因子很容易一口气试十几种分数再给每种试1、5、10、20日持有期最后只截图最显著的一项。胜者看上去有理有据读者却不知道它是在多少次挑选后出现的。研究前先写下要解决的问题、主要因子、预期方向、股票范围、主持有期、评估指标和保留标准。其他因子、其他期限可以探索但探索结果应与事先计划的主检验分开保留尝试记录。Harvey、Liu与Zhu关于大量资产定价因子反复检验的研究提醒我们试验范围越大单项看起来“显著”越不足以独立支持新结论。[2]图8研究流程。训练期可探索、选规则后续时期用于检验已冻结的规则。多次试验要留痕。平台显著性表考虑了持有期重叠引起的序列相关却不自动修正“试过几十种因子后才挑一张图”的问题。一个很小的p pp值不等于找到真实规律在本文尤其不能用它替代独立后续时期和可交易回测。如果后续结果不支持此前排序研究者可以检查样本、行业集中、缺失标签和执行成本也可以提出新版本。但已经看过的后续时期应记入新版本的研究历史不能反复把它叫作“样本外”。08从“有预测力”走到“能交易”读完因子报告最合理的下一步不是宣布发现了一套新策略而是把几种证据放在一条线上分数是否按预期方向与后来收益对应高低组之间的差异是否持续这个差异是否仍存在于实际可投资的股票中按策略的成交和成本规则执行以后账户还剩多少。图9证据链。只有前两格通过尚不足以得出最后一格的净收益结论。本系列的20日动量策略还加了60日趋势、流动性门槛和最多持股数。如果因子室对全样本的排序有效而策略回测不佳要逐层查清是哪一步使优势消失。可能是过滤后的股票不再支持排序也可能是次日开盘的可成交价格与因子室的次日收盘参照不同或订单缺口和费用吃掉了差异。反过来即便完整策略赚钱而单因子报告不亮眼也不必强行宣称20日动量单独具有广泛预测力。策略利润可能更多来自长期趋势过滤、仓位安排或某段行情第四篇讨论的基准比较仍要保留。因此第七篇真正要守住的是一句朴素的话分数若有用应该先能在事先确定的样本和时间口径里经得起“高分者后来怎样”的检查要证明账户能赚钱还需走完交易这段路。关于本文的研究口径本文未执行新的因子评估或策略回测。三只股票Rank IC为0.5、五分组收益、四年Rank IC、样本漏斗中的数量均为手工教学算例互不构成同一实证样本。图9是证据流程图。所有图注均标明用途不能把这些数字替换成“本平台验证结果”。本地功能核对momentum_20按复权收盘价计算20日变化因子评估用t tt日收盘后分数对t 1 t1t1日收盘至t N 1 tN1tN1日收盘收益。页面提供Rank IC、五或十分组、不同持有期、年度与前后半段统计、可选行业/市值调整。若部分股票缺未来价格先前的分组不因后来缺失而重排统计使用可观测标签。缺少当时可得的行业或市值资料调整会报错。因子室默认样本、收益时点与前六篇动量策略不同本篇不把因子结果写成该策略的净收益证据。分组收益和多空收益差不含实际交易成本。因子选择若使用了整段区间后半段统计只是回顾性切分不自动成为独立样本外验证。显著性表对序列相关做处理但不含多重试验校正。配套截图指南将现成页面与需要另行构建的同股票池研究分开说明。参考资料Jegadeesh, N., Titman, S. (1993).Returns to Buying Winners and Selling Losers: Implications for Stock Market Efficiency.The Journal of Finance, 48(1), 65–91. 期刊原文页面。其研究提供动量问题的历史背景不构成对本文20日A股因子的直接验证。Harvey, C. R., Liu, Y., Zhu, H. (2016).… and the Cross-Section of Expected Returns.The Review of Financial Studies, 29(1), 5–68. 期刊原文页面。本文借鉴其对大量候选因子反复检验的提醒没有把该文的显著性门槛机械用于本项目。本系列第五篇《最好的参数为什么未必值得选》。有关选择规则、训练期与后续时期分离的原则同样适用于因子研究。
返回列表